typed decision model · 单次前向 · 零生成解码

让软件的 if,跑在模型上

uniJev 是开源的中英双语类型化决策模型:输入状态 + 问题 + 选项,单次前向直接读出全选项概率。 在 TypeSafe 公开评测上与闭源 Jev 的公开成绩统计打平——而它跑在你自己的 GPU 上,权重、logits、数据全部可审计。

0.8815 vs 0.883
TypeSafe 公开评测 · 与闭源 Jev 公开值统计打平
100%
中文决策种子集 300/300 满分(双语训练)
~100ms
单决策延迟(本地 4B,短状态)
21MB
LoRA 适配器体积 · 一张消费级 GPU 即可运行

#它是什么

大多数 agent 决策很小:路由一下、重试与否、证据是否支持结论。通用聊天模型要为此生成整段文字再解析回来——uniJev 把决策做成模型的母语:声明选项,一次前向,读出概率。

⚡

决策原生读出

训练目标即推理方式:loss 直接打在选项字母的 logits 上。无生成循环、无 JSON 修复,延迟进入百毫秒级。

🇨🇳

中英双语

双语策略数据联合训练。中文种子集 300/300,英文主战场(Tev1 test 89.4%)超越 Tev1 官方自报的 88.0%。

🛡️

注入稳健

四种风格 × 双语的提示注入套件实测:受攻击准确率 95.5%,最顽固的"伪装管理员"攻击翻转率被压至 26%。

📐

可校准

逐评测集温度缩放后 ECE 低至 0.014。模型知道自己什么时候不确定——0.53 的概率就是"别拿这个判断当真"。

🔍

全链路可审计

本地权重、逐行 logits、数据构建脚本、训练配方、种子全部开源可复现,模型卡里每个数字都能独立重算。

🧩

三种决策原语

choice(多选一)· noul(是 / 否 / 信息不足)· score(分级评分),覆盖运行时定义的绝大多数小决策。

#接口与快速上手

状态、问题、选项运行时声明;读出推荐用各选项字母 logits 的 softmax(即概率分布)。

// 1️⃣ 声明一次决策(任意语言的状态)
{ "state": "总监邮件:'方案很有创意……建议先保留,聚焦存量用户转化。'",
  "question": "判断总监对该方案的实际态度倾向",
  "options": [
    {"label":"A","key":"positive", "description":"认可并支持立即执行"},
    {"label":"B","key":"neutral",  "description":"中立,需修改后重提"},
    {"label":"C","key":"negative", "description":"委婉拒绝,暂时搁置"}]}

// 2️⃣ 单次前向,读选项字母 logits → softmax
C: 0.986   // 正确识破"表面表扬、实则婉拒"的语用陷阱

// 3️⃣ 部署三选一
// transformers + PeftModel(bf16 完整权重或 LoRA)
// llama.cpp / Ollama(Q4 GGUF)
// 长状态(8k token 实测可用),共享状态可做前缀缓存批量判据

#评测数字

全部结果带未微调基线对照,逐行 logits 归档可复算。外部基准(SemIf 冻结矩阵、WANLI、TypeSafe 公开子集)与训练数据零接触。

评测集未微调v1v2v2r参照
TypeSafe 公开子集(等案例一致性)0.839—0.88150.8815公开 Jev 值 0.883
中文 zh_seed30095.391.3100.0100.0—
test 1,000(Tev1 同配方)77.888.389.289.4Tev1 自报 88.0
SemIf authored 14482.693.192.493.1SemIf 免训练 80.6
WANLI 256(NLI 硬骨头)66.875.073.174.6SemIf 免训练 63.7
提示注入受攻击准确率—83.092.095.5—
扰动稳定性(语义对齐)—98/108100/10899/108—
校准后 ECE(dev 4,568)0.0200.0090.0090.014—

限定:TypeSafe 对照为与 Jev 公布输出的一致性(n=102/20 案例,非地面真值);完整表格与逐行数据见模型卡。

#uniJev vs 闭源 Jev

在唯一公开可比的基准上打平;差异在别的地方——恰恰是对嵌入软件最要紧的地方。

uniJev-v2r(开源)

  • ✅ 本地免费,单张消费级 GPU,无 token 计费
  • ✅ 中英双语决策能力
  • ✅ 权重、logits、数据、配方全可审计可复现
  • ✅ 注入/扰动稳健性实测公开
  • ⚠️ 校准需按集装温度(语言类 T≈0.70)
  • ⚠️ 训练上下文 2048(8k 实测可用),选项 ≤24

Jev(TypeSafe,闭源)

  • ☁️ 托管服务,$0.042/百万输入 token
  • 🌐 英文服务(中文能力未披露)
  • 🔒 模型规模、训练数据、方法均未披露
  • 📐 默认校准输出(RLCD 训练),64k 上下文、255 选项
  • ⚡ 官方标称 70–500ms 托管延迟
  • 📊 公开评测一致性与 uniJev 统计持平(0.883 vs 0.8815)

#下载

全部托管于 ModelScope(本站所有下载按钮均指向 modelscope.cn)。底座 Qwen3.5-4B 为 Apache-2.0,衍生发布合规。

🧠 完整权重(bf16)

model.safetensors · ~9.3 GB

合并 LoRA 后的独立模型,transformers 直接加载,开箱即用的标准形态。

下载权重

📦 Q4 GGUF

uniJev-v2r-Q4.gguf · ~6.5 GB

llama.cpp / Ollama 生态部署版,已通过端到端正确性验证,低配设备首选。

下载 GGUF

🪶 LoRA 适配器

unijev-v2r-adapter-f16.gguf · 21 MB

r8 适配器(占底座 0.25% 参数),可挂载到任意 Qwen3.5-4B 量化版本。

下载适配器
Qwen3.5-4B 底座LoRA r8 · 10.6M 参数 47,440 训练样本Apache-2.0 DGX Spark 单机训练中 / 英