uniJev 是开源的中英双语类型化决策模型:输入状态 + 问题 + 选项,单次前向直接读出全选项概率。 在 TypeSafe 公开评测上与闭源 Jev 的公开成绩统计打平——而它跑在你自己的 GPU 上,权重、logits、数据全部可审计。
大多数 agent 决策很小:路由一下、重试与否、证据是否支持结论。通用聊天模型要为此生成整段文字再解析回来——uniJev 把决策做成模型的母语:声明选项,一次前向,读出概率。
训练目标即推理方式:loss 直接打在选项字母的 logits 上。无生成循环、无 JSON 修复,延迟进入百毫秒级。
双语策略数据联合训练。中文种子集 300/300,英文主战场(Tev1 test 89.4%)超越 Tev1 官方自报的 88.0%。
四种风格 × 双语的提示注入套件实测:受攻击准确率 95.5%,最顽固的"伪装管理员"攻击翻转率被压至 26%。
逐评测集温度缩放后 ECE 低至 0.014。模型知道自己什么时候不确定——0.53 的概率就是"别拿这个判断当真"。
本地权重、逐行 logits、数据构建脚本、训练配方、种子全部开源可复现,模型卡里每个数字都能独立重算。
choice(多选一)· noul(是 / 否 / 信息不足)· score(分级评分),覆盖运行时定义的绝大多数小决策。
状态、问题、选项运行时声明;读出推荐用各选项字母 logits 的 softmax(即概率分布)。
// 1️⃣ 声明一次决策(任意语言的状态) { "state": "总监邮件:'方案很有创意……建议先保留,聚焦存量用户转化。'", "question": "判断总监对该方案的实际态度倾向", "options": [ {"label":"A","key":"positive", "description":"认可并支持立即执行"}, {"label":"B","key":"neutral", "description":"中立,需修改后重提"}, {"label":"C","key":"negative", "description":"委婉拒绝,暂时搁置"}]} // 2️⃣ 单次前向,读选项字母 logits → softmax C: 0.986 // 正确识破"表面表扬、实则婉拒"的语用陷阱 // 3️⃣ 部署三选一 // transformers + PeftModel(bf16 完整权重或 LoRA) // llama.cpp / Ollama(Q4 GGUF) // 长状态(8k token 实测可用),共享状态可做前缀缓存批量判据
全部结果带未微调基线对照,逐行 logits 归档可复算。外部基准(SemIf 冻结矩阵、WANLI、TypeSafe 公开子集)与训练数据零接触。
| 评测集 | 未微调 | v1 | v2 | v2r | 参照 |
|---|---|---|---|---|---|
| TypeSafe 公开子集(等案例一致性) | 0.839 | — | 0.8815 | 0.8815 | 公开 Jev 值 0.883 |
| 中文 zh_seed300 | 95.3 | 91.3 | 100.0 | 100.0 | — |
| test 1,000(Tev1 同配方) | 77.8 | 88.3 | 89.2 | 89.4 | Tev1 自报 88.0 |
| SemIf authored 144 | 82.6 | 93.1 | 92.4 | 93.1 | SemIf 免训练 80.6 |
| WANLI 256(NLI 硬骨头) | 66.8 | 75.0 | 73.1 | 74.6 | SemIf 免训练 63.7 |
| 提示注入受攻击准确率 | — | 83.0 | 92.0 | 95.5 | — |
| 扰动稳定性(语义对齐) | — | 98/108 | 100/108 | 99/108 | — |
| 校准后 ECE(dev 4,568) | 0.020 | 0.009 | 0.009 | 0.014 | — |
限定:TypeSafe 对照为与 Jev 公布输出的一致性(n=102/20 案例,非地面真值);完整表格与逐行数据见模型卡。
在唯一公开可比的基准上打平;差异在别的地方——恰恰是对嵌入软件最要紧的地方。
全部托管于 ModelScope(本站所有下载按钮均指向 modelscope.cn)。底座 Qwen3.5-4B 为 Apache-2.0,衍生发布合规。