1 什么是 JEV 与 System One 决策模型?
2026年,由 InstructGPT 与 RLHF 共同发明人 Diogo Almeida 创立的 TypeSafe AI 推出了业内首个商业化 System One 决策模型 —— JEV。 随后,开源社区相继涌现了 Von (基于 ModernBERT-Large 395M, Apache-2.0, 延迟仅 18ms)、Laya (ConvAI Innovations, 421M/322M 多语言, 延迟 33ms)、OpenThai-SystemOne 以及 openjev 等对标项目。
三大决策原语 (Decision Primitives)
| 原语名称 | 数学定义与输出形式 | 典型工业场景 | 置信度度量 (Confidence) |
|---|---|---|---|
| Noul (Calibrated Boolean) |
后验概率标量 $P(y=1 \mid S, Q) \in [0.0, 1.0]$,指示特定布尔命题是否成立。 | 工单是否紧急?是否有系统崩溃风险?输入是否违规? | 距离不确定中点 0.5 的偏离度:$2 \times |P - 0.5|$ |
| Choice (Categorical Decision) |
互斥候选集上的概率分布 $\{c_1, \dots, c_K\}$,满足 $\sum P(c_k) = 1$。 | 工单意图分类、微服务路由分发、机器人动作离散决策。 | 首选与次选概率差(Margin):$P(c_{(1)}) - P(c_{(2)})$ |
| Score (Ordinal Rating) |
在有序等级 $\{0, \dots, K-1\}$ 上的期望值:$\mathbb{E}[L] = \sum_{l=0}^{K-1} l \cdot P(l)$。 | 用户不满情绪分级(0~3)、安全警报威胁等级打分。 | 等级分布的峰度与熵约束(确定性程度)。 |
2 模型核心机理与架构原理
为什么 JEV、Von 和 Laya 能够做到一次请求同时评估 10~100 个问题,且延迟仅 18~35ms? 其核心在于“非自回归 OptionMarker 编码”与“双向全注意力机制(Bidirectional Attention)”。
3 端到端训练全流程路线图 (End-to-End Pipeline)
要完整复刻一个工业级可用的 JEV 模型,整个工程生命周期分为 5 大关键阶段。
4 基础数据集构造与对齐锚点
JEV 这一类模型不学习自由对话,它的核心能力是“给定证据与严格标准,做出可信的裁决”。
5 PyTorch 模型架构与多头实现
基于 ModernBERT-Large (395M) 打造非自回归 OptionMarker 决策模型代码骨架:
import torch
import torch.nn as nn
from transformers import AutoModel, AutoConfig
class SystemOneDecisionModel(nn.Module):
def __init__(self, model_name_or_path: str = "answerdotai/ModernBERT-large"):
super().__init__()
self.config = AutoConfig.from_pretrained(model_name_or_path)
self.encoder = AutoModel.from_pretrained(model_name_or_path, config=self.config)
hidden_size = self.config.hidden_size
self.choice_scorer = nn.Sequential(
nn.Linear(hidden_size, hidden_size // 2),
nn.GELU(),
nn.Dropout(0.1),
nn.Linear(hidden_size // 2, 1)
)
self.noul_head = nn.Sequential(
nn.Linear(hidden_size, hidden_size // 2),
nn.GELU(),
nn.Dropout(0.1),
nn.Linear(hidden_size // 2, 1)
)
self.score_head = nn.Sequential(
nn.Linear(hidden_size, hidden_size // 2),
nn.GELU(),
nn.Linear(hidden_size // 2, 10)
)
self.temperature = nn.Parameter(torch.ones(1) * 1.10)
def forward(self, input_ids, attention_mask, option_positions=None, task_type="choice", num_levels=3):
outputs = self.encoder(input_ids=input_ids, attention_mask=attention_mask)
sequence_output = outputs.last_hidden_state
if task_type == "choice":
batch_size, num_opts = option_positions.shape
opt_features = []
for b in range(batch_size):
pos = option_positions[b]
opt_features.append(sequence_output[b, pos, :])
opt_features = torch.stack(opt_features, dim=0)
logits = self.choice_scorer(opt_features).squeeze(-1)
scaled_logits = logits / torch.clamp(self.temperature, min=0.1)
probabilities = torch.softmax(scaled_logits, dim=-1)
return scaled_logits, probabilities
elif task_type == "noul":
cls_repr = sequence_output[:, 0, :]
logit = self.noul_head(cls_repr).squeeze(-1)
prob = torch.sigmoid(logit / torch.clamp(self.temperature, min=0.1))
return logit, prob
elif task_type == "score":
cls_repr = sequence_output[:, 0, :]
logits = self.score_head(cls_repr)[:, :num_levels]
prob = torch.softmax(logits / torch.clamp(self.temperature, min=0.1), dim=-1)
levels = torch.arange(num_levels, device=logits.device, dtype=torch.float32)
expected_score = torch.sum(prob * levels, dim=-1)
return expected_score, prob
6 RLCD 联合损失函数与训练
标准 CE 损失会不断推高正确类别的 logit 值,导致模型产生严重的过度自信(Overconfidence)。 通过严格真分数准则,联合优化多分类交叉熵与 Brier 预测发散均方惩罚项:
class RLCDLoss(nn.Module):
def __init__(self, lambda_brier: float = 0.5):
super().__init__()
self.lambda_brier = lambda_brier
self.ce_loss = nn.CrossEntropyLoss()
def forward(self, logits: torch.Tensor, targets: torch.Tensor):
loss_ce = self.ce_loss(logits, targets)
probs = torch.softmax(logits, dim=-1)
one_hot_targets = torch.zeros_like(probs).scatter_(-1, targets.unsqueeze(-1), 1.0)
loss_brier = torch.mean(torch.sum((probs - one_hot_targets) ** 2, dim=-1))
total_loss = loss_ce + self.lambda_brier * loss_brier
return total_loss, loss_ce, loss_brier
7 后训练温度校准与置信度计算
8 高性能推理服务与 API 规范
直接实现与 TypeSafe 官方规范完全兼容的 POST /v1/systemone 接口,无缝接入生态。
9 评测基准与业务工作流验证
System One 评测包含三大体系:jabr v2 49 任务基准、ViZDoom 8-Seed 实时竞技 与 Workflow Evals 帕累托前沿。
10 开源决策模型全景与基准深度评测
当前开源社区四大主力模型横向对标:
| 模型名称 | 基模架构 / 参数量 | 开源协议 | GPU 延迟 | jabr v2 宏准确率 | ViZDoom 击杀数 | 架构特点与适用定位 |
|---|---|---|---|---|---|---|
| TypeSafe Jev 1.13 | 闭源专家混合 (MoE) | 商用闭源 | ~115 ms (网络 API) | 96.6% | 5.62 kills | 云端托管商业标杆,综合推理能力最强,但受制于网络往返延迟。 |
| Von-1.2 (wfzyx/von) |
ModernBERT-Large (395M) | Apache 2.0 | ~18 ms | 71.5% (Choice 83.4%) |
9.38 kills | 开源性能领跑者。OptionMarker 双向全注意力,极端低延迟使得游戏击杀反超 JEV +66.9%。 |
| Laya (convaiinnovations/laya) |
ModernBERT-Large (421M) mmBERT-base (322M) |
Apache 2.0 | ~33 ms | 58.3% (Choice 66.8%) |
1.25 kills | 企业级工作流专精:支持 100+ 多语言,专攻客服邮件分流、发票审核与对话轨迹建模 (TD(λ=1.0))。 |
| OpenThai-SystemOne (iapp-technology) |
Qwen3.5-0.8B (去除 LM 头) | Apache 2.0 | ~45 ms | 64.2% | 2.10 kills | 因果小模型改造范本:在 <|ts_answer|> 挂载 256-way SlotHead,支持泰英双语。 |
| GLiNER2 (fastino) |
双向跨度编码 (~300M) | Apache 2.0 | ~93 ms | 68.4% | N/A | 擅长零样本文本跨度与实体级分类,但在复杂逻辑多跳推理和动作决策上表现一般。 |
第三方评测机构 OrcaRouter 针对开源模型 Von 进行了未见业务场景的盲测:若只给裸标签,准确率暴跌至 8.8% ~ 26.7%!
其本质原因在于模型是“上下文语义核验器”,必须提供显式、具有操作意义的 Criteria 准则。
11 工业级业务数据工程深度实战
决定商业落地生死的正是业务工作流数据工程(占 85%)。
12 业界产品落地与生态全景矩阵
JEV 与 System One 范式不仅仅是研究概念,它正在以惊人的速度在工业界转化为可落地的软硬件产品。 以下系统梳理业界当前商业级基础设施、开源开发套件与八大杀手级应用场景。
业界八大杀手级产品化应用场景
KEEP / TRUNCATE / DROP 的并行 Noul 判定,在 50ms 内剪掉 80% 无效噪音,为后续自回归大模型节省数倍 Token 费用。
TypeSafeModel。
开发者只需声明一个带有各类型字段的 Python Class,JEV 会将所有属性映射为原子 Question 并行前向计算,一次性完成结构化提取,数学上杜绝传统 LLM 的 JSON 解析异常。
13 学术论文与理论体系脉络
JEV 与 System One 的诞生并非凭空出现,其底层融合了自然语言处理、强化学习反思与统计真分数校准理论。 以下整理该技术流派的关键学术文献脉络:
| 论文与作者 | 发表年份 / 会议 | 核心理论贡献与对 JEV 的指导意义 |
|---|---|---|
| 《Von: Non-Autoregressive System One Decision Modeling via Calibrated Bidirectional Representations》 Victor Panisa |
2026 开源项目论文 |
系统确立了基于 ModernBERT 双向全注意力编码器的 OptionMarker 架构,证明了在单步前向传播下处理高基数选择与多原语判别的统计有效性。 |
| 《Reinforcement Learning with Calibration Distribution for Non-Autoregressive Decision Modeling》 DeepMost Innovations |
2025/2026 arXiv:2503.23303 |
RLCD 训练机制的首篇理论论文。从理论上证明了传统 RLHF 偏好学习必然破坏概率分布校准,提出联合真分数准则(Brier Penalty)能驱动模型收敛于真实贝叶斯后验。 |
| 《ModernBERT: Bringing BERT into the Modern Era》 Answer.AI & LightOn |
2024/2025 arXiv:2412.13663 |
为 System One 模型提供了现代高效的双向骨干基座。原生支持 8192 上下文、旋转位置编码 (RoPE) 与 FlashAttention-2,比传统 BERT 速度提升 3~5 倍。 |
| 《Training language models to follow instructions with human feedback》 Long Ouyang, Diogo Almeida et al. |
2022 NeurIPS (InstructGPT) |
TypeSafe 创始人 Diogo Almeida 的代表作。揭示了通过人类反馈微调大语言模型的范式。正是看到了生成模型在阿谀奉承(Sycophancy)与虚假自信上的缺陷,才启发了创始人投身 System One 的反向创新。 |
| 《On Calibration of Modern Neural Networks》 Chuan Guo, Geoff Pleiss et al. |
2017 ICML 经典论文 |
现代深度神经网络校准的理论基石。首次系统指出现代网络因过拟合 NLL 导致的严重过自信现象,提出了 ECE(Expected Calibration Error)指标与基于验证集的温度缩放(Temperature Scaling)理论。 |
| 《Strictly Proper Scoring Rules, Prediction, and Estimation》 Tilmann Gneiting & Adrian E. Raftery |
2007 JASA 统计学顶级期刊 |
严格真分数(Strictly Proper Scoring Rules)的数学体系奠基。证明了 Brier Score 与负对数损失在数学上具有“防伪防冒”特性:预测者只有输出其真实的内心后验概率时,才能获得最大的期望数学期望收益。 |