泰语版 Jev 来了!OpenThai 团队的开源模型,命名为 OpenThai-SystemOne

泰语版 Jev 来了! OpenThai 团队的开源模型,命名为 OpenThai-SystemOne。
TypeSafe 发布 Jev(一种不生成文本、而是一次计算即以概率给出决策的 "System One model")五天之后,OpenThai 团队推出了面向泰语 + 英语的开源版本。
- 0.8B 参数,可在笔记本上运行
- 基座 Qwen3.5-0.8B,用约 50 亿泰语 token 继续预训练,并把 248k 词表的 LM 头替换为"256 槽位决策头"
- 输入状态(文本/JSON)+ 单选 / 打分 / 是否问题 → 一次前向计算返回所有问题的答案及置信度
- 在与 Bespoke-Nimble-9B 相同的 13 子集公开基准上:我们 61.9 / Nimble-9B 74.8 / Jev 76.0 / 原始 Qwen3.5-0.8B 45.4(13 个子集中 4 个领先 9B)。泰语任务:意图 86.4%、新闻主题 97.7%、XNLI-th 76.5%
- 用途:文本分类(Text Classification)、情感分析(Sentiment Analysis)、为 AI 选择动作(Agentic Computer Use)
- Apache-2.0 全部开放:权重、训练脚本、配置与合成数据
下载与文档:huggingface.co/iapp/OpenThai-SystemOne 在浏览器中试玩:iapp.co.th/docs/llm/openthai-systemone 代码:github.com/iapp-technology/openthai-systemone 完整细节:OpenThai-SystemOne 模型页
真实输出示例
一条泰语工单"被重复扣款两次,请尽快退款",问它该由哪个团队负责、客户是否要求退款。两个问题在一次前向计算中作答,输出 token 为零。
{"answers": {"department": {"choice": "billing", "probabilities": {"billing": 0.972, "technical": 0.009, "sales": 0.018}, "confidence": 0.87},
"refund": {"noul": 0.954}}, "usage": {"input_tokens": 91, "output_tokens": 0}}
企业每天要做数百万次这样的决策,每次都调用 LLM 既慢又贵。System One 模型正是这类工作的合适形态,而此前泰语领域一个也没有。
工作原理
- 基座是 Qwen3.5-0.8B 的文本塔(去掉视觉编码器),用约 50 亿泰语 token 继续预训练。
- 248k 词表的 LM 头被替换为 256 路决策头。每个选项由控制 token
<|ts_opt_i|>引入;<|ts_answer|>位置的隐状态被投影为 256 个 logit,超出选项数的槽位被掩码,然后 softmax。槽位 255 为 abstain。 - 训练时打乱选项顺序,因此没有位置偏差。这是架构层面的设计,而不是读取字母 logprob 的技巧。
- 校准阶段(Brier 损失 + 按类型的温度)使高
confidence真正对应高准确率。
数据
在 Bespoke Labs 的 13 子集公开基准(与对比 Jev 时相同)上的宏平均:
| 模型 | 规模 | 平均分 |
|---|---|---|
| OpenThai-SystemOne | 0.8B | 61.9 |
| Bespoke-Nimble-9B | 9B | 74.8 |
| Jev(TypeSafe AI,闭源) | – | 76.0 |
| 原始 Qwen3.5-0.8B | 0.8B | 45.4 |
0.8B 模型在 13 个子集中的 4 个领先 Nimble-9B(MultiNLI、SummEval-consistency、HelpSteer2、Civil Comments),在英语阅读理解型的是/否任务上明显落后。
泰语留出测试集(完整评测集):Prachathai 97.7、MASSIVE-th 86.4、XNLI-th 76.5(是/否 84.3)、SIB-200 Thai 77.5、Wongnai 63.3 完全匹配(MAE 0.44)、xLAM 工具选择 99.4,以及 Wisesight 38.7(已知弱项,v0.2 正在修复)。泰语测试集上的 ECE 不超过 0.05,confidence 字段在这些任务上可以信任。
延迟:3 个问题的请求在 H100 上约 40 毫秒,在 MacBook M3 Max 上 154 毫秒。
先把局限说清楚
这是 v0.1。0.8B 模型不是推理模型。它无法输出不存在的选项,但可能选错,因此请使用 confidence 字段,把低置信度的案例转给更大的模型或人工。仅支持文本,每个问题最多 255 个选项,纯 CPU 仍较慢,请使用 GPU 或 Apple MPS。
试一试
pip install "git+https://github.com/iapp-technology/openthai-systemone"
from openthai_systemone import SystemOneClient, Choice, Noul
c = SystemOneClient("iapp/OpenThai-SystemOne")
r = c.system_one("โดนหักเงินซ้ำสองครั้ง ขอเงินคืนด่วน",
{"dept": Choice(instructions="ทีมใดควรรับผิดชอบ", criteria={"billing": None, "technical": None}),
"refund": Noul(instructions="ลูกค้าขอเงินคืนหรือไม่")})
print(r.answers["dept"].probabilities, r.answers["refund"].noul)
接口与 TypeSafe 的 POST /v1/systemone 一致,现有 SDK 代码可以不加修改地指向本模型。
- 模型与模型卡:huggingface.co/iapp/OpenThai-SystemOne
- 在浏览器中试玩:iapp.co.th/docs/llm/openthai-systemone
- 代码与完整训练流程:github.com/iapp-technology/openthai-systemone
- 完整细节、训练流程与参与方式:OpenThai-SystemOne 模型页
欢迎在 Discord 或 Facebook 群组告诉我们你的发现。我们希望得到更多泰语测试集,尤其是选项很多的任务和 UI/智能体任务。
