模型与端侧推理
open d1:有些 AI 任务,不必逐字生成答案
Easycha 编辑部
#open d1#Liquid AI#决策模型

原文发布日期:2026 年 10 月 7 日(UTC),北京时间 10 月 8 日
一张工单该交给哪个团队,一张图片是否符合要求,一条请求有多紧急?这些任务往往只需要判断结果,不需要一段解释。Liquid AI 发布的 open d1 决策模型,尝试通过一次前向计算返回结构化答案,省去逐个生成输出 token 的过程。
团队此次介绍 d1-3B 和实验版 d1-omni-600M,并提供开放权重。本文依据团队文章和官方模型卡整理;Easycha 没有运行模型或复现性能测试。
官方能力:给定状态和问题,直接返回判断
d1-3B 基于 LFM2.5-VL-3B,接受文本、图片及其组合。d1-omni-600M 基于编码器模型,增加视觉和音频编码器,但单次请求只能选择图片或音频,不能把两者同时送入。后者仍是早期研究版本,团队没有发布其推理速度。
两款模型都不是用来写长文的聊天模型。模型卡展示的是非此即彼的判断、从命名选项中选择,以及按有序等级评分;返回结果可包含概率。同一份输入状态可以对应多个命名问题,而不必让模型为每个问题分别写一段回复。
“零输出 token”描述的是这种接口的计算方式,不代表输入免费、计算不耗资源,也不是任何第三方服务的计费承诺。
Easycha 分析:适合放在流程的哪一段
对 API 应用而言,可以考虑把固定选项的任务与自由生成分开。比如先判断请求类型,再由其他组件检索资料或生成回复;对图片先做条件检查,再决定后续处理方式。这是工程建议,不是原文验证过的线上收益。
这类方案的前提,是开发者能把选项和判断标准写清楚。若任务要求开放创作、复杂解释或未定义的新类别,结构化选择并不能直接替代生成模型。返回概率也不自动等于可靠置信度,阈值需要用自己的数据验证。
毫秒数字,必须连同输入条件一起看
官方 d1-3B 模型卡在预热后的单题测量中,报告 Jetson AGX Thor 为 16 毫秒;同一设备处理约 3.4 千 token 的状态,表中则为 220 毫秒。图片、多问题与批量请求也各有不同测量结果。
这说明“一次前向计算”不等于任意输入都一样快。模型卡还说明,新形状的首次调用可能付出内核选择或编译成本。上述数字是团队在指定条件下的测量,不能当成包含网络、排队和预处理的生产接口延迟保证。
成绩也要保留来源边界
团队报告 d1-3B 的 Decision Index 0.2.1 得分为 48.57。模型卡明确这是使用官方评分器得到的结果,并非榜单提交;其他对照行来自公开榜单。不能据此把它写成独立机构认证,更不能把决策评测外推成通用聊天能力。
音频部分尤其需要谨慎解读。实验版模型卡说明,其训练面向英语说话者与助手之间的请求,音频片段截断到三十秒。支持音频输入,并不证明中文语音或任意声音任务已达到可用水平。
接入前,把业务条件补齐
模型卡提供专用调用示例,两款模型的依赖版本要求不同,权重使用 LFM1.0 许可。部署前应分别核对代码、版本、许可条款与硬件需求,而不是只看“开放权重”四个字。
Easycha 建议先选一个固定分类任务,使用真实输入检查误判、模糊请求和低置信结果,再测完整流程的耗时与资源占用。open d1 的价值,是提醒团队按任务选择输出方式;是否值得接入,仍取决于正确率、维护成本和实际用户需求。