header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol

动察 Beating AI 快讯,蚂蚁百灵推出医疗健康模型 Ling-3.0-flash-Sante。它基于 Ling-3.0-flash 强化医疗能力,采用 MoE 架构,总参数 1240 亿,但每个 token 只激活约 51 亿参数。重点能力包括医学推理、药物安全、循证检索和长流程医疗研究。


百灵公布的评测里,Sante 在 DiagnosisArena-MCQ 拿到 83.8 分,高于 GPT-5.6 Sol 的 81.9、Kimi K3 的 78.4 和 Gemini 3.6 Flash 的 76.2。MedXpertQA-Text 得分 53.9,也略高于 Kimi K3 的 53.5,但仍低于 GPT-5.6 Sol 的 60.2 和 Gemini 3.6 Flash 的 62.4。


它也没有只刷医学选择题。百灵还测试了 BrowseComp、DeepSearchQA 和 HLE with tools,重点强化「自己查资料再回答」的能力。医疗伦理和安全也单独做了测试,MedEthicAlign 得分 82.1,内部安全测试 AFUSAFE-MedSCE 得分 78.6。


Sante 已经接入 OpenRouter 和 Vercel,可免费调用。

AI 解读
蚂蚁百灵的行业垂直模型节奏正在明显提速。不到两周前刚开源金融版Fin,今天就推出医疗版Sante,且均基于Ling-3.0-flash这一51亿激活参数的MoE底座做领域强化。这透露出一个清晰的产品策略:用低激活参数的通用模型做基座,通过垂直数据训练快速复制到高价值行业,而非为每个行业训练独立大模型。

Sante的评测口径值得留意。在MedXpertQA-Text上它落后GPT-5.6 Sol和Gemini 3.6 Flash,但在DiagnosisArena-MCQ上反超,且强调“不刷选择题”——实际是主动划定了竞争维度:不拼全能医学知识,而是拼循证检索和工具增强下的诊断能力。这延续了蚂蚁一贯的“效率优先”叙事,但医疗场景的合规成本远高于金融,模型已接入OpenRouter和Vercel免费调用,后续真正的看点是谁来为医疗级推理错误买单。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成