header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

大模型开始自己「打草稿」:NCP把猜后文塞进模型内部

动察 Beating AI 快讯,上海 AI Lab 和上海交大发布 89 亿参数模型 NCP-ArchPreview。普通大模型主要训练「猜下一个 token」,NCP 还会预测后面一小段对应的内部概念信号,再用它辅助 token 生成。最终仍然逐 token 输出,但模型内部已经会提前猜后文。


这套信号还能拿来给投机解码提速。DFlash、DSpark 这类方案会让一个小模型先猜后文,再交给大模型统一检查。NCP 团队把内部概念信号也交给这个小模型,相当于先给它一点「后面大概怎么写」的提示,再让它一次并行猜 16 个 token。


这样一来,小模型猜中的内容更多。四项测试里,大模型每验证一次,平均能通过的 token 从 5.933 个升到 6.180 个,提升 4.17%;HumanEval 上提升 7.59%。接入这套信号只给草稿模型增加约 4 万参数。


同样是 89 亿参数,NCP 用普通 Transformer 约 85% 的训练计算量,就能把训练误差降到差不多的水平。

AI 解读
上海AI Lab与上海交大发布的NCP-ArchPreview,核心不在89亿参数本身,而在训练目标的偏移:从纯token预测转向同时预测内部概念信号。这让模型在参数不变的前提下,用约85%的训练计算量达到接近Transformer的误差水平。

真正值得盯的是推理侧。团队把这套内部概念信号喂给投机解码的草稿模型,后者单次并行猜16个token,大模型每验证一次平均通过token从5.933升至6.180,HumanEval上提升7.59%,草稿模型仅增加约4万参数。投机解码的瓶颈从来是草稿命中率,NCP等于给草稿模型装了一层轻量先验。

这与近期行业把算力从训练往推理效率迁移的路径一致:当模型规模边际收益递减,用更少的验证轮次换吞吐,才是降本主线。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成