header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Claude Code自己给AI应用调优:改Prompt、换模型,变差就回滚

动察 Beating AI 快讯,Anthropic 给 Claude Code 的官方 claude-api Skill 加了一套自动调优工作流。build-eval 先从真实对话、Bug 或人工案例里做出测试集和评分方法,hillclimb 再让 Claude Code 反复修改系统 Prompt、工具说明、模型和推理强度。每次改完都重新跑测试,效果变好就保留,变差就回滚。


为了避免 Claude 只针对测试题优化,它不会拿所有样本一起调。部分案例用于找问题和改配置,另留一批案例检查修改能不能用在没见过的问题上。如果前面的分数涨了,留出的测试结果没有改善,这次修改就可能被判定为过拟合并撤回。


Anthropic 用 44 条客服工单演示了这套流程。Claude Code 先后清理 Prompt、补充业务规则、尝试不同模型并降低推理强度。最终找到一套 Sonnet 5 低 effort 配置。在 14 条没有参与调优的工单上,准确率从初始配置的 78.6% 提到 90.5%,成本降到约原来的五分之一。

AI 解读
Anthropic 给 Claude Code 的官方 claude-api Skill 加上自动调优:先造测试集,再让 Claude Code 反复改系统 Prompt、工具说明、模型与推理强度,好则留、差则回滚,并用留出集判过拟合。Claude Code 的竞争力约四成靠 harness;5 月 Opus 4.8 带来 Dynamic Workflows,Effort 等推理档位进入产品线,6 月底 Sonnet 5 上线 Claude Code/API。Skills 从社区教程变成官方优化对象。

值得注意,演示对象是 44 条客服工单。最终配置落在 Sonnet 5 低 effort:14 条未参与调优工单准确率从 78.6% 到 90.5%,成本约原来五分之一。留出集回滚意味着 Anthropic 正把 Agent 调优做成可评测、可泛化、成本敏感的工程流水线,这会削弱“换更强模型”的单一叙事。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成