header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

AI写的网页到底能不能用?腾讯做了个会自己点网页的评测

动察 Beating AI 快讯,腾讯混元联合清华、北大推出 IWC-Bench,专门评测 AI 生成的网页实际用起来怎么样。


不少网页生成评测主要看代码或截图。页面可能看起来很漂亮,代码里也确实写了功能,但按钮点不开、表单交不了、切个页面就报错,这些问题很难靠静态检查发现。


IWC-Bench 更像真人验收。它让一个 Agent 真正打开网页,点击按钮、输入内容、切换页面,再检查哪些功能实际跑过。最后分别评价三件事:页面好不好看、操作顺不顺、用户要求的功能有没有做出来。


基准收录 369 条真实用户需求和 5088 条验收标准,17 个模型一共生成了 6273 个网页应用。在另外 197 组人工复核的对比中,IWC-Bench 有 168 组和人类选择一致,一致率达到 85.3%。


结果也说明,网页「看起来不错」和「真的好用」不是一回事。GPT-5.6-Sol 的页面美观度最高,但易用性只排第六;具体到单个网页,好看基本不能说明它好不好用,两项相关系数只有 0.36。

AI 解读
腾讯混元联合清华、北大推出 IWC-Bench,把网页生成评测从静态代码、截图,推进到 Agent 真实点击、输入、切页的验收。基准收录 369 条真实需求、5088 条验收标准,17 个模型生成 6273 个网页应用;197 组人工复核中 168 组一致,一致率 85.3%。混元近月已用 LHTB 测终端长任务、发布 WorldClaw 让 Agent 搭 3D 世界,Terminal-Bench 3.0 也把真实终端执行作为擂台,评测与执行环境正被连续补齐。最该注意的是,GPT-5.6-Sol 页面美观度最高,易用性仅排第六,单个网页美观与好用相关系数只有 0.36。网页生成正从“看起来不错”转向可操作交付,自动验收若成标准,会反向定义模型优化目标。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成