header-langage
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
扫码下载APP

Databricks用AI横扫英伟达Kernel榜:235项测试四个赛道第一,Token花费约7万美元

动察 Beating AI 快讯,Databricks 团队称,他们把 GPT-6 Astra 和 Opus 5 放进自动优化循环,让模型持续重写、测试和改进 GPU kernel,最终在 NVIDIA SOL-ExecBench 的四个赛道全部排到第一。这个基准包含 235 个 GPU kernel 任务,覆盖基础算子、复杂融合算子、低精度计算和真实大模型推理。团队称,整个过程的模型 Token 花费约 7 万美元。


这套系统建立在 KDA 和 Humanize 之上,让 AI 自己写 kernel、跑正确性和性能测试,再根据结果不断修改。KDA 团队近期还把类似方法用在 Kimi Delta Attention 上,在 NVIDIA B300 上做到月之暗面官方 FlashKDA 的 2.96 倍速度。


两项成果属于同一套 Agent 内核优化体系的不同应用。Kimi 展示的是一个高难度注意力内核能被 AI 重写;Databricks 这次则把这种方法扩展到了数百个不同 kernel。

AI 解读
Databricks 用 GPT-6 Astra 与 Opus 5 自动循环重写、测试、迭代 GPU kernel,在 NVIDIA SOL-ExecBench 四个赛道登顶。该基准含 235 项任务,覆盖真实大模型推理,Token 花费约 7 万美元。7 月它已用自家数百万行代码库真实 PR 评 Agent,此次把真实工程与 Agent 自动化推到 CUDA 最底层。

同一体系在 Kimi Delta Attention 上,B300 达官方 FlashKDA 的 2.96 倍,6 组任务几何平均。更关键的是,约 7 万美元就完成 235 项 kernel 的自动重写、测试与迭代,过去依赖稀缺 CUDA 工程师数周手调。Hugging Face Kernels、英伟达 SoL-Pi 也在把算子编译与 Agent 优化流水线化,内核层正从手工艺变成可批量的 token 消耗。
展开
举报 纠错/举报
纠错/举报
提交
新增文库
仅自己可见
公开
保存
选择文库
新增文库
取消
完成