对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回
6604点击    2026-09-14 15:05

对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回


AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。


免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回?


过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步:让 AI 去优化大模型自己运行时使用的算子


所谓“算子”,可以简单理解为大模型运行时反复执行的一小段底层计算程序模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。


这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。


为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回


结果很有趣:


两组选手都顺利完成了任务,Codex + GPT-5.6 Sol 用 8 分 57 秒给出结果,AgnesCode + Agnes 3.0 Flash 在中途被测试人员催促了一次后,耗时 20 分 36 秒完成任务。经过官方自动化评测后,对比 Codex 通过7款芯片的战绩,AgnesCode 略逊一筹,通过了 6 款芯片;但在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比更高,其中在国际通用芯片 B 上达到 4.81×,高于 Codex 的 3.71×,加速比分数高出约 29.6%;昆仑芯上也只有 AgnesCode 通过测试。


这不只是一个“免费模型全面替代付费模型”的故事,还说明了另一件事:当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已经可以进入底层工程任务,并交出可验收、有性能收益的产物。


Agent 时代,模型便宜只是入场券,能把任务交到终点才是分水岭。本文真正想回答的,是当 AI 开始拧紧自己的底层螺丝,免费的 AgnesCode 距离一个可用的工程助手还有多远。


01

一道题:

优化 DeepSeek-V3 底层算子


考虑到常见测试任务的数据很可能已经用于模型训练,导致模型本身已经很擅长,因此,在这次测试中,我们直接跳过常见的网页生成、数据看板、文案撰写等常见测试场景,选择让 AgnesCode 直接挑战更接近基础工程的题目:大模型推理算子优化。


具体来说,算子是模型算法能运行的基础环节,模型每生成一个 Token,背后都要反复调用矩阵乘法、注意力、归一化、激活函数等底层算子。在单个算子上几个百分点的加速比,往往直接变成推理延迟、显存占用和服务成本的差异。更重要的是,算子优化正在成为 AI 自进化的一部分,过去,优化这类底层代码高度依赖系统工程师手写经验;现在,Coding Agent 开始尝试读任务、写算子代码、跑测试、看报错、再改代码,这是 AI 开始反过来优化自身运行底座的一种工程样本


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

所选测试题来源截图1: 众智 FlagOS 开放计算全球大赛赛季二的赛道一


需要说明的是,这次的测试题目来自众智 FlagOS 开放计算全球大赛赛季二的赛道一:SGLang框架算子在多款芯片的性能优化。该比赛围绕 SGLang 推理框架开放了 200 余道算子任务,每周发布一批算子题目,参赛者只能在本周内看到赛题内容。因此,这可以极大保证测试任务的数据没有被测试模型提前学习,对评测对象来说,这完全是一次摸底考试”。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

所选测试题来源截图2: 200+算子的多芯片优化任务


具体来说,我们选择了一道 DeepSeek-V3 在解码阶段使用的融合 QKV-A 下投影算子 题目(Task66: dsv3_fused_a_gemm)作为测试任务,该算子是将输入特征与合并后的投影权重相乘,一次完成 Q 分支和 KV 分支的前置投影,为后续注意力计算准备数据。题目本身的计算并不难,真正的挑战在于考察 AgnesCode 能否生成一套优化算子代码能快速通过 8 款芯片(2款国际芯片、天数智芯、沐曦、燧原、海光信息、昆仑芯和华为)。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

所选测试题来源截图3: Task66-dsv3_fused_a_gemm 赛题


02

对打 Codex:

入口名翻车,但性能结果并不弱


为了更好知道 AgnesCode 的行业水平,我们选择 Codex+GPT-5.6 Sol 组合作为对照组,AgnesCode 则用官方提供的免费模型 Agnes 3.0 Flash 作为后台。我们为两个组合同时提供一个标准化的 Skill,该 skill 提供了赛制的全部信息,例如如何命名每个代码文件、如何在代码文件中命名函数名、写完代码以后要打包等。之后,我们在相同的环境下让两个组合为测试题撰写代码。


具体地,我们首先让两个组合在一台含有 NVIDIA 芯片的机器上撰写第一个版本代码,然后再基于这个版本代码撰写适配其他所有芯片的代码。


从运行过程来看,AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码的时候,首先花费了7分10秒没有给出答案,经过测试人员催促以后,再次经过13分26秒后给出了 针对不同后端调整优化的代码。包括语法、禁用项和文件依赖检查,最终整理提交包,并更新开发记录。整体来看,从编写实现、跨芯片适配,到代码自检、打包和交付,这个组合已经能够围绕一个专业任务推进完整的工作流程。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

AgnesCode + Agnes 3.0 Flash 组合运行截图


再来看看 Codex+GPT-5.6 Sol 组合的表现,相对AgnesCode + Agnes 3.0 Flash 组合 整体使用 20 分 36 秒的时间开销,Codex+GPT-5.6 Sol 组合仅用8分57秒就给出了结果。对比来看,Codex+GPT-5.6 Sol 组合的整体工作推进更快,也更加流畅。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

Codex+GPT-5.6 Sol 组合运行截图


任务推进过程是一方面,两个模型经过系统评测的效果如何呢?


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回


众智 FlagOS 开放计算全球大赛赛事官方自动化评测结果截图,第一行为 AgnesCode + Agnes 3.0 Flash 测评结果,第二行为 Codex+ GPT-5.6 Sol 测评结果。


整体来看,虽然在芯片的适配数量上,AgnesCode 落后Codex 一个,仅有六个芯片通过了测试。但在双方共同通过的五个芯片上,AgnesCode 有四项加速比更高,在天数智芯上,AgnesCode 为 2.16×,Codex为 1.72×;在国际通用芯片 B 上,AgnesCode 达到 4.81×,高于对照组的 3.71×,加速比分数高出约 29.6%;在昆仑芯上仅有 AgnesCode 通过了测试,并取得来2.56X的加速比。


该结果表明,AgnesCode + Agnes 3.0 Flash 交付了能够在多个平台获得实际加速的算子成果,体现了一定的竞争力,但在跨平台覆盖和最终验收,仍有继续改进的空间。


最后,对于一个绕不开的话题——成本,AgnesCode + Agnes 3.0 Flash 完全免费,这让它在真实的业务场景里更具吸引力。很多任务往往需要多轮问答才能获得较为不错的效果,而且模型还需要反复读取文件、根据用户反馈进行调整。若按闭源模型计费,账单很可能快速爆炸,而免费模型至少把“敢不敢让多试几轮”的门槛降了下来。


03

AA榜单揭示 

Agnes 3.0 Flash 的能力边界


上述测试可以发现,免费的 AgnesCode+Agnes 3.0 Flash 完全可以和付费订阅的 Codex+ GPT-5.6 Sol 打的有来有回,这是个例还是普遍存在呢?


对此,我们调取了 Artificial Analysis (AA榜单)公布数据,其中的 Intelligence Index 指标综合考察模型在工作任务、工具执行、编程、复杂推理、知识可靠性与长上下文等方面的表现,为模型的整体水平提供参照,Agnes 3.0 Flash 的得分为 36 分,即为接近  GPT-5.6 Luna(max)的 38 分。这说明 Agnes 3.0 Flash 本身能力已经和主流模型能力不相上下了。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

Artificial Analysis (AA榜单)公布数据截图


在 Artificial Analysis 的智能表现 × Token价格对比中,Agnes 3.0 Flash以约 0.03 美元/百万 Token 的价格进入最具吸引力区间,并位于帕累托前沿。


另外,把能力和价格放到同一张图里看,Agnes 3.0 Flash 的位置会更直观。AA 榜单的智能表现 × Token 价格对比显示,它以约 0.03 美元/百万 Token 的价格,进入了图中最具吸引力的低价高能区间:横向看,它的价格显著低于多数同等智能表现的模型;纵向看,在相近价格带里,拿到了更靠前的智能表现,这直接让模型坐稳帕累托前沿的位置。


从实际的 Agent 工作流来说,这个位置尤其重要,因为长任务会不断放大 Token 消耗,模型每便宜一点,都会直接影响用户是否愿意让它持续读文件、改代码、跑测试和反复迭代。


对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回

Artificial Analysis (AA 榜单)的智能表现 × Token 价格对比数据截图


04

免费又不失性能,

为 AI 进化带来更多探索空间


通过代码优化测试可以发现,AgnesCode + Agnes 3.0 Flash 已经能自动化生成能被系统验收、能被继续迭代、能在成本上算得过账的交付物。Agent 时代,模型便宜只是入场券,能把任务交到终点才是护城河。


换句话说,随着 AI 的发展,用户需要的不再只是生成应用,而是 AI 开始拧紧自己的底层螺丝。


从结果看,AgnesCode + Agnes 3.0 Flash 展示了两个信号:


1.在有明确工作流、任务文件和评测反馈的情况下,它已经能推进跨芯片算子适配,并在部分芯片上跑出更高加速比。


2.Agent 可能会在“最后一公里”犯错,例如入口命名、提交规范、覆盖范围等细节,这些问题不一定抹掉性能亮点,但会直接决定结果能不能被真实系统接收。


模型能力决定上限,工作台能力决定它能不能稳定抵达上限对开发者和企业用户而言,AgnesCode 的优势不只在模型本身,也在它把模型、项目文件、Skill、命令执行和评测反馈组织到同一个工作流里,帮助用户少打扰、少返工、少花钱地把事做完。


从算子优化来说,这也是国产 AI 芯片生态正在面对的现实问题,不同芯片之间的差异,不会因为上层框架统一就自动消失;推理框架、算子库、编译工具链和真实业务负载之间,仍然需要大量适配工作。如果 Agent 能进入这条链路,它就有机会把过去依赖少数系统工程师经验的优化工作,变成可以持续生成、持续验证、持续迭代的工程流程。


对比,Codex + GPT-5.6 Sol 在任务推进速度和整体流畅度上依然更占优,AgnesCode + Agnes 3.0 Flash 也暴露出交付细节上的不稳定。但同时证明了一件事:免费模型并非只能停留在简单任务层面,只要工具链、上下文和评测闭环足够明确,它同样可以进入专业工作流,并交出有竞争力的结果。


免费模型的真正价值,正在从让 AI 变得更便宜转向让更多真实任务有机会被 AI 反复尝试。当试错成本下降,Agent 才可能从“偶尔帮忙”变成“持续干活”;当持续干活成为可能,谁能把专业要求稳定写进执行过程,谁就更接近下一代 AI 工作台的入口。


文章来自于"AI科技评论",作者 "吴海明 曹PP"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md