
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
而在本地、Docker与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。
针对这一问题,浙江大学ZJU-REAL团队开源了ageval(agent eval)。它的核心思路是将待测Agent与运行环境通过插件彻底解耦:在配置文件中修改一行,同一份dataset就能在不同环境、不同Agent间自由切换运行。
配合专用的CLI与skills,ageval还能让coding agent自主编写benchmark、迁移已有测试集并执行自动化评测。

做Agent评测,开发者常遇到两个痛点:一是换个Agent或换套环境就得重写一遍适配脚手架;二是跑完只给出一个笼统的分数,中间卡在哪一步完全无法追溯。ageval覆盖了从本地复盘调试到云端结果共享的完整工作流。
评测未通过时,定位问题最需要看清Agent的实际执行轨迹。
在终端执行ageval view,即可在本地启动轻量Web轨迹查看器,按照Jobs→Tasks层级完整复盘每一次运行:

ageval将运行环境与Agent运行时均封装为标准插件,免去重复编写适配胶水代码的成本:
如果需要切换执行环境或待测Agent,只需在配置文件profiles.yaml中修改对应声明,原有的dataset无需任何改动即可直接运行。

点击进入任意插件详情页,可以直观查看该插件对外export的服务、所依赖的环境capabilities,以及安装命令与参数配置示例:


许多公开benchmark往往只公布模型名称与得分,既没有说明使用的是哪套Harness,也没有标明沙箱环境版本与Prompt模版,外界往往难以真正复现。
在ageval Hub的公开榜单上:

在实际业务中,调优出一套好用的Agent(包括Prompt模版、工具链编排与执行逻辑)通常需要投入大量的工程精力。
在ageval Hub上,团队可以直接将调优好的方案打包发布为Agent包:

点击进入单个Agent主页,可以进一步查看该Agent的配置详情、参与测评的模型列表与dataset历史记录。

在针对业务场景进行模型选型时,团队通常关注两个核心问题:
在Models Tab中,可以按照模型维度查看其在各类dataset与Agent组合下的解题成功率和调用成本:

点击具体模型进入详情页,可以进一步查看该模型在不同dataset和不同Agent下的表现明细:

在Agent详情页中,可以固定同一套Agent运行时(保持相同的Prompt策略与工具调度链),横向对比不同模型在同一个dataset下的代码生成质量与解题通过率:

在本地开发环境中,只需为coding agent安装ageval CLI和配套skills:
uv tool install ageval-clinpx skills add ZJU-REAL/ageval
安装完成后,你的coding agent就能理解ageval的CLI指令与数据结构规范。你可以直接吩咐它完成原本繁琐的工程操作:

要既能无缝适配多种执行环境(本机、Docker、云沙箱),又能兼容完全不同的Agent运行时,关键在于底层两项核心设计:一次运行的五个标准阶段以及基于服务契约的插件机制。
ageval的执行底座是一条确定性的单向流水线:
lock→environment→run→evaluate→record
无论运行过程是成功、失败、超时还是被外部中断,cleanup钩子都会在finally阶段可靠执行,彻底清理容器实例、注销网络并擦除临时凭证。

框架内部没有面向特定环境或特定Agent的硬编码if/else分支,所有组件均通过声明式的服务契约实现解耦:

以DeepSeek开源的deepseek-harness(dsh)为例。接入dsh不需要改动ageval框架的一行源码,只需要提供一份简明直观的插件声明:
plugins/dsh/plugin.yaml——Agent插件声明(节选)
plugin_id: dsh
slots:
exclusive:
- id: executor #注册为Agent执行器
inject:
- service: environment #声明依赖环境服务
capabilities: [exec, upload] #要求环境提供命令执行和文件上传能力
对于使用者而言,调用dsh与运行普通Agent完全一致。原有的dataset保持原样不动,切换对应的配置文件即可直接执行:
#1.安装带dsh支持的extras
uv tool install 'ageval-cli[dsh]'
#2.dataset保持不动,指定dsh配置开跑
ageval run <dataset> --task <task-id> --profiles profiles.dsh.yaml
ageval现已正式开源。你可以通过pip/uv安装CLI,也可以直接从源码编译体验。
#全局安装CLI
uv tool install ageval-cli
#或一次性安装全部插件扩展(含e2b,dsh,daytona等)
uv tool install 'ageval-cli[all]'
#检查安装
ageval -V
#为本机codingagent安装skills
npx skills add ZJU-REAL/ageval
直接运行公开的dataset,或本地dataset目录:
#查看公开可见的dataset
ageval registry list
#运行评测
ageval run <org>/<name>@<version> --task <task-id>
#本地启动复盘查看器
ageval view <org>/<name>@<version>
#克隆仓库
git clone https://github.com/ZJU-REAL/ageval.git
cd ageval
#安装项目依赖
uv sync --frozen --all-packages
#运行仓库自带的最小示例
uv run ageval run examples/datasets/minimal-demo --task terminal-jsonl-agg
#本地启动复盘查看器
uv run ageval view examples/datasets/minimal-demo
GitHub仓库:https://github.com/ZJU-REAL/ageval
项目主页:https://zju-real.github.io/ageval
文档与插件指南:https://zju-real.github.io/ageval/docs/
文章来自于"量子位",作者 "ZJU-REAL 团队"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0