配套CLI与Skills,浙大开源可插拔Agent评测底座
配套CLI与Skills,浙大开源可插拔Agent评测底座同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
来自主题: AI技术研报
8924 点击 2026-09-14 09:49
搜索
同一套模型,换一个coding agent运行时,测试得分和实际消耗往往大相径庭。
今天,来自ZJU-REAL的团队带来了ClawGUI,一个覆盖GUI智能体在线RL训练、标准化评测、真机部署完整生命周期的开源框架。不是三个独立工具的简单拼接,而是一条打通的流水线:用ClawGUI-RL训练,用ClawGUI-Eval评测,用OpenClaw-GUI部署,端到端验证。