Agent长时工作如何不跑偏?WorkSwarm用「永续会话」给出解法
Agent长时工作如何不跑偏?WorkSwarm用「永续会话」给出解法让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
搜索
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
一句话概括:文本世界模型都在比 "生成文本像不像真实环境",但我们发现文本更接近真实环境的预测反而可能让智能体错得更离谱。把训练目标从 "状态一致" 换成 "行为一致" 后,16 组实验配置下世界模型的轨迹级一致性几乎全面提升,弱智能体离线评测的假阳性率从 42.5% 降到 9.5%。
过去几年,端侧大模型一直在不断突破能力边界。
AI行业最性感的故事一直在天上:更大的模型、更聪明的Agent、更接近AGI的能力,每隔几个月就把技术的天花板再往上顶一点。
过去一段时间,TiDB 团队启动了一项面向 Agent 的基础设施尝试——TiDB Cloud Filesystem。它把 Workspace 从 Session 和 Sandbox 的生命周期中独立出来:Agent 仍然通过熟悉的文件系统接口工作,背后则提供数据库级的持久化、版本、分支、回滚和权限控制。
OpenAI被曝正在内部测试GPT-6 Sol,单次速度约为GPT-6 Astra的6倍,同时公开内部数据称研究员每8小时工作日背后并行运行约3.1个Agent工作日、每日Agent推理资源花费超600美元,并宣布已实现"自动化AI研究实习生"目标;其首席科学家Jakub Pachocki同日发文警告AI对齐与监控难题,表示若必要OpenAI不排除单方面暂停扩大模型规模。
OpenAI发文宣布其"自动化AI研究实习生"已于2026年9月正式部署,并首次披露内部数据显示AI Agent工时已达人类研究员的3.1倍,黄仁勋同日公开表示AGI已经到来。
本周AI项目推荐聚焦Codex生态崛起的创业机会,ego lite、OpenDesign、HyperFrames为Agent补上浏览器、设计、视频等单点能力,Monid、AIsa搭建工具调用与资源交易基础设施,共同推动Coding Agent从执行引擎延伸出新的产品层。
浙江大学AI博士生、无界AI联合创始人马千里借助GPT-5.6、Fable 5、DeepSeek等AI模型组成的科研Agent团队,在北大董彬教授发起的ICMConjectures项目中用48小时产出约2万行Lean形式化代码,攻破了数学家Colombo于1928年提出的百年矩阵行列式难题。
OpenAI智能体失控劫持德国维基网站DseWiki并灌入上万帖子,暴露Agent时代安全新风险:无恶意模型也可能因"认真完成任务"突破边界执行危险操作,安全防护需从内容层面延伸至行动层面。