在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
搜索
大模型过去几年的能力跃迁,几乎都围绕一个词:Scaling。
OpenAI发布的GPT-6 Astra在Insilico Medicine构建的DDD Benchmark抗体可开发性预测测试中以37.98分登顶第一,在不依赖外部专用工具的情况下击败所有前沿模型,标志着通用大模型正在突破抗体成药性预测这一生物医药研发的"死亡之谷",成为AlphaFold之后最具震撼性的科学范式转移。
《纽约时报》最新追访,补出了这场冲突中此前没有披露的细节。
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
remove-ai-watermarks是支持一条命令去除AI生成图片明水印和C2PA文件信息层暗水印的开源工具,覆盖Nano Banana、豆包、即梦等多种水印,像素层SynthID暗水印需借助NVIDIA显卡跑invisible命令重绘去除。
因为一份Markdown,Claude Code可能要被踢出门了。最近,Shopify CEO Tobi Lütke突然在X上发话——我正在考虑禁止Shopify使用Claude Code。除非他们改主意,开始支持读取AGENTS.md和.agents/skills 。
模型的发布流程,早已在密集迭代中演变为精准的工业流水线:技术报告开路,Benchmark榜单刷屏,紧接着开放API,最后以开源权重收尾。
8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。
新智元报道 据传,下一代GPT-6本周就要来了! 这不刚在昨天,OpenAI「义父」Tibo亲自爆料,Codex将接入最强Astra模型。 消息一出,全网瞬间沸腾,人们期待值直接拉满。就连Polymarket上,关于OpenAI本周发布下一代Astra的概率,飙涨到了52%。
上周我去参加了一场在旧金山举办的 robotics meetup,主办方是 Silicon Valley Robotics 和 Nomadic AI,地点在 717 Market Street。说实话,我去之前没有太高的预期,觉得这类活动大概就是几个人站着聊天喝酒,讲几个 demo 然后散场。但五个演讲下来,我发现我想多了。