47.6%,阿里Qoder拿到了比跑分更硬的成绩
47.6%,阿里Qoder拿到了比跑分更硬的成绩对 AI Coding 来说,有人用,比任何 Benchmark 都管用,而有人持续付费,又比有人用更管用。
搜索
对 AI Coding 来说,有人用,比任何 Benchmark 都管用,而有人持续付费,又比有人用更管用。
最近两周,因为Claude Fable 5回归、GPT-5.6上线再加上Tibo义父疯狂的重置。
国产Coding模型杀疯了!实测1分20秒闭环真实Bug,1395行代码徒手捏出《我的世界》,长程工程能力直逼Opus 4.8,不用再当AI保姆了。这款装入CC的AI,就是快手发布的KAT-Coder-Pro V2.5,一款旗舰级的Agentic Coding模型。
2026年下半场,AI Coding赛道最大的焦虑变了。
咱发现,邓文迪和默多克的二女儿Chloe Di Murdoch(以下简称Chloe),今年刚提前一年从斯坦福硕士毕业,就兴致勃勃加入了一家AI创业公司。就是AI 2.0时代程序员古早外挂、Vibe Coding老祖——Devin背后的公司。
腾讯旗下的AI应用生成及灵感共创平台“吐司” iOS版正式上线。这标志着吐司完成了移动端双平台(iOS+Android)的全量覆盖,让更多用户能够随时随地,通过自然语言对话创造应用。作为一款零门槛的Vibe Coding产品,吐司旨在满足大量真实、细碎、且个性化的应用需求。
两个月的时间,混元 3 正式版上线。结合了用户对预览版的反馈以及对模型稳定性和可用性的提升,Hy3 在 Agent 和 Coding 能力上有了实质的提升。我们做了多个前端网页的生成测试,大多数都包含复杂的 3D 网页模拟、严格的游戏逻辑,以及需要调用不同的框架和库文件,Hy3 交付的内容要比预览版好上一个等级。
为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。
一名员工响应公司号召,一头扎进Vibe Coding的世界里,勤勤恳恳搓出了一个像素风脑腐FPS游戏。没等他心里美完,不经意瞥了一眼。我去,这玩意儿花了我81267美元的token(折合人民币55万元)???
没有发布会,没有 Zuckerberg 的长文,Meta 就这样在六月底悄悄把一款新应用塞进了 App Store 和 Google Play。 这款叫 Pocket 的产品,直到七月初才被应用研究员 Alessandro Paluzzi 在 X 上扒出来。Appfigures 的数据证实,它最早出现在应用商店的时间是 6 月 29 日。没有官方公告,没有推广投放,甚至连美国用户眼下都下载不了