A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
搜索
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
网商银行在2026外滩大会首次披露AI银行落地进展:全球首个小微普惠金融Agent百灵2.0已面向4200万小微商家开放,复杂需求办理从3天缩短至10分钟;后台AI全面进入风控、人审、营销、产研等核心生产环节,搭建千里眼、定海针、宝莲灯、筋斗云等八大AI工作台。
清华大学AI Agent课题组提出加速扩散语言模型单元测试生成的框架DiffuTester,通过抽象语法树动态挖掘多个测试用例间的共享结构模式,在解码过程中保留相关token,在保持测试覆盖率的同时实现最高约2–3倍加速,相关论文已被EMNLP 2026接收。
Anthropic发布2026年9月威胁情报报告,指出AI滥用已从辅助工具升级为可自主运行的行动系统,覆盖非法模型蒸馏、零日漏洞自动化挖掘、多Agent集群滥用等七大风险领域。
AI视频Agent已经告别大抽卡时代了?
RunningHub推出开源的H3 Lightning加速方案,在保留BF16满血精度的前提下使MiniMax H3视频生成速度提升约12倍,依托RH后训练加速模型、SageAttention2等工程优化并针对无NVLink的PCIe多卡环境调优,目前已全部开源至GitHub,支持创作者本地部署。
短短半年,我电脑里已经装了七八款Agent。但真正常用的只有那么一两款。其它的尝鲜后都慢慢吃灰了…
AI大模型评测平台Arena宣布用户可在直接模式中限时免费使用GPT-6 Astra(仅限medium级别),大量开发者涌入体验开发游戏,目前该模型在Agent Arena榜单中整体排名第二、前端网页开发排名第一。
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
一周之内大语言、图片、视频模型都迎来新赛季:OpenAI的GPT-6 Astra让编码 Agent更好地使用游戏引擎和Blender,自己改场景、自己跑、自己测;GPT-image-2.5上线,更快更强,图片编辑和关键帧动画显著提升;fal和Yoroll分别发布 H3 MaxTurbo和H3 Superfast后训练加速模型,5秒视频3秒内推理,实时生成和互动玩法纷纷涌现。