A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
搜索
Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。
如果超级智能有黎明, 我们现在大概在黎明破晓前。 天还没亮,但地平线上已经有光了。
Ilya Sutskever创立的「安全超级智能」实验室(Safe Superintelligence,简称SSI),可能就在本周,甩出首个重磅模型!圈内大佬疯狂暗示,SSI将发布首个颠覆性的大模型。
今日,Meta超级智能实验室大牛、AI研究科学家余家辉宣布将离职创业。余家辉在帖子上提到离职原因是,随着时间推移,他意识到有一个对人类未来至关重要、却鲜少有人探索的事,他要将全部精力投入到这件事上。不过,他并未透露具体的创业方向。
2026 年 Agent 全球火爆,黄仁勋称赞 OpenClaw 是 “当代最重磅的软件” 连代安装都成了赚钱生意。但在国内,这类开源 Agent 由于其数据泄露、权限裸奔等风险在办公场景一度遭遇落地寒冬。
今天 AI 圈的国际头版头条,比往常还要激烈。前有收获不少好评的 Grok-4.5,后有虎视眈眈的 GPT-5.6。结果就在刚刚,Meta 超级智能实验室 (MSI) 杀出, 甩出新模型 Muse Spark 1.1。
Meta超级智能实验室(MSL)扔出了首个图像生成模型Muse Image,代号「芒果」(Mango)。这是我们迄今为止最先进的图像生成模型。与Muse Image一同亮相的,还有视频模型Muse Video,目前仍是预览版。
最近,GPT-5.6泄露了!150万Token+神级极简UI,下月紧急上线,奥特曼的「超级智能体」要掀翻整个硅谷?6月AI大战,已经提前爆发了。
63家AI新实验室,总估值约3000亿!Ilya在搞安全超级智能,Murati在重建通用架构,贝佐斯在造机器人,孙正义押注具身智能……这不是一份融资名单,更是一场胜率未知的基础研究豪赌。
在对多位内部开发者的采访中得知,这个模型的研发已被叫停。LPM 1.0 并非仍在推进的核心项目,而是视频团队对过去一年工作成果的集中汇报——既是对外展示,也是对内总结。该视频团队由“童姥”( 前微软亚研院首席研究员童欣) 带领, AilingZeng做Tech Lead,作者中近半数来自 Anuttacon内部,蔡浩宇本人并未直接参与模型研发。