揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26
揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。
搜索
当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。
自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。
GPT Image 2.5凌晨突发,把改图能力端了出来。
今年 4 月,有买家给 Anthropic 开出约 6000 亿美元的估值,到了 8 月,部分投资人预计,Anthropic 上市时的估值可能达到 2 万亿美元甚至更高。事实上,要支撑这样的估值,Anthropic 需要在未来几年持续保持高速增长,但 OpenAI 的追赶给这一预期再次增加了不确定性。
以后手机GPU渲染游戏画面,不用再吭哧吭哧把每个像素都算出来了。
前些天,号称「实现 AGI」的 GPT-6 Astra 发布后,引发了全网对于递归自我改进架构的热议。
AI语音创企公司ElevenLabs已聘请前Adyen首席财务官Ethan Tandowsky出任CFO,为2028年可能进行的IPO做准备,其ARR有望达6亿美元且已实现盈利。
DeepSeek Flash系列自明日中午起降价,闲时缓存、输入和输出价格分别降至每百万Token 0.02元、1元和4元,新模型DeepSeek v4.1 Flash也已上线。
OpenAI发布新一代图像生成模型ChatGPT Images 2.5,在图片细节质量、生成速度、编辑精度及多轮修改一致性上有所提升,并新增Sketch手绘参考、创作模板和图片评论编辑等功能。
融资资金将用于扩大前沿模型研究、提升模型训练算力等。 编译 | 杨京丽 编辑 | 李水青 智东西9月8日消息,今日,法国AI公司Mistral宣布完成30亿欧元(约合人民币234亿元)D轮融资,投后估