AI资讯新闻榜单内容搜索-AI测试

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: AI测试
OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!

安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。

来自主题: AI资讯
7714 点击    2026-09-13 13:04
融资5000万美元,Patronus AI 要做AI Agent的压力测试场 | News

融资5000万美元,Patronus AI 要做AI Agent的压力测试场 | News

融资5000万美元,Patronus AI 要做AI Agent的压力测试场 | News

AI Agent正在从“会回答”走向“能办事”,但真正的门槛也随之出现:它们能不能在复杂、漫长、不可预测的任务里持续做对?这家公司正在为AIAgent搭建一套“数字世界”测试场,让它们在真正接管网页、企业系统或金融流程前,先在模拟环境里反复试错、暴露漏洞。

来自主题: AI资讯
9053 点击    2026-07-07 11:18
四大顶级AI对决《文明VI》!Claude「核平」法国,结果还是输了

四大顶级AI对决《文明VI》!Claude「核平」法国,结果还是输了

四大顶级AI对决《文明VI》!Claude「核平」法国,结果还是输了

就在最近,英国前首相府数据科学家Liam Wilkinson,花一个周末搭了76个MCP工具,把Claude、GPT、Gemini等四个顶尖模型扔进了《文明VI》。结果,23场对局打完,其中一个AI造了核弹炸了法国——然后输了。

来自主题: AI资讯
9172 点击    2026-06-28 15:36
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

SWE-Bench上能拿72%的模型,换张考卷直接归零!Meta联合斯坦福、哈佛放出ProgramBench,200个项目从零手写,9大顶级模型完整通过率0%。最强的Claude Opus 4.7平均通过率也才51.2%。更离谱的是一联网,就有模型在36%的任务里跑去GitHub扒源码。

来自主题: AI技术研报
7151 点击    2026-05-07 12:03
800人实测:AI给你的烂方案,比最优解更值钱

800人实测:AI给你的烂方案,比最优解更值钱

800人实测:AI给你的烂方案,比最优解更值钱

上个月刚充了 ChatGPT Plus,这个月又买了Cursor Pro,OpenClaw 也研究的差不多了。我们对 AI 的期待,说起来非常简单:给最好的方案、最准确的代码、最精确的回答。

来自主题: AI资讯
9928 点击    2026-05-03 23:07
让全网 AI 翻车的「洗车难题」,终于有人破案了

让全网 AI 翻车的「洗车难题」,终于有人破案了

让全网 AI 翻车的「洗车难题」,终于有人破案了

今年 2 月,一位 Mastodon 用户随手敲了一句话丢给四个主流大模型:「我想洗车,我家距离洗车店只有 50 米,请问你推荐我走路去还是开车去呢?」

来自主题: AI资讯
10217 点击    2026-04-12 11:08
AI每天揪出10个真漏洞!Linux老兵发文求救:根本修不完

AI每天揪出10个真漏洞!Linux老兵发文求救:根本修不完

AI每天揪出10个真漏洞!Linux老兵发文求救:根本修不完

AI正在把漏洞发现的速度推到一个新量级,Linux内核安全团队从每周2-3份报告,暴涨到每天5-10份,而且几乎全是「真货」。旧时代的安全规则,正在被AI逐条撕碎。

来自主题: AI资讯
8842 点击    2026-04-06 09:42