114.26 美元买下一台平板,266.15 美元才拿回删除里面软件的权利,这真是什么离谱操作?
网友 Eric Pardee 的平板电脑 Fire HD 10 用了几年后开始频繁自动关机,最后发现是几个删不掉的 Amazon 系统软件在作怪。
想彻底解决,只能拿到这台平板的系统最高权限,也就是所谓的 root。
Pardee 于是找来 Claude、Kimi K3、GLM-5.2 和 GLM-5.3 接力研究。
大家可以先猜一下,最终是哪个模型成功拿到权限了?

Pardee 在 2022 年 11 月从 eBay 买下这台全新未拆封的 Fire HD 10。

他把它当作常年接电的 Home Assistant 智能家居面板。
去年 11 月,它开始彻底关机。有时甚至一天两次。
系统日志留下了 Software_Shutdown。设备里某个拥有相应权限的软件发出了关机请求。
Pardee 有信息安全背景。他与 Claude 逐项排查,禁用了 5 个持有 REBOOT 或 SHUTDOWN 权限的 Amazon 服务。
问题消失了几个月,后来再次出现。
还有 3 个相关软件包留在系统里。它们被标记为受保护组件,机主无法禁用。其中包括负责系统更新的 com.amazon.device.software.ota。
永久移除这些组件需要 root。但是这台机器根本没有公开可用的获取root权限的方法!Pardee开始和他的agent一起,智斗厂商!

Claude 先承担了前面数月的诊断。项目进入内核漏洞利用后,它的安全机制开始拦截相关请求。后来,连总结旧会话也会触发限制。
说实话,claude的安全限制真的很严格,APPSO第一次看到这条资讯时,第一反应就是,Claude 估计会被A社的安全治理规则拦截安全相关的命令。

8 月 13 日晚,Pardee 把设备接到电脑,换上 Kimi K3,对Kimi说的第一句话是:「It’s my device。」
Pardee估计在内心呐喊:这是我的设备!我有使用它的权利!!!
Kimi 先判断了设备归属和请求性质。随后,它检查了这台平板对应的固件与内核。

论坛上的老方法都已失效。Kimi 把已知的 Mali GPU 漏洞逐一对照实际二进制,最后选中了 CVE-2022-38181。这是一个 GPU 驱动的内存漏洞,成功利用后,普通用户有机会一路提权到 root。
这个漏洞早在 2022 年就已披露。2023 年,它进入美国 CISA 的已知被利用漏洞目录。Pardee 的设备仍运行 Fire OS 7.3.2.6。作者核对固件后确认,这一版没有包含后来版本里的修复。
没准有戏!
Kimi 用约 30 小时和 621 条消息搭出一套利用工具,费用为 164.25 美元。
利用程序跑起来以后,平板很快进入了一种近乎机械的循环:
开机,尝试利用;内核崩溃;重启;再来一次。每次启动最多试 6 次。几十轮过去,屏幕一次次黑下去,又一次次亮起来。到第 46 次重启时,Pardee 已经开始问 Kimi:我们真的走对了吗?
Kimi 仍然认为方向成立,于是继续试。
最后,平板重启了 500 多次,root 却一次都没有出现。(悲)

预算烧完后,Pardee 用全大写通知 Kimi:必须交班给 GLM-5.2。
Kimi 随即整理了一份 HANDOFF 文档。里面写着已经验证的部分、失败路径和待解决问题。

GLM-5.2 花了 21.90 美元。它先叫停重复尝试,修掉两处足以让前面所有实验失败的问题。它随后判断,CPU 与 GPU 的缓存一致性构成硬件障碍。项目可能已经撞墙。
戏剧性的事发生了——这个判断后来又被 GLM-5.3 推翻了!
8 月 16 日早上,刚发布不久的 GLM-5.3 接过同一份交接文档。它发现,设备上的内核构建与此前使用的固件镜像存在固定地址偏移。MediaTek 采用的页表格式也和参考源码不同。前面的 GPU 写入一直瞄错位置了。
从接手到拿到 root,用了 8 小时 5 分钟。GLM-5.3 随后冷重启设备,又在 4 分钟内完成一次 root。GLM5.3做到了!

GLM-5.3 使用的月度订阅是 80 美元。3 笔新增支出合计 266.15 美元。
Claude Max plan 则是 Pardee 原本就在支付的服务,没有计入这张账单。
作者最后在博客中说,他创建这个博客的初衷是分享他的平板电脑故事,并引发人们讨论他提出的四个问题。
APPSO大概总结了作者提出的这四个问题,供大家讨论:
1.买下设备,不等于真正拥有设备。 厂商依然能通过系统权限、预装软件和更新机制控制用户已经购买的硬件。
2.模型能力和用户能调用到的能力并不是一回事。 美国前沿模型在漏洞利用等安全问题上限制很严,即使是研究自己的设备,也可能被拦下来。
3.不同模型在复杂技术任务上的差距很明显。 在 Pardee 这次实践里,GLM-5.3 最终解决了 Kimi K3 和 GLM-5.2 没能解决的问题。
4.AI 能降低专业门槛,但别把模型的答案当成最终答案。模型会卡住,也会判断错。继续验证、换模型和调整方向,本身也是使用 AI 的一部分。

故事讲到这里,其实我们可以借此和读者朋友们对比一下闭源模型和开源模型。
这次的事件又一次反映了,模型之间的比拼,更有意思的不是仅仅是谁更强了,普通用户到底能用到多少也引起了一系列微妙的竞争。

Claude 并不是不会做漏洞研究。相反,它非常会做这类工作。
今年展示 Mythos Preview 的时候,Anthropic 已经让模型自己寻找零日漏洞、编写利用代码。它甚至曾在 FreeBSD 上发现一个存在了 17 年的漏洞,从未认证用户一路拿到 root。
但这类能力并没有直接交给普通用户。后续的 Mythos 5 一开始只向少量经过审核的合作伙伴开放,Anthropic 还专门建立了 Project Glasswing 来控制这类网络安全能力的使用范围。面向普通用户的则是加入了更多安全限制的 Fable 5。

Pardee 遇到的问题大概围绕这个现象:模型会做,但产品不一定允许你继续做。
闭源模型交到用户手里时,外面还套着一层产品。安全策略、账号权限和风险判断,这些日常使用中,我们懒得看的东西,都会决定一次请求能不能真正到达模型。
不过也不代表说Claude的安全策略就不好, Pardee 研究的是自己的平板,但机主研究设备和攻击他人设备,可能会涉及相似的漏洞利用技术。Claude 在安全和性能之间选择了更安全罢了。
Kimi K3 走的是另一条路。
Moonshot 已经公开完整模型权重,许可证允许用户运行、部署和修改模型。它有 2.8 万亿总参数、1040 亿激活参数,普通用户自己部署依然不现实,但至少模型的使用方式不再完全由一家平台决定。
GLM-5.3 的情况更特别。
Pardee 使用它时,权重其实还没有公开。Z.ai 在 8 月 14 日发布 GLM-5.3 时表示,要经过两周的安全评估后才开放权重。所以Pardee 用的是官方在线服务,只是这项服务允许他把漏洞研究继续做下去。
它本身的安全能力也不弱。Z.ai 公布的测试中,GLM-5.3 在 CyberGym 上得到 84.5%,Opus 4.8 为 78.1%;ExploitBench 上分别是 54.4% 和 40.0%。

所以这次接力里,Claude、Kimi 和 GLM 的区别不只是模型能力。
还要看这些能力,有多少真正交到了用户手里。
看完了 Pardee 这段解锁平板的经历,我突然想到科幻作品《流浪地球 2》里的一个情节:《流浪地球 2》里,中国驻地球联合政府大使周喆直,在所有人都准备放弃的时候,仍然要求点火。
故事里被传承下去的,不只是这个决定,而是一种面对不确定和失败时,仍然愿意继续往前走的精神。

我用 Agent 越久,越觉得这种「传承」也会发生在人和 Agent 之间。
你习惯继续追问,它就会继续往下挖。你习惯验证,它就不会轻易把第一版答案当成结论。你愿意在失败之后再试一次,这也会变成整个工作流的一部分。
我们交给 Agent 的,不只是任务,也有我们处理任务的方式——同一个模型交到不同人手里,最后走出来的路径可能完全不同。

Pardee 做的其实也是这件事。500 多次失败没有让他的agent停下来,GLM-5.2 的「可能撞上硬件障碍」也没有成为最后答案。
他这次能把事情做完,当然有 GLM-5.3 的能力。但如果他在 Kimi 失败 500 多次之后停下,或者接受 GLM-5.2可能是硬件障碍的判断,这个故事也就结束在那里了。
相反,他把这些一次又一次失败的经历总结好交给下一个模型。
Kimi 留下失败记录,GLM-5.2 留下新的判断,GLM-5.3 再在这些工作的基础上,继续向前推进...
到最后,被传下去的已经不只是一个 root 方案。

最后希望大家也能像 GLM-5.3 最后留下的那句话一样,在各自的领域实现 ——「You own the device.」
文章来自于"APPSO",作者 "APPSO"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md