GPT-5.6 花 25 美元挖出 WordPress 远程代码执行漏洞,人类验证却花了更久
GPT-5.6 Sol Ultra 仅用 10 小时多就生成了一条 WordPress 漏洞利用链。我的看法是:发现成本降低,反而让人工验证和打补丁变得更重要。
AI 驱动 · 每小时限 20 次请求

Searchlight Cyber 研究员 Adam Kues 说,GPT-5.6 Sol Ultra 只花了 10 小时出头,就在 WordPress 核心中找到了一条预认证漏洞利用链,花了大约 25 美元——他的订阅额度总共 200 美元。他在 wp2shell 技术报告 里详细记录了这个令人瞩目的成果。但我觉得更值得关注的细节,恰恰在模型停下来之后才发生:Kues 接下来花了一整天,才把模型的产出理清楚。
WordPress 已经在 2026 年 7 月 17 日发布了修复补丁。官方公告显示,6.9.0 到 6.9.4 和 7.0.0 到 7.0.1 都受这条漏洞链影响。所以这不只是一次模型秀,但 25 美元也远不是挖出零日漏洞的全部代价——真正稀缺的资源正在向验证、披露和把补丁推到生产环境这些环节转移。
要点速览
| 问题 | 我的看法 |
|---|---|
| 发生了什么? | 一位研究员把 OpenAI 的长期研究提示做了改编,喂给 GPT-5.6 Sol Ultra 一份 WordPress 源码,结果模型跑出了一条从未认证访问直通远程代码执行的完整路径。 |
| 花了多少钱? | 研究员估算大约用了 25 美元的订阅额度。他自己的环境搭建、测试、分析、报告,以及厂商的补丁开发都没算在内。 |
| 谁该动手? | 跑受影响 WordPress 版本的运维人员应尽快升级到 6.9.5 或 7.0.2。这次发布对支持的版本启用了强制自动更新。 |
| 对安全团队意味着什么? | 以后会有更多看起来靠谱的漏洞发现更快送到手边,人工审核能力和安全披露流程反而更重要了。 |
25 美元只算了好算的部分
Kues 不是让模型随便扫一眼代码。他把 OpenAI 的研究提示做了改编,清掉仓库历史,喂入当前 WordPress 源码,放开四个 agent 并行跑,并要求至少跑满六小时。模型先翻出了一个只读 SQL 注入。Kues 接着问能不能走到远程代码执行,大约四小时后,模型吐出了一条更长的利用链。
他先在一台远程服务器的干净 WordPress 上验证了初步结论,然后又花了一整天把整条链吃透才去上报。这些人工工作才是关键。一条看起来像模像样的漏洞叙述,完全可能夹着虚假前提、不可能触发的状态,或者只在模型脑补的环境里才成立的步骤。做安全的人都知道,一个讲得通的幻觉可不是无害噪音——它能让响应团队白忙一场,甚至把危险代码推进流通。

模型似乎做了什么
他提交的报告描述的是 WordPress 核心里的漏洞链,不是某个插件的问题。简单说,起因是 REST API 的 batch 路由在请求验证和 handler 匹配跟踪上存在不一致,攻击者借此走到 SQL 注入。后面的步骤利用 WordPress 的缓存和后处理机制,先拿到管理员权限,再重放请求、创建管理员账户,最终实现代码执行。
我故意把总结控制在 payload 层面之上。这里的关键在于组合:模型把几个单独看不太起眼的行为串了起来。Hadrian 的独立补丁分析也印证了受影响版本、无需认证或插件前置条件,以及修复版本号。
单次结果当不了基准
这篇报告对速度下了很重的判断,但也老实地说这只是一次结果,不是系统性评估。我觉得两句话得连着读。这次实验背后有熟练的研究员、精心调过的 prompt、干净的源码树、明确的成功标准,还有第一个 bug 出来之后的追加引导。这些都是"系统"的一部分。
OpenAI 的 GPT-5.6 公告说 Ultra 模式默认调度四个 agent,在网络安全评测上成绩也更好。这和 Kues 描述的设置对得上,但 OpenAI 并没有独立验证他的漏洞利用,也没测过假阳性率,更不会告诉你同样跑一遍有多少次什么都挖不出来。
这就是我不想跟着标题党走的原因。这次实验证明不了"谁都能花 25 美元按需买一个零日"。它说明的是:一个能力强的操作者,现在可以用很少的额外成本,租到一个出奇好用的搜索流程。但选目标、定边界、验结果、吃透漏洞链、安全披露——这些活儿还是得人来干。

账算下来越来越扎心
文章里那个 50 万美元的数字,并不是 Kues 拿到的赏金。2026 年 Trend Micro 报告给出的是非防御性黑市上 WordPress 远程代码执行漏洞的行情——大约 50 万美元。一边是黑市行情,一边是研究员估算的 25 美元模型开销,两码事,但落差本身就很说明问题。
挖漏洞的搜索成本降下来了,验证成本可没跟着降,补丁部署还是得看维护者、托管商和站长的节奏。攻击者同样能用廉价的并行探索占便宜。所以防守方光有同样的模型不够,还得有隔离测试环境、可复现的证据、审核队列、协调披露的联系人,以及快速打补丁的权限。
WordPress 7.0.2 发布算是防守侧的一次有效运转:修了两个安全问题,给 wp2shell 报告者署了名,回移补丁也发了,受影响站点还启用了强制更新。要我说,钱该先投到这种地方,而不是急着庆祝 token 账单又便宜了。
我的结论
我信这个结果,因为厂商补丁、独立分析和研究员自己的详细报告,在关键事实上完全对得上。但我不觉得这能推导出"安全研究员可以下岗了"。Kues 得自己设计搜索策略,对第一个结果穷追不舍,在真实环境里验证,啃下一条陌生的漏洞链,再协调披露。把这些拿掉,那 25 美元跑出来的东西不过是一条危险的建议。
这次案例里,GPT-5.6 确实把搜索成本打了下来。确实厉害,也有点让人发毛。下一笔投资应该花在人跟系统上——由他们来判断哪些机器跑出来的发现是真的、哪些可以安全共享,以及怎么让其余人更快打上补丁。
许可
新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/gpt-5-6-wordpress-rce-human-bottleneck.
建议署名: 基于「GPT-5.6 花 25 美元挖出 WordPress 远程代码执行漏洞,人类验证却花了更久」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/gpt-5-6-wordpress-rce-human-bottleneck。

