# GPT-5.6 花 25 美元挖出 WordPress 远程代码执行漏洞，人类验证却花了更久

**Summary:** GPT-5.6 Sol Ultra 仅用 10 小时多就生成了一条 WordPress 漏洞利用链。我的看法是：发现成本降低，反而让人工验证和打补丁变得更重要。

- Canonical: https://markhuang.ai/zh/news/gpt-5-6-wordpress-rce-human-bottleneck
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-07-20
- Section: News
- Tags: AI, GPT-5.6, WordPress, 网络安全, 漏洞研究
- Source: [Searchlight Cyber](https://slcyber.io/research-center/exploit-brokers-pay-500000-for-a-wordpress-rce-i-found-one-with-gpt5-6/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一张卡通肖像画，Mark 正在检查一个从 AI 计算盒中延伸出的分支漏洞链](https://cdn.markhuang.ai/news/gpt-5-6-wordpress-rce-human-bottleneck/hero.webp)

*模型可以生成精巧的漏洞利用链，但有人仍需验证每个环节，才能让这个发现真正有用。*

Searchlight Cyber 研究员 Adam Kues 说，GPT-5.6 Sol Ultra 只花了 10 小时出头，就在 WordPress 核心中找到了一条预认证漏洞利用链，花了大约 25 美元——他的订阅额度总共 200 美元。他在 [wp2shell 技术报告](https://slcyber.io/research-center/exploit-brokers-pay-500000-for-a-wordpress-rce-i-found-one-with-gpt5-6/) 里详细记录了这个令人瞩目的成果。但我觉得更值得关注的细节，恰恰在模型停下来之后才发生：Kues 接下来花了一整天，才把模型的产出理清楚。

WordPress 已经在 2026 年 7 月 17 日发布了修复补丁。官方公告显示，6.9.0 到 6.9.4 和 7.0.0 到 7.0.1 都受这条漏洞链影响。所以这不只是一次模型秀，但 25 美元也远不是挖出零日漏洞的全部代价——真正稀缺的资源正在向验证、披露和把补丁推到生产环境这些环节转移。

## 要点速览

| 问题          | 我的看法                                                                                         |
| ----------- | -------------------------------------------------------------------------------------------- |
| 发生了什么？      | 一位研究员把 OpenAI 的长期研究提示做了改编，喂给 GPT-5.6 Sol Ultra 一份 WordPress 源码，结果模型跑出了一条从未认证访问直通远程代码执行的完整路径。 |
| 花了多少钱？      | 研究员估算大约用了 25 美元的订阅额度。他自己的环境搭建、测试、分析、报告，以及厂商的补丁开发都没算在内。                                       |
| 谁该动手？       | 跑受影响 WordPress 版本的运维人员应尽快升级到 6.9.5 或 7.0.2。这次发布对支持的版本启用了强制自动更新。                              |
| 对安全团队意味着什么？ | 以后会有更多看起来靠谱的漏洞发现更快送到手边，人工审核能力和安全披露流程反而更重要了。                                                  |

## 25 美元只算了好算的部分

Kues 不是让模型随便扫一眼代码。他把 OpenAI 的研究提示做了改编，清掉仓库历史，喂入当前 WordPress 源码，放开四个 agent 并行跑，并要求至少跑满六小时。模型先翻出了一个只读 SQL 注入。Kues 接着问能不能走到远程代码执行，大约四小时后，模型吐出了一条更长的利用链。

他先在一台远程服务器的干净 WordPress 上验证了初步结论，然后又花了一整天把整条链吃透才去上报。这些人工工作才是关键。一条看起来像模像样的漏洞叙述，完全可能夹着虚假前提、不可能触发的状态，或者只在模型脑补的环境里才成立的步骤。做安全的人都知道，一个讲得通的幻觉可不是无害噪音——它能让响应团队白忙一场，甚至把危险代码推进流通。

![一幅卡通天平，一边是廉价的 AI 计算，另一边是需要打补丁的大量服务器堆栈](https://cdn.markhuang.ai/news/gpt-5-6-wordpress-rce-human-bottleneck/economic-asymmetry.webp)

*发现过程可能很便宜，但防御工作却落在研究员、维护者、托管商和网站运营者身上。*

## 模型似乎做了什么

他提交的报告描述的是 WordPress 核心里的漏洞链，不是某个插件的问题。简单说，起因是 REST API 的 batch 路由在请求验证和 handler 匹配跟踪上存在不一致，攻击者借此走到 SQL 注入。后面的步骤利用 WordPress 的缓存和后处理机制，先拿到管理员权限，再重放请求、创建管理员账户，最终实现代码执行。

我故意把总结控制在 payload 层面之上。这里的关键在于组合：模型把几个单独看不太起眼的行为串了起来。[Hadrian 的独立补丁分析](https://hadrian.io/blog/wp2shell-a-pre-authentication-rce-in-wordpress-cores-rest-batch-api)也印证了受影响版本、无需认证或插件前置条件，以及修复版本号。

> **Info:**
>
> 如果你运维 WordPress，实际操作就是更新。WordPress 推荐使用 7.0.2 版，或为停留在 6.9 分支的站点使用 6.9.5 版。封掉 batch API 的匿名访问只是应急措施，不能替代修复版本。

## 单次结果当不了基准

这篇报告对速度下了很重的判断，但也老实地说这只是一次结果，不是系统性评估。我觉得两句话得连着读。这次实验背后有熟练的研究员、精心调过的 prompt、干净的源码树、明确的成功标准，还有第一个 bug 出来之后的追加引导。这些都是"系统"的一部分。

OpenAI 的 [GPT-5.6 公告](https://openai.com/index/gpt-5-6/)说 Ultra 模式默认调度四个 agent，在网络安全评测上成绩也更好。这和 Kues 描述的设置对得上，但 OpenAI 并没有独立验证他的漏洞利用，也没测过假阳性率，更不会告诉你同样跑一遍有多少次什么都挖不出来。

这就是我不想跟着标题党走的原因。这次实验证明不了"谁都能花 25 美元按需买一个零日"。它说明的是：一个能力强的操作者，现在可以用很少的额外成本，租到一个出奇好用的搜索流程。但选目标、定边界、验结果、吃透漏洞链、安全披露——这些活儿还是得人来干。

![Mark 在允许经验证的补丁到达受保护服务器前，正在审查四条快速漏洞流](https://cdn.markhuang.ai/news/gpt-5-6-wordpress-rce-human-bottleneck/verification-gate.webp)

*并行 agent 让候选漏洞的涌入速度更快，但人工审核仍然是把线索变成已验证漏洞的那道闸门。*

## 账算下来越来越扎心

文章里那个 50 万美元的数字，并不是 Kues 拿到的赏金。[2026 年 Trend Micro 报告](https://documents.trendmicro.com/assets/pdf/How_State-Sponsored_Actors_Exploit_Your_Perimeter.pdf)给出的是非防御性黑市上 WordPress 远程代码执行漏洞的行情——大约 50 万美元。一边是黑市行情，一边是研究员估算的 25 美元模型开销，两码事，但落差本身就很说明问题。

挖漏洞的搜索成本降下来了，验证成本可没跟着降，补丁部署还是得看维护者、托管商和站长的节奏。攻击者同样能用廉价的并行探索占便宜。所以防守方光有同样的模型不够，还得有隔离测试环境、可复现的证据、审核队列、协调披露的联系人，以及快速打补丁的权限。

[WordPress 7.0.2 发布](https://wordpress.org/news/2026/07/wordpress-7-0-2-release/)算是防守侧的一次有效运转：修了两个安全问题，给 wp2shell 报告者署了名，回移补丁也发了，受影响站点还启用了强制更新。要我说，钱该先投到这种地方，而不是急着庆祝 token 账单又便宜了。

## 我的结论

我信这个结果，因为厂商补丁、独立分析和研究员自己的详细报告，在关键事实上完全对得上。但我不觉得这能推导出"安全研究员可以下岗了"。Kues 得自己设计搜索策略，对第一个结果穷追不舍，在真实环境里验证，啃下一条陌生的漏洞链，再协调披露。把这些拿掉，那 25 美元跑出来的东西不过是一条危险的建议。

这次案例里，GPT-5.6 确实把搜索成本打了下来。确实厉害，也有点让人发毛。下一笔投资应该花在人跟系统上——由他们来判断哪些机器跑出来的发现是真的、哪些可以安全共享，以及怎么让其余人更快打上补丁。
