# Hy4 默认深度推理，腾讯却警告它想太多

**Summary:** 腾讯 7700 亿参数开源模型默认启用高推理模式，但其模型卡却警示可能过度思考和验证。使用前务必测试不同推理模式。

- Canonical: https://markhuang.ai/zh/news/hy4-defaults-high-reasoning-overthinks
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-29
- Section: News
- Tags: 腾讯 Hy4, 开源权重, AI 推理
- Source: [Tencent](https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![大面积玻璃质感的 AI 模块组成网络，发光的推理路径在回路中反复穿梭，最终通向出口](https://cdn.markhuang.ai/news/hy4-defaults-high-reasoning-overthinks/hero.webp)

*Hy4 预览版能让每个 token 只经过大模型的一小部分。更难的产品决策是：每项任务到底该投入多少推理。*

[腾讯于 2026 年 8 月 28 日发布了 Hy4 预览版](https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/)，总参数达 7700 亿，每次 token 激活 490 亿参数，上下文窗口超过一百万 tokens。权重已开源，腾讯正将该模型集成到 WorkBuddy 和 CodeBuddy 等产品中。

发布数据里有个设置很容易被忽略。Hy4 默认开启高推理模式，但腾讯自己的模型卡同时警告：这个预览版在复杂任务上耗时可能超出必要，还会反复验证自己的输出。这种矛盾带来的后果很直接——延迟变高、token 消耗上升，甚至 agent 该停了还在跑。团队测试推理模式的认真程度，应该不亚于测试模型本身。

## 默认设置体现产品理念

[官方 Hy4 预览版 README](https://github.com/Tencent-Hunyuan/Hy4-preview/blob/main/README.md) 把高推理设为默认，推荐用在数学、编码和推理任务上。同一份文档里也有一个 `no_think` 选项，可以跳过思考直接回答。换句话说，腾讯给出了两种差别很大的工作模式，然后替用户选了更爱多想的那个。

这种选择在跑高难度评测时可能让模型表现更好，但放到实际生产环境里就不一定了。coding agent 有时需要在整个代码库里做规划，但有时候只是回答一个小问题、修个格式，或者测试通过就该停了。多想只有真的能改变结果的时候才有意义。

我更愿意把推理力度当成产品配置来调，而不是当成模型的"性格"。默认设置决定了用户花多少钱、等多久——而这些数字在有人验证多出来的思考到底有没有用之前，就已经定了。

## 腾讯的证据值得尝试

腾讯做了一轮内部盲测：163 位专家在 203 个工程任务上给输出打分。Hy4 预览版在 4 分制下平均拿到 2.99，GLM-5.3 是 2.92，Kimi K3 是 2.94。腾讯还给出了对 GLM-5.3 的胜率 46.8%、对 Kimi K3 的胜率 51.2%，平局和输的情况单独列出。

这些结果足够具体，有参考价值，但毕竟是腾讯用自己的专家、自己的任务组合跑出来的。分差也很小。这只能说明 Hy4 值得认真试，不能说明它不用做工作负载测试就能替掉别的模型。

[BenchmarkList 的第三方指数](https://benchmarklist.com/models/tencent-hy4-preview/)目前收录了 40 个 Hy4 预览版的测试结果。Hy4 在代码库和长上下文任务上表现很强，但在其他 agent 和软件工程测试上排名偏低。早期的 [LocalLLaMA 讨论](https://www.reddit.com/r/LocalLLaMA/comments/1w0igxk/tencenthy4preview_770ba49b_weight_dropped/)里，有评论者提出了同样的实际质疑：在 DeepSWE、CyberGym 这类测试上，光看标题数据说明不了问题。

> **Info:**
>
> 我会拿同样的常规任务和难题，分别跑高推理和 `no_think` 两种模式，然后比通过率、耗时、总 token 数、工具调用次数和人工修正次数。哪个模式能用最低成本稳定把活干完，就选哪个。

## 权重开源了，默认设置就能谈

这次的发布包分量不轻。腾讯以 Apache 2.0 协议开放模型，提供完整权重和 FP8 权重，并给出了 vLLM、SGLang 的部署文档。[Hugging Face 仓库](https://huggingface.co/tencent/Hy4-preview/tree/main)显示完整 checkpoint 共 131 个权重分片，总计 1.56 TB。权重确实开放了，但别想随便下载到笔记本上跑。

有基础设施的团队可以自己看模型卡、选部署方案、调推理模式、做微调、搭自己的评测流程。其余人大概率会通过托管产品或 API 来用 Hy4——这时候，服务商的默认设置和定价就决定了你的体验。

这跟我之前写 [Hy3 把价格做成评测的一部分](https://markhuang.ai/news/hy3-price-is-the-eval) 时的看法一脉相承。Hy4 体量大得多，但核心决策还是运营层面的：一个反复验证才交差的高质量回答，可能还不如一个稍弱但干脆利落的答案好用。正如我在[《Token 价格不是账单》](https://markhuang.ai/news/token-price-is-not-the-bill)里说过的——成本要看最终完成的任务，不是看单价或参数规模。

## 预览版应该为其默认设置证明价值

腾讯把问题说得挺直白，这一点我欣赏。模型卡明确说 Hy4 还是早期版本，团队预计还会做更多预训练和后训练。它也直接告诉用户现在哪里会出问题：推理可能拖太长，验证可能过度。评测的人现在有了一个具体的故障模式可以盯。

但光披露问题并不能解决默认设置带来的影响。如果高推理对所有任务都开着，模型已知的短板就会变成大多数用户的第一印象。我会把高推理只路由到真正受益的任务上。

Hy4 预览版底子够强，值得认真测；权重够开放，也值得动手改。比起"7700 亿参数能不能赢下模型竞赛"这种大问题，我更想先问一个没那么光鲜的：在哪些任务上，Hy4 知道自己该停了？
