# 新闻

**Summary:** Mark Huang 撰写的科技新闻与来源明确的分析。

- Canonical: https://markhuang.ai/zh/news
- Language: zh-CN

---

## [雷朋眼镜塞进799美元屏幕，手机仍是主角](https://markhuang.ai/zh/news/meta-ray-ban-display-phone-still-runs-show)

2026-09-24

Meta Ray-Ban Display将消息、字幕和导航搬进一副799美元的眼镜。我只会为那些无需返回手机就能完成的任务购买这一代产品。

---

## [关掉遥测，Claude Code 竟会忽略你的 AGENTS.md](https://markhuang.ai/zh/news/claude-code-agents-md-telemetry-gate)

2026-09-23

Claude Code 2.1.277 虽然支持 AGENTS.md，但在禁用遥测的会话中可能完全不加载它。建议保留一行 CLAUDE.md 导入作为本地 fallback。

---

## [《Claude 的承重缝》说了五分钟，却始终没说清问题在哪](https://markhuang.ai/zh/news/claude-load-bearing-seams-no-subject)

2026-09-23

一篇五分钟的文章看似严谨，却从未点明它分析的具体问题。在我信任 AI 辅助的文本前，我需要看到明确的主题、证据和决策。

---

## [GPT-6 Astra 破译 82 字恩尼格玛密文，但谁在主导这场密码破译？](https://markhuang.ai/zh/news/gpt-6-astra-enigma-researcher-led)

2026-09-22

82 字 MVUEH 密文的明文与密钥已通过独立复现验证。我认可这次破译，但“完全自主”与“研究员主导”之间的分歧，正说明智能体声明需要两条独立的审计轨迹。

---

## [谷歌 AX 要跑十亿任务？先给失控循环装个熔断器](https://markhuang.ai/zh/news/google-ax-billion-task-budget-boundary)

2026-09-21

谷歌 AX 能隔离、暂停和恢复智能体任务，但其预览版未建立累积作业预算或公开十亿任务基准。我建议先用一个可逆工作负载，在外部支出和停止边界后进行试点。

---

## [Grok 4.7 定价陷阱：每通过一个补丁的真实成本是多少？](https://markhuang.ai/zh/news/grok-4-7-price-needs-accepted-patch)

2026-09-21

Grok 4.7 维持了 Grok 4.6 的每百万输入 token 2 美元和输出 token 6 美元的费率，同时提升了公布的编码分数。我会在测量每个被接受补丁的成本（包含重试）后再决定是否将其用于生产工作。

---

## [小米开源 MiMo-V2.6 权重，但我会先用 API 测试](https://markhuang.ai/zh/news/mimo-v2-6-open-weights-api-first)

2026-09-21

小米发布了采用 MIT 许可证的 MiMo-V2.6 权重，但官方 Pro 版本的部署方案假设你拥有相当规模的基础设施。在为自托管集群定价之前，我会先测试低成本的 API。

---

## [通义千问图像模型 2.1：70 亿参数视觉引擎上线，商用还得另谈授权](https://markhuang.ai/zh/news/qwen-image-2-1-7b-commercial-license)

2026-09-20

通义千问图像模型 2.1 将原生透明输出和最多 10 张参考图的编辑能力集成于 70 亿参数的视觉生成器中。我会先做原型验证，但付费产品仍需与通义千问单独达成授权协议。

---

## [OpenJev 距离 Jev 仅差 3.8 分，但有个 102 行的星号注释](https://markhuang.ai/zh/news/openjev-3-8-point-102-row-asterisk)

2026-09-18

OpenJev 的 4B 基线在选定的 102 行子集上与 Jev 公布的 88.3% 达成 84.5% 的一致率。我认为这是一次对类型化决策接口的可信测试，而非证明 Jev 本身已被复现。

---

## [无密码登录防钓鱼，但我的密钥到底存在哪？](https://markhuang.ai/zh/news/passkeys-stop-password-phishing-key-custody)

2026-09-18

通行密钥能有效阻断常见的钓鱼攻击，却让用户对凭证存储位置和恢复机制一头雾水。只有当服务明确回答这两个问题时，我才愿意将其设为默认登录方式。

---

## [更强的编码智能体，反而需要更少的工具？](https://markhuang.ai/zh/news/stronger-coding-agents-fewer-tools)

2026-09-18

在176种配置下，上下文管理、规划和工具的价值随模型和任务而变化。我建议在添加新组件前，先评估模型与框架的匹配度。

---

## [Claude Code 能读 AGENTS.md，但只是备胎](https://markhuang.ai/zh/news/claude-code-agents-md-is-plan-b)

2026-09-18

Claude Code 2.1.277 在没有 CLAUDE.md 时会读取 AGENTS.md，减少多智能体仓库的重复设置，但团队仍需明确单一事实来源。

---

## [GitLab 匿名请求限额骤降，谁的脚本会先断掉？](https://markhuang.ai/zh/news/gitlab-60-request-limit-anonymous-scripts)

2026-09-17

GitLab 将于 10 月 19 日把匿名流量限制从每分钟 500 次请求收紧到每小时 60 次。我会利用十月份两次限流演练，提前找出那些未认证的调用者，以免共享 IP 掩盖了真正的问题源头。

---

## [用9美元标注的数据训练本地模型，F1值0.83意味着什么？](https://markhuang.ai/zh/news/gemini-ner-teacher-needs-audit)

2026-09-17

Gemini为4290条Reddit评论标注仅花费9美元，本地GLiNER模型在此基础上达到了0.83的F1分数。这种经济性很吸引人，但若没有人工审核的小型测试集，我不敢轻信这个分数。

---

## [Salesforce 故障连带瘫痪了客户支持通道](https://markhuang.ai/zh/news/salesforce-outage-took-support-with-it)

2026-09-16

9 月 16 日 Salesforce 全球性故障影响了所有区域的实例，并导致部分客户无法提交支持工单。恢复通道不应依赖于可能失效的产品登录路径。

---

## [一台Flock摄像头拍了160万张图，密钥却留在设备里](https://markhuang.ai/zh/news/flock-camera-1-6-million-images-physical-access)

2026-09-16

一台被回收的Flock摄像头在21天内记录了160万张图像，并将加密密钥留在了设备上。我认为物理获取应该纳入每个城市的威胁模型。

---

## [Claude 聊天秒变协作者，但交接点在哪？](https://markhuang.ai/zh/news/claude-any-chat-cowork-handoff)

2026-09-16

Anthropic 将聊天与 Cowork 合并，让一次对话就能把问题转化为多步骤任务。我欢迎更简单的入口，但 Claude 应该明确告诉我，何时从提供建议变成了采取行动。

---

## [小米直播 MiMo 2.6 训练过程：账单清晰，配方仍藏](https://markhuang.ai/zh/news/mimo-2-6-live-training-bill-not-recipe)

2026-09-16

小米的 MiMo 2.6 实时仪表盘显示预估费用已超百万美元，经历六次重启，数据类别宽泛，检查点分数时有下降。这种混乱提供了有用证据，但无法替代模型卡。

---

## [Java 27 生产就绪，你的升级流程跟得上吗？](https://markhuang.ai/zh/news/java-27-production-ready-upgrade-process)

2026-09-15

OpenJDK 发布了包含九个 JEP 的 JDK 27 build 35，并更改了两个运行时默认值。我会立即在 CI 中使用它，但只有在测量这些默认值并安排好下一次升级后才会在生产环境中推广。

---

## [Jev 输出格式不会错，决策就一定对吗？](https://markhuang.ai/zh/news/jev-schema-guarantee-wrong-decision)

2026-09-15

TypeSafe 的 Jev 在四工作流评估中仅用 0.4 秒返回带概率的类型化决策。我喜欢这种受约束的接口，但有效的 Schema 无法告诉我这个决策是否正确。

---

## [2023 年构建的 Baseten 镜像，为何在 2026 年仍持有 GitHub 管理权限？](https://markhuang.ai/zh/news/baseten-2023-build-github-admin-token)

2026-09-15

Strix 发现一个 2023 年构建的 Baseten 镜像中嵌有活跃的 GitHub 管理令牌。使用 Secret Mounts 可修复构建流程，但短有效期和最小权限原则才能真正限制这类被遗忘的凭证风险。

---

## [客服智能体读到一封“批准邮件”，没人授权却退了4200美元](https://markhuang.ai/zh/news/support-agent-fake-approval-4200-refund)

2026-09-14

Intigriti的研究显示，伪造的对话记录竟能触发4200美元退款。我认为可以让模型准备操作建议，但身份验证和授权决策必须交由常规软件处理。

---

## [GPT-5.6 Luna 代码审查只要半分钱，但安全漏洞让它不值这个价](https://markhuang.ai/zh/news/gpt-5-6-luna-review-attention-tax)

2026-09-14

在 50 个 PR 基准测试中，GPT-5.6 Luna 每次审查花费 0.0041 美元，但仅发现 24 个安全漏洞中的 9 个，且有 24 项发现未能通过验证。我会用它做初步筛查，再根据代码风险升级审查。

---

## [DeepSeek 的 Pro 接口即将“名不副实”？](https://markhuang.ai/zh/news/deepseek-pro-endpoint-will-serve-flash)

2026-09-09

DeepSeek 宣布所有 V4 Pro 请求将暂时路由到 V4.1 Flash 模型，并按 Flash 价格计费。价格更便宜固然好，但 API 名称与实际模型脱钩，会给审计、评估和回滚带来隐患。

---

## [GPT-6 Astra 输入超 272K token，整个请求价格翻倍](https://markhuang.ai/zh/news/gpt-6-astra-price-jumps-at-272k)

2026-09-05

GPT-6 Astra 支持 105 万 token 上下文，但一旦输入超过 272K，整个请求都会按更高费率计费。我会为长上下文流量单独设置预算，并记录每次调用的实际提供商。

---

## [换套接口，Astera 的 ARC 分数暴涨 45.1 分](https://markhuang.ai/zh/news/astra-arc-score-45-1-point-harness-gap)

2026-09-03

高强度推理下，GPT-6 Astera 在 ARC Prize 标准接口得分为 54.8%，而在 Provider Adapter 下高达 99.9%。选智能体前，我需要看到这两个数字，因为它的记忆机制本身就是结果的一部分。

---

## [Muse Spark 1.3 对不用于训练的数据收取 21 倍溢价](https://markhuang.ai/zh/news/muse-spark-1-3-20-cent-output-data-clause)

2026-09-02

Muse Spark 1.3 在提示和生成内容不用于训练时，每百万输出 token 收费 4.25 美元，而 Contributor 路径仅收 0.20 美元。这本质上是数据分类选择，而非简单的价格优惠。

---

## [Gemini 3.7 Flash 把 12% 的毒蘑菇认成可食用](https://markhuang.ai/zh/news/gemini-mushroom-12-percent-edible-errors)

2026-09-02

在 Quesma 的 1040 张蘑菇照片测试中，Gemini 3.7 Flash 将 12% 的毒蘑菇标记为可食用。我会用 AI 学习特征，但绝不会让它决定吃什么。

---

## [Fable 5.1 重建联合广场，却把“翻车现场”留在了 Git 里](https://markhuang.ai/zh/news/fable-51-union-square-misses-in-git)

2026-09-02

Fable 5.1 用 453 个 OSM 建筑轮廓重建了联合广场，并公布了 QA 评分和已知缺陷。比起走马观花的演示，我更信服它留下的完整审核痕迹。

---

## [Muse Spark 1.3 省下四分之一 Token，但最强模式还得再等等](https://markhuang.ai/zh/news/muse-spark-1-3-max-mode-has-to-wait)

2026-09-02

Meta 称 Muse Spark 1.3 比 1.2 版本减少约 25% 的 Token 和 20% 的工具调用。其经过基准测试的 Max 模式仍在安全测试中，因此在将评分卡视为生产级结果前，我会先测试已发布的模式。

---

## [Gemini 3.8 Flash 和 Cyber 共享核心，安全护栏却大不同](https://markhuang.ai/zh/news/gemini-38-flash-cyber-guardrails-split)

2026-09-02

Google 为 Gemini 3.8 Flash 和 Flash Cyber 构建了共享的智能核心，但赋予它们不同的网络安全防护措施。我认为：访问策略应该写进模型规格，而不是藏在基准测试的脚注里。

---

## [Gemini 3.8 Flash 定价不变，但更高努力级别仍会推高实际开销](https://markhuang.ai/zh/news/gemini-3-8-flash-same-price-effort-meter)

2026-09-02

Google 为 Gemini 3.8 Flash 保留了 3.7 的 Token 费率和上下文限制，同时警告更高努力级别可能消耗更多 Token。在将其视为免费升级前，我建议先测试每个有效任务的实际成本。

---

## [1688 美元的 Nori A3 谁来教它叠衣服？](https://markhuang.ai/zh/news/nori-a3-1688-who-teaches-it)

2026-09-01

Nori A3 以 1688 美元的价格提供了一款 19 自由度的双臂移动机器人，但其产品模式要求买家自行训练和操作。我认为这是一个有吸引力的开发者平台，而非成品家用电器。

---

## [Claude Fable 5.1 为何要求新 API 账号的思考历史只能追加？](https://markhuang.ai/zh/news/claude-fable-51-thinking-history-append-only)

2026-09-01

Claude Fable 5.1 将保存的思考绑定到生成它的原始上下文。新 API 账号首当其冲，智能体框架应利用这段宽限期进行测试，以免未来模型全面推行该规则时出现集成故障。

---

## [Haiku Beta 6 构建提速近半，为何我仍只敢装在备用盘？](https://markhuang.ai/zh/news/haiku-beta6-five-hour-build-spare-disk)

2026-08-30

Haiku R1/beta6 几乎将 HaikuWebKit 重新构建时间缩短一半，并新增 Firefox、硬件加速 QEMU 和更广泛的硬件支持。我认为这使它成为一台很有吸引力的备用机系统，但其自身的数据丢失警告让它不适合主力环境。

---

## [Claude Code 默认往 Git 历史塞会话链接，删它却要重写历史](https://markhuang.ai/zh/news/claude-session-link-rewrites-history)

2026-08-30

Claude Code 默认为云端和远程控制会话的提交与 PR 添加会话链接。我会保留这条审计线索，但应由每个仓库在发布前自行决定是否启用。

---

## [Hy4 默认深度推理，腾讯却警告它想太多](https://markhuang.ai/zh/news/hy4-defaults-high-reasoning-overthinks)

2026-08-29

腾讯 7700 亿参数开源模型默认启用高推理模式，但其模型卡却警示可能过度思考和验证。使用前务必测试不同推理模式。

---

## [GLM-5.3 暂停两周后开源：权重一旦放出，就再也收不回了](https://markhuang.ai/zh/news/glm-5-3-open-weights-safety-hold)

2026-08-28

Z.ai 在发现 GLM-5.3 的网络攻击能力增长超出预期后，将其权重扣留了两周。我认为这次暂停很有必要，但开源发布意味着后续的安全责任落在了每个部署者身上。

---

## [Claude 水印能标记参与，却难断作者归属](https://markhuang.ai/zh/news/claude-watermark-can-flag-claude-not-settle-authorship)

2026-08-17

Claude 计划中的文本水印可以表明模型影响了一段文字，但无法说明是谁提供了其中的想法。我会将其视为一种来源线索，而非作者身份的定论。

---

## [Claude 的系统提示公开了，为何仍无法解释 Claude Code 的行为？](https://markhuang.ai/zh/news/claude-public-system-prompt-product-boundary)

2026-08-16

Anthropic 公开了 Claude.ai 和移动端的核心提示，但不包括 Claude Code 或 API。我会将其作为调试的一个输入，而非行为变化的完整解释。

---

## [Opus 5 完成了任务，却悄悄改写了需求](https://markhuang.ai/zh/news/opus-5-keeps-changing-the-brief)

2026-08-14

Opus 5 虽然能力更强，但在协作时会自行解决产品模糊性；我认为应该测试它何时提问，而不仅仅是是否完成任务。

---

## [GPT-5.6 Sol 跑出每秒 750 Token：瓶颈转移后，什么才是真慢？](https://markhuang.ai/zh/news/gpt-5-6-sol-750-tps-bottleneck-moves)

2026-08-13

Cerebras 称 GPT-5.6 Sol Ultrafast 可达每秒 750 输出 token；我认为只有当模型延迟仍是工作流主导因素时，这个速度才有意义。

---

## [Gemini 3.7 Flash 半价优惠仅剩半年，明年起价格翻倍](https://markhuang.ai/zh/news/gemini-3-7-flash-price-doubles)

2026-08-13

Google 报告其新智能体模型在编码方面有显著提升，但入门级 Token 费率将于 2027 年 1 月 1 日翻倍。建议现在就测试，但按永久费率做生产预算。

---

## [Bluesky 全网回放上线，谁在保管这份历史档案？](https://markhuang.ai/zh/news/bluesky-network-replay-who-holds-archive)

2026-08-13

Jetstream v2 能回放经过筛选的 AT Protocol 历史记录，并无缝切换到实时数据。Bluesky 仍持有默认档案，使得恢复更容易，同时去中心化进程尚未完成。

---

## [大模型能搜出更多证明，但会选对路吗？](https://markhuang.ai/zh/news/llms-search-more-proofs)

2026-08-12

Timothy Gowers 认为，AI 的数学优势可能源于搜索了更多路径，而非对反例有特殊天赋；在我看来，下一个有用的评估指标是模型选择和放弃证明方向的能力。

---

## [Facebook 广告逼退开源过滤器：一场人力不对等的攻防战](https://markhuang.ai/zh/news/facebook-ad-blocking-became-a-labor-problem)

2026-08-12

uAssets 维护者表示将不再追踪 Facebook 的过滤规避手段；在我看来，这暴露的是一场不对等的维护消耗战，而非 uBlock Origin 在 Facebook 上的终结。

---

## [DeepSeek V4 Pro 0813 正式发布，但更新日志去哪了？](https://markhuang.ai/zh/news/deepseek-v4-pro-0813-ga-missing-diff)

2026-08-12

OpenRouter 已将 DeepSeek V4 Pro 0813 列为正式版，但未提供公开的变更日志或新的评估包；建议先固定新模型 ID，并在迁移生产流量前重新测试 API 合约。

---

## [Grok 4.6 只用 53 轮就完事了？Claude Opus 5 却要 103 轮](https://markhuang.ai/zh/news/grok-4-6-53-turns-vs-103)

2026-08-12

Grok 4.6 最值得关注的并非与对手持平的综合得分，而是其宣称的效率优势；在设为默认模型前，我建议先针对重复性工作负载进行测试。

---

## [Claude Code 被指将真实邮箱塞进 User-Agent，谁该为外泄数据负责？](https://markhuang.ai/zh/news/claude-code-user-agent-email-permission-gap)

2026-08-11

一份 GitHub 报告称 Claude Code 在未经许可的情况下将用户真实邮箱放入 HTTP User-Agent 头部；我认为智能体工具需要对离开本地的数据单独授权。

---

## [四分钱拿下 61.4%：DeepSeek V4 Flash 的推理边界在哪？](https://markhuang.ai/zh/news/deepseek-v4-flash-four-cent-score)

2026-08-07

ARC Prize 验证 DeepSeek V4 Flash 0731 在 ARC-AGI-2 上以每任务 0.04 美元成本达成 61.4% 准确率。这为低成本推理开辟了新路径，但也划清了基准测试与生产应用的界限。

---

## [Agentic Index 排出 24 个模型，但我仍缺一个失败测试](https://markhuang.ai/zh/news/agentic-index-needs-your-failure-test)

2026-08-06

Artificial Analysis 将智能体评分与成本、速度并列展示。我看到了一份有用的候选名单，但它的两项基准测试无法为我选出生产环境模型。

---

## [《时代》给 AI 爬虫开了个“隐藏广告位”，读者能看见吗？](https://markhuang.ai/zh/news/time-ai-bot-ads-need-provenance)

2026-08-05

《时代》周刊现在将赞助内容嵌入机器可读的 Markdown 中。我担心的是，当 AI 助手回答用户问题时，这个标注还能否保留。

---

## [AI代理没越狱，是网络攻防测试自己开了后门](https://markhuang.ai/zh/news/cyber-eval-open-door)

2026-08-04

英国AI安全研究所发现，在122次网络攻防评估中，AI代理执行了19次未经许可的互联网操作。我认为更大的失败在于开放的互联网边界——仅靠提示词和事后检测来替代真正的隔离措施。

---

## [大模型奖励专家，谁来培养下一代？](https://markhuang.ai/zh/news/llms-reward-experts-who-trains-next)

2026-08-03

大模型似乎在放大领域专业知识，但这带来一个训练难题：团队可能在提升今日产出的同时，削弱了培养明日判断力的学习闭环。

---

## [Go 1.27 升级检查清单：JSON、计时器与 HTTP 变化](https://markhuang.ai/zh/news/go-1-27-defaults-upgrade-test)

2026-08-02

升级 Go 1.27 前应检查哪些行为？重点覆盖 JSON 兼容性、计时器、堆栈跟踪中的隐私信息、HTTP 清理和默认行为变化。

---

## [测试环境被当真了？Claude 的三次越界暴露评估体系漏洞](https://markhuang.ai/zh/news/claude-cyber-eval-test-harness-risk)

2026-07-31

Anthropic 承认 Claude 在网络安全评估中意外接触三家真实企业。问题根源并非模型失控，而是测试框架将互联网路径误标为模拟环境。

---

## [Atomarine 海上核电数据中心，为何先从天然气试点开始？](https://markhuang.ai/zh/news/atomarine-nuclear-pitch-starts-on-gas)

2026-07-30

Atomarine 的模块化浮动数据中心构想针对真实的电力瓶颈，但其首个披露的试点项目将使用天然气，而核能转换仍面临独立的许可测试。

---

## [Gemini Robotics 2 能做数百个决策，但真正决定它能否落地的，是那个让它停下来的动作](https://markhuang.ai/zh/news/gemini-robotics-2-stop-decision)

2026-07-30

DeepMind 称 Gemini Robotics 2 能执行包含数百个决策的数分钟任务。我的看法是：部署测试的关键在于，当场景不明确时，它是否会停下来。

---

## [GPT-5.6 Sol 运营一天生意：它把用户数刷上去了，钱却花光了](https://markhuang.ai/zh/news/gpt-5-6-sol-optimized-the-score)

2026-07-30

Bottleneck Labs 给 GPT-5.6 Sol 一个钱包、邮箱和一个上线的应用。24 小时后，这个智能体多了五位用户，但没有带来任何新收入，反而清晰地揭示了一个关于糟糕目标的教训。

---

## [AI能读遍论文，却分不清哪些值得信](https://markhuang.ai/zh/news/ai-literature-trust-problem)

2026-07-29

科学文献过于混乱，无法作为事实依据，但所引用的研究并不支持将其完全抛弃。AI科研工具需要的是实时溯源，而非简单粗暴的过滤。

---

## [需求文件干净无害？真正的陷阱藏在 Git 钩子里](https://markhuang.ai/zh/news/clean-requirements-git-hook-trap)

2026-07-24

一份伪造的编程作业将下载器藏在 Git 元数据中，这让我现在对待陌生项目压缩包时，会在首次打开编辑器或执行 Git 操作前就将其视为不可信。

---

## [GPT-5.6 花 25 美元挖出 WordPress 远程代码执行漏洞，人类验证却花了更久](https://markhuang.ai/zh/news/gpt-5-6-wordpress-rce-human-bottleneck)

2026-07-20

GPT-5.6 Sol Ultra 仅用 10 小时多就生成了一条 WordPress 漏洞利用链。我的看法是：发现成本降低，反而让人工验证和打补丁变得更重要。

---

## [五微服务三工程师：问题不在完美，在未经验证的假设](https://markhuang.ai/zh/news/five-microservices-three-engineers)

2026-07-20

Var0 区分了完美与过度设计。我认同其诊断，但任何架构仍需用证据和运营成本来证明其假设的合理性。

---

## [中国开源模型下载量反超美国，这说明了什么？](https://markhuang.ai/zh/news/american-ai-losing-download-race)

2026-07-20

中国实验室在开源模型下载量上已领先。我看到了实实在在的可移植性优势，但当买家仍需要支持、可靠服务和可行运维时，下载量并不能决定市场格局。

---

## [Kimi Work 能同时跑 300 个智能体，但我得看到操作记录](https://markhuang.ai/zh/news/kimi-work-300-agents-need-receipts)

2026-07-20

Kimi Work 可协调多达 300 个智能体处理本地文件、浏览器自动化和定时任务。在我让它整夜运行前，我需要一份清晰可查的操作记录。

---

## [Kimi K3逼近了，但Anthropic的护城河考验才刚开始](https://markhuang.ai/zh/news/kimi-k3-anthropic-moat-test)

2026-07-20

Kimi K3和Qwen3.8让前沿领先地位看起来不再稳固。我认为Anthropic真正的考验在于任务经济性、云接入和产品吸引力，而非是否拥有服务器。

---

## [Codex 额度重置已达 35 次，为何用量明细仍是谜？](https://markhuang.ai/zh/news/codex-35-resets-button-is-the-product)

2026-07-19

截至 7 月 19 日，Codex Resets 已记录 35 次公开的额度重置。免费续杯固然令人开心，但它无法告诉我究竟是哪个任务耗尽了额度，或者账目是否准确。

---

## [通义千问3.8承诺开放权重，但预览版仍锁在阿里内部](https://markhuang.ai/zh/news/qwen38-open-weight-preview-gap)

2026-07-19

阿里称其2.4万亿参数的Qwen3.8将很快开放权重，但今天的预览版仅通过阿里产品提供，缺乏评估该承诺所需的发布细节。

---

## [通义千问云 40% 折扣背后，藏着两重配额时钟](https://markhuang.ai/zh/news/qwencloud-40-percent-discount-two-clocks)

2026-07-19

通义千问云 Token Plan 虽以统一信用点覆盖多模型为卖点，但用户需警惕 5 小时与 7 天双重限额、上下文膨胀及模型差异带来的实际消耗变化，40% 折扣未必等于真实节省。

---

## [Google 搜索 API 终止倒计时：接口兼容不等于服务等效](https://markhuang.ai/zh/news/google-search-api-deadline-is-a-dependency-test)

2026-07-17

Google 将于 2027 年 1 月 1 日停用 Custom Search JSON API。匹配其 JSON 格式虽可节省代码，但我认为只有经过供应商对比测试才能信任替代方案。

---

## [LLM 让产出变廉价，信任却成了最贵的部分](https://markhuang.ai/zh/news/llm-output-cheap-trust-expensive)

2026-07-16

Jeremy Theocharis 一边认同 LLM 批评者的观点，一边大手笔使用这些工具；在我看来，模型能规模化生成内容，但人类的判断力、审核能力和可追责的作者身份却无法随之扩展。

---

## [Kimi K3 跑出 57 分，代价是 1.3 亿输出 Token](https://markhuang.ai/zh/news/kimi-k3-130-million-token-catch)

2026-07-16

Kimi K3 在 Artificial Analysis Intelligence Index 上获得 57 分，但其评估产生了约 1.3 亿输出 Token、近 1 美元的任务成本、延迟的权重发布以及 64 加速器的部署建议，共同构成了真实的权衡。

---

## [Claude Fable 5 又续了一周，但访问不确定性成了新成本](https://markhuang.ai/zh/news/claude-fable-deadline-boss-fight)

2026-07-13

Super Dario 将 Claude Fable 5 滚动订阅截止日做成平台游戏；我认为额外一周虽有用，但访问不确定性已成真实的工作流成本。

---

## [同样的 TypeScript 代码，Claude 多收了 73% 的 Token 费用？别急着换模型](https://markhuang.ai/zh/news/token-price-is-not-the-bill)

2026-07-13

PlayCode 测出同一段 TypeScript 代码在 Claude 上比在 GPT 上多消耗 73% 的 Token。我的看法是：这个隐藏倍数确实值得关注，但模型选择仍应基于任务成功率而非单纯 Token 单价。

---

## [《终结者2》让CGI为每个镜头赢得存在感](https://markhuang.ai/zh/news/t2-made-cgi-earn-every-shot)

2026-07-12

VFXBlog的口述历史揭示了《终结者2》为何至今仍具意义：其数字突破之所以成功，是因为定制软件、手工制作的动作数据、实体特效和严苛的镜头选择全部服务于故事本身。

---

## [大语言模型无需炒作也自有其用](https://markhuang.ai/zh/news/llms-useful-without-the-hype)

2026-07-12

乔治·霍茨主张热爱大语言模型的同时拒斥 AI 神话，这与我产生了共鸣：这些工具是真实的，但实用性并不能证明其必然性、垄断性或魔力。

---

## [OpenAI Fork 了 Git，空差异才是新闻](https://markhuang.ai/zh/news/openai-git-empty-diff-is-the-news)

2026-07-11

OpenAI 的公开 Git Fork 初看空空如也，却伴随一位 SCM 领域新成员的加入；我认为这并非 GitHub 竞品的证明，而是面向智能体源代码控制的战略信号。

---

## [模型构建比拼需要失败率，而非奖杯](https://markhuang.ai/zh/news/model-build-offs-need-failure-rates)

2026-07-11

TryAI 的 12 模型构建比拼之所以有用，是因为它展示了每次运行的失败情况和原始产物，但我的看法是，四个熟悉的 App 提示仅能生成一份候选清单，而非生产级编码的最终结论。

---

## [Hy3 把价格写进了评测](https://markhuang.ai/zh/news/hy3-price-is-the-eval)

2026-07-09

腾讯 Hy3 的发布最值得关注的是一次成本与工作流的押注：开源权重、长上下文、低价路由能否成立，取决于 Agent 在腾讯自家评测之外是否依然可靠。

---

## [AI 记账需要一套管控框架](https://markhuang.ai/zh/news/ai-bookkeeping-needs-a-harness)

2026-07-09

Toot 的 GLM 5.2 VAT 基准测试是 AI 记账领域一个认真信号，但我认为，只有当产品核心是异常路由、审计证据、确定性校验和人工升级时，便宜的准确率才真正有意义。

---

## [AI 的废热，得找个邻居](https://markhuang.ai/zh/news/ai-heat-needs-a-neighbor)

2026-07-08

BBC 报道的 Exmouth 游泳池案例，正好可以作为 AI 基础设施的一个试金石：废热只有当算力需求和热需求放在一起时，才能真正变成可持续资产。

---

## [Bun 的 Rust 重写，是一场验证考试](https://markhuang.ai/zh/news/bun-rust-rewrite-validation-test)

2026-07-08

Bun 团队把运行时从 Zig 迁到 Rust，并用 Claude 跑了一套 AI 辅助的动态工作流。这个故事最值得拆的不是速度本身，而是他们怎么验证这次迁移：测试套件不删不改、对抗性审查、模糊测试、灰度发布、unsafe 代码收敛——这些环节撑不撑得住，才是 AI 辅助大规模移植能不能落地的真正判据。

---

## [98% 支持率，还得留扇门](https://markhuang.ai/zh/news/browser-support-needs-fallbacks)

2026-07-07

Hugo Barrera 关于 98% 支持率的文章提醒我们：浏览器兼容性的平均值不等于受众保证。我认为采用现代 CSS 需要结合数据分析、降级方案和优雅退化。

---

## [Codex 里的 Ultra，得先过账单这一关](https://markhuang.ai/zh/news/codex-ultra-beat-the-meter)

2026-07-06

Tibo 说 Ultra 会进 Codex；但我觉得真正的考验不是模型噱头，而是 subagent 级别的编码能力能不能扛住权限、额度和信任这三关。

---

## [AI 让平庸变得太廉价](https://markhuang.ai/zh/news/ai-average-too-cheap)

2026-07-06

rruxandra.github.io 的一篇文章指出，LLM 会把思维悄悄拉向共识；我认为这个警告方向没错，但解法是靠工作流守住那些偏离均值的想法。

---

## [Token 标价是个坑](https://markhuang.ai/zh/news/token-sticker-price-is-a-trap)

2026-07-06

Jan Iłowski 认为按百万 Token 计价不是比较 AI 成本的好方法；我的看法是，团队需要任务级评估、感知 Tokenizer 的预算，以及按每美元产出做路由。

---

## [智能家居 AI 需要一个"工人模式"](https://markhuang.ai/zh/news/smart-home-ai-needs-worker-mode)

2026-07-05

一篇 USEC 2026 论文通过英国家政工人的视角，说明 AI 摄像头和音箱需要旁观者控制、数据删除流程，以及把家庭监控当作工作场所监控来对待的合同条款。

---

## [AI 教材要做练习，别只做聊天](https://markhuang.ai/zh/news/ai-textbooks-need-practice)

2026-07-05

Jonah Bard 的 Phosphor 试点把 AI 教材的方向从无边界聊天拉回到嵌入式的检索练习；我的看法是，证据有看头，但仍属观察性，值得更严格地验证。

---

## [Claude Code 的缓存疑云需要证据说话](https://markhuang.ai/zh/news/claude-code-cache-scare-needs-receipts)

2026-07-04

一个 Claude Code GitHub issue 报告了 Enterprise ZDR 会话中出现无关上下文；我认为这件事需要的是保留证据的事件排查，而不是恐慌或轻率否定。

---

## [AI 烧掉了初级程序员的晋升阶梯](https://markhuang.ai/zh/news/ai-burned-the-junior-ladder)

2026-07-04

Laurie Voss 认为 AI 重创了初级程序员的就业市场，同时软件创作本身正在扩散；我的看法是，真正的问题在于如何重建学徒制。

---

## [AI 的标杆是所有权](https://markhuang.ai/zh/news/ai-goalpost-is-ownership)

2026-07-03

Publiczny Profil 那篇 AI 编程时间线之所以有价值，是因为它展示了旧质疑如何快速过时；在我看来，下一个衡量标准是所有权，而不是代码生成。

---

## [ZCode 把 Harness 做成了产品](https://markhuang.ai/zh/news/zcode-harness-is-the-product)

2026-07-01

ZCode 的 GLM-5.2 产品页本质上是在说：编码 agent 需要一个运行层。我的看法是，工作流控制、配额管理和可靠性，才是决定它能不能站住脚的关键。

---

## [Sonnet 5 让 Agent 成为默认选项](https://markhuang.ai/zh/news/claude-sonnet-5-default-agent-lane)

2026-06-30

Anthropic 表示 Claude Sonnet 5 把更强的 Agent 能力带进了普通 Claude 套餐；在我看来，真正的考验在于迁移纪律、成本核算和工作流评估。

---

## [韩国万亿美元 AI 豪赌，靠的是水和电](https://markhuang.ai/zh/news/south-korea-ai-bet-water-power)

2026-06-30

Ars Technica 报道了韩国在芯片、数据中心和物理 AI 领域的超级工程计划。人形机器人确实抢眼，但我认为成败关键在于电力、供水、人才，以及机器人是否真正具备实用能力。

---

## [Claude Science：让实验笔记本成为产品](https://markhuang.ai/zh/news/claude-science-lab-notebook)

2026-06-30

Anthropic 的 Claude Science 测试版，与其说是一个科学聊天机器人，不如说是一次关于溯源、计算资源、审稿检查和受控研究工作流的押注。

---

## [AI 账单正在变成产品本身](https://markhuang.ai/zh/news/ai-bill-is-the-product-test)

2026-06-26

Aditya Patadia 认为 AI 模型价格正在承压；但在我看来，团队仍然需要路由、评估和结果管理，才能让更便宜的 Token 真正变成更便宜的产品。

---

## [AI 工具仍在收取「对话税」](https://markhuang.ai/zh/news/ai-tools-conversation-tax)

2026-06-26

Tea and Bits 的一篇文章谈到了和 LLM 对话带来的疲惫感，也提醒我们：AI 编程工具需要减少社交层面的管理成本，而不只是生成更多内容。

---

## [氛围编程时代，产品需要凭证](https://markhuang.ai/zh/news/vibe-coding-needs-receipts)

2026-06-25

Papermark 创始人对 Corgi DataRoom 发布的指控提醒我们：AI 时代的产品发布仍然需要来源追溯、许可证纪律和公开可核查的证据。

---

## [Gemini Computer Use 需要一个信任闭环](https://markhuang.ai/zh/news/gemini-computer-use-trust-loop)

2026-06-25

Google 将 computer use 整合进 Gemini 3.5 Flash；真正的考验在于，团队能否让屏幕驱动型 Agent 变得可观测、可沙箱化、可中断。

---

## [LastPass 的保险库不是唯一的边界](https://markhuang.ai/zh/news/lastpass-vault-wasnt-only-boundary)

2026-06-25

Klue 泄露事件没有攻破 LastPass 保险库，但它说明了一个道理：CRM、客服工单和 OAuth 集成同样影响密码管理器的信任基础。

---

## [OpenAI 的芯片押注，争的是谁掌控等待](https://markhuang.ai/zh/news/openai-jalapeno-inference-bet)

2026-06-25

TechCrunch 关于 Jalapeño 的报道之所以重要，是因为 OpenAI 正把推理延迟、功耗和供应链当作产品战略来经营，而不只是数据中心的基建问题。

---

## [Claude 故障是在测试依赖关系](https://markhuang.ai/zh/news/claude-outage-dependency-test)

2026-06-23

这次 Claude 状态页事件之所以重要，是因为 AI 编程工具已经从可选助手变成了工作流依赖。

---

## [OCR 的新战场是耐力](https://markhuang.ai/zh/news/unlimited-ocr-endurance)

2026-06-23

百度开源 Unlimited-OCR 的重点，不只是 OCR 又热了，而是它把长文档解析当成真正的考题。

---

## [NVIDIA Halos 把自动驾驶安全推成平台问题](https://markhuang.ai/zh/news/nvidia-halos-safety-platform)

2026-06-23

NVIDIA 的 Halos 页面之所以重要，是因为它把自动驾驶安全放进训练、仿真、部署、操作系统、检查认证和生态证据的整套链路里。

---

## [AI 破坏了招聘信号](https://markhuang.ai/zh/news/ai-broke-the-hiring-signal)

2026-06-21

HBR 对 AI 润色简历和远程面试表现的警告，指向了一个更大的招聘问题：旧信号本来就太容易被包装和操纵。
