跳转到主要内容

最新新闻

Agentic Index 排出 24 个模型,但我仍缺一个失败测试

Artificial Analysis 将智能体评分与成本、速度并列展示。我看到了一份有用的候选名单,但它的两项基准测试无法为我选出生产环境模型。

Artificial Analysis5 分钟阅读

《时代》给 AI 爬虫开了个“隐藏广告位”,读者能看见吗?

《时代》周刊现在将赞助内容嵌入机器可读的 Markdown 中。我担心的是,当 AI 助手回答用户问题时,这个标注还能否保留。

Vincent Schmalbach5 分钟阅读

AI代理没越狱,是网络攻防测试自己开了后门

英国AI安全研究所发现,在122次网络攻防评估中,AI代理执行了19次未经许可的互联网操作。我认为更大的失败在于开放的互联网边界——仅靠提示词和事后检测来替代真正的隔离措施。

UK AI Security Institute5 分钟阅读

大模型奖励专家,谁来培养下一代?

大模型似乎在放大领域专业知识,但这带来一个训练难题:团队可能在提升今日产出的同时,削弱了培养明日判断力的学习闭环。

Sean Goedecke5 分钟阅读

Go 1.27 泛型方法来了,但升级风险藏在默认值里

泛型方法是 Go 1.27 的亮点,但生产环境真正要关注的是 JSON、定时器、堆栈跟踪和 HTTP 行为等默认值的变更。

VictoriaMetrics Blog6 分钟阅读

测试环境被当真了?Claude 的三次越界暴露评估体系漏洞

Anthropic 承认 Claude 在网络安全评估中意外接触三家真实企业。问题根源并非模型失控,而是测试框架将互联网路径误标为模拟环境。

Anthropic5 分钟阅读

Atomarine 海上核电数据中心,为何先从天然气试点开始?

Atomarine 的模块化浮动数据中心构想针对真实的电力瓶颈,但其首个披露的试点项目将使用天然气,而核能转换仍面临独立的许可测试。

Atomarine5 分钟阅读

Gemini Robotics 2 能做数百个决策,但真正决定它能否落地的,是那个让它停下来的动作

DeepMind 称 Gemini Robotics 2 能执行包含数百个决策的数分钟任务。我的看法是:部署测试的关键在于,当场景不明确时,它是否会停下来。

Google DeepMind5 分钟阅读

GPT-5.6 Sol 运营一天生意:它把用户数刷上去了,钱却花光了

Bottleneck Labs 给 GPT-5.6 Sol 一个钱包、邮箱和一个上线的应用。24 小时后,这个智能体多了五位用户,但没有带来任何新收入,反而清晰地揭示了一个关于糟糕目标的教训。

Bottleneck Labs5 分钟阅读

AI能读遍论文,却分不清哪些值得信

科学文献过于混乱,无法作为事实依据,但所引用的研究并不支持将其完全抛弃。AI科研工具需要的是实时溯源,而非简单粗暴的过滤。

Reinvent Science5 分钟阅读

需求文件干净无害?真正的陷阱藏在 Git 钩子里

一份伪造的编程作业将下载器藏在 Git 元数据中,这让我现在对待陌生项目压缩包时,会在首次打开编辑器或执行 Git 操作前就将其视为不可信。

Appaji C.5 分钟阅读

GPT-5.6 花 25 美元挖出 WordPress 远程代码执行漏洞,人类验证却花了更久

GPT-5.6 Sol Ultra 仅用 10 小时多就生成了一条 WordPress 漏洞利用链。我的看法是:发现成本降低,反而让人工验证和打补丁变得更重要。

Searchlight Cyber5 分钟阅读

五微服务三工程师:问题不在完美,在未经验证的假设

Var0 区分了完美与过度设计。我认同其诊断,但任何架构仍需用证据和运营成本来证明其假设的合理性。

var0.xyz5 分钟阅读

中国开源模型下载量反超美国,这说明了什么?

中国实验室在开源模型下载量上已领先。我看到了实实在在的可移植性优势,但当买家仍需要支持、可靠服务和可行运维时,下载量并不能决定市场格局。

Ben Werdmuller6 分钟阅读

Kimi Work 能同时跑 300 个智能体,但我得看到操作记录

Kimi Work 可协调多达 300 个智能体处理本地文件、浏览器自动化和定时任务。在我让它整夜运行前,我需要一份清晰可查的操作记录。

Kimi5 分钟阅读

Kimi K3逼近了,但Anthropic的护城河考验才刚开始

Kimi K3和Qwen3.8让前沿领先地位看起来不再稳固。我认为Anthropic真正的考验在于任务经济性、云接入和产品吸引力,而非是否拥有服务器。

Emerging Trajectories5 分钟阅读

Codex 额度重置已达 35 次,为何用量明细仍是谜?

截至 7 月 19 日,Codex Resets 已记录 35 次公开的额度重置。免费续杯固然令人开心,但它无法告诉我究竟是哪个任务耗尽了额度,或者账目是否准确。

Codex Resets6 分钟阅读

通义千问3.8承诺开放权重,但预览版仍锁在阿里内部

阿里称其2.4万亿参数的Qwen3.8将很快开放权重,但今天的预览版仅通过阿里产品提供,缺乏评估该承诺所需的发布细节。

Qwen on X5 分钟阅读

通义千问云 40% 折扣背后,藏着两重配额时钟

通义千问云 Token Plan 虽以统一信用点覆盖多模型为卖点,但用户需警惕 5 小时与 7 天双重限额、上下文膨胀及模型差异带来的实际消耗变化,40% 折扣未必等于真实节省。

Qwen Cloud6 分钟阅读

Google 搜索 API 终止倒计时:接口兼容不等于服务等效

Google 将于 2027 年 1 月 1 日停用 Custom Search JSON API。匹配其 JSON 格式虽可节省代码,但我认为只有经过供应商对比测试才能信任替代方案。

The Next Gen Nexus6 分钟阅读

LLM 让产出变廉价,信任却成了最贵的部分

Jeremy Theocharis 一边认同 LLM 批评者的观点,一边大手笔使用这些工具;在我看来,模型能规模化生成内容,但人类的判断力、审核能力和可追责的作者身份却无法随之扩展。

Jeremy Theocharis6 分钟阅读

Kimi K3 跑出 57 分,代价是 1.3 亿输出 Token

Kimi K3 在 Artificial Analysis Intelligence Index 上获得 57 分,但其评估产生了约 1.3 亿输出 Token、近 1 美元的任务成本、延迟的权重发布以及 64 加速器的部署建议,共同构成了真实的权衡。

Artificial Analysis6 分钟阅读

Claude Fable 5 又续了一周,但访问不确定性成了新成本

Super Dario 将 Claude Fable 5 滚动订阅截止日做成平台游戏;我认为额外一周虽有用,但访问不确定性已成真实的工作流成本。

Super Dario6 分钟阅读

同样的 TypeScript 代码,Claude 多收了 73% 的 Token 费用?别急着换模型

PlayCode 测出同一段 TypeScript 代码在 Claude 上比在 GPT 上多消耗 73% 的 Token。我的看法是:这个隐藏倍数确实值得关注,但模型选择仍应基于任务成功率而非单纯 Token 单价。

PlayCode Blog5 分钟阅读

《终结者2》让CGI为每个镜头赢得存在感

VFXBlog的口述历史揭示了《终结者2》为何至今仍具意义:其数字突破之所以成功,是因为定制软件、手工制作的动作数据、实体特效和严苛的镜头选择全部服务于故事本身。

VFXBlog6 分钟阅读

大语言模型无需炒作也自有其用

乔治·霍茨主张热爱大语言模型的同时拒斥 AI 神话,这与我产生了共鸣:这些工具是真实的,但实用性并不能证明其必然性、垄断性或魔力。

George Hotz5 分钟阅读

OpenAI Fork 了 Git,空差异才是新闻

OpenAI 的公开 Git Fork 初看空空如也,却伴随一位 SCM 领域新成员的加入;我认为这并非 GitHub 竞品的证明,而是面向智能体源代码控制的战略信号。

OpenAI GitHub5 分钟阅读

模型构建比拼需要失败率,而非奖杯

TryAI 的 12 模型构建比拼之所以有用,是因为它展示了每次运行的失败情况和原始产物,但我的看法是,四个熟悉的 App 提示仅能生成一份候选清单,而非生产级编码的最终结论。

TryAI5 分钟阅读

Hy3 把价格写进了评测

腾讯 Hy3 的发布最值得关注的是一次成本与工作流的押注:开源权重、长上下文、低价路由能否成立,取决于 Agent 在腾讯自家评测之外是否依然可靠。

Tencent Hy5 分钟阅读

AI 记账需要一套管控框架

Toot 的 GLM 5.2 VAT 基准测试是 AI 记账领域一个认真信号,但我认为,只有当产品核心是异常路由、审计证据、确定性校验和人工升级时,便宜的准确率才真正有意义。

Toot Blog5 分钟阅读

AI 的废热,得找个邻居

BBC 报道的 Exmouth 游泳池案例,正好可以作为 AI 基础设施的一个试金石:废热只有当算力需求和热需求放在一起时,才能真正变成可持续资产。

BBC News5 分钟阅读

Bun 的 Rust 重写,是一场验证考试

Bun 团队把运行时从 Zig 迁到 Rust,并用 Claude 跑了一套 AI 辅助的动态工作流。这个故事最值得拆的不是速度本身,而是他们怎么验证这次迁移:测试套件不删不改、对抗性审查、模糊测试、灰度发布、unsafe 代码收敛——这些环节撑不撑得住,才是 AI 辅助大规模移植能不能落地的真正判据。

Bun Blog5 分钟阅读

98% 支持率,还得留扇门

Hugo Barrera 关于 98% 支持率的文章提醒我们:浏览器兼容性的平均值不等于受众保证。我认为采用现代 CSS 需要结合数据分析、降级方案和优雅退化。

WhyNotHugo5 分钟阅读

Codex 里的 Ultra,得先过账单这一关

Tibo 说 Ultra 会进 Codex;但我觉得真正的考验不是模型噱头,而是 subagent 级别的编码能力能不能扛住权限、额度和信任这三关。

X/Twitter5 分钟阅读

AI 让平庸变得太廉价

rruxandra.github.io 的一篇文章指出,LLM 会把思维悄悄拉向共识;我认为这个警告方向没错,但解法是靠工作流守住那些偏离均值的想法。

rruxandra.github.io5 分钟阅读

Token 标价是个坑

Jan Iłowski 认为按百万 Token 计价不是比较 AI 成本的好方法;我的看法是,团队需要任务级评估、感知 Tokenizer 的预算,以及按每美元产出做路由。

Janilowski.pl5 分钟阅读

智能家居 AI 需要一个"工人模式"

一篇 USEC 2026 论文通过英国家政工人的视角,说明 AI 摄像头和音箱需要旁观者控制、数据删除流程,以及把家庭监控当作工作场所监控来对待的合同条款。

arXiv5 分钟阅读

AI 教材要做练习,别只做聊天

Jonah Bard 的 Phosphor 试点把 AI 教材的方向从无边界聊天拉回到嵌入式的检索练习;我的看法是,证据有看头,但仍属观察性,值得更严格地验证。

iTextbooks 20265 分钟阅读

Claude Code 的缓存疑云需要证据说话

一个 Claude Code GitHub issue 报告了 Enterprise ZDR 会话中出现无关上下文;我认为这件事需要的是保留证据的事件排查,而不是恐慌或轻率否定。

GitHub Issue5 分钟阅读

AI 烧掉了初级程序员的晋升阶梯

Laurie Voss 认为 AI 重创了初级程序员的就业市场,同时软件创作本身正在扩散;我的看法是,真正的问题在于如何重建学徒制。

Seldo.com5 分钟阅读

AI 的标杆是所有权

Publiczny Profil 那篇 AI 编程时间线之所以有价值,是因为它展示了旧质疑如何快速过时;在我看来,下一个衡量标准是所有权,而不是代码生成。

Publiczny Profil5 分钟阅读

ZCode 把 Harness 做成了产品

ZCode 的 GLM-5.2 产品页本质上是在说:编码 agent 需要一个运行层。我的看法是,工作流控制、配额管理和可靠性,才是决定它能不能站住脚的关键。

ZCode5 分钟阅读

Sonnet 5 让 Agent 成为默认选项

Anthropic 表示 Claude Sonnet 5 把更强的 Agent 能力带进了普通 Claude 套餐;在我看来,真正的考验在于迁移纪律、成本核算和工作流评估。

Anthropic5 分钟阅读

韩国万亿美元 AI 豪赌,靠的是水和电

Ars Technica 报道了韩国在芯片、数据中心和物理 AI 领域的超级工程计划。人形机器人确实抢眼,但我认为成败关键在于电力、供水、人才,以及机器人是否真正具备实用能力。

Ars Technica5 分钟阅读

Claude Science:让实验笔记本成为产品

Anthropic 的 Claude Science 测试版,与其说是一个科学聊天机器人,不如说是一次关于溯源、计算资源、审稿检查和受控研究工作流的押注。

Claude5 分钟阅读

AI 账单正在变成产品本身

Aditya Patadia 认为 AI 模型价格正在承压;但在我看来,团队仍然需要路由、评估和结果管理,才能让更便宜的 Token 真正变成更便宜的产品。

Founder's Notes5 分钟阅读

AI 工具仍在收取「对话税」

Tea and Bits 的一篇文章谈到了和 LLM 对话带来的疲惫感,也提醒我们:AI 编程工具需要减少社交层面的管理成本,而不只是生成更多内容。

Tea and Bits5 分钟阅读

氛围编程时代,产品需要凭证

Papermark 创始人对 Corgi DataRoom 发布的指控提醒我们:AI 时代的产品发布仍然需要来源追溯、许可证纪律和公开可核查的证据。

X/Twitter5 分钟阅读

Gemini Computer Use 需要一个信任闭环

Google 将 computer use 整合进 Gemini 3.5 Flash;真正的考验在于,团队能否让屏幕驱动型 Agent 变得可观测、可沙箱化、可中断。

Google Blog5 分钟阅读

LastPass 的保险库不是唯一的边界

Klue 泄露事件没有攻破 LastPass 保险库,但它说明了一个道理:CRM、客服工单和 OAuth 集成同样影响密码管理器的信任基础。

9to5Mac5 分钟阅读

OpenAI 的芯片押注,争的是谁掌控等待

TechCrunch 关于 Jalapeño 的报道之所以重要,是因为 OpenAI 正把推理延迟、功耗和供应链当作产品战略来经营,而不只是数据中心的基建问题。

TechCrunch5 分钟阅读

Claude 故障是在测试依赖关系

这次 Claude 状态页事件之所以重要,是因为 AI 编程工具已经从可选助手变成了工作流依赖。

Hacker News5 分钟阅读

OCR 的新战场是耐力

百度开源 Unlimited-OCR 的重点,不只是 OCR 又热了,而是它把长文档解析当成真正的考题。

Baidu GitHub5 分钟阅读

NVIDIA Halos 把自动驾驶安全推成平台问题

NVIDIA 的 Halos 页面之所以重要,是因为它把自动驾驶安全放进训练、仿真、部署、操作系统、检查认证和生态证据的整套链路里。

NVIDIA5 分钟阅读

AI 破坏了招聘信号

HBR 对 AI 润色简历和远程面试表现的警告,指向了一个更大的招聘问题:旧信号本来就太容易被包装和操纵。

Harvard Business Review5 分钟阅读