# Fable 5.1 重建联合广场，却把“翻车现场”留在了 Git 里

**Summary:** Fable 5.1 用 453 个 OSM 建筑轮廓重建了联合广场，并公布了 QA 评分和已知缺陷。比起走马观花的演示，我更信服它留下的完整审核痕迹。

- Canonical: https://markhuang.ai/zh/news/fable-51-union-square-misses-in-git
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-02
- Section: News
- Tags: Claude Fable 5.1, AI 智能体, 数字孪生
- Source: [PhiloLabs on GitHub](https://github.com/PhiloLabs/fable51-worlds)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![重建后的联合广场在完工街区、线框几何、点云与相机视锥之间切换](https://cdn.markhuang.ai/news/fable-51-union-square-misses-in-git/hero.webp)

*联合广场中心看起来已经完工，周围的线框和相机视角则揭示了重建背后的校验过程。*

[fable51-worlds 仓库](https://github.com/PhiloLabs/fable51-worlds)展示了一个旧金山联合广场的浏览器端重建项目，据称从调研、建模到校验的全流程都由 Claude Fable 5.1 智能体群完成。场景加载了 453 个 OpenStreetMap 建筑轮廓、220 个模拟行人，跑的是一个再普通不过的 Three.js 应用。

看完 59 秒的演示视频，我转而打开审核文件，这才真正来了兴趣。仓库里有 34 个对应实拍角度的视点、147 张对比图和九份评审智能体报告。项目自己的最终报告给视觉保真度、街道细节和材质分别打了 6/10。比起一个打磨精美的智能体演示，这些坦诚的自评反而让我更有东西可写。

这些分数本身并不能独立证明重建的准确性。但这个仓库提供了一种更窄、却也更可信的东西：一个完整的成果，连同它的输入、校验过程和未解决的缺陷，全部开放供人审查。

## 证据远比演示本身厚实

项目覆盖联合广场周围大约 800×720 米的区域。README 列出了 75 份手工编写的立面规范、129 个已识别的店铺、109 辆车、两个可探索的室内空间和 23 个交互对象。整个场景在运行时由数据和生成资产拼装而成，并不依赖专有的 3D 瓦片。

这些数字很容易拿来给模型能力讲故事。Anthropic 把 [Fable 5.1](https://www.anthropic.com/claude/fable) 定位在长周期编码、多日自主运行、自写测试和视觉校验这些场景上，而这个仓库就是把这套说辞扔进了一项复杂的真实任务：调研一个真实地点，把混杂的信息源变成代码和资产，搭出一个可交互的世界，再拿结果和照片逐项比对。

QA 机制就摆在产出旁边。Playwright 抓取固定视角的截图，另一个脚本把渲染图和参考照片并排叠加到 50%，报告里则如实记录仍然存在的差距。读者一看就明白，为什么团队会给一个看上去相当不错的场景在多个维度只打 6/10。

## 评审智能体仍在实验内部

README 称这九个评审智能体是独立的，分别扮演建筑师、地理学家、技术美术师和交互评审等角色。不同角色确实能抓住不同类型的缺陷。报告提到，这些评审发现了向内翻卷的立面墙体、一个被拉伸成 28 米实体方块的交通站轮廓、镜像对称的街道标线，以及被放置在建筑内部或道路中间的参考相机。项目方表示这些问题都已修复，并通过截图完成了复查。

但我仍然会对“独立”这个词划一道界限。仓库里描述的评审智能体都属于同一个项目工作流，这些分数也不是以第三方审计的身份呈现的。角色提示词可以分散注意力，但无法自动分散训练中的假设，也无法证明评分标准就符合一位旧金山建筑师、无障碍专家或日常行人的评判方式。

我在之前那篇[跨模型多智能体集成智能](https://markhuang.ai/blog/cross-family-multi-ai-science-of-ensemble-intelligence)的文章里就说过，多个智能体哪怕看起来在互相辩论，也可能共享同一套盲点。Fable51-worlds 用外部照片和地理空间数据来交叉比对渲染结果，算是部分弥补了这个问题。但外部评审做的事情本质上不一样。

## 开放数据提供了坐标，而非一座完整的城市

数据源的选择合理且可追溯。几何信息来自 OpenStreetMap，高程数据来自 USGS 3DEP，店铺门面和视觉参考则依托公共记录和免费授权的照片。[OpenStreetMap 的许可页面](https://www.openstreetmap.org/copyright)说明其社区数据在 ODbL 许可下可用，需署名并相同方式共享。仓库记录了照片来源，但没有重新分发参考图像。

这些数据源能锚定街道网格和建筑轮廓，但无法确定每一面立面、每家店铺租户、每个室内布局或街道行为。项目自己的[差异清单](https://github.com/PhiloLabs/fable51-worlds/blob/main/union-square-sf/qa/discrepancies.md)提到，部分建筑细节是近似处理的，程序化纹理在近距离观看时会重复。行人不会走进商店，公交车也不会在站台停靠。一些店铺仍未解决，用了空白的门楣，而不是编造一个假身份。

我很欣赏最后这个选择。一个中性的空白，虽然不如一个看似合理的伪造品那么有电影感，但它将缺失的证据与生成的细节清晰地区分开来。对一个真实地点的重建来说，这种界限是必要的。

> **Info:**
>
> [最终 QA 报告](https://github.com/PhiloLabs/fable51-worlds/blob/main/union-square-sf/FINAL_QA_REPORT.md)指出，其分类分数是未经调整的评审智能体原始结果，并非为了达到项目目标门槛而提高的分数。它们可作为项目自身验收记录的参考，而非 Fable 5.1 的外部基准。

## 那份“失败清单”才是我想复制的部分

大多数模型展示都把工作压缩成一个提示词和一张成品截图。输出看起来很神奇，错误的代价却变得难以估量。这个仓库则把研究过程、置信度、抓取脚本、对比图、评审报告、性能数据和已知缺陷全部摊开。开发者无需先逆向工程整个实验，就能对结果提出异议。

在将其称为一个可靠的数字孪生之前，我仍然希望看到人类领域专家的评审。我也想知道成本、消耗的智能体会话时间、人工干预、失败的分支，以及每个评审角色所使用的具体模型和框架。这些信息的缺失，使得很难将此构建与一支熟练的人类团队或其他智能体系统进行比较。

但该项目已经做出了一个我愿意复制的决定：它将不确定性与工件一同存储。如果智能体群要构建需要数天时间的视觉系统，那么交付物就应该说明哪些部分经过了检查，哪些部分失败了，哪些部分仍是近似的，以及哪些主张是外部人员可以复现的。Fable 5.1 的联合广场雄心勃勃。正因为它把“翻车现场”留在了 Git 里，我才更相信它那些更窄的声明。
