# AI能读遍论文，却分不清哪些值得信

**Summary:** 科学文献过于混乱，无法作为事实依据，但所引用的研究并不支持将其完全抛弃。AI科研工具需要的是实时溯源，而非简单粗暴的过滤。

- Canonical: https://markhuang.ai/zh/news/ai-literature-trust-problem
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-07-29
- Section: News
- Tags: AI, 科学研究, 研究诚信, 大语言模型, 数据溯源
- Source: [Reinvent Science](https://www.reinvent.science/p/the-scientific-literature-is-poisonous)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![Mark在温暖的图书馆里，将坚固和易碎的研究论文分类摆放，旁边是一台AI阅读机器](https://cdn.markhuang.ai/news/ai-literature-trust-problem/hero.webp)

*多读论文能解决"读不到"的问题，但没法告诉机器哪些结果值得信。*

[Reinvent Science认为科学文献对大语言模型有毒](https://www.reinvent.science/p/the-scientific-literature-is-poisonous)，因为论文里无心的错误、未经证实的假说、选择性报告和学术造假混在一起，外表却都同样光鲜。我同意这个诊断：模型不能把"已发表"等同于"可信"。但我不认为证据支持将文献彻底抛弃。

文章引用的2024年研究训练了28个独立的15亿参数模型，实验本身很认真，但结论比标题暗示的更微妙、也更有用。科学文本不是铁板一块的污染源——不同的文献集合帮到不同的任务，评估方式决定了哪些来源看起来可有可无。

## 快速回答

| 问题                   | 我的看法                                              |
| -------------------- | ------------------------------------------------- |
| 文献干净吗？               | 不干净。论文可能出错、被撤稿、被操纵甚至伪造，发表元数据也定不了可靠性。              |
| 那项研究证明科学论文会毒害大语言模型吗？ | 没有。去掉一个学术分区确实没拉低测试均分，但作者也说了，综合均分最高的模型用了全部或接近全部来源。 |
| AI科研产品该怎么做？          | 把每个结论追溯到原始证据，标出更正和撤稿信息，说清楚为什么收录某个来源。              |
| 该避免什么？               | 用私下的学术八卦或持续监控来替代可审计的证据。                           |

## 实验本身比标题党说的窄得多

[《预训练者的训练数据指南》](https://aclanthology.org/2024.naacl-long.179/)将Pile数据集分为九个领域，每次移除一个领域后测试27个问答数据集。其学术分区包含60GB的arXiv、PhilPapers和NIH ExPorter材料。PubMed则是单独的109GB生物医学分区。

论文图表显示，移除学术分区后某些均分确实提升了，所以Reinvent Science的观察有依据。但作者也指出，综合均分最高的模型用了全部或接近全部来源。移除PubMed会拉低生物医学问答的表现，而移除Common Crawl对学术问答的损害甚至超过了移除学术分区。

论文自己给出了解释：那些问答集根本没考到高级科学和数学期刊里的编程能力或科学严谨性。说白了，考试不考的东西，教它的教材自然显得没用。我不会拿这种错位来给整个科学文献定罪。

![Mark在一把大型黄铜筛子前停顿，筛子同时捕捉到有价值的证据包和易碎的纸片](https://cdn.markhuang.ai/news/ai-literature-trust-problem/blunt-filter.webp)

*语料库级别的过滤太粗暴了——它可能把低质量内容筛掉，也同时抹掉了别的任务需要的专门证据。*

## 信任问题确实存在

Reinvent Science把文献描述成事实、遗漏、错误和不当行为的混合物，这个判断更站得住脚。2026年[《自然》的一项分析](https://www.nature.com/articles/d41586-026-00969-z)指出，数万篇2025年发表的论文可能包含AI生成的无效参考文献。另一项[JMIR研究](https://www.jmir.org/2026/1/e88766)测试了九种免费AI工具处理15篇撤稿文章的能力，没有一种工具能正确处理所有情况。表现最好的工具在15篇文章中有8篇完成了全部五项任务，而三种专注于研究的工具则未能给出任何完全正确的答案。

这并不意味着每篇期刊文章都可疑，但信任确实会随时间变化。撤稿状态可能在模型训练后才更新，一项更正可能削弱某个结论而不使整篇论文失效，一项严谨的研究也可能与用户关心的特定人群或结果无关。

> **Info:**
>
> 我希望研究助理能回答比“哪些论文提到了这个”更难的问题：每篇论文具体支撑了哪个结论、这篇论文有没有被更正或撤稿、有哪些独立证据支持或反驳它。

## 私下八卦不是缺的那块拼图

Reinvent Science说，人类研究者通过对话、实验室互访和学术圈子口耳相传，积累了不少非正式的口碑判断。文章提出的给AI补上这层信息的方案包括：让AI和科学家"社交"、在私下场合录音、或者鼓励科学家之间流传八卦。文章也承认了其中的监控代价。

我觉得到这里就该打住了。非正式知识确实有用，但也夹带地位偏见、个人恩怨，以及当事人无法核实或反驳的说法。再多录一些私人对话，只会制造一堆敏感数据，并不会把口碑变成可靠证据。Reinvent Science唯一一位公开评论者说得更直白：让大语言模型犯糊涂的毛病，同样在困扰试图搞清楚真相的人类科学家。

我更愿意把口耳相传中真正有用的部分变成可查证的记录。把每个结论链接到底层数据集和实验方案，记录复现尝试，在可以公开的时候保留审稿人的意见，查询时同步撤稿和更正信息，让专家附上署名且有明确范围的评估、写清楚自己的推理过程——而不是给一个莫名其妙的"声誉分"。

![Mark和一个小型AI从一张主张卡片追溯彩色线索，回到笔记本、数据、更正和重复实验证据](https://cdn.markhuang.ai/news/ai-literature-trust-problem/evidence-trail.webp)

*真正缺的是一条可查证、可更新、可质疑的证据链——不需要录下任何私人对话。*

## 我的底线

我喜欢这个挑衅性的观点，因为它戳中了AI for Science背后一个偷懒的假设：论文读得越多，科学判断力就越强。事实并非如此。模型可以吞下一个领域的所有文字，却不知道哪个实验改变了学界共识，哪个结果没能复现，哪条引用只是因为大家都在抄前人的参考文献才活到现在。

但“有毒”这个说法太粗糙了。引用的训练研究表明，数据组成和评估设计很关键，并没有证明科学文献有独特的危害性。我会选择为溯源而非纯净度来设计系统：保留论文，呈现从结论到证据的完整链条，检查每个引用的实时状态，让不确定性可见。能读文献的AI仍然需要一种展示自己推理过程的方式。
