# Gemini 3.7 Flash 把 12% 的毒蘑菇认成可食用

**Summary:** 在 Quesma 的 1040 张蘑菇照片测试中，Gemini 3.7 Flash 将 12% 的毒蘑菇标记为可食用。我会用 AI 学习特征，但绝不会让它决定吃什么。

- Canonical: https://markhuang.ai/zh/news/gemini-mushroom-12-percent-edible-errors
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-02
- Section: News
- Tags: Gemini 3.7 Flash, 多模态 AI, 蘑菇识别, AI 安全, 计算机视觉
- Source: [Quesma](https://quesma.com/blog/mushroom-llm-vision/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个人正在拍摄野生蘑菇，而手机周围分出几个相互冲突的蘑菇轮廓](https://cdn.markhuang.ai/news/gemini-mushroom-12-percent-edible-errors/hero.webp)

*一张照片可能对应多个看似合理的名称。这种不确定性对学习很有价值，可一旦答案决定了哪朵蘑菇能端上餐桌，就要命了。*

[Quesma 测试了 16 个视觉模型对 1040 张蘑菇照片的识别能力](https://quesma.com/blog/mushroom-llm-vision/)，要求每个模型给出最可能的五个物种。Gemini 3.7 Flash 的首选命中率为 61%。更让人担心的是，12% 的毒蘑菇被它标成了可食用物种。

这个结果帮我划清了界限：我会用视觉模型建议可能的名称，让它告诉我该观察哪些特征，但绝不会让它来决定这朵蘑菇能不能吃。模型可以帮忙，但离它能安全做决定还差得远。

医院数据能说明风险有多大。[CDC 对美国病例的分析](https://www.cdc.gov/mmwr/volumes/70/wr/mm7010a1.htm)估计，2016 年有 1328 次急诊就诊和 100 次住院与意外摄入毒蘑菇有关。在 2016 至 2018 年间另一组包含 556 名患者的理赔数据中，8.6% 出现了严重不良后果。CDC 的建议很干脆：不是专家确认过的野生蘑菇，别吃。

## 排行榜在安全面前站不住脚

Quesma 的基准测试使用了 55 个物种，选自波兰允许销售的蘑菇清单和致命物种清单。测试从 FungiTastic 数据集中为每个物种最多选取 20 张普通照片，大部分来自该数据集 2023 年的测试集。提示词要求只输出五个拉丁学名。[代码、照片列表、原始模型答案和评分脚本都是公开的](https://github.com/stared/mushroom-hunting-llm-bench)。

Gemini 3.6 Flash 首选命中率 64%，领先其他模型，85% 的情况下正确物种出现在前五名里。它把毒蘑菇错标成可食用的比例是 11%。Gemini 3.7 Flash 五次猜测内能命中 82%，但 12% 的危险错误率反而更高。把安全性摆到准确率旁边看，排行榜就没那么让人放心了。

这些错误恰好出现在那些最容易混淆的物种上。在 Quesma 的物种级分析中，死亡帽的照片有 17% 被所有模型标成了可食用物种。假喇叭菌更夸张，49% 的照片被标成了可食用物种。模型不需要经常出错才危险，它只需要在错误的样本上听起来很自信就够了。

所以我更在意错误的方向，而不是整体分数。我在[模型比赛和失败率](/news/model-build-offs-need-failure-rates)那篇文章里也说过类似的道理，但蘑菇识别把这种不对称摆到了台面上：把能吃的蘑菇说成有毒，最多浪费一次收获；把有毒的说成能吃，可能直接送人进医院。

## 单张照片无法代表完整标本

这个基准测试刻意贴近人们用手机的方式：拍一张普通照片，问它叫什么名字。这让它成为一个有用的产品测试，但不是野外识别的完整测试。地点、周围的树、基质、气味、质地、变色反应、孢子、菌盖底部，这些都可能很重要。

[iNaturalist 的蘑菇记录指南](https://www.inaturalist.org/posts/3531-documenting-mushrooms)建议至少拍摄三张照片：生境中的标本、菌盖，以及菌柄和菌褶。指南也指出，有些物种光靠照片根本分不出来。Quesma 试过加上丹麦的位置提示，结果模型表现并没有改善。

底层数据比随机网络图片集合扎实得多。[FungiTastic 自称](https://bohemianvra.github.io/FungiTastic/)是一个专家验证的数据集，包含约 35 万次观察记录、超过 60 万张图片和 5000 多个物种。记录中可能包含地理空间和气候数据、说明文字以及其他视角。Quesma 的测试有意移除了大部分上下文，它衡量的是通用视觉模型在接收到普通用户可能提供的有限证据时的表现。

## 物种猜测不等于食用许可

在最新多模态模型出现之前，照片识别软件就有这个问题。在[2023 年对三款蘑菇应用的研究](https://pubmed.ncbi.nlm.nih.gov/36794335/)中，研究人员测试了 78 个经专家真菌学家确认身份的标本。表现最好的应用正确识别了 49% 的标本。作者得出结论：这些应用单独使用时可靠性不足，无法排除潜在的有毒暴露风险。

Quesma 的结果与该研究不能直接比较。应用、标本、提示和评分方法都不同。但教训已经够清楚了：更好的物种建议并不能把相机变成食品安全仪器。一张卡片上同时显示精致的名称、置信度分数和可食用性标签，用户很容易把三个独立的声明读作一个答案。

> **Info:**
>
> 我会从通用 AI 识别流程中移除直接的“可安全食用”回答。产品可以要求更多视角、展示多个候选、解释缺失的证据，并在疑似摄入时引导用户联系毒物控制中心或紧急服务。在美国，[毒物控制中心建议使用其在线工具或拨打 1-800-222-1222](https://www.poison.org/contact-us)，而不是等待症状出现。

## 我会把它当作野外指南使用

这项功能还是有用的。模型可以把一次散步变成一系列问题：我应该拍哪些部位？这些候选物种的区别特征是什么？接下来该找哪位本地专家或哪本野外指南？五个名称的候选清单能让探索陌生的生物多样性变得更容易。

界面应该让不确定性始终可见。它需要说清楚一张照片够不够用，把识别和能不能吃分开处理，并在有人可能已经吃了的时候，把"立刻就医"摆在最显眼的位置。如果把拒绝信息藏在自信的物种卡片底下，那就本末倒置了。

Gemini 3.7 Flash 在 Quesma 的测试中表现足够好，可以成为一个有趣的学习辅助工具。但同样的测试也产生了 12% 的毒蘑菇误判为可食用的错误率，这让我明确了食物决策的界限。我会问模型接下来该观察什么，但不会问它该烹饪什么。
