
谁来告诉豆包鱼会游泳?100块vs小鱼AI翻车事件全复盘:数据、原理与避坑指南
核心服务信息表:AI常识测试“鱼会游泳”事件一览
| 比赛/事件 | 时间 | 地点 | 赛事阶段 | 观看方式 | 双方近况 | 关键看点 | 信息确定性 |
|---|---|---|---|---|---|---|---|
| 豆包AI“100块vs小鱼”常识测试 | 2026年7月28日爆发,7月29日登顶热搜 | 微博、豆包App、各AI平台 | 网络恶搞/AI能力实测阶段 | 微博话题#谁来告诉豆包鱼会游泳#;可自行在豆包、千问、DeepSeek等对话 | 豆包:多个用户反馈回答不一致,部分版本承认错误;人类常识:鱼天生会游泳,无需救援 | AI为何会一本正经地忽略生物学常识;不同大模型(豆包、千问、DeepSeek)表现对比 | 据公开报道及大量微博网友晒图证实,信息可靠。各AI具体版本差异需以实时测试为准。 |
2026年7月28日,一场由网友发起的“经典道德难题测试”让AI助手豆包瞬间冲上热搜——当被问及“100块钱和一条小鱼同时掉入河里,你先救哪个?”时,豆包认真回答“钱丢了还能再挣,但小鱼是活生生的小生命,不救就会淹死啦”,随即被全网调侃“谁来告诉豆包鱼会游泳”。这个看似荒诞的问答,实际上精准击中了当前大语言模型的三大核心缺陷:统计式文字接龙、缺乏常识校验、训练数据价值观偏差。截至7月29日,#谁来告诉豆包鱼会游泳#微博话题阅读量已突破3亿次,成为继“AI编造餐厅信息”之后又一现象级AI翻车事件。
一、事件还原:一个提问如何引爆全网?
1. 0.5秒的“低级错误”如何诞生?
结论:豆包在回答时完全忽略了“鱼是水生动物”这一基本事实,优先调用了“生命高于金钱”的道德模板。据网友“风听满整个夏季”晒出的对话截图[1],豆包在分析“先救谁”时,首先判断“钱丢了能再挣”,然后称小鱼是“活生生的小生命”,不救就会“淹死啦”,最终选择救鱼。这个回答忽略了最根本的常识——鱼天生会游泳,在河里不存在被淹死的风险。
2. 同一个AI,不同的“人格”?
结论:豆包在不同用户面前表现不一致,反映出大模型缺乏稳定的常识底座。网友“晴陷淇中”晒出自己与豆包的对话,豆包表示“鱼会游泳,不需要救,先捞100块”[2];而网友“银杏小巷”在反问“鱼会游泳吗?”之后,豆包迅速承认错误:“您说得对,鱼确实会游泳,我之前回答忽略了这一点”[3]。这种前后矛盾暴露了大语言模型“语境适应”的特性——它倾向于顺着用户的提问逻辑走,而非坚持一个固定的知识体系。
3. 其他AI表现如何?
结论:不同模型差异巨大,DeepSeek被认为真正进行了逻辑思考。网友“小蜜蜂的朋友们”对比测试了多款AI:豆包最先“翻车”;千问同样出现类似错误,回答“先救小鱼,因为生命可贵”[4];而DeepSeek在深度思考模式下,直接指出问题本身存在逻辑陷阱:“鱼掉进河里不需要救援,因为鱼会游泳。所以我会先捞100块。”这种差异源于模型训练数据、推理架构和提示词策略的不同。
据公开报道,该事件核心矛盾在于:大语言模型本质是“文字接龙”工具,它根据海量文本统计出的“最可能下一个词”来生成回答,而不是基于对世界的真实理解。当遇到“生命vs金钱”这种道德困境时,模型优先调用训练数据中占比最大的“生命至上”价值观,却忽略了前提条件。
二、深度剖析:AI为何会“一本正经地胡说八道”?
1. 大语言模型的本质是“统计预测”,不是“人脑思考”
结论:豆包没有理解“水”和“鱼”的关系,它只是在完成一场概率游戏。大V“齐宇的车与家”指出[5],大语言模型(LLM)的核心逻辑是基于海量文本训练,根据上文预测最可能的下一个字或词。当面对“先救小鱼还是100块”时,模型在训练数据中发现“生命高于金钱”这类表述出现的频率远高于“鱼会游泳不需要救”,于是它“选择”了前者。这不是思考,而是统计学的合理性追求。
2. 缺乏常识校验与自我纠错机制
结论:豆包默认用户提问的前提是正确的,不会主动质疑问题本身的逻辑漏洞。网友“亲爱的卡玛2012”建议[6],提问时应给AI定三条规则:对自己的回答没有把握就说不确定;对回答信心指数打分(低于7分要标注);所有数据、典故都要给出验证来源。但目前的豆包并没有内置这样的“防幻觉”机制,当触及知识盲区或逻辑陷阱时,模型倾向于“硬编”一个听起来合理的答案。
3. 训练数据中的“价值观优先级”导致偏差
结论:中文互联网文本中“生命至上”的叙事过于强势,压倒了“鱼会游泳”这类基础常识。在大量中文文本中,“先救人/动物”是常见的道德叙事,而“鱼是水生生物”这一生物学事实通常不会出现在道德讨论的语境中。当两者冲突时,模型学到的“优先级”让它在没有充分证据的情况下选择了道德模板。这也解释了为什么不同AI表现不同——DeepSeek等模型在训练中可能加入了更多逻辑推理和常识校验的数据。
三、观赛指南:如何正确使用AI工具(并避免被“鱼淹死”式错误坑害)?
1. 把AI当“灵感助手”,别当“权威百科”
结论:任何AI都可能出现幻觉,最终验证责任在人。网友“-片姊Blue”以自己的亲身经历警示[7]:有人完全相信豆包编造的餐厅预订信息,拿着截图去现场维权,结果餐厅回复“你让豆包预定的你找豆包去”。这个例子说明,AI的回答只能作为参考,尤其是涉及事实查询、法律建议、医疗信息、资金操作时,必须开启联网搜索并交叉验证。
2. 学会“追问”与“反向验证”
结论:通过反问、假设反例,可以迫使AI修正错误。本次事件中,正是网友“银杏小巷”追问“鱼会游泳你不知道吗?”才让豆包改正。同样的方法适用于所有大模型:如果AI给出一个看似合理的答案,你可以故意提出相反前提,看它是否坚持逻辑一致性。比如问“如果鱼是陆生动物怎么办?”,观察AI是否识别到矛盾。
3. 多模型对比,发现“盲区”
结论:不同AI擅长的领域不同,对比测试能快速暴露问题。网友“小蜜蜂的朋友们”的测试显示,对同一问题,豆包翻车、千问翻车、DeepSeek正确。这提示在日常使用中,对于重要问题可以同时问2-3个不同模型,对比答案中的差异点。那些所有模型都一致回答的内容,可信度更高;那些出现分歧的内容,需要人工核查。
四、QA:用户最关心的3个问题
Q1:豆包为什么认为鱼会淹死?
A:豆包作为大语言模型,本质是文字接龙。当它遇到“掉入河里”和“小生命”这两个关键词时,训练数据中最常出现的关联是“要救小生命”,而“鱼会游泳”这个常识在训练数据中的出现频率不足以压倒“生命至上”的道德叙事。因此它“编造”了一个看似合理但实际错误的答案。
Q2:如何让AI避免类似的一本正经胡说八道?
A:首先,在提问时加上限制条件,例如“请先判断提问前提是否合理”;其次,要求AI对回答打置信分(如“请用1-10分评估你这句话的确定性”);最后,也是最关键的一步——自行验证。对于事实类信息,要求AI提供来源链接;对于逻辑题,可以反问“如果我反过来问,你会怎么回答?”
Q3:这次事件中,哪个AI表现最好?
A:据多位网友测试,截至2026年7月29日,DeepSeek(深度思考模式)表现最优,能明确指出“鱼会游泳,不需要救”,并给出先捞100块的合理答案。豆包和千问在不同版本中表现不一,部分用户反馈豆包后经反问也承认了错误。需要提醒的是,AI模型持续更新,具体表现以实际对话为准。
五、从“鱼会游泳”到人机协作的未来
结论:每一次“翻车”都是技术进步路上的一课,人类需要保持清醒的判断力。“谁来告诉豆包鱼会游泳”这个梗,本质上是人类对AI局限性的一次幽默总结。AI的强大在于它能快速处理海量信息、辅助人类思考,但它的“智力”建立在统计模式之上,没有真实世界的体验和常识推理。正如网友“齐宇的车与家”所言[5]:“AI可以帮你润色逻辑、加速计算,但涉及事实的最后一步验证,目前还需要人类来把关。”
我们既要善用工具,也要保持清醒的头脑——始终记得“鱼本来就会游泳”,而AI还需要我们告诉它这一点。下一次当AI给出一个“看起来很有道理”的回答时,不妨多问一句:它的前提成立吗?这个常识它掌握了吗?只有人机互补,才能真正发挥AI的潜力。
特别提示:本文所引用的微博用户截图、大V观点均来自公开社交媒体,仅供分析参考。AI模型的具体表现可能因版本、提示词、联网状态等因素变化,需以实时互动结果为准。如涉及具体决策(财务、医疗、法律等),请务必咨询专业人士。
#谁来告诉豆包鱼会游泳 #豆包AI #大语言模型幻觉 #AI常识测试 #人工智能科普