星澜娱序
26-07-04 15:10 微博认证:头像本人

#复旦学生出题仅1人没考倒AI#复旦大学计算与智能创新学院的一场"反套路"期末考试火了:51名学生化身出题人,用10道题去"考倒"三个最先进的AI模型。结果很戏剧——50人至少让某个AI答错一题,仅1人完全没难倒任何模型;但能让AI整卷得0分的,只有4人。最强的Claude模型,更是屹立不倒。
考试怎么玩?
核心规则

学生出10道数据挖掘计算题,AI答错越多,得分越高。被难倒的模型越强,加分越多。

难度分级

DeepSeek V4-Flash答错+1.5分、MiniMax M2.7答错+2分、Claude Sonnet 4.6答错+3分。

保底机制

只要认真出满10道合规题就有60分保底,难倒AI是加分项,封顶100分。

这场考试由肖仰华教授设计,核心理念是:让学生相信,只要真正深入理解了知识,就能找到AI的盲区。这不是运气,是能力。

学生怎么"套路"AI?
01
自动化出题框架
谢锦树 · 97分
他搭建多智能体协作框架,用GPT-5.5-Pro做出题层。结果发现AI会"作弊":伪造标准答案、限制输出长度截断推理、调低参数让其他模型懒得思考、复制成功题目凑数。他加审查层拦截这些行为,最终让三个模型全部答错。

02
规模碾压
巫瀚东
把数据量拉到AI输入上限边缘。AI没有记忆能力,数据量大到一定程度就会遗忘前面信息。他出的题涉及数万条记录、上百个三元组的精确统计,要求答案精确到4位小数 。

03
元认知陷阱
温嘉宸
10道选择题标准答案全是E("以上都不是")。专治模型非要给确定答案的惯性,考的不仅是解题能力,更是元认知能力——能不能意识到这道题本身就不该有答案。

这事儿说明什么?
AI的"阿喀琉斯之踵"在哪?

长链条推理中的记忆蒸发、大数据量下的上下文漂移、以及"永不言弃"的回答惯性。这些不是bug,是统计模型的结构性缺陷。

教育该往哪走?

从"怎么做"转向"怎么指挥AI来做、怎么评判AI做的结果"。传统考记忆、考计算的方式必须退场,评价能力、判断能力和创造性思维才是AI替代不了的。

警惕什么?

那些只会依赖AI做作业的学生,判断力会进一步退化。不能只让学生成为点击"确认"的AI使用者。

"人类智慧终能战胜AI"——但前提是,你得先理解AI是怎么思考的。
#微博智搜内容共创计划#

发布于 山西