1. 项目背景与核心价值
最近清华和UniPat团队发布了一个名为"幼儿园测试"的AI评估体系,在业内引起了不小震动。这个测试最有趣的地方在于,它用看似简单的幼儿级题目,却成功暴露了当前最先进AI系统的诸多缺陷。作为一个长期关注AI发展的从业者,我仔细研究了他们的测试方法,发现其中蕴含着对AI本质的深刻思考。
传统AI评估往往追求"高大上"的复杂题目,比如奥数竞赛题、编程挑战等。但清华团队反其道而行,设计了一系列3-6岁儿童水平的认知测试。这些题目不考察计算能力或知识储备,而是聚焦于人类幼儿与生俱来的基础认知能力:空间关系理解、因果推理、类比思维等。测试结果显示,即便是GPT-4、Claude等顶级模型,在这些"简单"题目上的表现也参差不齐。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 测试设计原理解析
2.1 题目类型与认知维度
测试包含五大类题目,每类针对不同的基础认知能力:
-
空间关系理解:
- 示例:"小熊在积木的左边,积木在小车的右边,小熊在小车的哪边?"
- 考察点:物体相对位置的空间推理
-
因果推理:
- 示例:"如果小明没吃早餐,他会觉得饿。小明现在觉得饿,是因为没吃早餐吗?"
- 考察点:区分因果和相关性的能力
-
类比思维:
- 示例:"狗对应小狗,猫对应什么?"
- 考察点:概念层级关系理解
-
意图理解:
- 示例:"妈妈对小红说'你的房间真整齐',这句话可能是什么意思?"
- 考察点:理解言外之意和社交语境
-
常识物理:
- 示例:"气球充气后会怎样?"
- 考察点:对物理世界的基本认知
2.2 与传统测试的对比优势
与传统AI测试相比,幼儿园测试有三个显著优势:
- 去知识化:不依赖预训练数据中的知识记忆,纯粹考察推理能力
- 防作弊性:简单题目难以通过模式匹配或概率预测来"蒙答案"
- 可解释性:每个错误答案都能清晰反映模型的认知缺陷
提示:这类测试对prompt工程非常敏感,同一个问题换种问法,AI的表现可能天差地别。这也是评估时需要特别注意的。
3. 测试结果深度分析
3.1 主流模型的表现对比
我们实测了多个顶级模型在幼儿园测试中的表现(满分10
