1. 谷歌Deep Think的推理暴力美学
1.1 ARC-AGI-2测试的突破性表现
84.6%的正确率在AI领域意味着什么?要知道人类在这个测试中的平均正确率只有60%左右。ARC-AGI-2测试的特殊之处在于,它不考察模型记住了多少知识,而是测试模型从有限示例中归纳规则的能力——这正是人类智能的核心特征之一。
我仔细研究了ARC Prize官方的测试方法,发现这个测试特别设计了"对抗性"题目,专门针对当前AI系统的弱点。比如有一类题目会给模型展示几个数字序列的例子,然后要求预测下一个数字。人类可以轻松发现"质数序列"或"斐波那契数列"这类模式,但对AI来说却是巨大挑战。
1.2 Deep Think模式的技术原理
Deep Think不是新模型,而是Gemini 3的一种特殊推理模式。它的核心思想是让模型"慢思考"——通过多轮推理和并行假设探索来逼近最优解。这让我想起人类认知心理学中的双系统理论:系统一是快速直觉反应,系统二是缓慢理性思考。
从技术实现看,Deep Think可能采用了以下几种关键技术:
- 假设树探索:模型会生成多个可能的解题路径,并行评估
- 反思机制:对初步答案进行多轮验证和修正
- 不确定性量化:对每个推理步骤都计算置信度
1.3 跨领域能力验证
谷歌展示的案例中,最让我印象深刻的是数学论文审核的例子。罗格斯大学的数学家Lisa Carbone使用Deep Think发现了一个人类评审都忽略的逻辑漏洞。这说明了几个关键点:
- 模型已经具备专业领域的深度理解能力
- 可以识别人类专家都难以发现的微妙错误
- 在数学这种需要严格逻辑的领域表现出色
另一个3D打印案例展示了模型的空间推理能力:从2D草图到3D模型的转换需要理解几何结构和空间关系,这曾是AI的短板。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. OpenAI的速度革命
2.1 Codex-Spark的技术定位
OpenAI选择了一条与谷歌截然不同的道路:不追求最高准确率,而是优化响应速度。Codex-Spark的定位非常明确——实时编程辅助。每秒1000+token的处理速度意味着:
- 代码补全几乎实时显示
- 长代码段的生成等待时间大幅缩短
- 交互式编程体验接近人类配对编程
