1. 项目概述:当大语言模型学会"自己算数"
大语言模型能做奥数题却算不对两位数乘法——这个看似矛盾的现状,正是当前AI领域最令人尴尬的技术瓶颈。2026年3月,Percepta团队在Transformer架构内部"建造"出一台完整计算机的研究成果,彻底改变了这一局面。他们让大模型不依赖任何外部工具就能直接执行C语言程序,这项突破性工作迅速登上Hacker News首页,获得包括AI领域标杆人物Karpathy在内的广泛关注。
这项技术的核心价值在于:它首次证明了大语言模型不仅可以作为统计预测器,还能成为真正的通用计算基底。想象一下,一个既能理解自然语言又能像计算机一样精确执行算法的AI系统——这就像是给诗人配了一台超级计算器,让创意与精确计算首次在神经网络中实现了完美融合。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术原理深度解析
2.1 Transformer内部的计算机架构
Percepta团队在Transformer权重中实现了一套完整的RAM计算机架构,包括:
-
内存管理系统:将Transformer的隐藏状态空间划分为:
- 代码区(存储编译后的WebAssembly指令)
- 数据区(模拟RAM存储空间)
- 寄存器组(用于临时变量存储)
-
指令执行单元:通过特殊的注意力头设计实现:
- 取指阶段:从代码区读取下一条指令
- 译码阶段:解析操作码和操作数
- 执行阶段:在数据区完成算术逻辑运算
-
控制流处理:
- 使用条件跳转指令实现分支
- 通过栈结构处理函数调用
- 循环控制采用PC相对跳转
这种设计的关键在于,所有计算操作都被编码为Transformer可以处理的token序列。例如,计算3+5会被编译为如下指令流:
code复制LOAD R1, 3
LOAD R2, 5
ADD R3, R1, R2
STORE 0x100, R3
2.2 2D注意力头的革命性突破
传统Transformer的O(n)计算复杂度是阻碍长序列计算的主要瓶颈。Percepta团队的2D注意力头设计通过三个创新点解决了这个问题:
- 几何化键向量:
- 将每个token的key向量从传统的1D形式改为2D坐标(x,y)
- 在注意力计算
