1. 从4篇到187篇:一位技术人的2025年蜕变实录
2026年初的深圳图书馆,阳光透过落地窗洒在我的笔记本上。后台统计页面那个醒目的数字——187篇技术文章,让我停下了敲击键盘的手指。这个数字对于一年前全年只产出4篇博文的我来说,简直像是个奇迹。更准确地说,这不是奇迹,而是365天持续不断的坚持与刻意练习的结果。
作为一名从业多年的技术人,我深知在这个信息爆炸的时代,系统性输出技术文章有多难。2023年我只写了1篇,2024年勉强写了4篇,每次打开编辑器时总想着"等把这个技术吃透再写",结果就是永远没有"吃透"的时候。直到2025年元旦,我给自己定下了一个简单粗暴的规则:每周至少产出3篇技术文章,不论长短,但必须保证技术深度和原创性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术复盘:构建认知体系的187块基石
2.1 从黑盒到白盒的认知升级
2025年是AI技术尤其是大语言模型(LLM)爆发的一年。面对ChatGPT、Claude等产品的快速迭代,很多开发者选择直接调用API快速实现功能。而我却选择了一条看似笨拙的道路——从零开始理解LLM的每一个组件。
在《构建大语言模型(从头开始)》专栏中,34篇文章记录了我完整的探索历程:
- Tokenizer实现细节(3篇):从最基础的BPE算法到SentencePiece的优化策略
- 注意力机制全解析(7篇):包括多头注意力的并行计算优化、KV缓存机制等生产级考量
- 位置编码实战(4篇):对比了正弦编码、旋转位置编码(RoPE)和ALiBi的优劣
提示:理解位置编码时,建议亲手实现不同方案并对比在长文本任务中的表现差异,这是理解LLM长上下文处理能力的关键。
2.2 Transformer架构的庖丁解牛
Transformer作为现代LLM的基石,我用了21篇文章进行拆解。其中最具挑战性的是反向传播的矩阵求导部分,为此我专门制作了计算图:
python复制# 自注意力层的梯度计算示例
def backward_attention(Q, K, V, dOutput):
# 计算dSoftmax
dSoftmax = np.dot(dOutput, V.T)
# 计算dQ, dK, dV
dQ = np.dot(dSoftmax, K)
dK = np.
