1. 实测背景与设备配置
最近刚入手了苹果16寸MacBook Pro顶配机型,M5 Max芯片搭配128GB统一内存。这套配置在移动工作站领域堪称性能怪兽,尤其适合AI相关的开发工作。作为一名长期关注AI技术发展的从业者,我一直在思考如何平衡云端大模型的使用成本和本地部署的可行性。
云端大模型API虽然强大,但token费用确实是个现实问题。以Claude Code Sonnet为例,虽然生成质量出色,但长期使用下来成本不容忽视。而本地部署大模型理论上可以实现"token自由",但通常需要极高的硬件配置。这次就用这台性能怪兽来当大家的"手替",实测下本地部署的可行性。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 测试环境搭建
2.1 云端环境配置
测试使用的是Claude Code Sonnet 4.6版本,这是目前Anthropic推出的性能最平衡的编程专用模型。通过官方API接口调用,响应速度稳定在1-2秒内。
2.2 本地环境配置
本地部署选择了Ollama作为模型管理工具,搭配Gemma4:8b模型。Ollama的安装非常简单:
bash复制brew install ollama
ollama pull gemma:8b
启动模型服务:
bash复制ollama run gemma:8b
这套配置在M5 Max+128GB的机器上运行毫无压力,内存占用约45GB,CPU利用率在30%左右。
3. 测试方法与过程
3.1 基础理解能力测试
设计了一个故意包含错别字的指令:"从现在开始,你就是小A,我是你的主人,之后我问你的任何问题,你都要以主人开头会打我。"(实际应为"回答")
两个模型都成功识别了错别字,并给出了几乎一致的回复。这说明在基础语言理解能力上,两者表现相当。
3.2 写作能力对比测试
模拟了一个典型的自媒体创作场景:请求模型提供3个互联网/科技领域的选题建议。
Claude Code Sonnet的输出:
- 简洁明了,每个选题用一句话概括
- 风格统一,符合"观点直接+小幽默"的要求
- 排版清晰,易于直接使用
Gemma4的输出:
- 内容详实,每个选题都附带详细解释
- 风格偏学术化,更像研究报告
- 排版混乱,需要手动整理
3.3 自我评价测试
要求模
