1. 千问3.5系列模型开源概览
2024年2月25日,阿里云在AI开源领域投下重磅炸弹——继除夕开源千问3.5-397B-A17B之后,再次开源三款中等规模的千问3.5系列模型。这次开源的模型包括Qwen3.5-35B-A3B、Qwen3.5-122B-A10B和Qwen3.5-27B,它们在性能上实现了对前代旗舰模型的全面超越,甚至在多个基准测试中击败了GPT-5 mini等强劲对手。
最令人振奋的是,这些新模型对硬件要求大幅降低,可以直接部署在消费级显卡上运行。这意味着普通开发者和中小企业也能轻松使用这些高性能AI模型,而不需要昂贵的专业计算设备。阿里云同时上线了基于Qwen3.5-35B-A3B的托管服务Qwen3.5-Flash,每百万Token输入成本低至0.2元,为AI应用落地提供了极具性价比的选择。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术架构与性能突破
2.1 混合注意力与MoE架构创新
千问3.5系列模型的核心技术突破在于其创新的混合架构设计。模型采用了混合注意力机制与高稀疏的MoE(Mixture of Experts)架构相结合的方式,这种设计在保持模型性能的同时显著降低了计算资源需求。
具体来说,混合注意力机制能够动态调整不同层次和位置的注意力权重,使模型更高效地处理长序列输入。而MoE架构则通过专家网络的路由机制,在推理时只激活部分网络参数(如Qwen3.5-35B-A3B仅激活约30亿参数),大幅减少了实际计算量。
这种架构创新带来了惊人的效率提升:
- Qwen3.5-122B-A10B总参数1220亿,激活参数约100亿
- Qwen3.5-35B-A3B总参数350亿,激活参数约30亿
- 相比传统密集模型,计算效率提升3-5倍
2.2 多模态训练与性能表现
千问3.5系列模型在训练数据和方法上也有重大改进。新模型基于更大规模的文本和视觉混合Token进行训练,采用了创新的课程学习策略和多阶段微调方法。这使得模型在多任务处理上表现出色,特别是在以下领域:
- 指令遵循:在IFBench测试中准确率提升15%
- 复杂推理:GPQA博士级推理测试得分提高20%
- 数学能力:HMMT 25数学竞赛题解决率提升12%
- 多语言理解:MMMLU多语言知识测试覆盖50+语言
