1. MiniMax M2.7模型深度测评:国产大模型的真实实力
最近在AI圈子里,MiniMax M2.7这个国产大模型突然火了起来。作为一个长期关注AI技术发展的从业者,我决定亲自上手测试一下这个号称"全球第四"的模型到底有几斤几两。不同于那些只看benchmark分数的测评,我更关注它在实际工作场景中的表现。
MiniMax M2.7是国产AI"御三家"之一MiniMax的最新力作。所谓国产御三家,业内通常指的是Qwen、GLM、MiniMax和Kimi这四家(没错,就像四大天王有五个一样)。在最新的PinchBench(俗称"龙虾榜")上,M2.7已经冲到了全球第四的位置,与GLM和GPT并列前三。
特别说明:PinchBench与传统benchmark不同,它不测试模型回答问题的准确性,而是评估模型完成完整任务的能力,特别是Agent任务的成功率。这更接近真实工作场景的需求。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 测试环境与方法论
为了全面评估M2.7的能力,我设计了多平台、多场景的测试方案:
-
测试平台:
- MaxClaw(已接入M2.7)
- Claude Code
- MiniMax Agent网页端
-
测试维度:
- 多步骤任务执行能力
- 编程与创意能力
- 办公自动化能力
每个测试案例都会详细记录执行过程、结果质量以及遇到的问题,力求给出客观真实的评价。
3. 多步骤任务执行测试
3.1 电影信息收集与可视化
任务描述:
- 访问豆瓣电影网站
- 搜索近期热门电影
- 根据热度、评分和上映时间筛选10部
- 整理成Excel表格
- 基于表格数据生成可视化HTML
- 将结果自动发送到飞书
执行过程:
在MaxClaw平台,我直接输入上述任务指令。M2.7一次性完成了所有步骤,没有出现任何中断或错误。
结果分析:
- Excel表格包含两个子表:封面页和原始数据页
- 表格设计了专业的底色和格式
- HTML可视化图表清晰展示了电影评分分布
- 整个流程耗时不到2分钟
实操心得:这种多步骤任务最考验模型的指令理解和工具调用能力。M2.7的表现证明它在复杂任务规划方面确实出色,完全达到了生产级可用的水平。
3.2 自动视频创作任务
任务描述:
使用libtv-skills创作40秒短漫剧《像素荒原》,要求:
- 实拍与Low-Poly CGI混合渲染
- 呈现"高清现实"与"崩坏马赛克"的切换效果
- 包含完整的剧情和隐喻
执行过程:
M2.7自主完成了:
- 剧本创作
- 分镜设计
- 视频片段生成
- 最终合成
结果分析:
- 视频质量达到商用水平
- 剧情完整表达了数字存在主义危机主题
- 故障艺术(Glitch Art)风格运用得当
- 从指令到成品完全自动化
注意事项:MaxClaw本身支持视频生成功能,如果不需要特定风格,可以直接使用内置功能。但需要特定效果时,必须明确指定使用libtv-skills。
4. 编程能力测试
4.1 3D魔方模拟
任务要求:
创建一个HTML文件,使用Three.js实现:
- 可交互的3D魔方
- 自动解谜功能
执行过程:
第一版存在颜色丢失的问题,反馈后:
- 模型立即理解了问题原因
- 修正了方块位置和颜色的更新逻辑
- 第二版完美运行
结果亮点:
- UI设计比前代M2.5更精致
- 动画流畅,无渲染错误
- 自动解谜算法高效准确
4.2 产品宣传页设计
任务要求:
为AI鼠标"小沃"设计产品宣传页
设计亮点:
- 现代简约的VI设计
- 科技感十足的配色方案
- 完整的产品功能展示
- 响应式布局适配多设备
专业建议:目前M2.7还不支持视觉理解能力,无法基于图片进行设计。建议先提供详细的文字描述,待视觉能力上线后再测试更复杂的设计任务。
4.3 知识网站构建
任务要求:
使用Knowledge Site Creator Skills创建关于Token的知识学习网站
执行过程:
- 自动提取公众号文章关键信息
- 设计知识架构
- 生成具有高级审美的页面
结果评价:
- 内容组织严谨且有层次
- 交互设计富有创意
- 排版专业,阅读体验佳
技术限制:目前M2.7不能直接读取公众号URL内容,需要手动提供文本。期待后续版本能解决这个限制。
5. 办公自动化测试
5.1 腾讯财务分析三件套
任务要求:
基于假设的腾讯2025年财报:
- 构建财务模型
- 撰写研究报告
- 制作汇报PPT
Excel模型分析:
- 包含业绩总览、收入分析、盈利分析等完整模块
- 数据计算准确无误
- 图表类型选择恰当
Word研究报告:
- 23页近万字内容
- 专业的研究框架
- 数据与假设一致
- 格式需要少量调整
PPT演示文稿:
- 高级视觉设计
- 逻辑清晰的叙事结构
- 专业的数据可视化
效率评估:这套三件套如果由人工完成,至少需要1-2个工作日。M2.7在20分钟内完成核心内容,后续微调约需1小时,整体效率提升80%以上。
6. 综合评估与使用建议
经过全方位测试,MiniMax M2.7展现出了令人印象深刻的实力:
核心优势:
- 复杂任务的一次通过率高
- 长上下文记忆能力出色
- 多工具协同能力强
- 输出结果可直接用于生产
待改进点:
- 视觉理解能力待加强
- 部分专业格式需要人工调整
- 外部内容获取能力有限
使用建议:
- 对于多步骤任务,建议先测试简单版本,再逐步增加复杂度
- 涉及专业领域时,提供足够的背景信息
- 关键产出务必进行人工复核
- 善用反馈机制帮助模型迭代优化
在实际工作中,我发现M2.7特别适合以下场景:
- 重复性高的多步骤任务
- 需要快速原型设计的工作
- 数据分析与报告生成
- 创意内容的生产
从技术成熟度来看,M2.7已经达到了准生产级别。虽然还有提升空间,但它展现出的能力足以改变很多工作流程。对于追求效率的团队和个人,现在就是开始使用的最佳时机。
