1. 项目背景与核心挑战
这个ICLR'26投稿项目直指当前大模型研究中最具争议性的问题——语言模型对口语的真实理解能力。过去三年,GPT系列、Claude、Gemini等模型在文本任务上的表现突飞猛进,但当我们用日常对话的方式与它们交互时,常常会遇到令人困惑的情况:模型能流畅接话却答非所问,能引用文献却不懂双关语,能写学术论文却听不懂方言笑话。
这种现象暴露了当前评估体系的重大缺陷:主流benchmark(如GLUE、SuperCLUE)主要测试结构化文本任务,而人类最自然的语言表达——口语交流中的隐含逻辑、情感倾向、文化背景等维度,却缺乏系统性的评估工具。我们的团队在语音助手商业化落地过程中,就曾遭遇过模型在实验室指标优秀,但用户实际使用时满意度不足30%的尴尬局面。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基准设计方法论
2.1 多模态感知评估体系
不同于传统纯文本benchmark,我们构建了包含声学特征(音高、语速、停顿)、视觉线索(唇动、表情)和语言内容的三维评估框架。例如在"语调理解"测试中,同一句"这可真有意思"会以赞赏、讽刺、疑问三种语调呈现,要求模型结合音频频谱图和上下文判断真实意图。
特别设计了"跨模态一致性"测试案例:
- 场景:视频中人物笑着说"我太高兴了"(实际嘴角下垂)
- 预期输出:"说话人可能在反讽,其肢体语言与话语情绪矛盾"
2.2 深层推理能力维度
针对当前模型在逻辑推理上的短板,我们开发了口语特有的推理挑战集:
-
会话隐含逻辑(需要补充省略的前提)
- 输入:"会议室还在用吗?"
- 预期输出应包含:"询问者可能需要使用会议室,需确认当前使用状态"
-
文化背景理解(方言/网络用语)
- 输入:"这波操作属实下饭"
- 应识别出:"下饭"在此处指"操作拙劣令人发笑"
-
多轮对话维持(超过20轮次)
设计了包含话题跳转、信息回溯的复杂场景,例如从购物咨询自然过渡到售后投诉的完整流程。
3. 技术实现关键点
3.1 数据采集与标注
与传统众包模式不同,我们搭建了专业级口语语料采集系统:
- 在7个方言区建立录音棚,采集2000+小时自然对话
- 采用演员演绎的方式生成特定情感强度的语料
- 创新性地引入"语误样本"(如口吃、错误语法)增强鲁棒性
标注体系包含3
