ECoM-Reasoning:让端到端的语音大模型学会轻量级推理
以 GPT-4o、Moshi、GLM-4-Voice、Qwen-Omni 为代表的端到端语音大模型SLM正在推动人机交互迈向“开口即对话”的新阶段。然而在需要精确、结构化推理的场景下——尤其是口语数学问答——语音大模型的表现仍显著落后于纯文本 LLM。根源在于语音模态自身的表达瓶颈、现有模态链方案的效率代价以及简单降本的不可行。如何在保持推理能力的同时大幅压缩中间 Token 开销成为 SLM 走向真正智能交互的核心问题。本文解读的 ECoM Reasoning 正是对这一问题的系统性回答。▎三重挑战语音大模型为什么想不清楚语音大模型在处理口语数学问答等结构化推理任务时面临三重递进式挑战第一重语音模态自身的表达瓶颈。纯语音推理需要将数学表达式口语化例如将x5y0读作x加五y等于零这种表述远不如符号化文本直观大幅增加了模型理解和推理的难度第二重现有模态链方案的效率代价。当前的模态链Chain-of-Modality, CoM架构虽然通过在语音生成前插入文本推理来缓解这一问题但完整的推理链带来了大量文本Token开销直接导致语音首帧延迟过长第三重简单降本的不可行。如果简单地在推理时截断推理来降低成本模型的推理能力会急剧崩溃。实验表明将CoM Reasoning的Token预算限制到30个时在MultiArith数据集上的准确率从63.40%骤降至5.17%。三重挑战叠加之下让 SLM 既想得清楚又说得快不再只是一个工程优化目标而是语音大模型走向真正智能交互必须跨越的核心门槛。▎ECoM Reasoning首个将压缩推理引入 SLM 的端到端语音交互范式本研究提出 Efficient Chain-of-Modality ReasoningECoM Reasoning其核心思想是与其让中间文本成为一段完整思维链的转录不如让它成为一段高信息密度的压缩推理表示同时服务于语音生成和问题求解。从 CoM 到 ECoM Reasoning 的交互范式图1Standard CoM 框架与 ECoM Reasoning 框架概览如图不加推理的 Standard CoM 范式生成链路为系统与任务设定 用户语音 → 用户语音转写文本 → 回答文本 → 回答语音在这一范式下输入 SLM 的序列由系统与任务设定与用户语音拼接而成模型自回归生成的序列则依次为用户语音转写文本 → 回答文本 → 回答语音先把用户的语音转写成文本再直接写出回答文本最后合成用户真正听到的音频。带完整推理链的 CoM Reasoning 范式中间插入了完整推理文本系统与任务设定 用户语音 → 用户语音转写文本 → 完整推理文本 → 回答文本 → 回答语音输入 SLM 的序列与 Standard CoM 保持一致但模型生成的序列被扩展为用户语音转写文本 → 完整推理文本 → 回答文本 → 回答语音即模型在写出回答文本之前先显式地生成一段完整的自然语言推理作为回答的中间监督与思考支撑。而 ECoM Reasoning 则将 SLM 的生成链路重构为系统与任务设定 用户语音 → 压缩推理文本 → 回答文本 → 回答语音在 ECoM Reasoning 中模型自回归生成的序列则精简为压缩推理文本 → 回答文本 → 回答语音——用户语音转写这一步被整体省略完整推理被压缩为一段高密度的关键 Token 序列随后直接产出回答文本并合成语音。相较 CoM Reasoning生成端少了一个环节用户语音转写文本并把最长的一段完整推理文本压至 40% 长度从而实现输入不变、生成更短的推理链重构。压缩数据是如何构造的ECoM Reasoning 对两类中间文本采用不同的压缩策略用户文本 ( User Text ) 句子级压缩。经过渐进式训练后模型已经具备鲁棒的口语理解能力即使完全移除转写文本语音理解性能也不会下降。推理文本 ( Reasoning Text ) Token 级保守压缩。采用 LLMLingua-2 作为 Token 重要性评估器无需修改主干 LLM 架构保留高重要性 Token删除冗余 Token。一个典型示例原始推理The number of books in the bin is 41 − 33 8 books. After adding 2 books, the number of books in the bin is 8 2 10 books. The answer is 10.压缩至 40%bookstore sold 33, 41 − 33 8, put 2, 8 2 10. The answer is 10.在保留核心推理骨架的同时语言冗余被显著剥离。训练策略是如何设计的如果直接从零训练 ECoM Reasoning模型需要同时学会口语理解 语音生成 压缩文本上的推理三件难事收敛困难性能显著下滑。图2ECoM Reasoning 渐进式训练流程概览受课程学习启发作者提出三阶段渐进式训练如图Stage 1 — Standard CoM仅使用不含显式推理的语音对话与口语问答数据建立基础的语音理解与语音生成能力。Stage 2 — CoM Reasoning引入含完整推理链的监督信号让模型先掌握完整思考的能力。Stage 3 — ECoM Reasoning将完整的中间文本替换为压缩表示将已有推理能力蒸馏到高密度的压缩形式中。这种先学会完整思考再学会精炼表达的顺序被消融实验证明是最优课程编排。▎实验结果40% 的 Token换来更高的准确率那么实际效果如何作者在 AddSub、SingleEq、MultiArith、SVAMP 四个数学推理数据集上进行了系统对比实验关键结论如下表1数学问答基准测试结果高准确率ECoM Reasoning 相较不加推理的 Standard CoM 提升 21%相较带完整推理链的 CoM Reasoning 也有所提升( 3%)低成本ECoM Reasoning 仅使用 CoM Reasoning 约 40% 的文本 Token 预算30.21 vs 96.56低延迟在流式推理模式下ECoM Reasoning首个语音Token延迟从4.90秒降至1.60秒满足口语对话的实时性消融实验进一步表明40%的压缩率是最优选择——适度压缩去除了冗余Token保留了核心推理路径而过度压缩如20%则会导致关键推理信息丢失。研究还发现渐进式训练有助于模型学习压缩推理其使模型隐藏层与完整CoM模型保持高度相似。▎方案价值让 SLM 走向高准确率 低成本 低延迟ECoM Reasoning 面向语音大模型在口语数学问答中的应用场景通过压缩推理与渐进式训练在保持甚至提升准确率的前提下将文本 Token 用量减少至 40%显著降低推理成本与延迟。具体解决纯语音推理难以处理结构化信息通过引入高密度压缩文本作为语音生成的引导表征与推理载体的双重身份让符号级推理能力回到语音交互链路中。传统模态链推理效率低下、成本高昂将中间文本从完整思维链转录重构为高信息密度压缩表示Token 消耗从 96.56 降至 30.21首帧延迟从 4.90s 降至 1.60s。直接训练压缩推理导致模型性能下降通过 Progressive Compression 三阶段课程学习先建立完整推理能力再将其蒸馏到压缩表示中使模型在压缩后仍保持稳定的推理表现。▎结语语音大模型的未来绝不只是能听清、能开口而是能在你说完话的一瞬间把复杂的问题想明白然后用最自然的语气告诉你答案。ECoM Reasoning 想做的正是给这些会说话的 AI装上一颗更轻、更快、更聪明的推理大脑让它在实时对话中不再犹豫不再啰嗦不再答非所问。这一步实现人机对话的边界又会往前推进一点。相关文献参考[1] Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, et al. 2025. Fun-AudioChat Technical Report. arXiv preprint arXiv:2512.20156 (2025).[2] Zhuoshi Pan, Qianhui Wu, Huiqiang Jiang, Menglin Xia, Xufang Luo, Jue Zhang, Qingwei Lin, Victor Rühle, Yuqing Yang, Chin-Yew Lin, et al. 2024. Llmlingua-2: Data distillation for efficient and faithful task-agnostic prompt compression. In Findings of the Association for Computational Linguistics: ACL 2024. 963–981.[3] Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, et al. 2026. SLAMLLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing. IEEE Journal of Selected Topics in Signal Processing (2026).[4] Wenxi Chen, Ziyang Ma, Ruiqi Yan, Yuzhe Liang, Xiquan Li, Ruiyang Xu, Zhikang Niu, Yanqiao Zhu, Yifan Yang, Zhanxun Liu, et al. 2025. Slam-omni: Timbrecontrollable voice interaction system with single-stage training. In Findings of the Association for Computational Linguistics: ACL 2025. 2262–2282.[5] Ruiqi Yan, Xiquan Li, Wenxi Chen, Zhikang Niu, Chen Yang, Ziyang Ma, Kai Yu, and Xie Chen. 2025. URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models. arXiv preprint arXiv:2502.17810 (2025).