📰 研报摘要
查看全文 ➔摘要: 本次会议分享了关于扩散语言模型(DRM)高效并行推理的最新研究工作 VDRM。该工作核心旨在通过重构注意力机制,解决扩散语言模型在推理速度上的瓶颈,实现兼顾高性能与高推理效率的并行生成方案。
行业主线:
- 推理效率优化:针对自回归模型(AR)受限于显存带宽(Memory-bound)的问题,探索利用额外算力换取更多 Token 输出的并行生成方向。
- 架构重构:通过将双向注意力改为因果注意力(Causal Attention)并结合拓扑换位(Ordering)技术,使 DRM 能够支持高效的 KV Cache 缓存,兼容 FlashAttention 等现有生态。
关键变化与分歧:
- 解码策略升级:提出从 Block-wise 解码转向滑动窗口解码(Streaming Decoding),显著减少重计算,提升吞吐量。
- 生成引导机制:引入距离惩罚机制,鼓励模型优先生成前缀 Token,在保证性能的同时最大化缓存复用率。
- 加速效果:在低熵场景(如简单对话)可实现极高加速比(甚至 10 倍以上),但在复杂逻辑场景(如数学)加速效果相对有限。
受益方向与风险:
- 受益方向:大模型推理成本降低、端到端延迟缩短,以及并行生成技术的工程化落地。
- 核心风险:不同任务场景间并行度的不稳定性(Acceptance rate 差异大);现有推理框架生态对非 AR 模型的支持尚不完善。