热点资讯

大模型生成速度的突破,提升代理性能的关键

datetime

2026-09-02

阅读数量

6464

主流的大型模型依然以自回归方式不断演进,但一种新技术正在接近商业应用的边缘。9月1日,扩散智能DiffuSpace与亚洲智能体计算平台Acrab联合测试的结果显示,扩散语言模型(dLLM)在实际应用中能将代理的运行速度提高约5倍。基于这一测试结果,双方计划加快扩散语言模型在人工智能PC、智能汽车、机器人以及智能家居等领域的应用推进。

dLLM因其“全局生成”的独特特性,被认为是未来通用人工智能基础模型的重要方向之一,有望在短期内取代现有的GPT类自回归模型。与传统模型逐个生成Token的做法不同,dLLM借鉴了图像模型中的扩散机制,首先构建全局内容框架,然后通过并行计算不断修正内容,这样不仅能生成更具一致性的内容,还能实现5倍甚至10倍的推理加速,尤其在边缘AI中优势更为明显。

传统的自回归模型每次仅能生成一个Token,未能充分利用芯片的并行计算能力,而扩散语言模型则可以同时处理多个位置,从而转化并提升芯片的计算速度。代理场景中,生成速度尤为重要,因为一次完整的代理任务通常需要多个步骤,包括规划、检索、调用工具等,每次生成的延迟都会在过程中累积。因此,提升速度可显著缩短任务完成时间。 龙8头号玩家国际

以AI PC为例,一个本地代理可能需要同时处理邮件、安排日程、检索文件并制定后续计划,扩散模型能够对多个相关步骤进行并行推演,实时调整各项任务。扩散智能DiffuSpace是全球最早致力于dLLM研究的团队之一,核心团队成员来自清华、北大、港大和CMU等著名高校,长期在扩散语言模型领域处于国际领先地位。

团队于2022年推出DiffuSeq,开创了扩散模型处理序列生成的新技术;而在2025年,他们推出的Dream 7B模型在规划能力上超越了同等参数的自回归模型,并在能力上与671B的DeepSeek V3并肩。我们与DiffuSpace就其技术路线及产业应用进行了深入交流。

问及为何端侧应用可能成为扩散语言模型的优势场景,DiffuSpace表示在处理单一用户任务时,dLLM的推理加速优势尤其显著。端侧推理通常服务于单一用户,用户对于响应时间非常敏感,因此端侧应用是他们非常看重的领域。 龙8头号玩家国际

关于扩散语言模型速度优势的来源,DiffuSpace说明,自回归模型每一步只能前向生成一个Token,而扩散模型则能同时生成多个Token,更符合人类的思维过程。人类在思考时并不会逐字逐句地表达,而是首先有一些模糊的想法,随后逐渐清晰化。若速度提升十倍,用户的等待时间仅需十秒,这种快速体验将大大改善用户感受,特别是代码任务中,扩散模型能够更有效地生成多个Token,从而提升服务效率并降低成本。

最后,DiffuSpace指出,dLLM在代理使用体验上的变化将是显著的。如果用户在对话中修改了早期的内容,自回归模型只能从修改位置重新生成,难以利用已生成的后续内容,而扩散模型则能更加高效地处理这些情况。