2026-09-03
利用推测解码加速大语言模型推理的协同设计方法
本文是AI模型协同设计系列第三篇,聚焦如何利用投机解码(Speculative Decoding)在保持精度的同时加速大语言模型推理。文章提出五条选择草稿长度与草稿机制的实用准则:通过增加草稿长度将GEMM推入计算密集区...
本文是AI模型协同设计系列第三篇,聚焦如何利用投机解码(Speculative Decoding)在保持精度的同时加速大语言模型推理。文章提出五条选择草稿长度与草稿机制的实用准则:通过增加草稿长度将GEMM推入计算密集区...