英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的
创始人
2026-09-03 19:23:08
0

最近,英伟达发了篇官方的大模型推理指南,结果翻着翻着,硬是让人看成了一本华人团队的论文合集。

事情是这样的。

9月2日,英伟达技术博客上线了一篇长文《用投机解码做AI模型协同设计》。

文章的核心就是一张选型表,把目前最主流的6种推理加速方案一字排开,连训练成本、适用场景都给你扒得干干净净。

它的分量在于,这是芯片霸主极其罕见地以官方姿态,把「模型该怎么贴着硬件物理极限去设计」写成了规范。

而当他们环顾四周,寻找能在硅片极限上跳舞的最优解时,列入指南的核心方案,几乎全是由华人团队主导的。

这早已超出了普通算法综述的范畴。这张表到底泄露了什么天机?咱们一行一行拆。

几乎纯赚的买卖:投机解码在干嘛

要看懂这张表,得先弄明白「投机解码」是个什么局。

大模型吐字,是一个一个往外蹦的。每吐一个词,几百GB的参数就得在显存里完整跑一圈。其实大部分时间,算力都在干等着内存搬数据。

「投机解码」的解法,十分简单粗暴——

先找个轻量级的小模型做前置预测,一口气先猜7个字;然后大模型一次性对这7个字做验证。

验证7个字和自己写1个字的耗时差不多,毕竟权重反正都要搬一遍。

猜对的直接收下,猜错的就从断点处重来。因为大模型只接受它自己本来就会写的字,所以最终输出连个标点都不用变。这就是所谓的「无损加速」。

在这个游戏里,所有的算力压榨,都围绕着一个核心的数学期望公式展开:

Speedup = 

𝔼[L] × Ttarget

Tdraft + Tverify

分子是收益𝔼[L],代表预期接受长度(大模型平均每轮能相中几个字)。

分母是你付出的额外代价,小模型做预测的时间(Tdraft)加上大模型最终验证的时间(Tverify)。

想让加速比(Speedup)狂飙,无非两条路:要么拉高分子(猜得更准),要么极致压缩分母(猜得更快)。

踩着同行的肩膀,卷出四代进化

顺着英伟达这张表从上往下捋,你会看到一条清晰的厮杀主线。

第一行是最古老的「外置草稿模型」,得单独训一个小模型当助手。

英伟达直接亮出了天价账单:从头训要消耗1T到10T的token,代价非常高昂。

不过它之所以还留在表上,是因为英伟达给它安排了一个特定的归宿——他们花了200亿美元收编的Groq芯片(LPU)。

最后一行则是无需训练的n-gram查表法,靠从上文里硬搜重复片段直接抄,只适合大段复制粘贴的死板场景。

真正代表技术演进的,是中间的这四行。

第二行:EAGLE-3。

出自北大Yuhui Li、滑铁卢大学Hongyang Zhang等人的团队。

从ICML、EMNLP一路杀到NeurIPS,三年连发三代,把「逐字往下猜」这条串行老路做到了物理上限。

它曾是这个领域的绝对霸主,但在英伟达的新表里,它被挤到了「参考位」,理由极短:接受长度已经被后浪超越。

第三行:MTP(多Token预测)。

思路虽然是Meta在2024年首创,但真正把它锤成大模型推理标配的,是DeepSeek-V3。

英伟达给它的评价极高——GPU上大模型的最佳选择。核心要义在于,这种方案在预训练阶段就得和主模型绑在一起练。

第四行:DFlash。拿下6倍无损加速的狠角色。

三位作者Jian Chen、Yesheng Liang、Zhijian Liu。它彻底摒弃了EAGLE和MTP那种「一个字接一个字猜」的串行打法,转而借鉴扩散模型,一次前向计算,直接将7个Token的预测序列一次性生成出来,把分母(耗时)压缩到了极致。

顺带一说,指导老师Zhijian Liu是UCSD助理教授,但他同时也是英伟达研究院的研究科学家。

第五行:DSpark。由DeepSeek和北京大学混编的24人团队操刀。

DFlash的并行架构虽然快,但有个致命伤:越往后猜越不准。为了强行拉高分子(接受长度),DSpark在并行底座上外挂了一个极轻的串行模块。

实测数据非常直观:接受长度比EAGLE-3拔高近30%,比DFlash拔高18%。在DeepSeek-V4的线上生产环境里,速度比MTP生生快了60%到85%。

硬件常数,反向锁死模型架构

这四代技术能把算力榨干到这种地步,靠的不仅仅是算法上的巧思。

很多人以为草稿一次猜得越多越赚,但这完全无视了硅片的物理规则。

当注意力机制占据解码时间的大头时,大模型验证阶段需要处理的Token总数是1+D(1个真实输入 + D个草稿预测)。

为了把这部分数据喂给GPU,硬件会在底层把Query头和KV头进行分组,每组的注意力核分块大小,必须严格受制于GPU物理矩阵的边界(Tile Size,当前架构通常为128)。

这就拿到了底层对齐公式:× (1 + D) ≤ 128

稍微推导一下,就得出了英伟达指南里的终极常数准则:

D  = 

128

G

 − 1

其中,G是注意力分组数(Query头和KV头的比例)。

这就意味着,你的模型在设计之初怎么给注意力分组,就直接决定了草稿该猜几个字,才能刚好把GPU的分块严丝合缝地填满。

如果G=8,草稿刚好猜15个;如果G=32,只能猜3个。硬件跨不过边界,哪怕最后一个Tile你只用了半块,算力照样按整块扣费。

以前,投机解码是模型练完出炉后,工程团队再去想办法外挂的加速包。但现在,底层的物理法则告诉你:一个硬件矩阵的常数,直接反推到了模型架构的设计参数上。

我们印象里,鲜有芯片厂商会像这样,把一个底层硬件的约束方程,写进了大模型的设计图纸里。

尾声

模型运行效率的竞赛重心,彻底变了。

单纯堆砌庞大参数的时代正在翻篇,如今真正的胜负手,取决于谁更懂脚下那块硅片的物理极限。

在这个由芯片巨头反向定规矩的新赛场上,华人团队已经悄然成为了破局的默认答案。

英伟达这样的算力霸主,自然不会挑剔货架上摆的是哪家算法。

但这套榨干硅片极限的最优解究竟出自谁手,白纸黑字,印得清清楚楚。

相关内容

兖矿能源:深耕深部矿井建设...
(来源:兖矿能源)走转改·四季行暑去秋来,脚沾泥土、眼观一线,兖矿...
2026-09-03 20:09:20
康哲药业创新药百卢妥获批新...
康哲药业(00867.HK)9月3日晚间公告,旗下德镁医药已于9月...
2026-09-03 20:09:14
正品!正品!正品!德国60...
来源:猫哥的视界德国飞鹰撤柜清仓,秋装终于来了!!(这次是男女同款...
2026-09-03 20:09:08
四川北川县发生4.8级地震
(来源:华商报)中国地震台网正式测定:09月03日19时39分在四...
2026-09-03 20:09:01
呈现彰显世界水平、中国特色...
以更高站位、更实举措、更优服务,全力呈现一场彰显世界水平、中国特色...
2026-09-03 20:08:54
热点丨特朗普版1美元硬币正...
“美国铸币局于美东时间9月2日中午正式发售印有特朗普总统头像的新款...
2026-09-03 20:08:49
上海市开展U6G外场试验 ...
(来源:上观新闻)转载自:中国无线电 8月31日至9月2日,工业和...
2026-09-03 20:08:43
“科罗旺”路径调整,即将进...
(来源:上观新闻)受海上偏东气流影响,今天本市出现了分散性的阵雨。...
2026-09-03 20:08:37
北京市招标公告
(来源:中国政府采购报)转自:中国政府采购报北京市招标公告项目名称...
2026-09-03 20:08:30

热门资讯

兖矿能源:深耕深部矿井建设 赋... (来源:兖矿能源)走转改·四季行暑去秋来,脚沾泥土、眼观一线,兖矿能源新闻中心“走转改·四季行”再次...
康哲药业创新药百卢妥获批新增特... 康哲药业(00867.HK)9月3日晚间公告,旗下德镁医药已于9月2日获得中国国家药品监督管理局批准...
正品!正品!正品!德国60年大... 来源:猫哥的视界德国飞鹰撤柜清仓,秋装终于来了!!(这次是男女同款)老粉丝肯定不陌生了。前段时间,我...
四川北川县发生4.8级地震 (来源:华商报)中国地震台网正式测定:09月03日19时39分在四川绵阳市北川县(北纬31.91度,...
呈现彰显世界水平、中国特色、上... 以更高站位、更实举措、更优服务,全力呈现一场彰显世界水平、中国特色、上海风采的技能盛会。 第48届世...
热点丨特朗普版1美元硬币正式发... “美国铸币局于美东时间9月2日中午正式发售印有特朗普总统头像的新款1美元硬币,到周三下午,这些硬币似...
上海市开展U6G外场试验 各项... (来源:上观新闻)转载自:中国无线电 8月31日至9月2日,工业和信息化部—国际电信联盟“空间促进发...
“科罗旺”路径调整,即将进入东... (来源:上观新闻)受海上偏东气流影响,今天本市出现了分散性的阵雨。由于降雨时间短,对降温作用微弱,全...
北京市招标公告 (来源:中国政府采购报)转自:中国政府采购报北京市招标公告项目名称:友谊医院所需通州院区2026年至...
国际创意何以落地东阳 (来源:中国政府采购报)转自:中国政府采购报【采购实务项目案例】国际创意何以落地东阳■ 陈柏青项目概...