🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-09-04T16:11:28+00:00

华为发布麒麟2026芯片实测数据与韬定律论文

原始标题:麒麟 2026 芯片晶体管密度暴涨 55%,华为何庭波更新韬定律论文

来源
ithome
发布时间
2026-09-04T13:09:06
采集批次
2026-09-04-16
字数
1840
URL 指纹
4b108c0e729a3113

📌 AI 总结(259 字)

华为工程师何庭波在ChinaXiv发布预印本论文,详细阐述τ(韬)定律及逻辑折叠技术原理,并公布麒麟2026芯片实测结果。该芯片作为首款落地逻辑折叠的移动SoC,采用3D混合键合工艺实现1.5μm键合节距与5000万根垂直互连,晶体管密度从1.55亿/mm²提升至2.38亿/mm²,增幅55%。实测显示,对比麒麟9030 Pro,NPU功耗下降66%、GPU功耗下降58%。文章解释,功耗降低源于走线缩短削减互连电容及电压降低,并披露下一代麒麟2027已实现1μm键合节距,目标三年内达720nm节距与1亿以上互连。
📄 正文(1840 字)
今日,一篇发布于ChinaXiv的预印本论文《华为τ(韬)芯片本该过热烧毁?》对外公开,华为工程师何庭波详细披露了τ(韬)定律的底层原理,并且放出麒麟2026芯片的实测数据。长久以来行业普遍认为,3D堆叠会带来严重的发热难题,但麒麟2026的实测结果,给出了完全不一样的答案。

传统摩尔定律依靠缩小晶体管几何尺寸实现性能迭代,而受外部条件限制,华为无法继续沿用EUV极紫外光刻向下推进制程。华为选择跳出空间缩放的固有路线,开创τ缩放定律,不再一味缩小晶体管,转而压缩信号在芯片内部传输的特征延迟τ(韬),逻辑折叠(LogicFolding)就是该理论的核心落地技术。

逻辑折叠依托3D混合键合工艺,把原本平铺在平面的电路拆分为多层垂直堆叠的硅片裸片,依靠微米级垂直互连桥接各层电路,将芯片内部漫长的水平走线替换成距离极短的垂直跳转。不同于常规封装工艺,华为将混合键合视作晶圆级器件制造工序,麒麟2026实现1.5μm键合节距,拥有5000万根垂直互连;下一代麒麟2027已经达成1μm键合节距,垂直互连数量突破1亿根。预计三年内,将实现720nm顶层金属节距,做到1亿以上垂直互连。

麒麟2026是首款落地逻辑折叠的移动SoC。单代迭代之下,芯片晶体管密度从1.55亿/平方毫米提升至2.38亿/平方毫米,增幅达到55%,这一提升幅度相当于过去三年依靠传统工艺微缩取得的全部成果。

按照行业固有认知,晶体管密度大幅提升,功率密度、芯片温度必然随之飙升,但实测结果截然相反。在同等性能的测试条件下,对比前代平面架构麒麟9030 Pro,麒麟2026的NPU功耗下降66%,GPU功耗下降58%,CPU性能大核功耗下降41%,在晶体管数量暴涨的同时,完成同等工作的芯片工作温度更低。

论文解释了反常识的核心原因:芯片绝大部分能耗,并非消耗在晶体管本身的计算运算上,而是消耗在金属走线的数据搬运,如同上班族通勤的能量消耗远大于工位办公。逻辑折叠大幅缩短信号走线长度,直接削减占据功耗大头的互连电容开销。走线缩短带来电容层面的功耗缩减,同时走线变短后,电路可以进一步降低工作电压;动态功耗与电压平方成正比,由此带来幅度更大的功耗收益。

从各模块实测数据来看,数据搬运越密集、并行度越高的模块,逻辑折叠收益越显著。作为AI算力核心的NPU,保持29 TOPS算力不变,频率降低63%,电压从0.85V降至0.55V,功率密度暴跌73%。

当然技术也存在差异化表现。DSP模块出现特殊情况:麒麟2026的DSP总功耗下降25%,但芯片面积缩减40%,单位面积功率密度反而上涨24%;而迭代后的麒麟2027已经解决该问题,在功耗下降47%的同时,功率密度也优于平面架构芯片。这也印证:功率密度不是堆叠技术的宿命,而是可以通过设计调控的结果。

CPU大核由于存在大量不可并行的串行计算任务,功耗收益相对有限,仅取得41%功耗降低。论文提到,低并行度CPU核心实现完整逻辑折叠,需要EDA工具迭代、漫长验证,属于系统性工程。麒麟2026已经实现3.1GHz大核频率,未来3-5年,随着键合工艺、堆叠层数持续升级,目标将CPU核心频率推向5GHz以上。

逻辑折叠还给芯片带来双重工作模式。除了等性能下省电低温,开启涡轮增压模式时,麒麟2026的NPU算力可达70 TOPS,相比前代提升141%,GPU帧率提升42%。此时芯片功率密度会随之升高,系统可以根据场景,在极致省电与极限性能之间灵活切换。

在热设计层面,华为没有盲目全盘堆叠所有电路,而是采用选择性折叠,结合热感知布局,交错排布高温、低温逻辑模块,规避热点上下层直接叠加。热量既可以多层分摊,也能够优先横向扩散,晶体管结温被控制在安全区间,以此化解3D堆叠的局部发热风险。

文章同时类比软件工程领域著名的阿姆达尔定律,提出硬件侧的对应思想:芯片串行逻辑占比有限,大部分电路可以牺牲单线程速度换取大规模并行。软硬件协同调度,把任务更多分发到大量并行小核,减少大核的串行负载,充分释放折叠架构的功耗优势,这也是系统-工艺协同优化(STCO)的核心理论根基。

论文也指出,τ是时间缩放定律,不等于天然低功耗。折叠架构既可以低电压低温运行,也可以拉高频率换取更强性能,低温是工程师主动做出的取舍,并非技术自带效果。迭代不会停止,每一代芯片拿到折叠带来的时间裕量之后,再将其转化为功耗或者性能收益,循环往复,持续推动芯片进步。