- 专业PCB设计平台 20年专业经验 - 专业PCB设计平台 20年专业经验

展开 关闭
官方QQ - 电子设计有限公司
QQ
567463954
官方微信 - 电子设计有限公司
微信
官方二维码 - 电子设计有限公司
留言咨询
留言
联系电话
电话
400-87053771
联系邮箱
邮件
pocketGames@lnlhmq.com
Banner 新闻动态 - 电子设计有限公司

新闻动态

News
返回首页
公司新闻
公司新闻
打造“AI工厂”,摩尔线程为什么强调系统级创新?

2025-07-29 17:30:47

点击数 415

【导语】在2025年世界人工智能大会(WAIC)开幕前夕,摩尔线程举行了一场技术分享会,揭开了其打造高效“AI工厂”的神秘面纱。摩尔线程创始人兼CEO张建中提出,面对全球前沿模型智力迅猛增长和迭代速度加快的挑战,摩尔线程将通过系统级技术创新与工程化能力,以全功能GPU、MUSA架构等五大技术为核心,构建用于生产智能的AI工厂。这一工厂旨在解决大模型训练效率瓶颈,满足新一代高性能人工智能计算基础设施的迫切需求,为我国AI算力行业赢得国际竞争提供重要技术支撑。

7月25日,摩尔线程在世界人工智能大会(WAIC 2025)开幕前夕举行技术分享会。会上,摩尔线程创始人兼CEO张建中表示,将以系统级技术创新与工程化能力打造用于生产智能的“AI工厂”。在他看来,“AI工厂”,如同芯片晶圆厂的制程升级,是一个系统性、全方位的变革,需要实现从底层芯片架构创新、到集群整体架构的优化,再到软件算法调优和资源调(diào)度(dù)系(xì)统(tǒng)的(de)全面(miàn)升(shēng)级(jí)。

AI工(gōng)厂(chǎng)的(de)生(shēng)产(chǎn)效(xiào)率(lǜ)取(qǔ)决(jué)于(yú)加(jiā)速(sù)计(jì)算(suàn)通(tōng)用(yòng)性(xìng)、单(dān)芯(xīn)片(piàn)有(yǒu)效(xiào)算(suàn)力(lì)、单(dān)节(jié)点(diǎn)效(xiào)率(lǜ)、集群(qún)效(xiào)率(lǜ)、集群(qún)稳(wěn)定(dìng)性(xìng),这(zhè)五(wǔ)大(dà)元(yuán)素(sù)相(xiāng)互(hù)配(pèi)合(hé),缺(quē)一(yī)不(bù)可(kě)。与(yǔ)之(zhī)相(xiāng)对(duì)应(yīng),摩(mó)尔(ěr)线(xiàn)程(chéng)以(yǐ)全功(gōng)能(néng)GPU、MUSA架(jià)构(gòu)、MUSA软(ruǎn)件(jiàn)栈(zhàn)、KUAE集群(qún)、零(líng)中(zhōng)断(duàn)五(wǔ)大(dà)技(jì)术(shù),满(mǎn)足(zú)AI工(gōng)厂(chǎng)对(duì)生(shēng)产(chǎn)效(xiào)率(lǜ)的(de)要(yào)求(qiú)

image001.j

张(zhāng)建(jiàn)中(zhōng)在(zài)技(jì)术(shù)分(fēn)享(xiǎng)会(huì)上(shàng)介(jiè)绍(shào)摩(mó)尔(ěr)线(xiàn)程(chéng)高(gāo)效(xiào)AI工(gōng)厂(chǎng)打(dǎ)造(zào)方(fāng)案(àn)

为(wèi)何(hé)要(yào)打(dǎ)造(zào)“AI工(gōng)厂(chǎng)”?

全球(qiú)前(qián)沿(yán)模(mó)型(xíng)“智(zhì)力(lì)”正(zhèng)迅(xùn)猛(měng)增(zēng)长(zhǎng)。模(mó)型(xíng)产(chǎn)业(yè)竞(jìng)争(zhēng)激(jī)烈(liè),迭(dié)代(dài)速(sù)度(dù)愈(yù)来(lái)愈(yù)快(kuài)。全球(qiú)代(dài)表(biǎo)性(xìng)模(mó)型(xíng)的(de)迭(dié)代(dài)周(zhōu)期(qī),从(cóng)5—6个(gè)月(yuè)逐(zhú)渐(jiàn)缩(suō)减(jiǎn)到(dào)1个(gè)月(yuè),甚(shén)至(zhì)近(jìn)期(qī)每(měi)周(zhōu)都(dōu)有(yǒu)新(xīn)的(de)模(mó)型(xíng)智(zhì)能(néng)水(shuǐ)平(píng)超(chāo)越(yuè)行(xíng)业(yè)既(jì)有模型。以人类智力水平100分为标(biāo)准(zhǔn),DeepSeek V3在(zài)2024年(nián)12月(yuè)推(tuī)出时,评分为46分;今年5月推出的DeepSeek R1,智力水平已经能够达到68分。在不到半年的时间内,DeepSeek智能水平提升了50%以上。

这种高频迭代不仅体现在大型语言模型(LLM)上,还同步扩展至多模态模型、语音模型、世界模型等前沿模型领域。这些模型在性能、效率和应用场景上实现的指数级突破,不仅推动了AI从专用领域向通用智能的跨越,其快速迭代的特性更对新一代高性能人工智能计算基础设施提出了迫切需求。

而训练具有高智能水平的模型,首先要算力足够高、效率足够高,才可以成为有效的算力。

张建中在主题演讲中表示,为应对生成式AI爆发式增长下的大模型训练效率瓶颈,摩尔线程旨在通过系统级创新,将全功能GPU加速平台的强大潜能,转化为工(gōng)程级的训练效率与可靠性,为AGI时代打造生产先进模型的“超级工厂”

相较于海外行业头部企业代表,我国万卡以上算力集群搭建仍处于追赶状态。对于我国AI算力行业而言,部署规模更大、高效高可靠的大规模算力集群,仍是赢得国际竞争的重要技术路线。

何以提升单芯片有效算力?

算力芯片是AI工厂的技术基座。如果算力芯片不够通用、性能不够强,效率不够高,AI工厂的地基就不够牢。芯片运算效率高低取决于芯片架构、驱动性能、算子优化程度等多维因素。

在实际应用中,芯片算力很少能够达到理论峰值算力,实际运行算力与产品设计理论算力之间存在差值。而好的芯片架构,应该像一个优秀的管理者一样,通过调度使所有的(de)资源“忙”起来。

记者注意到,摩尔线程正在以多种方式提升芯片实际应用算力。

image002.j

摩尔线程在WAIC 2025展示全功能GPU在不同(tóng)场(chǎng)景(jǐng)中(zhōng)的(de)应(yīng)用(yòng)实(shí)例(lì)

MUSA(Meta-computing Unified System Architecture,即(jí)元(yuán)计(jì)算(suàn)统(tǒng)一(yī)架(jià)构(gòu))是(shì)摩(mó)尔(ěr)线(xiàn)程(chéng)自(zì)研(yán)架(jià)构(gòu),其(qí)核(hé)心(xīn)理(lǐ)念(niàn)是(shì)——要(yào)做(zuò)多(duō)引(yǐn)擎(qíng)可(kě)配(pèi)置(zhì)的(de)统(tǒng)一(yī)系(xì)统(tǒng)架(jià)构(gòu)。

首(shǒu)先(xiān)是多引擎,体现在单颗GPU芯片上同时支持AI计算、图形渲染、物理仿真和科学计算、超高清编解码技术,目前国内只有以摩尔线程为代表的少数GPU厂商具备全功能能力。

其次,该架构采用统一的MUSA编程接口,提供统一的API。这样一来,开发者采用一套编程指令集就能驱动在MUSA架构之下的多种算力引擎。

为了更好地调动存算资源,摩尔线程自主研发的加速引擎——张量计算引擎(TCE)和张量访存引擎(TME)。前者将大大小小各种不同的复杂结构(gòu)高(gāo)效(xiào)组(zǔ)合(hé)起(qǐ)来(lái),同时具备高精度累加器,能够降低小数累入损失。后者用以充分发挥存储的效率,支持Img2Col、矩阵转置,能够加速前、后处理。

即便是国际GPU头部企业,也仍然存在通信任务占用计算资源的问题。而将原本可用于计算的处理器用于通信,会损失运算效率。为解决这一问题,摩尔线程开发了ACE(异步通信引擎),能够实现异步DMA搬移,同时不占用计算核的资源和访存带宽,减少了15%的计算资源损耗;内嵌同步机制,能够提高跨引擎协同性能;采用多种访存地址(zhǐ)计(jì)算模式,提高搬移效率。

不(bù)仅(jǐn)如(rú)此(cǐ),在(zài)计(jì)算(suàn)层(céng)面(miàn),摩(mó)尔(ěr)线(xiàn)程(chéng)的(de)AI加(jiā)速(sù)系(xì)统(tǒng)全面(miàn)支(zhī)持(chí)INT8/FP8/FP16/BF16/TF32等(děng)多(duō)种(zhǒng)混(hùn)合(hé)精(jīng)度(dù)计(jì)算(suàn)。作(zuò)为国内首批实现FP8算力量产的GPU厂商,其FP8技术通过快速格式转换、动态范围智能适配和高精度累加器等创新设计,在保证计算精度的同时,将Transformer计算性能提升约30%。

何以实现高效节点、集群算力?

软件生态被视为芯片企业的“护城河”。摩尔线程着力建设的MUSA软件栈正成为其全功能GPU性能发挥的有力支撑。

基于推理场景对Kernel延时敏感的现状,MUSA的驱动和运行时库,能够帮助用户实现Kernel launch开销缩减:通过软硬协同,核函数启动延迟降低至业界平均水平的50%;近千次的计算和通信任务下发开销,由近千次优化为单次,GPU等待时间大大缩减(jiǎn);借(jiè)助引擎间依赖解析技术,任务流之间的依赖解析延时可大幅降低至1.5μs,优于业界头部算力卡。

image003.png

MUSA算子库提升了芯片计算效率

算子库的效率直接关乎分布式集群的训练效率。

当前,MUSA能够提供三大算子库:极致性能muDNN、易用的MUTLASS、MUSA AI Tensor Engine开源推理算子库

其中,muDNN是一款极致性能的开箱即用标准算子库,完整覆盖常见的前向和反向算子。能够支持完整的XMMA,支持Tensor Core全精度(dù)及(jí)所(suǒ)有(yǒu)量(liàng)化(huà)模(mó)式(shì),以(yǐ)及(jí)常(cháng)用(yòng)的(de)神(shén)经(jīng)网(wǎng)络(luò)算(suàn)子(zi)操(cāo)作(zuò)。当(dāng)前(qián),业(yè)内(nèi)算(suàn)子(zi)矩(ju)阵乘法的效率大部分可以做到90%以上,摩尔线程muDNN矩阵乘法算子效率可达到98%。国际一流厂商Flash Attention算子效率约为75%,而muDNN的Flash Attention能够达到95%。

MUTLASS高性能的线性代数模板库,可极大降低在MUSA环境中自定义算子的开发工作量,相当于提供了一个可供二次开发的模板。当前MUTLASS已在Github上开源,支持平湖架构所有特性,同时提供高性能矩阵乘法、卷积算子实现,在Kernel中调用模板库就可以进行二次开发。

此外,摩尔线程即将发布的面向大语言模型的开源推理算子库MUSA AI Tensor Engine,能够帮助开发者快速搭建自定义推理引擎。该算子库提供用户友好的Python API,进一步降低开发者使用门槛,只要会Python就可以调用。

大模型训练动辄需要调动几千张甚至几万张算力卡资源。要实现模型的高效训练,不仅单卡性能要高,还需要有强大的集群管理和调度能力。

image004.j

摩尔线程在WAIC 2025现场展示KUAE夸娥智算集群

摩尔线程自研的夸娥(KUAE)计算集群,集成了计算集群、软件平台、管理系统、优化系统以及维护和服务等一系列流程。整合数据、模型、张量、流水线和专家并行技术,全面支持Transformer等主流(liú)架(jià)构(gòu);支(zhī)持(chí)端(duān)到(dào)端的模型训练,能够实现对混合专家模型、自动驾驶模型、视频生成模型、具身智能模型等多种类模型的全面支持。

在构建高效集群的基础上,稳定可靠的运行环境是“AI工厂”持续产出的保障。在万卡级AI集群中,硬件故障导致的训练中断会严(yán)重(zhòng)浪(làng)费(fèi)算(suàn)力(lì),甚(shén)至(zhì)会(huì)导(dǎo)致(zhì)训(xun)练(liàn)团(tuán)队(duì)几(jǐ)个(gè)月(yuè)的(de)努(nǔ)力(lì)付(fù)诸(zhū)东(dōng)流(liú)。

为(wèi)此(cǐ),摩(mó)尔(ěr)线(xiàn)程(chéng)推(tuī)出(chū)零(líng)中(zhōng)断(duàn)容(róng)错(cuò)技(jì)术(shù),故(gù)障(zhàng)发(fā)生(shēng)时(shí)仅(jǐn)隔(gé)离(lí)受(shòu)影(yǐng)响(xiǎng)节(jié)点(diǎn)组(zǔ),其(qí)余(yú)节(jié)点(diǎn)继(jì)续(xù)训(xun)练(liàn),备(bèi)机(jī)无(wú)缝(fèng)接(jiē)入(rù),全程(chéng)无(wú)中(zhōng)断(duàn)。这(zhè)一(yī)方(fāng)案(àn)使(shǐ)KUAE集群(qún)有(yǒu)效(xiào)训(xun)练(liàn)时(shí)间(jiān)占(zhàn)比(bǐ)超(chāo)99%,大(dà)幅(fú)降(jiàng)低(dī)恢(huī)复(fù)开(kāi)销(xiāo)。同(tóng)时(shí),KUAE集群(qún)通(tōng)过(guò)多(duō)维(wéi)度(dù)训(xun)练(liàn)洞(dòng)察(chá)体(tǐ)系(xì)实(shí)现(xiàn)动(dòng)态(tài)监(jiān)测(cè)与(yǔ)智(zhì)能(néng)诊(zhěn)断(duàn),将(jiāng)异(yì)常(cháng)处(chù)理(lǐ)效(xiào)率(lǜ)提(tí)升(shēng)50%;结(jié)合(hé)集群(qún)巡(xún)检(jiǎn)与(yǔ)起(qǐ)飞(fēi)检(jiǎn)查(chá),训(xun)练(liàn)成(chéng)功(gōng)率(lǜ)提(tí)高(gāo)10%,为(wèi)大(dà)规(guī)模(mó)AI训(xun)练(liàn)提(tí)供(gōng)稳(wěn)定(dìng)了(le)保(bǎo)障(zhàng)。


列表新闻列表