DeepSeek撬开ASIC时代大门?
近(jìn)日(rì),DeepSeek研(yán)究(jiū)团(tuán)队(duì)再(zài)放(fàng)大(dà)招(zhāo),公(gōng)开(kāi)NSA算(suàn)法(fǎ)。同(tóng)日(rì),马(mǎ)斯(sī)克(kè)发(fā)布(bù)Grok 3模(mó)型(xíng),试(shì)与(yǔ)DeepSeek和(hé)Open AI来(lái)比(bǐ)高(gāo)。此(cǐ)外(wài),Open AI首(shǒu)款(kuǎn)AI ASIC芯(xīn)片(piàn)即(jí)将(jiāng)完成,有望明年量产.....
DeepSeep之风正盛,将全球科技产业的重心从训练推向AI时代下半程的推理阶段。随着算力需求节节高升,ASIC芯片在这股气势汹涌的浪潮之下,得以有更多(duō)机(jī)会(huì)在(zài)定(dìng)制(zhì)化场景中大显身手。值此之际,属于ASIC定制化芯片的时代之幕是否由此拉开?

打破AI芯片的旧范式
2025年开年以来,一场由DeepSeek引发的“科技风暴”迅速席卷全球:英伟达称DeepSeek-R1是最先进的大语言模型;亚马逊和微软宣布接入DeepSeek-R1模型;DeepSeek-R1、V3、Coder等系列模型陆续上线国家超算互联网平台;微信宣布接入DeepSeek,上线AI搜索功能......
在各类“DeepSeek”消息满天飞的背后,一方面反映出全球科技企(qǐ)业(yè)在(zài)这(zhè)一(yī)开(kāi)源(yuán)AI模(mó)型(xíng)到(dào)来(lái)后(hòu)的(de)焦(jiāo)虑(lǜ)或(huò)兴(xìng)奋(fèn),但(dàn)另(lìng)一(yī)更(gèng)为(wèi)深(shēn)层(céng)的(de)原(yuán)因(yīn)是(shì):DeepSeek的(de)出(chū)现(xiàn)打(dǎ)破(pò)了(le)一(yī)直(zhí)以(yǐ)来(lái)模(mó)型(xíng)对(duì)于(yú)硬(yìng)件(jiàn)算(suàn)力(lì)预设的包袱,或将塑造AI产业发展的全新生态。
芯片作为支撑人工智能发展的算力底座,与大模型的训练效率和推理速度直接相关,其中自去年下半年迅速崛起的ASIC尤为值得关注。
ASIC芯片是指专为特定应用而设计的集成电路。由于ASIC芯片针对特定算法和应用进行优化设计,它在特定任务上的计算能力强大,通常具有较高的能效比。在AI领域,AI ASIC芯片也叫AI算力专用芯片,是作为人工智能产业链(liàn)的(de)上(shàng)游(yóu)产(chǎn)品(pǐn)之(zhī)一(yī),为(wèi)整(zhěng)个(gè)人(rén)工(gōng)智(zhì)能(néng)的(de)大(dà)模(mó)型(xíng)训(xun)练(liàn)和(hé)推(tuī)理(lǐ)提(tí)供(gōng)算(suàn)力(lì)支(zhī)撑(chēng),主要(yào)面(miàn)向(xiàng)深(shēn)度(dù)学(xué)习(xí)、神(shén)经(jīng)网(wǎng)络训练/推理等AI任务而定制。DeepSeek 的问世,提供了“极致压缩+高效强化训练+AI推理算力大幅简化”的低成本新模式,推动ASIC时代加速到来。

图为中昊芯英高(gāo)性(xìng)能(néng)TPU芯(xīn)片(piàn)“刹(shā)那(nà)”
“DeepSeek 将(jiāng)软(ruǎn)硬(yìng)件(jiàn)协(xié)同(tóng)优(yōu)化(huà)推(tuī)向(xiàng)了(le)极(jí)致(zhì)的(de)路径,本(běn)质(zhì)上(shàng)打(dǎ)破(pò)了(le)AI芯(xīn)片(piàn)领(lǐng)域‘生(shēng)态(tài)霸(bà)权(quán)决(jué)定(dìng)市(shì)场(chǎng)格(gé)局(jú)’的(de)旧(jiù)范(fàn)式(shì),开(kāi)启(qǐ)了(le)‘算(suàn)法(fǎ)定(dìng)义(yì)硬(yìng)件(jiàn)’的(de)新(xīn)竞(jìng)争(zhēng)维(wéi)度(dù)。”中(zhōng)昊(hào)芯(xīn)英(yīng)解(jiě)决(jué)方(fāng)案(àn)架(jià)构(gòu)师(shī)顾(gù)立(lì)程(chéng)向(xiàng)《中(zhōng)国(guó)电(diàn)子(zi)报(bào)》记(jì)者(zhě)表(biǎo)示(shì)。
具(jù)体(tǐ)而(ér)言(yán),DeepSeek对(duì)ASIC芯(xīn)片(piàn)的(de)影(yǐng)响(xiǎng)体(tǐ)现(xiàn)在(zài)以(yǐ)下(xià)三(sān)方(fāng)面(miàn)。
一(yī)是(shì)在(zài)技(jì)术(shù)路线(xiàn)重(zhòng)构(gòu)方(fāng)面(miàn),产(chǎn)生(shēng)了(le)架(jià)构(gòu)定(dìng)义(yì)权(quán)的(de)转(zhuǎn)移(yí)。过(guò)去(qù)开(kāi)发(fā)者(zhě)因(yīn)CUDA工(gōng)具(jù)链(liàn)完(wán)备(bèi)性(xìng)被(bèi)迫(pò)绑(bǎng)定(dìng)NVIDIA硬(yìng)件(jiàn),但(dàn)DeepSeek绕(rào)过(guò)了(le)CUDA的(de)优(yōu)化(huà)策(cè)略(è),证(zhèng)明(míng)直(zhí)接(jiē)操(cāo)作(zuò)PTX指(zhǐ)令(lìng)的(de)收(shōu)益(yì)已(yǐ)超(chāo)越(yuè)工(gōng)具(jù)链(liàn)便(biàn)利(lì)性(xìng)成(chéng)本(běn),DeepSeek的(de)成(chéng)功(gōng)实(shí)践(jiàn)验(yàn)证(zhèng)了(le)算法主导的硬件设计范式,为TPU等ASIC芯片突破生态桎梏提供了方法论。
二是为生态破局提供契机,从"适配生态"到"定义生态"。CUDA生态的依赖降低后,ASIC芯片将能通过提供定制化工具链、优化编译器等方式,吸引到更多开发者,尤其是已有意愿做底层优化的客户。此外,AI芯片在架构设计上更能灵活适应新的本土趋势和需求,比如支持动态稀疏计算或混合精度。
三是ASIC芯片商业价值的跃升,从"替代品"到"最优解"。当硬件性能差异足够大时,细分领域客户将更愿意为ASIC芯片的定制优化方案买单。尤其是,DeepSeek式技术路线能与国产ASIC芯片协同,通过本土模型与算力厂商间更紧密的合作、更极致的适配优化,为客户提供最具性价比的算力。
算力的风吹向推理
AI计算分为训练和推理两种。在AI大模型的下半场,算力需求的重心正在逐步从训练转向推理。在温哥华NeurIPS大会上,OpenAI联合创始人兼前首席科学家Ilya Sutskever曾作出“AI预训练时代将终结”的判断。而DeepSeek的到来,也预示着这一过程的临近。
就在2月18日,DeepSeek研究团队在海外社交平台X上发布了一篇关于NSA(原生稀疏注意力)的技术论文。一经发布,迅速引发广泛关注。据悉,新注意力机制NSA专(zhuān)为(wèi)长(zhǎng)文本(běn)训(xun)练(liàn)与(yǔ)推(tuī)理(lǐ)设(shè)计(jì),能(néng)利(lì)用(yòng)动(dòng)态(tài)分(fēn)层(céng)稀(xī)疏(shū)策(cè)略(è)等(děng)方(fāng)法(fǎ),通(tōng)过(guò)针(zhēn)对(duì)现(xiàn)代(dài)硬(yìng)件(jiàn)的(de)优(yōu)化(huà)设(shè)计(jì),显(xiǎn)著(zhe)优(yōu)化(huà)传(chuán)统(tǒng)AI模(mó)型(xíng)在(zài)训(xun)练(liàn)和推理过程中的表现,特别是提升长上下文的推理能力,在保证性能的同时提升了推理速度,并有效降低了预训练成本。
对于ASIC而言(yán),机(jī)会(huì)蕴(yùn)藏(cáng)在(zài)从(cóng)业(yè)者(zhě)阵(zhèn)营(yíng)的(de)扩(kuò)张(zhāng)。在(zài)ASIC芯(xīn)片(piàn)的(de)分(fēn)支(zhī)中(zhōng),TPU和(hé)LPU这(zhè)两(liǎng)类(lèi)芯(xīn)片(piàn)都(dōu)有(yǒu)望(wàng)在(zài)DeepSeek的(de)浪(làng)潮(cháo)下(xià)受(shòu)益(yì)。

LPU与GPU(来源:Groq官网)
早在今年1月就有消息传出,美国推理芯片公司Groq已经在自己的LPU芯片上实机运行DeepSeek,效率比最新的H100快上一个量级,达到每秒24000token。值得关注的是,Groq曾于2024 年12月在沙特阿拉伯达曼构建了中东地区最大的推理集群,该集群包括了19000个Groq LPU。
而(ér)在TPU方面,据产业链相关人士透露,谷歌TPU芯片去年的生产量已经达到280万到300万片之间,成为全球第三大数据中心芯片设计厂商。
随着AI大模型进入“下半场”,逻辑推理成为新的焦点。这一阶段对算力的需求虽然不如训练阶段那么高,但对能效和成本的要求更为严格。ASIC芯片由于其高度优化的设计和针对特定任务的高效性,在AI推理领域具有显著优势。“AI专用芯片推理服务器的占比将逐步提升,这将使得AI专用芯片在推理市场上占据重要地位。”顾立程表示。
GPU地位被撼动?
DeepSeek的出圈,最先带来的影响是令长期占据算力主力军地位的GPU陷入焦虑,尤其是全球最大数据中心GPU供应商英伟达的股价(jià)和(hé)市(shì)值(zhí)曾(céng)一(yī)度(dù)下(xià)挫(cuò)。相(xiāng)比(bǐ)之(zhī)下(xià),被(bèi)视(shì)为(wèi)挑(tiāo)战(zhàn)GPU“挑(tiāo)战(zhàn)者(zhě)”的(de)ASIC芯(xīn)片(piàn)则(zé)迎(yíng)来(lái)了(le)更上一层楼的时机。那么,这是否预示着未来AI芯片的版图将出现剧烈的反转?

就在DeepSeek让行业对AI算力需求的视线中心从训练转向推理之际,一个被称为“杰文斯悖论”的经济学理论被业界重新提及。1865年,经济学家杰文斯提出:当技术进步提高了效率,资源消耗不仅没有减少,反而激增。例如,瓦特改良的蒸汽机让煤炭燃烧更加高效,但结果却是煤炭需求飙升。
上述理论与当下GPU芯片遇到的情况类似。面对“DeepSeek危机”的英伟达股价曾一度大跌17%,但截止2月19日已恢复(fù)到(dào)此前高位水平,从侧面反映了AI行业对GPU芯片需求的认知变化。AI推理芯片初创企业Groq公司CEO乔纳森·罗斯在近日的访谈对此事发表了看法,他认为英伟达的股票不应该为此下跌。这与市场的价值衡量无关,而只是市场中一种人气的较量。“实际上,我认为英伟达会卖掉他们生产的(de)每一块用于训练的GPU。你会看到相同数量的 GPU仍然会被售出,但对训(xun)练(liàn)的(de)需(xū)求(qiú)会(huì)增(zēng)加(jiā)。因(yīn)为(wèi)对(duì)推(tuī)理(lǐ)的(de)需(xū)求越多,需要的训练芯片就越多,反之亦然。”
一般来说,被广泛采用的(de)英(yīng)伟(wěi)达(dá)GPU芯(xīn)片(piàn)更(gèng)多(duō)被(bèi)用(yòng)来(lái)进(jìn)行(xíng)AI大(dà)模(mó)型(xíng)训(xun)练(liàn),而(ér)到(dào)了(le)推(tuī)理(lǐ)阶(jiē)段(duàn),一(yī)些(xiē)厂(chǎng)商(shāng)开(kāi)始(shǐ)着(zhe)力(lì)开(kāi)发(fā)自(zì)己(jǐ)的(de)AI推(tuī)理(lǐ)芯(xīn)片(piàn),其(qí)中(zhōng)多(duō)为(wèi)ASIC定(dìng)制(zhì)化(huà)芯(xīn)片(piàn)。不(bù)同(tóng)的(de)是(shì),在(zài)DeepSeep助(zhù)力(lì)下(xià),以(yǐ)前(qián)行(xíng)业(yè)更(gèng)关注(zhù)决(jué)定(dìng)下(xià)限(xiàn)的(de)训(xun)练(liàn)阶(jiē)段(duàn),如(rú)今(jīn)或(huò)将(jiāng)更(gèng)多(duō)注(zhù)意(yì)力(lì)放(fàng)到(dào)决定上限的推理阶段。有业内人士指出,GPU与ASIC之间并非简单的替代关系。
不过,虽然作为开(kāi)源(yuán)推(tuī)理(lǐ)模(mó)型(xíng)的(de)DeepSeek令(lìng)推(tuī)理需求受到更多关注,但ASIC芯片的崛起将在训练和推理两个角度都会对算力芯片的竞争格局带来深远变化。
从训练角度来看,过去传统GPU凭借其强大的并行计算能力,在AI训练阶段占据了主导地位。然而,AI专用芯片针对特定场景设计,在拥(yōng)有(yǒu)配(pèi)套的软硬件全栈生态下,AI专用芯片算力集群的算力利用效率更高,功耗更低。随着软件生态的逐步成熟,AI专用芯片有望更广泛地应用于AI训练,与传统GPU形成竞争态势。另外,随着AI专用芯片使用的规模扩大,也会让AI专用芯片的单芯片成本逐渐降低,为智算中心建设带来切切实实的采购成本降低,并提升了应用端的能力。
“AI专用芯片的崛起将使得算力芯片的竞争格局更加多元化和复杂化。”在顾立程看来,在训练和推理两个领域,AI专用芯片都将与GPU展开激烈竞争,挑战其霸主地位。同时,AI专用芯片的应用前景也极为广阔,有望在数据中心、云计算、人工智能等多个领域发挥重要作用。