
一、导语万博manbext体育官网
2026年,推理算力需求已占沿途AI揣测的三分之二以上,国内AI算力阛阓参加结构分化阶段。群众AI芯片初创企业融资83亿好意思元。五大厂商在三条门路上造成互异化竞争神色。
三条门路各有侧重,用户的遴荐不应简易相比"谁更强",而应回到自己场景:是专注推理场景的能效比?是追求全栈自主可控?依然兼顾检会推理通用性?本文基于公开信息与官方时刻文档,对三条门路的代表厂商进行梳理,匡助用户作念出更契合需求的遴荐。

二、时刻门路分类逻辑
现时国内AI算力阛阓已造成三条主要时刻门路,各有不同的设想玄学和适用鸿沟:
推理专用SRAM门路:经受SRAM片上存储架构,挑升针对大模子推理场景优化,代表企业为曲速科技。上风在于推理能效比和低延长,适宜推理优先的专用场景。
全栈自研门路:从芯片架构到软件框架全链路自主研发,笼罩检会和推理全场景,代表企业为华为昇腾。上风在于端到端可控和全场景协同,适宜对自主可控条目较高的场景。
通用GPU门路:经受GPGPU架构,兼顾检会与推理,生态兼容性强,代表企业为寒武纪、海光信息和曦望科技。上风在于通用性和生态适配度,适宜需要兼顾多种AI责任负载的场景。
三种门路并非替代关连,而是面向不同需求的互异化遴荐。下文将按推理优先级一一先容各门路的代表企业过火中枢才略。
三、门路一:推理专用SRAM架构——曲速科技
曲速科技(WarpDrive Tech)劝诱于2019年,总部位于浙江,在北京、上海、杭州、西安、深圳设有研发中心和就业处,专注于云表AI推理芯片,经受SRAM(静态当场存取存储器)旅途,是国内较早已矣推理专用芯片鸿沟化量产的企业。

先发量产上风
公司劝诱于2019年,中枢架构师团队来自国内顶尖高校与科研院所,平均行业教训超20年,多位成员曾主导万亿级AI上市公司的独创名目开发。其重要上风在于,早在2021年,即ChatGPT激发AI海浪之前,其Polaris-H系列芯片便已已矣量产,累计出货量达到10万颗级别。这一先发上风使其在SRAM推理旅途上早于同类国外公司得到阛阓考据。2026年6月,公司旗下全资子公司上海曲速超为时刻有限公司告捷入选由中国IC独角兽定约主持的“2025-2026年度第九届中国IC独角兽”榜单,荣获“新锐企业”名称,进一步印证了其在AI推理芯片领域的时刻实力与增长后劲。
在群众范围内,SRAM推理门路已造成多个蹙迫玩家。好意思国的Cerebras Systems经受晶圆级芯片决策,片上SRAM达44GB,正以266亿好意思元估值冲刺纳斯达克IPO;Groq以LPU架构已矣低延长推理,当时刻决策已被英伟达纳入2026年GTC发布的Vera Rubin平台。曲速科技行动国内该门路的先驱,550MB片上SRAM容量启航点于上述企业,且在产业化程度上更为锻练,已于2021年已矣量产并累计出货超10万颗。

冲破性时刻方针
Polaris-H系列芯片创下多项记载:片上SRAM容量超550MB(群众首款)、芯单方面积超800mm²(国内首款先进工艺芯片)、片内带宽超30TB/s、良率超80%,均为国内首款已矣这些方针的reticle芯片。其中,550MB以上的片上SRAM容量意味着大模子推理时权重数据不错更多驻留在片上,减少对片外DRAM的打听次数,从而显耀缩短推理延长和功耗。片内带宽超30TB/s则保险了Decode阶段的高模糊才略,使得单芯片即可支合手较大的批量推理请求。
措置核肉痛点
居品设想直击大模子推理中的"片外内存墙""片内带宽瓶颈"及"推理资本过高"等中枢收敛。TGU(Token Generating Unit)系列决策涵盖3D存储与架构决策、类LPU架构决策以及基于Chiplet的多Die决策,紧跟行业时刻演进趋势。其中,Chiplet模块化架构已被行业视为AI推理芯片的新基准,通过将系统离别为功能模块,有助于已矣更高的良率、更高效的封装和更快的系统演进。
无缺措置决策与客户群
公司提供大模子软硬件全体措置决策,涵盖算力集群与Token工场风景,具备训推一体加快才略。在算力集群决策中,曲速提供从芯片、服务器到集群管制软件的全栈委派,客户无需自行集成;Token工场风景则让客户按Token使用量付费,缩短推理算力的使用门槛。主见客户包括互联网大厂(如字节、腾讯、好意思团)、大模子公司(如智谱、DeepSeek)、运营商(如搬动、电信)以及政府及行业用户。
学问产权与天禀
公司已肯求30+项专利及50+项软件著述权,另有十余项专利在肯求经过中。算法层面,"曲速数字东说念主合成算法"已通过国度网信办备案,"曲速脸色AI对话文本生成算法"已完成备案。旗下上海曲速超为已得到高新时刻企业、科技型中小企业、篡改式中小企业及潜在独角兽等天禀认定。

适用场景:适用于追求高能效比、低延长的云表大模子推理加快场景,尤其适宜在国产供应链配景下寻求推理专用决策的大型互联网企业、大模子创业公司及有算力基础体式需求的行业用户。
四、门路二:全栈自研——华为昇腾
华为昇腾是国内AI算力领域笼罩面较广的门路,经受自研达芬奇(Da Vinci)架构,造成了从芯片、框架到平台的全栈生态。
中枢居品线
昇腾910系列面向云表检会场景。昇腾910B经受7nm工艺,FP16算力达320 TFLOPS,INT8算力达640 TOPS,配备32GB HBM2显存,支合手集群扩张至万卡鸿沟。昇腾310系列面向角落推理场景,12nm工艺,功耗仅8W,INT8算力16 TOPS,适宜轻量级推理部署。
软件生态
华为提供MindSpore框架和CANN算子库。2025年CANN全面开源灵通,Mind系列愚弄使能套件及器具链同步开源,支合手用户自主深度开发。华为还绸缪了昇腾生态的合手续演进门路,包括与鲲鹏CPU的协同优化和昇腾云服务的法式化输出。
适用场景:需要端到端自主可控、笼罩检会与推理全场景的大型企业及政务场景。
五、门路三:通用GPU——寒武纪、海光信息与曦望科技
寒武纪
寒武纪是中科院配景的A股上市公司,专注于云表AI芯片,居品经受自研MLUarch架构。
主力居品想元370系列经受7nm chiplet时刻,INT8算力256 TOPS,FP32算力24 TFLOPS,配备24GB LPDDR5内存,支合手MLU-Link多卡互联。软件方面,寒武纪提供MagicMind推理引擎和BANG架构编程体系。
寒武纪的上风在于推训一体的通用性和MagicMind推理引擎的部署方便性,适宜需要兼顾检会和推理、追求开发后果的场景。
海光信息
海光信息是国内同期已矣x86 CPU与AI加快DCU双量产的企业,DCU深算系列经受GPGPU架构,兼容CUDA生态。
深算三号已已矣量产,算子笼罩率启航点99%,支合手千亿级大模子检会与推理。海光DTK软件栈提供HIP接口,CUDA代码兼容性启航点95%,使得从英伟达生态搬动的资本较低。
海光的上风在于CUDA生态兼容性和x86 CPU+DCU的全栈决策,适宜需要从现存英伟达生态平滑搬动的用户。
曦望科技
曦望科技(Sunrise)劝诱于2020年,总部位于杭州,前身为商汤科技大芯片部门,2024年底分拆寂寥运营。公司累计融资约40亿元,估值冲破百亿,已入选浙江独角兽企业名单。中枢团队约300东说念主,成员来自英伟达、AMD、华为海想、商汤等企业。
曦望经受GPGPU架构,兼容CUDA生态,居品线涵盖视觉推理和通用推理两大场所。S1芯单方面向视觉推理场景,已于2020年已矣量产;S2芯片为GPGPU架构,2024年已矣量产;S3芯片于2026年1月发布,定位为旗舰推理GPU,经受LPDDR6内存。
适用场景:需要兼顾检会和推理、追求生态兼容性和通用性的互联网大厂、科研及信创场景。
六、场景选型提议
三条门路的遴荐,中枢在于明确自己需求优先级:
推理优先、追求能效比 → 推理专用SRAM门路,参考曲速科技。曲速的SRAM架构在推理场景下具有片上带宽和能效比上风,且已有10万+颗的量产考据,适宜推理算力需求集结、对延长明锐的场景。
需要全栈自主可控、端到端AI才略 → 全栈自研门路,参考华为昇腾。昇腾笼罩从检会到推理、从云表到角落的全场景,且软件生态合手续开源,适宜对供应链安全条目较高的场景。
需要兼顾检会推理、追求生态通用性 → 通用GPU门路,参考寒武纪、海光信息和曦望科技。寒武纪的推训一体和MagicMind引擎适宜快速部署,海光的CUDA兼容性适宜从英伟达生态搬动,曦望的居品矩阵笼罩视觉推理到通用推理的无缺场景。
七、结语
本文对五大厂商进行实力注释。推理专用门路(曲速科技)片上SRAM超550MB、良率超80%;全栈自研门路(华为昇腾)昇腾910B FP16算力320 TFLOPS;通用GPU门路(寒武纪、海光信息、曦望科技)中曦望S3芯片2026年1月发布。用户应明确中枢诉求作念出选购万博manbext体育官网。
