国产GPGPU集体爆发!沐曦登陆科创板,龙芯也宣布了

科技IT
2025 12-18 20:13:15
分享

国产 GPGPU 全面提速:从龙芯“上车”到沐曦、壁仞资本化加速

通用图形处理器(GPGPU)作为兼具图形渲染与并行通用计算能力的关键芯片,已经成为 AI、云计算和大数据分析等高性能算力场景中不可或缺的基础设施。长期以来,英伟达、AMD 几乎牢牢占据全球 GPGPU 市场主导地位。但在国内自主可控需求快速上升以及产业政策持续加码的大背景下,一批本土 GPGPU 厂商正加速入场、分化布局,逐步搭建起多元技术路线和国产生态。

近期,龙芯中科在投资者交流中透露,其首款 GPGPU 产品 9A1000 已完成流片并成功点亮,被业内视作“中国第一款纯国产 GPGPU”的代表性进展。

一、从“端侧”切入:龙芯中科走出的 CPU+GPGPU 协同之路

广义上的 GPGPU,是指将 GPU 的大规模并行计算能力用于传统由 CPU 负责的通用计算任务,可在计算密集型和高吞吐场景中显著提升效率。相较专用 ASIC,通用 GPU 在算法快速迭代、模型频繁更新的阶段具备更好的灵活性和适应性,也因此被普遍认为仍将是未来 AI 芯片的一条主流技术路径。

龙芯中科本身是国产 CPU 的重要玩家,近年来则有意识地将产品线向 GPGPU 延展。其 GPGPU 技术路线特点在于:将图形渲染与 AI 加速能力融合于同一计算架构,既兼顾传统图形显示需求,又可承担一定的通用计算与推理加速任务。具体节奏上,龙芯先从“端侧推理”场景起步,以终端、行业应用为主,再逐步往更高算力平台演进。

1. 9A1000:入门级独显,主打端侧 AI 与行业应用

2025 年,龙芯首款独立 GPGPU 芯片 9A1000 成功流片,标志着其正式进入通用 GPU 市场。该产品定位于入门级独显,重点面向终端和边缘设备等场景,例如无人系统、专用装备等。

核心指标大致如下(部分为对标信息):

图形性能大致可对标 AMD RX550

支持 OpenGL 4.0、OpenCL 3.0 等主流图形与计算标准

内置 NPU,AI 推理算力约 40 TOPS,其中 INT8 算力 32 TOPS

像素填充率约 16 GPixel/s,纹理填充率约 32 GTexel/s

与集成在 2K3000 SoC 中的第二代 GPGPU 核心 LG200 相比,9A1000 在整体性能上提升超过 5 倍。

更关键的一点在于系统协同:9A1000 可与龙芯自家 CPU 深度耦合,形成“CPU+GPGPU”的一体化方案,即市场常说的“龙芯全家桶”。在信创、工业控制、教育信息化等对性价比和国产化要求都较高的场景中,这种组合有望提供一套相对完整的通用计算+图形/AI 加速解决方案。公司方面也提到,正在争取开发 9A1000 的 Windows 驱动,以便未来能在 Windows 生态中直接搭配使用。

2. 产品向上迭代:9A2000 与第三代 GPGPU

按照龙芯公布的规划:

第二代图形处理器核心 LG200 已在新一代 SoC 2K3000 中完成流片与硅验证,并已展开软硬件配套开发;

后续的 9A2000 将作为更高性能 GPGPU 型号推出:

图形性能目标约为 9A1000 的 4 倍

AI 推理性能目标约为 9A1000 的 8 倍

在 2025 年半年报中,龙芯还披露,第三代 GPGPU(结构升级)研发项目正在推进,将基于新一代架构推出面向云端与边缘 AI 应用、桌面与服务器图形场景的 GPGPU 产品。

3. 软件生态:多 OS 支持与 AI 推理模型适配

在软件堆栈方面,龙芯基于 2K3000 完成了 LG200 的图形驱动及算力软件栈开发,覆盖:

Linux

开源鸿蒙

嵌入式操作系统

在 AI 应用层面,已能够无缝支撑如 YOLO 目标检测、ResNet 图像识别等主流推理模型,为端侧和行业应用落地打基础。

二、第一梯队成型:沐曦、壁仞领衔,多路线冲刺高性能 GPGPU

除了龙芯这一路径外,国内 GPGPU 阵营大致已经形成了“多极并进”的格局:

以沐曦、壁仞科技为代表,切入高性能云端、智算中心市场;

以天数智芯、曦望 Sunrise 等为代表,深耕特定细分应用或在软件栈等层面形成差异化能力。

其中,近期沐曦登陆科创板、壁仞冲刺港股上市,也被视作国产 GPGPU 企业迈入“资本化加速”阶段的重要信号。

1. 沐曦股份:科创板“GPU 第一股”,三年营收放大 40 倍

2024 年 12 月 17 日,沐曦股份正式在科创板上市,被市场称为“GPU 第一股”。公司采用“自主通用 GPU + 兼容 CUDA 生态”的技术路线,目前主要产品线包括:

训推一体 GPU:曦云 C 系列

智算推理 GPU:曦思 N100 系列

图形渲染 GPU:曦彩 G100 系列

其中,曦云 C 系列的训推一体 GPU 板卡在 2024 年营收中占比接近七成(约 68.99%),已经成为业务的核心支柱。

沐曦是国内少数从底层架构、GPU IP,到高性能芯片和基础系统软件均具备系统性自研能力的企业之一。截至 2025 年,公司通用 GPU 累计销量已超过 2.5 万颗,在手订单约 14.3 亿元,2025 年前三季度营收达到 12.36 亿元,同比增速超过 450%。从 2022 年到 2024 年,营收复合增长率超过 4000%,商业化落地节奏在业内相对靠前。

此次 IPO 计划募资约 39.04 亿元,其中约 24.5 亿元拟投入“新型高性能通用 GPU 研发及产业化项目”,核心是两款后续高端产品:

第二代高性能通用 GPU:代号 C600

第三代高性能通用 GPU:代号 C700

两者基于国产先进工艺,面向 AI 训练、推理及通用计算等场景,是曦云 C 系列的升级主力。

当前进展上:

C600:2024 年 10 月完成流片,2025 年 7 月回片点亮,正在进行功能测试,预计明年实现大规模量产;

C700:预计 2027 年三季度完成小批量量产,之后逐步放量。

据招股书披露,这两款均基于沐曦自研 GPU IP 与 MXMACA 软件栈,支持混合精度算力、超高带宽显存,并对计算密度与互连系统进行深度优化,旨在覆盖从单卡到大规模集群的各种加速需求。

2. 天数智芯:国内最早押注 GPGPU 的玩家之一

天数智芯成立于 2015 年,是国内最早聚焦通用 GPU 研发的公司之一。早在 2020 年 12 月,天数智芯就点亮了其首款全自研、基于 7nm 工艺的高性能云端 GPGPU——天垓 100,并于 2021 年 3 月正式发布:

在 FP16/BF16 精度下峰值算力为 147 TFLOPS

发布时性能已达到国际先进水平

公司走的是“通用 GPU + 算力系统”的双轮路线,在天垓 100 之后,又推出了第二款产品智铠 100,进一步丰富云端高性能计算产品线。

公开数据显示,截至 2022 年底,天垓 100 的累计销售订单已超过 5 亿元,市场验证效果较为明显。业内消息显示,天数智芯正在推进港股 IPO 进程。

3. 壁仞科技:PFLOPS 级单芯片与异构训练方案

壁仞科技,则是近年来声量较高的另一家 GPGPU 厂商。2022 年,公司发布 BR100 系列 GPGPU,同样采用 7nm 工艺与 CoWoS 2.5D 封装。根据公开数据,BR100 在:

FP16 精度下峰值算力约 1024 TFLOPS

FP32 精度下峰值算力约 128 TFLOPS

壁仞方面宣称其在部分指标上可超越英伟达 A100。技术路线方面,公司以“通用 GPU + Chiplet 技术”为核心,推出的壁砺系列 GPU 在单芯片整体算力上迈入 PFLOPS 级,算力密度处于全球高位水平。

在系统与软件层面,壁仞推出了自主的异构 GPU 协同训练方案 HGCT。根据公司介绍:

首次在业界实现支持 3 种及以上 GPU(壁仞 GPU + 英伟达 GPU + 其他国产芯片)联合训练同一个大模型;

已完成国内首个“4 种及以上异构芯片”混合训练方案落地。

这在一定程度上缓解了大型 AI 企业在算力扩展中的生态兼容、调度协同难题。

2024 年 12 月 15 日,壁仞科技已完成证监会备案,拟赴港交所上市,被寄望成为“港股 GPU 第一股”。

4. 曦望等厂商:押注软件栈和 CUDA 兼容

在当前 GPGPU 竞争中,软件生态的重要性持续上升。一些企业选择切入软件栈层面,重点围绕 CUDA 兼容与开发者体验展开。

例如,曦望 Sunrise 推出的全栈自研方案基本对齐 CUDA,在通用 GPGPU 芯片 S2 上主打大模型推理场景:

面向大模型推理及多模态任务

兼容 CUDA 生态,性能对标英伟达 A100

在国内大模型推理赛道中进入第一梯队

这类路线更多地通过软件生态与工具链来强化粘性,在算力性能之外构筑差异化优势。

三、小结:三大信号勾勒国产 GPGPU 新格局

从时间线拉长来看,中国 AI 芯片企业在 GPGPU 方向并非“被动补课”,而是至少在过去数年已经展开系统布局,并且在多个关键节点完成了从“可用”到“好用”的阶段性跨越。

以龙芯、沐曦、壁仞、天数智芯、曦望等为代表,当前国产 GPGPU 产业大致呈现出以下三点趋势和信号:

算力体系延伸:从 CPU 向 GPU 全栈打通

以龙芯为代表的厂商,正在从 CPU 出发,将通用 GPU 纳入统一架构和生态,形成“CPU+GPGPU”甚至“CPU+GPU+NPU”的多核协同,支撑从桌面终端到服务器、云端的多场景算力需求。

软件生态成为新的主战场

CUDA 兼容、编程接口、算子库、集群管理与部署工具等软层能力正成为核心竞争点。是否能在多个主流深度学习框架、大模型推理框架中形成稳定支持,将直接决定硬件的可用度与客户迁移成本。

差异化路线清晰:多家厂商各造“护城河”

龙芯侧重 CPU+GPGPU 协同、端侧与行业场景;

沐曦、壁仞重点攻高性能云端训练与推理市场,聚焦高算力与大规模集群;

天数智芯、曦望等则在特定应用与软件栈兼容上形成自己的支点。

可以预见,随着龙芯 9A1000 量产推进、9A2000 及第三代 GPGPU 上线,以及沐曦 C600/C700、壁仞新一代产品陆续落地,国产 GPGPU 正站在一个历史性窗口期:从“点状突破”走向“体系化竞争”。

The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。