工程架构◆ AI 生成 · 已溯源

不追制程、不靠 HBM、不复制 GPU:东方算芯首颗 AI 芯片 DF1000 的“搬得快”新范式

不追制程、不靠 HBM、不复制 GPU:东方算芯首颗 AI 芯片 DF1000 的“搬得快”新范式
结论前置 / TL;DR

东方算芯发布国内首颗软件定义近存计算 3D AI 芯片 DF1000,主打推理时代“搬得快”而非“算得快”,以全国产供应链流片、128 卡集群验证给出一条差异化路径。

推理时代改写游戏规则

过去几年 AI 芯片几乎遵循同一条路径:更先进的制程、更大的 GPU 集群、更高的算力。但推理时代到来,规则开始改变——模型不再只追求训练速度,更关注推理成本、Token 吞吐与部署效率,能源、制造工艺和供应链的制约也日益凸显。7 月的首届发布会上,东方算芯推出国内首颗采用“软件定义近存计算”的 3D AI 芯片 DF1000,并完成了一系列工程验证:全国产供应链流片制造、128 卡集群在真实业务中稳定运行、全栈软件生态同步搭建。

真正稀缺的可能是能源

香港工程院院士郑光廷指出,AI 发展正受到物理世界的约束。国际能源署(IEA)数据显示,AI 专用数据中心用电量 2025 年增长 50%,远高于数据中心整体 17% 的增速;Gartner 预测到 2030 年,面向 AI 负载优化的服务器将占数据中心电力消耗的近一半。他认为,未来真正稀缺的未必是算力,而可能是能源——如何在有限能源下释放更多有效算力,是全行业的共同命题。

从“算得快”到“搬得快”

东方算芯副总裁郭炜分析:占训练计算量约 70% 的预训练是计算密集型任务,芯片计算能力仍是训练效率核心;但推理逻辑截然不同——当参数相对固定,系统需不断读取模型权重与 KV Cache 再生成 Token,芯片竞争的重点正从“算得快”转向“搬得快”。推理中 Decode 阶段占时间大头,其 Token 吞吐高度依赖计算单元与存储单元之间的访存带宽。

国产 GPU 的两道坎

郭炜坦言,训练侧越来越依赖先进制程——国际领先已进 3 纳米,而国内可获取的先进工艺仍以 14 纳米级为主,工艺代差直接限制提升空间;推理侧瓶颈则转向存储与互联——先进 HBM 决定单卡带宽上限但供应受限,高速 I/O 密度也受制造工艺制约。更本质的是,北京超弦存储器研究院执行副院长赵超指出,传统冯·诺依曼架构本身也未必是 AI 时代的最优解。DF1000 的“近存计算”,正是针对“搬得快”这一推理时代新瓶颈给出的差异化答案。

优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。