
中国发展网讯9月21日,2026人工智能计算大会(AICC2026)在北京中关村国际创新中心举行。大会聚焦大模型、智能体加速演进带来的计算产业变革,以应用负载为牵引,汇聚芯片、系统、软件、模型与应用等产业链力量证券投资顾问可以炒股吗,展示前沿技术探索与落地实践,以开放、多元推动协同创新,共同探索适合智能体时代中国AI计算产业的发展路径,加快人工智能向现实生产力转化。
“Agent时代,计算产业衡量自身价值的方式,正从‘拥有多少算力’进一步转向‘能够支撑多强的智能,以及能够以多低的成本生产多少智能’。”浪潮信息首席AI战略官刘军表示,前沿大模型与Agent的快速发展,正在推动计算产业从“提供算力”走向“生产智能”,而突破智能上限与实现智能充分供给,将成为Agent时代AI计算发展的两个重要方向。
刘军所说的,是一场正在发生的角色转变。人工智能正在从“回答问题”走向“解决问题”:今天的Agent可以理解目标、制订计划、调用工具、执行任务并检查结果,甚至能够重新规划、再次执行;多个Agent还可以组成Agent Swarm,分工协同完成更复杂的任务。一个人的意图背后,可能是几十次、几百次甚至更多次推理,是多个Agent连续几小时甚至几天的协同工作。
在他看来,这意味着计算的对象正在被重写。“过去几十年,信息技术主要解决的是如何更高效地处理信息;而今天,大模型和Agent让技术开始规模化地提供智能本身。知识、推理、判断、创造、规划这些过去高度依赖人的能力,开始能够被计算、被复制、被调用,甚至被规模化生产。”智能一直是人类社会最重要、同时也最稀缺的资源之一,而Agent第一次让人们看到:智能正在像计算、像电一样,成为一种可以大规模生产和供给的生产要素。
两条主线:向上突破,向广普及
当智能成为可生产、可供给的生产要素,人工智能的发展随之分出了两个同样重要的方向。刘军将其概括为“向上”与“向广”。
向上,即Capability AI Compute(能力型智算),是面向智能前沿的能力型智算,回答的是“智能究竟可以有多强”。它支撑前沿模型与复杂Agent去解决过去解决不了的问题,让AI参与科学发现和复杂工程创新,帮助人类探索未知,解决过去解决不了的问题。向广,即Capacity AI Compute(容量型智算),是面向智能普及的容量型智算,回答的是“我们究竟能够拥有多少智能”。它让高水平智能越来越便宜、越来越丰富,让个人可以调用多个Agent,让中小企业也能获得过去难以长期配置的专业能力,逐步实现智能普惠。
“前沿智能能不能真正进入日常工作,取决于人们能否负担得起、能否持续使用。如果每次调用的成本都很高,再强的AI也仍然是稀缺资源。”刘军说,这两个方向不是并列的选择题,而是同一枚硬币的两面——每一次新的智能能力出现时,往往首先是昂贵而稀缺的;随着算法进步、系统优化和工程成熟,这些能力会逐渐以更低的成本进入更多模型、应用和用户。今天的Capability,正是明天Capacity需要规模化供给的能力:一个负责创造新的可能,一个负责让新的可能被更多人获得;而更大规模的智能普及,又会带来新的应用、新的数据和新的需求,推动下一轮Capability的突破。
能力型智算:把前沿智能装进一个计算域
突破智能上限,意味着让AI去帮助人类解决今天尚无答案的问题。从海量蛋白质中发现新的药物分子候选物,探索数学、物理领域尚未找到的求解路径,都是这一方向的具体体现。在刘军看来,未来一个AI Scientist可能独立阅读论文、提出假设、设计实验、分析结果,并不断修正判断;如果AI能够持续参与这样的科学探索,就有望改变人类发现新知识、理解新规律和创造新技术的方式。
要支撑这样的前沿智能,有三个绕不开的关键要素。第一是模型前沿:当前前沿模型的参数量与上下文长度持续增长,全球最大的开源模型参数规模已达到2.8万亿,未来还将向10万亿参数级演进,同时KV Cache等运行状态持续增长,计算系统需要具备更强的承载能力。第二是极低时延:Agent不是调用一次模型,而是持续进行感知、规划、推理、执行和反馈,一次任务可能包含数十次甚至数百次模型调用,延迟会在一次次调用中不断累积,必须尽可能减少计算、数据访问和芯片间通信的等待。第三是长稳运行:复杂Agent执行任务可能持续数天甚至更久,大量模型调用、工具交互和多Agent协同持续发生,计算系统需要支撑长时间连续运行,保证复杂智能任务稳定完成。
“面向前沿模型和复杂Agent,计算系统需要的远不止更多芯片、更大内存容量和更低时延的通信,更关键的是如何让模型权重、KV Cache和运行状态在不同芯片与内存之间高效流动,减少数据搬移和通信等待。”刘军表示,这正是超节点存在的意义:它突破传统单机的计算边界,把更多芯片和内存纳入一个高效协同的计算域,为前沿智能提供更大的“有效计算空间”。
围绕这一判断,浪潮信息发布元脑SD200Ultra超节点AI服务器,以开放系统设计紧耦合128芯本土AI芯片,通过统一内存寻址、超低时延通信和超级算子优化,提升多芯片协同效率。产品在单机内可承载2.8万亿参数的Kimi K3模型,Token生成时延低至5.85毫秒,并支持10万亿参数规模的前沿模型。
在具体实现上,SD200Ultra做了四层系统级设计:采用3D Hyper Mesh架构实现128颗芯片紧耦合互连,配备8TB统一编址显存与64TB内存,可承载10万亿参数前沿模型,并通过原生内存语义通信减少访问中转与数据搬移,百纳秒级物理延迟下通信时延低至0.69μs;采用高可靠短距铜缆互连,减少光电转换环节,链路FIT仅为光互连的1/100,可支撑长程任务持续运行。通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现跨主机域的统一寻址访问,远端资源可在统一地址空间下直接访问,减少传统消息通信中的数据搬移。基于对称内存,产品在本土算力超节点上首次实现显存直连,使GPU能够像访问本地显存一样直接访问远端GPU显存数据,通信由GPU直接发起,减少地址转换、避免缓冲区中转,Allreduce通信时间降低3.5倍。此外,产品率先在本土算力超节点上实现通算融合超级算子,算子数量降低10倍,模型推理性能提升3倍以上。
容量型智算:让智能成为可负担的基础设施
在刘军看来,容量型智算要解决的核心问题是Token的单位成本。随着Agent数量和使用深度不断增加,Token需求将快速增长,提高单位计算资源的Token产出成为规模化供给的关键。而要做到这一点,首先要理解推理内部真实的负载差异:Prefill和Decode的计算特征不同,Attention和MoE对计算与访存的要求不同,KV Cache又是随任务运行持续增长的数据;多模态、MTP等模型架构的发展,还会带来更多类型的计算负载。单纯增加同一种算力,难以充分满足这些需求。
“正确的做法,是按负载特点配置算力,让不同资源承担适合的任务,并协调好各个推理环节,减少闲置、等待和重复计算。”刘军说。围绕这一思路,浪潮信息发布元脑HC2000多元算力机组,采用DirectCom2.0极速架构,基于高密液冷AI整机柜,搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化,围绕不同模型与业务的实际负载选择相应的算力和存储配置,并通过软件栈组织协同,使得同等投资Token产能提升10倍。
HC2000的系统设计集中在两个重点。其一是高密液冷整机柜:融合高密液冷和高效供电技术,采用Fanless全液冷设计和2000A高通流供电,突破传统风冷机柜的散热与供电瓶颈,单柜供电能力达300kW以上,最大承载256张AI PU;支持标准开放加速模组,适配多元本土算力芯片,为不同类型算力在同一机组架构下部署提供基础;DirectCom2.0实现计算与通信1:1均衡配比,柜内聚合带宽可达200Tbps,支撑高密部署下的多元算力协同。其二是多元算力承载:Prefill阶段并行度高、计算密集,可选择大算力芯片搭配LPDDR或GDDR;Decode阶段的Attention计算需要反复读取KV Cache,可选择大容量HBM配置,兼顾显存容量与带宽;对于稀疏、访存敏感的FFN计算,可选择3D DRAM堆叠芯片,缩短数据搬运路径、提高访存带宽。不同算力通过软件栈协同,共同完成推理任务。
把多元算力真正“调度”起来的是MCIS多元算力协同推理软件栈。它支持多元算力的Prefill/Decode分离计算,兼容主流本土AI芯片及SGLang、vLLM等推理框架,覆盖请求路由、推理计算、算力动态调整和KV Cache管理等关键环节。一方面,通过“测量—分配—监控—调整”的闭环机制贯通部署前后的优化:部署前通过性能仿真评估芯片、并行方式和P/D组合,方案确定后自动完成资源分配、环境配置和实例部署,运行中通过全链路监控识别瓶颈,并随业务负载变化调整P/D配比、实例数量和负载分配。另一方面,MCIS打通不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,相比CPU中转,数据传输性能最高提升约5倍;并根据KV Cache数据的冷热程度,构建覆盖HBM、DRAM、本地磁盘与远端存储的分级存储体系,结合多级流水、并行聚合等优化,将节点内本地磁盘IO性能提升约32倍。
在本次发布展示的典型Agent任务场景中,元脑HC2000搭配MCIS部署DeepSeek V4推理服务,在相同服务水平目标(SLO)约束下,相较于使用单一算力AI服务器,实现同等投资下Token产能提升10倍。在刘军看来,这个10倍的意义不在于一个性能数字,而在于它说明:当计算系统开始按负载配置算力、按任务调度资源,智能就不再是少数人的奢侈品,而可以成为被广泛调用的基础设施。
从提供算力,走向生产智能
谈及计算产业下一阶段的任务,刘军将其归结为贯穿式系统创新与开放协同的产业生态:通过全栈规划与跨层协同,持续提升整个计算系统的效率;通过多元算力的高效协同,支撑计算产业生态的健康、可持续发展。
“Capability不断定义新的能力前沿,Capacity不断把新的能力前沿变成新的普及基线。”刘军表示,二者交替上升,构成了Agent时代智能进化的基本节奏。
由此,他对计算产业的新使命给出了清晰的判断:“Token工厂不能只问拥有多少GPU、CPU、服务器和存储,更应该问:这些算力能够支撑多强的智能?能够以多低的成本生产多少智能?这就是Agent时代计算产业的新使命——从提供算力,走向生产智能。”
海量资讯、精准解读,尽在新浪财经APP
文章为作者独立观点,不代表联华证券_线上配资利息_网上配资利息观点