欢迎访问济南特荣信息技术有限公司网站!

浪潮服务器1块钱百万token,推理快至8.9ms,适合智能体场景

时间:2026-04-15 作者:互联网 511

8.9毫秒,推理速度创下新的记录!1元钱能有百万个token,浪潮信息的AI服务器促使智能体的产业化进程加速。

-09-2913:54:13来源:量子位

产业发展历程的计算,是一个专用与通用对立又统一,且交替向前发展的进程,是这样一个专门针对此的独特过程。

克雷西 henry 发自 凹非寺

量子位 | 公众号

一百万Token的输出推理成本,只要一块钱了。

今年,在人工智能计算大会之上,浪潮信息发布了超扩展AI服务器元脑,其将AI推理成本大幅度降低了。

于此的同一时间,浪潮信息另外推出了一项杀手锏,那便是元脑SD200超节点,它还使得-R1的Token生成时间抵达了毫秒的数量等级。

浪潮信息首席AI战略官刘军

进入到AI竞赛的智能体产业化阶段之时,能力、速度以及成本变成对于胜负起到决定性作用的三项核心要素。

浪潮信息所打出的,这样一整套组合拳,其针对的正是,那其中所涉及到的,有关AI Infra的,两项关键指标,即速度,与成本。

元脑SD200,以及元脑,会给多智能体协同,还有复杂任务推理的规模化落地,供应高速度的同时低成本的算力基础设施。

-R1推理进入10ms时代

首先来看元脑SD200超节点AI服务器。

其能够于单机之中同时开展运行,运行对象为-R1、Kimi K2等四大国产开源模型,它对超万亿参数大模型推理予以支持,并且支持多智能体实时协作,它还对同时运行64个蛋白质预测模型给予支持。

尤其在速度方面,元脑SD200首先达成了把大模型从一端到另一端进行推理时产生的延迟控制在10ms之内的成果。

在实测当中,元脑SD200于运行 -R1之际,TPOT(也就是每Token输出的时间)仅仅只有8.9ms,其领先了之前的SOTA(之前为15ms)差不多接近一倍,并且还让 -R1 671B的推理性能达成了**16.3倍的超线性扩展率。

而且元脑SD200并未因 speed 令系统的稳定性与可靠性受损 ,反倒于系统硬件层各个区域 ,基础软件层各个方面 ,以及业务软件层各个类型等层面开展针对性设计以及优化 ,确保整机运行具备高可靠设计 ,切实达成了 “快却有序 ”。

为什么元脑SD200如此强调“速度”?

因为速度已经成为智能体时代AI竞争的关键变量。

伴随AI步入智能体时代,交互方式产生了极大改变,以往大模型仅需开展人机对话,然而如今还得有智能体与智能体之间的交流,对模型的生成速度更为敏感。

特别是于实际应用场景当中,智能体跟智能体之间的交互轮次更为众多,延迟会顺着这一进程持续积累,致使整个系统的运行速度难以被用户所接纳,在竞争里会变成致命的缺陷。

并非仅仅是用户的直观感受,致使商业场景对于速度有着苛刻要求的缘由,存在着诸多情况。

举例来说,在金融交易这一范畴内,对于响应时效存有着颇为苛刻的需求,反欺诈算法得要在时长为10毫秒的这段时间里辨明风险交易,不然的话后果将会不堪设想。

所以,Token生成的速率,不但會对用户的体验有所波及,而且还会直接关联到商业产出方面的稳定性以及可靠性呢。

那么,制约Token生成速度提升的因素,又是什么呢?

问题主要出在了通信环节。

当参数规模迅速突破万亿级别,模型不得不拆分到几十张卡乃至上百张卡上时,原本在单机内部的高速通信变成了跨机的网络传输,这种情况下,通信便成为了更为严峻的挑战。

尤其在处理推理进程里数量众多的小数据包之际,延迟问题显著凸显,并且每一回跨机通信都兴许导致额外延迟,当多个万亿级模型要求实时协作之时,传统架构已然全然无法应对。

针对这些问题,元脑SD200先是在架构层面进行了革新。

详细来讲,元脑SD200用了创新的多主机3D Mesh系统架构,这架构自搭载入自研的Open,并对其进行贯通,把多个主机的GPU资源整合为一个统一的计算域,而且这个计算域能达成跨主机域全局统一编址。

这一架构使得显存统一地址空间得以扩增,扩增幅度为8倍,它能够达成单机64路的Scale up纵向扩展,其最大可提供的显存为4TB,内存为64TB,进而构建起超大的KV缓存分级存储空间。

且借助Smart ,元脑SD200达成了超节点64卡全局最优路由的自行创建,确保AI芯片间通信路径为最短途程,进而缩减基础通信延迟。

不算架构,于互联协议这儿,为达成极低通信,元脑SD200用了极简三层协议栈,不用网络层,也不用传输层,仅靠物理层、数据链路层以及事务层这三层,就能实现GPU直接去访问远端节点的显存,或者主存。

这种模式,不需要那种“发送 - 接收”样式的消息语义拷贝,把基础通信的延迟降低到了百纳秒级别。

浪潮信息元脑SD200_浪潮服务器应用场景_元脑HC1000AI服务器

与此同时,为达成得以稳定可靠进行通信的目的,元脑SD200在原生状态下就对那种靠硬件逻辑运作来达成的链路层重传情况予以支持,能够把重传所产生的延迟降低到处于微秒级别的状态;而且借助对于分布式、预防式这般流控机制予以采用的方式,于根源处防止拥塞现象出现以及丢包情况发生。

此外,元脑SD200还运用了通信库优化技术,采用了并行推理框架技术,采取了PD分离策略技术,以及启用了动态负载均衡技术,以便充分将超节点的性能优势给发挥出来。

最终呢,进行了R1 671B推理,先是从16卡的规模进行扩展,而后一直扩展到了64卡,达成了16.3倍的超线性扩展率哟。

百万Token推理只要一块钱

除了元脑SD200,浪潮信息还带来了超扩展AI服务器元脑。

首先,元脑具备支持极大推理吞吐量的能力,其次,它能够使单卡成本降低百分之六十,再者,它可以让均摊系统成本降低百分之五十,最后,它会把每百万Token输出成本降低到一元。

若是讲速度是智能体应用的维持生存的关键要素,那么成本就决定了在度过生存阶段后,该应用能不能获得盈利。

在智能体的时代当中,Token的消耗量此刻正在呈现出暴增的态势,就以辅助编程作为例子来说,该情况下,每月所消耗的Token数量,相较于一年之前,增长幅度达到了50倍之多。

倘若从经济层面予以考量,企业每去布置一个智能体,平均地每个月所耗费的Token成本将会达到5 000美元。

浪潮信息预计,未来5年,智能体应用带来的Token消耗会呈现指数级增长,并且随着任务复杂度、使用频率等指标持续升高。

Token数量呈现出只增加不减少的态势,要是不将单个Token成本降低下来,那么在具有高强度交互特性的智能体环境里,Token成本必然会成为规模化部署过程中的瓶颈。

那么,Token推理成本又为什么居高不下呢?

推理阶段算效(MFU)低是主要原因。

就具体情况而言,于训练的这个时候,模型的FLOPs的利用比率有可能会达到50%,然而在进行推理的那个阶段,这个数值也许会低上一个数量级。

进一步的原因在于,推理的每个阶段,其运算特点都不一样,这与算力无法达成有效匹配。

元脑瞄准的出发点正在于此——

既然在每一个阶段当中存在不一样的运算特点,那么就把推理的计算流程予以拆解,针对模型结构开展解耦。

元脑不但把推理过程的以及阶段给予分离,还把阶段再进一步分解为注意力运算和FNN,借此提升资源利用效率。

通过解耦,还有一个好处,即对于芯片的指标要求,不复为“五边形战士”,能够有针对性地进一步削减成本,在节约成本之际,还可以降低功耗。

在硬件方面,元脑创新的 16 卡计算模组有着设计,单卡存在“计算 - 显存 - 互连”的均衡设计,显著地降低了单卡花费以及每卡依照系统分摊的成本。与此同时,全对称的系统拓扑构造设计能够支持超大规模的无损扩展。

经测算,元脑在推理性能这一方面,相较于传统RoCE,得到了1.75倍的提升,并且,单卡模型的算力利用率,其**提升幅度达到了5.7倍。

而且,元脑运用的是全对称极速架构,它具备可以凭借超低延迟直接连通通讯的能力,如此就能保证计算与通信进行一比一的均衡分配。

面向未来的AI创新计算架构

着眼于智能体AI时代,浪潮信息借助元脑 SD200 以及元脑这两个极具威力的工具,破开了智能体大规模落地过程里速度与成本这两个关键难题。

一方面,处于智能体商业化进程里,Agent应用常常依照“快杀慢”的规则,——。

用户在面对数量众多的选择时,会更倾向于去选择那么能够得出结果或者表达更迅速,并且在履行交付职责方面效率更高的工具。

从另一个方面来讲,伴随应用规模不断扩大,以及交互频次逐步提升,行业所关注的重点,也由单纯的算力指向了总体拥有成本,特别是直接对商业可行性产生影响的单Token成本。

鉴于此,浪潮信息针对未来智能体的商业化场景,于速度跟成本方面率先实现突破,将“百万Token上下文”由高成本的技术演示,转变为能够规模化运营的现实能力。

然而,AI算力要实现可持续发展,仍然面临着三大挑战,其一,系统规模已经快要接近工程极限了,其二,电力基础设施承受着巨大的压力,其三,算力投入和产出处于不平衡的状态。

在此背后,是通用计算架构,其由GPGPU主导,该架构的局限性正逐渐显现。

因此,思维需要转变,要思考新的路径,从规模导向转变为效率导向,要重新对AI计算架构进行规划和设计,还要发展AI专用计算系统。

浪潮信息首席AI战略官刘军指出:

通用架构它效率低,然而适应性强,易于产业化推广;专用架构效率高,只是应用面窄,不利于普及推广。计算产业发展的历程,是一个专用与通用对立统一的进程,也是一个交替发展的过程。

这表明,由GPGPU等所主导的通用AI计算架构,正面临着诸多挑战,正朝着细分化、专业化的应用阶段,加速进行转型。

在顺应此趋势的情形下,浪潮信息借助软硬件协同设计以及深度优化,针对具体应用,去探索AI下半场的算力新路径。

目前,浪潮信息已经交出了元脑SD200和元脑这样的答卷。

下一步,它会朝着核心算法算子,展开硬件化、电路化设计,达成性能的数量级提升,进而有效应对未来Token规模不断增长引发的巨大计算需求,为智能体时代的高效落地,提供可持续、可扩展的基础设施保障。

版权所有,未经授权不得以任何形式转载及使用,违者必究。

返回列表