浪潮信息升级存量算力,让老GPU服务器重返AI训练一线
医疗行业是较早推进“AI+”应用的领域之一。随着人工智能从深度学习迈向大模型阶段,相关业务对算力的要求也在不断提高。为了支持影像大模型、DLR(深度学习图像重建)等医疗专用模型和算法的训练,医疗设备企业持续购置GPU服务器,由此形成了规模庞大、覆盖多个技术代际的算力资源。然而,部分早期部署的GPU服务器仍采用10Gb网络,网络性能不足逐渐成为新模型研发与训练过程中的明显制约。
如果整体更换设备,企业需要承担较高成本;若继续沿用原有配置,又难以充分发挥算力价值。对此,浪潮信息为某医学影像诊疗设备提供商带来了新的解决思路——通过焕新服务盘活旧设备。该企业拥有近400台跨越三代技术平台的GPU服务器,其中100余台仍配置10Gb网络。浪潮信息服务团队通过更新网卡部件,将这些服务器升级至百Gb级网络,同时协助优化训练平台的资源分组和任务配置。整个项目投入不足100万元,却让价值接近4000万元的GPU服务器重新具备承担AI训练与验证任务的能力。

三代平台并存,老网络成瓶颈
该客户在中国医学影像设备领域处于领先地位,产品线覆盖磁共振、CT、PET/CT、DR及放射治疗等,在售产品超过120款,年营收过百亿。作为“AI+医疗”的先行者,该客户已自主开发医疗文本大模型、影像大模型和医疗行业大模型,并形成100多款AI应用方案。
但客户的AI能力不是一次性投入。影像大模型、DLR等专用模型与算法要持续训练、持续迭代,才能不断提升诊断精度、适配更多设备与病种。这背后,是长期、稳定、且规模不断扩大的算力需求。因而,伴随AI技术创新的不断深入,客户GPU服务器数量不断增长,当前存量已经接近400台。
这些GPU服务器采购时间从2019年延续至2025年,横跨三代技术平台。多代设备并存,抬高了资源调度与运维管理的复杂度,带来了一系列问题,其中最突出的是网络。最早部署的百余台GPU服务器仍采用10Gb网络,而新设备已普遍配置百Gb级别的网络。面对跨节点梯度通信、远端共享存储访问等高带宽负载,10Gb网络逐渐成为制约旧服务器参与训练任务的瓶颈。以DLR训练为例,当服务器从远端共享存储并发读取大规模3D影像数据时,网络I/O瓶颈尤为明显,导致新设备持续高负载运行,而部分旧设备的利用率较低。
网络焕新,唤醒存量算力
这类问题,通常只剩“将就”或“换机”两个结局。而焕新服务的价值,恰恰在于第三条路。浪潮信息掌握不同代际服务器的结构设计、接口配置和部件兼容信息,能够针对旧设备的内部空间与接口条件制定适配方案。
工程师深入解构旧服务器结构,对既有转接卡进行适配改造,在不改变原有设备架构的前提下,让旧服务器支持了百Gb级别的网卡。同时,高速网络对接口、空间与信号的稳定传输高度敏感,团队进一步开展兼容性、稳定性和压力测试,验证转接卡、网卡与整机系统的协同运行,确保焕新方案不仅能够完成适配,也能够满足后续稳定运行要求。
焕新之后,浪潮信息进一步协助客户重构AI训练平台:按技术平台、性能与配置对服务器分类,将能力相近的设备编入同一算力集群,再结合不同训练任务做资源匹配。通过减少跨代设备之间不必要的通信与调度,降低平台差异对训练作业的拖累,让每一台被焕新的设备都用在最合适的负载上。

从设备保障,到算力价值的持续释放
这次焕新服务总支出不到100万元,却让接近4000万元的存量设备重新回到可用状态——客户以约四十分之一的投入,唤醒了一大批原本闲置的算力资产。焕新完成后,这些旧设备重新组建为分布式集群,承载AI算法验证与训练负载,资源利用率快速回升,客户的AI研究与训练进度明显加快。
原厂焕新的底气,来自长期积累的服务能力。在持续积累的设备数据、服务经验和技术档案,也为此次跨代设备焕新提供了支撑。每一次服务,团队都会沉淀完整的故障分析(FA)报告,把问题原因、处置过程与改进建议固化下来;每一次焕新,也都有可查询的原厂焕新记录,让设备的每一次变更都清晰可溯——这些,都是焕新能“敢保、可续”的基础。
不少较早布局AI的企业已经沉淀了数量可观的算力设备。在GPU资源相对紧张、AI基础设施投入不断增加的情况下,对现有算力资产进行升级改造,正成为越来越多企业兼顾成本与效率的现实选择。针对这一趋势,浪潮信息将原厂服务由传统的设备运行保障进一步拓展至存量基础设施焕新,帮助客户延长设备的有效使用周期、提升既有投资回报,并让不同代际的算力资源在匹配的业务场景中继续释放价值。