中国信通院郭亮等:大模型算力体系构建与关键技术分析

发布时间:2026-08-25 16:58  浏览量:1

0 引言

2017年,谷歌发布Transformer模型,凭借自注意力机制突破长序列数据处理瓶颈,推动模型并行化训练和高效计算,使得人工智能(Artificial Intelligence,AI)领域迎来重大发展。2018年,基于Transformer的GPT和BERT等预训练模型问世,开启了自然语言处理(Natural Language Processing,NLP)的预训练时代,并在多项典型任务中取得突破性进展。2021年,Vision Transformer、MAE等模型将Transformer架构引入计算机视觉领域,为CV大模型注入新活力。2022年,生成式AI取得重大突破,OpenAI开发的ChatGPT通过监督微调(Supervised Fine-Tuning,SFT)和基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)等技术,生成更自然、更符合人类偏好的对话文本,同时期多模态模型融合进一步深化,可实现文本、图像、音频等多种模态数据的统一编码。2025年初,我国推出的DeepSeek系列模型凭借混合专家模型(Mixture of Experts,MoE)结合思维链构建、多并行策略等优化方法,显著降低训练成本,其开源性质加速了AI应用的普及化。

在AI快速发展的背景下,大语言模型(Large Language Model,LLM)始终处于核心地位,其不仅在自然语言处理领域取得革命性进展,也通过多模态数据融合与多种智能体结合的技术探索,不断拓宽能力边界,为未来通用智能的发展提供强大动力和无限可能。值得注意的是,如今LLM领域的蓬勃发展并非偶然,而是各领域长期理论研究和应用创新迭代的产物,特别是计算、网络和存储等相关领域的长期积累,为其提供了必要的算力底座,支撑着其进行数以千亿模型参数训练,并成为其技术发展和应用的首要前提。虽然LLM持续增加预训练的数据量和模型参数仍符合缩放定律[1],但随着硬件集群的限制和成本的约束,模型参数的增长已逐渐减缓,如何提升算力集群应用效率成为当前推进AI发展必须面对的课题。

1 大模型工作范式

Transformer是一种基于注意力机制提取数据特征的深度学习架构,由Vaswani等[2]人在2017年首次提出。Transformer在NLP领域取得了突破性的进展,成为当前许多先进模型的基础架构。Transformer架构以经典的Encoder-Decoder架构为基础,通过在输入端引入位置编码并采用多头自注意力机制和前馈神经网络作为编码器,将输入序列转换为上下文表示,解码器则利用编码器的输出生成目标序列。

1.1 GPT系列的预训练微调范式

业界广泛探索基于Transformer架构的大模型训练范式,出现了Only-Encoder架构的BERT、Only-Decoder架构的GPT系列,以及Encoder-Decoder架构的T5模型。但由于GPT系列在NLP领域取得的空前成就,Only-Decoder成为了当前大语言模型的主流框架,OpenAI公司的模型训练模式也成为业界的训练范式。

GPT系列模型采用预训练、监督微调和基于人类反馈的强化学习3个阶段的训练模式。预训练阶段,模型使用大量文本学习语言结构和模式,通过预测下一个词捕捉长距离依赖并生成连贯文本;监督微调阶段,模型使用特定任务数据进行优化,以更好地理解和生成相关文本;强化学习阶段,模型通过人类标注对回答排序生成奖励模型,再用强化学习算法进行微调,使模型生成文本更符合人类偏好[3-5]。

1.2 DeepSeek的知识蒸馏训练范式

2025年1月,DeepSeek发布开源推理模型DeepSeek-R1,其性能与OpenAI的o1正式版持平,标志着中国在AI领域的一次重大探索和成功。DeepSeek通过开源策略,显著降低了AI技术的使用门槛,推动了AI技术的普及。

与GPT系列的训练范式不同,DeepSeek强调从预训练到强化学习知识蒸馏的过程。预训练阶段,模型通过大量文本数据学习语言结构,捕捉长距离依赖;指令调优与强化学习阶段,模型理解指令格式并优化输出;知识蒸馏阶段,模型将大型教师模型的知识迁移到较小的学生模型中,通过教师模型生成高质量推理数据,小模型模仿学习,优化训练以接近教师模型性能[6]。这种技术路线使DeepSeek在保持较低算力需求的同时,实现高效的模型训练和推理。

2 大模型关键技术

2.1 并行训练

随着AI的快速发展,模型的规模不断增大,参数量从百万级增长到万亿级。这种趋势带来了巨大的计算和内存挑战,单一图形处理器(Graphics Processing Unit,GPU)的性能已无法满足大参数量LLM训练的需求,分布式并行训练技术成为关键。主要的并行训练策略包括数据并行、模型并行、专家并行、序列并行等。这些并行训练技术各有优势和适用场景,通过合理选择和组合,可以有效提高大模型训练的效率和扩展性。

2.2 Prompt工程

Prompt工程是指通过精心设计提示,引导大型语言模型生成更准确、更相关、更符合需求的输出。随着LLM在自然语言处理和计算机视觉等领域的广泛应用,Prompt工程成为优化模型性能的重要手段。Prompt工程技术有多种特点和适用场景,通过合理选择和组合,可以显著提高大型语言模型的性能和输出质量。在实际应用中,Prompt工程是一个迭代的过程,需根据具体任务和目标进行不断的测试和优化。

2.3 知识库检索

大模型知识库是将大型语言模型与知识管理相结合的系统,旨在通过高效的知识获取、处理和检索,提升模型在特定领域的性能和准确性,目前已经成为了企业智能化升级的核心基础设施。大模型知识库的技术背景根植于大数据处理、自然语言处理及深度学习技术的飞速发展。其构建流程涵盖从文档、网页、数据库等数据源采集数据,利用自然语言处理技术将数据转化为结构化知识,并依托向量数据库实现高精度的语义检索与推荐。在架构方面,大模型知识库通过知识价值密度评估和知识热力分析优化知识处理策略,确保资源高效利用。

2.4 Agent工具

Agent作为拓宽大模型能力边界的关键技术,赋予了大模型更强的工具调用与任务执行能力。Toolformer [7]作为这一领域的开创性研究,为Agent技术的发展提供了重要的理论基础和实践方向。Toolformer通过自监督学习让大型语言模型自主调用外部工具,克服了模型在算术运算和事实查找等基础功能上的不足。其核心在于通过应用程序编程接口(Application Programming Interface,API)让模型学习使用外部工具,技术实现包括将API调用表示为元组、构建自监督数据集以及对模型进行微调。其优势在于自监督学习减少了人工标注成本,同时保留了模型的核心语言建模能力,具有很强的通用性,为当前大模型Agent的发展奠定了技术基础。

3 大模型算力面临的挑战

大模型的关键组成是算力、算法和算据,而大模型算力的关键组成是算力、存力和运力。通用算力发展逾十年,形成了完整的体系架构和技术特征。而大模型算力与传统通用算力在行业认知、计算效率、存储读写和网络技术等各方面都不尽相同。

3.1 计算效率待提升

在大模型训练中,分布式并行训练以及大规模数据交互产生的通信开销和同步问题对训练效率产生很大影响。

高性能计算资源无法完全发挥自身性能。GPU如A100、H100等提供了强大的计算能力,但在实际的大模型训练中,这些硬件的利用率往往远低于其理论峰值。在H100/H800 GPU集群中,模型算力利用率(Model Flops Utilization,MFU)往往不超过50%[8]。随着模型规模和GPU数量的增加,节点间的数据同步需求急剧上升,尤其是梯度汇总等操作导致网络通信开销过大,成为并行效率提升的主要瓶颈[9]。大模型训练集群的稳定性也是影响计算效率的关键因素,大规模训练任务持续时间长,参与计算设备众多,集群故障成为模型预训练过程中的常态。故障不仅影响单服务器作业,在梯度同步的过程中可能拖慢数万个GPU的整个集群训练作业[10]。

3.2 存储读写与带宽瓶颈

随着大模型参数和数据集规模的快速增长,存储系统面临海量数据的存储与读写需求、存储系统的性能瓶颈以及检查点(Checkpoint,CKPT)快速读写三大挑战。

数据存储容量需求随着模型规模的增加而急剧上升,大模型训练除了需要处理庞大的训练数据集之外还包括模型参数、激活函数和优化器状态等临时数据的存储与计算,这些数据对存储系统性能和容量需求很高。频繁的数据同步需要存储系统具备很高的读写性能与传输带宽。例如,Meta公司Llama 3.1 405B模型训练的存储系统需要支持2 TB/s持续读写带宽,在爆发式读写操作时,读写带宽可提升至7 TB/s[11]。这种高带宽需求对分布式存储系统的读写性能提出了巨大挑战。为有效应对集群故障问题,将模型训练的中间过程作为CKPT进行异步保存是目前广泛应用的训练策略。不同于训练数据,CKPT数据带有明显的碎片化和稀疏性特征,为尽可能不影响训练效率,在保存CKPT的过程需要将模型状态数据快速写入存储系统,一旦系统发生故障,在故障修复之后也需要将CKPT快速读取。但稀疏性的CKPT数据特点显著降低了存储系统利用率,同时也对存储空间高效管理提出了挑战。

3.3 信息丢失与流量极化

随着模型规模的扩大和分布式并行训练的普及,信息丢失问题愈发突出,也成为大模型训练的关键挑战之一。网络丢包增加了重传开销,严重影响数据同步和模型收敛,根据IEEE 802 Nendica Report:Intelligent Lossless Data Center Networks,0.1%的网络丢包率即可导致算力损失高达50%。网络拥塞是信息丢失和时延增加的主要原因,大模型训练中动态时延对效率的影响尤为明显,根据有关实验仿真结果,网络时延每增加1 ms,计算效率会快速下降。在大模型训练中,产生的突发性、周期性流量峰值巨大,较易超过网络链路容量,引发网络拥塞。传统三层算内网络架构使得大流量的转发需要经过多次哈希,这种“级联”哈希效果很可能导致更严重的负载均衡问题,即哈希极化,加剧网络拥塞。

4 大模型算力关键技术

4.1 存储

为适应大模型训练与应用的复杂需求,存力需具备更高的每秒处理读写操作次数(Input/Output Operations Per Second,IOPS)性能,包括更高的数据预处理效率、更快的海量小文件读取速度、更强的大文件大带宽读写性能等。数据预处理环节普遍占据大模型训练过程30%以上的时间,因此对数据清洗、去重、预处理以及训练过程中的CKPT读取流程的优化对于缩短训练周期、提升训练效率至关重要[12]。

4.1.1 高性能存储系统

当前普遍的大模型训练容错方案依赖周期性保存CKPT,但当模型参数达百亿或千亿级别时,周期性保存CKPT不但会中断训练进程,而且会占用大量时间。为解决这一问题,可通过CKPT多级存储,构建基于高IOPS性能的内存介质存储系统,支持快速读取CKPT数据以实现断点续训。然而,传统存储技术难以支持大规模并行访问。例如,在10万卡规模集群下,CKPT的IOPS需求可达千万级别。针对此问题,可通过混合输入输出负载的高性能读写能力,显著提升训练数据加载性能,并通过并行大带宽和高IOPS,支持模型CKPT数据的快速读写,满足CKPT粒度变大时的效率需求。

4.1.2 并行文件系统

并行文件系统用于满足AI训练中海量数据和高并发访问的需求,采用数据与控制计算单元分离架构,支持独立扩展,可优化数据调度与访问均衡,突破传统架构瓶颈。并行文件系统的具体技术手段包括高性能存储介质与架构优化、数据调度与负载均衡策略、弹性扩展与容错机制。其中,高性能存储介质与架构优化采用全固态硬盘(Solid State Drives,SSD)和分布式存储架构,可支持大规模数据并行访问,结合硬件配置和网络协议优化实现高IOPS和低延迟的性能提升。数据调度与负载均衡策略根据数据访问热度和节点状态动态调整数据分布,通过对下一任务时刻数据调用的预测,提前将待调用数据存放至高速缓存区,在保证模型训练效率的同时可优化资源利用率。弹性扩展与容错机制主要用于存储设备的横向扩展和自动故障切换,在面临大规模数据存储需求时可保证在集群无感的前提下扩充设备,同时在面临系统故障时可自动完成数据跨设备迁移,保障数据高可用性。

4.1.3 DPC加速

分布式并行客户端(Distributed Parallel Client,DPC)作为运行在计算节点上的存储客户端,通过网络协议与存储节点进行数据交换,不同于传统方案中计算节点通过单客户端只能连接一个存储节点的访问方式,该方法可实现单客户端连接多个存储节点,通过兼容标准POSIX语义和MPI-IO语义提供并行接口以及智能数据缓存策略,大幅提升并发访问能力,实现在AI训练过程中中间结果数据、CKPT数据的高吞吐、低时延读写,减少因存储设备自身输入输出性能瓶颈导致的GPU等待。

4.2 集合通信

大模型训练通常会将样本分配至多个加速节点进行并行计算,每次迭代后需同步梯度数据。大规模集群中数据同步耗时较长,成为性能瓶颈。为此,可引入集合通信技术以实现高效的节点间信息交换,显著提升同步效率。

4.2.1 集合通信算法及流程

集合通信技术为智算集群提供单机多卡和多机多卡通信策略,可根据具体的集群拓扑结构自动选择合适算法。在服务器内部的多卡通信场景,通常采用全网状互联拓扑结构,基于网格(Mesh)算法实现高效点对点通信。在服务器之间的多机多卡通信场景,支持Halving-Doubling(HD)、Ring和非均衡的层次环(Nonuniform Hierarchical Ring,NHR)等多种算法,AI芯片通过并发使用多路链路,充分利用双向带宽,显著提升服务器间通信效率。

4.2.2 计算通信统一硬化调度

通过最大化反向计算与梯度聚合通信的并行度,实现计算与通信任务的全硬化调度。借助专用硬件调度引擎和硬件通信原语,实现计算与通信任务在硬件层面无缝衔接,精准控制系统抖动,显著降低调度开销,优化硬件资源利用率。

在高性能并发方面,通过随路方式重点优化“归约”类集合通信操作,将计算与通信任务并发执行,大幅降低系统总执行时长,进而提升大规模分布式并行训练效率。同时为应对适应不同硬件架构和训练场景,在软硬件层面需采取优化手段,硬件层面优化专用调度引擎设计,减少任务调度延迟;软件层面改进通信原语实现方式,提升通信任务执行效率。

4.3 网络

大模型通过模型并行、流水线并行等方式切分到AI集群的各个机器,但不管用什么样的方式,切分后仍需网络对分布在不同机器的参数进行总体聚合,机间互联便成了主要的性能瓶颈。从通信方式的角度来看,参数聚合会对网络提出很多需求,例如对模型局部变量进行更新等。由于专用的AI加速芯片中内存与计算单元的高带宽存储器(High Bandwidth Memory,HBM)等片内带宽很大,计算速度很快,但是在集群中的网络传输速度远远不能匹配专用的AI加速芯片运算速率,卡间互联就成了一个重要的研究方向。

机间互联主要以基于远程直接内存访问(Remote Direct Memory Access,RDMA)的IB、RoCE技术为主,是设备间高速互联技术的典型代表[13]。其中,RoCE是一种基于以太网的RDMA方案,通过构建无损网络可有效保障RoCE协议在数据传输过程中能够实现可靠传输[14],逐渐成为业界主流。卡间互联以NVLink、HCCL技术为主,美国头部企业联合成立了UALink联盟进行该技术的标准制定工作。开放数据中心委员会(Open Data Center Committee,ODCC)联合产业链成立了AI网络特别任务组,并开展Eth-X等AI网络的研究工作,推进其与国际标准的接轨。

4.4 设施

从传统的互联网数据中心(Internet Data Center,IDC)到云数据中心(Data Center,DC)再到智算中心(Artificial Intelligence Data Center,AIDC),其对供配电和制冷等基础设施的要求各不相同。目前,大型设施的平均机柜功率密度约为36 kW/机架,IDC估计其复合年增长率将达到7.8%,到2027年该数值将接近50 kW/机架,许多AI集群的功率密度需求预计将达到80~100 kW/机架[15]。对功率密度骤升的AIDC来说,面临的挑战更为严峻。

另外,可持续发展已成为当今数据中心最重要的问题之一。数据中心和数据传输网络占能源相关温室气体排放量的1%[16]。对可持续性的高度关注意味着AIDC运营商必须在电力受限的环境中应对双重挑战,即在确保可靠的电力供应的同时最大限度地减少设施的环境足迹,这就对AIDC的绿色低碳提出了新的要求。

5 大模型算力体系构建

5.1 大模型算力体系

随着大模型训练对算力需求的快速增长,构建高效、可扩展的算力基础设施成为推动AI发展的关键。基于对大模型算力挑战和关键技术的研究,本文构建了面向大模型等应用的算力体系,该体系的重点是“三要素两协同”,即算、存、运三要素,算存运协同和软硬件协同两协同(见图1)。

图1 大模型算力体系框图

5.2 大模型算力关键要素

算力、存力和运力是大模型算力的三大关键要素,共同构成了大模型算力基础设施的核心支撑,确保了AI应用的高效运行和持续发展。

算力是大模型算力的动力引擎,为模型训练和推理提供强大的算力支持。随着大模型参数量的提升,模型对计算资源的需求急剧增加。高性能计算架构以及分布式计算技术,成为满足大模型算力需求的关键。存力是大模型算力的先进燃料,负责存储和管理海量的数据资源。大模型算力需要处理巨大的数据量,从模型训练的输入数据到训练过程中的中间结果,再到最终的模型参数,均依赖高效可靠的先进存储方案。运力是大模型算力的数据通道,确保数据在各节点之间高效传输。在各类大模型训练中,入算网络、算内网络和算间网络都至关重要,通信效率直接影响训练速度和模型性能。

5.3 算存运协同建设

大模型算力是集算力、存力、运力于一体的新型生产力。算存运协同建设,以网强算、以存强算成为大模型算力体系构建的重点。

大模型呈爆发式发展,从千亿稠密模型逐渐走向万亿稀疏模型,未来有效样本量和模型参数规模仍会快速增长,将带来集群规模需求的快速攀升。随着集群规模的增大,算力之间的规模互连技术面临巨大挑战,如GPT-4约1.8万亿参数规模的大模型训练过程中,每轮迭代计算都涉及前反向传播算法的计算和通信,带来集群计算中参数面网络和数据面网络对更大交换带宽的需求,时延、负载均衡、拥塞控制均成为技术难点。

规模定律描述了模型性能与模型参数数量、数据集大小和计算资源之间的幂律关系。相关公式表明,增加参数量、数据量或计算资源均能降低损失,但收益遵循边际递减规律(幂律衰减)。

对于大模型算力而言,算力(C)、运力(N)和存力(S)作为基础硬实力,对最终形成的大模型算力(CLLM)具有重要的贡献,具体可用公式(1)所示广义线性模型表示。

5.4 软硬件协同优化

软硬件协同发展是大模型算力向上提供支撑的关键。大模型训练集群是复杂硬件和复杂软件构成的一体融合的复杂系统,成千上万训练卡互连的算力整体使用效率是关键挑战。模型规模不断增大,引发单机计算执行中内存和输入输出访问瓶颈、计算交互损耗、资源调度不均问题;各类并行通信额外开销影响算力利用率的保持度,进而影响训练效率和成本。需要运用系统工程方法,通过软硬件全栈整合优化等综合提升集群算力使用效率。DeepSeek发布之后,主流GPU厂商均加速适配。主流GPU芯片均已适配DeepSeek R1 及 V3 原版模型,这对芯片的计算能力、内存带宽以及多卡互联等技术有着较高要求。

大模型算力需要在硬件选型和软件配置上进行精细化设计,确保两者之间的无缝对接和高效协同[17],实现从数据预处理到模型推理的全流程优化。软硬件协同效率(Collaborative Efficiency of Software and Hardware,CESH)是很大的影响因素。基于此,公式(1)可变型为

公式(3)中,可将效率分解为两个部分:静态部分 (Eops),反映模型本身的构造优劣;动态部分(逻辑斯蒂衰减函数),它模拟了随着模型规模M的增长,系统性能因通信、计算等开销增加而“衰减”的非线性过程。这个曲线的形状比简单的线性或指数关系更贴近真实世界的性能表现。

6 大模型算力发展趋势

6.1 大算力集群仍是刚需

大参数量的模型训练需要大量的算力,包括但不限于OpenAI/Microsoft、xAI和Meta在内的多个大型AI实验室正在竞相构建的超10万个GPU的大算力集群[18]。目前以鹏城、之江等为代表的国家级实验室,字节、百度等互联网公司,中国电信、中国移动等基础电信运营商建成了多个万卡算力集群,为我国大模型的发展奠定了良好基础,也为后续更大规模集群建设积累了宝贵的运维经验。

6.2 端侧大模型迎来机会

多家科技公司推出4B参数以下的端侧小模型,在保持一定性能的前提下,大幅降低对算力的需求。例如苹果公司在2024年6月发布了面向iPhone、iPad和Mac的个人智能化系统Intelligence[19],在上述端侧设备中部署了大约3B的本地模型,提供强大的人工智能生成内容(AI-Generated Content,AIGC)功能;通义推出参数规模横跨5亿到1 100亿的8款大语言模型,其中小尺寸模型如0.5B、1.8B、4B、7B、14B,可便捷地在手机、个人电脑等端侧设备部署。

6.3 缩放定律面临挑战

OpenAI带来了后训练缩放定律[20],该规则是指在模型预训练完成后,可通过强化学习和测试时间搜索等方法,进一步提升模型性能。此外,缩放定律也受到了创新产品的挑战。DeepSeek-v3采用FP8进行训练,以14.8万亿Tokens作为预训练语料,仅需要2.788 M H800 GPU小时完成了训练,被认为有颠覆缩放定律的潜力。

6.4 基于算网协同的统一调度需求

针对跨数据中心大语言模型训练面临的数据隐私保护、算力网络异构性及通信效率等挑战,对基于算网协同的统一调度系统提出新的需求。通过分层分簇架构,结合实际算力与网络状态,进行动态规划分割联邦学习任务与网络路由编排,有效平衡计算与通信负载,为解决大规模分布式模型训练中的隐私保护与资源协同调度提供新思路。

7 结束语

本文系统分析了大模型面临的算力挑战,提出了大模型算力体系,强调大模型训练的高效实施依赖于计算、存储和网络三大核心领域的协同建设和软硬件的协同发展。大模型给算力以及千行百业带来了翻天覆地的变化,头部大模型的日活已经达到千万级别。AI驱动内容生产、带动数字经济发展已经成为重要趋势。大模型给人类带来的更多改变值得期待。

作者简介

郭亮

中国信息通信研究院云计算与大数据研究所总工程师,正高级工程师,IEEE高级会员,主要从事与算力网络相关的政策支撑、技术研究和标准制定工作。

王月

通信作者。中国信息通信研究院云计算与大数据研究所数据中心部副主任,高级工程师,主要从事绿色算力、算电协同等相关的产业咨询、技术研究和标准制定工作。

李洁

中国信息通信研究院云计算与大数据研究所副所长,博士、正高级工程师,长期从事算力相关的产业、政策、技术、标准研究工作。

论文引用格式:

郭亮, 王月, 李洁. 大模型算力体系构建与关键技术分析[J]. 信息通信技术与政策, 2025, 51(11): 81-88.

本文刊于

《信息通信技术与政策》

2025年 第11期

公众号封面由AI生成

主办:中国信息通信研究院

《信息通信技术与政策》

是工业和信息化部主管、中国信息通信研究院主办的专业学术期刊。本刊定位于“

信息通信技术前沿的风向标,信息社会政策探究的思想库

”,聚焦信息通信领域技术趋势、公共政策、 国家/产业/企业战略,发布前沿研究成果、焦点问题分析、热点政策解读等,推动6G、新型工业化、人工智能、脑机接口、先进算力等技术产业的创新与发展,引导国家技术战略选择与产业政策制定,搭建产、学、研、用的高端学术交流平台。

期刊荣誉与收录情况

AMI(2022版)A刊扩展期刊

RCCSE中国核心学术期刊

入选中国科协信息通信领域高质量科技期刊分级目录

《信息通信技术与政策》投稿指南!