← 返回列表第九届未来网络大会:AI大模型跨域训练池化调度技术体系白皮书
2025-09-15T02:19:12.000Z已保存的公开摘要。此页不是完整正文,附件尚未迁移。
AI大模型的跨域训练是全球范围关注的前沿技术方向,它是指将多个不同的智算中心组合在一起训练同一个AI大模型。为什么需要跨域训练?业界通常的认知在于,当大模型未来发展到万亿、十万亿参数规模时,根据Scaling Law需要用到万卡甚至十万卡才能完成其预训练过程,这样的体量规模如果集中到一个集群内部,在技术、能源、配套等方面都存在着严峻的挑战,因此需要通过网络连接多个集群并加以组合,以共同训练同一个万亿/十万亿的大模型。
报告是基于未来网络团队多年来在AI大模型跨域训练与算力网调度方面结合实践的创新成果。与业界面向于通用大模型在“同属同构/异构、同城/异地”资源上的拉远部署技术路线有所不同,未来网络专注于企业大模型在“异属、异构、异地”资源上的池化调度技术路线,通过“广域确定性网络+智算资源并网+算网协同调度”三位一体的技术架构,可真正实现“异属合训、异构混训、异地同训”的池化调度能力。
白皮书围绕技术体系视角,对于A大模型跨域训练池化调度的参考架构、关键技术、试验评估等进行了详细的介绍。希望能够通过本白皮书的内容,为业界树立基于“异属异构异地”资源的 AI大模型跨域训练池化调度范式,为实现全国一台超级计算机的宏伟目标走出未来网络创新路径。