AI Podcast

LoongTrain: 高效长序列大语言模型训练


Listen Later

本期播客深入探讨LoongTrain,一个为长序列大语言模型设计的高效训练框架。我们将讨论其核心的2D注意力机制,以及它如何结合头并行和上下文并行来克服扩展性限制并保持效率。此外,还将分析Double-Ring-Attention机制,以及设备放置策略对训练速度的影响。
...more
View all episodesView all episodes
Download on the App Store

AI PodcastBy weedge