数据并行

  • 大模型算法工程师面试问题汇总

    一、基础理论与数学 二、大模型架构与关键技术 三、训练与优化 四、推理与部署 五、大模型应用与评估 六、前沿与扩展 七、编程与工程 八、系统设计题常见考点 九、行为与行业认知 十、高阶问题 建议准备策略: 可重…

    默认分类 27/05/2025
    01350
  • 【DeepSpeed】3D 并行原理解读

    DeepSpeed 的 3D 并行 是一种高级分布式训练策略,通过结合 数据并行 (Data Parallelism, DP)、模型并行 (Model Parallelism, MP) 和 流水线并行 (Pipeline Parallelism, PP),在多 GPU 和多节点环境中高效训练超大…

    人工智能 21/05/2025
    01820
  • 大模型的N种并行训练方法汇总

    数据并行 数据并行,就是将数据集分为N份,分别装载到N个GPU节点中,每个GPU节点持有一个完整的模型副本,分别基于每个GPU中的数据去进行梯度求导。在GPU0上对每个GPU中的梯度进行累加,最后,再将GPU0聚合后的结果…

    21/03/2024
    02.6K0