Hugging Face Accelerate 两个后端的故事：FSDP 与 DeepSpeed

最近，我们尝试分别使用 DeepSpeed 和 PyTorch FSDP 进行训练，发现两者表现有所不同。我们使用的是 Mistral-7B 基础模型，并以半精度（
bfloat16）加载。可以看到 DeepSpeed（蓝色）损失函数收敛良好，但 FSDP（橙色）损失函数没有收敛，如图 1 所示。

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

相关文章