图解展示了DeepSeek模型在多GPU环境下进行Embedding层计算的分布式架构。输入tokens经分发后,各GPU(如GPU0、GPU1)并行生成局部embedding表。为处理全局索引,系统需“找出掩码索引”、“转局部索引”并“掩码”无效值,再从本地表中“索引取出”对应向量。关键挑战在于不同GPU因数据分布不均导致输出embedding数量稀疏且不一致,无法直接拼接或all_reduce。解决方案采用填充/占位符机制,强制“第0行一定会被取出”,以此作为默认填充项,确保后续操作维度对齐。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。