vLLM-Omni 系统级优化结合 FastH3 实现 MiniMax H3 实时服务
1 小时前
本文围绕 MiniMax H3 的服务优化展开,指出其服务是系统级问题,涉及多环节时延。vLLM-Omni 从完整常驻流水线入手,通过长序列注意力与通信优化、融合 DiT 算子、并行 VAE 解码、紧凑输出传输及并行 MP4 构建等系统级优化,在八卡 B300 配置下,将完整响应时延相对 Diffusers 降低 30.8%。同时介绍通用 H3 服务架构的扩展手段,包括分布式逐层卸载、编码器分离、可选量化与注意力加速等。此外,FastVideo 的 FastH3 将 DiT 前向从 49 次减为 4 次,在八卡 B300 上,生成 10.125 秒完整 MP4 用时 8.678 至 8.710 秒,5 秒、10 秒、15 秒档均实现完整响应就绪时间快于播放时长的实时效果,其 VSA 变体还可进一步提升速度。最后给出生产部署建议及后续工作方向。
体验专业版特色功能,拓展更丰富、更全面的相关内容。