部署方式对比
三种方式可以组合,例如试验期用公有云,稳定后迁到自建机房。
选型参考
各家最新开源大模型私有化推理的显存粗估,按官方发布的权重计算,用来提需求时定一个起点;实际配置以实测为准。
| 模型 | 总参数 / 激活参数 | 官方权重 | 推理部署参考 |
|---|---|---|---|
| 大语言模型 | |||
| Kimi K3 | 2.8T / 104B | MXFP4,约 1.56 TB | 单机 8 张 288 GB 级;或 2 台 8 张 141 GB 级 |
| Qwen3.8-2.4T | 2.45T / 95B | FP8,约 2.5 TB | 2 台 8 张 192 GB 级起;长上下文建议 288 GB 级 |
| DeepSeek-V4-Pro-0813 | 1.6T / 49B | FP4 + FP8,约 893 GB | 单机 8 张 141 GB 级起;长上下文建议 192 GB 级 |
| GLM-5.3 | 753B(MoE) | FP8,约 756 GB | 单机 8 张 141 GB 级;或 2 台 8 张 80 GB 级 |
| DeepSeek-V4.1-Flash | 552B / 16B | FP4 + FP8,约 510 GB | 单机 8 张 141 GB 级;8 张 80 GB 级偏紧 |
| MiniMax-M3 | 428B / 23B | MXFP8,约 444 GB | 单机 8 张 80 GB 级;BF16 版需 8 张 141 GB 级 |
| 视频生成模型 | |||
| MiniMax-H3 | 33B 稠密 | BF16,整套约 144 GB | 官方示例 4 卡部署;建议 4 张 80 GB 级起 |
| 中小模型 | |||
| 70B 及以下 | 稠密模型 | BF16 每 10 亿参数约 2 GB | 1–2 张 80 GB 级;INT4 量化后可单卡 |
- MoE 模型按总参数占显存:激活参数只决定每个 token 的计算量,全部专家都要放进显存。
- 另需 KV 缓存与 10%–20% 运行余量;这些大语言模型支持百万级上下文,并发和上下文越长,需要越多,可能要多一台。
- 视频模型的显存与耗时随分辨率、时长和并发增长;H3 整套含主干、文本编码器与视频解码器。档位只表示单卡显存量级,不代表现货型号。
适用场景
私有化部署
开源模型需要长期运行推理服务
训练与微调
按几周到几个月的周期使用资源
数据要求
对数据存放位置与网络隔离有要求
资源合作
持有算力或机房资源,寻求合作
合作范围
可直接洽谈
- 资源能否匹配工作负载
- 部署环境与网络
- 使用周期与合作方式
- 资源供应合作
需单独确认
- 位置、设备与可用容量
- 对外租用与运维范围
- 认证、备份与 SLA
- 到期迁移与退出
机房的一部分资源承载易AI 自己的业务,可对外的部分按实际资源确认;第三方模型也不一定运行在自有机房内。