算力层 · 自建机房 · 业务承载

自建机房资源

易AI 拥有自建机房,将按工作负载与周期确认资源匹配情况及双方分工。

适合企业技术团队 · 基础设施合作伙伴

易AI 自建机房示例

工作负载需求

工作负载
推理服务
用途
内部知识库问答
模型
开源大模型,私有化部署
使用周期
按项目确定
希望上线
下季度
咨询内容
机房资源能否匹配
公司与数字为示意,替换为实际情况后发给我们。

部署方式对比

  • 公有云 GPU

    按需开通的云上算力

    适合
    短期试验、负载波动大的业务
    起步
    开通即用
    计费
    按小时或按量,长期运行成本偏高
    数据
    存放在云厂商环境
  • 自建机房资源

    按工作负载匹配机房资源

    适合
    长期运行的推理服务、按周期的训练与微调
    起步
    按配置与周期确认资源
    计费
    按配置与使用周期报价
    数据
    可约定所在机房与网络隔离方式
  • 企业本地私有化

    设备放在企业自己的环境

    适合
    数据不能离开企业环境
    起步
    采购、上架与部署周期较长
    计费
    一次性投入设备,另计运维
    数据
    完全留在企业内部

三种方式可以组合,例如试验期用公有云,稳定后迁到自建机房。

选型参考

各家最新开源大模型私有化推理的显存粗估,按官方发布的权重计算,用来提需求时定一个起点;实际配置以实测为准。

模型总参数 / 激活参数官方权重推理部署参考
大语言模型
Kimi K32.8T / 104BMXFP4,约 1.56 TB单机 8 张 288 GB 级;或 2 台 8 张 141 GB 级
Qwen3.8-2.4T2.45T / 95BFP8,约 2.5 TB2 台 8 张 192 GB 级起;长上下文建议 288 GB 级
DeepSeek-V4-Pro-08131.6T / 49BFP4 + FP8,约 893 GB单机 8 张 141 GB 级起;长上下文建议 192 GB 级
GLM-5.3753B(MoE)FP8,约 756 GB单机 8 张 141 GB 级;或 2 台 8 张 80 GB 级
DeepSeek-V4.1-Flash552B / 16BFP4 + FP8,约 510 GB单机 8 张 141 GB 级;8 张 80 GB 级偏紧
MiniMax-M3428B / 23BMXFP8,约 444 GB单机 8 张 80 GB 级;BF16 版需 8 张 141 GB 级
视频生成模型
MiniMax-H333B 稠密BF16,整套约 144 GB官方示例 4 卡部署;建议 4 张 80 GB 级起
中小模型
70B 及以下稠密模型BF16 每 10 亿参数约 2 GB1–2 张 80 GB 级;INT4 量化后可单卡
  • MoE 模型按总参数占显存:激活参数只决定每个 token 的计算量,全部专家都要放进显存。
  • 另需 KV 缓存与 10%–20% 运行余量;这些大语言模型支持百万级上下文,并发和上下文越长,需要越多,可能要多一台。
  • 视频模型的显存与耗时随分辨率、时长和并发增长;H3 整套含主干、文本编码器与视频解码器。档位只表示单卡显存量级,不代表现货型号。
私有化部署开源模型:显存怎么估

适用场景

  • 私有化部署

    开源模型需要长期运行推理服务

  • 训练与微调

    按几周到几个月的周期使用资源

  • 数据要求

    对数据存放位置与网络隔离有要求

  • 资源合作

    持有算力或机房资源,寻求合作

合作范围

可直接洽谈

  • 资源能否匹配工作负载
  • 部署环境与网络
  • 使用周期与合作方式
  • 资源供应合作

需单独确认

  • 位置、设备与可用容量
  • 对外租用与运维范围
  • 认证、备份与 SLA
  • 到期迁移与退出

机房的一部分资源承载易AI 自己的业务,可对外的部分按实际资源确认;第三方模型也不一定运行在自有机房内。

合作流程

  1. 1

    描述工作负载

    推理或训练、模型规模与使用周期。

  2. 2

    核对资源

    确认计算、存储与网络能否匹配。

  3. 3

    划分责任

    权限、运维、备份与到期退出。

询价准备

  • 工作负载类型
  • 模型规模
  • 计算与存储
  • 网络要求
  • 使用周期
联系我们

联系我们

咨询方向:基础设施能力

微信Li___CaB6

查看联系页