产品与解决方案

五大核心产品线,覆盖从训练到推理、从单机到千卡集群的完整算力需求。所有产品共享同一套网络、存储与身份体系,可自由组合。

GPU 裸金属

独享物理机,零虚拟化损耗,为大规模分布式训练提供确定性性能。

弹性实例

按秒计费、秒级伸缩,为流量波动的在线业务最大化资源利用率。

托管推理

上传即部署的生产级推理端点,内置连续批处理与量化加速。

并行文件存储

200GB/s 聚合吞吐,POSIX 兼容,训练数据加载不再成为瓶颈。

容器编排

托管 K8s 与 Ray 集群,支持拓扑感知调度与 GPU 共享切分。

成本治理

账单拆解到项目与成员,闲置检测与预算告警主动止损。

01 · GPU 裸金属

零虚拟化损耗的确定性算力

直接交付物理机资源,NCCL 通信性能与自建机房完全一致,适合对吞吐与延迟极度敏感的大规模训练任务。

GPU 裸金属机型规格
机型 GPU 配置 vCPU / 内存 本地 NVMe 网络 适用场景
HC-H100-8 8 × H100 SXM 80GB 224 核 / 2048 GB 2 × 3.84 TB 3.2T IB 千亿参数训练
HC-A100-8 8 × A100 SXM 80GB 192 核 / 1536 GB 2 × 3.84 TB 1.6T IB 通用大模型训练
HC-L40S-8 8 × L40S 48GB 128 核 / 1024 GB 1 × 3.84 TB 400G RoCE 推理与中小微调
HC-A100-4 4 × A100 SXM 80GB 96 核 / 768 GB 1 × 3.84 TB 800G IB 中小规模训练

独占物理资源

无 Hypervisor 层,CPU、内存、PCIe 全部独占,性能抖动趋近于零,长周期训练任务结果可复现。

无损 RDMA 网络

基于 InfiniBand 与 RoCEv2 的无损网络,配合 PFC/ECN 调优,千卡扩展线性加速比稳定在 90% 以上。

整机预留与抢占

长期任务可用预留实例锁定价格与资源;容错型离线任务可用抢占实例,成本低至按量的 3 折。

02 · 弹性实例

按秒计费,让闲置归零

面向流量波动明显的在线服务与批量实验场景。实例可随时升降配、随时销毁,未产生的时间片不计费。

自动伸缩策略

支持基于 QPS、GPU 利用率、显存占用、消息队列深度等多维指标触发伸缩,并支持定时策略与预测式伸缩,从容应对可预期的流量高峰。

  • 缩容至零 · 冷启动预热池
  • 多可用区容灾与流量调度
  • 灰度发布与自动回滚

实例规格族

按计算特性划分为通用型、计算优化型与显存优化型三类,并支持 GPU 切分(MIG / vGPU),让中小模型也能以更低成本获得独占显存。

通用型 g1
1 × L40S / 16 核
计算优化 c1
1 × A100 / 32 核
显存优化 m1
2 × H100 / 48 核
共享切分 s1
1/4 H100 / 8 核
03 · 托管推理

把模型变成稳定的 API

上传权重即获得生产级推理端点。我们负责引擎选型、批处理调优、显存优化与弹性扩缩容,你只关心业务逻辑。

42ms
首 Token 延迟
3.8×
吞吐提升
45%
显存节省
99.99%
服务可用性

连续批处理

动态合并不同长度的请求,GPU 空转时间大幅压缩,高并发下吞吐接近理论上限。

KV Cache 复用

命中前缀共享的请求直接复用缓存,多轮对话与 Few-shot 场景首字延迟显著下降。

量化加速

内置 INT8 / FP8 / AWQ / GPTQ 量化流水线,在精度损失可忽略的前提下把成本降低一半。

04 · 存储与网络

别让 I/O 拖慢你的 GPU

训练集群的瓶颈常常不在显卡,而在数据供给。我们提供与算力同区域部署的高吞吐存储与低延迟网络。

并行文件存储 AFS

POSIX 兼容、全闪介质,单文件系统聚合吞吐最高 200GB/s,支撑数千卡同时读取训练数据。

对象存储 AOS

S3 兼容接口,标准/低频/归档三级存储,冷数据成本低至热数据的 1/12,支持生命周期自动沉降。

高速网络 AXN

RDMA over Converged Ethernet 与 InfiniBand 双栈,跨可用区延迟低于 1.5ms,支持带宽包共享计费。

05 · 行业方案

按场景组合,不必从零搭建

我们把常见业务形态沉淀为参考架构,包含机型选型、网络拓扑、调度策略与成本模型。

大模型预训练

千卡级 InfiniBand 集群 + AFS 并行存储 + Megatron/DeepSpeed 预置镜像。提供检查点自动续训与断点恢复。

  • 最大 4096 卡单集群
  • 拓扑感知调度 · 失败自动重排

在线推理服务

托管推理端点 + 弹性实例兜底 + 多可用区容灾。支持 A/B 实验与按租户隔离的配额管理。

  • 秒级扩容 · 缩容至零
  • 灰度发布 · 自动回滚

科学计算与仿真

高主频 CPU 机型 + 双精度 GPU + Slurm 调度,面向分子动力学、气象预报、CFD 等 HPC 负载优化。

  • Slurm / PBS 原生支持
  • FP64 高精度算力机型

渲染与数字内容

大规模并发渲染农场,按帧计费,支持主流渲染器插件与自动化提交脚本,峰值可瞬间扩展至数千节点。

  • 按帧计费 · 峰值弹性
  • 渲染器插件与提交脚本

不确定该选哪种机型?

把业务场景和预算告诉我们,解决方案架构师会在 1 个工作日内给出一份包含机型、架构与成本测算的建议书。