GPU 裸金属
独享物理机,零虚拟化损耗,为大规模分布式训练提供确定性性能。
五大核心产品线,覆盖从训练到推理、从单机到千卡集群的完整算力需求。所有产品共享同一套网络、存储与身份体系,可自由组合。
独享物理机,零虚拟化损耗,为大规模分布式训练提供确定性性能。
按秒计费、秒级伸缩,为流量波动的在线业务最大化资源利用率。
上传即部署的生产级推理端点,内置连续批处理与量化加速。
200GB/s 聚合吞吐,POSIX 兼容,训练数据加载不再成为瓶颈。
托管 K8s 与 Ray 集群,支持拓扑感知调度与 GPU 共享切分。
账单拆解到项目与成员,闲置检测与预算告警主动止损。
直接交付物理机资源,NCCL 通信性能与自建机房完全一致,适合对吞吐与延迟极度敏感的大规模训练任务。
| 机型 | GPU 配置 | vCPU / 内存 | 本地 NVMe | 网络 | 适用场景 |
|---|---|---|---|---|---|
| HC-H100-8 | 8 × H100 SXM 80GB | 224 核 / 2048 GB | 2 × 3.84 TB | 3.2T IB | 千亿参数训练 |
| HC-A100-8 | 8 × A100 SXM 80GB | 192 核 / 1536 GB | 2 × 3.84 TB | 1.6T IB | 通用大模型训练 |
| HC-L40S-8 | 8 × L40S 48GB | 128 核 / 1024 GB | 1 × 3.84 TB | 400G RoCE | 推理与中小微调 |
| HC-A100-4 | 4 × A100 SXM 80GB | 96 核 / 768 GB | 1 × 3.84 TB | 800G IB | 中小规模训练 |
无 Hypervisor 层,CPU、内存、PCIe 全部独占,性能抖动趋近于零,长周期训练任务结果可复现。
基于 InfiniBand 与 RoCEv2 的无损网络,配合 PFC/ECN 调优,千卡扩展线性加速比稳定在 90% 以上。
长期任务可用预留实例锁定价格与资源;容错型离线任务可用抢占实例,成本低至按量的 3 折。
面向流量波动明显的在线服务与批量实验场景。实例可随时升降配、随时销毁,未产生的时间片不计费。
支持基于 QPS、GPU 利用率、显存占用、消息队列深度等多维指标触发伸缩,并支持定时策略与预测式伸缩,从容应对可预期的流量高峰。
按计算特性划分为通用型、计算优化型与显存优化型三类,并支持 GPU 切分(MIG / vGPU),让中小模型也能以更低成本获得独占显存。
上传权重即获得生产级推理端点。我们负责引擎选型、批处理调优、显存优化与弹性扩缩容,你只关心业务逻辑。
动态合并不同长度的请求,GPU 空转时间大幅压缩,高并发下吞吐接近理论上限。
命中前缀共享的请求直接复用缓存,多轮对话与 Few-shot 场景首字延迟显著下降。
内置 INT8 / FP8 / AWQ / GPTQ 量化流水线,在精度损失可忽略的前提下把成本降低一半。
训练集群的瓶颈常常不在显卡,而在数据供给。我们提供与算力同区域部署的高吞吐存储与低延迟网络。
POSIX 兼容、全闪介质,单文件系统聚合吞吐最高 200GB/s,支撑数千卡同时读取训练数据。
S3 兼容接口,标准/低频/归档三级存储,冷数据成本低至热数据的 1/12,支持生命周期自动沉降。
RDMA over Converged Ethernet 与 InfiniBand 双栈,跨可用区延迟低于 1.5ms,支持带宽包共享计费。
我们把常见业务形态沉淀为参考架构,包含机型选型、网络拓扑、调度策略与成本模型。
千卡级 InfiniBand 集群 + AFS 并行存储 + Megatron/DeepSpeed 预置镜像。提供检查点自动续训与断点恢复。
托管推理端点 + 弹性实例兜底 + 多可用区容灾。支持 A/B 实验与按租户隔离的配额管理。
高主频 CPU 机型 + 双精度 GPU + Slurm 调度,面向分子动力学、气象预报、CFD 等 HPC 负载优化。
大规模并发渲染农场,按帧计费,支持主流渲染器插件与自动化提交脚本,峰值可瞬间扩展至数千节点。