前头部云厂商计算产品负责人,主导过三代云主机架构落地。坚信算力应当像水电一样易得。
让每一份算力都物尽其用
我们相信算力不该是少数团队的奢侈品。ArithCloud 从第一天起就只做一件事:把高性能计算资源做得更易获得、更易使用、更便宜。
从一台没人用的 GPU 开始
2019 年,创始团队在一家 AI 实验室里发现了一个尴尬的现实:机房里的 GPU 平均利用率不足 30%,而隔壁的创业团队却因为买不到卡、排不上队,把模型训练排期推后了整整两个月。
ArithCloud 由此诞生。我们没有从零造硬件,而是先解决调度问题——把分散、闲置、规格各异的算力聚合起来,用统一的接口交付出去。第一个版本只有 128 张卡,却服务了 11 家客户。
七年过去,平台上的在线 GPU 超过 12000 张,分布在 8 个自建可用区。但目标从未改变:让拿到算力这件事,变得像打开水龙头一样自然。
先问结果,再谈资源
我们不推销最贵的卡,而是先理解你的模型规模与迭代节奏,再给出够用且经济的配置。
交付简单,是本事
拓扑编排、网络调优、故障自愈都藏在平台内部。用户看到的应该只有一行命令和一个可用端点。
不做一次性生意
算力是长跑。我们把资源自建、技术自研,而不是转售拼凑,只为在三年、五年后依然能履约。
一路走来的关键节点
公司成立,首个可用区上线
在杭州部署 128 张 GPU,发布第一版调度引擎与开放 API,服务首批 11 家客户。
弹性实例与按秒计费发布
推出行业首批按秒计费的 GPU 弹性实例,同年通过等保三级认证,客户数突破 500 家。
自建 3.2T InfiniBand 集群
完成首个千卡规模无损网络集群,线性加速比突破 92%,支撑多个百亿参数模型的持续训练。
托管推理服务上线
内置连续批处理与 KV Cache 复用,把模型部署从数天缩短到数分钟,推理成本平均下降 40%。
8 大可用区、12000+ 卡在线
完成全国骨干网络布局,服务 3000+ 家客户,推出企业级专属资源池与专属架构师服务。
做算力的人,也是用算力的人
团队来自头部云厂商、芯片公司与 AI 实验室,平均从业年限超过十年,每个人都亲手调过大规模训练任务。
分布式系统专家,曾负责万节点级调度系统。现主导 ArithCloud 调度引擎与网络架构研发。
深耕 GPU 并行计算十五年,负责 InfiniBand 集群拓扑设计与大规模训练性能调优。
专注模型服务化与推理加速,主导托管推理引擎的连续批处理与量化流水线实现。
负责 AFS 并行文件系统与 RDMA 网络栈,把训练数据加载瓶颈从小时级压到分钟级。
统筹等保三级与 ISO 27001 体系建设,负责租户隔离、密钥管理与审计合规。
带领架构师团队服务超 800 家企业客户,擅长把业务语言翻译成可落地的算力架构。
自建可用区,自研调度
所有算力资源均为自建自运营,不依赖第三方转售。这让我们能在性能、价格与服务承诺上给出确定答案。
| 可用区 | 所在地 | 在线 GPU | 网络架构 | 机房等级 |
|---|---|---|---|---|
| cn-hangzhou-1 | 浙江 · 杭州 | 3,200 卡 | 3.2T InfiniBand | Tier IV |
| cn-beijing-1 | 北京 · 亦庄 | 2,600 卡 | 3.2T InfiniBand | Tier IV |
| cn-shanghai-1 | 上海 · 临港 | 2,100 卡 | 1.6T InfiniBand | Tier III+ |
| cn-shenzhen-1 | 广东 · 深圳 | 1,800 卡 | 400G RoCEv2 | Tier III+ |
| cn-chengdu-1 | 四川 · 成都 | 1,400 卡 | 400G RoCEv2 | Tier III+ |
| cn-wuhan-1 | 湖北 · 武汉 | 900 卡 | 200G RoCEv2 | Tier III |