行业动态101AI 基础设施团队6 分钟

千万级算力就位!101AI All in 大模型 Token 服务

这次扩容并不是一次简单的算力叠加,而是围绕吞吐、稳定性和高峰时段调度能力做的一轮整体升级。目标很直接:让高质量模型服务不再只属于头部团队。

101AI
ALL IN ?
千万级算力Token 服务
高性能集群扩容

101AI 新增 40 台高性能 AI 服务器,总计 320 张 RTX 5090 GPU,在深圳核心机房完成部署并正式投入使用。

01

为什么要在这个阶段扩容

过去半年里,开发者的调用模式已经从“单次请求”快速转向“长上下文 + 多轮 Agent + 批量任务”。这类流量峰值更高,且更依赖稳定吞吐。

只有把底层资源提前铺开,才能同时保证价格、速度和可用性,不至于在高峰期被迫提高门槛或限制模型供给。

  • 多轮 Agent 工作流让平均上下文长度显著上升
  • 批量任务和异步生成需要更高的并发承载
  • 企业用户对 SLA 的预期已经明显高于早期试用阶段
02

集群结构怎么调

我们把新增资源拆成多层节点:面向低延迟请求的热路径节点、面向长任务的高吞吐节点,以及负责回退的冗余节点。这样同一套服务既能顶住峰值,也不会在长任务上拖垮整体响应。

调度层在做的不是静态绑定,而是根据实时成本、节点水位和健康度做动态路由。

Cluster Layout

热路径、长任务、回退节点分层调度

通过多层节点和动态路由,把最适合的资源留给最适合的请求。

40 台新增服务器
320 张总 GPU
深圳核心机房部署位置
03

对开发者最直接的变化

更低的排队概率、更稳定的峰值吞吐,以及更容易做到的价格分层,是本次扩容带来的三件最直观的事情。

如果你已经在做代码智能体、长文档分析或连续生成任务,这一轮扩容会让工作流更可预测。

  • 高峰时段的可用率更稳定
  • 高上下文任务的平均等待时间下降
  • 模型套餐和节点组合可以做更细的成本分层
04

下一阶段会开放什么

接下来会把扩容后的调度能力继续下沉到模型广场、订阅套餐和企业私有通道中,让不同层级的用户都能感知到这轮升级带来的价值。

下一阶段

订阅权益、企业专属通道和更细粒度的 SLA 配置会继续开放。

准备好用 AI 创造了吗?

让 101AI 赋能您的业务

统一接入模型、数据产品与智能体工作流,把想法直接送进可落地的生产路径。