101AI 新增 40 台高性能 AI 服务器,总计 320 张 RTX 5090 GPU,在深圳核心机房完成部署并正式投入使用。
为什么要在这个阶段扩容
过去半年里,开发者的调用模式已经从“单次请求”快速转向“长上下文 + 多轮 Agent + 批量任务”。这类流量峰值更高,且更依赖稳定吞吐。
只有把底层资源提前铺开,才能同时保证价格、速度和可用性,不至于在高峰期被迫提高门槛或限制模型供给。
- 多轮 Agent 工作流让平均上下文长度显著上升
- 批量任务和异步生成需要更高的并发承载
- 企业用户对 SLA 的预期已经明显高于早期试用阶段
集群结构怎么调
我们把新增资源拆成多层节点:面向低延迟请求的热路径节点、面向长任务的高吞吐节点,以及负责回退的冗余节点。这样同一套服务既能顶住峰值,也不会在长任务上拖垮整体响应。
调度层在做的不是静态绑定,而是根据实时成本、节点水位和健康度做动态路由。
热路径、长任务、回退节点分层调度
通过多层节点和动态路由,把最适合的资源留给最适合的请求。
对开发者最直接的变化
更低的排队概率、更稳定的峰值吞吐,以及更容易做到的价格分层,是本次扩容带来的三件最直观的事情。
如果你已经在做代码智能体、长文档分析或连续生成任务,这一轮扩容会让工作流更可预测。
- 高峰时段的可用率更稳定
- 高上下文任务的平均等待时间下降
- 模型套餐和节点组合可以做更细的成本分层
下一阶段会开放什么
接下来会把扩容后的调度能力继续下沉到模型广场、订阅套餐和企业私有通道中,让不同层级的用户都能感知到这轮升级带来的价值。
订阅权益、企业专属通道和更细粒度的 SLA 配置会继续开放。
