运行与 Runtime 容量、限流和验收参考
本页用于让管理员、实施和运行人员回答三个可验收的问题:当前机器能承载多少 AOS Work 接口、Runtime 普通任务和 Sandbox 任务;模型平台是否会成为吞吐瓶颈;上线前应达到哪些压测、监控和恢复标准。
本页解决什么问题
本页用于让管理员、实施和运行人员回答三个可验收的问题:当前机器能承载多少 AOS Work 接口、Runtime 普通任务和 Sandbox 任务;模型平台是否会成为吞吐瓶颈;上线前应达到哪些压测、监控和恢复标准。它不是普通用户操作任务的前置页面。
下列机器数据是当前容量规划的参考基线,适用于 AOS Work 与 Runtime 分机部署且预留约 15%–25% 生产安全空间的前提。它不是客户环境的承诺值;最终结论必须以目标环境、实际模型额度和代表性压测结果为准。
先统一评估口径
| 指标 | 用途 | 合格判断 |
|---|---|---|
| QPS / req/s | AOS Work 每秒接口请求量 | 在目标负载下连续稳定,无持续错误或资源饱和 |
| Run/s | 不启用 Sandbox 时 Runtime 每秒普通任务量 | 与实际任务模型调用和外部依赖共同验证 |
| Session/s | 启用 Sandbox 时每秒完成的完整 AI 任务量 | 按轻、中、重任务分别测量,不能合并为一个数字 |
| 成功率 | 成功请求或任务/全部请求或任务 | 容量结论要求至少 99% |
| P50 / P95 / P99 | 中位、绝大多数、尾部延迟 | 必须记录;阈值按业务 SLA 设定,不只看平均值 |
| CPU、内存、磁盘 | 服务与 Sandbox 资源余量 | 峰值压测下仍保留安全空间,不能仅按 CPU 核数推导并发 |
基础设施容量参考
| 机器规格 | AOS Work 稳定接口量 | Runtime 普通任务(无 Sandbox) | Sandbox 轻/中/重任务 | 推荐场景 |
|---|---|---|---|---|
| 4 核 / 16 GB | 180–250 req/s | 20–35 Run/s | 1–3 / 0.5–1.5 / 0.1–0.5 Session/s | 开发、演示、低流量 |
| 8 核 / 32 GB | 320–430 req/s | 45–75 Run/s | 3–7 / 1–3 / 0.2–0.8 Session/s | 中小规模生产、轻量 AI 工具 |
| 16 核 / 64 GB | 450–500 req/s | 140–160 Run/s | 8–20 / 3–8 / 0.5–2 Session/s | 当前推荐生产基准 |
| 32 核 / 128 GB | 480–600 req/s | 220–300 Run/s | 16–36 / 6–15 / 1–4 Session/s | 中大型生产、较多并发工具任务 |
Sandbox 轻任务为少量状态查询、无大量文件读写;中任务例如约 8 MB 文件写入与多轮计算;重任务例如约 32 MB 文件写入与高强度重复计算。长时间命令、大文件、复杂代码或文档生成应按中/重任务估算。
选择部署与并发上限
| 机器规格 | 无 Sandbox 建议 | Sandbox 建议 | 主要风险 |
|---|---|---|---|
| 4 核 / 16 GB | 1 个 Runtime,16–32 并发普通任务 | 轻任务并发 2;中、重任务并发 1 | CPU、内存余量不足 |
| 8 核 / 32 GB | 1–2 个 Runtime,每个约 32 并发普通任务 | 轻 4–6;中 2–3;重 1–2 | 中重任务的磁盘与内存 |
| 16 核 / 64 GB | 4 个 Runtime,每个最多 64 并发普通任务 | 4 个 Runtime;轻 12、中 6、重 3 | AOS Work 与 Runtime 同机时的 CPU 争用 |
| 32 核 / 128 GB | 4–8 个 Runtime,每个最多 64 并发普通任务 | 8 个 Runtime;轻 24、中 12、重 6 | 数据库、消息系统、磁盘可能先到上限 |
不得将无 Sandbox 的 64 并发配置直接用于 Sandbox。AOS Work 与 Runtime 同机部署时,应在压测中单独证明不存在 CPU、内存或 I/O 争用。
将模型限流纳入计算
端到端持续吞吐取下列最小值:
min(AOS Work 接口容量, Runtime/Sandbox 执行容量,
模型 RPM/RPS, 模型 TPM/TPS, 模型并发或专属吞吐)上线前按每个“平台账号或订阅 + 区域 + 模型 + 版本 + 端点/部署类型”单独记录 RPM/QPM、TPM、RPS/TPS、TPD、并发和专属吞吐中的适用项;Context Window 与 Credits 都不能替代这些限流指标。
所需 RPM = 峰值业务请求/s × 60 × 每个业务请求的模型调用次数
所需 TPM = 峰值业务请求/s × 60 × (P95 输入 Token + P95 输出 Token) × 平台换算系数生产持续负载预算建议只使用平台额度的 70%–80%,为突发流量、重试和长尾输出保留空间。文档生成类任务的现有观测为每完整任务累计约 100,000–500,000 Token;在缺少更多样本时,按 500,000 Token/任务作为初始上界,并持续以 P50/P95 实测替换。
Runtime System Tool 与 Action 边界
业务动作先通过 workbench_action_search 发现,再使用当次返回的 Action Key 与 Schema 执行。搜索不是授权,也不是业务完成证据;执行后还需核对结果和必要的目标状态。access=user 仅操作当前用户有权访问的数据;管理员级操作还需要管理员或超级管理员席位。