
核心结论生成成功只是中间状态;真正的生产完成还包括安全交付、可追踪成本和可恢复失败。
请求入口
- 校验文件类型、大小、尺寸和可访问性。
- 限制 Prompt 长度并清理不可见字符。
- 为每次提交生成稳定 request_id。
- 使用幂等键防止重复任务。
- 对用户、团队和项目设置速率限制。
任务执行
- 使用明确的 pending、running 和终态状态机。
- 为连接、排队和总任务分别设置超时。
- 只重试可恢复错误,并采用退避与抖动。
- 为路由定义主模型、回退模型和停止条件。
- 记录版本、参数、路由原因和供应商任务号。
结果交付
- 验证 Webhook 签名并去重事件。
- 把结果复制到自有存储,不依赖短期 URL。
- 校验媒体类型、大小、时长和解码能力。
- 在发布前执行内容安全与品牌规则检查。
- 为失败、超时和审核中的状态提供清晰用户界面。
运营与治理
- 设置单任务、单用户和每日预算上限。
- 明确输入、Prompt、日志和输出的保留期限。
- 为供应商中断、价格变化和模型下线准备演练。
ModelRush 建议把这份清单变成发布门禁,并为每项保留测试证据。最容易被忽略的不是主路径,而是重复回调、结果过期、用户取消和供应商已扣费但客户端超时这类边界。
上线后的第一周应每天查看失败类型、P95 交付时间、可用成片率和单位成本,再决定是否提高流量。
下一步
从这篇文章直接进入模型详情、当前价格、API 文档和 Playground。查看 API 文档
把文章中的架构和可靠性原则对应到请求、任务状态与错误处理。继续阅读
围绕相邻决策继续构建你的多模型技术栈。


