← 全部文章
LLMOps后端基础设施

把大模型应用送上生产

2026年6月22日 · 7 分钟

从 demo 到产品之间的鸿沟

一个大模型 demo 会掩盖真正重要的一切:尾延迟、每用户成本、当供应商返回 500 时会 发生什么,以及你如何知道某次改动是变好了还是变差了。

我从不省略的四件事

  • 流式 + 超时。 用流式输出提升体感速度;给每个上游调用设硬上限,并优雅降级。
  • 一层缓存。 语义缓存 + 精确匹配缓存,对成本与延迟的改善胜过任何模型替换。
  • 结构化输出。 要求 JSON schema,做校验,失败前先尝试修复一次。
  • CI 中的离线评测。 每个 PR 都跑黄金集,回归则阻止合并。
const res = await withTimeout(
  llm.stream({ schema, messages }),
  8_000,
  () => fallbackModel.stream({ schema, messages })
);

观测一切

记录 prompt、检索到的上下文、token、成本,以及每个请求的 trace id。当用户说 它给了个奇怪的答案时,你要能回放,而不是靠猜。

相关水晶