LLMOps后端基础设施
把大模型应用送上生产
2026年6月22日 · 7 分钟
从 demo 到产品之间的鸿沟
一个大模型 demo 会掩盖真正重要的一切:尾延迟、每用户成本、当供应商返回 500 时会 发生什么,以及你如何知道某次改动是变好了还是变差了。
我从不省略的四件事
- 流式 + 超时。 用流式输出提升体感速度;给每个上游调用设硬上限,并优雅降级。
- 一层缓存。 语义缓存 + 精确匹配缓存,对成本与延迟的改善胜过任何模型替换。
- 结构化输出。 要求 JSON schema,做校验,失败前先尝试修复一次。
- CI 中的离线评测。 每个 PR 都跑黄金集,回归则阻止合并。
const res = await withTimeout(
llm.stream({ schema, messages }),
8_000,
() => fallbackModel.stream({ schema, messages })
);
观测一切
记录 prompt、检索到的上下文、token、成本,以及每个请求的 trace id。当用户说 它给了个奇怪的答案时,你要能回放,而不是靠猜。