Series · 0 篇文章 · 17 张笔记卡

LLM 生产化

Provider 适配、模型路由、结构化输出、可观测性、成本与安全护栏等生产落地主题。

01

OpenAI 兼容接口适配层:别把业务绑死在一个 Provider 上

整理如何用 provider adapter 隔离模型服务差异,让云模型、本地模型和兼容接口能被统一调用。

02

本地 LLM 服务怎么选:Ollama、vLLM 与 OpenAI 兼容接口

从开发体验、吞吐、模型管理和接口兼容性角度,整理本地或自托管 LLM 服务的选型思路。

03

模型路由策略:在质量、延迟和成本之间做工程取舍

讨论如何把不同模型放进同一套任务路由体系,用任务风险、输入长度和质量要求做选择。

04

上下文工程入门:Prompt Caching、长上下文和可复用前缀

从提示前缀、缓存、上下文分层和任务状态出发,整理长上下文 AI 应用的工程设计方法。

05

Prompt 模板版本控制:把提示词当成代码资产

说明为什么提示词需要版本号、变更记录、评估集和回滚策略,而不是散落在代码字符串里。

06

结构化输出不是格式洁癖:让 AI 应用可测试、可回滚、可接入

从结构化输出和提示工程出发,整理 AI 应用如何把自然语言结果变成可测试、可验证、可接入的工程接口。

07

结构化输出失败怎么办:解析、修复和降级路径

整理结构化输出在生产环境里的失败处理:schema 校验、修复请求、人工复核和降级策略。

08

LLM 调用的限流与重试:别让失败风暴扩大

整理 LLM API 调用中的超时、限流、重试、退避和幂等设计,避免故障时雪崩。

09

AI 批处理任务设计:什么时候该从实时接口切到 Batch

整理适合异步批处理的 AI 场景,以及任务切分、结果回收和失败重试的设计方式。

10

LLM 可观测性:为什么日志里要有 prompt、工具和引用

从 trace、span、工具调用和引用链路出发,整理 LLM 应用应该记录哪些观测数据。

11

AI 成本可观测性:token 预算、缓存和任务画像

整理 AI 应用成本治理的基础做法:记录 token、任务类型、缓存命中和异常请求。

12

AI 应用护栏设计:从输入过滤到动作确认

整理 AI 应用常见护栏层次:输入风险识别、输出约束、工具权限、人工确认和审计。

13

发给模型前先脱敏:PII、日志和最小上下文原则

整理 AI 应用接入私有数据前的脱敏策略:字段过滤、最小上下文、日志保留和人工审查。

14

多模态 AI 产品模式:图片输入到底该放在哪一层

从图片输入、文本推理和结构化输出三个层次,整理多模态 AI 应用的产品与工程拆分方式。

15

语音转写流水线:从音频切片到可检索文本

整理语音转写系统的基础流水线:上传、切片、转写、说话人信息、校对和入库。

16

AI 图片生成资产管线:从提示词到可复用素材

把 AI 图片生成纳入设计资产流程:提示词版本、尺寸约束、人工筛选和版权记录。

17

LLM 应用落地:从测试策略到审计与信任

探讨 LLM 应用在上线前的测试方法、医疗场景下的用户信任风险,以及提升 AI 智能体可审计性的新协议。