Series · 0 篇文章 · 17 张笔记卡
LLM 生产化
Provider 适配、模型路由、结构化输出、可观测性、成本与安全护栏等生产落地主题。
OpenAI 兼容接口适配层:别把业务绑死在一个 Provider 上
整理如何用 provider adapter 隔离模型服务差异,让云模型、本地模型和兼容接口能被统一调用。
本地 LLM 服务怎么选:Ollama、vLLM 与 OpenAI 兼容接口
从开发体验、吞吐、模型管理和接口兼容性角度,整理本地或自托管 LLM 服务的选型思路。
模型路由策略:在质量、延迟和成本之间做工程取舍
讨论如何把不同模型放进同一套任务路由体系,用任务风险、输入长度和质量要求做选择。
上下文工程入门:Prompt Caching、长上下文和可复用前缀
从提示前缀、缓存、上下文分层和任务状态出发,整理长上下文 AI 应用的工程设计方法。
Prompt 模板版本控制:把提示词当成代码资产
说明为什么提示词需要版本号、变更记录、评估集和回滚策略,而不是散落在代码字符串里。
结构化输出不是格式洁癖:让 AI 应用可测试、可回滚、可接入
从结构化输出和提示工程出发,整理 AI 应用如何把自然语言结果变成可测试、可验证、可接入的工程接口。
结构化输出失败怎么办:解析、修复和降级路径
整理结构化输出在生产环境里的失败处理:schema 校验、修复请求、人工复核和降级策略。
LLM 调用的限流与重试:别让失败风暴扩大
整理 LLM API 调用中的超时、限流、重试、退避和幂等设计,避免故障时雪崩。
AI 批处理任务设计:什么时候该从实时接口切到 Batch
整理适合异步批处理的 AI 场景,以及任务切分、结果回收和失败重试的设计方式。
LLM 可观测性:为什么日志里要有 prompt、工具和引用
从 trace、span、工具调用和引用链路出发,整理 LLM 应用应该记录哪些观测数据。
AI 成本可观测性:token 预算、缓存和任务画像
整理 AI 应用成本治理的基础做法:记录 token、任务类型、缓存命中和异常请求。
AI 应用护栏设计:从输入过滤到动作确认
整理 AI 应用常见护栏层次:输入风险识别、输出约束、工具权限、人工确认和审计。
发给模型前先脱敏:PII、日志和最小上下文原则
整理 AI 应用接入私有数据前的脱敏策略:字段过滤、最小上下文、日志保留和人工审查。
多模态 AI 产品模式:图片输入到底该放在哪一层
从图片输入、文本推理和结构化输出三个层次,整理多模态 AI 应用的产品与工程拆分方式。
语音转写流水线:从音频切片到可检索文本
整理语音转写系统的基础流水线:上传、切片、转写、说话人信息、校对和入库。
AI 图片生成资产管线:从提示词到可复用素材
把 AI 图片生成纳入设计资产流程:提示词版本、尺寸约束、人工筛选和版权记录。
LLM 应用落地:从测试策略到审计与信任
探讨 LLM 应用在上线前的测试方法、医疗场景下的用户信任风险,以及提升 AI 智能体可审计性的新协议。