长任务 Agent 的恢复点:失败后从哪一步继续
解释长任务 Agent 为什么需要检查点、任务状态和可恢复步骤,而不是一口气跑完整流程。
长任务 Agent 一旦涉及检索、工具、人工确认和外部 API,就不可能假设每次都完整成功。LangGraph 文档强调 durable execution,适合把长任务拆成可恢复的状态图。[resume-001]
每一步都要能记录状态
比如写文章 Agent:
选题 -> 找来源 -> 筛来源 -> 写大纲 -> 写正文 -> 审稿 -> 发布每一步都应该有输入、输出、状态和错误原因。
长任务可靠性的关键,是失败后不需要从第一步重来。
概念状态:
{
"step": "source_filtering",
"status": "failed",
"error": "two sources unavailable",
"resume_from": "source_retrieval"
}恢复不等于重试
有些失败可以重试,例如网络超时;有些失败需要人工处理,例如来源不足;有些失败要终止,例如权限不够。
综合长任务 Agent 资料可以推断:工作流恢复点是 Agent 从 demo 走向生产的分界线之一。
参考资料
- [resume-001] LangChain Docs, “LangGraph overview”, https://docs.langchain.com/oss/python/langgraph/overview