返回文章列表

长任务 Agent 的恢复点:失败后从哪一步继续

解释长任务 Agent 为什么需要检查点、任务状态和可恢复步骤,而不是一口气跑完整流程。

长任务 Agent 一旦涉及检索、工具、人工确认和外部 API,就不可能假设每次都完整成功。LangGraph 文档强调 durable execution,适合把长任务拆成可恢复的状态图。[resume-001]

每一步都要能记录状态

比如写文章 Agent:

选题 -> 找来源 -> 筛来源 -> 写大纲 -> 写正文 -> 审稿 -> 发布

每一步都应该有输入、输出、状态和错误原因。

长任务可靠性的关键,是失败后不需要从第一步重来。

概念状态:

{
  "step": "source_filtering",
  "status": "failed",
  "error": "two sources unavailable",
  "resume_from": "source_retrieval"
}

恢复不等于重试

有些失败可以重试,例如网络超时;有些失败需要人工处理,例如来源不足;有些失败要终止,例如权限不够。

综合长任务 Agent 资料可以推断:工作流恢复点是 Agent 从 demo 走向生产的分界线之一。

参考资料

  1. [resume-001] LangChain Docs, “LangGraph overview”, https://docs.langchain.com/oss/python/langgraph/overview