ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

DeerFlow Checkpoint Agent

DeerFlow Checkpoint Agent 评测DeerFlow Checkpoint Agent建议重点关注“是否正确保存状态、是否能可靠恢复、恢复后是否继续完成任务”这三类指标。可以按以下维度设计评测。1. 核心功能指标指标含义典型评测方式Checkpoint 创建成功率Agent 是否能在指定节点成功保存检查点成功创建次数 / 总创建次数Checkpoint 完整性保存的状态是否包含恢复所需的全部信息比较保存前后的任务状态、消息、工具调用记录、变量等Checkpoint 可恢复率从检查点恢复后工作流是否能继续执行成功恢复并继续执行次数 / 恢复次数任务最终成功率发生中断后恢复是否仍能完成原任务对比无故障运行与故障恢复运行的最终结果状态一致性恢复后的状态是否与中断前一致校验上下文、执行步骤、工具结果、任务变量恢复后的结果正确率恢复后最终输出是否正确而不仅是流程跑完使用人工标注、规则校验或 LLM Judge 评估其中最重要的指标通常是Recovery Success Rate 成功恢复并正确完成任务的次数 / 总故障测试次数2. 故障恢复能力应模拟不同类型的故障Agent 进程崩溃服务重启网络中断LLM 调用超时Tool 调用失败数据库或 Checkpoint Store 暂时不可用流程在不同节点被中断长时间暂停后恢复并发请求下发生故障对应指标包括恢复成功率恢复成功率 恢复成功次数 / 故障次数恢复时间从检测到故障或收到恢复请求到 Agent 重新开始执行的时间Recovery Time Resume Timestamp - Failure Timestamp建议统计平均恢复时间P50P95P99恢复后的任务完成时间恢复之后任务从断点继续执行到最终完成所需的时间。需要注意区分从故障到恢复的时间恢复后重新执行的时间总任务完成时间可恢复断点覆盖率测试任务中Checkpoint 是否覆盖所有关键执行节点Checkpoint Coverage 可从检查点恢复的关键节点数 / 关键节点总数3. Exactly-once 与幂等性这是 Checkpoint Agent 很关键的评测项。恢复时可能出现某个工具调用已经成功但结果还没来得及写入 CheckpointAgent 重启后重复调用工具消息已经发送但状态没有更新外部副作用已经产生但流程认为没有执行因此建议评测重复执行率Duplicate Execution Rate 被重复执行的步骤数 / 总步骤数特别关注有副作用的操作发邮件创建订单写数据库调用支付接口发布消息修改文件创建云资源幂等恢复成功率对于允许重试的工具Idempotent Recovery Rate 重试后结果正确且无额外副作用的次数 / 总重试次数副作用一致性检查恢复后是否出现重复扣款重复发消息重复创建资源数据覆盖状态回退任务步骤跳过如果 DeerFlow Checkpoint Agent 不保证严格 exactly-once也应该明确其语义是At-most-once最多执行一次可能丢失At-least-once至少执行一次可能重复Effectively-once通过幂等键、事务或去重实现业务上的一次效果4. Checkpoint 数据正确性建议检查以下状态是否被正确保存和恢复Agent 状态当前任务 ID当前执行节点当前步骤子 Agent 状态Agent 之间的通信状态暂停、等待、失败、完成等状态对话上下文System PromptUser MessageAssistant MessageTool CallTool Result中间推理所需的上下文消息顺序消息角色和元数据运行时变量工作流变量工具参数环境配置重试次数超时状态已完成步骤列表待执行步骤列表外部引用文件路径数据库记录 ID对象存储地址子任务 ID远程任务状态可以为每个字段定义恢复正确率Field Recovery Accuracy 正确恢复的字段数 / 应恢复字段总数5. 性能指标Checkpoint 写入延迟统计平均写入延迟P95/P99 写入延迟大状态写入延迟并发写入延迟Checkpoint 恢复延迟包括查找 Checkpoint读取数据反序列化重建 Agent 状态恢复工作流上下文Checkpoint 开销比较启用和禁用 Checkpoint 时的差异Time Overhead 启用 Checkpoint 的任务耗时 - 未启用时任务耗时Storage Overhead Checkpoint 占用空间 / 原始任务状态大小还可以统计单次 Checkpoint 大小每个任务产生的 Checkpoint 数量每个任务的总存储量序列化和反序列化 CPU 占用内存占用网络流量6. 长任务和大上下文能力Checkpoint Agent 往往用于长流程因此建议专门测试100 步、1,000 步以上的工作流大量消息上下文多个子 Agent 协作多轮工具调用长时间暂停后恢复多次连续暂停和恢复Checkpoint 数量持续增长大文件、复杂 JSON、嵌套状态上下文压缩或裁剪后是否仍可恢复重要指标随任务长度增长的成功率变化随上下文大小增长的恢复延迟长任务的存储增长曲线多次恢复后的状态漂移率7. 并发与一致性如果多个请求或多个 Worker 可能同时操作同一任务需要评测同一任务并发创建 Checkpoint同一任务被多个实例同时恢复一个实例写入、另一个实例读取Checkpoint 版本冲突重复 Resume 请求乱序写入Worker 崩溃后锁是否释放对应指标并发冲突率数据覆盖率版本回退率脏读率重复恢复率乐观锁/悲观锁失败率最终一致性收敛时间如果系统要求严格顺序尤其要验证Checkpoint Version N1 不应被 Version N 覆盖8. 可靠性和稳定性建议通过长时间压测和故障注入评测连续运行 24 小时或更长时间高并发任务随机注入进程崩溃随机注入网络错误随机删除或损坏部分 CheckpointCheckpoint Store 容量不足数据库连接池耗尽LLM 服务限流工具响应异常指标包括长时间运行成功率MTBF平均故障间隔MTTR平均恢复时间Checkpoint 损坏率数据丢失率任务丢失率错误重试成功率故障恢复后的最终任务成功率9. 安全和数据隔离Checkpoint 通常包含完整对话和工具调用信息应评测不同用户是否能读取彼此的 Checkpoint不同租户是否隔离是否存在越权恢复Checkpoint 是否加密存储敏感信息是否脱敏删除任务后 Checkpoint 是否真正删除日志是否泄露 Prompt、Token 或工具参数恢复请求是否校验任务所有权Checkpoint 是否支持访问审计关键指标Unauthorized Access Rate 越权访问成功次数 / 越权访问测试次数理想值应为 0。10. 成本指标如果 Checkpoint 会增加存储和调用成本建议统计每个任务的 Checkpoint 存储成本每次恢复额外产生的 Token 消耗重试导致的工具调用成本Checkpoint 序列化、读写的计算成本不同保存频率下的成本变化增量 Checkpoint 与全量 Checkpoint 的成本差异推荐的最小评测指标集如果只做一版基础评测建议至少包含以下 10 项Checkpoint 创建成功率Checkpoint 数据完整性恢复成功率恢复后任务最终成功率恢复时间 P50/P95/P99状态一致性重复执行率外部副作用错误率Checkpoint 写入和读取延迟多租户数据隔离和越权访问率推荐报告格式可以按下面的形式输出测试任务数1,000 故障注入次数500 Checkpoint 创建成功率99.8% Checkpoint 完整性99.5% 恢复成功率98.6% 恢复后最终任务成功率97.8% 状态一致性99.2% 重复执行率0.7% 外部副作用错误率0.1% 恢复延迟 - P50320 ms - P951.2 s - P993.8 s Checkpoint 写入延迟 - P5045 ms - P95180 ms 存储开销 - 平均每任务2.4 MB - 相比无 Checkpoint 的额外耗时6.3% 安全 - 越权访问成功率0% - 跨租户数据泄露0 次总体上不要只评测“Checkpoint 能不能保存和读取”更应该评测在 Agent 执行到任意阶段发生故障后是否能以正确的状态恢复并且不丢任务、不乱序、不重复产生外部副作用最终得到与无故障执行一致的结果。
返回列表