Skip to content

考点5:上下文管理与可靠性(15%)

5.1 管理对话上下文以保留关键信息

关键知识:

  • 渐进式摘要的风险:数字值、百分比和日期在模糊摘要中被压缩
  • 中间迷失效应:模型可靠地处理长输入的开头和结尾,但可能错过中间的发现
  • 工具输出可能在上下文中积累,与相关性不成比例(需要5个字段时却有40+个字段)
  • 在后续API请求中发送完整对话历史的重要性

关键技能:

  • 将事务性事实提取到摘要历史之外的持久化"案例事实"块中
  • 将详细的工具输出精简到相关字段
  • 在汇总数据的开头放置关键发现,并使用明确的章节标题
  • 要求子智能体在结构化输出中包含元数据(日期、来源)

5.2 设计有效的升级模式并解决歧义

关键知识:

  • 适当的升级触发器:明确请求人工干预、策略缺口/例外、无法取得进展
  • 立即升级(明确请求)vs 尝试解决(在智能体范围内)
  • 情感分析和模型置信度自评是案例复杂性的不可靠智能体
  • 多个客户匹配需要请求额外标识符,而非启发式猜测

关键技能:

  • 在系统提示词中使用少样本示例明确升级标准
  • 立即执行人工干预的明确请求,不进行额外调查
  • 当策略对特定请求模糊或未明确时升级
  • 当工具结果包含多个匹配时请求额外标识符

5.3 在多智能体系统中实现错误传播策略

关键知识:

  • 结构化错误上下文(故障类型、查询、部分结果、替代方案)使协调者能够更智能地恢复
  • 区分访问失败(超时需要重试决策)和有效的空结果(无匹配)
  • 通用错误状态("搜索不可用")对协调者隐藏了有价值的上下文
  • 静默抑制或在单个失败时中止整个工作流都是反模式

关键技能:

  • 返回结构化错误上下文:故障类型、尝试内容、部分结果、可能的替代方案
  • 区分访问失败和有效的空结果
  • 在子智能体内对瞬时失败进行本地恢复;仅传播无法恢复的错误以及部分结果
  • 在综合中注释覆盖范围:哪些内容有充分支撑vs哪里存在缺口

5.4 在调查大型代码库时高效管理上下文

关键知识:

  • 长会话中的上下文退化:模型开始产生不稳定的答案,并提及"典型模式"而非具体类
  • 草稿文件跨上下文边界保留关键发现
  • 委托给子智能体可以隔离详细的发现输出
  • 结构化状态持久化支持崩溃恢复

关键技能:

  • 为具体问题生成子智能体,同时在主智能体中保持高层协调
  • 使用草稿文件存储关键发现并在后续引用
  • 在生成下一阶段子智能体之前总结关键发现
  • 在长时间调查中使用 /compact 减少上下文使用

5.5 设计具有人工监督和置信度校准的工作流

关键知识:

  • 总体指标(例如,97%总体准确率)可能掩盖特定文档类型或字段上的差性能
  • 分层随机抽样测量高置信度提取中的错误率
  • 使用标注验证集进行字段级置信度校准
  • 在自动化之前按文档类型和字段细分验证准确性

关键技能:

  • 实现分层随机抽样以检测新的错误模式
  • 按文档类型和字段分析准确性以验证稳定性能
  • 输出字段级置信度分数并使用标注数据校准审查阈值
  • 将低置信度或模糊来源的提取路由到人工审查

5.6 在多源综合中保存溯源信息并处理不确定性

关键知识:

  • 在摘要期间未保留"声明→来源"映射时归因会丢失
  • 在聚合期间必须保留结构化映射
  • 通过用归因注释冲突来处理冲突统计数据,而非任意选择一个值
  • 包含发布/收集日期以避免将时间差异误读为矛盾

关键技能:

  • 要求子智能体输出"声明→来源"映射(URL、文档名称、引用)
  • 将报告结构化为将稳定发现与有争议发现分开
  • 保留带有注释的冲突值,并传递给协调者进行调解
  • 包含发布日期以便正确解读时间顺序
  • 按类型渲染内容:财务数据用表格,新闻用散文,技术发现用结构化列表