Skip to content

【Managed Agent】可观测性与任务治理

本文暂为大纲,正文待补充。

对平台而言,可观测性不只是开发者排查报错的日志。它还要让租户和应用的用量可见,让运营者知道系统是否健康,并在长期卡住或状态异常的任务无人处理时安全止损。

一次任务如何被串起来

  • 使用event_idconversation_idsession_idcorrelation_id关联业务请求、Worker、模型、工具和Sandbox。
  • 日志、Trace和事件账分别回答什么问题,哪些信息不能写入日志。

Usage与Activity

  • 租户级:配额、成本、总体使用趋势与审计。
  • 应用级:模型、工具、Sandbox、Artifact等资源的用量、延迟与失败率。
  • Activity记录谁在何时创建、修改、调用或下载了什么。

从观测到治理

  • 识别长期无进展、心跳过期、重复失败、资源租约泄漏和状态不一致。
  • 保留现场与审计线索后,按策略取消任务、停止进程、回收Sandbox和释放配额。
  • 区分当前已实现能力、已有数据但未形成治理闭环的能力,以及未来策略。

设计约束

  • 可观测性不能泄露Prompt、Secret和用户隐私。
  • 治理动作必须可审计、可解释,并避免误杀仍在正常等待外部IO的任务。