研究解读 · AAAI 2026 TrustAgent

Factor(U,T)

只看计划,够吗?

协议示意 · 不是实验轨迹

监督者看到了什么?

  1. 01用户任务

    提出需要完成的问题

  2. 02 · U不可信模型

    把任务拆成文字计划

  3. 03 · T可信执行者

    分别实现子任务

  4. 04完整实现

    组合后形成具体行为

比较的是监督者所见的信息:只读计划,还是读完整解答。

论文报告的监测区分能力
监测输入AUROC
拆分计划0.52
完整 Python 解答0.96

0.5 是随机排序的基准;这些数值不是整体安全率。实验条件与其他协议结果请见论文。

01

问题:拆开之后,还看得见什么?

把复杂任务拆成几个小任务,可以限制每个执行者接触的信息。但监督者也可能因此失去关键上下文。只看拆分后的文字说明,能不能识别有问题的计划?

Factor(U,T) 让能力更强、但可能带有恶意的不可信模型 U 负责拆分任务,由可信模型 T 分别完成子任务。这里的“可信”是控制协议中的假设,不是说模型永远不会出错。论文在 BigCodeBench 的 Python 编程任务上研究这个问题。

02

一个帮助理解的例子

假设计划里有一步叫“整理并输出结果”。这句话本身没有告诉监督者:输出哪些字段、写到哪里、谁能读到。具体实现补上这些细节后,同一句计划可能对应完全不同的行为。

这是为解释问题构造的例子,不是论文中的实验轨迹。它说明了为什么隔离与监督之间可能存在张力:隐藏上下文能限制组件的能力,也可能让监督者看不清组合后的结果。

03

实验结果:0.52 和 0.96 说明什么?

公开论文报告:仅根据拆分计划区分诚实与恶意行为,监测 AUROC 为 0.52;根据完整 Python 解答进行监测,AUROC 为 0.96。这是论文所测试条件下的区分能力,不是所有部署环境中的表现。

AUROC 衡量评分对两类样本的区分能力,0.5 对应随机排序的基准。0.96 不等于“96% 的行为是安全的”,也不直接给出某个阈值下的漏报率。选择阈值、面对新的攻击,以及整个协议是否安全,仍然是另外的问题。

04

对我来说,设计问题变了

我原来关注提示注入和系统提示泄露,后来更在意整个认知系统怎样工作:谁有权限,谁看到上下文,任务怎样拆分,最后又由谁判断。这个项目让我把注意力从提示技巧转向监督所需的信息。

我的贡献包括协议设计、实现、实验设计与分析、对抗评估和论文写作。这个结果支持检查监督者看到了什么;它不能单独证明关于制度、社会反馈循环或“分布式可纠正性”的更大论点。

05

仍然没解决的问题

隔离到什么程度,才既能限制不可信组件,又不至于让监督者丢失必要信息?如果任务拆分者知道监督规则,并据此调整计划,监测还能保持多可靠?

要回答这些问题,需要新的实验。这里保留的是已有结果的范围,以及它让我想继续追问的方向。