01
问题:拆开之后,还看得见什么?
把复杂任务拆成几个小任务,可以限制每个执行者接触的信息。但监督者也可能因此失去关键上下文。只看拆分后的文字说明,能不能识别有问题的计划?
Factor(U,T) 让能力更强、但可能带有恶意的不可信模型 U 负责拆分任务,由可信模型 T 分别完成子任务。这里的“可信”是控制协议中的假设,不是说模型永远不会出错。论文在 BigCodeBench 的 Python 编程任务上研究这个问题。
02
一个帮助理解的例子
假设计划里有一步叫“整理并输出结果”。这句话本身没有告诉监督者:输出哪些字段、写到哪里、谁能读到。具体实现补上这些细节后,同一句计划可能对应完全不同的行为。
这是为解释问题构造的例子,不是论文中的实验轨迹。它说明了为什么隔离与监督之间可能存在张力:隐藏上下文能限制组件的能力,也可能让监督者看不清组合后的结果。
03
实验结果:0.52 和 0.96 说明什么?
公开论文报告:仅根据拆分计划区分诚实与恶意行为,监测 AUROC 为 0.52;根据完整 Python 解答进行监测,AUROC 为 0.96。这是论文所测试条件下的区分能力,不是所有部署环境中的表现。
AUROC 衡量评分对两类样本的区分能力,0.5 对应随机排序的基准。0.96 不等于“96% 的行为是安全的”,也不直接给出某个阈值下的漏报率。选择阈值、面对新的攻击,以及整个协议是否安全,仍然是另外的问题。
04
对我来说,设计问题变了
我原来关注提示注入和系统提示泄露,后来更在意整个认知系统怎样工作:谁有权限,谁看到上下文,任务怎样拆分,最后又由谁判断。这个项目让我把注意力从提示技巧转向监督所需的信息。
我的贡献包括协议设计、实现、实验设计与分析、对抗评估和论文写作。这个结果支持检查监督者看到了什么;它不能单独证明关于制度、社会反馈循环或“分布式可纠正性”的更大论点。
05
仍然没解决的问题
隔离到什么程度,才既能限制不可信组件,又不至于让监督者丢失必要信息?如果任务拆分者知道监督规则,并据此调整计划,监测还能保持多可靠?
要回答这些问题,需要新的实验。这里保留的是已有结果的范围,以及它让我想继续追问的方向。