來源:arXiv · cs.AI查看原文 ↗
原文著作權歸來源方所有,本站僅作收錄、翻譯或格式整理。
事實脈絡
arXiv:2608.11229v1 Announce Type: new Abstract: Comparative feedback, asking people which of two behaviors they prefer, has become a standard way to align robot and agent behavior with human intent when the reward itsel
解讀與影響
导读摘要
在人类与自主系统协作的场景中,让机器人或智能体的行为符合人类意图一直是一个核心难题。传统方法往往依赖明确的奖励函数来引导学习,但在许多真实任务里,奖励本身难以形式化定义。近年来,比较式反馈(comparative feedback)——即询问人类“你更偏好哪种行为”——逐渐成为对齐行为的常用手段。然而,arXiv 新发表的这项研究指出,仅仅收集偏好反馈还不够:人类与智能体之间对“对方在想什么”的理解差异,会系统性地影响反馈的有效性。
该研究将二阶心智理论引入人机团队建模。所谓二阶心智理论,指的不仅是个体对任务本身的判断,还包括个体对“对方如何判断我的判断”的推理。在比较式反馈的框架下,人类给出偏好时,隐含地假设智能体能够正确理解其选择背后的意图;而智能体在解读反馈时,也会对人类的预期形成自己的模型。当双方的二阶信念不一致时,即使反馈本身是准确的,行为对齐也可能出现偏差。论文提出了一种同步机制,使智能体在更新策略的同时,显式地建模并校准对人类二阶信念的估计。
从技术脉络来看,这项研究与同期多篇关于多智能体协作的论文形成了呼应。例如,关于多 LLM 智能体系统动态治理的研究讨论了当两个目标结构对立的语言模型智能体进行多轮交互时,缺乏共享目标函数会引发何种行为模式;而另一项关于 LLM 智能体社会模拟的工作则关注大规模智能体群体中的宏观涌现现象。相比之下,本文聚焦的是更小规模、更紧密的人机团队场景,其核心贡献在于将“信念同步”从单层偏好对齐提升到二阶推理层面。
论文的具体实验设置与验证结果在摘要中未充分展开,原文未提供更多细节。但可以明确的是,该研究试图解决一个实际且普遍的问题:当人类无法用数值奖励精确表达意图时,如何让智能体不仅“做对的事”,而且“理解人为什么认为这是对的”。这一方向对辅助机器人、个性化推荐系统以及人机协同决策等应用领域具有直接的参考价值。
參考來源
來源原文
arXiv:2608.11229v1 Announce Type: new Abstract: Comparative feedback, asking people which of two behaviors they prefer, has become a standard way to align robot and agent behavior with human intent when the reward itself cannot be specified directly. Preference-based reward learning typically casts the human teacher as a passive oracle answering learner-generated queries. We argue this forfeits the teacher's defining advantage: knowledge of the objective. A teacher who knows the target can construct training examples more efficiently than any learner-driven acquisition strategy, an advantage that widens as the reward's feature dimension grows. However, exploiting this advantage requires an accurate model of what the learner currently knows. We therefore recast p