[Agent 考古] 多 Agent 冲突仲裁三方案:均衡约定、PERSUADER 劝说与行为抽象

Under the Sun with Paddy

系列名称:意图即承诺,智能体即社会——自主性的第一个可计算答案

篇号:第 5 篇 / 共 11 篇 主题分类:历史记述 前置阅读总览与阅读路线 · 合同网 阅读时间:约 15 分钟


三种仲裁:合同网留下的冲突,与三个互不相识的答案

上一篇的结尾停在一个尴尬的场景上:两个管理者同时看中了同一个承包者。Davis 和 Smith 在合同网论文第 11.4 节亲口承认,“全局最优不一定由局部最优拼接而来”,脚注 22 干脆直接命名:“这像是囚徒困境的一种”contractnet-limitcontractnet-pd。协议能走完招标、投标、成交的全部流程,却回答不了一个更根本的问题:当匹配权的竞争是真冲突时,谁说了算?管理者无权裁决利益冲突,节点又被预设为自愿合作——合同网把最难的那一步留在了协议外面。

1988 到 1990 年,三篇论文从三个互不相同的方向撞上了这同一个缺口。卡内基梅隆的 Katia Sycara 造了一个扮演劳工调解人的程序 PERSUADER,不裁决谁对谁错,只用先例和劝说论据动态改写双方的效用结构。希伯来大学的 Gilad Zlotkin 和 Jeffrey Rosenschein 把博弈论整个搬进协商,证明均衡策略本身就是约定,根本不需要外部仲裁者。马萨诸塞大学的 Edmund Durfee 与 Thomas Montgomery 让机器人在六维行为空间里识别潜在冲突,逐级下钻消解。三种答案,三种仲裁形态,构成本篇的主角。

本篇沿着这三条线依次走完,最后合观一个直到今天仍然扎人的发现:这三种机制,连同它们试图修补的合同网,没有一种能摆脱设计期的人工预设。

缺口:自愿投标的节点,从来没被问过”为什么”

先回到缺口本身。合同网的核心假设写在论文第一页——它研究的是“由分散且松耦合的问题求解器集合进行的合作解题”(the cooperative solution of problems by a decentralized and loosely coupled collection of problem solvers)contractnet-coop。节点“从自身视角评估信息”,但投标本身被预设为自愿行为:协议从不追问节点为什么投标、投多高、什么时候宁愿不投。

Zlotkin 和 Rosenschein 在 1989 年把这一点挑明了:

“Smith’s work on the Contract Net introduced a form of simple negotiation among cooperating agents, with one agent announcing the availability of tasks and awarding them to other bidding agents. While Smith’s original work assumed some autonomy among agents, these agents willingly bid for tasks without explicit motivation.” ——Smith 的合同网引入了一种合作 agent 间的简单协商,一个 agent 宣告任务的可获得性并授予投标的 agent。Smith 的原始工作虽假设 agent 有某种自主性,但这些 agent 不带明确动机地自愿投标。zr-critique

“不带明确动机的自愿投标”,这句批评的分量在于它点出的是一块空白,而非 bug:合同网没有动机模型。论文自己给出的数字例(第 11.4 节 Fig.19)把这个空白具象化了:两个管理者 A、B 和两个承包者 X、Y,A 的视角里 X 评 0.9、Y 评 0.8,B 的视角里 X 评 0.8、Y 评 0.2。双方都想要 X,但全局更优的分配是 A 接受 Y、把 X 让给 B。局部最优拼不出全局最优,协议本身解决不了,只能靠信息交换的代价权衡兜着contractnet-pd

这就是三篇论文共同的起点。三年之内,三个团队各自交卷:

Image

这张时间线上的三个分支回答的是同一个问题——矛盾建议谁仲裁。PERSUADER 的答案是第三方调解,Z&R 的答案是协议内生均衡,D&M 的答案是分层行为协调。加上合同网本身的招标裁决(管理者仲裁),四种形态并列,才构成 1983-1990 年“谁仲裁”问题的完整答案谱系。下面按时间倒着讲也许更顺,但按“离博弈论最近”的顺序讲更清楚:先看 Z&R 如何用效用计算取代自愿姿态,再看 PERSUADER 如何反过来批评效用计算本身,最后看 D&M 如何绕开效用 altogether。

均衡即约定:Z&R 给自愿投标补上效用动机

Zlotkin 和 Rosenschein 的论文《Negotiation and Task Sharing Among Autonomous Agents in Cooperative Domains》发表于 IJCAI-89,页码 912-917zr-paper。此处需要一条署名勘误:论文署名 Zlotkin 在前、Rosenschein 在后(Gilad Zlotkin, Jeffrey S. Rosenschein,Hebrew University),而通行文件名以 RosenscheinZlotkin 命名、顺序相反。引用按论文实际署名顺序标注。论文开篇就给自己的位置定了调:

“This paper imports game theoretic techniques into an analysis of multi-agent negotiation, in a way analogous to Malone’s introduction of economic theory to the Contract Net.” ——本文把博弈论技术引入多 agent 协商分析,其方式类似于 Malone 把经济学理论引入合同网。zr-import

类比很精确:Malone 给合同网补了市场机制,Z&R 要给协商补上博弈论。而且他们没有走博弈论的现成大道——连续域和完全信息这两条标准假设被明确弃置,转而研究“离散域且 agent 只有部分信息”的情形,理由很实际:后者对人工智能更有意义。

Z&R 区分了合作域与非合作域。合作域“总存在至少一个能维持或增加每个 agent 孤立效用的交易”;非合作域“每个 agent 单干反而更好,加入群体只为处理干扰而不得不压低效用”zr-domain。要点在于,即便是合作域,个体利益冲突仍是分析的轴心——每个 agent 全程按自身效用计算,双赢是定理的结论,无须预设善意。核心机制有三件:协商集 NS 收拢所有个体理性且帕累托最优的交易,Theorem 2 保证它非空(总有双赢空间),Theorem 3 保证协议下有限步收敛;Zeuthen 策略让 agent 用主观概率估计对方是否会坚守上一报价,只在坚守的期望收益大于让步损失时才不让步,Extended Zeuthen Strategy 在均衡中(Theorem 5)。

于是有了全文最重要的那句论断——均衡即约定

“if it were commonly known that the said strategy was being built into automated agents, no one could benefit by choosing a different strategy for their own agent.” ——若该策略内置于自动化 agent 成为公共知识,则没有任何人为自己的 agent 改选别的策略能获益。zr-convention

矛盾如何裁决?不需要外部仲裁者。均衡策略本身就是约定(convention):单方偏离无益。谈崩了也有可信兜底——冲突交易(conflict deal),即各送各的信,”no agent will agree to deliver any letters other than his own”(没有任何 agent 会同意投递除自己以外的信)zr-conflict。整条协商流程可以这样看:

Image

图里最要紧的是右下角那条虚线:协商的每一步都悬在“谈崩”的悬崖边上,而悬崖底下不是深渊,是冲突交易这个可信回落。正因为各干各的是一个真实存在的坏结局,让步才有分寸,约定才立得住。

撒谎分析:协议设计如何封死有利谎言

Z&R 还做了一件更细的事:分析撒谎的激励。在纯交易下,藏信(hiding letters,隐瞒自己持有的信件)是“安全谎言”(”it is a ‘safe’ lie—it will never be discovered”,永远不会被发现)且有利,效用 6 对诚实的 4;幻影信(phantom letters,伪造不存在的信)同样安全有利,效用 4 对诚实的 3。但在混合交易下,幻影信可能被要求交付给对方而暴露。Theorem 9 的原话:

“when negotiating on mixed deals there never exists a beneficial safe lie” ——在混合交易上协商时,永远不存在有利的安全谎言。zr-theorem9

我们在复现仓里用数字示例验证了这条定理(完整代码在 ../persuader-negotiation-reproduction/)。程序对三种交易类型逐一检查有利的安全谎言是否存在,输出如下:

  pure_cooperative:
  有利谎言存在: True
  说明: 纯交易下藏信是安全谎言 (效用6 vs 诚实4), 永远不会被发现

pure_competitive:
  有利谎言存在: True
  说明: 纯交易下幻影信安全且有利 (效用4 vs 诚实3), 但非合作域冲突交易为兜底

mixed:
  有利谎言存在: False
  说明: 混合交易下幻影信可能被要求交付给对方而暴露,
        不存在有利的安全谎言 (Theorem 9)

>> 结论:在混合交易上协商时,永远不存在有利的安全谎言

三行输出讲了一个完整的机制设计故事:纯交易下两种谎言都安全有利——藏信净赚 2,幻影信净赚 1;切到混合交易,有利谎言的存在标志直接翻成 False。协议设计本身就是防背叛机制:选择纯交易还是混合交易,直接决定 agent 能否靠撒谎获利,不需要外部审计来盯梢。这一层洞察,即把激励封进协议结构而非依靠监督,会在十年后以 FIPA 交互协议的形态重新出现,此是后话。

效用重写:PERSUADER 做一个不裁决的调解人

Z&R 用博弈论批评合同网的时候,Sycara 的 PERSUADER 已经先批评了整个 AI 界。这篇发表于 AAAI-88(页码 245-250)的论文开篇就开火persuader-paper。此处需要一条替代说明:目标文献本应是 Sycara 发表于 EJOR 46(2) 1990 的期刊长文,经 OpenAlex 核验为 closed access 无 OA 副本,按预案退用 AAAI-88 会议版:同一个 PERSUADER 系统,机制三件套一致。两条批评一针见血:

“AI work has focused primarily on fostering cooperation and avoiding goal conflicts.” ——AI 工作主要聚焦于促进合作、回避目标冲突。persuader-critique

“In environments where cooperative behavior of the agents cannot be assumed, goal conflicts have to be resolved by finding compromises.” ——在无法假设 agent 合作行为的环境里,目标冲突必须通过寻找折中来解决。persuader-compromise

更锋利的是对博弈论路线的批评:”no attempt is made to influence other agents’ utilities and payoffs, i.e. the dynamics of negotiation is ignored”,没人试图影响其他 agent 的效用与支付,协商的动态被忽略了persuader-dyn。在 Sycara 看来,真实协商的动态恰恰是不断改变对方的效用:你劝我让一步,不是在固定支付矩阵前选策略,而是让我重新估量这一步对我的价值。Z&R 假设效用给定再求均衡,PERSUADER 直接把”改写效用”做成算法。

角色设定写得很清楚:

“the PERSUADER, a program which, acting as a labor mediator, enters in negotiation with each of the parties, the union and company, proposing and modifying compromises and utilities until a final agreement is reached.” ——PERSUADER 是一个扮演劳工调解人的程序,与工会和公司双方分别进入协商,提出并修改折中方案和效用,直到达成最终协议。persuader-mediator

领域知识来自两位执业联邦调解人——一位参与开发、一位做非正式验证persuader-expert。注意这个措辞:调解人(mediator),不是仲裁人(arbitrator)。PERSUADER 的核心特征是不裁决——它不宣判谁对,只用机制让“之前不是解的方案后来变成解”。机制有三件:案例推理(CBR)以 contracts、impasses、arguments 三个焦点检索先例,成功案例存入 memory 复用,僵局连同失败原因存储以警示;偏好分析基于多属性效用理论,准则为”maximizes the joint payoff of the agents and minimizes the payoff difference”(联合收益最大化加收益差最小化,效率与公平兼顾);劝说式论据则是招牌:说服某人可以被建模为提高该方案对他的收益。

信念结构:把对方的目标画成一张 DAG

三件机制里最独特的是第三件,而它的核心数据结构是信念结构。原文写道:

“The PERSUADER’s model of a persuadee’s goals is a directed acyclic graph, called a belief structure. It is searched and updated during argument generation. The nodes are goals with the associated importance, utility value, and desired direction of change. The arcs represent the percent contribution of a goal to each of its ancestor goals.” ——PERSUADER 对被劝说方目标的建模是一个有向无环图,称为信念结构。它在论据生成过程中被搜索与更新。节点是目标,附有重要性、效用值和期望变化方向;边表示一个目标对每个祖先目标的贡献百分比。persuader-belief

在复现仓(../persuader-negotiation-reproduction/,含 persuader/belief_structure.pypersuader/case_library.pypersuader/negotiator.py 三个模块)里,工会的信念结构是这样搭起来的,数字忠实于原文的 trace——工会 wage_goal 重要性 6,employment 重要性 8persuader-trace

bs = BeliefStructure("工会信念结构")
bs.add_node("wage_raise", importance=6, direction="increase")
bs.add_node("employment", importance=8, direction="increase")
bs.add_node("pension", importance=5, direction="increase")
bs.add_node("outsourcing", importance=7, direction="decrease")
# 因果边: wage_raise -> labor_cost -> production_cost -> employment
bs.add_edge("wage_raise", "labor_cost", 0.4)
bs.add_edge("labor_cost", "production_cost", 0.6)
bs.add_edge("production_cost", "employment", -0.5)

看这几个数字的用意:wage_raise 沿因果链向上爬——加薪推高劳动成本(+0.4)、劳动成本推高生产成本(+0.6)、生产成本反过来削减雇佣(-0.5)。劝说算法就藏在这张图的爬升里。find_pivot 是论据生成的核心,从被拒绝的议题出发,沿因果边向祖先传播,找一个重要性更高的目标节点当支点:

def find_pivot(self, source_goal):
   source_importance = self.nodes[source_goal].importance
   ancestors = self.get_ancestors(source_goal)   # BFS 向祖先传播
   for ancestor in sorted(ancestors, key=lambda n: self.nodes[n].importance, reverse=True):
       if self.nodes[ancestor].importance > source_importance:
           return ancestor, self.trace_path(source_goal, ancestor)
   return None

论据生成的关键示例是原文那句”If the company is forced to grant higher wage increases, then it will decrease employment”,若公司被迫给予更高加薪,就会削减雇佣。算法从 wage_raise 出发,沿 wage_raise → labor_cost → production_cost → employment 传播到 employment,发现它的重要性 8 大于 wage 的 6,支点成立,论据生成。翻译成人话就是:“你坚持的这一条,会伤到你自己更在乎的那一条。”这不再是讨价还价,而是劝说——它不改变议题本身,改变的是议题在对方效用结构里的权重。

Sycara 把这个过程命名为动态问题空间

“The negotiation process itself is a search of a dynamic problem space where an agent’s beliefs about other agents’ beliefs over the cycle of proposals continuously changes the space being searched. What was not a solution at one point becomes a solution at a later point.” ——协商过程本身是对一个动态问题空间的搜索,agent 关于其他 agent 信念的信念在提案循环中持续改变着被搜索的空间。之前不是解的方案,后来变成了解。persuader-dynamic

如果劝说失败、折中被拒,修理准则兜底:修复须让反对者的收益增量大于此前赞成者的收益损失,否则不收敛。这一条保证调解人有路可走,但注意它没有硬兜底——不像 Z&R 有冲突交易,谈崩了 PERSUADER 只能一直修下去。

Getaway 算例:三个 agent 如何达成一致

PERSUADER 论文里的完整算例是 Getaway 运输公司罢工谈判:工会要 15% 涨薪、7% 养老金、零外包;公司要 0%、0%、无限外包persuader-getaway。协商器扮演调解人,与工会、公司两方构成三个 agent,依次执行 CBR 检索、财务约束检查、主动提醒检验、劝说式论据生成和偏好分析。运行 main.py 的完整输出:

============================================================
实验1:Getaway 算例——工会 vs 公司
============================================================
工会要求: {'wage_raise': 15, 'pension': 7, 'outsourcing': 0}
公司出价: {'wage_raise': 0, 'pension': 0, 'outsourcing': inf}

[轮次 1] 初始折中生成 -- CBR 检索
  CBR 检索先例: Bluehound 运输公司合同 (12%/5%/无限外包)
  先例方案: 涨薪 12%, 养老金 5%, 外包 unlimited
  适配后: 涨薪 12.9%, 养老金 5.6%, 仅超额工作可有限外包

[轮次 2] 财务约束检查
  检索财务数据: 3 年连亏 4%
  应用启发式: 降幅=亏损百分比之半
  降幅 = 亏损百分比之半 = 2%
  涨薪 12.9% -> 10.9%

[轮次 3] 主动提醒检验 (intentional reminding)
  检索到先例: 外包无时限申诉先例
  失败原因: 工会曾因外包无时限提出申诉
  修复: 在外包条款加时间限制
  外包条款: limited_with_time_limit

[轮次 4] 劝说式论据生成
  论据: "若公司被迫给予更高加薪, 就会削减雇佣
          (wage_raise -> labor_cost -> production_cost -> employment)"
  信念传播路径: wage_raise -> labor_cost -> production_cost -> employment
  工会 wage_raise 重要性(6) < employment 重要性(8), 论据成立

[轮次 5] 偏好分析 -- 联合收益最大化 + 收益差最小化
  工会效用: 15.63
  公司效用: 4.00
  联合收益: 19.63
  收益差:   11.63

协商结果: {'wage_raise': 10.9, 'pension': 5.6,
            'outsourcing': 'limited_with_time_limit'}
使用先例: ['Bluehound 运输公司合同 (12%/5%/无限外包)',
            '3年连续亏损4%案例', '外包无时限申诉先例']
劝说论据数: 1

五个轮次就是机制三件套的一次完整合奏:CBR 检索到 Bluehound 同区先例(12%/5%)适配成 12.9%/5.6%;查到 3 年连亏 4% 的财务数据,应用“降幅=亏损之半”的启发式砍到 10.9%;主动提醒检验翻出外包无时限曾引发申诉的僵局先例,给外包条款加上时间限制;然后是全场的支点——劝说论据沿信念图传播,employment 的 8 压过 wage 的 6,论据成立;最后偏好分析给出联合收益 19.63、收益差 11.63 的收尾核算。论文原文的最终涨薪是 9%,复现是 10.9%,差异来自先例适配的启发式简化:原文用行业竞争地位和地区工资差做领域推理,复现用 70% 先例加 30% 需求的线性插值代替。这个差异我们会在文末的边界清单里如实展开。

行为抽象:D&M 只广播行为的轮廓,冲突才下钻

第三种答案来自完全不同的场景:分布式机器人。Durfee 和 Montgomery 的论文《A Hierarchical Protocol for Coordinating Multiagent Behavior》发表于 AAAI-90,页码 86-93。此处需要一条页码勘误:通行引文标注 88-95 有误,实际页脚印刷页码为 86-93dm-paper

核心概念是行为抽象层级(behavior abstraction hierarchy),定义走的是先否定再肯定的路线——“它不是计划层级……也不是目标层级”,然后正面给出:“行为层级涵盖计划与目标层级,因为它表征做什么与怎么做,还有谁、何时、何地、为何”dm-behavior。六个维度:做什么(what)、怎么做(how)、谁(who)、何时(when)、何地(where)、为何(why)。

这里必须划一条关键界线,划错了整篇论文就会被误读。“行为抽象层级”是协调协议中通信内容的抽象层级——agent 之间交换什么信息、以多粗的粒度交换;它不是 agent 内部的分层架构——agent 内部如何组织与此无关。Ferguson 的综述甚至把本篇归入审慎式架构一节,这是分类错误:本系列把 D&M 归入协调协议线,而非架构线,不得称为分层混合架构的代表。这条界线在讲 TouringMachines 的那一篇还会再遇到。

协议流程反而简单。agent“盲播最抽象的行为信息而非计划细节”(blindly broadcast the most abstract behavior information rather than plan details),在六维空间中定位自己的行为区域,“区域重叠或邻近即可识别潜在交互”dm-protocol。发现潜在负交互时二选一:沿行为维度修改自身行为避开,或者下钻一层——更细的层面可能发现“看似冲突实则无冲突”。整个循环长这样:

Image

图里藏着协议的全部经济性:左上角那个循环是“问一句最粗的问题,多数情况就此打住”;只有区域重叠才付出细节交换的代价,而权威序的移交机制(图右半)保证了发现冲突后总有裁决出口。出口的裁决依据是预设权威值——已实现版本给每台机器人唯一权威值并按全序轮流做上下级,动态权威分配在 1990 年还只是 future work。这一点先记下,结尾要用。

实验数字来自 MICE 测试床加 GBB 黑板的 36 组实验,把协调粒度与通信代价的权衡量得清清楚楚dm-experiment。无协调时两机器人“在门口永久碰撞”;仅抽象层协调,2 条消息即无冲突,但完全串行,Done=51;细节层协调 16 条消息,Done=101——细协调的通信与推理开销反噬了总时长;而无冲突情形完全不协调反而最优,Done=27。结论落在一句朴素的话上:“不同情形应在不同层级消解冲突”,单层级协议做不到。D&M 对 PGP(部分全局规划)的继承与超越也写在明处:原文说“部分全局规划被我们的新协议包含”;PGP 依赖静态组织知识规定“该与谁交换计划”,本协议“不假设此类知识”dm-pgp。而行为六维与 Malone 1987 人类组织分解方向的对应,为后来的 TAEMS 系统埋了线。这条线在谱系一节再展开。

谁仲裁、凭什么、谈崩了怎么办

三种机制到这里都出场了,加上它们共同回应的合同网,四种仲裁形态可以放进同一张表里对勘:

维度Z&R 均衡约定PERSUADER 效用重写D&M 行为抽象层级
谁仲裁无外部仲裁者,协议内生均衡第三方调解者(mediator,非 arbitrator)预设权威值全序(动态权威为 future work)
依据什么个体效用计算 + Zeuthen 策略案例先例 + 信念结构 + 偏好分析行为六维空间区域重叠
谈崩了怎么办冲突交易(各干各的)作可信兜底修理准则保证收敛;无硬兜底沿行为维度修改避开,或按权威序裁决
防背叛机制Theorem 9:混合交易封死安全谎言劝说论据改变对方效用结构盲播最抽象信息减少信息泄露

(合同网的形态是第四种:招标裁决,由管理者用投标评估程序裁决,谈崩没有兜底,没人投标任务就完不成。)

三种机制并不互斥,它们回答的是不同层面的问题:Z&R 回答“在效用已知、目标良定义的合作域中如何达成帕累托最优交易”;PERSUADER 回答“在效用不精确可知、目标欠定的真实冲突中如何找到可接受折中”;D&M 回答“在分布式机器人中如何用最小通信量识别和消解行为冲突”。换到 BDI 坐标上看更清楚:合同网在意图层仲裁,管理者裁决意图承诺的归属;Z&R 在信念层仲裁,均衡策略作为公共知识构成约定;PERSUADER 在愿望层仲裁,调解者改写对方效用,改写效用就是改写愿望;D&M 也在信念层仲裁,行为描述的抽象层级控制着信息交换的粒度。四种形态在 BDI 三轴上各占一格,正好把“谁仲裁”问题铺满。

但把四格铺满不等于把问题解决。这张表里还有一列没被追问:表头写着“依据什么”,而每一种依据(效用函数、信念结构、六维坐标)是从哪里来的?这是 Bar-Hillel 之刺要扎的地方。

Bar-Hillel 之刺:效用、信念、维度,全在设计期就装好了

本系列惯用的那把检验刀,在此再磨一次:

“一个理论的语义解释力,取决于它能把多少不可观察的内部状态映射到可观察的行为上。如果一个理论需要预设不可观察的内部状态作为前提,那么这些前提本身就需要被解释。”

Z&R 的博弈论协商要求效用函数已知。但“如何从无限事实中构造效用函数”正是前提选择问题。Z&R 在四条假设中明确列出了 EXPECTED UTILITY MAXIMIZER 和 COMPLETE KNOWLEDGE:agent 是期望效用最大化者且拥有完全知识zr-assumptions。可现实中 agent 的效用函数从何而来?从信念、目标、偏好的无限事实中构造一个标量效用函数,这本身就是一次设计期的人工选择。Z&R 证明的是“给定效用函数后均衡存在”,但效用函数的构造(信念到效用的映射)是一个未被形式化的黑箱。Theorem 9 说“混合交易下不存在有利的安全谎言”,前提是 agent 对交易类型的分类(纯交易还是混合交易)本身是公共知识——这个分类从何而来?如果 agent 对交易类型的信念不一致,Theorem 9 的安全保证就失效。

PERSUADER 的劝说式论据需要信念结构作为支点。但“哪些信念节点是对方的支点”需要理解对方的内部状态。信念结构是调解人“建模被劝说方的目标”,可调解人如何知道对方的目标重要性?原文的答案上文已经给过:两位执业联邦调解人做领域专家persuader-expert。这等于说,信念结构是设计期注入的,不是运行时学到的。PERSUADER 证明的是“给定信念结构后论据生成有效”,但信念结构本身(“employment 重要性 8 > wage 重要性 6”)是从哪里来的?如果对方的真实重要性排序与调解人建模的不同,论据就会失效——你说服了一个不存在的信念结构。

这不是假设性的担忧,复现代码可以当场演示。

编者注:以下反例为本篇新增的验证实验,代码取自复现仓的 BeliefStructure,仅调换两个节点的重要性数字,因果边与算法均未改动。

同一张因果图,换一个真实排序为“工资高于饭碗”的工会——wage_raise 重要性 8、employment 重要性 6,边的贡献系数一概不变:

bs = BeliefStructure("工会信念结构(真实排序反例)")
bs.add_node("wage_raise", importance=8, direction="increase")
bs.add_node("employment", importance=6, direction="increase")
# 因果边不变: wage_raise -> labor_cost -> production_cost -> employment

运行 find_pivot("wage_raise"),返回 None——祖先节点里重要性最高的是 employment 的 6,压不过源节点的 8,支点不成立,论据生成直接失败。而同一个函数跑在调解人建模的那张 DAG 上(wage 6、employment 8),返回的是 employment 支点和完整的传播路径。这就是“效用函数预设了仲裁结果”的实证:劝说能否成立,在信念结构写下的那一刻就已经定了——算法只是在 DAG 里把设计者装好的数字读出来。Getaway 算例的“成功劝说”,成功的从来不是算法,是那两个数字的排序。

D&M 的行为抽象层级需要“用什么维度描述行为”是设计者预先选定的——六维(what/how/who/when/where/why)是人为选择的描述框架,原文没有论证为什么是这六个维度而非五个或七个。“区域重叠即识别潜在交互”依赖六维空间的坐标系定义。如果两个行为的“why”维度不同但在其他五维重叠,它们是否冲突?D&M 的回答取决于设计者如何定义“重叠”。这又是一次前提选择。

三篇合观的结论:1990-1995 的实现里,完全不依赖设计期预设的仲裁机制并不存在。Z&R 预设了效用函数,PERSUADER 预设了信念结构,D&M 预设了行为维度。真正的动态仲裁,即效用元推理(agent 自己反思自己的效用函数从何而来)、学习层(agent 从交互中学习对方的信念结构)、动态权威分配(agent 运行时协商谁做仲裁者,而非依赖预设全序),在三篇原文中全部位于 future work。Z&R 的 NO HISTORY 假设(每次协商独立)直接排除了学习;PERSUADER 的信念结构由领域专家提供,排除了运行时学习;D&M 的动态权威分配“列为进行中的工作”,但 1990 年的实现版本全靠预设权威值全序。那句“之前不是解的方案后来变成了解”听上去很动态,可让方案变成解的那个支点,从第一天起就没动过。

谱系回响:报价协议、论据协商与任务结构

批评归批评,这三种机制的影响是实打实的,而且各走各路。引证强度按本系列惯例分级。

强影响:Z&R 的报价/让步协议流入 FIPA 的 propose/accept-proposal/reject-proposal 交互协议。Z&R 的同时报价、每步至少一方让步的协议结构,直接进入 FIPA 1997 规范集的交互协议定义——FIPA Contract Net Interaction Protocol(FIPA00026)和 FIPA Request Interaction Protocol(FIPA00037)中的 propose/accept/reject 循环,正是 Z&R 报价/让步谱系的标准化形态fipa-00026fipa-00037

中强影响:PERSUADER 的劝说式论据机制流向论据协商(Argumentation-Based Negotiation)。“说服某人可以被建模为提高该方案对他的收益”这一思想,影响了 Sierra、Jennings 和 Parsons 1998 年提出的论据协商模型;信念结构(DAG)的搜索与更新机制,为后来论据协商中论据的生成与评估提供了框架abn-1998

中等影响:D&M 的行为抽象层级埋线 TAEMS 任务结构建模。D&M 原文将行为六维与 Malone 1987 人类组织分解方向对应,这一对应为 Decker 1995 年的 TAEMS(Task Analysis and Environment Modeling System)系统埋下伏笔——TAEMS 把任务间关系建模为 enable/facilitate/hinder 等质量关系,继承了“不同情形应在不同层级消解冲突”的核心思想taems

把三路影响和四种仲裁形态画在一张图上,谱系的形状就出来了。下图保留自本系列的研究底稿,从“谁仲裁、依据什么、谈崩了怎么办、防背叛”四个切口并置三种机制:

​三种仲裁机制对比Z&R 均衡约定PERSUADER 效用重写D&M 行为抽象层级谁仲裁无外部仲裁者协议内生均衡策略谁仲裁第三方调解者(mediator, 非 arbitrator)谁仲裁预设权威值全序(动态权威为 future work)依据什么个体效用计算Zeuthen 策略Theorem 5: 策略均衡依据什么案例先例 (CBR)信念结构 (DAG)劝说论据找支点依据什么行为六维空间区域重叠检测逐级下钻交换细节谈崩了怎么办冲突交易兜底各送各的信谈崩了怎么办修理准则保证收敛反对者增量 > 赞成者损失谈崩了怎么办沿行为维度避让或按权威序裁决防背叛Theorem 9:混合交易封死安全谎言防背叛劝说论据改写对方效用结构防背叛盲播最抽象信息减少信息泄露

三种仲裁机制对比 Z&R 均衡约定 PERSUADER 效用重写 D&M 行为抽象层级 谁仲裁 无外部仲裁者 协议内生均衡策略 谁仲裁 第三方调解者 (mediator, 非 arbitrator) 谁仲裁 预设权威值全序 (动态权威为 future work) 依据什么 个体效用计算 Zeuthen 策略 Theorem 5: 策略均衡 依据什么 案例先例 (CBR) 信念结构 (DAG) 劝说论据找支点 依据什么 行为六维空间 区域重叠检测 逐级下钻交换细节 谈崩了怎么办 冲突交易兜底 各送各的信 谈崩了怎么办 修理准则保证收敛 反对者增量 > 赞成者损失 谈崩了怎么办 沿行为维度避让 或按权威序裁决 防背叛 Theorem 9: 混合交易封死安全谎言 防背叛 劝说论据 改写对方效用结构 防背叛 盲播最抽象信息 减少信息泄露

图上三列并置,读法是纵向对比而非横向排名:每一列在四个切口上的答案,就是它的仲裁形态全部。这个谱系在系列里还有几处后续。对上一篇的合同网而言,囚徒困境缺口(第 11.4 节 Fig.19)由这三种仲裁补足,合同网的招标裁决只是四种形态之一。对智能体如何找到彼此一篇,Z&R 的报价/让步谱系流入 FIPA 的 propose/accept/reject 之后,FIPA 的言语行为类型学就不只是消息格式标准化,更是协商协议的可证均衡收敛:Theorem 3(有限步收敛)和 Theorem 5(策略均衡)为 FIPA 交互协议提供了博弈论地基。对反应与慎思的和解一篇,D&M 的“行为抽象层级”必须与 TouringMachines 的三层并发结构划清界限:后者是 agent 内部的控制分层(反应层/规划层/建模层),前者是 agent 之间的通信内容分层,一个回答“agent 内部如何组织”,一个回答“agent 之间交换什么”。对意图编辑权一篇,四种仲裁形态是意图编辑权分担在冲突消解面的展开:合同网把编辑权交给管理者,Z&R 交给协议(策略内置于所有 agent),PERSUADER 交给调解者(改写对方效用即改写对方意图),D&M 交给行为维度(沿维度修改行为即修改意图)。而对自组织的实证与治理悖论一篇,Dochkina 的 Sequential 机制将是第五种仲裁——涌现式自主弃权。前四种都依赖设计期预设;Sequential 展示的是运行时涌现的权威分配:agent 通过观察对方的弃权行为动态推断谁该做仲裁者,无需预设。

复现的边界:这次简化了什么

按系列惯例,复现的每一条简化都要摊开在结尾。第一条,先例适配简化:原文用行业竞争地位和地区工资差做领域推理得到 11%/4%,复现用 70% 先例加 30% 需求的线性插值得到 12.9%/5.6%,最终涨薪 10.9% 对原文的 9%,差异全部来自适配启发式的简化。第二条,信念结构预构建:原文的信念结构由两位执业联邦调解人提供领域知识,复现的信念结构是手工编码的固定 DAG;PERSUADER 原文的“动态问题空间”(信念结构在协商过程中被搜索与更新)在复现中仅实现了搜索(find_pivot),未实现动态更新。第三条,撒谎分析为示例性验证:Z&R 的 Theorem 9 是形式化证明,复现仅用数字示例(效用 6 对 4、4 对 3)做说明性验证,未复现形式化证明过程。第四条,D&M 未复现:本篇代码只复现了 PERSUADER 和 Z&R 两个机制,D&M 的行为抽象层级在文中描述但未编码实现,实验数字(2 条消息/16 条消息/Done 值)引自原文。

四条边界摆在一起,恰好和 Bar-Hillel 之刺的结论互为印证:复现越忠实,越能看清原文把什么做成了前提。Z&R 证明了给定效用函数后均衡存在,PERSUADER 证明了给定信念结构后论据生成有效,D&M 证明了给定六维坐标后冲突可分层消解——三篇论文各自把“仲裁”做成定理、算法、协议,也各自把最难的半步留在了设计期。1990-1995 年间,完全不依赖设计期预设的仲裁机制并不存在;下一次有人宣称解决了“谁仲裁”,值得先问一句:它的效用、信念和维度,是谁在什么时候装进去的。

参考文献

[contractnet-limit]  Davis, R. & Smith, R.G. (1983). “Negotiation as a Metaphor for Distributed Problem Solving.” Artificial Intelligence, 20(1):63-109. 第 11.4 节,Fig.19 及脚注 22。

[contractnet-coop]  同上,第 1 节:”the cooperative solution of problems by a decentralized and loosely coupled collection of problem solvers.”

[contractnet-pd]  同上,脚注 22:”This appears to be a variety of the ‘prisoner’s dilemma’ problem.”

[zr-paper]  Zlotkin, G. & Rosenschein, J.S. (1989). “Negotiation and Task Sharing Among Autonomous Agents in Cooperative Domains.” IJCAI-89, pp. 912-917. 署名勘误:论文署名 Zlotkin 在前、Rosenschein 在后,文件名顺序相反。

[zr-critique]  同上,第 1.2 节:”these agents willingly bid for tasks without explicit motivation.”

[zr-import]  同上,第 1.3 节:”This paper imports game theoretic techniques into an analysis of multi-agent negotiation.”

[zr-domain]  同上,第 2.1 节脚注 1:合作域与非合作域定义。

[zr-convention]  同上,第 6 节结论:”if it were commonly known that the said strategy was being built into automated agents, no one could benefit by choosing a different strategy for their own agent.”

[zr-theorem9]  同上,第 5 节 Theorem 9:”when negotiating on mixed deals there never exists a beneficial safe lie.”

[zr-conflict]  同上,第 3.1 节:”no agent will agree to deliver any letters other than his own.”

[zr-assumptions]  同上,第 2.3 节四条假设:EXPECTED UTILITY MAXIMIZER / COMPLETE KNOWLEDGE / NO HISTORY / COMMITMENTS ARE VERIFIABLE。

[persuader-paper]  Sycara, K. (1988). “Resolving Goal Conflicts via Negotiation.” AAAI-88, pp. 245-250. 替代说明:目标 EJOR 46(2) 1990 期刊版经 OpenAlex 核验为 closed access 无 OA 副本,按预案退用 AAAI-88 会议版。

[persuader-critique]  同上,第 1 节:”AI work has focused primarily on fostering cooperation and avoiding goal conflicts.”

[persuader-compromise]  同上,第 1 节:”In environments where cooperative behavior of the agents cannot be assumed, goal conflicts have to be resolved by finding compromises.”

[persuader-dyn]  同上,第 1 节:”no attempt is made to influence other agents’ utilities and payoffs, i.e. the dynamics of negotiation is ignored.”

[persuader-mediator]  同上,第 1-2 节:”the PERSUADER, a program which, acting as a labor mediator, enters in negotiation with each of the parties.”

[persuader-belief]  同上,第 5.1 节:”The PERSUADER’s model of a persuadee’s goals is a directed acyclic graph, called a belief structure.”

[persuader-trace]  同上,第 5.1 节论据生成示例:工会 wage_goal 重要性 6,employment 重要性 8,8 > 6 故论据成立。

[persuader-dynamic]  同上,第 1 节:”The negotiation process itself is a search of a dynamic problem space… What was not a solution at one point becomes a solution at a later point.”

[persuader-getaway]  同上,第 4 节 Getaway 运输公司罢工谈判完整算例:工会要 15%/7%/零外包,公司要 0/0/无限外包。CBR 检索 Bluehound 先例 (12%/5%) → 适配 11%/4% → 查财务 3 年亏 4% → 降幅=亏损之半 → 9% → 外包条款加时限。

[persuader-expert]  同上,第 2 节:”We used two practicing Federal Mediators as experts: one for development and the other for informal validation.” 脚注 3:联邦调解人依法须销毁全部案卷。

[dm-paper]  Durfee, E.H. & Montgomery, T.A. (1990). “A Hierarchical Protocol for Coordinating Multiagent Behavior.” AAAI-90, pp. 86-93. 页码勘误:通行引文标注 88-95 有误,实际页脚印刷页码为 86-93。

[dm-behavior]  同上:”It is not the plan level… nor is it the goal level.” 正面定义六维:what/how/who/when/where/why。

[dm-protocol]  同上:”blindly broadcast the most abstract behavior information rather than plan details.”

[dm-experiment]  同上,实验结果:无协调时”在门口永久碰撞”;抽象层协调 2 条消息 Done=51;细协调 16 条消息 Done=101;无冲突不协调 Done=27。

[dm-pgp]  同上:”Partial Global Planning is subsumed by our new protocol.” PGP 依赖静态组织知识,本协议”不假设此类知识”。

[fipa-00026]  FIPA Contract Net Interaction Protocol Specification (FIPA00026). https://fipa.org/specs/fipa00026/

[fipa-00037]  FIPA Request Interaction Protocol Specification (FIPA00037). https://fipa.org/specs/fipa00037/

[abn-1998]  Parsons, S., Sierra, C. & Jennings, N.R. (1998). “Agents that Reason and Negotiate by Arguing.” *AAAI 1998 Workshop on Negotiation. https://dl.acm.org/doi/10.1145/3005624.3005683

[taems]  Decker, K.S. & Lesser, V.R. (1995). “Environment Centered Analysis and Design of Coordination Mechanisms.” Artificial Intelligence, 73(1-2):29-71. https://doi.org/10.1016/0004-3702(95)00037-2

系列导航 · 意图即承诺,智能体即社会——自主性的第一个可计算答案

Agent 考古 意图即承诺,智能体即社会 系列文章关键词
导读:总览与阅读路线四条线时间线 · 阶段二衔接 · 阅读路线
意图即带承诺的选择C&L 1990 · PGOAL · 持续承诺
BDI 从理论到工程PRS · AgentSpeak · dMARS · 承诺策略
何为 AgentW&J 弱/强概念 · AOP
合同网Smith 1980 · 任务招标 · 囚徒困境
三种仲裁Z&R · PERSUADER · D&M
联合意图部署STEAM · ARCHON · EV(通信)
智能体如何找到彼此KQML · FIPA · JADE · MCP/A2A
反应与慎思的和解TouringMachines · INTERRaP · 门控
意图编辑权三时空同构 · 编辑权拉锯 · 自止焊接
自组织的实证与治理悖论Dochkina 2026 · BCG 治理悖论
当 LLM 住进 BDICiatto 2025 · GenAI+BDI · 计划生成

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注