AI 代理开始互相付钱,缺的不是结算,是谁来判「做没做完」
导读:Token Dispatch 把 PayPal、FINRA、国际商会那套人类纠纷机器,对照到 x402 这种平均不到一美分的机器支付上:钱能托管、身份能上链,但「工作是否合格」仍要有人判。作者抓住 GenLayer 的 Intelligent Contract——用多验证者 + 大模型对照合约规则做裁决——并把它放进 UMA、Kleros、Google AP2、ERC-8004 的缝隙里:证据层已齐,缺的是解释层。

我们好像把文明建在一个事实之上:证据和接受,根本不是一回事。
做研究的人被期待用真实、直接的一手来源。设计师被期待明白「干净」不等于交一张白纸。开发者被要求做出能用的结账页,同时不能让页面加载四分钟。人类很擅长携带这些没写进合同的上下文,因为我们共享一套「什么叫合理工作」的直觉。软件过去很少需要这些,因为我们给它的指令通常窄到可以直接逐字执行。
如果你看过《奥维尔号》里那段梗,大概懂我在说什么。
AI 代理开始进入更脏的世界:指令写不全「把活干好」到底包含什么。一旦钱绑在那段缺失的上下文上,解释本身就变成交易的一部分。
如果有人花 15 美元雇自由职业者调研 20 家公司,且 brief 写得还算清楚,他期待什么?找到公司、说明各自做什么、用独立来源、在截止日期前交报告。活按时交、名单也齐了 20 家,接单的人会觉得自己干完了。
买方看法不同。好几条引用回指公司自家博客,还有两段描述几乎是原文照搬。
两边都是人时,下一步是吵架、发截图、翻回原 brief,来回拉扯。还谈不拢,最终得另有人决定:这活到底算不算够格付钱。
如果两边都是 AI 代理呢?
钱本身并不难。
托管合约可以把这 15 美元先锁住,直到工作提交。区块链能显示款项何时存入、成果何时提交。身份系统能帮你确认是哪个代理干的活。签名记录能留住双方当初同意过的指令。
仍没解决的是:总得有人读 brief、检查成果,并判定卖方是否真的把活做完了。
商业一直有处理这类问题的制度,只是出了事我们才注意到。PayPal 买家说货没到或完全不符描述时,双方会先自行协商;谈不拢,一方可升级成 claim,让 PayPal 核验证据并裁决。PayPal 称多数决定大约 14 天,少数会拖到 30 天或更久。
更大的商业争议有自己的机器。美国券商有行业自律组织 FINRA,自办仲裁论坛:2025 年新收 2597 件案件,平均结案 13.4 个月。非营利的美国仲裁协会称,2025 年收到 58 万件案件,其中 B2B 主张与反主张合计超过 290 亿美元。国际商会同年新收 881 件仲裁,在办案件标的合计达 2990 亿美元。这些争议显然比代理现在会碰上的大得多。但它们说明:交易一多,人就会吵到足够频繁,于是整套产业会围着「看证据、判谁该拿钱」长出来。
AI 代理开始把同类问题推到另一端:交易极小、频率极高,传统纠纷流程根本划不来。
Visa 与 Artemis 研究了两套面向机器对机器商务的新兴支付协议,发现 x402 自 2025 年 5 月上线到 2026 年 4 月,处理了约 1.096 亿笔经调整交易,金额约 1500 万美元。Visa 考察的协议上,平均支付金额还不到一美分。人类客服团队没法认真花半小时,去查清每一笔只值几分钱的分歧。

我去找谁在解这个问题,看到了 GenLayer——它想把这件事做成基础设施。
GenLayer 在自建一条区块链,专门处理普通智能合约搞不定的决策。传统智能合约擅长所有机器做同一套数学并落到同一结果:钱到没到、截止日期过没过。麻烦出现在需要「读懂并解释」的时候——通读研究报告、看网页、理解合同段落、判断一张图是否符合创意 brief。AI 模型从不会给出完全相同的回答;同一材料上,不同模型可以得出不同结论,于是「每个节点必须得到完全一致输出」的假设就塌了。
GenLayer 有一种「Intelligent Contract(智能合约的智能版)」。它不再要求每个验证者复现一模一样的文本,而是可以让若干验证者按照写进合约的规则,判断某个拟议结果是否可接受。验证者在此过程中可以使用大语言模型和公开网页数据。

乍一看,这像是代理技术栈里又缺的一层。但已有系统已经覆盖其中几块,所以 GenLayer 并不是从零开始。
它更具体的角色是:当双方仍争执不下时,判定证据到底意味着什么。
谷歌的 Agent Payments Protocol(AP2)已经能生成密码学签名记录:代理被授权买什么、商户报了什么价、哪笔支付获批。其规范明确说,这些授权与收据日后可合并成纠纷证据。但 AP2 本身并不裁决谁对、钱该给谁——协议只保住「发生了什么」的可信记录,把解释那一步留给别人。
ERC-8004 是以太坊上关于代理身份与声誉的标准,也有 Validation Registry。代理可以把工作送去由另一系统校验,结果再记上链,成为该代理历史的一部分。
区块链能证明钱动没动,所以纯支付纠纷好办;纠纷需要外部信息时,预言机把信息带上链。于是证据齐了却仍缺一环:总得有人判断证据意味着什么——GenLayer 卡的就是这里。
为了看看真实工作有多少落在哪一类,我在 Slack 上的代理(我盲目信任它,因为这是咱俩对世界)在 9 月 24 日抓了三百多条在线任务:Freelancer.com、Fiverr、Upwork、Scale AI 的 Outlier、Prolific,以及链上任务市场 Daydreams TaskMarket。我的代理说,约 23% 的任务可以用明确是/否轻易核对;另有约 45% 主要依赖个人判断;剩下约 32% 有证据可看,但仍得判断工作是否「够好」。
这不是市场规模估算,分类本身也是 AI 在做判断。但你能明白意思。而且并不是每个涉及 AI 的任务都需要一座 AI 法庭。
比如「设计最美的餐厅 logo」:几位验证者可能同意某一设计更好看,但同意并不能把品味变成客观标准。除非买方事先写了极细的创意 brief,争议仍根植于个人偏好。营销活动也可能交出承诺的互动数据,却仍争执有多少来自真实用户。每种情况都有证据可查,但付钱之前仍需要解释。
加密圈试验去中心化纠纷解决已有多年。这些系统处理分歧的方式很不一样。
UMA 的 Optimistic Oracle 默认主张成立,除非有人反对。提出主张的人先交保证金;等待期内无人挑战,答案就被接受;有人挑战,则由 UMA 代币持有者投票。成本因此压得很低——多数主张不用完整复审,昂贵投票只在有人挑战时发生。
Kleros 是以太坊上的去中心化纠纷解决系统。不是公司员工或法院判案,而是随机抽选质押了 PNK 代币的人当陪审员。一方上诉,下一轮会拉进更大的陪审团。这对真正需要人类判断的案子有用,但也意味着费时费钱。General Court 三陪审员一轮大约要 0.015 ETH(尚未计上诉),所以当纠纷本身只值几美元时,这套模型根本划不来。
GenLayer 把 Kleros 交给人类陪审员的「裁决活」,交给有 AI 辅助的验证者:一名验证者提出答案,其他人核查,同意人数够了就推向最终批准;有人挑战,则换一批新验证者复审,争议持续时再扩大规模。而且 UMA 与 Kleros 也都在走向 AI 辅助裁决,所以我不想把 GenLayer 说成「两个永远人类系统的 AI 替代品」。
规则写得具体,验证者才有具体可核对的东西。若合约只说工作应「有洞见」或「原创」,几个模型彼此同意,也不会让标准更清晰。
GenLayer 用所谓 Equivalence Principle(等价原则)处理这一点:告诉验证者,答案要相似到什么程度,网络才视为同一决定。有的合约要求精确匹配;有的允许措辞与推理不同,只要在关键结果上一致。GenLayer 文档反复鼓励开发者把这些决策收窄。
于是大量权力落在写合约的人手上。他们决定什么证据算数、什么算成功、答案之间允许多大差异。GenLayer 可以对照这些规则裁决,却不能在纠纷开始后再去修补一个含糊标准。
裁决只有在能真正改变交易时才有意义。实践里,这意味着资金或其他有价结果必须绑在决定上。纠纷可以以放款、退款,或更新代理声誉收场。
对小额代理交易而言,目标可能只是让钱落到正确一侧,而不是一份可强制执行的法律裁决。
那它实际会用在哪?
代理市场本就把委托工作、支付,以及越来越多的链上身份绑在一起,这是最显眼的观察点之一。
以 Daydreams TaskMarket 为例:它跑在 Base 上,允许人或 AI 代理用 USDC 背书发任务。不同任务格式正好露出裁决有用与无用之处。基准任务可以让工人在准确率或延迟等可测指标上竞技;若任务基于清晰分数——一个代理 96%、另一个 91%——平台直接对数、挑更好的结果即可。
但赏金任务可能有多人提交不同类型的成果,需求方得判断哪个最好。没有简单数字或规则告诉你谁更好时,就得有人看成果再定。
软件与安全赏金也一样:要求代理让固定测试套件通过的任务,可以机械结算;漏洞赏金则可能对「利用是否在范围内、严重性描述是否准确、是否已有人报过同一底层问题」产生真实分歧。
效果营销里,数出 5 万次社交互动并不难。但它们是真实用户还是机器号?GenLayer 已经展示了 Rally——一款效果营销应用,用其验证者分析社交活动并评估互动真实性。
服务等级协议(SLA)本质上是服务商与客户之间关于最低服务水准的承诺。例如云厂商承诺 99.9% 可用性,或支持两小时内回复;未达标时客户可能获退款或服务抵扣。
若协议已写明哪些日志、监控服务与排除项算证据,自动裁决者要处理的对象就会窄得多。
研究是 GenLayer 能做到某一步的好例子。研究有些部分容易核对:报告是否答完所有问题?来源是否真实?验证者可以检查这些。
但「洞见是否够原创」难得多——可能根本没有清晰规则或证据能一锤定音。
这类工作不能用简单是/否脚本判定,但仍有足够证据与结构,让不同验证者做出合理决定。若任务几乎全是品味或含糊质量,系统可用的抓手就少得多。
如果你以为用上好几位 AI 法官就自动可靠——并不会。
若五位验证者用的是相似模型,它们可能犯同样的错:误解同一条指令、信任同一坏来源,或都被操纵过的内容骗到。GenLayer 试图用验证者独立核查、以及有人上诉时换入新验证者来降低这一点。
证据本身也可能不可靠。网页会改、API 不同时间给不同答案、文档里可能藏着专门迷惑读它的 AI 的指令。所以系统只有在验证者能妥当检查同一份证据时才好用。有时根本没有清晰答案——GenLayer 可以返回「Undetermined(无法判定)」,而不是硬逼出一个是或否。
GenLayer 的设计倚重孔多塞陪审团定理:独立推理者组成的群体,胜过任何一个单独的人。前提是推理者真正独立;而 AI 模型往往从重叠数据里学习。Kleros 研究者在一家拉美加密交易所的 99 起真实客户纠纷上做过接近测试:ChatGPT 5.5 站客户一侧 3 次,Claude Opus 4.7 站客户一侧 14 次;换到下一版 Claude 再跑,平台胜率从 86% 升到 95%。模型混搭在偏误随机时有用;若整一代模型往同一边漂,混搭陪审团也会一起漂。
市场现在有多大?很难估——只有一部分代理交易最终会变成纠纷。但现有系统已显示,对裁决的需求本来就很大。
商户 2025 年处理了约 2.61 亿笔 chargeback,按每笔约 128 美元的纠纷处理成本计,大约 330 亿美元。另一端,GenLayer 目前测试网大约每天 2.58 万次决定;即便每次 1 美元,一年也大约只有 940 万美元。对照 eBay 巅峰时期约每年 6000 万纠纷(约每天 16.4 万件):只有机器商务最终吵到那个量级,GenLayer 才可能变成大生意。
要让这套跑通,合约需要清晰规则,证据需要可靠,验证者需要足够独立,使他们的一致意见真有意义;上诉也得保持便宜。
人类商务早已有法院、仲裁与纠纷团队,处理双方对同一笔交易谈不拢的情况。若代理开始更多彼此做生意,它们可能需要更快、更便宜的同款东西——因为机器永远需要万物的廉价高速版。
也许在教机器做完一切之前,先教它们怎样判定什么叫公平,反而是件好事。
作者:Thejaswini M A
编译:深潮 TechFlow
【免责声明】本内容仅传递行业动态,不构成任何投资建议。市场有风险,投资需谨慎。