
2025-03-26 12:30:21

2025 年是 agent 爆发之年。
基于处理复杂、多步骤任务以及与不同环境实(shí)时(shí)互(hù)动(dòng)的(de)能(néng)力(lì),由(yóu)大(dà)语(yǔ)言(yán)模(mó)型(xíng)(LLM)驱(qū)动(dòng)的(de) agent 系(xì)统(tǒng),尤(yóu)其(qí)是(shì)多(duō) agent 系统(MAS),被认为非常适合用来解决现实世界中的问题,也因此被越来越多地应用在各个领域中,如软件工程、药物发现、科学模拟,以及通用 agent 系统。
然而,相比于单个 agent 系统甚至更简单的 baseline,多 agent 系统却在处理实际问题时更易出错。如下图所示,AppWorld 的故障率可高达 86.7%。

图|使用 GPT-4o 和 Claude-3 的 5 种常用多 agent LLM 系统的故障率
这是为什么呢?来自加州大学伯克利分校(xiào)和(hé)意大利联合圣保罗银行的研究团队给出了答案——
他们首次对多 agent 系统面临的挑战进行了全面研究,并确定了 14 种独特的故障模式,并划分为 3 大类:(1)规范和系统设计故障;(2)agent 间错位;(3)任务验(yàn)证(zhèng)和(hé)终(zhōng)止(zhǐ)。
相(xiāng)关研(yán)究(jiū)论(lùn)文以(yǐ)“Why Do Multi-Agent LLM Systems Fail?”为(wèi)题(tí),已发表在预印本网站 arXiv 上。

论文链接:https://arxiv.org/abs/2503.13657
具体而言,他们提出了首个基于经验的多 agent 系统故障分类法——MASFT,理解和缓解多 agent 系统故障提供了一个结构化框架。
同时,他们也开发了一个可扩展的“LLM-as-a-judge”评估管道,用于分析新的多 agent 系统性能和诊断故障模式。
另外,针对 agent 规范、对话管理和验证策略,他们还进行了干预研究,尽管将任务完成率提高了 14%,但仍未能完全解决多 agent 系统故障问题,这凸显了结构性多 agent 系统重新设计的必要性。
此外,他们也将研究成果进行开源,包括:
150 多个标注的多 agent 系统会话轨迹;
可扩展的 LLM-as-a-judge 评估管道和 150 多个轨迹的 LLM 标注;
15 个选定轨迹的详细专家标注。
多达 14 种故障模式
在这项工作中,研究团队使用了扎根理论(Grounded Theory)这一定性研究方法,直接从经验数据中构建理论,而不是检验预定义的假设,使故障模式的识别有机地产生。
他(tā)们(men)通(tōng)过(guò)理(lǐ)论抽样、开放式编码、持续比较分析、备忘录和理论化等方法反复收集和分析多 agent 系统的执行轨迹,获得多 agent 系统跟踪记录并讨论初步发现后,通过收集观察到的故障模式得出了 MASFT。

图|系统研究多 agent 系统的方法流程
为了实现自动故障识别,他们开发了基于 LLM 的标注器,并验证了它的可靠性。
然后,他们进行了标注器之间的协议研究,通过添加、删除、合并、拆分或修改定义反复调整故障模式和故障类别,直到达成共识。这一过程反映了一种学习方法,即(jí)不(bù)断(duàn)完(wán)善(shàn)分(fēn)类(lèi)法(fǎ),直(zhí)至(zhì)达(dá)到(dào)稳(wěn)定(dìng)性(xìng),并通过 Kappa 系数来衡量标注器之间的一致性。

图|多 agent 系统故障模式分类法
最终,MASFT 包含了 3 个总体故障类别:规范和系统设计故障;agent 间错位;任务验证和终止,确定了多 agent 系统在执行过程中可能遇到的 14 种细粒度故障模式。
MASFT 还将多 agent 系统的执行划分为 3 个阶段:执行前、执行中和执行后,确定了每个细粒度故障模式可能发生的多 agent 系统执行阶段。

图|多 agent 系统故障类别相关矩阵
另外,他们发现,多 agent 系统面临着与复杂的人类组织类似的问题,其故障模式与在人类组织中观察到的常见(jiàn)故(gù)障(zhàng)模(mó)式(shì)一(yī)致(zhì)。“不(bù)要(yào)求(qiú)澄(chéng)清(qīng)”破(pò)坏(huài)了(le)“尊(zūn)重(zhòng)专(zhuān)业(yè)知(zhī)识(shi)”,“agent 错(cuò)位(wèi)”体(tǐ)现(xiàn)了(le)加(jiā)强(qiáng)等(děng)级(jí)区(qū)分(fēn)和(hé)协(xié)调(diào)角(jiǎo)色(sè)分(fēn)配(pèi)的(de)必(bì)要(yào)性(xìng)。
多(duō) agent 协(xié)作(zuò)的(de)有(yǒu)效(xiào)性(xìng),仍(réng)有(yǒu)待(dài)提(tí)高(gāo)
针(zhēn)对(duì)以(yǐ)上(shàng)所(suǒ)有(yǒu)的(de)故(gù)障(zhàng)类(lèi)别(bié),研(yán)究(jiū)团(tuán)队(duì)提(tí)出(chū)了(le)战(zhàn)术(shù)策(cè)略(è)和(hé)结(jié)构(gòu)策(cè)略(è)。
战(zhàn)术(shù)策(cè)略(è)涉(shè)及(jí)针(zhēn)对(duì)特(tè)定故(gù)障(zhàng)模(mó)式(shì)的(de)直(zhí)接(jiē)修(xiū)改(gǎi),如(rú)改(gǎi)进(jìn)提(tí)示(shì)、agent 网(wǎng)络(luò)的(de)拓(tà)扑(pū)结(jié)构(gòu)和(hé)对(duì)话(huà)管(guǎn)理(lǐ)。然而,两个案例研究证明,这些方法的有效性并不一致。
结构策略,即对整个系统有影响的更全面的方法:强验证、增强型通信协议、不确定性量化以及内存和状态管理。这些策略需要更深入的研究和细致的实施,仍是有待未来探索的研究课题。

图|多 agent 系统的解决策略和故障分类
研究团队在两个案例研究中应用了这些策略方法。
在第一个案例中,他们使用 AG2 中的 MathChat 场景实现作为基线,在该场景中,学生 agent 与能够执行 Python 代码的助理 agent 合作解决问题。
为了进行基准测试,他们从 GSM-Plus 数据集中随机选取了 200 个练习。第一种策略是改进原始提示,使其具有清晰的结构和专门用于验证的新部分。第二种策略是将 agent 配置细化为一个更专业的系统,其中包含三个不同的角色:问题解决者(Problem Solver),不使用工具,使用思维链方法解决问题;编码者(Coder),编写并执行 Python 代码,得出最终答案;验证者(Verifier),审查讨论并批判性地评估解决方案,要么确认答案,要么引发进一步讨论。
在这种情况下,一旦找到解决方案,只有验证人可以(yǐ)终(zhōng)止(zhǐ)对(duì)话(huà)。
在(zài)第(dì)二(èr)个(gè)案(àn)例(lì)中(zhōng),ChatDev 模(mó)拟(nǐ)了(le)一(yī)个(gè)多(duō) agent 软(ruǎn)件(jiàn)公(gōng)司(sī),不(bù)同(tóng)的(de) agent 有(yǒu)不(bù)同(tóng)的(de)角(jiǎo)色(sè)定(dìng)位(wèi),如(rú)首(shǒu)席(xí)执(zhí)行(xíng)官(guān)、首(shǒu)席(xí)技(jì)术(shù)官(guān)、软(ruǎn)件(jiàn)工(gōng)程(chéng)师(shī)和(hé)审(shěn)核(hé)员(yuán),他(tā)们(men)试(shì)图(tú)合(hé)作(zuò)解(jiě)决(jué)一(yī)个(gè)软(ruǎn)件(jiàn)生(shēng)成(chéng)任(rèn)务(wu)。
他(tā)们(men)实(shí)施(shī)了(le)两(liǎng)种(zhǒng)不(bù)同(tóng)的(de)干(gàn)预(yù)措(cuò)施(shī)。第(dì)一(yī)个(gè)是(shì)改(gǎi)进(jìn)特(tè)定(dìng)角(jiǎo)色(sè)的(de)提(tí)示(shì),以(yǐ)强(qiáng)化(huà)层(céng)次(cì)结(jié)构(gòu)和(hé)角(jiǎo)色(sè)一(yī)致(zhì)性(xìng);第(dì)二(èr)个(gè)是(shì)尝(cháng)试(shì)涉(shè)及(jí)对(duì)框(kuāng)架(jià)拓(tà)扑(pū)结(jié)构(gòu)的(de)根(gēn)本(běn)性(xìng)改(gǎi)变(biàn),将(jiāng)框(kuāng)架(jià)的(de)停(tíng)止(zhǐ)结(jié)构(gòu)从(cóng)有(yǒu)向(xiàng)无(wú)环(huán)图(tú)(DAG)修(xiū)改(gǎi)为(wèi)循(xún)环(huán)图(tú)。
现(xiàn)在(zài),只(zhǐ)有(yǒu)当(dāng) CTO agent 确(què)认(rèn)所(suǒ)有(yǒu)审(shěn)查(chá)都(dōu)得(de)到(dào)适(shì)当(dāng)满(mǎn)足(zú)时(shí),该(gāi)过(guò)程(chéng)才(cái)会(huì)终(zhōng)止(zhǐ),并(bìng)设(shè)定(dìng)了(le)最(zuì)大(dà)迭(dié)代(dài)截(jié)止(zhǐ)时(shí)间(jiān),以(yǐ)防(fáng)止(zhǐ)出(chū)现(xiàn)无(wú)限(xiàn)循(xún)环(huán)。这(zhè)种(zhǒng)方(fāng)法(fǎ)可(kě)以(yǐ)实(shí)现(xiàn)迭(dié)代(dài)改(gǎi)进(jìn)和(hé)更(gèng)全面(miàn)的(de)质(zhì)量(liàng)保(bǎo)证(zhèng)。

图(tú)|各(gè)种(zhǒng)方(fāng)案(àn)的(de)性(xìng)能(néng)准(zhǔn)确(què)度(dù)
研(yán)究(jiū)团(tuán)队(duì)表(biǎo)示,许多“显而易见”的解决方案实际上存在严重的局限性,需要概述的结构性策略来实现更加一致的改进。
考虑到目前多 agent 协调中的信息冗余与冲突,协作中放大的模型偏差,未来的多 agent 系统需要做到快速响应、实时验证和动态协调,以提高团队协作的有效性(xìng)。
“基(jī)于(yú) LLM 的(de)多(duō) agent,在(zài)分(fēn)布(bù)式科研协作、应急响应系统等领域仍具有一定的潜力。”
作者:与可