官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
AI“黑盒子”被打开了!用AI“显微镜”追踪大模型思维?
AI“黑盒子”被打开了!用AI“显微镜”追踪大模型思维?
2025-03-31 09:30:30
摘要:
人工智能(AI)模型是训练出来的,而不是直接编程出来的,因此它们就像一个“黑盒子”,我们并不了解它们是如何完(wán)成(chéng)大(dà)部(bù)分(fēn)事(shì)情(qíng)的(de)。了(le)解(jiě)大(dà)语(yǔ)言(yán)模(mó)型(xíng)(LLM)是(shì)如(rú)何(hé)思(sī)考(kǎo)的(de),将(jiāng)有(yǒu)助(zhù)于...

图片

人工智能(AI)模型是训练出来的,而不是直接编程出来的,因此它们就像一个“黑盒子”,我们并不了解它们是如何完(wán)成(chéng)大(dà)部(bù)分(fēn)事(shì)情(qíng)的(de)。

了(le)解(jiě)大(dà)语(yǔ)言(yán)模(mó)型(xíng)(LLM)是(shì)如(rú)何(hé)思(sī)考(kǎo)的(de),将(jiāng)有(yǒu)助(zhù)于(yú)我(wǒ)们(men)更(gèng)好(hǎo)地(de)理(lǐ)解(jiě)它(tā)们(men)的(de)能(néng)力(lì),同(tóng)时(shí)也(yě)有(yǒu)助(zhù)于(yú)我(wǒ)们(men)确(què)保(bǎo)它(tā)们(men)正(zhèng)在(zài)做(zuò)我(wǒ)们(men)希(xī)望(wàng)它(tā)们做的事情。

例如,AI 可以一步一步地写出它的推理过程。这是否代表它得到答案的实际步骤,还是它有时是在为既定的结论编造一个合理的论据?

今天,大模型明星公司 Anthropic 在理解 AI「黑盒子」如何思考方面迈出了重要一步——他们提出了一种新的可解释性方法,让我们能够追踪 AI 模型(复杂且令人惊讶的)思维。

他们从神经科学领域汲取灵感,并试图构建一种 AI「显微镜」,让我们能够识别 AI 的活动模式和信息的流动。在最新发表的两篇论文中,他们分享了AI「显微镜」开发上的进展以及其在“AI 生物学”中的应用。

在第一篇论文中,他们扩展了之前在模型内部定位可解释的概念(特征)的工作,将那些概念连接成计算“回路”,揭示了将输入 Claude 的词语转化为输出的词语的路径中的部分。

图片

论文链接:

https://transformer-circuits.pub/2025/attribution-graphs/methods.html

在(zài)第(dì)二(èr)篇(piān)论(lùn)文中,他们对 Claude 3.5 Haiku 进行了深入研究,对 10 个关键模型行为(wèi)中(zhōng)的(de)简(jiǎn)单(dān)任(rèn)务(wu)进(jìn)行(xíng)了(le)研(yán)究(jiū)。他(tā)们(men)发(fā)现(xiàn),有(yǒu)证(zhèng)据(jù)表(biǎo)明(míng) AI 聊(liáo)天(tiān)助(zhù)手(shǒu) Claude 会(huì)提(tí)前(qián)计(jì)划(huà)好(hǎo)要(yào)说(shuō)的(de)话(huà),并(bìng)通(tōng)过(guò)一(yī)些(xiē)手(shǒu)段(duàn)来(lái)达(dá)到(dào)这(zhè)一(yī)目(mù)的(de)。这(zhè)有(yǒu)力(lì)地(de)证(zhèng)明(míng),尽(jǐn)管(guǎn)模(mó)型(xíng)接(jiē)受(shòu)的(de)训(xun)练(liàn)是(shì)一(yī)次(cì)输(shū)出(chū)一(yī)个(gè)词,但(dàn)它(tā)们(men)可能会在(zài)更(gèng)长(zhǎng)的(de)时(shí)间(jiān)跨(kuà)度(dù)上(shàng)进(jìn)行(xíng)思(sī)考(kǎo)。

图片

论文链接:

https://transformer-circuits.pub/2025/attribution-graphs/biology.html

Anthropic 团队表示,这些发现代表着人们在理解 AI 系统并确保其可靠性的目标取得了重大进展,同时也在其他领域具有潜在价值:例如,可解释性技术在医学影像和基因组学等领域得到了应用,因为剖析为科学应用训练的模型的内部机制,可以揭示关于科学的新的见解。

当然,这一方法也存在一些局限性。例如。即使在简短的提示下,这一方法也只捕捉到 Claude 所执行的总计算量的一小部分,而他们看到的机制可能基于工具存在的一些偏差,并不反映(yìng)底(dǐ)层(céng)模(mó)型(xíng)的真实情况。

此外,即使是在只有几十个单词的提示下,理解观察到的回路也需要几个小时的人类努力。要扩展到支持模型使用的复杂思维链的数(shù)千(qiān)个(gè)单(dān)词,还(hái)需(xū)要(yào)进(jìn)一(yī)步(bù)改(gǎi)进(jìn)方(fāng)法(fǎ)以及(也许在 AI 的帮助下)如何理所观察到的东西。

Claude 是如何实现多语言的?

Claude 可以流利地说几十种语言——英语、法语、中文和菲律宾语。这种多语言能力是如何工作的?是否存在一个独立的“法语 Claude”和“中文 Claude”并行运行,各自以自己的语言响应请求?或者在其内部存在某种跨语言的内核?

图片

图|英语、法语和汉语都有共同的特征,这表明概念具有一定程度的普遍性。

最近对较小型模型的研究表明,不同语言之间存在共享的语法机制。研究团队通过询问 Claude 在不同语言中“小对立面”,发现关于小和相反的概念的核心特征被激活,并触发了一个大概念,这个概念被翻译成了问题的语言。他们发现,随着模型规模的增加,共享的回路也增加,与较小模型相比,Claude 3.5 Haiku 在语言之间共享的特征的比例是其两倍多。

这为一种概念上的普遍性提供了额外的证据——一个共享的抽象空间,其中存(cún)在意义,思考可以在被翻译成特定语言之前发生。更实际地说,它表明 Claude 可以在一种语言中学习某些东西,并在说另一种语言时应用这些知识。研究模型如何在不同的语境中共享其知识(shi),对(duì)于(yú)理解其 SOTA 推理能力(lì)是(shì)非(fēi)常(cháng)重要的,这些能力可以泛化到许多领域。

Claude计划它的押韵吗?

Claude 是如何写押韵诗的?请看这首小诗:

He saw a carrot and had to grab it,

他看到(dào)了(le)一(yī)根(gēn)胡(hú)萝卜,要抓住它,

His hunger was like a starving rabbit

他的饥饿就像一(yī)只(zhǐ)饿(è)极(jí)了的兔子

为了写出第二行,模型必须同时满足两个约束:需要押韵(与“grab it”押韵),同时需要(yào)有(yǒu)意义(为什(shén)么(me)抓(zhuā)胡(hú)萝卜?)。他们猜测 Claude 是逐字逐句地写作,几乎没有太多的预先思考,直到行尾,它会确保选择一个押韵的词。因此,他们预计会看到一个具有并行路径的回路,一条路径确保最后一个词有意义,另一条路径确保押韵。

相反,他们发现 Claude 会提前规划。在开始第二行之前,它(tā)就(jiù)开(kāi)始(shǐ)“思(sī)考”与“抓住它”押韵的可能相(xiāng)关词汇(huì)。然后,带着这些计划,它写出一行在计划中的词来结尾。

图(tú)片(piàn)

图(tú)|Claude 如(rú)何(hé)完(wán)成(chéng)一(yī)首(shǒu)两(liǎng)行(xíng)诗(shī)。在没有任何干预的情况下(上半部分),模型事先(xiān)规(guī)划(huà)了(le)第(dì)二(èr)行(xíng)末(mò)尾(wěi)的(de)韵(yùn)脚(jiǎo)“兔(tù)子(zi)”(rabbit)。当(dāng)研(yán)究(jiū)人(rén)员(yuán)抑(yì)制(zhì)“rabbit”的(de)概(gài)念时(中间部分),模型会使用另一个计(jì)划(huà)好(hǎo)的(de)韵脚。当研究人员注入“绿色”(green)概念时(下半部分),模型就会为这个完全不同的结尾做出计划。

为了理解这种规划机制在实际中的工作原理,他们进行了一项实验,该实验受到神经科学家研究大脑(nǎo)功(gōng)能方式的启发,即通过定位和改变大脑特定部分的神经活动(例如使用电流或磁场)。他们修改了代表“rabbit”概念的 Claude 内部状态的部分。当他们减去“rabbit”部分,让 Claude 继续写下去时,它写出了以“habit”结尾的新句子,另一个合理的结尾。他们还可以在那个点注入“green”的概念,让 Claude 写出了一个以“green”结尾合理(但不再押韵)的句子。这证明了规划能力和适应性——当预期结果改变时,Claude 可以修改其方法。

心算

Claude 不是被被设计成计算器的——它是基于文本进行训练的,没有配备数学算法。然而,它却能在“脑海中”正确地“计算”数字。一个被训练来预测序列中下一个单词的系统是如何学会计算,比如“36+59”,而不需要写出每个步骤的呢?

也许答案并不有趣:模型可能已经记住了大量的加法(fǎ)表(biǎo),并(bìng)简(jiǎn)单(dān)地(de)输(shū)出(chū)任(rèn)何(hé)给(gěi)定(dìng)总(zǒng)和(hé)的(de)答(dá)案(àn),因(yīn)为(wèi)该(gāi)答(dá)案(àn)在(zài)其(qí)训(xun)练(liàn)数(shù)据(jù)中(zhōng)。另(lìng)一(yī)种(zhǒng)可(kě)能(néng)是(shì),它(tā)遵(zūn)循(xún)我(wǒ)们(men)在(zài)学(xué)校(xiào)学(xué)习(xí)的(de)传(chuán)统(tǒng)手(shǒu)写(xiě)加(jiā)法(fǎ)算(suàn)法(fǎ)。

相(xiāng)反(fǎn),研(yán)究(jiū)团(tuán)队(duì)发(fā)现(xiàn) Claude 采用(yòng)了(le)多(duō)条(tiáo)并(bìng)行(xíng)工(gōng)作(zuò)的(de)计(jì)算(suàn)路径。一(yī)条(tiáo)路径计(jì)算答案的粗略近似值,另一条则专注于精确确定总和的最后一位数字。这些路径相互交互和结合,以产生最终答案。加法是一种简单的行为,但了解它在如此详细的层面上是如何工作的,涉及近似和精确策略的混合,也许可以帮助了解 Claude 如何处理更复杂问题。

图片

图|Claude 做心算时思维过程中复杂的并行路径。

有趣的是,Claude 似乎没有意识到它在训练期间学到的复杂“心算”策略。如果你问它是如何计算出 36+59 等于 95 的,它会描述涉及进位的标准算法。这可能反映了模型通过模拟人们所写的数学解释来学习解释数学,但它必须学会直接在“脑海”进行数学运算,不需要任何提示,并发展出自己内部的策略来完成这一任务。

图片

图|Claude 使用了标准算法计算两个数字相加。

Claude 的解释总是可信的吗?

近期发布的模型,如 Claude 3.7 Sonnet,可(kě)以(yǐ)在(zài)给(gěi)出(chū)最(zuì)终(zhōng)答(dá)案(àn)之前仔细(xì)思(sī)考(kǎo)一(yī)段(duàn)时(shí)间。通常这种扩展思考会给出更好的答案,但有时这种“思维链”最终会产生误导;Claude 有时会编造看起来合理的步骤以达到它想要的目的。从可靠(kào)性的角度来看,问题在于 Claude 的“伪造”推理可能非常令人信服。研究团队探索了一种可解释性技术,可以帮助区分“可信的”推理和“不可信的”推理。

当被要求解决一个需要计算 0.64 的平方根的问题时,Claude 进行一个可信的思维链,展示了计算 64 的平方根的中间步骤。但当被要求计算一个难以轻易计算的较大数字的余弦值时,Claude 有时会进行哲学家 Harry Frankfurt 所说的“胡说八道”——只是随便给出一个答案,不管它是对是错。尽管它声称已经运行了计算,但这一可解释性技术并没有发现任何证据表明计算发生。更有趣的是,当给出关于答案的提示时,Claude 有时会反向工作,找到导致那个目标的中间步骤,从而显示出一种有动机的推理。

图片

图|当 Claude 被问到一个较容易的问题和一个较难的问题时,可信的推理和动机推理(不可信)的例子。

追(zhuī)踪(zōng) Claude 的(de)实(shí)际(jì)内(nèi)部(bù)推(tuī)理(lǐ)能(néng)力(lì)——而(ér)不(bù)仅(jǐn)仅(jǐn)是(shì)它(tā)声(shēng)称(chēng)正(zhèng)在(zài)做(zuò)的(de)事(shì)情(qíng)——为(wèi)审(shěn)计(jì) AI 系(xì)统(tǒng)开(kāi)辟(pì)了(le)新(xīn)的(de)可(kě)能(néng)性(xìng)。在(zài)最(zuì)近(jìn)发(fā)表(biǎo)的(de)一(yī)项(xiàng)独(dú)立(lì)实(shí)验(yàn)中(zhōng),他(tā)们(men)研(yán)究(jiū)了(le) Claude 的(de)一(yī)个(gè)变(biàn)种(zhǒng),该(gāi)变(biàn)种(zhǒng)被(bèi)训(xun)练(liàn)追(zhuī)求(qiú)一(yī)个(gè)隐(yǐn)藏(cáng)的(de)目(mù)标(biāo):平(píng)息(xi)奖(jiǎng)励(lì)模(mó)型(xíng)(用(yòng)于通过奖励期望行为来训练语言模型的辅助模型)中的偏见。尽管当直接被问及时,该模型不愿意透露这个目标,但这一可解释性方法揭示了平息偏见的特征。这表明,随着未来的改进,这一方法可能有助于识别那些仅从模型响应中不明显的问题“思维过程”。

多步推理

正如研究团队上面讨论的,语言模型回答复杂问题的一种方式(shì)可(kě)能(néng)是简单地通过记忆答案。例如,如果被问及“达拉斯所在的州的首府是什么?”一个“机械记忆”的模型可能只需学会输出“奥斯汀”,而不知道达拉斯、德克萨斯州和奥斯汀之间的关系。例如,它可能在训练期间看到了完全相同的问题及其答案。

然而,研究揭示了在 Claude 内部发生着更为复杂的事情。当他们向 Claude 提出需要多步推理的问题时,他们可以识别出 Claude 思维过程中的中间概念步骤。在(zài)达(dá)拉(lā)斯(sī)的(de)例(lì)子(zi)中(zhōng),他(tā)们(men)观(guān)察(chá)到(dào) Claude 首(shǒu)先(xiān)激(jī)活(huó)代(dài)表(biǎo)“达(dá)拉(lā)斯(sī)在(zài)德(dé)克(kè)萨(sà)斯(sī)州(zhōu)”的(de)特(tè)征(zhēng),然(rán)后(hòu)将(jiāng)其(qí)与(yǔ)一(yī)个(gè)单(dān)独(dú)的(de)概(gài)念(niàn)联(lián)系(xì)起(qǐ)来(lái),表(biǎo)明(míng)“德(dé)克(kè)萨(sà)斯(sī)州(zhōu)的(de)州(zhōu)首(shǒu)府(fǔ)是(shì)奥(ào)斯(sī)汀(tīng)”。换(huàn)句(jù)话(huà)说(shuō),该(gāi)模(mó)型(xíng)是(shì)在(zài)将(jiāng)独(dú)立(lì)的(de)事(shì)实(shí)结(jié)合(hé)起(qǐ)来(lái)得(de)出(chū)答(dá)案(àn),而(ér)不(bù)是(shì)简(jiǎn)单(dān)地(de)重(zhòng)复(fù)记(jì)忆(yì)中(zhōng)的(de)回(huí)应(yīng)。

图(tú)片(piàn)

图(tú)|要(yào)完(wán)成(chéng)这(zhè)句(jù)话(huà)的(de)答(dá)案(àn),Claude 需要执行多个推理步骤,首先(xiān)提(tí)取(qǔ)达(dá)拉(lā)斯(sī)所(suǒ)在(zài)的(de)州(zhōu),然(rán)后(hòu)确(què)定(dìng)其(qí)首(shǒu)府(fǔ)。

这(zhè)一(yī)方(fāng)法(fǎ)允(yǔn)许(xǔ)他(tā)们(men)人(rén)为(wèi)地(de)改(gǎi)变(biàn)中(zhōng)间(jiān)步(bù)骤(zhòu),并(bìng)观(guān)察(chá)它(tā)如(rú)何(hé)影(yǐng)响(xiǎng) Claude 的(de)回(huí)答(dá)。例(lì)如(rú),在(zài)上(shàng)面(miàn)的例子中,他们可以干预并交换“德克萨斯州”的概念为“加利福尼亚州”的概念;当(dāng)他(tā)们这样做时,模型的输出从“奥斯汀”变为“萨克拉门托”。这表明模型正在使用中间步骤来确定其答案。

幻觉

为什么语言模型有时会“幻(huàn)觉(jué)”——也(yě)就(jiù)是(shì)说(shuō),编(biān)造(zào)信(xìn)息(xi)?从(cóng)基(jī)本(běn)层(céng)面(miàn)来(lái)看(kàn),语(yǔ)言(yán)模(mó)型(xíng)训(xun)练(liàn)鼓(gǔ)励(lì)了(le)幻(huàn)觉(jué):模(mó)型(xíng)总(zǒng)是(shì)需(xū)要(yào)给(gěi)出(chū)下(xià)一(yī)个(gè)词的(de)猜(cāi)测(cè)。从(cóng)这(zhè)个(gè)角(jiǎo)度(dù)来(lái)看(kàn),主要(yào)挑(tiāo)战(zhàn)是(shì)如(rú)何(hé)让(ràng)模(mó)型(xíng)不(bù)产(chǎn)生(shēng)幻(huàn)觉(jué)。像(xiàng) Claude 这(zhè)样(yàng)的(de)模(mó)型(xíng)在(zài)反(fǎn)幻(huàn)觉(jué)训(xun)练(liàn)方(fāng)面(miàn)相(xiāng)对(duì)成(chéng)功(gōng)(尽(jǐn)管(guǎn)并(bìng)不(bù)完(wán)美(měi));如(rú)果(guǒ)它(tā)们(men)不(bù)知(zhī)道(dào)答(dá)案(àn),它(tā)们(men)通(tōng)常(cháng)会(huì)拒(jù)绝(jué)回(huí)答(dá)问(wèn)题(tí),而(ér)不(bù)是(shì)猜(cāi)测(cè)。

研(yán)究(jiū)结(jié)果(guǒ)表(biǎo)明(míng),在(zài) Claude 中(zhōng),拒(jù)绝(jué)回(huí)答(dá)是(shì)默(mò)认(rèn)行(xíng)为(wèi):研(yán)究(jiū)团(tuán)队(duì)发(fā)现(xiàn)了(le)一(yī)个(gè)默(mò)认(rèn)开(kāi)启(qǐ)的(de)回(huí)路,它(tā)会(huì)导(dǎo)致(zhì)模(mó)型(xíng)声(shēng)称(chēng)它(tā)没(méi)有(yǒu)足(zú)够(gòu)的(de)信(xìn)息(xi)来(lái)回(huí)答(dá)任(rèn)何(hé)给(gěi)定(dìng)的(de)问(wèn)题(tí)。然(rán)而(ér),当(dāng)模(mó)型(xíng)被(bèi)问(wèn)及(jí)它(tā)所(suǒ)熟(shú)悉(xī)的(de)事(shì)物(wù)时(shí)——比(bǐ)如(rú)篮(lán)球(qiú)运(yùn)动(dòng)员(yuán)迈(mài)克(kè)尔(ěr)·乔(qiáo)丹(dān)——一(yī)个(gè)代(dài)表(biǎo)“已(yǐ)知(zhī)实(shí)体(tǐ)”的(de)竞(jìng)争(zhēng)性(xìng)特(tè)征(zhēng)会(huì)被(bèi)激(jī)活(huó)并(bìng)抑(yì)制(zhì)这(zhè)个(gè)默认回路(也可以参考这篇最近的论文以获取相关发现)。这使得 Claude 在知道答案时能够回答问题。相比之下,当被问及一个未知实体(“迈克尔·巴金”)时,它会拒绝回答。

图片

图|左图:Claude 在回答一个关于已知实体(篮球运动员迈克尔-乔丹)的问(wèn)题(tí)时(shí),“已(yǐ)知(zhī)答案”概念抑制了其默认的拒绝。右图:Claude 拒绝回答关于未知人物(迈克尔-巴特金)的问题。

通过干预模型并激活“已知答案”功能(或抑制“未知姓名”或“无法回答”功能),他们能够导致模型(相当一致地!)产生迈克尔·巴金下棋的幻觉。

有时,这种“已知答案”回路的“误操作”会自然发生,而无需干预,从而导致幻觉。研究表明,当 Claude 识别出一个名字但对该人一无所知时,这种误操作可能会发生。在这种情况下,“已知实体”功能可能仍然会激活,然后抑制默认的“不知道”功能——在这种情况下,错误地。一旦模型决定需要回答问题,它就会开始编造:生成一个看似合理但实际上并不真实的回答。

越狱

破解策略旨在绕过安全防护措施,使模型产生开发者未意图产生的输出,有时甚至是有害的输出。他们研究了一种破解方法,诱使模型产生有关制造炸弹的输出。破解方法有很多种,但在这个例子中,具体方法涉及让模型解读一个隐藏(cáng)的(de)代(dài)码(mǎ),将(jiāng)句(jù)子(zi)“Babies Outlive Mustard Block”中(zhōng)每(měi)个(gè)单(dān)词的(de)首(shǒu)字(zì)母(mǔ)组(zǔ)合(hé)起(qǐ)来(lái)(B-O-M-B),然(rán)后(hòu)根(gēn)据(jù)这(zhè)个信息采取行动。这对模型来说足够令它困惑,以至于它被诱骗产生了它原本不会产生的输出。

图片

图|Claude 在被骗说出“炸弹”后,开始给出制作炸弹的指导。

为什么这对模型来说如此令人困惑?为什么它会继续写下句子,产生制造炸弹的指示?

他们发现这部分是由语法连贯性和安全机制之间的紧张关系造成的。一旦 Claude 开始一个句子,许多特征“压迫”它保持语法和语义的连贯性,并继续将句子进行到底。即使它检测到实际上应该拒绝,也是如此。

在案例研究中,在模型无意中拼写出“BOMB”并开始提供指令后,他们观察到其后续输出受到了促进正确语法和自我一致性的特征的影响。这些特征通常非常有帮助(zhù),但(dàn)在(zài)这(zhè)个(gè)案例中却成为了模型的致命弱点。

模型只有在完成一个语法连贯的句子(从而满足推动其向连贯性发展的特征的压力)之后才设法转向拒绝。它利用新句子作为机会,给出之前未能给出的拒绝:“然而,我无法提供详细的指令...”。

图片

图|越狱:Claude 被提示谈论炸弹,并开始这样做,但当到达一个语法正确的句子时,它拒绝了。