官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
DeepSeek新应用!这群杭州90后做的事上热搜
DeepSeek新应用!这群杭州90后做的事上热搜
2025-02-25 14:15:20
摘要:
东坡肉、蘑菇炒青菜、清蒸鲫鱼、虾仁豆腐……做了满满一桌菜,拍张照片扔给AI,问它:图片里的哪种食物蛋白质含量最高?哪道菜尿酸偏高的人不宜多吃?AI深度思考了几秒钟,打出推理全过程,最后在图片上将答案圈了出来。这是学会推理的多模态大模型,未来在日常生活中的一个应用小场景。此前,这种“长眼睛”、擅长推理的AI还停留在想象阶段。不过最近,来自杭州Om AI Lab的一群95后,已经成功地将DeepSee...

东坡肉、蘑菇炒青菜、清蒸鲫鱼、虾仁豆腐……做了满满一桌菜,拍张照片扔给AI,问它:图片里的哪种食物蛋白质含量最高?哪道菜尿酸偏高的人不宜多吃?

AI深度思考了几秒钟,打出推理全过程,最后在图片上将答案圈了出来。

这是学会推理的多模态大模型,未来在日常生活中的一个应用小场景。此前,这种“长眼睛”、擅长推理的AI还停留在想象阶段。不过最近,来自杭州Om AI Lab的一群95后,已经成功地将DeepSeek-R1的训练方法,从纯文本领域迁移到视觉语言领域,打开了多模态大模型的更多想象空间。

他们还将这个名叫VLM-R1的项目开源,发布在全球最大的代码托管平台GitHub上,上线仅一周,就获得各国开发者给出的2.7k Stars(星标),并在2月21日登上热门趋势榜。这一成绩在这个开源社区里堪称亮眼。

VLM-R1上线GitHub一周的Star(星标)数据曲线

2月21日上了GitHub热门趋势榜

这支研发团队的带头人,是名90后——Om AI Lab的创始人赵天成博士,他同时也是浙江(jiāng)大(dà)学(xué)滨(bīn)江(jiāng)研(yán)究(jiū)院(yuàn)Om人(rén)工(gōng)智(zhì)能(néng)中(zhōng)心(xīn)主任(rèn)、博(bó)士(shì)生(shēng)导(dǎo)师(shī)。

将(jiāng)教(jiào)DeepSeek-R1推(tuī)理(lǐ)的(de)方(fāng)法(fǎ)

带(dài)到(dào)机(jī)器(qì)视(shì)觉(jué)领(lǐng)域

DeepSeek-R1模(mó)型(xíng)的(de)独(dú)特(tè)之(zhī)处(chù),在(zài)于(yú)DeepSeek对(duì)通(tōng)用(yòng)的(de)模(mó)型(xíng)推(tuī)理(lǐ)步(bù)骤(zhòu)进(jìn)行(xíng)了(le)调(diào)整(zhěng)。此(cǐ)前(qián),模(mó)型(xíng)在(zài)提(tí)升(shēng)推(tuī)理(lǐ)能(néng)力(lì)时(shí),通(tōng)常(cháng)依(yī)赖(lài)“监(jiān)督(dū)微(wēi)调(diào)”(即(jí)SFT,监(jiān)督(dū)式(shì)微(wēi)调(diào))这(zhè)个(gè)环(huán)节(jié)。简(jiǎn)单(dān)来(lái)说(shuō),就(jiù)是(shì)拿(ná)一(yī)个(gè)已(yǐ)经(jīng)学(xué)了(le)不(bù)少(shǎo)东(dōng)西(xi)的(de)大模型,用一些特定的、标记好的数据,来教它如何更好地完成某个任务。这就好比你已会做菜,但具体到川菜或徽菜,还需通过专门的练习来掌握烹饪技巧。

而DeepSeek-R1在训练过程中直接跳过了这个环节,进入“强化学习”阶段,探索大模型在没有监督数据的情况下,通过纯强化学习进行自我进化。这种创新性的强化学(xué)习(xí)方(fāng)法(fǎ),有(yǒu)个(gè)专(zhuān)业(yè)名词,叫(jiào)群(qún)组(zǔ)相(xiāng)对(duì)策(cè)略(è)优(yōu)化(huà)(Group Relative Policy Optimization,GRPO)。

GRPO已(yǐ)经(jīng)帮(bāng)助DeepSeek-R1学习推理,那是否也能帮(bāng)助(zhù)AI模(mó)型(xíng)在(zài)一(yī)般(bān)计(jì)算(suàn)机(jī)视(shì)觉(jué)任(rèn)务(wu)中(zhōng)表(biǎo)现(xiàn)得(de)更(gèng)强(qiáng)?

Om AI Lab研(yán)发(fā)团(tuán)队(duì)反(fǎn)复(fù)实(shí)验(yàn)后(hòu)的(de)答(dá)案(àn)是(shì):可(kě)以(yǐ)。

他(tā)们(men)在(zài)一(yī)个(gè)视(shì)觉(jué)定(dìng)位(wèi)任(rèn)务(wu)中(zhōng),训(xun)练(liàn)了(le)通(tōng)义(yì)开(kāi)源(yuán)视(shì)觉(jué)理(lǐ)解(jiě)模(mó)型(xíng)Qwen2.5-VL。在(zài)此(cǐ)基(jī)础(chǔ)上(shàng),同(tóng)时(shí)用(yòng)R1方(fāng)法(fǎ)和(hé)SFT方(fāng)法(fǎ)进(jìn)行(xíng)对(duì)比(bǐ)。目(mù)前(qián)得(de)出(chū)的(de)结(jié)论(lùn)是(shì):R1方(fāng)法(fǎ)在(zài)各(gè)种(zhǒng)复(fù)杂(zá)场(chǎng)景(jǐng)下(xià),都(dōu)能(néng)保(bǎo)持(chí)稳(wěn)定(dìng)的(de)高(gāo)性(xìng)能(néng)。这(zhè)在(zài)实(shí)际(jì)应(yīng)用(yòng)时(shí)至(zhì)关重要。

如下图的街景照片,给AI的任务是:定位出图中可能对视障人士行走造成危险的物体。

在路边人行道的场景里,人类能想到对视障人士造成行走障碍的,通常是石墩子、公交站牌、行人等,这些就是可以提前标记好的“数据”。但在这张图中,出现了一个比较特殊的情况——台阶。

从赵天成团队的实验看,经过R1方法训练的AI模型,能够成功推理出台阶在这个场景中会对视障人士造成危险。

“对人类来说,这属于常识性推理,再容易不过。但对于此前传统的计算机视觉模型而言,这其实非常难。”赵天成解释。

又如下面这张图,桌子上放着山药、鸡蛋饼、毛豆、青菜、咖啡和橙子,让AI定位图中含维生素C最多的食物。

使(shǐ)用(yòng)R1方(fāng)法(fǎ)训(xun)练(liàn)的(de)AI模(mó)型(xíng),很(hěn)快(kuài)锁(suǒ)定(dìng)了(le)橙(chéng)子(zi)并(bìng)附(fù)上(shàng)思(sī)考(kǎo)过(guò)程(chéng)。“以(yǐ)前(qián)它(tā)直(zhí)给(gěi)答(dá)案(àn),不(bù)会(huì)告(gào)诉(su)你(nǐ)解(jiě)题(tí)思(sī)路,且(qiě)错(cuò)误(wù)率(lǜ)偏(piān)高(gāo),比(bǐ)如(rú)10道(dào)题(tí)最(zuì)多(duō)答(dá)对(duì)四(sì)五(wǔ)题(tí),而(ér)用(yòng)R1方法训练的,能答对七八题。”

此外,机器学习领域有一种很常见的情况:用任务A去训练模型,随着训练步数(训练模型所执行的迭代次数)的增加,在跟A没有那么相似的任务B上,它的性能会变差(图中红色曲线)。“有点‘摁了葫芦起了瓢’的意思。所以以前做多任务时,还要精心控制任务间的比例。”而使用R1方法训练的AI模型(图中绿色曲线)并不会出现这种趋势,这意(yì)味(wèi)着(zhe)R1方(fāng)法(fǎ)能(néng)帮(bāng)助(zhù)模(mó)型(xíng)真(zhēn)正(zhèng)“学(xué)会(huì)”理(lǐ)解(jiě)视(shì)觉(jué)内(nèi)容(róng),而(ér)不(bù)是(shì)简(jiǎn)单(dān)地(de)记(jì)忆(yì)。

绿(lǜ)色(sè)曲(qū)线(xiàn)是(shì)使用R1方法训练,红色曲线是使用传统的SFT方法。

为视觉语言模型训练

打了新思路

“实验从春节长假期间开始启动。好在前期积累比较多,很多‘基础设施’是现成的,有了想法后,能快速进行实验、验证结果。”组成团队的10人,有研究院的研发人员,也有赵天成带的博士生。

2月15日,赵(zhào)天(tiān)成(chéng)在(zài)海(hǎi)外(wài)社(shè)交(jiāo)平(píng)台(tái)上(shàng)发(fā)布(bù)VLM-R1的(de)实(shí)验(yàn)结(jié)果(guǒ),并(bìng)将(jiāng)它(tā)开(kāi)源(yuán)、上(shàng)传(chuán)到(dào)GitHub,截(jié)至(zhì)2月(yuè)22日(rì),已(yǐ)获(huò)得(de)全球(qiú)开(kāi)发(fā)者(zhě)们(men)给(gěi)出(chū)的(de)2.7k Stars。

大(dà)大(dà)小(xiǎo)小(xiǎo)的(de)交(jiāo)流(liú)切(qiè)磋(cuō)问(wèn)题(tí)蜂(fēng)拥(yōng)而(ér)来(lái):要(yào)训(xun)练(liàn)多(duō)久(jiǔ),最(zuì)低(dī)显(xiǎn)存(cún)是(shì)多(duō)少(shǎo),能(néng)否(fǒu)再(zài)多(duō)分(fēn)享(xiǎng)几(jǐ)个(gè)模(mó)型(xíng)思(sī)考(kǎo)过(guò)程(chéng)……

“虽(suī)然(rán)底(dǐ)层(céng)逻(luó)辑(ji)是(shì)相(xiāng)通(tōng)的(de),但(dàn)视(shì)觉(jué)和(hé)数(shù)学(xué)、代(dài)码(mǎ)是(shì)完(wán)全不(bù)同(tóng)的(de)模(mó)态(tài)。怎(zěn)么(me)在(zài)视(shì)觉(jué)领(lǐng)域进(jìn)行(xíng)设(shè)计(jì),让(ràng)它(tā)真(zhēn)正(zhèng)跑(pǎo)通(tōng),团(tuán)队(duì)其(qí)实(shí)也(yě)经(jīng)历(lì)了(le)多(duō)次(cì)试(shì)错(cuò),才(cái)找到目前这样一个比较有效的组合。”赵天成坦言,现在这个版本只能算是0.1版,远未达到成熟,“有一些问题,需要继续用更多实验来解答。”

在他看来,这段时间的实验,最大意义之一是为多模态模型的训练和行业提供了一些新的思路。它证明了R1方法的通用性,“不仅在文本领域表现出色,还可能引领一种全新的视觉语言模型训练潮流。”

“做一个勇于尝试的引(yǐn)领(lǐng)者(zhě)

比(bǐ)在风口追随着他人来得重要”

Om AI Lab背后的母公司联汇科技,位于杭州滨江互联网产业园,这里曾是阿里、网易崛起的摇篮,互联网和物联网技术从这里走入我们的日常生活。眼下,人工智能成了主角,这家公司正在致力于人工智能智能体平台的应用和落地。

2月21日,由赵天成带队的Om AI Lab,在上海举行的2025全球开发者先锋大会(GDC)上,带去了基于R1强化学习的视觉理解多模态模型VLM-R1的首秀,以及开源大语言模型智能体评测平台Open Agent Leaderboard。

赵天成 (陈中秋 摄)

去年8月,赵天成在接受采访时说,他始终记得当年在美国卡耐基梅隆大学(CMU)求学时导师说的一句话:To be a leader, not a follower,做一个勇于尝试的引领者,远比在风口追随着他人来得重要。

(来源:潮新闻)