官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
DeepSeek 爆火出圈,国产 AI 大模型如何突围?
DeepSeek 爆火出圈,国产 AI 大模型如何突围?
2025-02-14 16:31:02
摘要:
2025年春节期间,DeepSeek爆火出圈,发布开源大模型,在数学、代码、自(zì)然(rán)语(yǔ)言(yán)推(tuī)理(lǐ)等(děng)任(rèn)务(wu)上(shàng)表(biǎo)现(xiàn)追(zhuī)平(píng)OpenAI,在(zài)美(měi)国(guó)对(duì)我(wǒ)国(guó)AI产(chǎn)业(yè)链(liàn)全方(fāng)位(wè...

2025年春节期间,DeepSeek爆火出圈,发布开源大模型,在数学、代码、自(zì)然(rán)语(yǔ)言(yán)推(tuī)理(lǐ)等(děng)任(rèn)务(wu)上(shàng)表(biǎo)现(xiàn)追(zhuī)平(píng)OpenAI,在(zài)美(měi)国(guó)对(duì)我(wǒ)国(guó)AI产(chǎn)业(yè)链(liàn)全方(fāng)位(wèi)打(dǎ)压(yā)遏(è)制(zhì)的(de)背(bèi)景(jǐng)下(xià),成(chéng)功(gōng)走(zǒu)出(chū)了(le)一(yī)条(tiáo)低(dī)成(chéng)本(běn)、高(gāo)性(xìng)能(néng)、国(guó)产(chǎn)化(huà)“突(tū)围(wéi)之(zhī)路”并(bìng)震(zhèn)惊(jīng)世(shì)界(jiè),为(wèi)加(jiā)速(sù)国(guó)产(chǎn)AI大(dà)模(mó)型(xíng)降(jiàng)本(běn)提(tí)效(xiào)、生(shēng)态(tài)繁(fán)荣(róng)注(zhù)入(rù)了(le)强(qiáng)大(dà)动(dòng)力(lì)。

DeepSeek 爆火出圈,国产 AI 大模型如何突围?

1、出(chū)圈(quān)情(qíng)况(kuàng)

DeepSeek凭(píng)借(jiè)“低(dī)成(chéng)本(běn)+高(gāo)性(xìng)能(néng)”模(mó)型(xíng)全球(qiú)破(pò)圈(quān)。DeepSeek早(zǎo)前(qián)发(fā)布(bù)的(de)V3模(mó)型(xíng)每(měi)训(xun)练(liàn)1万(wàn)亿(yì)tokens仅(jǐn)需(xū)在(zài)2048块(kuài)H800 GPU集群(qún)上(shàng)耗(hào)时(shí)3.7天(tiān),总(zǒng)计(jì)278万(wàn) GPU小(xiǎo)时(shí)、557.6万(wàn)美(měi)元(yuán)的(de)训(xun)练(liàn)成(chéng)本(běn),约(yuē)为(wèi)GPT-o1的(de)1/20、Llama 3.1的(de)1/10。

新(xīn)发(fā)布(bù)的(de)R1模(mó)型(xíng)API服(fú)务(wu)价(jià)格(gé)为(wèi)每(měi)百(bǎi)万(wàn)输(shū)入tokens 1-4元、每百万输出tokens 16元,远低于同期 OpenAI o1 API定价水平,且在逻辑、数学及中文任务中表现优异。DeepSeek应用程序霸榜苹果应用商店第一名,获全球主流公有云公司平台接入。

2、成功原(yuán)因(yīn)

①DeepSeek通(tōng)过(guò)较少算力实现高性能模型表现,主要通过算法创新和工程优化等方式大幅提升模型效率。

一是成功走通“纯”强化学习(RL)路径。DeepSeek-R1抛开以预设思维链模板和监督式微调等为特点的AI推理能力传统训练方法,仅依靠简单的奖惩信号来指导优化模型行为,不仅省去了SFT和复杂的奖惩模型对计算资源的需求,还促使模型以“顿悟”的形式学会思考。二是实现算法、框架和硬件的优化协同。为大幅减少内存占用和计算量,DeepSeek系列模型在算法层面引入专家混合模型、多头隐式注意力、多token预测,框架层面实现FP8混合精度训练,硬件层面采用优化的流水线并行策略,同时高效配置专家分发与跨节点通信,实现最优效率配置和资源节约。

②DeepSeek具有拥抱AI的创始基因丰富的算力资源储备、极具天赋的本土人才团队。

一是自带AI创始基(jī)因(yīn)。创(chuàng)始(shǐ)人(rén)梁(liáng)文锋(fēng)毕(bì)业(yè)于(yú)浙(zhè)江(jiāng)大(dà)学(xué)电(diàn)子(zi)信(xìn)息(xi)工(gōng)程(chéng)和(hé)计(jì)算(suàn)机(jī)科(kē)学(xué)专(zhuān)业(yè),早(zǎo)年(nián)创(chuàng)立(lì)对(duì)冲(chōng)基(jī)金(jīn)“幻(huàn)方(fāng)量(liàng)化(huà)”,实(shí)现(xiàn)投(tóu)资(zī)策略全面AI化,2023年5月成立深度求索,聚焦发展通用人工智能。二是丰富的算力资源储备。幻方量化曾投资超过10亿元,先后研发了AI超级计算机“萤火一号”和“萤火二号”。其中,“萤火二号”搭载了约1万张英伟达A100显卡。三是极具天赋的本土人才团队。DeepSeek团队工程师和研发人员几乎都来自清华大学、北京大学、中山大学、北京邮电大学等国内顶尖高校,鲜有“海归”,以走出校园不久的博士为主,也有(yǒu)部(bù)分(fēn)成(chéng)员(yuán)有(yǒu)英(yīng)伟(wěi)达(dá)、微(wēi)软(ruǎn)等(děng)国(guó)外(wài)企(qǐ)业(yè)工(gōng)作(zuò)或(huò)实(shí)习(xí)经(jīng)历(lì)。

3、产(chǎn)业(yè)影(yǐng)响(xiǎng)

一(yī)是(shì)DeepSeek打(dǎ)破(pò)大(dà)模(mó)型(xíng)发(fā)展(zhǎn)路径依(yī)赖(lài),基(jī)本(běn)确(què)立(lì)了符合中国实际的AI发展道路。DeepSeek 打破了 AI 大模型发(fā)展(zhǎn)对算力和标注数据的高度依赖,展示了通过改进模型架(jià)构和训练方法,以较少的数据标注量和算力消耗提升模型推理能力的可行性,标志着我国(guó)在(zài)硬(yìng)件上长期存在代际差距的情况下,可采取软硬协同方式实现对海外顶尖大模型的性能追赶和成本领先。

二是DeepSeek提升行业对模型的后训练和推理需求,长期提振算力需求。DeepSeek R1在 V3 的基础上进行了两次强化学习,明显提升了训练的探索时间和推理思考时间,将在后训练阶段延续Scaling Law法则。随着高性能低成本模型的出现将大幅降低国内AI赋能千行百业的应用开发门槛,推动AI产业链从“训练驱动”向“推理驱动”转变,带动推理算力需求加速释放。

三是DeepSeek以模型开源推动AI平(píng)权(quán),开(kāi)源(yuán)路线有望打造应用繁荣的安卓时刻”。DeepSeek完全开源了模型权重,允许其他开发者将模型用于商业用途并进行模型蒸馏。已发布了基于R1蒸馏Llama与Qwen的6个小模型,在多项基础测试集中性能对标 o1-mini,被Facebook首席人工智能科学家杨立昆誉为“开源模型对闭源模型的胜利”。开源模型通过知识蒸馏快速打造高性能、轻量化小模型,将驱动端侧模型在手机、电脑、眼镜等智能硬件上的部署应用,形成AI应用百花齐放的格局。

作者:邓衢文

单位:中移湾区(广东)创新研究院有限公司