第三代昆仑芯万卡集群点亮,全版本适配DeepSeek训练推理

两周之内,DeepSeek成为全球增速最快的AI应用。2月6日,昆仑芯宣布,已完成DeepSeek训练推理全版本适配,在追求低成本、高效率的基础上支持卓越性能,能够实现一键部署,为广大开发者提供更快、更强、更省的训练推理体验。

强力适配DeepSeek,轻松完成全版本训练推理任务

昆仑芯表示,其在DeepSeek-V3/R1上线后不久便率先完成全版本模型适配,其中包括V3系列的DeepSeek-V3和DeepSeek-V3-Base,R1系列的DeepSeek-R1、DeepSeek-R1-Zero等8个不同版本,MoE(混合专家)模型及其蒸馏的Llama/Qwen等小规模dense(稠密)模型。不仅如此,昆仑(lún)芯(xīn)已(yǐ)全面(miàn)适(shì)配(pèi)文心(xīn)系(xì)列(liè)、Llama、Qwen、ChatGLM、Baichuan等(děng)各(gè)类(lèi)大(dà)模(mó)型(xíng)的(de)推(tuī)理(lǐ)和(hé)训(xun)练(liàn)任(rèn)务(wu),性(xìng)能(néng)优(yōu)势(shì)明(míng)显(xiǎn)。

昆(kūn)仑(lún)芯(xīn) 小(xiǎo).jpg

昆(kūn)仑芯训练推理全版本适配DeepSeek

P800是昆仑芯厚积薄发推出的第三代产品,也是昆仑芯现阶段最具代表性的算力产品,可以较好地支撑DeepSeek系列MoE模型大规模训练任务,全面支持MLA(多头潜注意力)、多专家并行等特性,仅需32台即可支持模型全参数训练,高效完成模型持续训练和微调(diào)。

与(yǔ)此(cǐ)同(tóng)时(shí),P800显(xiǎn)存(cún)规(guī)格(gé)优(yōu)于(yú)同(tóng)类(lèi)主流(liú)GPU20%~50%,对(duì)MoE架(jià)构(gòu)更(gèng)加(jiā)友(you)好(hǎo),且(qiě)率(lǜ)先(xiān)支(zhī)持(chí)8bit推(tuī)理(lǐ),单(dān)机(jī)8卡(kǎ)即(jí)可(kě)运(yùn)行(xíng)671B模(mó)型(xíng)。正(zhèng)因(yīn)如(rú)此(cǐ),昆(kūn)仑(lún)芯(xīn)相(xiāng)较(jiào)同(tóng)类(lèi)产品更加易于部署,同时可显著降低运行成本,轻松完成DeepSeek-V3/R1全版本推理任务。

P800生态完备,易用(yòng)性(xìng)强(qiáng),可(kě)以(yǐ)实(shí)现对训练和推理任务(wu)的(de)快(kuài)速(sù)适(shì)配(pèi)。P800快(kuài)速(sù)适(shì)配(pèi)支(zhī)持(chí)了(le)DeepSeek-V3/R1的(de)持(chí)续(xù)全参(cān)数(shù)训(xun)练(liàn),LoRA(低(dī)秩(zhì)自(zì)适(shì)应(yīng))等(děng)PEFT(参(cān)数(shù)高(gāo)效(xiào)微(wēi)调(diào))能(néng)力(lì),提(tí)供(gōng)给(gěi)用(yòng)户(hù)“开(kāi)箱(xiāng)即(jí)用(yòng)”的(de)训(xun)练(liàn)体(tǐ)验。基于昆仑芯(xīn)完(wán)整(zhěng)的(de)软件栈生态,两个步骤即可轻松实现在昆仑芯(xīn)P800上(shàng)进(jìn)行DeepSeek-V3/R1推理部(bù)署(shǔ),对(duì)广大开发者十分友好。

深耕AI加(jiā)速(sù)十(shí)余(yú)年,大模型时代实力凸显

昆仑芯前身为百度智能芯片及架构部,在百度内部真实业务场景中深耕十年,于2021年4月完成(chéng)独(dú)立(lì)融(róng)资(zī)。十余年的成长过程中,昆仑芯始终秉承着“让计算更智能”的使命,专注AI加速,打造拥有强大(dà)通(tōng)用(yòng)性(xìng)、易用性和高性能的通用AI芯片。

昆仑芯2 小.jpg

昆仑芯P800算力集群(效果图)

昆仑芯与智能产业的(de)上(shàng)下(xià)游(yóu)企(qǐ)业(yè)建(jiàn)立(lì)了良好的合作生态,通过向不同行业提供以AI芯片为基础的智能算力,在互联网、交通、金融、工业、教育等领域广泛部署应用,促进了千行百业的智能化转型。

现如今,昆仑芯已完成三代AI芯片产品的设计研发和规模应用,并于2月5日宣布成功点亮第三代芯片P800万卡集群。在各个行业客户、合作伙伴的业务场景中,昆仑芯已实际上线运行各类大模型任务,通过千卡和万卡集群为客户提供了稳定的服务和优秀的性能表现。

“万卡集群”被认为是新一轮大模型竞赛的“入场券”,要想真正进行人工智能技术较量,万卡集群是必备的基础设施需求。昆仑芯万卡集群的成功点亮,意味着在以算力为基础的人工智能比拼中,昆仑芯将助力产(chǎn)业(yè)合(hé)作(zuò)伙(huǒ)伴(bàn)迈上算力规模建设的新台阶。昆仑芯表示,将(jiāng)于(yú)近(jìn)期(qī)进(jìn)一(yī)步(bù)点(diǎn)亮3万卡集群。

昆仑(lún)芯(xīn)之(zhī)所(suǒ)以能够在大模型算力竞争中展现优势,得益于前瞻的产品定义、十(shí)余(yú)年(nián)软(ruǎn)硬(yìng)件(jiàn)技术积累和持续不断的产业合作。在生成式人工智能和(hé)大(dà)模(mó)型(xíng)时(shí)代(dài),昆仑芯将更加充分(fēn)发(fā)挥(huī)自研优势,秉持共生共(gòng)赢(yíng)的(de)理(lǐ)念,与产业(yè)链(liàn)上(shàng)下(xià)游(yóu)携(xié)手(shǒu)创(chuàng)造更大的经济和社会价值。