DeepSeek被稱為AI界拼多多,訓(xùn)練2個月僅花費了557.6萬美元!
來源:24直播網(wǎng)
體育資訊1月28日報道宣稱 據(jù)錢江晚報報道,此次DeepSeek-V3在AI行業(yè)引發(fā)關(guān)注,關(guān)鍵的原因在于——超低的預(yù)訓(xùn)練成本。 “預(yù)訓(xùn)練”是AI大模型學(xué)習(xí)中的一種方法,指的是通過海量的數(shù)據(jù),訓(xùn)練一個大模型。訓(xùn)練時需要大量的數(shù)據(jù)和算力支持,每次迭代可能耗資數(shù)百萬至數(shù)億美元。 官方技術(shù)論文披露,DeepSeek-V3在預(yù)訓(xùn)練階段僅使用2048塊GPU訓(xùn)練了2個月,且只花費557.6萬美元。這個費用是什么概念? 據(jù)報道,GPT-4o的模型訓(xùn)練成本約為1億美元。簡單粗暴地說,這相當(dāng)于DeepSeek-V3比同等性能的AI大模型,降了十幾倍的成本。 早在2024年5月,深度求索發(fā)布DeepSeek-V2時,就曾因給模型的定價太過于便宜,開啟了中國大模型的價格戰(zhàn),被稱之為“AI界的拼多多”。 “相比于說它是‘拼多多’,它更像小米,貼近成本定價,并且自產(chǎn)自銷?!瘪R千里認(rèn)為,訓(xùn)練成本比較低的原因,離不開深度求索團(tuán)隊自研的架構(gòu)和算力,他們自身的算力儲備可以與大廠比肩,并且更注重底層的模型。 “ChatGPT走的是大參數(shù)、大算力、大投入的路子,DeepSeek-V3的路徑用了更多的巧思,依托數(shù)據(jù)與算法層面的優(yōu)化創(chuàng)新,從而高效利用算力,實現(xiàn)較好的模型效果。”馬千里說道。 |

相關(guān)閱讀

熱門錄像

熱門新聞
穿針引線!王思雨12分鐘4中3拿到9分8助正負(fù)值+7
3年2800萬!官宣:灰熊正式和杰羅姆簽下一份多年合同
災(zāi)難!克內(nèi)克特15投僅3中拿到8分7板三分8中1
孔德昕:女籃明天背靠背打新西蘭難度不大重點是半決賽戰(zhàn)日本
思路清晰!美記列舉灰熊操作順序:清理空間完成多個簽約續(xù)約
哈滕:隊里僅卡魯索開過香檳我們的奪冠香檳派對可能史上最弱雞
擴(kuò)大領(lǐng)先優(yōu)勢!中國女籃第三節(jié)轟下30分6649領(lǐng)先17分進(jìn)入末節(jié)
美麗凍人戴維恩米切爾在瑞士看雪冰天雪地中只穿單件球衣
詹寧斯談前5未上大學(xué)的NBA球員:自己、三球、老詹、科比、魔獸
明天迎來第三場!開拓者隊內(nèi)訓(xùn)練:楊瀚森上演各種空接暴扣