chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

爆了!GPT-4模型架構(gòu)、訓(xùn)練成本、數(shù)據(jù)集信息都被扒出來了

CVer ? 來源:機(jī)器之心 ? 2023-07-12 14:16 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

一直以來,大家都對 GPT-4 的模型架構(gòu)、基礎(chǔ)設(shè)施、訓(xùn)練數(shù)據(jù)集、成本等信息非常好奇。

奈何 OpenAI 嘴太嚴(yán),很長時間以來,大家也都只是猜測這些數(shù)據(jù)。

不久之前,「天才黑客」喬治?霍茲(George Hotz)在接受一家名為 Latent Space 的 AI 技術(shù)播客采訪時透露出一個小道消息,稱 GPT-4 是由 8 個混合專家模型組成的集成系統(tǒng),每個專家模型都有 2200 億個參數(shù)(比 GPT-3 的 1750 億參數(shù)量略多一些),并且這些模型經(jīng)過了針對不同數(shù)據(jù)和任務(wù)分布的訓(xùn)練。

雖然此消息無法驗(yàn)證,但其流傳度非常高,也被部分業(yè)內(nèi)人士認(rèn)為非常合理。

最近,更多的消息似乎被泄露了出來。

今日,SemiAnalysis 發(fā)布了一篇付費(fèi)訂閱的內(nèi)容,「揭秘」了有關(guān) GPT-4 的更多信息。

62a83668-2073-11ee-962d-dac502259ad0.png

文章稱,他們從許多來源收集了大量有關(guān) GPT-4 的信息,包括模型架構(gòu)、訓(xùn)練基礎(chǔ)設(shè)施、推理基礎(chǔ)設(shè)施、參數(shù)量、訓(xùn)練數(shù)據(jù)集組成、token 量、層數(shù)、并行策略、多模態(tài)視覺適應(yīng)、不同工程權(quán)衡背后的思維過程、獨(dú)特的實(shí)現(xiàn)技術(shù)以及如何減輕與巨型模型推理有關(guān)的瓶頸等。

作者表示,GPT-4 最有趣的方面是理解 OpenAI 為什么做出某些架構(gòu)決策。

此外,文章還介紹了 A100 上 GPT-4 的訓(xùn)練和推理成本,以及如何拓展到下一代模型架構(gòu) H100 。

我們根據(jù) Deep Trading(一家算法交易公司)創(chuàng)始人 Yam Peleg 的推文(目前已刪除),整理了以下關(guān)于 GPT-4 的數(shù)據(jù)信息。感興趣的讀者可以細(xì)致研究下。

62c6c88a-2073-11ee-962d-dac502259ad0.png

不過請注意,這并非官方確認(rèn)的數(shù)據(jù),大家自行判斷其準(zhǔn)確性。

62de8ec0-2073-11ee-962d-dac502259ad0.png

1、參數(shù)量:GPT-4 的大小是 GPT-3 的 10 倍以上。文章認(rèn)為它 120 層網(wǎng)絡(luò)中總共有 1.8 萬億個參數(shù)。

2、確實(shí)是混合專家模型。OpenAI 能夠通過使用混合專家(MoE)模型來保持合理成本。他們在模型中使用了 16 個專家模型,每個專家模型大約有 111B 個參數(shù)。這些專家模型中的 2 個被路由到每個前向傳遞。

3、MoE 路由:盡管文獻(xiàn)中對于選擇將每個 token 路由到哪個專家模型的高級路由算法進(jìn)行了大量討論,但據(jù)稱 OpenAI 在當(dāng)前的 GPT-4 模型中采用了相當(dāng)簡單的路由方式。該模型大約使用了 550 億個共享參數(shù)來進(jìn)行注意力計算。

62f0bb4a-2073-11ee-962d-dac502259ad0.png

4、推理:每次前向傳遞的推理(生成 1 個 token)僅利用約 2800 億個參數(shù)和約 560 TFLOP 的計算量。相比之下,純密集模型每次前向傳遞需要大約 1.8 萬億個參數(shù)和約 3700 TFLOP 的計算量。

5、數(shù)據(jù)集:GPT-4 的訓(xùn)練數(shù)據(jù)集包含約 13 萬億個 token。這些 token 是重復(fù)計算之后的結(jié)果,多個 epoch 中的 token 都計算在內(nèi)。

Epoch 數(shù)量:針對基于文本的數(shù)據(jù)進(jìn)行了 2 個 epoch 的訓(xùn)練,而針對基于代碼的數(shù)據(jù)進(jìn)行了 4 個 epoch 的訓(xùn)練。此外,還有來自 ScaleAI 和內(nèi)部的數(shù)百萬行的指令微調(diào)數(shù)據(jù)。

6、GPT-4 32K:在預(yù)訓(xùn)練階段,GPT-4 使用了 8k 的上下文長度(seqlen)。而 32k 序列長度版本的 GPT-4 是在預(yù)訓(xùn)練后對 8k 版本進(jìn)行微調(diào)而得到的。

636c0728-2073-11ee-962d-dac502259ad0.png

7、Batch Size:在計算集群上,幾天時間里,batch size 逐漸增加,最后,OpenAI 使用 batch size 達(dá)到了 6000 萬!當(dāng)然,由于不是每個專家模型都能看到所有 token,因此這僅僅是每個專家模型處理 750 萬個 token 的 batch size。

真實(shí)的 batch size:將這個數(shù)字除以序列長度(seq len)即可得到真實(shí)的 batch size。請不要再使用這種誤導(dǎo)性的數(shù)字了。

8、并行策略:為了在所有 A100 GPU 上進(jìn)行并行計算,他們采用了 8 路張量并行,因?yàn)檫@是 NVLink 的極限。除此之外,他們還采用了 15 路流水線并行。(很可能使用了 ZeRo Stage 1,也可能使用了塊級的 FSDP)。

641a88f2-2073-11ee-962d-dac502259ad0.png

9、訓(xùn)練成本:OpenAI 在 GPT-4 的訓(xùn)練中使用了大約 2.15e25 的 FLOPS,使用了約 25,000 個 A100 GPU,訓(xùn)練了 90 到 100 天,利用率(MFU)約為 32% 至 36%。這種極低的利用率部分是由于大量的故障導(dǎo)致需要重新啟動檢查點(diǎn)。

如果他們在云端的每個 A100 GPU 的成本大約為每小時 1 美元,那么僅此次訓(xùn)練的成本將達(dá)到約 6300 萬美元。(而如今,如果使用約 8192 個 H100 GPU 進(jìn)行預(yù)訓(xùn)練,用時將降到 55 天左右,成本為 2150 萬美元,每個 H100 GPU 的計費(fèi)標(biāo)準(zhǔn)為每小時 2 美元。)

10、使用專家混合模型時的 tradeoff:在使用專家混合模型時存在多方面 tradeoff。

例如,在推理過程中處理 MoE 非常困難,因?yàn)椴⒎悄P偷拿總€部分都在每個 token 生成時被利用。這意味著在某些部分被使用時,其他部分可能處于閑置狀態(tài)。在為用戶提供服務(wù)時,這會嚴(yán)重影響資源利用率。研究人員已經(jīng)證明使用 64 到 128 個專家比使用 16 個專家能夠?qū)崿F(xiàn)更好的損失(loss),但這僅僅是研究的結(jié)果。

選擇較少的專家模型有多個原因。OpenAI 選擇 16 個專家模型的一大原因是:在許多任務(wù)中,更多的專家模型很難泛化,也可能更難收斂。

由于進(jìn)行了如此大規(guī)模的訓(xùn)練,OpenAI 選擇在專家模型數(shù)量上更加保守。

643928ac-2073-11ee-962d-dac502259ad0.png

11、推理成本:GPT-4 的推理成本是 1750 億參數(shù)的 Davinci 模型的 3 倍。這主要是因?yàn)?GPT-4 需要更大規(guī)模的集群,并且達(dá)到的利用率要低得多。

據(jù)估計,在用 128 個 A100 GPU 進(jìn)行推理的情況下,8k 版本 GPT-4 推理的成本為每 1,000 個 token 0.0049 美分。如果使用 128 個 H100 GPU 進(jìn)行推理,同樣的 8k 版本 GPT-4 推理成本為每 1,000 個 token 0.0021 美分。值得注意的是,這些估計假設(shè)了高利用率和保持較高的 batch size。

12、Multi-Query Attention:OpenAI 和其他機(jī)構(gòu)一樣,也在使用 Multi-Query Attention(MQA)。由于使用 MQA 只需要一個注意力頭(head),并且可以顯著減少用于 KV 緩存的內(nèi)存容量。即便如此,32k 序列長度的 GPT-4 也絕對無法在 40GB 的 A100 GPU 上運(yùn)行,而 8k 序列長度的模型則受到了最大 batch size 的限制。

64c135f8-2073-11ee-962d-dac502259ad0.png

13、連續(xù) batching:OpenAI 實(shí)現(xiàn)了可變 batch size 和連續(xù) batching。這樣做是為了允許一定程度的最大延遲,并優(yōu)化推理成本。

14、視覺多模態(tài):它是一個獨(dú)立于文本編碼器的視覺編碼器,二者之間存在交叉注意力。該架構(gòu)類似于 Flamingo。這在 GPT-4 的 1.8 萬億個參數(shù)之上增加了更多參數(shù)。在純文本的預(yù)訓(xùn)練之后,它又經(jīng)過了另外約 2 萬億個 token 的微調(diào)。

對于視覺模型,OpenAI 本來希望從零開始訓(xùn)練,但由于其尚未成熟,所以他們決定先從文本開始訓(xùn)練來降低風(fēng)險。

這種視覺能力的主要目的之一是使自主智能體能夠閱讀網(wǎng)頁并轉(zhuǎn)錄圖像和視頻中的內(nèi)容。

他們訓(xùn)練的一部分?jǐn)?shù)據(jù)是聯(lián)合數(shù)據(jù)(包括渲染的 LaTeX / 文本)、網(wǎng)頁的截屏、YouTube 視頻(采樣幀),并使用 Whisper 對其進(jìn)行運(yùn)行以獲取轉(zhuǎn)錄文本。

6572b53a-2073-11ee-962d-dac502259ad0.png

15、推測式解碼(Speculative Decoding):OpenAI 可能在 GPT-4 的推理過程中使用了推測式解碼技術(shù)(不確定是否 100%)。這種方法是使用一個更小更快的模型提前解碼多個 token,并將它們作為單個 batch 輸入到一個大型的預(yù)測模型(oracle model)中。

如果小型模型對其預(yù)測是正確的,大型模型將會同意,我們可以在單個 batch 中解碼多個 token。

但是,如果大型模型拒絕了草稿模型預(yù)測的 token,那么 batch 中剩余的部分將被丟棄,然后我們將繼續(xù)使用大型模型進(jìn)行解碼。

有些陰謀論指出,新的 GPT-4 質(zhì)量已經(jīng)下降,這可能只是因?yàn)樗麄冏屚茰y式解碼模型(speculative decoding model)將概率較低的序列傳遞給預(yù)測模型,從而導(dǎo)致了這種誤解。

65a0d032-2073-11ee-962d-dac502259ad0.png

16、推理架構(gòu):推理運(yùn)行在由 128 個 GPU 組成的集群上。在不同地點(diǎn)的多個數(shù)據(jù)中心存在多個這樣的集群。推理過程采用 8 路張量并行(tensor parallelism)和 16 路流水線并行(pipeline parallelism)。每個由 8 個 GPU 組成的節(jié)點(diǎn)僅具有約 1300 億個參數(shù)。

該模型有 120 層,因此適合于 15 個不同的節(jié)點(diǎn)??赡艿谝粋€節(jié)點(diǎn)的層數(shù)較少,因?yàn)樗€需要計算嵌入。

根據(jù)這些數(shù)字,如果 OpenAI 試圖按照 chinchilla 的最佳指標(biāo)進(jìn)行訓(xùn)練,他們應(yīng)該使用的 token 數(shù)量是現(xiàn)在的兩倍。這表明他們在獲取高質(zhì)量數(shù)據(jù)方面遇到了困難。

最后想說的是,這應(yīng)該是迄今為止關(guān)于 GPT-4 最為詳細(xì)的數(shù)據(jù)揭秘。目前還不能求證是否真實(shí),但也值得大家研究下。正如原文作者所說,「有趣的方面是理解 OpenAI 為什么做出某些架構(gòu)決策?!?/p>

關(guān)于 GPT-4 的這些架構(gòu)信息,你怎么看?

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 模型
    +關(guān)注

    關(guān)注

    1

    文章

    3645

    瀏覽量

    51686
  • 數(shù)據(jù)集
    +關(guān)注

    關(guān)注

    4

    文章

    1229

    瀏覽量

    26031
  • OpenAI
    +關(guān)注

    關(guān)注

    9

    文章

    1238

    瀏覽量

    9794

原文標(biāo)題:爆了!GPT-4模型架構(gòu)、訓(xùn)練成本、數(shù)據(jù)集信息都被扒出來了...

文章出處:【微信號:CVer,微信公眾號:CVer】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點(diǎn)推薦

    訓(xùn)練平臺數(shù)據(jù)過大無法下載數(shù)據(jù)至本地怎么解決?

    起因是現(xiàn)在平臺限制圖片數(shù)量,想要本地訓(xùn)練下載數(shù)據(jù)時發(fā)現(xiàn)只會跳出網(wǎng)絡(luò)異常的錯誤,請問這有什么解決辦法?
    發(fā)表于 07-22 06:03

    【「DeepSeek 核心技術(shù)揭秘」閱讀體驗(yàn)】書籍介紹+第一章讀后心得

    DeepSeek-V3的MoE架構(gòu)革新與DeepSeek-R1的強(qiáng)化學(xué)習(xí)突破,更揭開了中國大模型“五百萬美元創(chuàng)造GPT-4級性能”的工程奇跡。 書中讓我們看到國產(chǎn)模型如何在
    發(fā)表于 07-17 11:59

    OCR識別訓(xùn)練完成后給的是空壓縮包,為什么?

    OCR識別 一共弄26張圖片,都標(biāo)注好了,點(diǎn)擊開始訓(xùn)練,顯示訓(xùn)練成,也將壓縮包發(fā)到郵箱,下載下來后,壓縮包里面是空的 OCR圖片2
    發(fā)表于 05-28 06:46

    請問如何在imx8mplus上部署和運(yùn)行YOLOv5訓(xùn)練模型?

    我正在從事 imx8mplus yocto 項(xiàng)目。我已經(jīng)在自定義數(shù)據(jù)上的 YOLOv5 上訓(xùn)練了對象檢測模型。它在 ubuntu 電腦上運(yùn)行良好?,F(xiàn)在我想在我的 imx8mplus
    發(fā)表于 03-25 07:23

    用PaddleNLP為GPT-2模型制作FineWeb二進(jìn)制預(yù)訓(xùn)練數(shù)據(jù)

    ,使用PaddleNLP將FineWeb數(shù)據(jù)集中文本形式的數(shù)據(jù),經(jīng)過分詞化(Tokenize),轉(zhuǎn)換為大語言模型能直接使用的二進(jìn)制數(shù)據(jù),以便提升訓(xùn)練
    的頭像 發(fā)表于 03-21 18:24 ?3771次閱讀
    用PaddleNLP為<b class='flag-5'>GPT</b>-2<b class='flag-5'>模型</b>制作FineWeb二進(jìn)制預(yù)<b class='flag-5'>訓(xùn)練</b><b class='flag-5'>數(shù)據(jù)</b><b class='flag-5'>集</b>

    數(shù)據(jù)標(biāo)注服務(wù)—奠定大模型訓(xùn)練數(shù)據(jù)基石

    數(shù)據(jù)標(biāo)注是大模型訓(xùn)練過程中不可或缺的基礎(chǔ)環(huán)節(jié),其質(zhì)量直接影響著模型的性能表現(xiàn)。在大模型訓(xùn)練中,
    的頭像 發(fā)表于 03-21 10:30 ?2277次閱讀

    是否可以輸入隨機(jī)數(shù)據(jù)來生成INT8訓(xùn)練后量化模型?

    無法確定是否可以輸入隨機(jī)數(shù)據(jù)來生成 INT8 訓(xùn)練后量化模型。
    發(fā)表于 03-06 06:45

    用PaddleNLP在4060單卡上實(shí)踐大模型預(yù)訓(xùn)練技術(shù)

    手把手教您如何在單張消費(fèi)級顯卡上,利用PaddleNLP實(shí)踐OpenAI的GPT-2模型的預(yù)訓(xùn)練。GPT-2的預(yù)訓(xùn)練關(guān)鍵技術(shù)與流程與
    的頭像 發(fā)表于 02-19 16:10 ?2115次閱讀
    用PaddleNLP在4060單卡上實(shí)踐大<b class='flag-5'>模型</b>預(yù)<b class='flag-5'>訓(xùn)練</b>技術(shù)

    馬斯克揭秘Grok 3訓(xùn)練成本:20萬塊英偉達(dá)GPU

    近日,馬斯克旗下的xAI公司正式推出了其新一代大模型——Grok 3。在備受矚目的發(fā)布會直播中,馬斯克親自披露了Grok 3的訓(xùn)練成本,這一數(shù)字引起了業(yè)界的廣泛關(guān)注。 據(jù)馬斯克透露,Grok 3
    的頭像 發(fā)表于 02-19 09:39 ?1175次閱讀

    讓大模型訓(xùn)練更高效,奇異摩爾用互聯(lián)創(chuàng)新方案定義下一代AI計算

    ? 電子發(fā)燒友網(wǎng)報道(文/吳子鵬)近一段時間以來,DeepSeek現(xiàn)象級火引發(fā)產(chǎn)業(yè)對大規(guī)模數(shù)據(jù)中心建設(shè)的思考和爭議。在訓(xùn)練端,DeepSeek以開源模型通過算法優(yōu)化(如稀疏計算、動態(tài)
    的頭像 發(fā)表于 02-18 09:19 ?1894次閱讀
    讓大<b class='flag-5'>模型</b><b class='flag-5'>訓(xùn)練</b>更高效,奇異摩爾用互聯(lián)創(chuàng)新方案定義下一代AI計算

    OpenAI簡化大模型選擇:薩姆·奧特曼制定路線圖

    前的技術(shù)環(huán)境下,大模型被廣泛應(yīng)用于各種聊天機(jī)器人中,其中OpenAI的ChatGPT就是一個典型的例子。然而,對于大多數(shù)用戶來說,選擇最適合自己需求的AI模型卻并非易事。OpenAI目前提供多種
    的頭像 發(fā)表于 02-18 09:12 ?730次閱讀

    弘信電子攜手燧原科技推動智算生態(tài)升級

    2024年12月,國產(chǎn)大模型DeepSeek推出DeepSeek-V3,以極低訓(xùn)練成本實(shí)現(xiàn)媲GPT-4o和Claude Sonnet 3.5的性能,震驚業(yè)界。
    的頭像 發(fā)表于 02-06 10:43 ?935次閱讀

    采用FP8混合精度,DeepSeek V3訓(xùn)練成本僅557.6萬美元!

    模型需要花費(fèi)約4684.8萬美元。然而,隨著技術(shù)的進(jìn)步,這一成本正在迅速降低。DeepSeek V3的出現(xiàn),標(biāo)志著訓(xùn)練成本的大幅下降,其訓(xùn)練成本僅為557.6萬美元,相較于之前的
    的頭像 發(fā)表于 01-13 11:12 ?1589次閱讀

    OpenAI GPT-5開發(fā)滯后:訓(xùn)練成本高昂

    已經(jīng)對GPT-5進(jìn)行了至少兩輪大規(guī)模訓(xùn)練,希望通過海量數(shù)據(jù)資源來優(yōu)化模型效能。然而,首次訓(xùn)練的實(shí)際運(yùn)行結(jié)果并未達(dá)到預(yù)期標(biāo)準(zhǔn),導(dǎo)致更大規(guī)模的
    的頭像 發(fā)表于 12-23 11:04 ?1409次閱讀

    【「大模型啟示錄」閱讀體驗(yàn)】如何在客服領(lǐng)域應(yīng)用大模型

    訓(xùn)練模型如BERT、GPT等。這些模型在理解自然語言、生成文本、處理對話等方面具有不同的能力。因此,在選擇模型時,需要了解每個
    發(fā)表于 12-17 16:53