1. GPT創(chuàng)造者:第二次改變AI浪潮的方向
那么,從推動這一系列變革的科學(xué)家角度,他究竟如何看待當(dāng)先ChatGPT、GPT-4模型的發(fā)展?他對AI的思考和堅(jiān)定信念從何而來?OpenAI下一步研究方向是什么?他又如何看待AI對社會的影響?
(資料圖片)
鏈接:
https://mp.weixin.qq.com/s/rZBEDlxFVsVXoL5YUVU3XQ
2. 科普:人類反饋的強(qiáng)化學(xué)習(xí)(RLHF)
ChatGPT中的RLHF究竟是如何運(yùn)作的?它為什么有效?
鏈接:
https://huyenchip.com/2023/05/02/rlhf.html
3. ChatGPT作者John Schulman:通往TruthGPT之路
大型語言模型(LLM)有一個眾所周知的“硬傷”——它們經(jīng)常會一本正經(jīng)編造貌似真實(shí)的內(nèi)容。作為ChatGPT項(xiàng)目的主要負(fù)責(zé)人以及OpenAI強(qiáng)化學(xué)習(xí)團(tuán)隊(duì)的領(lǐng)導(dǎo)者,John Schulman在最近的Berkeley EECS會議上系統(tǒng)性地分享了OpenAI在人類反饋的強(qiáng)化學(xué)習(xí)(RLHF)方面所做的工作,以及語言模型的幻覺等亟待解決的問題,同時也介紹了解決這些挑戰(zhàn)的潛在思路。
鏈接:
https://mp.weixin.qq.com/s/snS2ty4x7gJ9QoMxWU0_Lw
4. 為什么ChatGPT用強(qiáng)化學(xué)習(xí)而非監(jiān)督學(xué)習(xí)?
隨著ChatGPT等大型語言模型的發(fā)布,人們對“RLHF訓(xùn)練(即基于人類反饋的強(qiáng)化學(xué)習(xí)訓(xùn)練)”的重要性進(jìn)行了諸多討論。在訓(xùn)練語言模型方面,我一度困惑于為什么強(qiáng)化學(xué)習(xí)比從演示中學(xué)習(xí)(也稱為監(jiān)督學(xué)習(xí))更好,難道從演示中學(xué)習(xí)(或根據(jù)語言模型術(shù)語中的“指令微調(diào)”,學(xué)習(xí)模仿人類寫的回答)還不夠?
鏈接:
https://mp.weixin.qq.com/s/4USDakdomupWuwwhex6fMg
5. 谷歌研究科學(xué)家:ChatGPT秘密武器的演進(jìn)與局限
此前,ChatGPT負(fù)責(zé)人John Schulman介紹了RLHF想法的起源,關(guān)鍵在于他們在語言模型中應(yīng)用強(qiáng)化學(xué)習(xí),使用人類反饋去定義獎勵函數(shù)。此外,OpenAI的RLHF所使用的諸多技術(shù)也是基于前人研究基礎(chǔ)上組合而成的成果,其中就包括Natasha Jaques的工作。
鏈接:
https://mp.weixin.qq.com/s/HsJmaL3acV2yZJGd2npcLg
6. Constitution AI:訓(xùn)練大型語言模型的最佳方法?
語言模型如何決定它會處理哪些問題以及它認(rèn)為不合適的問題?為什么它會鼓勵某些行為而阻止其他行為?語言模型可能具有哪些“價值觀(values)”?
這些都是人們努力解決的問題。Anthropic最近發(fā)表的關(guān)于“Constitution AI”的研究認(rèn)為,這種方法為語言模型提供了顯式的價值觀,而不是通過大規(guī)模人類反饋隱式確定的價值觀。這不是一個完美的方法,但它確實(shí)使人工智能系統(tǒng)的價值更容易理解,也更容易根據(jù)需要進(jìn)行調(diào)整。Claude模型就使用Constitution AI進(jìn)行訓(xùn)練,從而讓其更安全。Anthropic認(rèn)為,這種方法優(yōu)于用于訓(xùn)練ChatGPT等系統(tǒng)的其他方法。
鏈接:
1. https://www.anthropic.com/index/claudes-constitution;
2. https://arxiv.org/abs/2212.08073
7. 向量嵌入:AutoGPT的幻覺解法?
此前,OpenAI首席科學(xué)家Ilya Sutskever談到,他希望通過改進(jìn)強(qiáng)化學(xué)習(xí)反饋步驟來阻止神經(jīng)網(wǎng)絡(luò)產(chǎn)生“幻覺”。不過,向量嵌入(vector embeddings)看上去是解決這一挑戰(zhàn)的更為簡單有效的方法,它可以為LLM創(chuàng)建一個長期記憶的數(shù)據(jù)庫。通過將權(quán)威、可信的信息轉(zhuǎn)換為向量,并將它們加載到向量數(shù)據(jù)庫中,數(shù)據(jù)庫能為LLM提供可靠的信息源,從而減少模型產(chǎn)生幻覺的可能性。
鏈接:
https://mp.weixin.qq.com/s/Hx52fL9hN5eLA13qJv-VCQ
8. 大語言模型(LLM)微調(diào)技術(shù)筆記?
在預(yù)訓(xùn)練后,大模型可以獲得解決各種任務(wù)的通用能力。然而,越來越多的研究表明,大語言模型的能力可以根據(jù)特定目標(biāo)進(jìn)一步調(diào)整。這就是微調(diào)技術(shù),目前主要有兩種微調(diào)大模型的方法指令微調(diào)、對齊微調(diào),OpenAI發(fā)布的ChatGPT主要應(yīng)用了微調(diào)技術(shù),從而獲得了驚艷全世界的效果。
鏈接:
https://github.com/ninehills/ninehills.github.io/issues/92
9. 大型語言模型綜述
在這篇綜述中,研究者們介紹了大型語言模型的背景、主要研究方向、主流技術(shù)以及最新進(jìn)展。他們特別關(guān)注LLM的四個主要方面,即預(yù)訓(xùn)練、適應(yīng)性精調(diào)、應(yīng)用和能力評估。此外,他們還總結(jié)了LLM的現(xiàn)有資源,并討論了未來發(fā)展方向等問題。
鏈接:
https://arxiv.org/abs/2303.18223
10. 那些開源的LLM和數(shù)據(jù)集、研究洞見
開源的力量正在源源不斷地影響著整個 AI 社區(qū),無論是 LLM 還是數(shù)據(jù)集。本文作者 Sebastian Raschka 對相關(guān)資源進(jìn)行了匯總,并分享了自己的洞見。
鏈接:
https://mp.weixin.qq.com/s/VleZkQT6Vga7vqZP8pvgQQ
11. Open LLMs:可供商業(yè)使用的開源大型語言模型列表
本文列出的?LLM 均已獲得商業(yè)用途許可(基于 Apache 2.0、MIT、OpenRAIL-M)。
鏈接:
https://github.com/eugeneyan/open-llms
12. 羊駝系列大模型和ChatGPT差多少?詳細(xì)測評后,我沉默了
總的來說,該測試得出的結(jié)論是:MPT 還沒有準(zhǔn)備好在現(xiàn)實(shí)世界中使用,而 Vicuna 對于許多任務(wù)來說是 ChatGPT (3.5) 的可行替代品。
鏈接:
https://mp.weixin.qq.com/s/Gg-zbhzJcqmU0guSSvWpXg
13. 大型語言模型的推理演算
本文詳細(xì)闡述了大型語言模型推理性能的幾個基本原理,不含任何實(shí)驗(yàn)數(shù)據(jù)或復(fù)雜的數(shù)學(xué)公式,旨在加深讀者對相關(guān)原理的理解。此外,作者還提出了一種極其簡單的推理時延模型,該模型與實(shí)證結(jié)果擬合度高,可更好地預(yù)測和解釋Transformer模型的推理過程。
鏈接:
https://mp.weixin.qq.com/s/2wfUQNsH4IRuJEF39mebUQ
14. Transformer模型的基礎(chǔ)演算
Transformer語言模型的許多基本重要信息可以通過簡單計算得出。不幸的是,這些計算公式在自然語言處理(NLP)社區(qū)中并不廣為人知。AI非營利研究組織EleutherAI收集整理這些公式,并介紹這些公式的來源和重要性。
鏈接:
https://mp.weixin.qq.com/s/0Er0UOk6Wdky-0gzeQxK0g
15. 機(jī)器學(xué)習(xí)系統(tǒng)的九種設(shè)計模式
設(shè)計模式是針對軟件工程中常見問題的可重復(fù)使用、經(jīng)過時間考驗(yàn)的解決方案。他們將最佳實(shí)踐和過去的知識進(jìn)行提煉,成為從業(yè)者的實(shí)用建議,并提供共享詞匯表,以便有效協(xié)作。本文作者分享了在機(jī)器學(xué)習(xí)系統(tǒng)中的主要設(shè)計模式。
鏈接:
https://eugeneyan.com/writing/more-patterns/
16. 編譯器大佬Chris Lattner全新編程語言「Mojo」:兼容Python核心功能
Mojo結(jié)合了Python的可用性與C的性能,釋放了AI硬件無與倫比的可編程性和AI模型的可擴(kuò)展性」—— 它與Python一樣易于使用,但具有C++和Rust的性能。此外,Mojo提供了利用整個Python庫生態(tài)系統(tǒng)的能力。
鏈接:
https://mp.weixin.qq.com/s/EguqTuzJwehfWm7UqMtbdw
17. 領(lǐng)域編譯器發(fā)展的前世今生
近年來,隨著GPU和DSA架構(gòu)在不同領(lǐng)域的廣泛應(yīng)用,特別是AI系統(tǒng)相關(guān)技術(shù)的飛速發(fā)展,對于編譯器的需求越來越強(qiáng)烈。編譯器已經(jīng)從一個相對小眾的研究領(lǐng)域,變?yōu)閷W(xué)界和業(yè)界都高度關(guān)注并大量投入的方向。與此同時,編譯器的開發(fā)人員也從芯片研發(fā)團(tuán)隊(duì)開始延伸到更上層的軟件層面。在很多領(lǐng)域的軟件系統(tǒng)中,都開始引入編譯技術(shù)來實(shí)現(xiàn)提升開發(fā)效率或運(yùn)行效率等目標(biāo)。本文從領(lǐng)域編譯器的角色著眼,來討論領(lǐng)域編譯器發(fā)展的前世今生。
鏈接:
1. https://mp.weixin.qq.com/s/eiQ6dRgDxAR7zkuWCBPfqg;
2.?https://mp.weixin.qq.com/s/Z6qiwPDevG6mF29TWjOb4g
18. OneFlow源碼解析:Eager模式下的設(shè)備管理與并發(fā)執(zhí)行
通過這篇筆記,希望能初步了解 OneFlow 在 Eager 模式下對設(shè)備的管理方式、設(shè)備執(zhí)行計算的過程以及如何充分利用設(shè)備計算能力。這里的設(shè)備主要指類似 CUDA 這樣的并行計算加速設(shè)備。
鏈接:
https://mp.weixin.qq.com/s/RMF38IlkRcxza6A8W6fG-w
其他人都在看
大型語言模型的推理演算
向量嵌入:AutoGPT的幻覺解法?
John Schulman:通往TruthGPT之路
《分布式人工智能系統(tǒng)》講習(xí)班開始報名
為什么ChatGPT用強(qiáng)化學(xué)習(xí)而非監(jiān)督學(xué)習(xí)
OneEmbedding:單卡訓(xùn)練TB級推薦模型不是夢
GLM訓(xùn)練加速:性能最高提升3倍,顯存節(jié)省1/3
歡迎Star、試用OneFlow:github.com/Oneflow-Inc/oneflow/http://github.com/Oneflow-Inc/oneflow/
關(guān)鍵詞: