語言模型是少樣本學習者(GPT-3)

Language Models are Few-Shot Learners

摘要

近期研究透過在大規模文字語料上做預訓練,再針對特定任務做微調 (Fine-tuning),已在許多 NLP 任務與基準上取得顯著進展。雖然這種方法在架構上是任務無關的 (task-agnostic),但仍然需要每個任務數千到數萬筆有標註資料的微調資料集。相對之下,人類通常只需少量範例或簡單指示,就能執行新的語言任務——這仍是現今 NLP 系統難以企及的能力。 本文展示:將語言模型大幅放大可顯著改善任務無關、少樣本 (Few-Shot) 的表現,有時甚至能與當前最先進的微調方法相媲美。具體而言,我們訓練了 GPT-3——一個具有 1750 億 (175B) 參數的自迴歸語言模型,比此前任何非稀疏語言模型大上 10 倍——並在少樣本設定下測試其表現。對於所有任務,GPT-3 都不做任何梯度更新或微調,只透過純文字介面與模型互動,提供任務描述與少樣本示範。 GPT-3 在許多 NLP 資料集上達到強勁表現,包括翻譯、問答 (Question Answering)、克漏字 (Cloze) 任務,以及若干需要即時 (on-the-fly) 推理或領域適應的任務(如重組單字、在句中使用新詞、執行三位數算術)。同時,我們也指出某些 GPT-3 仍力有未逮的資料集,以及一些因在大量網路語料上訓練而衍生方法論問題的資料集。最後,我們發現 GPT-3 可生成新聞文章樣本,人類評估者難以與真人撰寫者區別。我們也討論此一發現及 GPT-3 整體的更廣泛社會影響。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv