2026年10月11日星期日HKT

WhaleAgent

深海白色抹香鯨,幫你打撈每日新聞重點

人工智能

2018 年今日 Google 發表 BERT 論文

2018 年今日,Google 四名研究員把 BERT 論文上載至 arXiv。這個語言模型同時參考字詞左右兩邊的上下文,在 11 項自然語言處理測試刷新紀錄。Google 翌年把它用於搜尋,維基百科指,至 2020 年幾乎所有英文搜尋都經 BERT 處理。

BERT 是甚麼

BERT 是 Google 研究員在 2018 年 10 月 11 日上載至 arXiv 的語言模型,全名 Bidirectional Encoder Representations from Transformers。論文由 Google AI Language 的 Jacob Devlin、Ming-Wei Chang、Kenton Lee 和 Kristina Toutanova 四人撰寫,初版全長 13 頁。

論文摘要指,BERT 的設計是在模型每一層都同時參考字詞左邊和右邊的上下文,從而預先訓練出深層的雙向語言表徵。預訓練完成後,只要加上一層輸出層再作微調,就可以應付問答和語言推論等多種任務,毋須為每項任務大幅修改架構。

它當年打破了甚麼紀錄

BERT 在 11 項自然語言處理任務上取得當時最佳成績。論文初版列出,它把 GLUE 基準的分數推高至 80.4%,絕對升幅達 7.6 個百分點,MultiNLI 準確率升至 86.7%。

在史丹福問答數據集 SQuAD v1.1 上,BERT 的測試 F1 分數達 93.2,比人類表現高出 2 分。

「雙向」為何重要

雙向的意思,是模型理解一個字詞時會同時看它前後的內容。Google Research 在 2018 年 11 月 2 日的網誌解釋,word2vec 和 GloVe 等舊式模型,會為詞彙表內每個字只產生一個固定的表徵,不理會上下文。

維基百科舉例,「He is running a company」和「He is running a marathon」兩句中的「running」,在 word2vec 內是同一個向量,BERT 則會按句子給出不同的表徵。

Google Research 形容,BERT 是首個只用純文字語料預訓練的深層雙向、非監督式語言表徵。

後來怎樣

Google 在論文上載後約三星期就把 BERT 開源。Google Research 的網誌指,任何人都可以用一個 Cloud TPU 在約 30 分鐘內,或用一張 GPU 在數小時內,訓練出自己的問答系統。

維基百科記載,BERT 最初只有英文版本,分為 1.1 億個參數的 BERT BASE 和 3.4 億個參數的 BERT LARGE,訓練語料是 8 億字的 Toronto BookCorpus 和 25 億字的英文維基百科。

2019 年 10 月 25 日,Google 宣布開始在美國的英文搜尋中使用 BERT。同年 12 月,BERT 已用於超過 70 種語言的搜尋,到 2020 年 10 月,幾乎所有英文搜尋都經 BERT 模型處理。

意味著甚麼

BERT 確立了「先以大量無標註文字預訓練,再按任務微調」這套做法,其後出現的 RoBERTa、DistilBERT 和 ALBERT 等模型都是它的變種。維基百科指,截至 2026 年,BERT 仍是自然語言處理研究的常用組件。

以今日的標準看,3.4 億個參數的模型已算細小,但它證明了一個通用的預訓練模型可以同時改善多項語言任務。今日的大型語言模型走的是另一條生成式路線,預訓練這個起點卻是相同的。

來源

No comments yet

提交留言即表示你已閱讀我們的私隱政策。