求真百科歡迎當事人提供第一手真實資料,洗刷冤屈,終結網路霸凌。

HuggingFace檢視原始碼討論檢視歷史

事實揭露 揭密真相
前往: 導覽、 搜尋

來自 搜狐網 的圖片

HuggingFace作為一家開發社交 AI 運行聊天機器人應用程序的公司,允許用戶與公司開發的人工智能進行交互,為此它不僅提供了最先進的NLP模型,也提供很多非常優秀的NLP數據集。或許對此你會產生疑問:什麼是NLP數據集?它的用途又是什麼?

NLP(即自然語言處理)是[[人工智能[1]]]的一個分支,通過使用自然語言來實現人機交互。它專注於處理大量人類可理解的語言(通常是文本格式),以提取其背後隱藏的規律和含義。因此在現實生活中的應用十分廣泛,如分類項目(文本),檢測仇恨言論,過濾垃圾郵件和消息。

下面我們將更深入地探討Hugging Face提供的NLP數據集,內容包括:它們包含哪些數據,如何組織這些數據,以及它們可以用來做什麼。

十大Hugging Face數據集列表

1.IMDB數據集

IMDB數據集是一個大型電影評論數據集,為用戶提供了超過5萬條的[[電影[2]]]評論,而這些評論根據語言色彩被標記為「正面」或「負面」,即預測電影評論是正面情緒(「這是一部很棒的電影」)還是負面情緒(「這部電影是浪費時間」),因此是一個用於二元情感分類的數據集。

其中數據被分成兩等份,一份用於訓練,另一份用於測試。如果用戶需要,還有其他未標註的數據可供使用。該數據集除了可以檢測不同文本信息的正面和負面的電影反饋以外,還可以幫助識別一部電影是否被大眾所喜歡。

2.Amazon Polarity數據集

該數據集包含來自亞馬遜的超過3500萬條產品評論。數據跨越18年,包括截至2013年3月的約3500萬條評論。評論包括產品和用戶信息、評級和純文本評論。

其中每個數據點都包括客戶的評論和對給定產品的評級。同時每個數據點都被分類為積極評價或消極評價,這取決於客戶是喜歡還是不喜歡該產品。

這種類型的帶標籤數據集在NLP和機器學習中十分有用。公司可以通過使用Amazon Polarity數據集來提升廣告水平和營銷能力。就像是市場營銷,利用NLP技術可以讓營銷人員看到客戶喜歡哪些產品,並知道哪些功能使客戶決定購買該產品。

類似的數據集還有Yelp review full數據集,包含大量的評論,這些評論按其給定的評分(從1到5)進行標記。它和上面提到的Amazon Polarity數據集類似,使用這種數據集訓練得到的模型對餐館或服務公司的營銷工作來說有很大幫助。

此外,Amazon Polarity數據集或Yelp review full數據集可用於推薦系統,將產品或企業分為不同類別。分類有助於應用程序或網站篩選客戶偏好並增強組織性。

3.Emotion數據集

Emotion數據集將推特上的英文信息分為六類:

悲傷

快樂

喜愛

憤怒

恐懼

驚訝

這種類型的數據集可以用來訓練和測試一個NLP模型,該模型主要通過讀取用戶的文本來捕捉用戶的情緒。當然,還包括其他用途,如通過使用憤怒和悲傷的數據類別來檢測和消除令人沮喪的信息(仇恨言論)。

類似的還有基於Twitter的數據集。該數據集將用戶的推文劃分為不同的表情符號,包括笑聲、喜愛、快樂等。和Emotion數據集一樣,這個推文數據集也可以用於NLP模型的訓練,用表情符號來表示各種情緒。

4.Common Voice數據集

此數據集是音頻數據和文本數據的混合。Common Voice數據集中包含超過9000小時的錄音信息及其書面記錄文本,除此之外還可以使用其他數據信息,例如說話者的年齡,性別和口音,可以幫助提高模型的語音檢測性能。

該數據集可用於訓練60多種語言的語音檢測模型。無論是在Google Home、Alexa和Siri等常見應用中,都不可缺少這種語音檢測模型,這些語音模型當然也需要具備多語言的處理能力,這時Common Voice數據集就派上用場了。

5.Silicone數據集

Silicone數據集是用於訓練、評估和分析面向口語的自然語言理解系統的資源集合。

這個數據集將句子分為commissive、directive、informative,或者只是一個普通的問題。Silicone數據集涵蓋了各種不同的領域,包括電話對話、電視對話等。

6.Yahoo Answers Topics數據集

Yahoo Answers Topics數據集包含來自「雅虎問答」的大量問題及答案,總共分為10個主題,將每個數據對(問題和答案)歸類到一個給定的類別中。其中的類型包括體育、商業和金融、社會和文化、科學和數學、家庭和人際關係、計算機和互聯網等等。

該數據集可以用來訓練模型,將某些問題和答案歸類到這些類別裡面。

7.Hate Speech數據集

請注意,此數據集包含攻擊性文本。Hate Speech數據集主要是從Stormfront論壇獲得到的文本,從幾個子論壇中隨機抽取了一組論壇帖子並分成句子。根據某些注釋指南,這些句子已被手動標記為是否包含仇恨言論。即每條數據會根據其內容被標記為仇恨消息或非仇恨消息。因此這種類型的數據集可以用來訓練模型,能夠在各大在線論壇上檢測仇恨言論。

同樣包含這類內容的數據集還有hate speech offensive數據集。它是一個在推文上檢測仇恨言論和攻擊性語言的帶標註數據集,可用於訓練模型來過濾和禁止某些詞在論壇、視頻遊戲(有兒童人口統計)和搜索欄查詢中的出現。

8.Scan數據集

Scan數據集是一組簡單的語言驅動的導航任務(由一組簡單的組合導航命令與相應的動作序列配對組成),用於研究組合學習和零樣本泛化。

你可以看到Scan數據集中任意一條數據都被拆分為命令,例如反向向左走兩步,因此實際的操作應該就是向右走兩步。

9.SMS Spam數據集

SMS Spam數據集包含超過5,000條英文SMS消息,它們被歸類為垃圾郵件或非垃圾郵件。

垃圾郵件過濾是NLP模型的主要用途之一。除此之外,還可以使用有標記的垃圾郵件數據集來訓練電子郵件過濾系統。

10.Banking 77數據集

Banking 77數據集比較複雜,包含發送給銀行的超過13,000條客戶消息(投訴和問題)。

該數據集在銀行領域提供了一組標有77個非常細粒度的意圖,專注於細粒度的單域意圖檢測。其中意圖包括客戶詢問卡未送達、卡不工作、卡上的額外費用以及被拒絕的轉賬問題。

這種類型數據集訓練出來的模型能夠將不同客戶的問題歸類到一個更有組織的結構中以供之後使用,方便銀行快速作出反應,並可以為每天接收大量客戶請求的業務構建類似的模型。不過前提是提供一個經過過濾和處理的數據集來運行該模型。

其他有趣的Hugging Face數據集

以下是來自Hugging Face的另外三個有趣的數據集。

1.Lair數據集

Lair數據集是一個用於檢測假新聞的數據集,包含來自世界各地政治家的12000多份有標籤的聲明。標籤分為錯誤、比較正確、基本正確和正確四個選項,而每個聲明都由politifact.com編輯器評估其真實性。

使用Lair數據集,機器學習模型就能夠檢測未來類似聲明的可信度。

2.Google Well-Formed Query數據集

該數據集是對來自Parallax語料庫的25100個查詢(query)標註了其是否足夠消息靈通(well-informed)。每個查詢將由五個評分者標註為消息靈通或消息不靈通(每個評分者對查詢的消息靈通程度的評分為1~0)。

通過使用這個數據集,機器學習模型可以進一步預測給定查詢的消息靈通程度。

3.Jfleg數據集

Jfleg數據集是一個英語語法糾錯(GEC)數據集,被認為是一個評估GEC系統的流暢度(文本在一定程度上是本地發音)和語法方面的黃金標準。對於每個源文檔都有四個人工更正(即每條數據包含一個有多個錯誤語法及拼寫的句子,和另外四個由四個不同的人糾正了語法及拼寫的句子)。

使用這種類型的數據集進行訓練,可以讓我們的模型檢測並糾正它發現的語法錯誤。但與大多數機器學習模型相似的是,該模型可能無法保證在所有情況下都能進行完美的語法和拼寫糾正。這裡還有另一個需要注意的地方,那就是根據任務的預期結果(垃圾郵件過濾器、仇恨言論檢測器、評論),選擇正確的數據集將顯著提高模型的性能。

使用Hugging Face數據集

Hugging Face上的數據集有不少潛在的用途,例如,將項目(文本)組成不同的類別(用於進一步的推薦系統處理)、檢測仇恨言論和過濾垃圾郵件,最後你會發現NLP是一項值得學習的技能。

在本文中,我們探索了Hugging Face,作為一個開源網站,它包含大量的NLP數據集(主要致力於NLP機器學習模型),希望我們在這裡分享的數據集,能夠幫助大家改善自己的機器學習生涯。

我們建議大家嘗試上面提及到的一些示例,學習如何將這些數據集與自己的機器學習模型結合使用。你可以隨時在Hugging Face或其他網站上查看各種數據集,以滿足自身對模型的要求。

參考文獻

  1. ↑ 認識人工智能的九個方面,搜狐,2020-11-04
  2. ↑ 中國電影史,道客巴巴,2012-04-11