導覽
近期變更
隨機頁面
新手上路
新頁面
優質條目評選
繁體
不转换
简体
繁體
216.73.216.189
登入
工具
閱讀
檢視原始碼
特殊頁面
頁面資訊
求真百科歡迎當事人提供第一手真實資料,洗刷冤屈,終結網路霸凌。
檢視 HuggingFace 的原始碼
←
HuggingFace
前往:
導覽
、
搜尋
由於下列原因,您沒有權限進行 編輯此頁面 的動作:
您請求的操作只有這個群組的使用者能使用:
用戶
您可以檢視並複製此頁面的原始碼。
{| class="wikitable" align="right" |- |<center><img src=http://q7.itc.cn/q_70/images01/20240323/9319a8cfb04c40bc8ae3e8f73d629f72.jpeg width="330"></center> <small>[http://news.sohu.com/a/766355117_128289 来自 搜狐网 的图片]</small> |} '''HuggingFace'''作为一家开发社交 AI 运行聊天[[机器人]]应用程序的公司,允许用户与公司开发的人工智能进行交互,为此它不仅提供了最先进的NLP模型,也提供很多非常优秀的NLP[[数据集]]。或许对此你会产生疑问:什么是NLP数据集?它的用途又是什么? NLP(即自然语言处理)是[[人工智能<ref>[https://www.sohu.com/a/429466389_120797189 认识人工智能的九个方面],搜狐,2020-11-04</ref>]]的一个分支,通过使用自然语言来实现人机交互。它专注于处理大量人类可理解的语言(通常是文本格式),以提取其背后隐藏的规律和含义。因此在现实生活中的应用十分广泛,如分类项目(文本),检测仇恨言论,过滤垃圾邮件和消息。 下面我们将更深入地探讨Hugging Face提供的NLP数据集,内容包括:它们包含哪些[[数据]],如何组织这些数据,以及它们可以用来做什么。 ==十大Hugging Face数据集列表== ===1.IMDB数据集=== IMDB数据集是一个大型电影评论数据集,为用户提供了超过5万条的[[电影<ref>[http://www.doc88.com/p-799222872516.html 中国电影史],道客巴巴,2012-04-11</ref>]]评论,而这些评论根据语言色彩被标记为“正面”或“负面”,即预测电影评论是正面情绪(“这是一部很棒的电影”)还是负面情绪(“这部电影是浪费时间”),因此是一个用于二元情感分类的数据集。 其中数据被分成两等份,一份用于[[训练]],另一份用于测试。如果用户需要,还有其他未标注的数据可供使用。该数据集除了可以检测不同文本信息的正面和负面的电影反馈以外,还可以帮助识别一部电影是否被大众所喜欢。 ===2.Amazon Polarity数据集=== 该数据集包含来自[[亚马逊]]的超过3500万条产品评论。数据跨越18年,包括截至2013年3月的约3500万条评论。评论包括产品和用户信息、评级和纯文本评论。 其中每个数据点都包括[[客户]]的评论和对给定产品的评级。同时每个数据点都被分类为积极评价或消极评价,这取决于客户是喜欢还是不喜欢该产品。 这种类型的带标签数据集在NLP和机器学习中十分有用。公司可以通过使用Amazon Polarity数据集来提升广告水平和营销能力。就像是市场营销,利用NLP技术可以让营销人员看到客户喜欢哪些[[产品]],并知道哪些功能使客户决定购买该产品。 类似的数据集还有Yelp review full数据集,包含大量的评论,这些评论按其给定的评分(从1到5)进行标记。它和上面提到的Amazon Polarity数据集类似,使用这种数据集训练得到的[[模型]]对餐馆或服务公司的营销工作来说有很大帮助。 此外,Amazon Polarity数据集或Yelp review full数据集可用于推荐[[系统]],将产品或企业分为不同类别。分类有助于应用程序或网站筛选客户偏好并增强组织性。 ===3.Emotion数据集=== Emotion数据集将推特上的[[英文]]信息分为六类: 悲伤 [[快乐]] 喜爱 愤怒 恐惧 惊讶 这种类型的数据集可以用来训练和测试一个NLP模型,该模型主要通过读取用户的文本来捕捉用户的情绪。当然,还包括其他用途,如通过使用愤怒和悲伤的数据类别来检测和消除令人沮丧的[[信息]](仇恨言论)。 类似的还有基于Twitter的数据集。该数据集将用户的推文划分为不同的表情符号,包括笑声、喜爱、[[快乐]]等。和Emotion数据集一样,这个推文数据集也可以用于NLP模型的训练,用表情符号来表示各种情绪。 ===4.Common Voice数据集=== 此数据集是[[音频]]数据和文本数据的混合。Common Voice数据集中包含超过9000小时的录音信息及其书面记录文本,除此之外还可以使用其他数据信息,例如说话者的年龄,性别和口音,可以帮助提高模型的语音检测性能。 该数据集可用于[[训练]]60多种语言的语音检测模型。无论是在Google Home、Alexa和Siri等常见应用中,都不可缺少这种语音检测模型,这些语音模型当然也需要具备多语言的处理能力,这时Common Voice数据集就派上用场了。 ===5.Silicone数据集=== Silicone数据集是用于训练、评估和分析面向口语的自然语言理解系统的[[资源]]集合。 这个数据集将句子分为commissive、directive、informative,或者只是一个普通的问题。Silicone数据集涵盖了各种不同的领域,包括[[电话]]对话、电视对话等。 ===6.Yahoo Answers Topics数据集=== Yahoo Answers Topics数据集包含来自“雅虎问答”的大量问题及答案,总共分为10个主题,将每个数据对(问题和答案)归类到一个给定的类别中。其中的类型包括体育、商业和[[金融]]、社会和文化、科学和[[数学]]、家庭和人际关系、计算机和互联网等等。 该数据集可以用来训练模型,将某些问题和答案归类到这些类别里面。 ===7.Hate Speech数据集=== 请注意,此数据集包含攻击性文本。Hate Speech数据集主要是从Stormfront论坛获得到的文本,从几个子[[论坛]]中随机抽取了一组论坛帖子并分成句子。根据某些注释指南,这些句子已被手动标记为是否包含仇恨言论。即每条数据会根据其内容被标记为仇恨消息或非仇恨消息。因此这种类型的数据集可以用来训练模型,能够在各大在线论坛上检测仇恨言论。 同样包含这类内容的数据集还有hate speech offensive数据集。它是一个在推文上检测仇恨言论和攻击性语言的带标注数据集,可用于训练模型来过滤和禁止某些词在[[论坛]]、视频游戏(有儿童人口统计)和搜索栏查询中的出现。 ===8.Scan数据集=== Scan数据集是一组简单的语言驱动的[[导航]]任务(由一组简单的组合导航命令与相应的动作序列配对组成),用于研究组合学习和零样本泛化。 你可以看到Scan数据集中任意一条数据都被拆分为[[命令]],例如反向向左走两步,因此实际的操作应该就是向右走两步。 ===9.SMS Spam数据集=== SMS Spam数据集包含超过5,000条英文SMS消息,它们被归类为垃圾[[邮件]]或非垃圾邮件。 垃圾邮件过滤是NLP模型的主要用途之一。除此之外,还可以使用有标记的垃圾邮件数据集来训练电子邮件过滤系统。 ===10.Banking 77数据集=== Banking 77数据集比较复杂,包含发送给[[银行]]的超过13,000条客户消息(投诉和问题)。 该数据集在银行领域提供了一组标有77个非常细粒度的意图,专注于细粒度的单域意图检测。其中意图包括客户询问卡未送达、卡不[[工作]]、卡上的额外费用以及被拒绝的转账问题。 这种类型数据集训练出来的模型能够将不同客户的问题归类到一个更有组织的结构中以供之后[[使用]],方便银行快速作出反应,并可以为每天接收大量客户请求的业务构建类似的模型。不过前提是提供一个经过过滤和处理的数据集来运行该模型。 ==其他有趣的Hugging Face数据集== 以下是来自Hugging Face的另外三个有趣的数据集。 ===1.Lair数据集=== Lair数据集是一个用于检测假[[新闻]]的数据集,包含来自世界各地政治家的12000多份有标签的声明。标签分为错误、比较正确、基本正确和正确四个选项,而每个声明都由politifact.com编辑器评估其真实性。 使用Lair数据集,机器学习模型就能够检测未来类似声明的可信度。 ===2.Google Well-Formed Query数据集=== 该数据集是对来自Parallax语料库的25100个查询(query)标注了其是否足够消息灵通(well-informed)。每个查询将由五个评分者标注为消息灵通或消息不灵通(每个评分者对查询的[[消息]]灵通程度的评分为1~0)。 通过使用这个数据集,机器学习模型可以进一步[[预测]]给定查询的消息灵通程度。 ===3.Jfleg数据集=== Jfleg数据集是一个英语语法纠错(GEC)数据集,被认为是一个评估GEC系统的流畅度(文本在一定程度上是本地发音)和语法方面的黄金标准。对于每个源文档都有四个人工更正(即每条数据包含一个有多个[[错误]]语法及拼写的句子,和另外四个由四个不同的人纠正了语法及拼写的句子)。 使用这种类型的数据集进行训练,可以让我们的模型检测并纠正它发现的语法错误。但与大多数机器学习模型相似的是,该模型可能无法保证在所有情况下都能进行完美的[[语法]]和拼写纠正。这里还有另一个需要注意的地方,那就是根据任务的预期结果(垃圾邮件过滤器、仇恨言论检测器、评论),选择正确的数据集将显著提高模型的性能。 ==使用Hugging Face数据集== Hugging Face上的数据集有不少潜在的用途,例如,将项目(文本)组成不同的类别(用于进一步的推荐系统处理)、检测仇恨言论和过滤垃圾邮件,最后你会发现NLP是一项值得学习的[[技能]]。 在本文中,我们探索了Hugging Face,作为一个开源网站,它包含大量的NLP数据集(主要致力于NLP机器学习模型),[[希望]]我们在这里分享的数据集,能够帮助大家改善自己的机器学习生涯。 我们建议大家尝试上面提及到的一些示例,学习如何将这些数据集与自己的机器学习模型结合[[使用]]。你可以随时在Hugging Face或其他网站上查看各种数据集,以满足自身对模型的要求。 ==参考文献== [[Category:科技業]]
返回「
HuggingFace
」頁面