導覽
近期變更
隨機頁面
新手上路
新頁面
優質條目評選
繁體
不转换
简体
繁體
216.73.216.189
登入
工具
閱讀
檢視原始碼
特殊頁面
頁面資訊
求真百科歡迎當事人提供第一手真實資料,洗刷冤屈,終結網路霸凌。
檢視 DeepMind 的原始碼
←
DeepMind
前往:
導覽
、
搜尋
由於下列原因,您沒有權限進行 編輯此頁面 的動作:
您請求的操作只有這個群組的使用者能使用:
用戶
您可以檢視並複製此頁面的原始碼。
{| class="wikitable" align="right" |- |<center><img src=https://hellorfimg.zcool.cn/provider_image/preview260/hi2251086395.jpg?x-image-process=image/format,webp width="330"></center> <small>[https://www.hellorf.com/image/search?q=DeepMind%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD 来自 站酷网 的图片]</small> |} '''DeepMind'''MuZero,DeepMind开发的[[人工智能]]<ref>[https://www.sohu.com/a/681664709_121281900 智能汽车:人工智能引领汽车行业的革新 ],搜狐,2023-06-03 </ref>。MuZero在没有学习过游戏规则的情况下,不仅能下围棋、将棋和国际象棋,还在30多款雅达利游戏中展示出了超人类表现(superhuman performance)。2019年推出,2020年发表于《[[自然]]》。研究人员将MuZero描述为“在追求通用算法方面迈出的重要一步”。 ==背景== 即使在1997年IBM的“深蓝”(Deep Blue)击败当时的国际象棋冠军卡斯帕罗夫之后,棋类AI的发展仍步履维艰。以[[围棋]]为例:2013年,AI在不让子的情况下几乎无法击败人类[[职业]]选手。 2016年,AlphaGo横空出世,以4:1击败[[韩国]]选手李世石,并在2017年的乌镇围棋峰会上击败了世界第一棋手柯洁。中国围棋协会当即授予AlphaGo职业围棋九段的称号。 如果说AlphaGo的成功确立了AI的“围棋霸权”,随后的AlphaGo Zero和AlphaZero则进一步揭示了“棋类霸权”的可能性。作为AI算法,不论是AlphaGo还是其继位者,都需要大量的训练。AlphaGo依赖于[[专家]]棋法(expert moves)数据集,而AlphaGo Zero舍去了这一步,直接与自己对战以为训练提供[[数据]]。AlphaZero则除了围棋,更学会了日本象棋(将棋)和国际象棋。值得一提的是,2018年底发布的AlphaZero,从第一次见到棋盘,到成为世界级棋类大师,只用了24小时。 2020年,DeepMind发表了MuZero。 ==特点== 自古以来,[[哲学家]]和[[科学家]]都幻想着有朝一日能造出“人工通用智能”(artificial general intelligence)。简单地说,人工通用智能需要有极高的可塑性(flexibility),从而适应(甚至精通)各式不同的任务:一个能下棋、玩游戏、做家务、开飞机<ref>[https://www.sohu.com/a/788072295_121983720 飞机的发展历史过程 ],搜狐,2024-06-24</ref>的AI。然而在此之前,最好的AI算法也只能精通数个同类任务;会下围棋、将棋和国际象棋的AlphaZero就是一个例子。 这种限制,在很大程度上来自AI算法对[[规则]]的依赖性。要想让AlphaZero下好各种棋,人类需要明确地教它各种棋的规则。以国际象棋为例,AlphaZero知道象只能斜着走,还不能跨过障碍物,而马可以跨过障碍物,但需要走“日”字。AlphaZero也知道什么是输赢和平局。可是一旦更换棋种,人类就需要将新棋种的规则从头教给AlphaZero。 既然这种依赖性限制了目前AI算法的应用[[范围]],那最简单的解决方案,就是去除这种依赖性:人类可以不教AI下棋,只给它一个棋盘。每当AI选择了下一步该如何走时,人类才告诉它这一步合不合法,并且是否导致了输赢或平局。 ——这就是MuZero面临的情境。对于任何一个游戏或任务,MuZero所掌握的只有一套“思考方式”,并没有该任务的“行为准则”。它不知道国际象棋里的马该怎么走,也不知道将棋中如何达成“王手”。如同第一次见到[[电脑]]的小孩,MuZero具有作出推理论断的“思维工具”,但不知道如何才能赢得“扫雷”。 跟人类一样,MuZero的秘诀,在于摸着石头过河,为外部世界建立一个只属于自己的“模型”(internal model)。在这个内部模型中,MuZero舍弃了一切表面上的规则,只留下对决策有用的信息:[[价值]](value,即当前决策“有多好”)、策略(policy,即最好的“下一步”是什么)和奖励(reward,即上一步“有多好”)。 要明白这种[[策略]]的特殊和有效性,我们可以拿MuZero和AlphaZero的神经网络作对比: 任何深度学习算法在面对棋盘时,第一步总是[[观察]]。AlphaZero能观察当前棋局(S0),并直接利用S0计划未来的棋步。这要多亏了它所知道的棋类规则:它明白做出一个动作(action)后的下一个棋局长什么样,并可以在下一个棋局的基础上继续规划棋路,“想象”并评估各种不同的可能性。这样的规划方式,在深度学习上称为“蒙特卡洛树搜索”(Monte Carlo tree search,MCTS)。MCTS允许算法探索不同的可能性,并从中择出最优的动作。因此,熟知规则的AlphaZero要想精通棋类,只需要一个“[[神经网络]]”(neural network),即“预测网络”(prediction network)f,给f输入一个状态,它就能给出这个状态的价值(v)和潜在策略(p);通过评估各个可能性,AlphaZero就能得知当前最好的棋步。 MuZero则没有这种“奢华待遇”:它需要摸索出棋盘上各个子的合法(legal)走法,还需要弄清输赢的[[概念]];当然,它的目标与AlphaZero一样,赢就好了,越多越好。但在不清楚规则的情况下,MuZero需要另辟蹊径,利用“表征网络”(representation network)h,将观察到的棋盘状态转换成只属于自己的隐藏状态(hidden state)。我们将当前的棋盘状态称为“O”(observation,即观察),MuZero的当前隐藏状态称为S0。但这时,MuZero遇到了第二个大难题:如何像AlphaZero一样评估未来的各种可能性呢? 不像AlphaZero,不知道棋盘规则的MuZero不能预测棋盘的各种[[可能]]状态,因此,MuZero需要从零开始,创造自己对棋路的内部模型。幸运的是,有了隐藏状态S0之后,MuZero就能算出S0状态下可以做出的各种行动(经过学习,MuZero得出的可能行动会越来越符合规则),并能通过“动态网络”(dynamic network)g,利用MuZero选择的行动和当前潜在状态S0,推演出S1。在每一个真实[[世界]]的时间点内,MuZero都能利用自己的内部模型和MCTS选择出这一个时间点的最佳行为,并将其应用于真实世界中。在实际做出了一个最佳行为后,这个行为又能再“回收”,用于训练动态网络g(从而改进MuZero的内部模型)。 也就是说,由于AlphaZero对规则的掌握,它只需要一个预测网络f就能精通棋类。而不能预先知晓规则的MuZero,则需要利用动态网络g和表征网络h,自己学习并建立一个内在模型,从而学会下棋。在建立内在模型的过程中,人类不会给MuZero设置任何限制:MuZero可以舍弃任何[[信息]],只保留有用的元素(即价值、策略和奖励)。 ==参考文献== [[Category:300 科學類]]
返回「
DeepMind
」頁面