跳到內容

Reading note

Shin, Kim & Kim, Human Learning from Artificial Intelligence

Shin、Kim 與 Kim 以 Leela Zero 評估韓國職業棋手的落子,主張棋手在看得到 AI 的「推理過程」之後才明顯進步,只看 AI 的著手不夠。

Published: at 06:10 PM
編輯本頁下載圖卡

閱讀來源:Shin 2021

關於這篇筆記

本篇未讀論文的線上附錄(https://osf.io/skuy5),附錄收有 Leela Zero 介面說明與雙重差分(difference-in-differences)檢驗。引用效果量前請核對附錄。

核心論點

作者以 Leela Zero 的評估衡量韓國職業棋手的落子品質。 2016 年 AlphaGo 只公開了 AI 的著手,之後棋手的落子品質只略有提升。 2017 年開源 AI 公開了作者所謂 AI 的「推理過程」,也就是各候選手的勝率與預期變化,之後落子品質才明顯提升。服兵役、無法使用 AI 的棋手則沒有提升。

作者據此主張,人們是在觀察到 AI 的推理過程之後,才學會像 AI 那樣做決策,只觀察 AI 的著手則不然(Shin, Kim & Kim 2021: 1795)。

研究設計

兩個事件

第一個事件是 2016 年 3 月 15 日 AlphaGo 擊敗李世乭。棋界從此能看到 AI 下在哪裡,但看不到它為何這樣下。

第二個事件是 2017 年 10 月 25 日 Leela Zero 開源發布(Shin, Kim & Kim 2021: 1796)。開源程式會為每個可能的著手計算對應的勝率,並顯示下了這手之後棋局會怎麼進行,也就是 AI 預期的一連串最佳決策(Shin, Kim & Kim 2021: 1796)。作者把這些輸出稱為 AI 的推理過程。

作者在註腳說明,「勝率」的確切意義其實更微妙,只因為棋界都這麼用,才為了方便沿用(Shin, Kim & Kim 2021: 1796 n. 6)。「最佳決策」也是指行動者在該局面能做的最佳決策,不是真正的最佳決策(Shin, Kim & Kim 2021: 1796 n. 7)。

學習模型

棋手以評估參數 θ\theta 判斷局面,以策略參數 σ\sigma 決定著手,覆盤時更新兩者(Shin, Kim & Kim 2021: 1796–1797)。在 Leela Zero 之前,棋手只能從 AI 的著手間接推測它的 θ\theta 與 σ\sigma;Leela Zero 讓棋手第一次能直接觀察兩者。

測量

決策品質用 AI 自己的評估來衡量。人機差距(Human-AI Gap)量化的是 AI 的反事實決策為棋手帶來的優勢,與棋手自己的決策帶來的優勢之間的差(Shin, Kim & Kim 2021: 1797)。差距越小,表示棋手那一手越接近 AI 會下的那一手。

資料涵蓋 2014 年 1 月到 2020 年 3 月,357 位韓國職業棋手的 30,995 局,約 130 萬手(Shin, Kim & Kim 2021: 1798)。每一手都用 Leela Zero 模擬它會下的那一手,再計算差距;平均差距為 3.52 個百分點。

自然實驗

韓國男性須服役 18 到 24 個月。服役中的棋手每月至多參加一次比賽,沒有時間,也沒有高效能電腦研究 AI。作者把至少 6 個月無法使用 AI 的棋手當作對照組(Shin, Kim & Kim 2021: 1799, n. 12)。

結果

就前 50 手而言,AlphaGo 之後平均差距只略為下降,Leela Zero 之後則明顯下降(Shin, Kim & Kim 2021: 1798–1799)。

第 51 到 140 手沒有這種變化:開源 AI 之後的曲線和 AI 出現前的曲線重疊(Shin, Kim & Kim 2021: 1798)。作者的解釋是,改善中盤的決策可能特別困難,原因也許是複雜度難以處理、各局之間缺乏相似性,兩者都可能妨礙新策略的發現或學習(Shin, Kim & Kim 2021: 1798)。

控制棋手與月份的固定效果後,能使用 AI 的棋手在 Leela Zero 發布後差距顯著下降,服役的棋手沒有(Shin, Kim & Kim 2021: 1799–1800)。

作者在結論承認,AI 的每一手與棋局最終勝負之間的關聯,人類可能相當不清楚,AI 卻較能掌握這個關聯(Shin, Kim & Kim 2021: 1800)。

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。