競賽類的AI,和大多數公司用來進行預測AI,兩者有什麼區別?前者有創造能力。這種AI使用了「強化學習」,並不是靠餵歷史數據,來分析未來的變數;而是透過反覆試驗和錯誤來自我學習,擅長將某些會隨著時間流逝而改變優先執行順序的任務,來進行優化。那麼,領導人該怎麼去運用這種「更聰明」的AI,讓他們「發揮創造力」,幫你找出最佳解決方案?
圍棋的世界級棋王李世乭(Lee Sedol),在著名的2016年「人機大戰」第二局比賽中,很不理解Deepmind開發的AlphaGo軟體所下的第37步棋,結果花了將近15分鐘才落子。其他經驗豐富的棋手,也沒見過那一步棋的下法,有位評論員表示機器犯了錯誤。其實那是一個經典的例子,顯示人工智慧(artificial intelligence,AI)演算法似乎不只能在數據中辨識型態,還能學習具有策略、甚至具有創意的事物。確實,Deepmind的開發人員除了把圍棋棋王過去的下棋實例輸入演算法裡,還訓練AlphaGo自己和自己對弈數百萬場。這套系統在與自己的對弈中,有機會探索新的棋路和策略,然後評估這些表現是否有改善。透過所有這些反覆試驗和錯誤,AlphaGo發現了一種新棋路,連世界一流好手也感到意外。如果這種具備創意能力的AI,跟不同於大多數企業在應用機器學習時,最後會使用的聊天機器人和預測模型不一樣,那是因為,它們真的不同。AlphaGo之類的競賽系統,不是用歷史數據去產出預測的機器學習,而是使用「強化學習」(reinforcement learning),這是一種成熟的機器學習技術,擅長優化任務。為了做到這一點,行動者(agent)會隨著時間推進而採取一連串行動,而每一項行動所參考的資訊,都有關先前的行動產生了哪些結果。簡單來說,它的運作方式是嘗試不同的方法,並且鎖定(加強)那些看起來效果更好的方法。嘗試的次數夠多之後,你就可以強化你的做法,贏過當前的最佳方法,並且發現完成任務的最佳新方法。然而,強化學習雖然已經證明是有用的,但主要用於學術界,以及電玩遊戲和機器人技術等利基領域。網飛(Netflix)、Spotify和Google等公司,都已經開始使用強化學習,但大多數企業並未跟進。不過機會無處不在。其實,任何時候只要你必須依序做決定〔也就是AI專業人士所謂的「順序決策任務」(sequential decision task)〕,就有機會實施強化學習。以現實世界裡的許多問題為例;這類問題需要決定,如何隨著時間流逝而採取行動,在某個領域有某項事物需要極大化(或極小化),而且你從來沒有得到明確的正確解決方案。以下是一些例子:◼ 你應該如何將數據流量導引到不同的伺服器,或者決定要關閉資料中心的哪些伺服器?◼ 模擬建構一種分子,以開發突破性藥物時,如何決定接下來要添加哪種試劑?◼ 如果你想賣出大量持股,要如何在一整天內謹慎地慢慢賣出小單,以便盡量縮小股價跌幅?如果你是公司的領導人,可能會想把許多流程自動化或優化,但是有太多變動,或者有太多的例外情況和邊緣案例(edge case),無法設計成軟體。強化學習演算法甚至可以透過反覆嘗試和錯誤,以學習解決變動最多的優化問題,因而在快速變化的環境中,開啟自動化和個人化的新途徑。
尊重您的個人隱私權,所有資料皆以密碼保護。以下皆為必填欄位
請依據實際授課的人數(包含老師)選擇份數最低購買份數為5份