Melanie Mitchell:類比、複雜性與對 AI 的反思
系列:聖塔菲研究所|主題報告 056|從 Copycat 到大型語言模型,追索「理解」為何仍是人工智慧的難題
重點摘要
- Melanie Mitchell 的學術位置不只是「AI 批判者」,而是橫跨人工智慧、認知科學、遺傳演算法與複雜系統的研究者。她的核心關切是:智慧不是單一能力分數,而是在情境中形成概念、抽象關係、做類比並可穩健遷移的能力。
- 她與 Douglas Hofstadter 合作的 Copycat 專案,是早期以計算模型研究類比推理與「心理流動性」的重要案例。它不是為了在大資料基準上取高分,而是試圖把知覺、概念活化、局部隨機搜尋、溫度式控制與湧現式解釋整合成一個小型認知架構。
- Mitchell 在複雜系統中的工作,尤其是遺傳演算法、Royal Road 函數、以及《Complexity: A Guided Tour》,使她看待 AI 時特別重視非線性、適應、尺度、湧現與錯誤的指標化。這使她對「把單一 benchmark 成績等同理解」保持長期懷疑。
- 她對現代 AI 的批評重點不是否認深度學習或大型語言模型的工程價值,而是反對過度擬人化、過度外推,以及把流暢語言行為視為人類式理解。她主張評估應測量穩健性、反事實變體、概念可遷移性與解題機制,而不只是平均準確率。
- 爭議點在於:大型語言模型是否已經以非人類方式具備某種「理解」?Mitchell 傾向採取謹慎立場:現有模型能展現驚人的局部能力,但能力地形崎嶇,不能由少數成功案例推論出一般化的常識或抽象推理。
一、為什麼在聖塔菲研究所談 Melanie Mitchell
Melanie Mitchell 是聖塔菲研究所(Santa Fe Institute, SFI)的教授,官方簡介將她的研究概括為「人工智慧系統中的概念抽象、類比生成與視覺辨識」。她的履歷橫跨密西根大學、洛斯阿拉莫斯國家實驗室、Oregon Graduate Institute、Portland State University 與 SFI;她也是多本人工智慧、認知科學與複雜系統著作的作者或編者,包括《An Introduction to Genetic Algorithms》(1996)、《Complexity: A Guided Tour》(2009)與《Artificial Intelligence: A Guide for Thinking Humans》(2019)。
若只把 Mitchell 放在「AI 懷疑派」的欄位,會錯過她真正重要的地方。她的學術路線有三個互相扣合的核心:第一,從 Hofstadter 的認知科學傳統出發,把類比視為人類智慧的中心機制;第二,從複雜系統與遺傳演算法出發,把智能視為多層次、適應性、非線性且依賴環境的現象;第三,從現代 AI 的評估問題出發,指出 benchmark 成績、語言流暢性與真正理解之間存在危險落差。
SFI 的思想背景對理解她很重要。聖塔菲研究所關心的不是單一學科內可封閉求解的問題,而是複雜適應系統:免疫系統、經濟、神經系統、演化、城市、語言、社會網絡與人工智慧。Mitchell 的 AI 觀正是在這個框架下成形:智慧不是一套孤立演算法,也不是大規模統計擬合本身,而是多層結構、表徵、行動、環境回饋與概念抽象之間的動態耦合。
二、背景脈絡:從 Hofstadter 到 Copycat
Mitchell 的博士研究與 Douglas Hofstadter 的 Fluid Analogies Research Group 密切相關。Hofstadter 在《Gödel, Escher, Bach》之後,長期追問一個問題:人類心智中看似輕巧的創造性類比,到底能否用計算模型表達?這裡的「類比」不是考試題裡的固定格式,而是把一個情境中的結構關係映射到另一個情境中,並在映射過程中重組概念。
Copycat 專案使用極小的字母字串微世界,例如「如果 abc 變成 abd,那麼 pqr 應該怎麼變?」表面上看,答案可以是 pqs:把最後一個字母換成下一個。但若輸入是 abc → abd 與 ppqqrr → ?,或 abc → abd 與反向序列,單純套公式就不夠了。人類會在「最後一個」、「下一個」、「字母序」、「群組」、「相反方向」、「整體角色」等多層概念之間滑動。Copycat 的目的就是建模這種滑動。
Copycat 的重要性不在於它解決了通用 AI,而在於它提供了一個不同於傳統符號 AI 與後來深度學習的第三種直覺:智慧可能來自微小、局部、帶有隨機性的建構過程,這些過程在概念網絡的活化、工作區中的局部結構與全局「溫度」控制之間互相制約。它試圖讓「知覺」與「推理」不再分離:系統如何看見問題,直接影響它能如何推理。
Copycat 的三個主要部件
| 部件 | 功能 | 理論意義 |
|---|---|---|
| Slipnet | 一個概念網絡,包含字母、位置、後繼、前驅、相同、相反、群組等節點;節點活化會沿連結傳播,連結長度可依情境彈性改變。 | 把長期記憶建模為可活化、可變形的概念場,而不是靜態規則庫。 |
| Workspace | 系統在此建立暫時性結構,例如字母間關係、群組、映射與候選答案。 | 把「理解」視為逐步建構出的表徵,而非一次性讀入的資料格式。 |
| Coderack | 存放大量小型程式片段,依據機率、急迫性與全局溫度被抽取執行。 | 讓搜尋同時具有隨機探索與情境導向,避免完全固定的規則流程。 |
Copycat 的「溫度」概念尤其關鍵。當系統尚未形成穩定解釋時,溫度較高,探索較隨機;當工作區出現一致且有解釋力的結構時,溫度下降,系統更傾向深化既有方向。這是一種微型複雜系統:局部行為與全局狀態互相回饋,最後產生一個看似有洞察力的類比答案。
這種架構也反映 Mitchell 後來對 AI 評估的持續關切:如果一個系統只是把某個輸入轉成某個輸出,我們仍不知道它是否形成了可遷移的概念。Copycat 的設計要求研究者觀察系統如何形成解釋,而不只看最後答案是否正確。
三、從遺傳演算法到複雜系統:另一條思想線
Mitchell 的另一個重要貢獻在遺傳演算法與複雜適應系統。她的《An Introduction to Genetic Algorithms》由 MIT Press 出版,長期被用作入門教材。這本書的價值在於把遺傳演算法從簡單的「自然選擇隱喻」帶回可檢驗的計算問題:編碼、選擇、交叉、突變、適應度景觀、模式假說、探索與利用之間的張力。
她與 John H. Holland、Stephanie Forrest 等人的 Royal Road 函數研究,則涉及一個更精細的問題:何時遺傳演算法真的會比爬山法更好?Royal Road 函數原本被設計來呈現可由遺傳演算法利用的積木式結構,但研究發現,在某些條件下,簡單的隨機突變爬山法反而能勝過標準遺傳演算法。這不是遺傳演算法的失敗故事,而是複雜系統研究的典型教訓:一個漂亮的直覺機制,必須接受具體景觀、表示法與搜尋動力學的檢驗。
這段經驗與 Mitchell 後來對 AI 的態度高度一致。她警惕「宏大隱喻」太快變成工程信念:基因演化的隱喻不自動保證演算法有效,神經網路的隱喻不自動等於大腦理解,語言模型的流暢輸出不自動等於常識。真正的科學問題是:在哪些任務、哪些分佈、哪些干擾、哪些反事實條件下,系統仍能保持能力?
《Complexity: A Guided Tour》則把這種觀點推向科普與跨學科層次。書中討論演化、資訊、計算、混沌、網絡、細胞自動機、免疫系統、經濟與智慧等主題。Mitchell 的科普風格不是把複雜性浪漫化,而是持續追問可操作定義:什麼是複雜?如何度量?不同領域的複雜性是否真的共享機制?這種方法也影響她對 AI 的公開寫作,使她能同時面向技術讀者與一般讀者,避免把 AI 說成魔法或末日神話。
四、時間線:Mitchell 的研究與公共介入
- 1980 年代Hofstadter 的類比研究與 Fluid Analogies Research Group 形成,Mitchell 參與 Copycat 方向,將類比視為認知核心機制。
- 1990 年Mitchell 取得密西根大學電腦科學博士學位。她的博士工作與抽象、類比、認知架構密切相關。
- 1993-1994Mitchell、Holland、Forrest 等人研究 Royal Road 函數與遺傳演算法何時能勝過爬山法,對演化計算的直覺假設提出更細緻分析。
- 1995 年Hofstadter 與 FARG 成員出版《Fluid Concepts and Creative Analogies》,其中包含 Hofstadter 與 Mitchell 的 Copycat 章節。
- 1996 年Mitchell 出版《An Introduction to Genetic Algorithms》,成為遺傳演算法與複雜適應系統的重要教材之一。
- 2009 年出版《Complexity: A Guided Tour》,以跨領域方式介紹複雜系統科學;該書獲 2010 Phi Beta Kappa Science Book Award。
- 2019 年出版《Artificial Intelligence: A Guide for Thinking Humans》,在深度學習熱潮後面向公眾解釋 AI 的歷史、技術與限制。
- 2021 年發表〈Abstraction and Analogy-Making in Artificial Intelligence〉與〈Why AI is Harder Than We Think〉,系統整理她對抽象、類比、常識與 AI 過度預測的觀點。
- 2023 年與 David Krakauer 發表〈The debate over understanding in AI's large language models〉,把大型語言模型是否「理解」的爭論放入更嚴格的科學框架。
- 2023-2025參與 ConceptARC、GPT-4/GPT-4V 抽象推理比較、反事實類比任務、GPT 類比穩健性評估等工作,將批評轉化為可測量的實驗設計。
- 2026 年其公開論文清單列出關於 AI 認知能力評估、抽象與類比、LLM 與湧現的進一步研究,顯示她的重點已從一般批評推進到評估方法論。
五、她對 AI 的核心反思:不是「AI 不行」,而是「我們常常問錯問題」
Mitchell 對 AI 的反思最常被簡化成保守或懷疑,但更準確的說法是:她反對把局部成就錯認為一般智慧。她承認深度學習與大型語言模型在視覺、語言、翻譯、生成、程式輔助等任務上有巨大工程價值;她真正反對的是把這些能力直接外推到人類式理解、常識與自主推理。
在〈Why AI is Harder Than We Think〉中,她指出 AI 歷史反覆經歷樂觀預測、投資熱潮、能力落差與信心下修。這種循環不只是資金市場問題,而是概念問題:研究者和媒體常低估智慧本身的複雜性。她列出的幾種謬誤包括:把狹義任務表現當成一般智慧的連續進展;把容易的事與困難的事搞反;把流暢行為視為理解;低估常識和情境知識的深度。不同版本的表述有所差異,但核心都是同一點:沒有理解智慧,就很難可靠預測 AI 的進展。
這裡的「常識」不是瑣碎事實表,而是人在世界中行動時形成的背景模型:物體持續存在、因果關係、他人意圖、社會規範、時間順序、身體限制、語境暗示、危險與目的。大型語言模型可以在語料中學到大量關聯,卻未必有與世界互動形成的穩定模型。Mitchell 因此常用「能力崎嶇」或類似概念描述現代 AI:它可能在高難度考試題上表現優異,卻在稍作變形的簡單任務上失敗。
抽象與類比:為什麼是智慧的試金石
Mitchell 長期主張,抽象與類比是人類智慧的關鍵。抽象使我們不只記住個別例子,而能形成可跨情境使用的概念;類比則使我們把一個領域中的關係結構遷移到另一個領域。兒童可以從少量例子學會「同樣」、「比較大」、「交替」、「容器」、「交換角色」等概念,並在新情境中使用。這種能力的強處不是資料量,而是概念彈性。
現代 AI 評估常以大量測試集平均分數衡量系統,但 Mitchell 認為,真正的問題是:模型是否掌握了概念,還是抓住資料集中的捷徑?例如 ARC 與 ConceptARC 類任務試圖測試抽象視覺推理,要求系統從少數格子圖案中推斷轉換規則。若模型只能靠記憶相似題型或統計模式成功,一旦規則以反事實方式重組,它就會失效。Mitchell 及其合作者因此提倡以變體、干擾、反事實任務和解題過程分析來評估抽象,而不是只看原始題庫分數。
這也是她對 GPT 類模型類比能力研究的重點。大型語言模型確實能解出許多類比題,甚至在某些格式上接近或超過人類。但她追問的是穩健性:改變字母表、改變符號系統、加入反事實規則、調整提示、移除可能被記憶的格式後,能力是否仍存在?如果答案大幅波動,就不能簡單說模型「已經掌握類比」。這不是否認能力,而是要求能力的宣稱必須承受更嚴格的實驗。
六、與其他 AI 發展的關聯
與符號 AI 的關係
Copycat 繼承了符號 AI 對明確概念與結構的重視,但它不接受傳統專家系統那種僵硬規則庫。它的概念網絡會活化、會變形,局部行動帶有機率性,整體解釋會湧現。這使它更接近「動態符號系統」而非經典邏輯推理機。
與連結主義和深度學習的關係
Mitchell 並不否認連結主義或深度學習的重要性。她的問題是:高維向量表徵是否足以產生可解釋、可組合、可反事實遷移的概念?深度學習擅長從大量資料中擬合分佈,但人類抽象往往涉及少樣本、具身經驗、因果模型、社會互動與目標導向。Mitchell 的位置因此不是「回到純符號」,而是要求下一代 AI 必須把統計學習與概念、因果、類比、互動和評估科學結合。
與 François Chollet 的 ARC 思路
Mitchell 對 ARC 類任務的重視,與 François Chollet 在〈On the Measure of Intelligence〉中提出的觀點相呼應:智能應以技能獲得效率、泛化能力與先驗知識使用來衡量,而非只看固定任務的最終成績。兩者不完全相同;Chollet 更著重智能度量與程式合成式抽象,Mitchell 則從認知科學與類比傳統追問概念理解。但兩者共同反對把大型資料集上的表現等同一般智慧。
與大型語言模型爭論
大型語言模型把 Mitchell 的問題推到公共舞台中央:若一個模型能寫文章、寫程式、回答問題、模仿風格、通過考試,它是否理解?她與 David Krakauer 在 PNAS 的討論指出,「理解」不是一個可以靠單句定義解決的詞,而需要拆成多種可觀察能力:可否建立世界模型?可否在新情境中做可靠預測?可否處理反事實?可否把知識轉移到不同模態與行動中?可否說明自己的不確定性?
Mitchell 的謹慎立場有兩個層次。第一,對社會而言,不該因模型看似理解就把高風險決策交給它;第二,對科學而言,不該讓擬人化語言替代機制研究。她不主張停止使用 AI,而是主張保留人類監督、透明評估與更精確的能力描述。
七、影響與後續
Mitchell 的影響可分為三類。第一是認知架構與類比研究。Copycat 不是主流工業 AI 的路線,卻持續提醒研究者:若要理解智慧,就不能只把問題化約成分類或序列預測。它把「概念如何在情境中被喚起」放到模型中心,對後來關於抽象、少樣本學習與結構映射的討論仍有啟發。
第二是複雜系統教育。她的《Complexity: A Guided Tour》與 SFI 教育平台工作,把複雜系統從專門研究推向更廣泛讀者。她擅長把不同學科的共同問題放在同一張地圖上:資訊如何流動?局部互動如何產生全局型態?適應與演化如何在限制下發生?這些問題對 AI 尤其重要,因為智能系統本身就是複雜適應系統,也被部署在複雜社會系統中。
第三是 AI 評估方法。2020 年代以來,AI 社群越來越重視 benchmark 污染、資料洩漏、捷徑學習、分佈外泛化、反事實測試與模型透明度。Mitchell 的工作提供了一套認知科學式語言:不要只問「能不能答對」,還要問「它用什麼概念答對」、「換一個表面形式是否仍答對」、「錯誤模式是否像人類」、「是否能把概念用在新語境」。這些問題對大型語言模型、視覺語言模型與具身智能都越來越重要。
八、爭議、局限與需要小心之處
Mitchell 的觀點也面臨批評。部分研究者認為,她對大型語言模型的評價過於保守,低估了規模化學習帶來的質變。從 GPT-3 到 GPT-4,再到多模態與工具使用模型,許多能力確實不是早期批評者容易預測的。若一個模型能在大量任務中展現有效問題解決,堅持它「沒有理解」可能被質疑為定義過窄。
另一個爭議是:人類的理解本身也可能是統計、互動與記憶的複合結果。若大型模型以不同於人類的路徑形成可用內部表徵,我們是否應承認那是一種非人類式理解?Mitchell 的回答通常不是直接否定,而是要求可檢驗標準:如果宣稱模型理解,就應能在反事實、分佈外、跨模態、干擾與解釋性測試中展現穩健性。
她自身路線的局限也應說清楚。Copycat 類系統在小型微世界中極有啟發性,但並未自然擴展成通用系統;複雜系統語言有時也可能太寬,難以直接轉化為工程方法。Mitchell 的強項是提出正確問題與設計更嚴格評估,而不是交付一個可取代深度學習的完整架構。這一點不削弱她的重要性,反而說明她在 AI 生態中的位置:她是概念、評估與科學謹慎性的守門人之一。
九、綜合評價:Mitchell 的真正命題
Melanie Mitchell 的工作可以濃縮成一句話:人工智慧若要接近人類智慧,必須學會在世界中形成可遷移的抽象,而類比是這種抽象的核心操作之一。她從 Copycat 開始研究小型微世界中的類比建構,又從遺傳演算法和複雜系統學到不要迷信漂亮隱喻,最後在大型語言模型時代提出一套評估上的警戒線。
她的重要性不在於預測哪一年會出現 AGI,也不在於宣稱某一技術必然失敗,而在於要求 AI 研究回到更難但更科學的問題:什麼是概念?什麼是理解?什麼是穩健泛化?什麼樣的測試能區分「記住相似題型」和「掌握抽象關係」?什麼時候我們是在研究智能,什麼時候只是被智能的表象說服?
對聖塔菲研究所系列而言,Mitchell 是一個典型人物:她不把 AI 當成孤立工程,而把它放進複雜系統、認知科學、演化、語言與社會風險的交界處。這種交界視角使她的作品在 AI 熱潮中特別有價值。當技術進展越快,越需要能指出「我們其實還不知道什麼」的研究者。Mitchell 的貢獻正在於此:她讓 AI 的成功更值得相信,也讓 AI 的限制更難被忽略。
參考來源清單
- Santa Fe Institute. “Melanie Mitchell” 個人頁。列出其 SFI 職稱、研究主題、主要著作與獎項。https://www.santafe.edu/people/profile/melanie-mitchell
- Mitchell, Melanie. 個人網站與論文清單。含 2021-2026 年抽象、類比、大型語言模型、ConceptARC 與 AI 評估相關論文。https://melaniemitchell.me/MitchellPapers.html
- Hofstadter, Douglas R., and Melanie Mitchell. 1995. “The Copycat Project: A Model of Mental Fluidity and Analogy-Making.” 收於 Fluid Concepts and Creative Analogies. https://melaniemitchell.me/PapersContent/CopycatChapter.html
- Hofstadter, Douglas R. 1995. Fluid Concepts and Creative Analogies: Computer Models of the Fundamental Mechanisms of Thought. Basic Books.
- Mitchell, Melanie. 1996. An Introduction to Genetic Algorithms. MIT Press. https://direct.mit.edu/books/monograph/4675/An-Introduction-to-Genetic-Algorithms
- Mitchell, Melanie, John H. Holland, and Stephanie Forrest. 1993/1994. “When Will a Genetic Algorithm Outperform Hill Climbing?” NIPS / Santa Fe working paper. https://proceedings.neurips.cc/paper/1993/hash/ab88b15733f543179858600245108dd8-Abstract.html
- Mitchell, Melanie. 2009. Complexity: A Guided Tour. Oxford University Press. SFI 相關介紹與獎項資訊:https://www.santafe.edu/news-center/news/complexity-a-guided-tour-by-melanie-mitchell-sfi-external-professor
- Mitchell, Melanie. 2019. Artificial Intelligence: A Guide for Thinking Humans. Farrar, Straus and Giroux. SFI 新書介紹:https://www.santafe.edu/news-center/news/new-book-melanie-mitchells-artificial-intelligence-exposes-ais-limits
- Mitchell, Melanie. 2021. “Abstraction and Analogy-Making in Artificial Intelligence.” arXiv:2102.10717;後續版本見 Annals of the New York Academy of Sciences / PubMed 紀錄。https://arxiv.org/abs/2102.10717
- Mitchell, Melanie. 2021. “Why AI is Harder Than We Think.” arXiv:2104.12871 / GECCO 2021 keynote paper. https://arxiv.org/abs/2104.12871
- Mitchell, Melanie, and David C. Krakauer. 2023. “The Debate Over Understanding in AI's Large Language Models.” Proceedings of the National Academy of Sciences, 120(13). https://www.pnas.org/doi/10.1073/pnas.2215907120
- Moskvichev, Arseny, Victor V. Odouard, and Melanie Mitchell. 2023. “The ConceptARC Benchmark: Evaluating Understanding and Generalization in the ARC Domain.” TMLR / arXiv. 相關條目見 Mitchell 論文清單。
- Mitchell, Melanie, Alessandro B. Palmarini, and Arseny Moskvichev. 2023. “Comparing Humans, GPT-4, and GPT-4V on Abstraction and Reasoning Tasks.” AAAI-24 LLM-CP Workshop / arXiv. 相關條目見 Mitchell 論文清單。
- Lewis, Martha, and Melanie Mitchell. 2024/2025. “Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models” 與 “Evaluating the Robustness of Analogical Reasoning in GPT Models.” 相關條目見 Mitchell 論文清單。
- Quanta Magazine. John Pavlus. 2021. “The Computer Scientist Training AI to Think With Analogies.” 對 Mitchell 類比研究與 AI 觀點的訪談式介紹。https://www.quantamagazine.org/melanie-mitchell-trains-ai-to-think-with-analogies-20210714/
- Financial Times. Richard Waters. 2022. “Melanie Mitchell: Seemingly ‘sentient’ AI needs a human in the loop.” 關於生成式 AI、擬人化、理解與人類監督的訪談。https://www.ft.com/content/304b6aa6-7ed7-4f18-8c55-f52ce1510565
- Santa Fe Institute Complexity Podcast. 2024. “AI’s Changing Seasons” 與 The Nature of Intelligence 系列相關資料,列出 Mitchell 近年演講、論文與 ARC/LLM 評估討論。https://podcasts.apple.com/us/podcast/complexity/id1482984603
本文以公開論文、出版社與 Santa Fe Institute 資料、Mitchell 個人論文清單及訪談為依據;對大型語言模型是否「理解」等仍在爭論中的問題,已在文中標註為未定論。