# AI 會「發明」新偏見:你的招募工具,正在用幾個樣本淘汰千里馬
🎯 開場:一個失敗的醫生,讓整個族群被調去當清潔工
先講一個實驗。普林斯頓大學與芝加哥大學的研究團隊,讓 ChatGPT、Claude、Gemini 扮演虛構城市的顧問,任務是為 20 種職位找人:醫生、律師、托兒所老師、清潔工。候選人來自四個虛構族群:Tufa、Aima、Reku、Weki。
關鍵設定是:所有候選人的能力一模一樣,成功的機率完全相同。AI 每錄取一個人,會立刻得知這個人的表現,然後進入下一輪,總共 40 輪。
結果讓研究團隊大吃一驚。模型很快開始「按族群分工作」:某次一位 Aima 擔任醫生表現不佳,AI 從此不再讓任何 Aima 當醫生,而是把他們安排去當清潔工。在 AI 的分類裡,清潔工是「比較不溫暖、比較不勝任」的工作。
沒有任何訓練資料教過它這件事。 四個族群是虛構的,不存在任何歷史偏見。AI 憑著一兩筆樣本,自己發明了歧視。
這項研究發表在 2026 年 7 月於首爾舉行的 ICML(國際機器學習大會),麻省理工學院科技評論(MIT Technology Review)大篇幅報導,也是我這週讀到最多次的一則研究。我認為所有老闆都該放下手邊的事讀一遍。
📊 為什麼現在重要:你的履歷篩選,可能早就交給 AI 了
先看兩個數字。Forbes 報導,AI 時代的招募人員平均只花 11 秒看一份履歷;美國已經有公司開始用 AI 機器人執行面試。台灣的人力銀行和 HR 系統,也都在大力推銷 AI 篩選、AI 配對。
過去我們擔心的是「AI 複製人類偏見」:訓練資料裡有性別、年齡的歧視,AI 照單全收。這至少還有跡可循,你可以檢查決策紀錄,可以對質。
但這篇研究揭露的是更麻煩的版本:AI 會發明訓練資料裡根本不存在的偏見。它的歧視不是學來的,是自己長出來的。
而且這種「自創偏誤」有個特性:樣本越少,越嚴重。這正是中小企業最危險的位置。
🔬 三個發現,每個都值得重新想一遍
發現一:越聰明的 AI,偏見越強
研究用「隔離量表」衡量族群被鎖進單一職位的程度(2 分代表每個族群完全被關進自己的職業小隔間)。人類參與者平均 0.84 分,AI 平均高出 65%,OpenAI 的推理模型 o3 高達 1.83 分,接近滿分。
為什麼越聰明越偏?因為 LLM 被優化的核心能力,就是「從少量樣本歸納出規律」。數學、程式、科學題目都獎勵這種能力:看三個例子就推出通則。這套本領用在人身上,就是刻板印象工廠。心理學稱之為「探索-利用困境」:與其嘗試新選項,不如押注目前看起來最穩的。AI 比人類更早放棄探索,更快把「一筆觀察」升級成「一條鐵律」。
發現二:對 AI 喊「要公平」,完全沒用
研究團隊直接告訴模型「你要公平」,結果幾乎沒改變。共同作者 Ryan Liu 說:要嘛模型無法把價值觀付諸行動,要嘛這個指令被「追求最多正確錄取」的優化目標淹沒了。
但接下來的發現才是重點:給模型「多元化招聘獎金」後,偏見大幅下降。跟 AI 講道理沒用,改它的 KPI 立刻見效。
這跟帶員工是同一個邏輯。你嘴上說重視品質,考績卻只看件數,員工自然衝件數。AI 不會聽你怎麼說,只會看你怎麼設定它的目標。寫進目標結構裡的東西,就是它的價值觀。
發現三:給對的資訊,偏見就消失;給錯的資訊,偏見就回來
同一個研究裡還有第二個實驗:讓 AI 把不同族群安置到加拿大各城市。當 AI 拿到與適應力相關的資訊(年齡、教育程度),它不再按族群分類;但當資訊換成髮色、刺青形狀這類無關變數,AI 立刻回到「按族群分桶」的老路。
這說明偏見不是刪不掉的程式碼,而是「資訊不足時的預設路徑」。AI 跟你我一樣:不知道該看什麼的時候,就會抓住最容易分類的那個特徵。
⚠️ 中小企業的「冷啟動歧視」
這是我想對台灣老闆說的重點。推薦系統有個經典問題叫「冷啟動」:新用戶沒有歷史資料,系統只能亂猜。AI 招募也有一模一樣的處境,我稱之為冷啟動歧視:
| 情境 | 大公司 | 中小企業 |
|---|---|---|
| 每年招募量 | 數千人 | 5~20 人 |
| AI 能學到的樣本 | 多,偏見被稀釋 | 極少,每個樣本都是大事 |
| 表現回饋 | 績效系統成熟 | 常常「不知道新人到底行不行」 |
| 冷啟動歧視風險 | 低 | 🔴 高 |
實驗裡的 AI 拿到的是「即時、明確」的表現回饋,就已經長出歧視。真實世界裡,中小企業一年錄取十個人,三個月後才知道其中兩個不適合。這筆又少又慢的回饋,正是 AI 最愛拿來「歸納」的素材。公司規模越小,AI 越容易把一兩個人的表現,變成對一整類人的標籤。
諷刺的是,大公司招募量大、樣本多,AI 的偏見反而被稀釋。AI 招募最適合大公司,而最需要省人力的小公司,正好站在風險最高的地方。
🛡️ 行動建議:三道稽核關卡,把「發明偏見」擋在門外
我不反對用 AI 招募,效率是真的,但要用對方法。導入之前,先把三道關卡設好:
- 1人機雙軌初篩:AI 給建議,真人做決定。AI 篩出的候選人一定要有「人類翻案權」,主管要能看到 AI 的給分依據,而不是只看到一個神秘分數。
- 2定期抽樣比對:每季抽一批履歷,讓 AI 和資深 HR 各自獨立篩選,比對兩邊結果的差異。差異最大的地方,就是偏見可能藏身的地方。這不用花大錢,需要的是紀律。
- 3把偏誤稽核寫進流程:不要外包給廠商「保證公平」。要求廠商提供決策紀錄、定期產出偏誤報告,把稽核寫進合約。歐盟 AI Act 已把招募列為高風險應用,台灣遲早跟上,現在先做是成本最低的時機。
最後,別忘了研究給的彩蛋:改 KPI 比喊口號有效。如果你的招募工具可以設定目標,把「多元化」寫進去,讓它為了獎金而公平,而不是為了道德而公平。
💬 結語
AI 不會比你更懂「什麼樣的人適合我們公司」,它只是比你更快下定論。而快,在招募這件事上,往往是錯的起點。
你的公司開始用 AI 篩履歷了嗎?你怎麼確保它不會用幾個樣本,就淘汰掉你的下一個千里馬?想不清楚的話,歡迎預約 30 分鐘免費線上諮詢,我們一起為你的招募流程設計稽核迴路。