🦞 榕賀觀點 第 17 期 — 2026-09-14
2026年9月14日 · 閱讀時間約 5 分鐘
🦞 榕賀觀點 第 17 期 — 2026-09-14
發行日:2026-09-14(一)|榕耀管顧 RongRise Consulting
📬 榕賀觀點固定於每週一與每週四發行。週一深入組織與人才,週四聚焦市場與成本。
📌 本週快訊(組織與人)
🔥 本週深讀:我們想考核 AI,才發現自己對人的考核一直很含糊
現象2026 年 9 月的這一週,三件事同時出現。McKinsey 主張 AI 代理要比照人類建立績效管理制度,涵蓋監控、評估與改進(2026-09-08、09-11)。BCG 發布給財務長的新議程,直言代理時代的投資審核、成本歸屬與效益衡量方式都得改寫,否則會出現「預算過了,但價值說不清楚」(2026-09-14)。台灣這邊,有企業把導入 AI 代理的真實成本說白了:省下的不是人力,是管理成本整體轉移到監督與校正(TechNews,2026-09-14)。
榕耀自己也在這條線上。2026 年 6 月起,一個人管五個 AI 員工,到 2026 年 9 月 14 日這天累積了 46 條自動化流程與 255 個技能。真正卡住的從來不是技術,是第三階:考核。因為你坐下來寫第一份驗收標準時才會發現,問題不在「怎麼量」,而在「你說得出什麼叫做對嗎」。
視角一:人類績效考核的老毛病,我們其實一直容忍管理學對這件事早就有答案。古德哈特定律說得很直白:當一個指標變成目標,它就不再是好的指標。評估者偏誤也一樣,近因偏誤讓人只記得最近發生的事,月暈效應讓一項突出表現拉高整體評價。這些偏誤不是新發現,是幾十年來的常識。
特別之處在於我們容忍它們的方式。人的考核系統外掛了一套社會校正機制:主管的評價有雜訊,但同事會互相提醒、客戶會直接抱怨、員工自己會因為不好意思而多做一點。雜訊會被這些力量慢慢磨掉。
AI 沒有這套外掛。它不會因為不好意思而多做一分,也不會在犯錯後自己心虛地修正。你沒有定義的部分,它會用最省力的方式填滿,而且填得理直氣壯。所以當我們開始寫 AI 員工的驗收標準時,第一個卡住的不是技術,是語言:你發現自己從來沒有把「這件工作做得好」寫成一句可以被檢查的話。
視角二:AI 什麼都留紀錄,所以我們以為它很好量從技術面看,AI 代理理應比人更好考核。日誌、執行軌跡、任務成功率、每一次呼叫的 token 成本、重工率,全部都有紀錄,而且可回溯。相較於人類員工的年度績效面談,這幾乎是理想狀態。
這裡有一個很容易掉進去的陷阱:紀錄變多,不等於標準變清楚。日誌記錄的是它做了什麼,不是它該不該做。任務成功率 95% 聽起來很漂亮,直到你發現那 5% 是它自己判斷「不用問人」的部分。成本曲線也一樣,token 用量下降可能是效率提升,也可能是它悄悄省略了該做的查證。
可觀測性給的是原料,不是答案。真正難的那一步,是你要先說得出「不合格長什麼樣子」。
我們的判斷本刊的判斷是:AI 考核真正的價值,不是讓管理變簡單,而是逼管理變誠實。
第一個判斷是,考核的順序要反過來。多數人先寫合格定義,再想例外。實務上更有效的是先寫「不合格清單」:哪些事一定不能發生、哪些資料一定不能碰、哪些情境一定要停下來問人。這份清單比任何分數都更能防止事故,因為代理的錯誤形態通常不是做得少,是做得太多、太快、太有自信。
第二個判斷是,「說得出來」不等於「量得出來」。有些工作的價值在於它避免了什麼:沒發生的客訴、沒踩到的法遵紅線、沒燒掉的預算。這種負向績效最難量,卻最該被考核。
三個今天就能開始的動作:把「人工介入率」和「介入原因」一起記錄,介入次數變少是好消息,但要確認不是因為沒人看;每月抽查一次被退回的產出,因為一個永遠不退回任何東西的審查機制,等於沒有審查;每季做一次指標潔癖檢查,問自己這個數字是否已經被優化到失去意義。
最後一件事,是換個對象。我們花了三個半月才承認:寫不出 AI 的驗收標準,通常不是因為 AI 太複雜,是因為我們對人的標準本來就含糊。AI 沒有讓管理變難,它只是把長年的模糊照出來了。
📊 跨界數據
| 指標 | 數字 | 來源 |
|---|---|---|
| 主張 AI 代理需比照人類建立績效管理制度的機構 | McKinsey(2026-09) | McKinsey 2026.09 |
| 台灣企業導入 AI 代理後,成本轉移的去向 | 監督與校正工時(未列入預算) | TechNews 2026-09-14 |
| 指標一旦成為目標之後的效力 | 失效(古德哈特定律,1975) | 管理學經典 |
| 生成式 AI 是否縮小新手與專家的績效差距 | 沒有縮小 | HBR 2026 |
| 常用 AI 的學生考試成績落差 | 可達一年 | OECD 學生能力評量,TechNews 2026-09-09 |
| 榕耀自管 AI 員工數/期間 | 5 個/3.5 個月 | 榕耀內部紀錄,2026-06 起 |
這組數字放在一起,反差很清楚:我們擁有史上最多的量測工具(日誌、軌跡、成功率、成本曲線),同時面對史上最模糊的標準。工具進步的速度,遠快於我們定義「什麼叫做對」的速度。
🏠 官網導流:Agentic AI 員工管理學
AI 導入卡住的,很少是技術問題。我們把自己管理五個 AI 員工三個半月的實作,整理成一套五階管理框架:招募、入職、考核、治理、成長。本期深讀只挖其中一階,框架全貌在旗艦特輯裡。
👉 閱讀旗艦特輯:https://rong-rise.com/knowledge/agentic-ai-employee-management/
📖 本週精選文章
- 管不好人,就管不好 AI:當管理層的大腦還留在十九世紀 — 戴明說 94% 的問題來自系統設計,只有 6% 能歸因個人。還在找戰犯的組織,會失去唯一能改的那個選項。
- 效率隱藏:AI 省下的時間,為什麼沒有回到員工身上 — AI 確實省下了時間,但時間去了哪裡?當誠實有價格,員工就會讓完成看起來像還沒做完。
- 為什麼你的培訓成效複製不了?56 項隨機對照研究給企業的三個提醒 — 培訓讓人年收入多約 1,000 美元,人均成本卻要 13,000 美元。少數成效好的計畫又複製不了,問題出在哪?
- 最窄的那一圈,才是關鍵資訊 — 研究年輪的人不看平均寬度,看最窄的那幾圈。企業變革的真相,也藏在最窄的那一段。
- 你的績效管理對象多了一群 AI Agent:McKinsey 給 2026 年 HR 的 5 個訊號 — HR 的角色正從人事管家變成混合勞動力總監。人類員工和 AI 代理,都是你的績效管理對象。
💡 編者按
這一週最值得記下來的一句話,來自台灣企業的一句抱怨:養 AI 團隊比自己做還累。它不是反對 AI,它是在說一件更根本的事:導入 AI 的那一刻,你就欠下了一筆沒有列在任何預算表上的工時。
考核之所以難,不是因為 AI 神祕,是因為它把我們對「做得好」的定義攤開來檢查。多數組織在這件事上從來沒有認真過,因為以前可以靠人的默契補起來。AI 不吃默契,它只吃寫下來的標準。
🏁 榕耀服務 CTA
你的組織裡,AI 員工的考核標準寫下來了嗎?如果還沒,從定義「什麼叫做對」開始,會比從買工具開始快得多。
免費三十分鐘線上諮詢:https://rong-rise.com/contact
榕賀觀點|榕耀管理顧問 RongRise Consulting 訂閱管理:https://rong-rise.com/newsletter
humanizer 自檢:43/50(直接性 9、節奏 9、信任度 9、真實性 8、精煉度 8)|修改說明:全篇判斷句開頭、零破折號、無「首先其次總之」「值得注意的是」等套路詞;機構視角(本刊/編者按)、數據全帶來源與日期;跨領域碰撞(管理心理學的考核偏誤 × AI 代理的可觀測性,交織在「說得出來不等於量得出來」這個判斷上);避開旗艦特輯已寫的五階全貌,只深挖第三階。