# 我一個人管五個 AI 員工:導入 AI 的瓶頸不是技術,是管理
三個半月的實驗:讓 AI 當員工,而不是當工具
三個半月前,我把自己的公司拿來當實驗場。
內容產製、官網部署、電子報、影片、知識庫——全部交給 AI 和 AI Agent 來跑。不是「用 AI 輔助工作」,是「讓 AI 當員工」。
現在的樣子是這樣:46 條自動化流程每天自己啟動,255 個技能構成 AI 員工的能力庫,410 篇結構化筆記組成的第二大腦持續餵養上下文,5 個各司其職的 AI 員工,累積產出 22 篇文章、16 期電子報、26 個影片專案,官網在這段期間部署了 252 次。
而我,從頭到尾只有一個人。
這篇文章不談我用哪個模型、不比較哪個工具比較強。我要談的是這三個半月裡真正決定成敗的那件事:管理。
導入 AI 會卡住,通常不是技術問題
先講一個很常見的畫面。
企業導入 AI 的順序通常是這樣:看到一個很酷的工具,買了;找幾個有興趣的同事試用;效果不錯,擴大授權;過一陣子發現品質不穩、錯誤重複發生、沒人知道該找誰負責。
最後的結論往往是:「AI 還是不夠可靠。」
但把同一套標準套在人類員工身上,就會發現問題不在 AI:
- •你會不寫職缺就找人進公司嗎?
- •你會不給新人訓練,直接要他產出嗎?
- •你會不定義「什麼叫做做好」,就說他表現不好嗎?
- •你會把公司機密無限制交出去,卻沒有任何核准機制嗎?
- •你會在他犯錯之後不記錄、不檢討,然後等他再犯一次嗎?
這些問題,人力資源管理已經回答了一百年。
AI 時代真正的新問題不是「AI 能做什麼」,而是「你打算怎麼管理它」。
所以這三個半月,我沒有把 AI 當工具採購,而是當員工管理。以下是我實際跑出來的五個階段。
Agentic AI 員工管理學:五階生命週期
我把這套方法叫做「Agentic AI 員工管理學」。它由五個階段組成,順序不能換:招募 → 入職 → 考核 → 治理 → 成長。
先給一張速查表,後面再逐階展開。
| 階段 | 一句話 | 我這邊的實際數字 |
|---|---|---|
| 招募 | 先寫職能,再選工具 | 5 個 AI 員工 |
| 入職 | 技能+記憶+上下文 | 255 個技能 / 410 篇筆記 |
| 考核 | 先定義什麼叫做對 | 品質門檻 40 分(滿分 50) |
| 治理 | 分級授權,不是全面自動化 | 對外發布一律人工核准 |
| 成長 | 讓錯誤變成組織記憶 | 16 條事故紀錄 |
第一階:招募——先寫職能,再選工具
招募的意思是:在導入任何工具之前,先決定你要幾種 AI 員工、各自負責什麼。
我目前有 5 個常駐的 AI 員工,每一位有明確職能:一位負責網站開發與部署,一位負責內容產製,一位負責系統健康檢查與備份驗證,一位負責品質審查,一位負責知識掃描與研究。
他們的職能不重疊,就像你不會讓同一個人同時當工程師、編輯、稽核員。
這裡最常見的錯誤,是把五種職能全塞給同一個通用助理。 然後你得到一個什麼都懂一點、什麼都不專精,而且出錯時無法歸因的「萬能工具」。
為什麼要拆成五個而不是一個?理由很現實:當一件事出錯,你需要知道是哪個環節出的錯。 如果所有事都由同一個助理做,你只知道「結果不對」,但不知道是資料找錯、判斷失準,還是流程接錯。拆開之後,問題會自己定位。
還有一個好處:每個職能可以有自己的標準。負責品質審查的那一位,標準是「找出問題」;負責內容產製的那一位,標準是「通過門檻」。這兩種標準不可能同時放在一個角色身上。
第二階:入職——技能、記憶、上下文
一個 AI 員工要能真的做事,需要三樣東西:
技能,是「他會做什麼」。我這邊是 255 個技能,每一項都是可重複執行的標準作業程序,不是一次性的指令。這中間的差別很大:一次性指令做完就沒了,技能可以重複呼叫、可以改版、可以累積。
記憶,是「他做過什麼」。第二大腦目前有 410 篇筆記,橫跨 19 個領域。它不是資料堆積,是結構化的知識載體——同樣一件事,筆記裡找得到當初為什麼這樣決定。
上下文,是「他現在該知道什麼」。我的電子報產製流程啟動前,系統會自動把第二大腦裡最新相關的素材餵進工作流程。它不需要「記得」,它需要在對的時間拿到對的資料。
多數企業導入 AI 卡住的地方就在這一階:不是模型不夠聰明,是公司自己的知識沒有結構。 你沒有把知識變成 AI 讀得懂的形式,它就只能每次從零開始猜。
這一階的工程量,遠比多數人預期的大。它不像安裝軟體,比較像把一間公司的記憶重新整理一次。
第三階:考核——先定義「什麼叫做對」
沒有驗收標準的 AI 產出,等於沒有產出。
我的做法很單純:守門檻。所有對外文案必須通過一項文字品質自檢,滿分 50 分、門檻 40 分,未達標不得發布。分數要留紀錄,不是憑感覺說「我覺得可以了」。
這個門檻實際攔下過什麼?最常見的是三種:句子太整齊(讀起來像型錄)、論點沒有具體支撐(只有形容詞沒有數字)、以及開頭太客套(花了兩段還沒講重點)。這些問題人眼看得出來,但很容易因為「已經寫完了」而放行。有了分數,放行變成一個需要交代的動作。
除此之外,每天有獨立的品質審查流程在跑,每月有資產月檢,定期盤點所有 AI 員工的狀態。
關鍵在於:把「我覺得怪怪的」變成可量測的門檻,然後把門檻寫進流程。 靠人記得,就一定會忘。
第四階:治理——分級授權,不是全面自動化
治理要回答的是:AI 可以自己決定什麼、什麼一定要人核准。
我做的是電子報審閱制:系統自動產出草稿,寄給我確認,核准之後才啟動寄送。核准之前,任何自動化流程都不會把內容送出去。
實際的授權分級大概是這樣:
| 風險層級 | 例子 | 授權方式 |
|---|---|---|
| 低 | 內部資料整理、掃描、監控 | 全自動,事後看紀錄 |
| 中 | 產出草稿、準備發布素材 | 自動產出,人工過目 |
| 高 | 對外發布、系統重建、對外寄送 | 一律先核准才執行 |
還有一項容易被忽略的:憑證的定期維運檢查。自動化最怕的不是做錯,是靜默停擺——某個金鑰過期了,流程還在跑,只是再也沒產出,而且沒人發現。
而且,自動化不是越多越好。
2026 年 9 月,我把累積的內容一次透過自動化排上社群平台,16 篇在 4 分鐘內全部發布完畢。結果不是效率提升,是觸及率暴跌——平台的演算法把短時間大量發布判定為異常行為,後續貼文的初始觸及幾乎歸零;讀者端也出現內容疲勞。我只好緊急回收,改成一天一篇的滴灌模式,並加上人工審核。
這件事讓我修正了一個直覺:
自動化的價值來自「穩定」,不是「快」。
能自動化的事,不代表應該用最大速度去做。當你把發布自動化,你同時也放大了「發布過量」這個風險。技術上完全成功的操作,可能在商業上完全失敗。
所以治理要多問一個問題:這件事的節奏,該由誰決定? 多數情況答案是「人」。系統負責執行與提醒,但「什麼時候推、一次推多少」這種牽涉市場反應的判斷,要留在人手裡。
重點不是追求全面自動化,而是分級授權。 判斷標準只有一個問題:這件事錯了,代價是什麼?代價高的,留人工關卡;代價低的,放手讓它跑。看起來慢,但它讓你能放心把其他九成自動化。
第五階:成長——讓錯誤變成組織記憶
AI 員工最大的風險,是重複犯一樣的錯。
我的做法是把每一次出包都寫下來:目前累積 16 條事故紀錄,每一條都記錄根因與修法,成為下一次同類問題的防護。
這些紀錄裡有幾種反覆出現的類型:以為已經生效但其實沒有(改了設定沒重啟)、以為已經備份但其實漏了(只比對檔案清單,沒比對內容)、以為已經寄出但其實被跳過(條件判斷讓流程靜默略過)。
發現了嗎?這三類錯誤的共同點,都不是 AI 不夠聰明,而是流程少了驗證的環節。事故紀錄最大的價值,就是它會逼你把「我以為」變成「我確認過」。
除此之外,每兩天有一次記憶整理(去重、整併、沉澱),每週有一次技能自動精煉。
事故不是要藏,是要入庫。 沒有事故庫的團隊,會把同一種錯犯第二次、第三次,最後得出「AI 不可靠」的結論。但真正的問題從來不是 AI,是沒有學習機制。
最容易被跳過的,是治理和成長
上面五階,前兩階(招募、入職)談的人最多,因為它們看得見、也最容易有成就感。
但真正決定這套系統能不能長期運作的,是後兩階:治理與成長。
原因很簡單。AI 產出速度很快,快到你可能一天就累積了幾十項未經檢查的產出。如果沒有治理,這些產出會變成新債;如果沒有成長機制,你會不斷重複同樣的錯誤,而且沒有人意識到。
速度越快的系統,越需要煞車和後照鏡。
三個我在過程中犯過的判斷錯誤
這段我想誠實一點,因為這三個誤區我幾乎都踩過。
誤區一:以為工具選對了,事情就成了一半。 實際上工具只佔很小一部分。我換過模型、換過服務,真正讓我卡住最久的從來不是工具,是流程沒設計好。
誤區二:以為自動化程度越高越好。 我曾經把一些該留人工關卡的環節也自動化,結果出了問題才發現沒有煞車。自動化不是美德,是槓桿——用錯地方會放大錯誤。
誤區三:以為寫下來就等於學會了。 有了事故紀錄不等於不會再犯。真正讓錯誤停下來的是「把檢查點寫進流程」,而不是「記得上次的教訓」。
這套方法不適合誰
不是所有情境都需要走完五階,我也不想把這套方法講成人人適用。
如果你只是個人使用、產出不需要對外負責,那第三階之後的治理機制對你可能過重。
如果你的組織裡 AI 只是輔助工具、最終決策與品質責任都還牢牢握在人的手上,那你需要的可能只有第一階(職能分工)和第二階(知識整理)。
五階真正開始產生槓桿的地方,是當 AI 的產出會直接對外、而且量大到你無法逐一檢查的時候。那時候治理和成長就不是選項,是必需品。
常見的三個問題
「一定要用 Hermes 或某個特定平台嗎?」
不用。這套方法談的是管理結構,不是特定工具。換一套系統,五階依然成立。
「一個人真的管得動五個 AI 員工嗎?」
管理得動的關鍵不是執行力,是設計。你把標準、授權、檢查點設計好,剩下的時間你是在看報表,不是在盯進度。這也是為什麼第三階到第五階那麼重要——它們是讓你不必盯著的機制。
「要花多久?」
以我的經驗,第一階一週內可以有雛形,第二階沒有終點(知識整理是持續的),第三階到第五階是慢慢疊上去的。不要想著一次到位,先從一件對外產出開始守門檻。
如果你也想開始,先做這三件事
不用一次到位。以我的經驗,這三件事的投報率最高:
一、先寫 AI 職能表,再選工具。 問自己缺哪一種職能,而不是問哪個工具最好用。工具會換,職能不會。
二、挑一件事,定義可量測的門檻。 不用全面,先挑一項對外產出,定義「什麼叫做可以發布」,然後守它。你會立刻感受到差別。
三、開一份事故紀錄。 從今天開始,每次出錯就寫下根因與修法。三個月後回頭看,這份文件會是你最有價值的資產。
結語
我認為 AI 導入在未來兩年會出現明顯的分化:同一批工具、同一批模型,有些公司會拉開差距,有些公司會停在「買了但沒在用」。
差距不會來自技術。技術是公開的、會持續變便宜的。
差距會來自管理——有沒有人認真定義職能、建立門檻、畫出授權界線、把錯誤變成記憶。
AI 不會自動讓公司變強。是管理,讓 AI 變成產能。
*榕耀管顧(RongRise Consulting)提出的「Agentic AI 員工管理學」,是我在自己的一人公司實作了三個半月後整理出的方法論。如果你想知道自己的組織在這五階的哪一階還缺一塊,我們正在開發一份診斷量表,也歡迎直接找我們聊聊。*