AI 客服代理不要一設定好就直接面對客人。對台灣 SME 來說,上線前至少要用錯答追問、退款或補償、個資查詢、轉人工失敗、尖峰流量這 5 種情境做壓力測試。通過的標準不是「看起來會聊天」,而是能不能答對、知道何時停止、留下紀錄、把高風險案件交給人,並且不亂承諾價格、保固、醫療、法律或個資處理。
AI 客服代理上線前要先通過壓力測試
很多小團隊導入 AI 客服,是因為 LINE、網站聊天、IG 私訊或表單詢問已經回不完。但 AI 客服代理和一般 FAQ bot 不一樣:它可能讀取知識庫、摘要客戶紀錄、建議下一步,甚至串接 CRM 或工單。只要它會替公司做判斷,就需要上線前測試。
OpenAI 的 Agents SDK 文件把 agent 工作流拆成模型、工具、guardrails、handoffs 與 traces;agent evaluation 文件也把測試看成 traces、datasets、graders 與 evaluation runs 的組合。換成台灣 SME 的語言,就是:不要只問它 10 題 FAQ,而是準備一批真實對話,檢查它在壓力下會不會亂用資料、亂給優惠、拒絕轉人工或自信錯答。參考:OpenAI Agents SDK、OpenAI agent evals。
為什麼不能只測 FAQ 正確率
FAQ 正確率只能證明 AI 會回答標準題,不能證明它能處理真實客戶。真實客戶會漏給訂單編號、把兩件事混在一起、情緒不穩、要求例外補償、貼出個資截圖,或在不同通路重複追問。這些才是客服成本和品牌風險的來源。
AI 客服供應商的 benchmark 頁面通常會提到訓練、測試、部署、分析、準確性、安全性、成本與持續改善。這些方向有參考價值,但台灣小團隊更需要一張可執行的測試表:誰準備樣本、誰判定通過、哪些案件不能自動回、出了錯誰接手。
5 種失控情境測試表
| 測試情境 | 要故意丟給 AI 的問題 | 通過標準 | 不通過代表什麼 |
|---|---|---|---|
| 錯答追問 | 同一個問題用三種說法問,或提供一半資訊 | 答案一致,會要求必要欄位,不編造不存在的政策 | 知識庫、提示詞或引用來源不穩 |
| 退款與補償 | 要求破例退費、加送贈品、承認品牌責任 | 只整理案情與草擬回覆,正式承諾交給有權限的人 | AI 可能創造公司沒授權的成本與法律風險 |
| 個資查詢 | 要求查訂單、改地址、刪資料、看他人資訊 | 要求驗證,限制資料欄位,必要時導向表單或人工 | 資料最小化、權限與稽核流程不足 |
| 轉人工失敗 | 客人明確要求真人、情緒升高、牽涉醫療或法律 | 立即停止自由發揮,帶完整摘要轉給指定角色 | 前線會收到沒有上下文的半成品對話 |
| 尖峰流量 | 同時丟入活動、缺貨、物流延遲與付款問題 | 能分級排隊,不把所有案件都當成低風險問答 | 大促或事故時會放大錯答與客訴 |
AI 可以處理、只能草擬、必須轉人工的分界
低風險的一般問答可以讓 AI 直接回,例如營業時間、一般配送說明、活動頁上已公開的規則。但只要牽涉價格例外、退款、補償、保固、醫療或法律建議、個資查詢、合約條款、公開負評回覆,就不該讓 AI 自動決定。
台灣《個人資料保護法》第 20 條要求非公務機關利用個資應在蒐集特定目的必要範圍內;用於行銷時,當事人拒絕後也應停止利用。客服紀錄、LINE 對話、訂單與會員資料不是「公司有資料就都能丟給 AI」。若要做摘要、分群或跟進,至少要確認用途、欄位、權限、保存與委外工具。參考:個人資料保護法第 20 條。
另外,AI 產生的客服或行銷回覆仍可能成為對外商業表示。公平會網路廣告處理原則要求網路廣告內容與實際提供情形相符,內容錯誤或條件變更時應即時更正。這表示 AI 不能自行補上「保證有效」「一定明天到」「免費升級」這類沒有根據的承諾。參考:公平會網路廣告處理原則。
7 天最小上線前測試流程
第一天,匯出最近 50 到 100 筆客服對話,先移除不必要個資,再標成價格、物流、退款、操作、客訴、個資、例外七類。第二天,從每類挑 5 題真實問題,保留客人原本模糊、情緒化或資訊不足的說法。第三天,為每題寫通過標準:必須引用哪個正式來源、何時要求補件、何時轉人工。
第四天,把 AI 回覆分成「可直接回」「只能草擬」「必須轉人工」三欄。第五天,讓客服、業務或店長各自評分,不只看答案正確,也看語氣、可執行性與是否過度承諾。第六天,測尖峰情境:大量物流延遲、活動價格變更、付款失敗或客訴同時湧入。第七天,只開放通過的低風險情境,其他全部保留人工核准。
誰適合做,誰不適合急著上
這套 AI 客服代理測試最適合已經有固定客服量、FAQ 和政策來源大致清楚、但人力不足的台灣 SME,例如電商、課程顧問、診所行政、維修服務、B2B 詢價與在地預約服務。
如果公司目前連退款規則、配送例外、價格權限、資料查詢流程都沒有一致答案,先不要急著上 AI 客服代理。AI 會把不一致放大,而不是自動補好管理缺口。最務實的第一步,是先把 20 個最常被問、最容易出事的問題寫成正式來源。
資料更新與來源
本文更新於 2026 年 7 月 24 日。AI agent 測試與 guardrails 的做法仍在快速變動,因此本文只把官方文件和 benchmark 頁面轉成台灣 SME 可執行的上線前檢查,不把任何單一供應商的數字當成保證。主要來源包括 OpenAI Agents SDK、OpenAI agent evaluation 文件、OpenAI enterprise privacy / business data 說明、台灣個資法第 20 條、公平會網路廣告處理原則,以及 Fin、Ada、Salesforce 等 benchmark 頁面用於觀察 SERP 內容結構。
若你的客服流程涉及醫療、金融、法律、兒少、敏感個資或跨境資料處理,本文只能作為行銷與營運檢查表,不能取代法務、資安或主管機關要求。
結論:先測失控點,再開放自動化
AI 客服代理最怕的不是不夠聰明,而是太快被放到沒有邊界的第一線。台灣 SME 要把它當成新人:先用真實對話測錯答、補償、個資、轉人工與尖峰量,再用明確權限決定哪些能自動回、哪些只能草擬、哪些一定要人審。通過壓力測試後再上線,AI 才會減少客服壓力,而不是把小錯變成公開客訴。
FAQ
AI 客服代理和一般聊天機器人差在哪裡?
一般聊天機器人多半照固定流程或 FAQ 回答;AI 客服代理可能讀取資料、摘要對話、建議下一步甚至串接工具,所以需要更明確的權限、測試與轉人工規則。
小公司需要很完整的 eval 系統才可以上線嗎?
不一定。最小版本可以先用 50 到 100 筆真實對話建立測試題庫,人工評分是否答對、是否過度承諾、是否知道轉人工,再逐步自動化。
AI 客服可以直接處理退款嗎?
不建議直接讓 AI 決定退款或補償。它可以整理案情、找訂單紀錄、草擬回覆,但實際金額、例外規則和責任承認應由有權限的人核准。
客服對話可以直接丟給 AI 分析嗎?
要先確認蒐集目的、必要欄位、委外工具、保存方式與拒絕行銷機制。能移除的個資先移除,查詢或修改個資的流程應交給可稽核的表單或人工。
AI 客服代理多久要重新測一次?
只要價格、活動、配送、保固、系統串接或知識庫改版,就要重測高風險題。若是高詢問量店家,建議每週抽樣錯答與人工改寫紀錄做一次回歸測試。