電話裡的 AI 要笨一點







最近在看 AI 語音電話系統——會自己打電話出去、跟人講話、把該問的問完的那種。
看完一套實際上線在做生意的系統之後,我的第一個心得是:整套東西最花力氣的地方,是讓這個 AI 少做一點——講短一點、想少一點、能回答的範圍窄一點。
這篇分享:延遲為什麼直接等於錢、為什麼這種場景要挑輕量模型、提示詞真正要寫的是什麼,還有兩件大部分人沒想到的事——法規那一關,跟配音要找誰。
(基於保密,公司名稱、產業、報價都不寫。)
延遲不是體驗問題,是帳單問題
第一個技術重點是延遲。
算起來很單純:假設 AI 每次回話前頓 1 秒,你講一句、它回一句,一個來回就多等 1 秒。一通電話問十個問題,光是「等它反應」就吃掉 10 秒。
電話是照秒數計費的,每一秒都在燒錢。所以那 10 秒不是「有點卡」,是成本。
這跟我平常用 AI 的直覺很不一樣。我在電腦前等 AI 想三秒,最多就是覺得它慢;電話裡等三秒,對方已經在想這是不是詐騙電話了。
所以模型要挑輕量的
接的是哪個等級的模型?不會用到最新最強的那種。
理由有兩個。一個是延遲——會思考的模型就是慢,而這個場景要的是快。另一個是成本,最新的推理模型光是講話就貴得不合理。
這種場景要的是「快速而且準確執行我給的任務」,不是「想很多」。
這跟 Day 252 那篇論文講的是同一件事,只是從另一個角度切進來:那篇是強模型站在「負責規劃、派工」那一格會自作主張、不肯把工作交出去,這裡是強模型站在電話那一格會想太久、又太貴。兩邊的結論一樣——先看那一格要什麼,再決定放誰。
把範圍縮小才是真正的工作
他們給 AI 的那份固定指令——系統提示詞——力氣幾乎都花在寫「不准回答什麼」。
舉的例子是:使用者問「今天天氣好不好」,如果沒設限制,AI 就真的跟你聊起天氣,話題就發散了。而發散的每一秒都在計費。
所以實際設定裡有一整排護欄:對方多久沒出聲就主動問一句、聽到哪些關鍵字就結束通話、單通電話最長講多久、時間到自動掛斷。
連對話節奏都要寫死。像是「一次只問一個問題」——這行不寫,AI 會一口氣把三個問題丟出去,電話那頭的人根本來不及回。
聽起來很不 AI,但這就是把模型放進生意裡要做的事。真正決定一套系統好不好用的,是提示詞裡這些看起來很無聊的細節。
大部分人沒想到的兩件事
第一件是法規。
要讓 AI 打電話出去,不是寫個程式接上去就好。你得先跟電信業者申請 SIP trunk(讓公司的電話系統透過網路打進一般市話和手機的那條線路),而這件事 NCC 管得很嚴——因為怕有人拿這條線去打詐騙電話。
嚴到什麼程度:我看到的案子裡,要用這個服務的公司都要做實名審查(KYC),而且是真的有人跑到你公司去拍照,電信業者再回報給 NCC,確認確實有這間公司、確實在做這項業務。
我原本以為打電話的難點在語音,結果最硬的一關是行政流程。
還有一個我沒想過的細節:不同電信業者的通話頻寬不一樣,語音辨識的準確度會跟著變。所以接好線之後的第一件事,是先測這條線的音質,測完再開始撥。
第二件是配音。
平台內建的音色,客戶幾乎都不滿意,最後多半是自己去找專業配音員錄一段,把那個音色的使用權一次買斷。
比較有意思的是選角的邏輯。原本給某個外撥的案子配了「陽光甜美的年輕女生」那種聲音,客戶聽完自己去找人重錄——錄成一個阿桑的聲音。
理由是接電話的人多半六十幾歲,阿桑的聲音讓對方比較不會馬上掛掉。
這一格的最佳解,跟「聲音好不好聽」沒關係,跟「誰會接這通電話」有關係。
一句話總結
整套聽下來,難的地方沒有一個在模型上。
延遲、提示詞的護欄、NCC 的實名審查、選哪一種聲音——這四件事,都不是把模型換強一點就能解決的。
模型現在是最好解決的那一格。
如果你也在看這件事
會整理這篇,是因為這套東西的門檻不在技術,在上面這些細節——延遲怎麼壓、護欄怎麼寫、SIP trunk 怎麼申請、聲音要選誰。這些不會寫在官網上,得有人實際跑過一輪才講得出來。
如果你的公司正在評估 AI 語音電話(客服、預約提醒、名單確認、滿意度調查這類),或只是好奇這東西實際跑起來長什麼樣,歡迎私訊我聊聊。想約個時間了解也可以。
- Day 252 太強的模型不該做規劃