DAY 270

錄音的終點應該是知識庫

SLIDES · 4
Day 270 錄音的終點應該是知識庫 — 投影片 1Day 270 錄音的終點應該是知識庫 — 投影片 2Day 270 錄音的終點應該是知識庫 — 投影片 3Day 270 錄音的終點應該是知識庫 — 投影片 4
1 / 4

今年開始我積極參加實體聚會、做陌生開發。很多時候重點跟需求都藏在對話裡,或是客戶突然打電話過來交代一些事情——這些當下都不方便拿筆記下來。

我的想法很簡單:只要有錄音,剩下的事情 AI 就能完成 90%。

但市面上的錄音設備跟軟體,主打的都停在會議記錄、摘要、心智圖,我還沒看到有人做到最後一步。我覺得終點應該是企業的知識庫才對。

這篇分享:我現在怎麼處理錄音、為什麼買了 HiDock P1 還是不滿意,以及我心中理想的流程長什麼樣子。

現在的流程:錄完音,還要記得搬

不管是用筆電還是手機錄音,錄完之後我都得記得做這幾件事:

  1. 把錄音檔搬到筆電(用手機錄的話)
  2. 跑本機的 Whisper(OpenAI 開源的語音辨識模型)轉成文字
  3. 把逐字稿放進指定的專案資料夾
  4. 再餵給 agent 去整理、做事

每一步都不難,但每一步都要我「記得」。忘了搬,那段對話就躺在手機裡;搬了沒轉,就只是一個音檔。

Day 269 我測了六個本機語音辨識模型,就是因為這條流程裡,轉文字這一步我每天都在用。

買了 HiDock P1,因為它能接 AirPods

我最近買了 HiDock P1。選它的原因是藍牙耳機可以透過它來錄音,所以我可以沿用平常習慣的 AirPods,講電話、開會都能錄到雙方的聲音。

但整個體驗其實還是有落差:

  • 錄完之後,我要主動把錄音從設備轉移到筆電的網頁上,再點一下轉逐字稿
  • 它的逐字稿,有時候甚至不如我本機跑的模型
  • 整個流程一點都不聰明,每一步都還是要人去推

說穿了,它幫我解決的是「錄」這一步,後面的「搬、轉、整理、歸檔」還是我自己來。

我想像的流程長這樣

  1. 錄完音,檔案自動傳到筆電
  2. 傳到的那一刻,agent 自動偵測到新檔案,開始轉文字
  3. 轉完直接整理成方便閱讀的格式,例如一頁 HTML
  4. 10 分鐘後,我可以把剛剛的會議內容分享給客戶,請對方確認規格
  5. 同一份內容同步匯入我的知識庫

從錄音按下停止到拿到可以給客戶確認的稿子,中間我一個按鈕都不用按。

理想的工具要做到這五件事

  • 不改變使用習慣,隨時收音:這點最難,因為手機上的錄音支援還不齊全
  • 自動轉逐字稿
  • 自動整理成好讀的格式:例如 HTML,可以直接傳給客戶看
  • 資訊不外洩:最好不透過雲端,整條流程留在本機(目前主流的錄音筆,包括 HiDock,轉逐字稿都還是走雲端)
  • 續航力要夠:跑一整天的聚會跟電話不能沒電

卡住的是跟 agent 的結合

錄音、轉文字、摘要,每一段都已經有工具了。缺的是把它們接起來的那一段:錄音檔一出現就自動觸發轉錄、轉完自動交給 agent、agent 再依照我的 skill 整理成我要的格式,最後放進知識庫。

我想問的是:目前的服務是不是都很難跟 skill 之類的串起來?還是其實已經有人做好了,只是我還沒找到?

如果有一個工具能從錄音一路自動走到知識庫,你會想用嗎?


Day 269 本地語音轉文字模型比較:https://www.dawsonwang.com/day/269 HiDock P1:https://www.hidock.com/products/hidock-p1-ai-voice-recorder

延伸閱讀
看完整 269 篇 →