Muse Voice Transcribe 把三件事壓進同一個模型
Meta 在美國時間 9 月 1 日(香港時間 9 月 2 日)公布 Muse Voice Transcribe,是 Meta Superintelligence Labs 第一個即時音訊感知模型。過去要做即時字幕,慣常做法是串起三套系統:一套把聲音轉成文字,一套分辨哪一句由誰說出(業界稱為 diarization,說話人分離),再有一套判斷對方是否已經講完(端點偵測)。每多一層就多一重延遲,前一層的錯誤也會原封不動傳到下一層。
Muse Voice Transcribe 把三件事收進同一個自迴歸多模態模型,屬於 Meta 的 Muse Spark 系列。它以 80 毫秒為一格處理音訊,即每秒 12.5 格,每格壓成一個軟性 token;模型讀完一格之後自行決定是繼續聽下去,還是即時吐出文字。說話人換人時模型自行插入分段標記並標示身分,全部在同一次推理內完成,不需要事後再跑一輪。延遲不是固定的:Meta 以強化學習同時獎勵準確度與速度,讓模型逐個字調整要等多久才落實。
關鍵數字
項目 | 數字 |
|---|---|
最終轉錄錯字率(AA-WER) | 3.1% |
講完到吐出最終文字 | 約 0.16 秒 |
說話人分離錯誤率(多個基準平均) | 17.5% |
音訊處理格長 | 80 毫秒,即每秒 12.5 格 |
訓練語言 | 70 種以上,25 種在推出時完成驗證 |
同時分辨說話人 | 20 把聲以上 |
Meta Model API 定價 | 每 1,000 音訊分鐘 3 美元 |
AA-WER 榜上 3.1% 與後面七家的距離
第三方評測機構 Artificial Analysis 的 AA-WER Streaming Index 量度串流語音模型在偵測到說話結束後,最終文字有多少字轉錯,數字越低越好。Muse Voice Transcribe 以 3.1% 排第一。
模型 | 最終轉錄錯字率 |
|---|---|
Muse Voice Transcribe | 3.1% |
Cartesia Ink-2 | 3.4% |
ElevenLabs Scribe v2 Realtime | 3.6% |
Qwen3 ASR Flash Realtime | 3.7% |
GPT Live Transcribe | 3.9% |
Grok Speech to Text Streaming | 3.9% |
Gemini 3.5 Transcribe Live | 4.0% |
AssemblyAI U3.5 Realtime Pro | 4.0% |

值得留意的是榜首到榜尾只差 0.9 個百分點,第一與第二之間更只差 0.3 個百分點。單看這一欄,八家的轉錄準確度已經擠在同一個區間,Muse Voice Transcribe 領先但不算拋離。真正拉開距離的是另一項。
說話人分離才是差距所在
同一批評測中,Muse Voice Transcribe 的說話人分離錯誤率平均為 17.5%,其餘系統落在 21.1% 至 28.6% 之間。換算下來,它比最接近的對手少錯約 17%,比最差的一家少錯近四成,這個差距遠大於轉錄那 0.3 個百分點。
分辨誰在說話,正是會議記錄、訪問謄本、客服錄音這類實際用途的瓶頸。字認得對但歸錯人,整份謄本一樣要人手重看。Meta 稱模型可以原生處理超過一小時、20 把聲以上的長錄音,而且支援句內與句間的語言切換,即同一句話中英夾雜也不會斷。
每 1,000 分鐘 3 美元 Mac 按住 Fn 就能口述
開發者經 Meta Model API 使用,定價為每 1,000 音訊分鐘 3 美元,折合每小時約 0.18 美元。這是一條把即時轉錄當成基礎設施來賣的定價,而不是當成旗艦模型來賣。
同一個模型亦已經在 Meta AI for Mac 與 Muse Code 上運行。Mac 用戶按住 Fn 鍵,就可以向任何一個應用程式口述文字:因為 Meta AI 的 Mac 版能夠替其他軟件提供語音輸入,Muse Voice Transcribe 實際上成為這些軟件的聽寫引擎。對一間主要收入來自廣告的公司來說,把語音入口鋪到桌面每一個應用程式裏,本身就是回報。




No comments yet
提交留言即表示你已閱讀我們的私隱政策。