計費說明
概述
Vurbo.ai 採「點數制」計費:依實際使用的功能與時長扣點。點數可預先儲值,扣抵時依到期日先進先出(FIFO)。
- 即時錄音/廣播:按分鐘計費(未滿一分鐘進位一分鐘),每分鐘費率=所啟用功能的點數加總。
- 加值服務(摘要、重新翻譯):按文字量計費,依逐字稿字元數計算。
- 廣播:除主講者端的內容處理費外,另依翻譯語言數與觀眾規模計「雲端翻譯」費。
即時錄音的扣點時機(廣播除外)
- 每一分鐘開始時扣點:開始錄音時先扣第一分鐘,扣點完成後才會收到
session_started;之後每一分鐘開始時扣下一分鐘,結束錄音時不另外扣點 - 可用點數不足一分鐘時,該分鐘不扣點:開始錄音時收到
auth_quota_exceeded;錄音中則在下一分鐘開始前結束,並收到stt_quota_exceeded - 錄音中開關功能、增減聲道或翻譯語言,費率自下一分鐘起調整
- 每個分鐘邊界後有 1 秒寬限:錄 60.5 秒計 1 分鐘、錄 61.5 秒計 2 分鐘
- 暫停期間照常計費:暫停不會結束這場錄音;要停止計費,請結束錄音(
stop) - 斷線等待續接的期間不計費:續接成功後恢復按分鐘計費
- 音訊無法解碼的期間不計費:收到
audio_decode_failed之後、音訊恢復辨識之前的分鐘不扣點(已經開始的那一分鐘照常計費),恢復後照常按分鐘計費;因此這場錄音的計費分鐘數可能少於錄音時長 - 整場沒有收到可用音訊的錄音不計費:已扣的點數會自動退回
- 長時間沒有語音會自動結束:連續一段時間(預設 15 分鐘)沒有偵測到語音,錄音會自動結束,避免忘記停止而持續計費;暫停中不計入。見 長時間沒有語音時自動結束
本頁費率以「點數」為單位;點數與台幣的兌換見下方「點數定價」。
除點數制外,另提供以合約授權固定功能組合的「吃到飽方案」,見下方 吃到飽方案。
點數定價
| 項目 | 台幣(TWD) | 美元(USD) |
|---|---|---|
| 1 點 | 1.5 | ≈ 0.047 |
美元金額以參考匯率 USD 1 ≈ TWD 32 換算(TWD 1.5 ÷ 32 ≈ USD 0.047),僅供參考;實際依扣款當下的即期匯率換算為準。
基礎用量(即時錄音,點/分鐘)
即時錄音每分鐘費率=下列已啟用功能的點數加總。「基礎語音辨識」為必計項,其餘依實際啟用疊加。
| 功能 | 點/分鐘 | 說明 |
|---|---|---|
| 基礎語音辨識 | 1.0 | 必計項 |
| 多語言辨識 | 0.5 | 雙語/多語來源辨識 |
| 說話者辨識 | 0.5 | 語者分離 |
| 整句翻譯 | 0.2 | 與即時翻譯擇一 |
| 即時翻譯 | 0.5 | 與整句翻譯擇一 |
| 翻譯第 2 種語言起(整句翻譯,每 +1) | +0.2 | 每多一種翻譯語言 |
| 翻譯第 2 種語言起(即時翻譯,每 +1) | +0.4 | 每多一種翻譯語言 |
| 語音合成(TTS) | 1.0 | 即時語音回放 |
| 專業詞語庫 | 免費 | 術語庫/模糊詞校正/翻譯字典 |
專業詞語庫不另計費:術語庫、模糊詞校正、翻譯字典皆為免費功能,不影響每分鐘費率。
多語言辨識(來源語言)數量不另計費:同時指定多種轉錄語言(自動語言偵測)時,來源語言數量不影響費率。加乘只適用於「翻譯」輸出語言。
整句翻譯 vs 即時翻譯:兩者擇一計費(取費率較高者)。翻譯多種語言時,第 2 種語言起每多一種依上表加乘。
互譯模式
| 項目 | 點/分鐘 | 說明 |
|---|---|---|
| 即時互譯(conversation) | 1.5 | 整合費率,已含語音辨識+翻譯 |
| + 語音合成(TTS) | +1.0 | 啟用語音回放時加計 |
互譯整合費率不含語音合成。啟用 TTS 時每分鐘為 1.5 + 1.0 = 2.5 點;未啟用則為 1.5 點。 錄音過程中可隨時開關語音合成,費率自下一分鐘起隨之調整。
多聲道語者分離(點/分鐘)
一場錄音接多支實體麥克風時,可啟用多聲道語者分離(recognition_mode: "multi_channel"):語者身分由聲道決定,可選每路各自辨識(per_channel)或各路輪流發言、共用一條辨識(shared)。多聲道屬「說話者辨識(語者分離)」的一種,適用於即時錄音;操作方式見 WebSocket API 參考。
每分鐘費率(N = 該分鐘採計的聲道路數,上限 8):
| 項目 | 點/分鐘 | 說明 |
|---|---|---|
| 基礎語音辨識 | 1.0 | 必計項(第 1 路已含在內) |
| 說話者辨識 | 0.5 | 多聲道屬語者分離的一種,必計 |
| 多聲道路數加乘 | (N − 1) × 1.0 | 第 2 路起,每路每分鐘 1.0 點(shared 模式 N 固定為 1,不加收) |
即每分鐘 = 1.0 + 0.5 + (N − 1) × 1.0 點。
路數採計口徑
- 每一分鐘開始時扣點,N 採當下開著的路數。
add_channel於分鐘中途新增的聲道,自下一分鐘起納入採計;若在下一次扣點前就停用,或開始辨識後無法接收,下一次扣點會補計一次。同一分鐘內先後新增又停用多路時,依同時開著的最多路數補計。remove_channel停用一路後,下一分鐘起降價(當分鐘已在開始時扣點)。分鐘開始時已扣過點的聲道,停用後不會再計費。- 無法接收的聲道不採計:某一路的音訊在某一分鐘結算當下無法被接收(該路在該期間不會產生逐字稿),該分鐘不計入這一路;恢復後自下一分鐘起恢復採計。
- 第一分鐘於錄音開始時結算,當下尚未收到任何音訊,因此依開通的路數計算。
- 已開啟但未送出任何音訊的聲道照常採計——每一路即使無人說話,也建議持續傳送靜音音訊。
算例
- 3 路:1.0 + 0.5 + (3 − 1) × 1.0 = 3.5 點/分鐘
- 8 路、10 分鐘:1.0 + 0.5 + (8 − 1) × 1.0 = 8.5 點/分鐘;10 分鐘 = 85 點
shared模式(各路輪流發言、共用一條辨識):不論開幾路,1.0 + 0.5 = 1.5 點/分鐘;add_channel/remove_channel不影響費率
與其他計費軸的疊加
- 翻譯(整句/即時翻譯,含翻譯語言加乘)、會議摘要、重新翻譯等其他計費項照常依各自費率表計費,與多聲道路數加乘互不影響、直接疊加。
- 多聲道不支援語音合成(TTS)與廣播,無此兩項費用。
吃到飽方案的多聲道規則
- 多聲道需方案包含此功能:方案未包含時,
start收到plan_feature_not_allowed。 - 方案可設定同時辨識路數上限:超過上限時,
start/add_channel當場收到plan_feature_not_allowed(details.field為max_stt_streams),不會先放行再事後中斷。
音檔匯入(點/分鐘)
上傳音檔離線轉文字。批次處理採用較經濟的辨識服務,基礎費率低於即時錄音。
| 項目 | 點/分鐘 | 說明 |
|---|---|---|
| 匯入基礎語音辨識 | 0.3 | 批次處理專屬費率 |
| 匯入功能加乘 | 依基礎用量表 | 說話者辨識/整句翻譯(含翻譯語言加乘)依上表疊加 |
匯入的基礎語音辨識費率為 0.3 點/分鐘;其餘功能(說話者辨識、整句翻譯及其語言加乘)與即時錄音同表疊加。
加值服務(依文字量)
| 項目 | 費率 | 計費單位 |
|---|---|---|
| 會議摘要(首次生成) | 0.1 點 | 每 1,000 轉錄字元 |
| 重新生成摘要(換模板) | 0.1 點 | 每 1,000 轉錄字元 |
| Ad-hoc 摘要(自帶內容,v1.9.1 新增) | 0.1 點 | 每 1,000 內容字元 |
| 摘要翻譯(自帶內容,v1.17.0 新增) | 0.1 點 | 每 200 內容字元 |
| 重新翻譯(全文) | 0.1 點 | 每 200 字元 |
| 重新翻譯(單句) | 免費 | — |
「字元」的定義:逐字稿的實際字元數(UTF-8 字元)。中文、日文、韓文每字算 1 字元;英文每個字母算 1 字元。
進位規則:不足一個計費單位仍以一個單位計,且每次至少收 0.1 點。 例:12,000 字元的摘要 = 1.2 點;12,050 字元 = 1.3 點。
摘要以「送入模型的逐字稿字元數」計費,不是產出的摘要長度。
單句重新翻譯不計費:僅「全文重新翻譯」按文字量計費。
可用點數不足時不產生摘要:即時錄音因可用點數不足而結束,或結束時可用點數不足以支付摘要費用時,不會產生摘要,並收到
summary_error(summary_insufficient_credit);逐字稿與錄音照常保存。
廣播計費
廣播計費分為兩條獨立計費線,每分鐘總費率=兩者相加:
- 主講者端(內容處理):依上方「基礎用量」表計費(語音辨識、翻譯、語音合成、說話者辨識等),不受觀眾多寡影響。翻譯一律以即時翻譯計費,不受
start的realtime_translation設定影響。 - 雲端翻譯(內容派送):依翻譯語言數與最大觀眾人數兩項各自查表後相加。
- 計費從開播那一刻起算:預備階段(standby)不計費;由預備階段轉為直播時,第一分鐘從開播起算。
廣播不另計「翻譯第 2 種語言起」加乘:廣播的多語言費用已完整包含在下方「翻譯語言數」項目中,主講者端不再重複計算語言加乘。
雲端翻譯費(點/分鐘)
每分鐘雲端翻譯費 = 翻譯語言數費率 + 最大觀眾人數費率。
依翻譯語言數
| 翻譯語言數 | 點/分鐘 |
|---|---|
| 未啟用翻譯 | 0 |
| 1 種 | 2 |
| 2 種 | 6 |
| 3–4 種 | 14 |
| 5–8 種 | 30 |
| 9–12 種 | 62 |
依最大觀眾人數
| 最大觀眾人數 | 點/分鐘 |
|---|---|
| ≤ 50 | 1 |
| ≤ 100 | 3 |
| ≤ 500 | 6 |
| ≤ 1,000 | 12 |
| ≤ 2,000 | 18 |
| ≤ 5,000 | 38 |
| ≤ 10,000 | 70 |
| ≤ 20,000 | 137 |
| ≤ 30,000 | 203 |
觀眾人數以廣播建立時設定的最大觀眾人數計(固定整場,非即時在線人數)。 帳號預設可設定的最大觀眾人數為 5,000 人;需要更高上限請洽業務開通。
計費範例
各範例的 TWD/USD 為參考換算(1 點 = TWD 1.5 ≈ USD 0.047),美元依當下即期匯率計算、僅供參考。 摘要費用依逐字稿字元數計算,各範例已標示假設的字元數。
範例 1 — 即時錄音(transcribe):純逐字稿、無翻譯,60 分鐘(逐字稿約 12,000 字元)
- 錄音=基礎語音辨識 1.0 → 1.0 點/分;60 分鐘 = 60 點
- 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
- 合計 = 60 + 1.2 = 61.2 點(≈ TWD 91.8/USD 2.87)
範例 2 — 即時錄音(transcribe):整句翻譯 1 種語言,120 分鐘(逐字稿約 25,000 字元)
- 錄音=基礎語音辨識 1.0 + 整句翻譯 0.2 → 1.2 點/分;120 分鐘 = 144 點
- 會議摘要=25,000 ÷ 1,000 × 0.1 = 2.5 點
- 合計 = 144 + 2.5 = 146.5 點(≈ TWD 219.8/USD 6.87)
範例 3 — 即時錄音(transcribe):整句翻譯 6 種語言,30 分鐘(逐字稿約 6,000 字元)
- 錄音=基礎語音辨識 1.0 + 整句翻譯(0.2 + 第 2 種起 0.2×5 = 1.0)→ 2.2 點/分;30 分鐘 = 66 點
- 會議摘要=6,000 ÷ 1,000 × 0.1 = 0.6 點
- 合計 = 66 + 0.6 = 66.6 點(≈ TWD 99.9/USD 3.12)
範例 4 — 互譯(conversation):啟用語音合成,10 分鐘(逐字稿約 2,000 字元)
- 互譯=整合費率 1.5 + 語音合成 1.0 → 2.5 點/分;10 分鐘 = 25 點
- 會議摘要=2,000 ÷ 1,000 × 0.1 = 0.2 點
- 合計 = 25 + 0.2 = 25.2 點(≈ TWD 37.8/USD 1.18)
- 若未啟用語音合成:1.5 點/分 → 15 + 0.2 = 15.2 點
範例 5 — 音檔匯入(import):整句翻譯 1 種語言,30 分鐘(逐字稿約 6,000 字元)
- 匯入=基礎語音辨識 0.3 + 整句翻譯 0.2 → 0.5 點/分;30 分鐘 = 15 點
- 會議摘要=6,000 ÷ 1,000 × 0.1 = 0.6 點
- 合計 = 15 + 0.6 = 15.6 點(≈ TWD 23.4/USD 0.73)
範例 6 — 廣播(broadcast):即時翻譯 3 種語言、最大 500 觀眾,180 分鐘(逐字稿約 38,000 字元)
- 主講者端=語音辨識 1.0 + 即時翻譯 0.5 → 1.5 點/分(廣播不另計語言加乘)
- 雲端翻譯=語言數 3 種(3–4 帶)14 + 觀眾 ≤ 500 級距 6 = 20 點/分
- 每分鐘 = 1.5 + 20 = 21.5 點/分;180 分鐘 = 3,870 點
- 會議摘要=38,000 ÷ 1,000 × 0.1 = 3.8 點
- 合計 = 3,870 + 3.8 = 3,873.8 點(≈ TWD 5,810.7/USD 181.58)
範例 7 — 即時錄音(transcribe)+說話者辨識,60 分鐘(逐字稿約 12,000 字元)
- 錄音=基礎語音辨識 1.0 + 說話者辨識 0.5 → 1.5 點/分;60 分鐘 = 90 點
- 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
- 合計 = 90 + 1.2 = 91.2 點(≈ TWD 136.8/USD 4.28)
範例 8 — 音檔匯入(import):純逐字稿、無翻譯,45 分鐘(逐字稿約 9,000 字元)
- 匯入=基礎語音辨識 0.3 → 0.3 點/分;45 分鐘 = 13.5 點
- 會議摘要=9,000 ÷ 1,000 × 0.1 = 0.9 點
- 合計 = 13.5 + 0.9 = 14.4 點(≈ TWD 21.6/USD 0.68)
範例 9 — 廣播(broadcast):即時翻譯 5 種語言、最大 1,000 觀眾,60 分鐘(逐字稿約 12,000 字元)
- 主講者端=語音辨識 1.0 + 即時翻譯 0.5 → 1.5 點/分(廣播不另計語言加乘)
- 雲端翻譯=語言數 5 種(5–8 帶)30 + 觀眾 ≤ 1,000 級距 12 = 42 點/分
- 每分鐘 = 1.5 + 42 = 43.5 點/分;60 分鐘 = 2,610 點
- 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
- 合計 = 2,610 + 1.2 = 2,611.2 點(≈ TWD 3,916.8/USD 122.40)
範例 10 — 全文重新翻譯:60 分鐘錄音的逐字稿(約 12,000 字元)
- 全文重新翻譯=12,000 ÷ 200 × 0.1 = 6 點
- 合計 = 6 點(≈ TWD 9/USD 0.28)
- 若僅重新翻譯個別句子:免費
吃到飽方案
除點數制外,另提供「吃到飽方案」(v1.9.0):以合約授權固定的功能組合與使用上限,期間內使用方案內功能不逐分鐘扣點。方案的功能組合與各項上限由後台依合約自訂;可隨時透過 GET /api/v1/me/plan 查詢目前方案的內容、用量與限制何時恢復。
方案規則
- 方案綁定在單一 API Key 上:一份授權對應一把 API Key。同一帳號底下的其他 API Key 不受影響,仍依點數制計費;要讓多把 API Key 都吃到飽,需要各自綁一份授權。
- 方案不含的功能直接拒絕:呼叫方案未包含的功能會收到
plan_feature_not_allowed(REST 為 HTTP 403;WebSocket 為錯誤訊息),不會回落為點數扣抵。詳見 錯誤碼參考 – 方案限制錯誤。 - 廣播一律不含在吃到飽方案內:廣播照點數計費(見上方「廣播計費」)。
- 基本功能(所有方案必含):基礎語音轉錄、專業詞語庫、摘要、全文重翻。
方案可設定的上限
| 上限 | 說明 |
|---|---|
| 同時識別語言數 | 超過方案上限時 start 被拒(too_many_languages,details.max 為方案上限) |
| 單次錄音上限 | 單場錄音的長度上限 |
| 使用時數門檻 | 達門檻後定期中斷當場錄音(daily_limit_disconnect),可立即開始新的錄音;達每日硬上限則收到 daily_limit_reached(REST 事前閘為 plan_daily_limit_reached,HTTP 402),依方案規則重置(每日上限隔日重置)後恢復 |
| 併發錄音上限 | 同一把 API Key 同時進行的錄音數;達上限時回 concurrency_limit_reached。名額在伺服端送出 task_complete 時釋放,收到後即可開始下一場 |
| 多聲道路數上限 | 多聲道語者分離的同時辨識路數上限;超過時 start/add_channel 當場被拒(plan_feature_not_allowed,details.field 為 max_stt_streams) |
判斷時機:即時錄音的單次錄音上限、使用時數門檻與每日硬上限,都在每一分鐘開始前判斷;達到時下一分鐘不會開始,也不計入用量。同一把 API Key 同時進行多場錄音時,達到定期中斷的門檻後,每一場都會在各自的下一分鐘開始前中斷。
在同一條連線上重新開始:錄音被中斷後可以立即送出
start,但要等上一場處理完成(收到status: "ended")後才會收到session_started,視摘要長度可能需要數秒到數十秒。
版本:V1.24.1 最後更新:2026-10-07