即時語音 API

LecSync
Realtime STT

  • 通用轉錄模型
  • 快速轉錄
  • 即時翻譯
  • 說話人分割

一條 WebSocket 連線,同時提供即時轉錄與翻譯。從開口到首字上螢幕,平均 0.28 秒。

範例會話回放語種自動辨識
說話人 1ja

零点付近の量子化ステップは、およそ 8 です。

零点附近的量化台阶大约是 8。

說話人 2de

Dann bleiben ungefähr 22 dB Headroom, oder?

那还剩大约 22 dB 的余量,对吧?

說話人 1ko

맞아요 — 노이즈가 바로 거기서 올라오기 시작합니다.

没错——噪声就是从那儿开始冒出来的。

譯成

點擊時間戳可跳轉至對應語句。此處為範例會話的回放,非即時介面。

60
種語言,可在任意兩種之間互譯
0.28 s
從開口到首字上螢幕
5
個全球閘道區域
$0.01
每音訊分鐘,功能全部包含
01即時翻譯

翻譯方向由內容自動判定

為每條流指定一個語言對,系統按每個段落的辨識結果自動判定翻譯方向。

若會話中出現該語言對以外的第三種語言,同樣會翻譯為你的目標語言。譯文與轉錄同步串流輸出,無需等待整句結束。

翻譯環節為首個 token 增加約 88 毫秒延遲。

60

種語言,可在任意兩種之間互譯

English中文日本語한국어EspañolFrançaisDeutschItalianoPortuguêsРусскийहिन्दीالعربيةNederlandsPolskiTürkçeУкраїнськаČeštinaSlovenčinaSlovenščinaMagyarRomânăБългарскиHrvatskiСрпскиМакедонскиΕλληνικάSvenskaDanskNorskSuomiEestiLatviešuLietuviųShqipCatalàAfrikaansעבריתفارسیاردوमराठीবাংলাગુજરાતીಕನ್ನಡമലയാളംਪੰਜਾਬੀதமிழ்తెలుగుไทยTiếng ViệtBahasa IndonesiaBahasa MelayuTagalogKiswahiliҚазақшаAzərbaycanEuskaraБеларускаяBosanskiGalegoCymraeg
02即時轉錄

句子尚未結束,文字已經上螢幕

從說話人開口到首個字上螢幕,平均 0.28 秒。

辨識過程中持續輸出預覽文字,確認後落定為最終段落。語種自動辨識,無需在會話開始前手動指定。

03延遲控制

延遲不會隨時間累積

網路變慢時,音訊會在伺服器端積壓。我們將積壓上限設為 2 秒,超出部分直接丟棄,不進入佇列。

因此網路波動結束後,字幕會在 1 秒內回到當前語句,不會持續落後於說話人。

04說話人分割

每個段落都標註說話人

啟用 speakers 後,每個最終段落都會帶上說話人標識。

說話人標識與時間戳一同返回,可直接定位到某位說話人對應的音訊位置。

05音訊對齊

時間戳錨定在音訊上

段落的 startMs 即該段落在錄音檔案中的位置,可直接用於定位播放,無需額外校正。

上游辨識服務的時鐘以單次連線計數,重連後歸零;閘道依據錄音檔案的位元組偏移,將其換算為錄音的全域時間。

06即時紀要

紀要隨會話一段段長出來

傳 digest: true,內容累積到一定量後自動產出一段紀要,透過同一條連線推送。

講完一個話題,這一段就落定為已確認;當前話題留在進行中繼續補要點。每段都帶時間範圍,可以定位回對應的錄音位置。

07全球基礎設施

同一套 API,部署在 5 個區域

音訊在採集地就近處理,無需將每一幀傳輸至跨洋節點。可在交握時指定 region,也可由我們路由至最近的健康節點。

DAL

region: "dal"

HZ

region: "hz"

JP2

region: "jp2"

俄羅斯

region: "ru"

英國

region: "uk"

08其餘能力

全部位於同一條連線內

無需額外接入端點,無需額外整合,帳單上也不會增加條目。

術語表與領域上下文

將辨識結果偏向你提供的術語,並為人名、產品名指定固定譯法。

AI 譯文精修

第二輪模型呼叫結合上下文重寫譯文,並以相同的段落 ID 再次推送。

錄音儲存

store 預設 false。傳入 store: true 才從流結束起保留錄音與轉錄 JSON 30 天,以短期簽名 URL 下載。

09介面範圍

伺服器端已經處理好的部分

音訊處理、時間對齊、術語注入、紀要生成與流量控制均在伺服器端完成。

音訊緩衝、編碼、上傳、儲存

等 session.ready 後再推裸 PCM。store 預設 false,不開啟就不留內容。

轉錄與音訊的時間對齊

段落時間戳直接對應錄音檔案中的位置。

轉錄與翻譯的拼接

轉錄與翻譯從同一條連線返回,已完成配對。

術語表注入

產品名與專業術語在原文和譯文中保持一致。

摘要鏈路

結構化紀要在會話進行中持續推送。

流控與背壓

壅塞由伺服器端處理,客戶端只需持續傳送。

GPU 維運

翻譯執行在我們自行微調的模型與自有機器上。

10接入

連線,然後推流

先用 curl 連線,再將回傳的完整 url 和 token 用於任一簡短範例,傳送 3 秒靜音。文件提供包含有界佇列、逾時和清理的完整 WAV 用戶端。

curl — 建立會話

curl -X POST "https://api.lecsync.com/v1/realtime/connect" \
  -H "Authorization: Bearer $LECSYNC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":{"encoding":"pcm_s16le","sampleRate":16000,"channels":1},
       "transcribe":{"languages":["en"]},"store":false}'
11定價

單一價格

無階梯、無功能附加費,每條會話按整分鐘向上取整計費。

$0.01每音訊分鐘

以下功能全部包含:

  • 即時轉錄
  • 即時翻譯
  • 對齊音訊的時間戳
  • 說話人分割
  • 術語表與領域脈絡
  • AI 譯文精修
  • 即時結構化紀要
  • 錄音 + 轉錄儲存 30 天

每條會話結束時按有效音訊時長向上取整到整分鐘。斷線重開分別計費;沒有有效音訊不收費。

關閉功能不會降低價格,全部啟用也不會提高價格。

翻譯節點不可達時會自動回落,音訊流不會中斷。

幾分鐘內接入第一條流

註冊並建立 API Key,即可使用上述兩個呼叫開始。