实时语音 API

LecSync
Realtime STT

  • 通用转录模型
  • 快速转录
  • 实时翻译
  • 说话人分割

一条 WebSocket 连接,同时提供实时转录与翻译。从开口到首字上屏,平均 0.28 秒。

示例会话回放语种自动识别
说话人 1ja

零点付近の量子化ステップは、およそ 8 です。

零点附近的量化台阶大约是 8。

说话人 2de

Dann bleiben ungefähr 22 dB Headroom, oder?

那还剩大约 22 dB 的余量,对吧?

说话人 1ko

맞아요 — 노이즈가 바로 거기서 올라오기 시작합니다.

没错——噪声就是从那儿开始冒出来的。

译成

点击时间戳可跳转至对应语句。此处为示例会话的回放,非实时接口。

60
种语言,可在任意两种之间互译
0.28 s
从开口到首字上屏
5
个全球网关区域
$0.01
每音频分钟,功能全部包含
01实时翻译

翻译方向由内容自动判定

为每条流指定一个语言对,系统按每个段落的识别结果自动判定翻译方向。

若会话中出现该语言对以外的第三种语言,同样会翻译为你的目标语言。译文与转录同步流式输出,无需等待整句结束。

翻译环节为首个 token 增加约 88 毫秒延迟。

60

种语言,可在任意两种之间互译

English中文日本語한국어EspañolFrançaisDeutschItalianoPortuguêsРусскийहिन्दीالعربيةNederlandsPolskiTürkçeУкраїнськаČeštinaSlovenčinaSlovenščinaMagyarRomânăБългарскиHrvatskiСрпскиМакедонскиΕλληνικάSvenskaDanskNorskSuomiEestiLatviešuLietuviųShqipCatalàAfrikaansעבריתفارسیاردوमराठीবাংলাગુજરાતીಕನ್ನಡമലയാളംਪੰਜਾਬੀதமிழ்తెలుగుไทยTiếng ViệtBahasa IndonesiaBahasa MelayuTagalogKiswahiliҚазақшаAzərbaycanEuskaraБеларускаяBosanskiGalegoCymraeg
02实时转录

句子尚未结束,文本已经上屏

从说话人开口到首个字上屏,平均 0.28 秒。

识别过程中持续输出预览文本,确认后落定为最终段落。语种自动识别,无需在会话开始前手动指定。

03延迟控制

延迟不会随时间累积

网络变慢时,音频会在服务端积压。我们将积压上限设为 2 秒,超出部分直接丢弃,不进入队列。

因此网络波动结束后,字幕会在 1 秒内回到当前语句,不会持续落后于说话人。

04说话人分割

每个段落都标注说话人

启用 speakers 后,每个最终段落都会带上说话人标识。

说话人标识与时间戳一同返回,可直接定位到某位说话人对应的音频位置。

05音频对齐

时间戳锚定在音频上

段落的 startMs 即该段落在录音文件中的位置,可直接用于定位播放,无需额外校正。

上游识别服务的时钟以单次连接计数,重连后归零;网关依据录音文件的字节偏移,将其换算为录音的全局时间。

06实时纪要

纪要随会话一段段长出来

传 digest: true,内容累积到一定量后自动产出一段纪要,通过同一条连接推送。

讲完一个话题,这一段就落定为已确认;当前话题留在进行中继续补要点。每段都带时间范围,可以定位回对应的录音位置。

07全球基础设施

同一套 API,部署在 5 个区域

音频在采集地就近处理,无需将每一帧传输至跨洋节点。可在握手时指定 region,也可由我们路由至最近的健康节点。

DAL

region: "dal"

HZ

region: "hz"

JP2

region: "jp2"

俄罗斯

region: "ru"

英国

region: "uk"

08其余能力

全部位于同一条连接内

无需额外接入端点,无需额外集成,账单上也不会增加条目。

术语表与领域上下文

将识别结果偏向你提供的术语,并为人名、产品名指定固定译法。

AI 译文精修

第二轮模型调用结合上下文重写译文,并以相同的段落 ID 再次推送。

录音存储

store 默认 false。传入 store: true 才从流结束起保留录音和转写 JSON 30 天,用短期签名 URL 下载。

09接口范围

服务端已经处理好的部分

音频处理、时间对齐、术语注入、纪要生成与流量控制均在服务端完成。

音频缓冲、编码、上传、存储

等 session.ready 后再推裸 PCM。store 默认 false,不打开就不留内容。

转写与音频的时间对齐

段落时间戳直接对应录音文件中的位置。

转录与翻译的拼接

转录与翻译从同一条连接返回,已完成配对。

术语表注入

产品名与专业术语在原文和译文中保持一致。

摘要链路

结构化纪要在会话进行中持续推送。

流控与背压

拥塞由服务端处理,客户端只需持续发送。

GPU 运维

翻译运行在我们自行微调的模型与自有机器上。

10接入

连接,然后推流

先用 curl 连接,再将返回的完整 url 和 token 用于任一短示例,发送 3 秒静音。文档提供包含有界队列、超时和清理的完整 WAV 客户端。

curl — 创建会话

curl -X POST "https://api.lecsync.com/v1/realtime/connect" \
  -H "Authorization: Bearer $LECSYNC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":{"encoding":"pcm_s16le","sampleRate":16000,"channels":1},
       "transcribe":{"languages":["en"]},"store":false}'
11定价

单一价格

无阶梯、无功能附加费,每条会话按整分钟向上取整计费。

$0.01每音频分钟

以下功能全部包含:

  • 实时转录
  • 实时翻译
  • 对齐音频的时间戳
  • 说话人分割
  • 术语表与领域上下文
  • AI 译文精修
  • 实时结构化纪要
  • 录音 + 转写存储 30 天

每条会话结束时按有效音频时长向上取整到整分钟。断线重开分别计费;没有有效音频不收费。

关闭功能不会降低价格,全部启用也不会提高价格。

翻译节点不可达时会自动回落,音频流不会中断。

几分钟内接入第一条流

注册并创建 API Key,即可使用上述两个调用开始。