LecSync
Realtime STT
- 通用转录模型
- 快速转录
- 实时翻译
- 说话人分割
一条 WebSocket 连接,同时提供实时转录与翻译。从开口到首字上屏,平均 0.28 秒。
零点付近の量子化ステップは、およそ 8 です。
零点附近的量化台阶大约是 8。
Dann bleiben ungefähr 22 dB Headroom, oder?
那还剩大约 22 dB 的余量,对吧?
맞아요 — 노이즈가 바로 거기서 올라오기 시작합니다.
没错——噪声就是从那儿开始冒出来的。
点击时间戳可跳转至对应语句。此处为示例会话的回放,非实时接口。
- 60
- 种语言,可在任意两种之间互译
- 0.28 s
- 从开口到首字上屏
- 5
- 个全球网关区域
- $0.01
- 每音频分钟,功能全部包含
翻译方向由内容自动判定
为每条流指定一个语言对,系统按每个段落的识别结果自动判定翻译方向。
若会话中出现该语言对以外的第三种语言,同样会翻译为你的目标语言。译文与转录同步流式输出,无需等待整句结束。
翻译环节为首个 token 增加约 88 毫秒延迟。
种语言,可在任意两种之间互译
句子尚未结束,文本已经上屏
从说话人开口到首个字上屏,平均 0.28 秒。
识别过程中持续输出预览文本,确认后落定为最终段落。语种自动识别,无需在会话开始前手动指定。
延迟不会随时间累积
网络变慢时,音频会在服务端积压。我们将积压上限设为 2 秒,超出部分直接丢弃,不进入队列。
因此网络波动结束后,字幕会在 1 秒内回到当前语句,不会持续落后于说话人。
每个段落都标注说话人
启用 speakers 后,每个最终段落都会带上说话人标识。
说话人标识与时间戳一同返回,可直接定位到某位说话人对应的音频位置。
时间戳锚定在音频上
段落的 startMs 即该段落在录音文件中的位置,可直接用于定位播放,无需额外校正。
上游识别服务的时钟以单次连接计数,重连后归零;网关依据录音文件的字节偏移,将其换算为录音的全局时间。
纪要随会话一段段长出来
传 digest: true,内容累积到一定量后自动产出一段纪要,通过同一条连接推送。
讲完一个话题,这一段就落定为已确认;当前话题留在进行中继续补要点。每段都带时间范围,可以定位回对应的录音位置。
同一套 API,部署在 5 个区域
音频在采集地就近处理,无需将每一帧传输至跨洋节点。可在握手时指定 region,也可由我们路由至最近的健康节点。
region: "dal"
region: "hz"
region: "jp2"
region: "ru"
region: "uk"
全部位于同一条连接内
无需额外接入端点,无需额外集成,账单上也不会增加条目。
术语表与领域上下文
将识别结果偏向你提供的术语,并为人名、产品名指定固定译法。
AI 译文精修
第二轮模型调用结合上下文重写译文,并以相同的段落 ID 再次推送。
录音存储
store 默认 false。传入 store: true 才从流结束起保留录音和转写 JSON 30 天,用短期签名 URL 下载。
服务端已经处理好的部分
音频处理、时间对齐、术语注入、纪要生成与流量控制均在服务端完成。
音频缓冲、编码、上传、存储
等 session.ready 后再推裸 PCM。store 默认 false,不打开就不留内容。
转写与音频的时间对齐
段落时间戳直接对应录音文件中的位置。
转录与翻译的拼接
转录与翻译从同一条连接返回,已完成配对。
术语表注入
产品名与专业术语在原文和译文中保持一致。
摘要链路
结构化纪要在会话进行中持续推送。
流控与背压
拥塞由服务端处理,客户端只需持续发送。
GPU 运维
翻译运行在我们自行微调的模型与自有机器上。
连接,然后推流
先用 curl 连接,再将返回的完整 url 和 token 用于任一短示例,发送 3 秒静音。文档提供包含有界队列、超时和清理的完整 WAV 客户端。
curl — 创建会话
curl -X POST "https://api.lecsync.com/v1/realtime/connect" \
-H "Authorization: Bearer $LECSYNC_API_KEY" \
-H "Content-Type: application/json" \
-d '{"audio":{"encoding":"pcm_s16le","sampleRate":16000,"channels":1},
"transcribe":{"languages":["en"]},"store":false}'单一价格
无阶梯、无功能附加费,每条会话按整分钟向上取整计费。
以下功能全部包含:
- 实时转录
- 实时翻译
- 对齐音频的时间戳
- 说话人分割
- 术语表与领域上下文
- AI 译文精修
- 实时结构化纪要
- 录音 + 转写存储 30 天
每条会话结束时按有效音频时长向上取整到整分钟。断线重开分别计费;没有有效音频不收费。
关闭功能不会降低价格,全部启用也不会提高价格。
翻译节点不可达时会自动回落,音频流不会中断。