Realtime Speech API

LecSync
Realtime STT

  • Универсальная модель расшифровки
  • Быстрая расшифровка
  • Синхронный перевод
  • Разделение говорящих

Одно WebSocket-соединение, обеспечивающее расшифровку и перевод в реальном времени. Первое слово появляется на экране через 0,28 секунды после начала речи.

Запись примераязык определяется автоматически
Говорящий 1ja

零点付近の量子化ステップは、およそ 8 です。

Шаг квантования около нуля — примерно восемь.

Говорящий 2de

Dann bleiben ungefähr 22 dB Headroom, oder?

Значит, остаётся около 22 дБ запаса, верно?

Говорящий 1ko

맞아요 — 노이즈가 바로 거기서 올라오기 시작합니다.

Именно — шум как раз оттуда и начинает расти.

на

Выберите таймкод, чтобы перейти к этой фразе. Это воспроизведение примера сессии, а не живой API.

60
языков с переводом между любыми двумя
0.28 s
от начала речи до первого слова на экране
5
глобальных регионов шлюза
$0.01
за минуту аудио, все возможности включены
01Синхронный перевод

Направление определяется содержанием

Для каждого потока задаётся одна языковая пара, а направление перевода определяется по результату распознавания каждого сегмента.

Если в ходе сессии появляется третий язык, он также переводится на ваш целевой. Перевод передаётся потоком одновременно с расшифровкой, не дожидаясь конца фразы.

Перевод добавляет к первому токену около 88 мс.

60

языков с переводом между любыми двумя

English中文日本語한국어EspañolFrançaisDeutschItalianoPortuguêsРусскийहिन्दीالعربيةNederlandsPolskiTürkçeУкраїнськаČeštinaSlovenčinaSlovenščinaMagyarRomânăБългарскиHrvatskiСрпскиМакедонскиΕλληνικάSvenskaDanskNorskSuomiEestiLatviešuLietuviųShqipCatalàAfrikaansעבריתفارسیاردوमराठीবাংলাગુજરાતીಕನ್ನಡമലയാളംਪੰਜਾਬੀதமிழ்తెలుగుไทยTiếng ViệtBahasa IndonesiaBahasa MelayuTagalogKiswahiliҚазақшаAzərbaycanEuskaraБеларускаяBosanskiGalegoCymraeg
02Потоковая расшифровка

Текст появляется до конца фразы

Первое слово появляется на экране через 0,28 секунды после начала речи.

В процессе распознавания непрерывно выводится предварительный текст, который после подтверждения фиксируется как финальный сегмент. Язык определяется автоматически, указывать его заранее не требуется.

03Контроль задержки

Задержка не накапливается

При замедлении сети аудио скапливается на стороне сервера. Мы ограничиваем это накопление двумя секундами, а всё сверх того отбрасываем, не ставя в очередь.

Поэтому после окончания сбоя субтитры возвращаются к текущей фразе в течение секунды и не отстают всё сильнее.

04Разделение говорящих

Каждый сегмент помечен говорящим

При включённом параметре speakers каждый финальный сегмент получает метку говорящего.

Метки возвращаются вместе с таймкодами, поэтому реплики конкретного говорящего можно найти прямо в аудио.

05Выравнивание по аудио

Таймкоды привязаны к аудио

Значение startMs сегмента — это его позиция в записи, пригодная для воспроизведения напрямую, без дополнительных поправок.

Часы вышестоящего сервиса распознавания отсчитываются в пределах одного соединения и обнуляются при переподключении. Шлюз пересчитывает их в глобальное время записи по байтовому смещению в файле.

06Протокол в реальном времени

Протокол растёт раздел за разделом

Передайте digest: true — как только накопится достаточно сказанного, раздел протокола формируется и приходит по тому же соединению.

Когда тема завершается, её раздел помечается подтверждённым; текущая тема остаётся открытой и продолжает пополняться. У каждого раздела есть временной диапазон, отображаемый на запись.

07Глобальная инфраструктура

Один API, развёрнутый в 5 регионах

Аудио обрабатывается рядом с местом записи, поэтому кадры не передаются через океан. Регион можно указать при установлении соединения либо доверить маршрутизацию нам.

DAL

region: "dal"

HZ

region: "hz"

JP2

region: "jp2"

Россия

region: "ru"

Великобритания

region: "uk"

08Дополнительные возможности

Всё в пределах одного соединения

Без дополнительного эндпоинта, без дополнительной интеграции и без дополнительной строки в счёте.

Глоссарий и контекст предметной области

Смещает распознавание в сторону вашей терминологии и закрепляет перевод имён и названий продуктов.

ИИ-шлифовка перевода

Второй проход модели переписывает перевод с учётом контекста и публикует его повторно под тем же идентификатором сегмента.

Хранение записи

store по умолчанию false. store: true сохраняет запись и JSON расшифровки на 30 дней после конца потока; ссылка подписанная и краткоживущая.

09Объём API

Что выполняется на нашей стороне

Обработка аудио, выравнивание по времени, терминология, протоколы и управление потоком выполняются на стороне сервера.

Буферизация, кодирование, загрузка и хранение аудио

Отправляйте сырой PCM только после session.ready. store по умолчанию false — без явного включения ничего не хранится.

Выравнивание расшифровки по аудио

Таймкод сегмента напрямую соответствует позиции в записи.

Сшивка расшифровки с переводом

Расшифровка и перевод возвращаются по одному соединению уже сопоставленными.

Подстановка глоссария

Названия продуктов и специальные термины остаются единообразными в оригинале и переводе.

Конвейер саммаризации

Структурированный протокол передаётся непрерывно во время сессии.

Управление потоком и обратное давление

Перегрузка обрабатывается на стороне сервера, клиенту достаточно продолжать отправку.

Эксплуатация GPU

Перевод работает на дообученных нами моделях и на нашем оборудовании.

10Подключение

Подключитесь и передавайте аудио

Вызовите connect через curl, затем подставьте полученные полный url и token в один из примеров для отправки 3 секунд тишины. В документации — полные WAV-клиенты с ограниченной очередью, таймаутами и очисткой ресурсов.

curl — создать сессию

curl -X POST "https://api.lecsync.com/v1/realtime/connect" \
  -H "Authorization: Bearer $LECSYNC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":{"encoding":"pcm_s16le","sampleRate":16000,"channels":1},
       "transcribe":{"languages":["en"]},"store":false}'
11Цена

Единая цена

Без тарифных ступеней и доплат за функции. Каждый поток округляется вверх до целых минут.

$0.01за минуту аудио

Всё перечисленное включено:

  • Потоковая расшифровка
  • Перевод в реальном времени
  • Таймкоды, выровненные по аудио
  • Разделение говорящих
  • Глоссарий и доменный контекст
  • AI-доработка перевода
  • Живое структурированное резюме
  • Хранение записи и транскрипта, 30 дней

При завершении каждый поток округляется вверх до целых минут принятого аудио. Переподключение оплачивается отдельно. Без принятого аудио плата не взимается.

Отключение функций не снижает цену, а включение всех — не повышает её.

Если узел перевода недоступен, запрос автоматически переходит на резервный, и поток не прерывается.

Откройте первый поток за несколько минут

Зарегистрируйтесь, создайте API-ключ и начните с двух вызовов выше.