Прочитать сказанный сегмент
На входе кусок ASR: разговорный, обрезанный или слегка ошибочный. Модель переводит то, что есть, а не превращает это в сочинение.
Наша модель перевода на 4B читает живые транскрипты лекций и встреч — с предыдущим контекстом и вашим глоссарием — и пишет только перевод. Это движок живого перевода LecSync. Более лёгкая 1,7B по-прежнему доступна.
API для разработчиков скоро
В продукте
LecSync-MT — не побочное исследовательское демо. Это модель перевода, которую LecSync запускает на живой речи: один сегмент ASR на входе, рядом — необязательные предыдущие сегменты и глоссарий курса, на выходе только перевод. Этот контракт совпадает с тем, как устроены лекции и встречи: коротко, устно, иногда незавершённо.
Как это работает
Обычные модели MT учат на письменных текстах. LecSync-MT учили на речевых транскриптах, поэтому обрывки остаются обрывками и модель не дописывает несказанное.
На входе кусок ASR: разговорный, обрезанный или слегка ошибочный. Модель переводит то, что есть, а не превращает это в сочинение.
Предыдущие сегменты на языке оригинала — необязательный контекст. Они снимают местоимения и тематические слова, не переводясь повторно.
Передавайте термины курса или продукта парами «источник → цель». Модель учили сохранять эти формы, а не заменять их гладким почти-попаданием.
[system] You are a professional simultaneous interpreter for live lectures and meetings. [user] Context (previous segments): Today we talk about database design. Glossary: ERD -> 实体关系图 English->Chinese: So we use the ERD first.
Оценки
Решения о качестве принимает парный LLM-судья (Gemini, оба порядка). Официальный BLEU публикуем только как справочную цифру — на трёх замороженных наборах он расходился с судейским качеством.
Судья: Gemini 3.8 Flash, оба порядка, на замороженных наборах лекций и встреч. Производственное сравнение — 407 сегментов из живого трафика LecSync. Если не указано иное, результаты ниже относятся к 1,7B.
4B против 1,7B
4,21 / 5
Вдвое меньше серьёзных ошибок
Слепая оценка 1–5 на 998 живых сегментах: у 4B в среднем 4,21 против 3,72 у 1,7B, доля серьёзных ошибок снизилась с 18,2% до 9,9%. Лучшим перевод 4B признан в 485 сегментах против 58.
Прежний облачный контур
51,9%
Статистически вничью
Доля побед против прежнего продакшен-стека (облачной черновик плюс необязательная переписка) на 407 лекционных и переговорных сегментах. p = 0,69. Против сырого облачного черновика точечная оценка 55,7%, тоже незначима.
Tencent Hy-MT 1.8B
71,9%
Впереди на лекционном ASR
Доля побед на обычных лекционных сегментах. С предыдущим контекстом: 74,3%. С глоссарием: 69,3%. Hy-MT лидирует на письменном и новостном WMT24 — LecSync-MT специалист по речи, а не общая литературная модель.
Qwen3.5-2B
6 / 6
Впереди на каждом замороженном наборе
Те же шесть замороженных сюит, что и в сравнении с Hy-MT: лекции, контекст, глоссарий, без контекста, WMT24 и многоязычные цели.
| Сюита | Доля побед LecSync-MT |
|---|---|
| Лекционные сегменты | 71,9% |
| Нужен предыдущий контекст | 74,3% |
| Термины глоссария | 69,3% |
Характеристики
Задача
Перевод речевых транскриптов
Обучение
Реальные транскрипты лекций и встреч
Строк обучения
149 042
Декодирование
Жадное (как в оценке)
Большая часть лекционных строк — настоящие транскрипты LecSync, размеченные учительской моделью и отфильтрованные LLM-судьёй. Многоязычный replay сохраняет исходный слот на 60 целевых языков, чтобы модель не схлопывала все цели в китайский. Пары, чувствительные к контексту, и строки глоссария входят в смесь; у replay-строк нет ни того ни другого.
Целевой язык задаётся английскими именами (English→Chinese, Korean→English). Покрытие сильнее всего на лекционных языках продукта. У части низкоресурсных письменностей качество тоньше.
В размещённой песочнице можно отправить сегмент лекции или встречи и увидеть, как LecSync-MT его переводит. Веса не публикуются. Публичного HTTP API пока нет.
Самый быстрый способ оценить LecSync-MT — открыть LecSync и перевести настоящую лекцию или встречу.