Говорящие
Включите разделение говорящих при рукопожатии — и каждый завершённый сегмент вернётся с меткой говорящего рядом с таймкодами.
Поле speaker приходит только в завершённых сегментах: в предварительных его нет, потому что принадлежность определяется лишь при завершении сегмента.
Метка говорящего приходит в том же сообщении, что startMs и endMs, поэтому расшифровку можно проигрывать по говорящему: выберите метку, перейдите к смещению, включите воспроизведение.