Транскрипция потоковой передачи шепота представляет собой противоречие в терминах, и вы обнаруживаете это примерно через два часа после ее создания. Whisper — это пакетная модель. Ему нужен целый файл, и он будет сидеть и пережевывать его, пока не закончит, а затем передаст вам расшифровку...
Транскрипция потоковой передачи шепота представляет собой противоречие в терминах, и вы обнаруживаете это примерно через два часа после ее создания. Whisper — это пакетная модель. Ему нужен целый файл, и он будет его пережевывать, пока не закончит, а затем передаст вам стенограмму. Живой звук так не работает.
Я создал дублер видео в реальном времени, который полностью работает на моей машине, ничего не загружается и находится в автономном режиме после установки. Звук вкладки браузера выходит, транскрибируется, переводится и озвучивается поверх исходной дорожки. Транскрипция — это первая и самая суетливая часть этой цепочки, и именно здесь большинство людей сдаются.
Транскрипция потокового шепота: что на самом деле работает
Хитрость в том, что на самом деле вы вообще не транслируете Whisper — вы его притворяетесь. Дайте ему скользящее окно продолжительностью в несколько секунд и сохраняйте то, о чем он договорится, дважды подряд. В этом правиле «местного соглашения» и заключается вся игра. Меня поддерживают три вещи:
Используйте fast-whisper, а не стандартный пакет OpenAI. Те же модели, в несколько раз быстрее, и процессор работает без нареканий. Одна строка: pip install fast-whisper.
Обнаружение голосовой активности перед буфером. Как только я это добавил, галлюцинации от расшифровки тишины почти исчезли.