Распознавание и синтез речи вышли за рамки традиционных конвейеров в эпоху LLM, но развертывание этих моделей в больших масштабах приводит к возникновению проблем с инфраструктурой, которые большинство разработчиков не замечают. Между биллингом на основе токенов, который раздувается с длительным сроком ...
Распознавание и синтез речи вышли за рамки традиционных конвейеров в эпоху LLM, но развертывание этих моделей в больших масштабах приводит к возникновению проблем с инфраструктурой, которые большинство разработчиков не замечают. Между биллингом на основе токенов, который раздувается из-за длинного аудиоконтекста, холодным запуском, который прерывает рабочие процессы в реальном времени, и фрагментированными SDK, требующими настраиваемой интеграции, выбор правильного бэкэнда имеет такое же значение, как и выбор правильной модели. Oxlo.ai предлагает альтернативу, созданную специально для этих рабочих нагрузок: ценообразование на основе запросов, совместимость с OpenAI SDK и набор аудиомоделей, включая Whisper и Kokoro, доступ к которым осуществляется через единую конечную точку.
Распознавание речи с помощью шепота
Whisper от OpenAI остается стандартом для распознавания речи с открытым исходным кодом, а на Oxlo.ai размещаются Whisper Large v3, Turbo и Medium для рабочих нагрузок транскрипции. Поскольку Oxlo.ai предоставляет конечную точку аудио/транскрипции, которая отражает API OpenAI, вы можете указать существующему клиенту https://api.oxlo.ai/v1 без переписывания логики.
из openai импорт OpenAI
клиент = OpenAI(
base_url="https://api.oxlo.ai/v1",
api_key="ВАШ_OXLO_API_KEY"
)
с open("interview.wav", "rb") в качестве audio_file:
расшифровка = cli