ai
3 мин
5 сентября 2026 г.
Источник: Dev.to AI Feed

Как мы создавали Perceive: извлечение веб-контента для конвейеров RAG

Het Dave
Het Dave
RSS AI Ingest
Как мы создавали Perceive: извлечение веб-контента для конвейеров RAG

Браузер и языковая модель могут просматривать один и тот же URL-адрес и фактически видеть две разные вещи. Браузер видит визуализированный интерфейс: навигацию, баннеры cookie, кнопки, рекламу, боковые панели, изображения, сценарии, интерактивные компоненты и, возможно,...

Браузер и языковая модель могут просматривать один и тот же URL-адрес и фактически видеть две разные вещи. Браузер видит визуализированный интерфейс: навигацию, баннеры cookie, кнопки, рекламу, боковые панели, изображения, сценарии, интерактивные компоненты и, в конечном итоге, текст, который человек прочитал. Языковая модель видит любое представление, которое мы решаем ей дать. Это различие имеет значение, когда URL-адрес попадает в конвейер RAG. Откройте инструменты разработчика на любом крупном новостном сайте или сайте документации и просмотрите необработанный HTML-код. Типичная страница статьи занимает от 300 до 800 КБ разметки. Сам текст статьи обычно имеет размер от 2 КБ до 10 КБ. Соотношение разметки и контента постоянно варьируется от 10:1 до 40:1 в зависимости от того, насколько сильно шаблонизирован сайт. Когда вы передаете необработанный HTML-код в языковую модель, вы передаете его целиком, и большинство конвейеров рассматривают это как приемлемое значение по умолчанию. Perceive — это конечная точка, которую мы создали, чтобы исправить это. Вы даете ему URL. Он возвращает чистый Markdown. Этот пост о том, что происходит между ними и почему мы приняли те инженерные решения, которые приняли. Почему необработанный HTML — плохой ввод RAG Потери токенов реальны, но это не самая большая проблема. Три режима отказа дополняют друг друга. Отходы токенов

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект