Браузер и языковая модель могут просматривать один и тот же URL-адрес и фактически видеть две разные вещи. Браузер видит визуализированный интерфейс: навигацию, баннеры cookie, кнопки, рекламу, боковые панели, изображения, сценарии, интерактивные компоненты и, возможно,...
Браузер и языковая модель могут просматривать один и тот же URL-адрес и фактически видеть две разные вещи.
Браузер видит визуализированный интерфейс: навигацию, баннеры cookie, кнопки, рекламу, боковые панели, изображения, сценарии, интерактивные компоненты и, в конечном итоге, текст, который человек прочитал. Языковая модель видит любое представление, которое мы решаем ей дать.
Это различие имеет значение, когда URL-адрес попадает в конвейер RAG.
Откройте инструменты разработчика на любом крупном новостном сайте или сайте документации и просмотрите необработанный HTML-код. Типичная страница статьи занимает от 300 до 800 КБ разметки. Сам текст статьи обычно имеет размер от 2 КБ до 10 КБ. Соотношение разметки и контента постоянно варьируется от 10:1 до 40:1 в зависимости от того, насколько сильно шаблонизирован сайт. Когда вы передаете необработанный HTML-код в языковую модель, вы передаете его целиком, и большинство конвейеров рассматривают это как приемлемое значение по умолчанию.
Perceive — это конечная точка, которую мы создали, чтобы исправить это. Вы даете ему URL. Он возвращает чистый Markdown. Этот пост о том, что происходит между ними и почему мы приняли те инженерные решения, которые приняли.
Почему необработанный HTML — плохой ввод RAG
Потери токенов реальны, но это не самая большая проблема. Три режима отказа дополняют друг друга.
Отходы токенов