Превращение каталога общедоступных API в дружественный к кэшу уровень извлечения RAG В 2:00 ночи ваш внутренний помощник по обнаружению API исчерпает ежемесячную квоту токенов. Виновником является не неожиданный всплеск трафика, а устойчивый поток рутинных событий...
Превращение каталога общедоступных API в дружественный к кэшу уровень извлечения RAG
В 2:00 ночи ваш внутренний помощник по обнаружению API исчерпает ежемесячную квоту токенов. Виновником является не неожиданный всплеск трафика, а постоянный поток рутинных запросов разработчиков, таких как «Какой API бесплатной погоды поддерживает HTTPS и не требует аутентификации?» неоднократно выгружая 15 000 токенов необработанных заголовков Markdown, повторяющееся форматирование таблиц и почти идентичные строки каталога прямо в контекст. Наивные конвейеры RAG редко выходят из строя с серьезными ошибками 500; они незаметно истощают инфраструктурные бюджеты за счет избыточных входных токенов и уничтожают показатели попадания в кэш.
Основная проблема производства — стоимость повторяющегося контекста поиска.
Игрушечная реализация RAG обычно разделяет README public-apis/public-apis каждые N символов, встраивает каждый фрагментированный фрагмент, извлекает пять лучших ближайших соседей и слепо выгружает их в командную строку. В производственной среде этот наивный шаблон приводит к трем эксплуатационным сбоям:
Заголовки категорий отделяются от строк API, разрушая семантическую фильтрацию, когда фрагменты пересекают произвольные границы символов.
Почти идентичные описания вызывают повторный поиск, упаковывая контекстные окна с избыточными конечными точками.