Допущение «сначала локально»: измерение задержки, утечек полезной нагрузки и поведения в автономном режиме на трех уровнях LLM Каждая команда, внедряющая локальные приложения LLM, исходит из одного и того же предположения: личные данные никогда не должны покидать машину, поэтому модель м...
Допущение «сначала локально»: измерение задержки, утечек полезной нагрузки и поведения в автономном режиме на трех уровнях LLM
Каждая команда, внедряющая локальные приложения LLM, исходит из одного и того же предположения: личные данные никогда не должны покидать компьютер, поэтому модель должна работать параллельно с данными. Это предположение обычно исчезает во время первой демонстрации продукта на ноутбуке без графического процессора для интерактивного вывода. Боту поддержки, который хорошо ведет себя на рабочей станции, может потребоваться десятки секунд на ответ на ноутбуке с низким энергопотреблением, и запасной план отправки запроса на размещенный API внезапно снова выглядит привлекательным.
Недавние дискуссии в сообществе о системах искусственного интеллекта, которые запоминают и доверяют каждому фрагменту контекста, делают этот компромисс более острым, чем когда-либо. Когда запрос переходит к размещенной модели, полное приглашение проходит через границу сети, и каждый журнал, прокси-сервер и средство сообщения о сбоях на пути могут его прочитать. Удивительно то, что при локальных настройках также происходит утечка контекста, обычно через промежуточное программное обеспечение телеметрии, которое перенаправляет трассировку сеанса на серверную часть SaaS еще до того, как локальная модель будет вызвана. Настоящий вопрос заключается не в локальном или облачном уровне, а в том, какой уровень предлагает лучшее соотношение задержки, конфиденциальности и стоимости для конкретной среды.