Прежде чем я создал что-нибудь с помощью ИИ, я видел термин LLM повсюду — в статьях, в описаниях вакансий, в репозиториях GitHub. Я кивнул, как будто понял это. Я этого не сделал. Не совсем. Я знал, что это означает «большая языковая модель». Я знал ChatGPT...
Прежде чем я создал что-нибудь с помощью ИИ, я видел термин LLM повсюду — в статьях, в описаниях вакансий, в репозиториях GitHub. Я кивнул, как будто понял это. Я этого не сделал. Не совсем.
Я знал, что это означает «большая языковая модель». Я знал, что ChatGPT был одним из них. Но когда кто-то спросил меня «как это на самом деле работает» — я не смог этого объяснить. У меня был ярлык, а не понимание.
Эта статья — объяснение, которое мне хотелось бы получить до того, как я начал строить.
Что на самом деле означает «большая языковая модель»
Давайте разберем название.
Язык — он работает с языком. Ввод текста, вывод текста. Он читает ваши слова и записывает их обратно.
Модель — это математическая модель. Миллионы (на самом деле миллиарды) чисел, тщательно рассчитанные во время обучения, которые вместе отражают закономерности в языке.
Большой — модель огромна. GPT-4 имеет около 1,8 триллиона параметров. Близнецы, Клоды, Ламы — все исчисляется сотнями миллиардов. Эти цифры делают их способными. «Большой» — это не маркетинг — это то, что отличает эти модели от более ранних, более простых.
Итак: Большая языковая модель — это очень большая математическая модель, обученная понимать и генерировать язык.
Вы уже использовали один. Когда вы напечатали некоторые