Как работают большие языковые модели (LLM)
Ключевые тезисы:
- LLM — это огромные нейросети, которые просто предсказывают следующее слово (токен) в последовательности.
- Вся «магия» (понимание контекста, генерация кода, ответы на вопросы) возникает как побочный эффект (эмерджентность) масштабного обучения.
- Модели не мыслят и не понимают смысл слов — они работают с числами и статистическими закономерностями.
- Основная архитектура современных LLM — Трансформер с механизмом внимания (attention).
Что такое LLM?
Large Language Model (LLM) — это большая языковая модель.
- Большая: содержит триллионы параметров (настроечных чисел).
- Языковая: работает с естественным языком (английский, русский и др.).
- Модель: математическая функция — что-то на входе, что-то на выходе.
По сути, LLM — это нейросеть, обученная предсказывать следующий фрагмент текста.
Базовые принципы нейросетей
- Нейрон — математическая функция, принимающая числа, обрабатывающая их и выдающая результат.
- Слои: входной, скрытые (сотни в больших моделях) и выходной.
- Веса — числа, определяющие важность связи между нейронами. Изначально случайные, корректируются в процессе обучения.
- Обучение (обратное распространение ошибки): модели показывают данные с правильными ответами, веса подстраиваются после каждой ошибки.
Архитектура Трансформер: прорыв
До 2017 года использовались рекуррентные сети (медленные, плохо удерживали контекст). Статья Google «Attention is all you need» изменила всё.
Ключевая идея Трансформера: обрабатывать весь контекст параллельно, а не последовательно.
Механизм внимания (Attention):
- Позволяет модели определять связи между словами, даже если они далеко друг от друга.
- Работает через три вектора для каждого слова: запрос (query), ключ (key) и значение (value).
- Создаётся карта внимания, показывающая, насколько каждое слово важно для понимания других.
Токены и эмбединги
Токен — базовая единица текста для модели (целое слово, часть слова или символ).
- Зачем нужны? Золотая середина между буквами (слишком длинно) и словами (огромный словарь).
- Словарь обычно ~100 000 токенов. Русские слова часто занимают больше токенов, чем английские, поэтому LLM хуже работают с русским.
Эмбединги (Embeddings) — представление слов в виде векторов (списков чисел).
- Слова со схожим смыслом получают близкие векторы.
- Позволяют делать «математику со смыслом» (пример: вектор(«король») — вектор(«мужчина») + вектор(«женщина») ≈ вектор(«королева»)).
- Дают модели возможность работать с контекстом и смыслом.
Как LLM генерирует текст: пошагово
- Токенизация: запрос разбивается на токены.
- Эмбединги: токены превращаются в числовые векторы.
- Обработка трансформером: векторы проходят через множество слоёв, где механизм внимания анализирует связи.
- Предсказание: на выходе — распределение вероятностей для следующего токена.
- Выбор токена: модель выбирает следующий токен (часто не самый вероятный, чтобы избежать шаблонности).
- Повтор: процесс повторяется, пока не сформируется полный ответ. Каждый новый шаг учитывает всю предыдущую историю (запрос + сгенерированный текст).
Температура и сэмплинг
Почему на один вопрос бывают разные ответы?
- Распределение вероятностей: у модели есть «рейтинг» следующих слов (например, «Москва» — 95%, «город» — 2%).
- Сэмплинг: модель выбирает токен случайно, но в соответствии с этими вероятностями.
- Температура:
Низкая (~0): модель почти всегда выбирает самый вероятный вариант. Ответы точные, но скучные.
Высокая (~1 и выше): распределение «размывается», у менее вероятных слов больше шансов. Ответы креативнее, но могут быть бредовыми.
Как модели обучаются?
- Предварительное обучение: на терабайтах текста из интернета (книги, код, форумы). Задача — угадать следующее слово. Триллионы итераций.
- Дообучение (Fine-tuning) и RLHF:
- Базовой модели не хватает умения следовать инструкциям.
- Fine-tuning: дообучение на диалогах с примерами хороших/плохих ответов.
- RLHF (Reinforcement Learning from Human Feedback): люди оценивают варианты ответов → обучается модель-критик → основную модель дообучают генерировать ответы, которые понравятся критику.
Проблемы и ограничения LLM
- Галлюцинации: модель уверенно выдаёт выдуманную информацию, так как не отличает правду от статистически вероятного текста.
- Слабое рассуждение: плохо справляется с многошаговыми логическими задачами (хотя есть модели рассуждений — chain-of-thought).
- Шаблонность: из-за обучения под человеческие оценки в ответах много клише («Отличный вопрос!», «Важно отметить...»).
- Предубеждения: обучались на всём интернете, включая токсичный контент.
- Авторские права: обучение на защищённых материалах — предмет судебных разбирательств.
- Ограниченное контекстное окно: «рабочая память» модели (десятки/сотни тысяч токенов). Длинные диалоги забываются.
- Ресурсозатратность: обучение стоит сотни миллионов долларов, запросы тоже недешёвые.
Решения и тренды
- RAG (Retrieval-Augmented Generation): решение проблемы галлюцинаций. Перед ответом система ищет информацию в актуальной базе знаний и «подсовывает» её модели как шпаргалку.
- Квантование: хранение весов модели с меньшей точностью (в 8, 4 или 2 бита). Позволяет запускать мощные модели на обычном ПК.
- Открытые модели: Mistral, Qwen и др. — эффективные и доступные альтернативы.
- Агенты: LLM + оболочка, умеющая использовать инструменты (ходить в интернет, работать с файлами, выполнять действия). Примеры: Cursor (программирование), Claude Code.
- Мультимодальность: модели учатся работать не только с текстом, но и с изображениями, аудио, видео.
- AGI (Общий ИИ): гипотетическая цель — создать интеллект, решающий любые задачи на уровне человека. Пока остаётся предметом спекуляций и привлечения инвестиций.
Где применяются LLM?
- Программирование: GitHub Copilot, Cursor — автодополнение и генерация кода.
- Поиск: Google, Яндекс — улучшение выдачи и генерация AI-сводок.
- Медицина: анализ симптомов, помощь в диагностике (как инструмент для врача).
- Образование: персональные репетиторы и AI-ассистенты в обучающих платформах.
- Автономные агенты: автоматизация задач (бронирование, работа с проектами).
Выводы
- LLM — не мышление, а сложное статистическое предсказание следующего слова.
- Все удивительные способности — эмерджентное свойство масштаба данных и модели.
- Модели — мощные инструменты-имитаторы, но не обладают сознанием или пониманием мира.
- Будущее за агентами, мультимодальностью и методами вроде RAG, которые усиливают практическую пользу моделей, минимизируя их недостатки.