Этот конспект не сохранится

Закроешь вкладку — потеряешь. Зарегистрируйся — и он будет в библиотеке навсегда.

Telegram

Ваш конспект

YouTubeИИ не думает: как на самом деле работает LLM

🧠 Как работают большие языковые модели (LLM)

Ключевые тезисы:

  • LLM — это огромные нейросети, которые просто предсказывают следующее слово (токен) в последовательности.
  • Вся «магия» (понимание контекста, генерация кода, ответы на вопросы) возникает как побочный эффект (эмерджентность) масштабного обучения.
  • Модели не мыслят и не понимают смысл слов — они работают с числами и статистическими закономерностями.
  • Основная архитектура современных LLM — Трансформер с механизмом внимания (attention).

🔍 Что такое LLM?

Large Language Model (LLM) — это большая языковая модель.

  • Большая: содержит триллионы параметров (настроечных чисел).
  • Языковая: работает с естественным языком (английский, русский и др.).
  • Модель: математическая функция — что-то на входе, что-то на выходе.

По сути, LLM — это нейросеть, обученная предсказывать следующий фрагмент текста.

⚙️ Базовые принципы нейросетей

  • Нейрон — математическая функция, принимающая числа, обрабатывающая их и выдающая результат.
  • Слои: входной, скрытые (сотни в больших моделях) и выходной.
  • Веса — числа, определяющие важность связи между нейронами. Изначально случайные, корректируются в процессе обучения.
  • Обучение (обратное распространение ошибки): модели показывают данные с правильными ответами, веса подстраиваются после каждой ошибки.

🚀 Архитектура Трансформер: прорыв

До 2017 года использовались рекуррентные сети (медленные, плохо удерживали контекст). Статья Google «Attention is all you need» изменила всё.

Ключевая идея Трансформера: обрабатывать весь контекст параллельно, а не последовательно.

Механизм внимания (Attention):

  • Позволяет модели определять связи между словами, даже если они далеко друг от друга.
  • Работает через три вектора для каждого слова: запрос (query), ключ (key) и значение (value).
  • Создаётся карта внимания, показывающая, насколько каждое слово важно для понимания других.

🧩 Токены и эмбединги

Токен — базовая единица текста для модели (целое слово, часть слова или символ).

  • Зачем нужны? Золотая середина между буквами (слишком длинно) и словами (огромный словарь).
  • Словарь обычно ~100 000 токенов. Русские слова часто занимают больше токенов, чем английские, поэтому LLM хуже работают с русским.

Эмбединги (Embeddings) — представление слов в виде векторов (списков чисел).

  • Слова со схожим смыслом получают близкие векторы.
  • Позволяют делать «математику со смыслом» (пример: вектор(«король») — вектор(«мужчина») + вектор(«женщина») ≈ вектор(«королева»)).
  • Дают модели возможность работать с контекстом и смыслом.

🔄 Как LLM генерирует текст: пошагово

  1. Токенизация: запрос разбивается на токены.
  2. Эмбединги: токены превращаются в числовые векторы.
  3. Обработка трансформером: векторы проходят через множество слоёв, где механизм внимания анализирует связи.
  4. Предсказание: на выходе — распределение вероятностей для следующего токена.
  5. Выбор токена: модель выбирает следующий токен (часто не самый вероятный, чтобы избежать шаблонности).
  6. Повтор: процесс повторяется, пока не сформируется полный ответ. Каждый новый шаг учитывает всю предыдущую историю (запрос + сгенерированный текст).

🎛️ Температура и сэмплинг

Почему на один вопрос бывают разные ответы?

  • Распределение вероятностей: у модели есть «рейтинг» следующих слов (например, «Москва» — 95%, «город» — 2%).
  • Сэмплинг: модель выбирает токен случайно, но в соответствии с этими вероятностями.
  • Температура:
    • ✅ Низкая (~0): модель почти всегда выбирает самый вероятный вариант. Ответы точные, но скучные.
    • 🔥 Высокая (~1 и выше): распределение «размывается», у менее вероятных слов больше шансов. Ответы креативнее, но могут быть бредовыми.

🏫 Как модели обучаются?

  1. Предварительное обучение: на терабайтах текста из интернета (книги, код, форумы). Задача — угадать следующее слово. Триллионы итераций.
  2. Дообучение (Fine-tuning) и RLHF:
    • Базовой модели не хватает умения следовать инструкциям.
    • Fine-tuning: дообучение на диалогах с примерами хороших/плохих ответов.
    • RLHF (Reinforcement Learning from Human Feedback): люди оценивают варианты ответов → обучается модель-критик → основную модель дообучают генерировать ответы, которые понравятся критику.

⚠️ Проблемы и ограничения LLM

  • Галлюцинации: модель уверенно выдаёт выдуманную информацию, так как не отличает правду от статистически вероятного текста.
  • Слабое рассуждение: плохо справляется с многошаговыми логическими задачами (хотя есть модели рассуждений — chain-of-thought).
  • Шаблонность: из-за обучения под человеческие оценки в ответах много клише («Отличный вопрос!», «Важно отметить...»).
  • Предубеждения: обучались на всём интернете, включая токсичный контент.
  • Авторские права: обучение на защищённых материалах — предмет судебных разбирательств.
  • Ограниченное контекстное окно: «рабочая память» модели (десятки/сотни тысяч токенов). Длинные диалоги забываются.
  • Ресурсозатратность: обучение стоит сотни миллионов долларов, запросы тоже недешёвые.

🛠️ Решения и тренды

  • RAG (Retrieval-Augmented Generation): решение проблемы галлюцинаций. Перед ответом система ищет информацию в актуальной базе знаний и «подсовывает» её модели как шпаргалку.
  • Квантование: хранение весов модели с меньшей точностью (в 8, 4 или 2 бита). Позволяет запускать мощные модели на обычном ПК.
  • Открытые модели: Mistral, Qwen и др. — эффективные и доступные альтернативы.
  • Агенты: LLM + оболочка, умеющая использовать инструменты (ходить в интернет, работать с файлами, выполнять действия). Примеры: Cursor (программирование), Claude Code.
  • Мультимодальность: модели учатся работать не только с текстом, но и с изображениями, аудио, видео.
  • AGI (Общий ИИ): гипотетическая цель — создать интеллект, решающий любые задачи на уровне человека. Пока остаётся предметом спекуляций и привлечения инвестиций.

💡 Где применяются LLM?

  • Программирование: GitHub Copilot, Cursor — автодополнение и генерация кода.
  • Поиск: Google, Яндекс — улучшение выдачи и генерация AI-сводок.
  • Медицина: анализ симптомов, помощь в диагностике (как инструмент для врача).
  • Образование: персональные репетиторы и AI-ассистенты в обучающих платформах.
  • Автономные агенты: автоматизация задач (бронирование, работа с проектами).

🎯 Выводы

  • LLM — не мышление, а сложное статистическое предсказание следующего слова.
  • Все удивительные способности — эмерджентное свойство масштаба данных и модели.
  • Модели — мощные инструменты-имитаторы, но не обладают сознанием или пониманием мира.
  • Будущее за агентами, мультимодальностью и методами вроде RAG, которые усиливают практическую пользу моделей, минимизируя их недостатки.