🧠 LLM и ИИ-агенты: что это и как использовать локально

🎯 Ключевые тезисы

  • LLM (Large Language Model) — это сложная математическая функция с миллиардами параметров, обученная предсказывать следующий токен в тексте.
  • ИИ-агент — это комбинация LLM и обычного детерминированного кода (например, на Python), которая позволяет решать практические задачи, взаимодействуя с внешним миром (календарь, интернет, документы).
  • Локальные LLM можно бесплатно запускать на своём компьютере или даже телефоне, что обеспечивает приватность, независимость от блокировок и контроль над производительностью.
  • Качество решения задачи часто зависит не столько от мощности модели, сколько от грамотно спроектированного ИИ-агента, который компенсирует недостатки LLM (галлюцинации, ограниченный контекст).
  • Для многих реальных задач (анализ документов, автоматизация рутины) локальных моделей достаточно, и их использование может быть экономически выгоднее облачных платных решений.

🔬 Что такое LLM и как она работает

LLM (Большая языковая модель) — это, по сути, очень умное автодополнение текста. Это математическая функция с миллиардами параметров (весов), обученная на огромных массивах текстов.

🧩 Как текст превращается в ответ

  1. Токенизация: Входной текст (промпт) разбивается на токены (части слов или целые слова) с помощью токенизатора. Каждому токену присваивается числовой ID из словаря модели (обычно 30-200 тыс. токенов).
  2. Векторизация (Эмбеддинг): Каждый ID токена преобразуется в вектор — набор из тысяч чисел. Близкие по смыслу слова имеют близкие векторы.
  3. Обработка в модели: Векторы подаются на вход модели. Контекстное окно модели — это максимальное количество токенов, которое она может обработать за раз (от 4 тыс. до 1 млн).
  4. Генерация: Модель не возвращает одно слово. Она возвращает вероятности для ВСЕХ токенов в своём словаре, указывая, какой токен должен быть следующим.
  5. Выбор токена: Следующий токен выбирается на основе этих вероятностей. На этот процесс влияет параметр «температура»:
    • Температура = 0: Ответы более детерминированные и предсказуемые.
    • Температура ~1: Ответы более творческие и разнообразные.
  6. Цикл: Выбранный токен добавляется к контексту, и процесс повторяется для генерации следующего токена. Так генерируется весь ответ.

💡 Важно: LLM по своей природе недетерминированы (вероятностны). Даже при одинаковом промпте ответы могут отличаться из-за особенностей вычислений с плавающей запятой и параллельной обработки.


🤖 Что такое ИИ-агент и зачем он нужен

ИИ-агент — это система, где LLM сочетается с обычным программным кодом. Это позволяет выйти за рамки простого чата и решать реальные задачи.

💡 Как это работает: два подхода

  1. Код вызывает LLM: Например, программа мониторит чат Telegram, отправляет каждое новое сообщение в LLM с вопросом «Это спам?», и на основе ответа удаляет сообщение.
  2. LLM вызывает код (инструменты): Модели можно «дать» инструменты (функции). LLM сама анализирует запрос и решает, когда и какую функцию вызвать. Например, агент для генерации бухгалтерских документов сам решает, когда запросить у пользователя недостающие реквизиты, а когда вызвать функцию формирования счёта.

🔥 Практические примеры агентов (показаны в видео)

  • Агент для бухгалтерских документов: Работает на локальной модели Qwen. Принимает от пользователя описание работ и реквизиты (в тексте, PDF или даже на фото), валидирует данные и генерирует счёт и акт.
  • Агент для поиска отзывов о книгах: Работает на локальной модели Gemma 4 на iPhone. Умеет:
    • Распознавать название и автора книги по фотографии обложки.
    • Вызывать кастомный JavaScript-код (скилл), который ищет книгу на Литрес и возвращает отзывы.
    • Всё работает полностью оффлайн.

🏠 Локальные vs. Облачные модели: разбор мифов

Автор разбирает распространённые заблуждения из комментариев к предыдущим видео.

Миф / Утверждение Контраргумент и реальность
🚫 Локальные модели — игрушка, для реальных задач нужен Claude/GPT-4 Многие реальные задачи (распознавание речи в Handy, обработка документов) прекрасно решаются локальными моделями. Качество агента часто важнее мощности модели.
🚫 Локальные модели не хранят контекст, их нельзя дообучить Хранение контекста — задача агента, а не LLM. Агент может хранить историю в БД (например, SQLite) и передавать в модель только нужные части. Локальные модели тоже можно дообучать.
🚫 У локальных моделей слишком маленькое контекстное окно У современных локальных моделей (например, Qwen) контекстное окно может достигать 262 тыс. токенов. Для многих задач хватает и 4 тыс., если грамотно проектировать промпты агента.
🚫 Локальные модели бесполезны, так как плохо пишут код Написание кода — лишь одна из бесчисленных задач для ИИ-агентов. Агенты для автоматизации бизнес-процессов (бронирование, документооборот) могут быть сверхполезны и без генерации кода.
🚫 Платные модели дёшевы, локальные невыгодны При активном использовании (24/7) оплата по токенам для облачных моделей может составить миллионы рублей в год. Локальное решение — разовые затраты на железо + электричество.
🚫 В локальных LLM нет structured output Локальные модели можно промптами заставить возвращать JSON. Валидацию и обработку ошибок обеспечивает код агента.
🚫 Квантованные модели — мусор Квантование сжимает модель с некоторой потерей качества, но для многих задач этого достаточно (пример — рабочий агент на квантованной Qwen).
🚫 32 ГБ ОЗУ на ноутбуке — нереально дорого Ноутбуки с 32 ГБ ОЗУ можно найти на Avito за ~25 тыс. руб. iPhone 15 Pro также успешно запускает локальные модели (Gemma 4).
🚫 Если ответ генерируется дольше 2 секунд — это мусор Для многих задач (анализ, reasoning) важнее качество решения, а не скорость. Агент по документам может работать минуту, и это не критично.
🚫 Модель должна целиком помещаться в VRAM видеокарты Не обязательно. Такие программы, как LM Studio, умеют загружать часть модели в VRAM, а часть — в обычную оперативную память.

💎 Выводы

  • LLM — это инструмент, мощный, но ограниченный (вероятностный, с ограниченным контекстом). Ключ к практической пользе — в создании ИИ-агентов, которые объединяют силу LLM с надёжностью детерминированного кода.
  • Локальные модели — это практично. Они обеспечивают приватность, контроль и независимость от зарубежных сервисов. Для множества задач их качества более чем достаточно.
  • Будущее за гибридными подходами: В одном агенте можно использовать и локальные модели для простых задач, и мощные облачные — для сложных.
  • Программисты останутся востребованы. LLM — это мультипликатор навыков, а не замена. Чтобы эффективно использовать ИИ, нужно понимать, как всё работает «под капотом», уметь проектировать системы, проверять и дорабатывать сгенерированный код.