LLM и ИИ-агенты: что это и как использовать локально
Ключевые тезисы
- LLM (Large Language Model) — это сложная математическая функция с миллиардами параметров, обученная предсказывать следующий токен в тексте.
- ИИ-агент — это комбинация LLM и обычного детерминированного кода (например, на Python), которая позволяет решать практические задачи, взаимодействуя с внешним миром (календарь, интернет, документы).
- Локальные LLM можно бесплатно запускать на своём компьютере или даже телефоне, что обеспечивает приватность, независимость от блокировок и контроль над производительностью.
- Качество решения задачи часто зависит не столько от мощности модели, сколько от грамотно спроектированного ИИ-агента, который компенсирует недостатки LLM (галлюцинации, ограниченный контекст).
- Для многих реальных задач (анализ документов, автоматизация рутины) локальных моделей достаточно, и их использование может быть экономически выгоднее облачных платных решений.
Что такое LLM и как она работает
LLM (Большая языковая модель) — это, по сути, очень умное автодополнение текста. Это математическая функция с миллиардами параметров (весов), обученная на огромных массивах текстов.
Как текст превращается в ответ
- Токенизация: Входной текст (промпт) разбивается на токены (части слов или целые слова) с помощью токенизатора. Каждому токену присваивается числовой ID из словаря модели (обычно 30-200 тыс. токенов).
- Векторизация (Эмбеддинг): Каждый ID токена преобразуется в вектор — набор из тысяч чисел. Близкие по смыслу слова имеют близкие векторы.
- Обработка в модели: Векторы подаются на вход модели. Контекстное окно модели — это максимальное количество токенов, которое она может обработать за раз (от 4 тыс. до 1 млн).
- Генерация: Модель не возвращает одно слово. Она возвращает вероятности для ВСЕХ токенов в своём словаре, указывая, какой токен должен быть следующим.
- Выбор токена: Следующий токен выбирается на основе этих вероятностей. На этот процесс влияет параметр «температура»:
Температура = 0: Ответы более детерминированные и предсказуемые.Температура ~1: Ответы более творческие и разнообразные.
- Цикл: Выбранный токен добавляется к контексту, и процесс повторяется для генерации следующего токена. Так генерируется весь ответ.
Важно: LLM по своей природе недетерминированы (вероятностны). Даже при одинаковом промпте ответы могут отличаться из-за особенностей вычислений с плавающей запятой и параллельной обработки.
Что такое ИИ-агент и зачем он нужен
ИИ-агент — это система, где LLM сочетается с обычным программным кодом. Это позволяет выйти за рамки простого чата и решать реальные задачи.
Как это работает: два подхода
- Код вызывает LLM: Например, программа мониторит чат Telegram, отправляет каждое новое сообщение в LLM с вопросом «Это спам?», и на основе ответа удаляет сообщение.
- LLM вызывает код (инструменты): Модели можно «дать» инструменты (функции). LLM сама анализирует запрос и решает, когда и какую функцию вызвать. Например, агент для генерации бухгалтерских документов сам решает, когда запросить у пользователя недостающие реквизиты, а когда вызвать функцию формирования счёта.
Практические примеры агентов (показаны в видео)
- Агент для бухгалтерских документов: Работает на локальной модели Qwen. Принимает от пользователя описание работ и реквизиты (в тексте, PDF или даже на фото), валидирует данные и генерирует счёт и акт.
- Агент для поиска отзывов о книгах: Работает на локальной модели Gemma 4 на iPhone. Умеет:
- Распознавать название и автора книги по фотографии обложки.
- Вызывать кастомный JavaScript-код (скилл), который ищет книгу на Литрес и возвращает отзывы.
- Всё работает полностью оффлайн.
Локальные vs. Облачные модели: разбор мифов
Автор разбирает распространённые заблуждения из комментариев к предыдущим видео.
| Миф / Утверждение | Контраргумент и реальность |
|---|---|
Локальные модели — игрушка, для реальных задач нужен Claude/GPT-4 |
Многие реальные задачи (распознавание речи в Handy, обработка документов) прекрасно решаются локальными моделями. Качество агента часто важнее мощности модели. |
Локальные модели не хранят контекст, их нельзя дообучить |
Хранение контекста — задача агента, а не LLM. Агент может хранить историю в БД (например, SQLite) и передавать в модель только нужные части. Локальные модели тоже можно дообучать. |
У локальных моделей слишком маленькое контекстное окно |
У современных локальных моделей (например, Qwen) контекстное окно может достигать 262 тыс. токенов. Для многих задач хватает и 4 тыс., если грамотно проектировать промпты агента. |
Локальные модели бесполезны, так как плохо пишут код |
Написание кода — лишь одна из бесчисленных задач для ИИ-агентов. Агенты для автоматизации бизнес-процессов (бронирование, документооборот) могут быть сверхполезны и без генерации кода. |
Платные модели дёшевы, локальные невыгодны |
При активном использовании (24/7) оплата по токенам для облачных моделей может составить миллионы рублей в год. Локальное решение — разовые затраты на железо + электричество. |
В локальных LLM нет structured output |
Локальные модели можно промптами заставить возвращать JSON. Валидацию и обработку ошибок обеспечивает код агента. |
Квантованные модели — мусор |
Квантование сжимает модель с некоторой потерей качества, но для многих задач этого достаточно (пример — рабочий агент на квантованной Qwen). |
32 ГБ ОЗУ на ноутбуке — нереально дорого |
Ноутбуки с 32 ГБ ОЗУ можно найти на Avito за ~25 тыс. руб. iPhone 15 Pro также успешно запускает локальные модели (Gemma 4). |
Если ответ генерируется дольше 2 секунд — это мусор |
Для многих задач (анализ, reasoning) важнее качество решения, а не скорость. Агент по документам может работать минуту, и это не критично. |
Модель должна целиком помещаться в VRAM видеокарты |
Не обязательно. Такие программы, как LM Studio, умеют загружать часть модели в VRAM, а часть — в обычную оперативную память. |
Выводы
- LLM — это инструмент, мощный, но ограниченный (вероятностный, с ограниченным контекстом). Ключ к практической пользе — в создании ИИ-агентов, которые объединяют силу LLM с надёжностью детерминированного кода.
- Локальные модели — это практично. Они обеспечивают приватность, контроль и независимость от зарубежных сервисов. Для множества задач их качества более чем достаточно.
- Будущее за гибридными подходами: В одном агенте можно использовать и локальные модели для простых задач, и мощные облачные — для сложных.
- Программисты останутся востребованы. LLM — это мультипликатор навыков, а не замена. Чтобы эффективно использовать ИИ, нужно понимать, как всё работает «под капотом», уметь проектировать системы, проверять и дорабатывать сгенерированный код.
Локальные модели — игрушка, для реальных задач нужен Claude/GPT-4