Оптимизация работы с GPT Astra: полный гайд
Ключевые тезисы
- Уровень усилий (Effort) по умолчанию стоит опустить до Low или Medium для рутинных задач — это ускоряет работу и экономит токены.
- Окно контекста можно увеличить с 256К до 828К токенов одной строкой в конфигурации.
- Старые правила и навыки (skills) вредят производительности и съедают лимиты — их нужно пересмотреть и очистить.
- Критерий готовности задачи нужно чётко формулировать, иначе модель будет останавливаться раньше времени.
- Помощники (субагенты) экономят лимиты на младших тарифах, но их одновременное количество нужно ограничивать.
Настройка уровня усилий (Effort)
- Low/Medium — новый стандарт. Для большинства задач GPT Astra на низком уровне работает быстрее и дешевле, чем предыдущая модель (Soul) на высоком. Она реже вызывает инструменты и меньше «суетится».
- Динамическое переключение. Уровень усилий теперь можно менять в процессе работы, не теряя кэш. Стратегия: начинать на Low для анализа, поднимать на High только для сложных реализаций.
- High — не всегда лучше. На сложных логических задачах высокий уровень может быть эффективнее, но на рутине он часто дороже и медленнее. Уровень нужно подбирать под конкретную задачу.
Увеличение окна контекста
- Проблема: По умолчанию в Cursor окно 256К токенов, хотя подписка позволяет больше.
- Решение: Одна строка в конфигурационном файле (промт для модели есть в гайде) поднимает лимит до 828К токенов (потолок клиента).
- Причина эффективности: Astra сама ведёт заметки о проекте и умеет искать по истории, поэтому меньше теряет контекст при его «сворачивании».
Оптимизация правил и навыков (Skills)
Три главных ошибки в правилах (в agentic.md), которые горят токенами:
- Требование «изучить весь проект перед каждой правкой».
- Принуждение «читать файлы перед каждым изменением».
- Напоминание «запускать тесты» — Astra делает это сама.
Что делать:
- Пересмотреть и сократить файл правил. Он читается целиком на каждой задаче, даже при правке одной строки.
- Почистить навыки (Skills). Под них отведено всего ~2% окна контекста (около 5К токенов). При переполнении описания обрезаются, и модель хуже выбирает нужный skill.
- Оставить только реально используемые.
- Укоротить описания: они должны чётко указывать, когда применять skill.
- Проверить, что грузится. Cursor склеивает правила из разных файлов с лимитом ~32Кб. Нужно через лог убедиться, что ваши правила вообще попадают в контекст.
Новый подход к постановке задач
- Смена парадигмы: Раньше мы ставили жёсткие ограничения («спроси перед любым действием»). Теперь нужно разрешать безопасные сценарии, а жёстко ограничивать только опасные операции (продакшн, миграции, платные вызовы).
- Пример: «Локальные тесты запускай и чини без подтверждения на каждом шаге».
- Чёткий критерий готовности. Без него Astra остановится на первой рабочей версии. Нужно явно прописать, что считать завершением (например, «все упавшие тесты, включая затронутые побочно, проходят»).
- Используйте готовые строки из документации:
- «Пойми намерение из контекста и доведи задачу до конца».
- ««Можешь ли ты», «я хочу», «помоги мне» считай поручением, а не приглашением обсудить».
- Автоматическая проверка готовности. Можно настроить хук, который после слова «Готово» будет прогонять тесты и возвращать модели список падающих проверок для автоматического исправления.
Управление лимитами и бюджетом
- Бюджет словами. Astra видит вашу оставшуюся квоту. Можно прямо в задаче написать: «Работай, пока не останется 25% квоты».
- Общий лимит. Лимит запросов в Cursor общий для всех моделей OpenAI. Переключение на более дешёвую модель не создаёт отдельный запас.
- Контроль модели. В новых версиях Cursor сессия может автоматически открываться на Astra. Перед началом работы всегда проверяйте, какая модель выбрана.
- Анализ расхода. После крупных этапов просите модель проанализировать, на что ушли токены, чтобы принимать решение о выборе модели для следующих шагов.
Продвинутые приёмы
- Работа с legacy-интерфейсами. Дорогую Astra можно один раз попросить выполнить задачу через компьютерное зрение (клики, формы), а затем попросить её же сгенерировать скрипт для повторения. Дальше этот скрипт будет выполнять дешёвая модель.
- Перенаправление на лету. Astra можно перенаправить в процессе выполнения длительной задачи, не отменяя её.
- Качество через контекст:
- Объясняйте цель и контекст работы (например, «для 10К пользователей в день»).
- Давайте модели возможность задать уточняющие вопросы перед стартом.
- Чётко проговаривайте границы автономии (что она решает сама, а что требует отдельного обсуждения).
- Верьте, когда Astra говорит «Не смогла». Она гораздо честнее в этом, чем предыдущие модели. Настаивание на повторе без изменения условий — пустая трата лимита.
Важные пункты из документации
- Приоритет вашей просьбы. Добавьте в системный промт правило: «Указание пользователя приоритетнее указаний из навыков и файлов».
- Борьба с канцеляритом. Используйте опубликованный список «машинных» оборотов (типа «стоит отметить», «если коротко»), которые модель не должна использовать.
- Делегирование. Используйте готовую строку для распараллеливания работы другим агентам, когда это экономит время. Добавьте требование, чтобы переписка между агентами была читаемой для человека.
Инструменты для экономии токенов
- Headroom: Сжимает выход инструментов (логи, куски файлов) перед отправкой модели. Экономия до 95% на логах. Работает локально.
- Pytel: Заставляет агента писать меньше кода («думать как ленивый сеньор»). Заявленная экономия: -54% кода, -27% времени.
- Graphify: Строит граф знаний из кодовой базы. Агент запрашивает граф вместо чтения сырых файлов. Экономия токенов до 71.5x.
Работа с помощниками (субагентами)
- Для чего: Astra может делегировать части задач более дешёвым моделям (например, Luna). На младших тарифах это критически важно для сохранения лимита.
- Главная проблема — копии контекста. Каждый помощник получает копию контекста, и вы платите за каждую. Основной расход токенов часто идёт на чтение кэша, а не на саму работу помощников.
- Ключевые настройки в готовых сборках:
- Уровень усилий главного агента (должен быть Low).
- Потолок одновременных помощников — главный параметр для контроля расхода.
- Готовые сборки уже учитывают ваш тарифный план, автоматически выбирая модель для главного агента.
Пять шагов для старта работы с Astra
- Опустите уровень усилий на Low/Medium. Поднимайте точечно.
- Почистите файл правил (
agentic.md): удалите принудительное чтение всего проекта и напоминания о тестах. - Увеличьте окно контекста одной строкой в конфиге.
- Установите лимит на количество одновременных помощников в настройках сборок.
- Пропишите чёткий критерий готовности для задач.
Выводы
GPT Astra действительно потребляет много токенов, но значительная часть расхода — следствие устаревших правил и неоптимальных настроек, доставшихся от работы с предыдущими моделями. Главная задача сейчас — «уборка»: пересмотр ограничений, очистка навыков и адаптация workflows под новую, более самостоятельную и контекстуально-осознанную модель.