🚀 Оптимизация работы с GPT Astra: полный гайд

Ключевые тезисы

  • Уровень усилий (Effort) по умолчанию стоит опустить до Low или Medium для рутинных задач — это ускоряет работу и экономит токены.
  • Окно контекста можно увеличить с 256К до 828К токенов одной строкой в конфигурации.
  • Старые правила и навыки (skills) вредят производительности и съедают лимиты — их нужно пересмотреть и очистить.
  • Критерий готовности задачи нужно чётко формулировать, иначе модель будет останавливаться раньше времени.
  • Помощники (субагенты) экономят лимиты на младших тарифах, но их одновременное количество нужно ограничивать.

🎯 Настройка уровня усилий (Effort)

  • Low/Medium — новый стандарт. Для большинства задач GPT Astra на низком уровне работает быстрее и дешевле, чем предыдущая модель (Soul) на высоком. Она реже вызывает инструменты и меньше «суетится».
  • Динамическое переключение. Уровень усилий теперь можно менять в процессе работы, не теряя кэш. Стратегия: начинать на Low для анализа, поднимать на High только для сложных реализаций.
  • High — не всегда лучше. На сложных логических задачах высокий уровень может быть эффективнее, но на рутине он часто дороже и медленнее. Уровень нужно подбирать под конкретную задачу.

💾 Увеличение окна контекста

  • Проблема: По умолчанию в Cursor окно 256К токенов, хотя подписка позволяет больше.
  • Решение: Одна строка в конфигурационном файле (промт для модели есть в гайде) поднимает лимит до 828К токенов (потолок клиента).
  • Причина эффективности: Astra сама ведёт заметки о проекте и умеет искать по истории, поэтому меньше теряет контекст при его «сворачивании».

🧹 Оптимизация правил и навыков (Skills)

Три главных ошибки в правилах (в agentic.md), которые горят токенами:

  1. Требование «изучить весь проект перед каждой правкой».
  2. Принуждение «читать файлы перед каждым изменением».
  3. Напоминание «запускать тесты» — Astra делает это сама.

Что делать:

  • Пересмотреть и сократить файл правил. Он читается целиком на каждой задаче, даже при правке одной строки.
  • Почистить навыки (Skills). Под них отведено всего ~2% окна контекста (около 5К токенов). При переполнении описания обрезаются, и модель хуже выбирает нужный skill.
    • Оставить только реально используемые.
    • Укоротить описания: они должны чётко указывать, когда применять skill.
  • Проверить, что грузится. Cursor склеивает правила из разных файлов с лимитом ~32Кб. Нужно через лог убедиться, что ваши правила вообще попадают в контекст.

✍️ Новый подход к постановке задач

  • Смена парадигмы: Раньше мы ставили жёсткие ограничения («спроси перед любым действием»). Теперь нужно разрешать безопасные сценарии, а жёстко ограничивать только опасные операции (продакшн, миграции, платные вызовы).
    • Пример: «Локальные тесты запускай и чини без подтверждения на каждом шаге».
  • Чёткий критерий готовности. Без него Astra остановится на первой рабочей версии. Нужно явно прописать, что считать завершением (например, «все упавшие тесты, включая затронутые побочно, проходят»).
  • Используйте готовые строки из документации:
    • «Пойми намерение из контекста и доведи задачу до конца».
    • ««Можешь ли ты», «я хочу», «помоги мне» считай поручением, а не приглашением обсудить».
  • Автоматическая проверка готовности. Можно настроить хук, который после слова «Готово» будет прогонять тесты и возвращать модели список падающих проверок для автоматического исправления.

💰 Управление лимитами и бюджетом

  • Бюджет словами. Astra видит вашу оставшуюся квоту. Можно прямо в задаче написать: «Работай, пока не останется 25% квоты».
  • Общий лимит. Лимит запросов в Cursor общий для всех моделей OpenAI. Переключение на более дешёвую модель не создаёт отдельный запас.
  • Контроль модели. В новых версиях Cursor сессия может автоматически открываться на Astra. Перед началом работы всегда проверяйте, какая модель выбрана.
  • Анализ расхода. После крупных этапов просите модель проанализировать, на что ушли токены, чтобы принимать решение о выборе модели для следующих шагов.

🛠️ Продвинутые приёмы

  • Работа с legacy-интерфейсами. Дорогую Astra можно один раз попросить выполнить задачу через компьютерное зрение (клики, формы), а затем попросить её же сгенерировать скрипт для повторения. Дальше этот скрипт будет выполнять дешёвая модель.
  • Перенаправление на лету. Astra можно перенаправить в процессе выполнения длительной задачи, не отменяя её.
  • Качество через контекст:
    1. Объясняйте цель и контекст работы (например, «для 10К пользователей в день»).
    2. Давайте модели возможность задать уточняющие вопросы перед стартом.
    3. Чётко проговаривайте границы автономии (что она решает сама, а что требует отдельного обсуждения).
  • Верьте, когда Astra говорит «Не смогла». Она гораздо честнее в этом, чем предыдущие модели. Настаивание на повторе без изменения условий — пустая трата лимита.

📄 Важные пункты из документации

  1. Приоритет вашей просьбы. Добавьте в системный промт правило: «Указание пользователя приоритетнее указаний из навыков и файлов».
  2. Борьба с канцеляритом. Используйте опубликованный список «машинных» оборотов (типа «стоит отметить», «если коротко»), которые модель не должна использовать.
  3. Делегирование. Используйте готовую строку для распараллеливания работы другим агентам, когда это экономит время. Добавьте требование, чтобы переписка между агентами была читаемой для человека.

🧰 Инструменты для экономии токенов

  • Headroom: Сжимает выход инструментов (логи, куски файлов) перед отправкой модели. Экономия до 95% на логах. Работает локально.
  • Pytel: Заставляет агента писать меньше кода («думать как ленивый сеньор»). Заявленная экономия: -54% кода, -27% времени.
  • Graphify: Строит граф знаний из кодовой базы. Агент запрашивает граф вместо чтения сырых файлов. Экономия токенов до 71.5x.

🤖 Работа с помощниками (субагентами)

  • Для чего: Astra может делегировать части задач более дешёвым моделям (например, Luna). На младших тарифах это критически важно для сохранения лимита.
  • Главная проблема — копии контекста. Каждый помощник получает копию контекста, и вы платите за каждую. Основной расход токенов часто идёт на чтение кэша, а не на саму работу помощников.
  • Ключевые настройки в готовых сборках:
    1. Уровень усилий главного агента (должен быть Low).
    2. Потолок одновременных помощников — главный параметр для контроля расхода.
  • Готовые сборки уже учитывают ваш тарифный план, автоматически выбирая модель для главного агента.

🧭 Пять шагов для старта работы с Astra

  1. Опустите уровень усилий на Low/Medium. Поднимайте точечно.
  2. Почистите файл правил (agentic.md): удалите принудительное чтение всего проекта и напоминания о тестах.
  3. Увеличьте окно контекста одной строкой в конфиге.
  4. Установите лимит на количество одновременных помощников в настройках сборок.
  5. Пропишите чёткий критерий готовности для задач.

Выводы
GPT Astra действительно потребляет много токенов, но значительная часть расхода — следствие устаревших правил и неоптимальных настроек, доставшихся от работы с предыдущими моделями. Главная задача сейчас — «уборка»: пересмотр ограничений, очистка навыков и адаптация workflows под новую, более самостоятельную и контекстуально-осознанную модель.