AB context-engineering-review
Проанализируйте, что функция или агент LLM фактически помещает в свое контекстное окно — и найдите, что раздувает объем, отсутствует или противоречит само себе. Используйте, когда вас попросят просмотреть системный промпт и сборку контекста, сократить использование токенов без потери качества, отладить агента, который игнорирует инструкции, или проверить, как результаты поиска, история и определения инструментов упакованы в окно. Создает инвентаризацию контекста с вердиктом «сохранить/удалить/реструктурировать» для каждого компонента, исправления порядка и кэширования, а также бюджет токенов. Для настройки промпта на уровне формулировок используйте prompt-optimizer.
машинный переводПоказать оригиналСкрыть оригинал«Review what an LLM feature or agent actually puts in its context windo…»
Review what an LLM feature or agent actually puts in its context window — and find what's bloating, missing, or fighting itself. Use when asked to review a system prompt and context assembly, cut token usage without losing quality, debug an agent that ignores instructions, or audit how retrieval results, history, and tool definitions are packed into the window. Produces a context inventory with a keep/cut/restructure verdict per component, ordering and caching fixes, and a token budget. For wording-level prompt tuning use prompt-optimizer.
Проанализируйте, что функция или агент LLM фактически помещает в свое контекстное окно — и найдите, что раздувает объем, отсутствует или противоречит само себе.
Как процесс B 75/100 · Почти готов — слабые места: когда включается, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
frontmatter-keyнеизвестное поле фронтматтера "homepage"
Процессный рейтинг: все десять параметров 75/100
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 55Ошибки и развилки. Развилок: 1
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 26
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1172 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +4Нет примеров входа/выхода
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 545 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 8 заголовков
- +3Пошаговые инструкции: 26 пунктов
- +3Формат ответа описан явно
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 82.