CF night-shift
Ставьте в очередь планы кодирования в течение дня, утверждайте их, выполняйте позже в изолированных рабочих областях и проверяйте отчеты. Фоновое агентское выполнение требует явно настроенного неинтерактивного исполнителя.
машинный переводПоказать оригиналСкрыть оригинал«Queue coding plans during the day, approve them, execute later in isol…»
Queue coding plans during the day, approve them, execute later in isolated worktrees, and inspect reports. Background agentic execution requires an explicitly configured non-interactive runner.
Ставьте в очередь планы кодирования в течение дня, утверждайте их, выполняйте позже в изолированных рабочих областях и проверяйте отчеты.
Как процесс F 56/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: scripts/test_queue.py, scripts/test_integration.py
Чем это грозит
Скилл содержит фрагменты, которые в чужих руках стоят денег или данных. Ниже, что рискует потерять тот, кто установит, и что должен сделать автор.
Скилл содержит команды, которые удаляют файлы, переписывают диски или исполняют код, скачанный из сети. Агент может выполнить их без вопроса, если считает, что так требует инструкция.
Замените разрушительные команды на безопасные аналоги с подтверждением, ограничьте область действия конкретной папкой и не тяните код через curl | bash: укажите версию и контрольную сумму.
Как улучшить
- Разберите находки высокой серьёзности: каждая стоит 18 баллов безопасности. Если это ложное срабатывание, добавьте код правила в guard.allow в spec.yaml.
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 3
-
высокая Опасные команды
cmd-destructive-fsscripts/verifier.py:30Разрушительная команда для файловой системы (корень / домашняя папка / диск) (строковый литерал в коде, не выполняется)":(){ :|:& };:": "Fork bomb",строка в коде -
высокая Опасные команды
cmd-destructive-fsscripts/verifier.py:36Разрушительная команда для файловой системы (корень / домашняя папка / диск) (строковый литерал в коде, не выполняется)":(){:|:&};:": "Fork bomb (alternate)",строка в коде
Средние и низкие: 1
-
низкая Опасные команды
cmd-privilegescripts/verifier.py:31Повышение привилегий / права на запись для всех (строковый литерал в коде, не выполняется)"chmod 777 /": "Root permission escalation",
строка в коде
Просканировано файлов: 21. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
missing-refссылка на отсутствующий файл: scripts/test_queue.py - предупреждение
missing-refссылка на отсутствующий файл: scripts/test_integration.py
Процессный рейтинг: все десять параметров 56/100
- 0Инструменты и файлы. Не хватает 2 файла(ов): scripts/test_queue.py, scripts/test_integration.py
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 30Повторный запуск. Изменяющих операций: 16, без проверки текущего состояния
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 85Шаги. Шагов: 251, расплывчатых формулировок: 3
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 3882 токенов
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 17. Похоже на несколько доменов в одном скилле
- low Ответ описан самодельной разметкой (5 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -32 из 16 скриптов не упомянуты в SKILL.md
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 193 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 59 заголовков
- +3Пошаговые инструкции: 251 пунктов
- +4Есть примеры (1 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 72.