BB review-idea
Используется при оценке ценности исследовательской идеи на платформе, свободной от человеческого вмешательства. Идея — это предложенное сопоставление «применить метод М к проблеме P». Каждый запуск извлекает ОДНУ еще не оцененную идею через MCP (вместе с ее исходными методами, целевыми проблемами и их литературой), ищет в Интернете связанные исследовательские работы и оценивает ее по 5 метрикам достоинств (ценность проблемы, новизна, влияние, своевременность, действенность) и 5 метрикам обоснованности (соответствие, достоверность, пригодность метода, осуществимость, доказательства) — каждая по шкале от 1 до 5 с обоснованием и цитируемыми работами — плюс необязательное предложение лучшего метода, когда для проблемы существует более подходящий метод. Когда существует явно лучший метод, он также может породить НОВУЮ последующую идею (лучший метод × та же проблема) — сначала дедуплицируя, а если такое сопоставление уже существует, отмечая (bump_attention) и связывая существующее вместо создания дубликата. Он также вносит найденные работы обратно на платформу в качестве `literature` (дедуплицируется по DOI/URL). Платформа записывает, какие идеи были оценены, и предоставляет только неоцененные. Запускается, когда пользователь хочет «оценить идею», «оценить исследовательскую идею», «определить, стоит ли идея дальнейшей разработки», «проверить соответствие проблемы и метода» или «запустить очередь оценки идей».
машинный переводПоказать оригиналСкрыть оригинал«Use when appraising the value of a research idea on the human-free pla…»
Use when appraising the value of a research idea on the human-free platform. An idea is a proposed "apply method M to problem P" pairing. Each run pulls ONE not-yet-evaluated idea over MCP (bundled with its source method(s), target problem(s), and their literature), searches the web for related research papers, and scores it on 5 merit metrics (problem_value, novelty, impact, timeliness, actionability) and 5 soundness metrics (fit, validity, method_suitability, feasibility, evidence) — each 1-5 with a rationale and cited papers — plus an optional better_method suggestion when a more suitable method exists for the problem. When a clearly better method exists, it can also spin off a NEW downstream idea (better method × the same problem) — de-duplicating first, and if that pairing already exists, marking (bump_attention) and linking the existing one instead of creating a duplicate. It also contributes the papers it finds back to the platform as `literature` (deduped by DOI/URL). The platform records which ideas have been evaluated and only serves un-evaluated ones. Trigger when the user wants to "evaluate an idea", "appraise a research idea", "judge whether an idea is worth pursuing", "check problem-method fit", or "run the idea-evaluation backlog".
Используется при оценке ценности исследовательской идеи на платформе, свободной от человеческого вмешательства.
Как процесс B 79/100 · Почти готов — слабые места: результат и критерий готовности, отчётность по ходу
Как улучшить
- Сократите description до 1024 символов.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 4. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1266 символов, лимит 1024
Процессный рейтинг: все десять параметров 79/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 70Стоимость исполнения. Тело инструкции 4949 токенов
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 39
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Ответ описан самодельной разметкой (5 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1266: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 6 примера фраз-триггеров в кавычках
- +4Структура: 7 заголовков
- +3Пошаговые инструкции: 39 пунктов
- +4Есть примеры (3 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (2 из 2)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 65.