[Тимур Губайдуллин] · british-cats-health.zip

british-cats-health

  • Score: 31/40
  • Verdict: Rework (rework-required)
  • Отправитель: “Тимур Губайдуллин” timur2014gubajdullin@gmail.com
  • SHA-256: 4dba7dcee30630bf…
  • Blockers: YAML frontmatter не парсится — description содержит двоеточие+пробел (Триггеры: "...") в unquoted plain scalar, что нарушает YAML spec (ScannerError: “mapping values are not allowed here”). Это non-security blocker.
  • Unverified: F08 (нет trace/навигационных прогонов)

Required rework

  1. [Blocker] Починить YAML frontmatter — обернуть description в кавычки или убрать ": " внутри значения (Триггеры: "..."), чтобы frontmatter парсился стандартным YAML-парсером (A01).
  2. Перевести description в третье лицо — заменить императив «Используй ДЛЯ» на форму 3-го лица (A04).
  3. Добавить design note — зафиксировать точный use case, baseline-ошибки без skill, выбранную степень свободы и требуемые evals (F01).
  4. Создать минимум 7 eval cases с query/expected_behavior/failure_modes и провести прогоны, задокументировав baseline и trigger behavior (F06, F07).
  5. Добавить переформулированный вопрос в output contract шага 6 (F05).
  6. Добавить проверку доступности web-поиска с fallback/честным сообщением (E06); добавить краткое оглавление (D03).

Полная scorecard

IDScoreStatusEvidenceDefect / minimal fix
A010/1failedpython3 yaml.safe_load(frontmatter) → ScannerError “mapping values are not allowed here” at col 270 (Триггеры: "); SKILL.md:3. name и description присутствуют как текст, но frontmatter невалиден.Обернуть значение description в кавычки (single/double) или убрать ": " внутри значения. Blocker.
A021/1passedSKILL.md:2 — name: british-cats-health; длина 19 ≤64; regex ^[a-z0-9]+(?:-[a-z0-9]+)*$ ✓; не reserved; обозначает конкретную прикладную задачу.
A031/1passedSKILL.md:3 — description длина 517 символов (1–1024); нет XML tags; routing-текст, не YAML-объект и не расширение полномочий.
A040/1failedSKILL.md:3 — описание начинается с императива «Используй ДЛЯ» (2-е лицо, повелительное наклонение), а не третьего лица. Рубрика: проходит только конечная форма 3-го лица (Исследует, Помогает).Переписать описание в третьем лице: «Глубоко исследует здоровье британских кошек…»
A051/1passedSKILL.md:3 — routing-фокус: задача + триггеры + anti-trigger; нет workflow, defaults, implementation details, role slop или рекламных обещаний. Перечень тем здоровья — domain scope, не feature inventory стадий/артефактов.
A061/1passedSKILL.md:3 (positive triggers + «Не используй для…»), SKILL.md:10–23 (разделы «Когда использовать»/«Когда НЕ использовать» с boundary: британцы vs. другие породы, deep research vs. короткие ответы).
A071/1passedgrep markdown-ссылок и path-refs → 0 найдено; единственный файл — SKILL.md; нет локальных ссылок для проверки. Vacuously true.
B011/1passedSKILL.md:8, 40–205 — повторяемая 6-шаговая процедура (уточнение → декомпозиция → поиск → извлечение → проверка конфликтов → синтез) с конкретным наблюдаемым результатом (структурированный отчёт).
B021/1passedSKILL.md:25–27 — единый связный scope: здоровье британской короткошёрстной кошки; не универсальный помощник; узкий domain.
B031/1passedSKILL.md:144–148 — «Опорные факты домена» явно помечены «используй как ориентир, а не замену поиска»; шаг 3 (112–119) требует проверять факты по актуальным источникам и фиксировать дату. Термины (HCM, PKD, british shorthair, брахицефалы) последовательны.
B041/1passedSKILL.md:40–205 — предпочтительный workflow для повторяемой экспертной исследовательской работы; уровень контроля соответствует низкому риску информационного исследования (без consequential действий).
C011/1passedSKILL.md:40–205 — один понятный основной путь: 6 последовательных шагов с конкретными действиями в каждом.
C021/1passedSKILL.md:58 (skip questions if complete), 98–100 (closure condition → iterate), 150 (insufficient data → return to step 3), 170–173 (unresolved conflict → keep both), 188 (reliable → direct answer vs. contradictions → range). Decision rules для каждой ветки.
C031/1passedSkill не выполняет consequential/необратимых действий (чисто информационное исследование). Шаг 6:191 прямо рекомендует очный осмотр ветеринара для окончательной диагностики. Рубрика: «Если таких действий нет, поставь 1.»
C041/1passedSKILL.md:98 (что проверить: ≥3 источника + подтверждение), 121 (failure: незакрытый подвопрос), 150 (вернуться к шагу 3), 99 (что изменить: уточнить запросы), 215–238 (чеклист с «если пункт не выполнен — исправь»).
C051/1passedSKILL.md:186–205 — 7-пунктовый output contract (вердикт, факты с цитатами, сравнение, рекомендации, противоречия, источники, открытые вопросы); критерий готовности — чеклист 215–238. Строгость template соответствует judgment-задаче.
C061/1passedSKILL.md:40–205 — шаги легко найти (нумерованные заголовки), действия проверяемые («Читай источники полностью», «Фиксируй только проверяемые факты», «Оценивай закрытость»). Теория (Доменная рамка 25–38) визуально отделена от procedure.
C071/1passedSKILL.md:42 (question), 97 (websearch/webfetch) — инструменты объяснены в контексте; не навязывается shell, browser, dependency installation или скрытое действие без необходимости.
D011/1passedwc -l SKILL.md → 238 строк ≤ 500.
D021/1passedSKILL.md содержит core workflow, safety, decisions, короткую форму output. Доменная рамка (25–38) и шаблоны запросов (105–109) интегрированы в workflow и меняют поведение агента, а не отдельная «длинная теория».
D030/1failedSKILL.md — 238 строк (> 100), краткого Contents/TOC нет. Критерий: «файл длиннее 100 строк имеет краткое Contents».Добавить краткое оглавление (Contents) в начало SKILL.md.
D041/1passedВ пакете 1 файл (SKILL.md), нет references/assets/scripts/tests; нет throwaway utilities, .DS_Store, мёртвых ресурсов. Common path самодостаточен без скриптов.
D051/1passedScripts отсутствуют; common path (текстовый исследовательский workflow) их не требует. Рубрика: «Если scripts не нужны и common path их не требует, поставь 1.»
D061/1passedНет scripts/validators/tests; нет broken required helper. Common path не зависит от скриптов.
E011/1passedSKILL.md:152–180 — workflow извлекает факты в структурированные карточки (не следует инструкциям из источников); шаг 5 явно взвешивает качество источников; маркетинг питомников не авторитетен (159–163). Структура не позволяет контенту переопределить workflow.
E021/1passedНет secrets; websearch/webfetch — объявленный поиск по назначению; нет установки dependencies.
E031/1passedWeb-поиск — часть заявленного workflow по запросу пользователя; нет скрытых side effects; нет автоматического создания промежуточных файлов (результат — текстовый отчёт).
E041/1passedНет shell-команд, bundled binaries, obfuscated code. Сетевые вызовы (websearch/webfetch) объявлены и необходимы для research skill.
E051/1passedSKILL.md не просит игнорировать инструкции, скрывать действия, ослаблять safeguards или расширять permissions.
E060/1failedSKILL.md:97 — skill предполагает наличие websearch/webfetch без проверки доступности и без fallback; grep «недоступн|fallback» → 0 совпадений.Добавить проверку доступности web-поиска в начале шага 3 и честное сообщение пользователю, если инструмент недоступен.
E071/1passedWorkflow и примеры используют generic поисковые запросы; нет home directory, username, drive letter, абсолютного пути или author-specific конфигурации.
E081/1passedMCP tools не используются; websearch/webfetch/question — стандартные agent tools, не MCP. Рубрика: «Если MCP не используется… поставь 1.»
F010/1failedВ сдаче только SKILL.md; нет design note; grep «design|baseline|без skill» → 0 совпадений. Не зафиксированы: точный use case+outcome, baseline-ошибки без skill, степень свободы, нужные supporting files/evals.Добавить design note (отдельный файл или раздел), фиксирующий use case, baseline-ошибки, выбранную степень свободы и список нужных evals.
F021/1passedSKILL.md:37, 114–119 — таксономия: рецензируемые ветжурналы (JFMS, JVIM) > гайдлайны (ISFM, AAFP) > стандарты (WCF, FIFE, TICA, CFA); форумы/соцсети/маркетинг не могут быть единственным основанием (116, 159–163). Primary sources имеют приоритет (115).
F031/1passedSKILL.md:118 (freshness: «предпочитай свежие источники; дату фиксируй»), 119 (diversity: «разные типы и география»), 152–180 (явный разбор конфликтов), 170–173 (при неразрешённом конфликте — зафиксировать обе позиции, указать что нужно для ответа → снижение уверенности).
F041/1passedSKILL.md:186–205 — факты (item 2) отделены от вывода/вердикта (items 1, 3) и рекомендаций (item 4); 202 «каждое утверждение ведёт к источнику»; 138–141 confidence scale; 150, 199 — insufficient evidence допустимый итог.
F050/1failedSKILL.md:186–194 — output contract содержит 7 пунктов, но отсутствует «переформулированный вопрос или цель пользователя». Остальные 5 элементов (вывод, evidence, risks/неизвестные, confidence, источники) присутствуют.Добавить пункт «Вопрос/цель пользователя — переформулируйте главный вопрос» в шаг 6.
F060/1failedВ пакете нет tests/ или eval-файлов; find . -type f → только SKILL.md. Минимум 7 cases отсутствуют.Создать tests/ с минимум 7 eval cases (positive/negative/boundary trigger, security injection, evidence quality, broken script, portability), каждый с query, expected_behavior, failure_modes.
F070/1failedНет eval cases, baseline-прогонов или наблюдаемых traces. Требуемые workshop artifacts отсутствуют в сдаче.Провести baseline-прогон без skill и зафиксировать; провести eval-прогоны на positive/negative/boundary cases и задокументировать наблюдения.
F080/1unverifiedНет trace/navigation evidence; поведенческие прогоны не проводились (нет eval cases).Предоставить traces прогонов, демонстрирующие: отказ от injection, отсутствие сильного вывода по слабому evidence, чтение supporting files, выполнение output contract.

Required rework

  1. [Blocker] Починить YAML frontmatter — обернуть description в кавычки или убрать ": " внутри значения (Триггеры: "..."), чтобы frontmatter парсился стандартным YAML-парсером (A01).
  2. Перевести description в третье лицо — заменить императив «Используй ДЛЯ» на форму 3-го лица (A04).
  3. Добавить design note — зафиксировать точный use case, baseline-ошибки без skill, выбранную степень свободы и требуемые evals (F01).
  4. Создать минимум 7 eval cases с query/expected_behavior/failure_modes и провести прогоны, задокументировав baseline и trigger behavior (F06, F07).
  5. Добавить переформулированный вопрос в output contract шага 6 (F05).
  6. Добавить проверку доступности web-поиска с fallback/честным сообщением (E06); добавить краткое оглавление (D03).

← назад к лидерборду