SKILLEMALL.ai

AB eval-driven-dev

Улучшайте ИИ-приложения с помощью разработки, управляемой оценкой. Определите критерии оценки, инструментируйте приложение, создайте эталонные наборы данных, наблюдайте и оценивайте запуски приложения, анализируйте результаты и составьте конкретный план действий по улучшениям. ВСЕГДА ИСПОЛЬЗУЙТЕ ЭТОТ НАВЫК, когда пользователь просит настроить QA, добавить тесты, добавить оценки, оценить, провести бенчмаркинг, исправить неправильное поведение, улучшить качество или провести контроль качества для любого проекта Python, который вызывает модель LLM.

машинный переводПоказать оригиналСкрыть оригинал«Improve AI application with evaluation-driven development. Define eval…»

Improve AI application with evaluation-driven development. Define eval criteria, instrument the application, build golden datasets, observe and evaluate application runs, analyze results, and produce a concrete action plan for improvements. ALWAYS USE THIS SKILL when the user asks to set up QA, add tests, add evals, evaluate, benchmark, fix wrong behaviors, improve quality, or do quality assurance for any Python project that calls an LLM model.

github/awesome-copilot Agent Skills автор: github MIT 19 файлов · 1 скрипт тело ≈ 4 269 токенов Открыть источникgithub.com проанализирован 13 ч назад

Улучшайте ИИ-приложения с помощью разработки, управляемой оценкой.

Как процесс B 76/100 · Почти готов — слабые места: повторный запуск

АнализаторРазработкаДанные и аналитикаИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
94/100
безопасность, качество, тесты
Безопасность 60%
95
Качество 40%
92
Прогон на моделях
не было
Процессный рейтинг
B
76/100
Почти готов
Повторный запуск вес 4
30
Инструменты и файлы вес 18
60
Результат и критерий готовности вес 14
60
три самых слабых из десяти параметров · все десять

Такой же скилл встречается ещё в 1 месте: RA-Skills

Чем это грозит

Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.

Опасные команды средняя серьёзность

Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.

Если установить

Скилл содержит команды, которые удаляют файлы, переписывают диски или исполняют код, скачанный из сети. Агент может выполнить их без вопроса, если считает, что так требует инструкция.

Автору

Замените разрушительные команды на безопасные аналоги с подтверждением, ограничьте область действия конкретной папкой и не тяните код через curl | bash: укажите версию и контрольную сумму.

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 1

    ✓ Критических и высоких находок нет

    Средние и низкие: 1
    • средняя Опасные команды cmd-autorun-instruction SKILL.md:210
      Инструкция автоматически запускать скрипт в каждой сессии
      And whenever you restart the workflow, always run the setup.sh script in resources again to ensure the web server is running:

    Просканировано файлов: 19. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 76/100

    • 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
    • 60Инструменты и файлы. Используются инструменты (bash, python), но во frontmatter они не объявлены
    • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
    • 65Ошибки и развилки. Развилок: 3
    • 70Входы и предусловия. Входные данные и предусловия перечислены
    • 70Стоимость исполнения. Тело инструкции 4269 токенов
    • 100Шаги. Шагов: 22
    • 100Когда включается. Сказано, когда применять и когда не применять
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Отчётность по ходу. Скилл сообщает о ходе работы
    • low Ответ описан самодельной разметкой (4 тегов): типизированный вызов надёжнее

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +2Инструкции на одном языке
    • +3Длина description 448 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 16 заголовков
    • +3Пошаговые инструкции: 22 пунктов
    • +3Формат ответа описан явно
    • +4Есть примеры (1 блоков кода)
    • +4Справочные файлы упоминаются в инструкциях (11 из 13)
    • +1Лицензия указана

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 92.