SKILLEMALL.ai

AB multi-skill-eval

Интегрированная система оценки навыков по нескольким методам. Объединяет статический анализ (skill-assessment), оценку качества по рубрикам (skill-evaluator) и автономное тестирование (skill-eval). Используется для всесторонней оценки, сравнения, аудита или улучшения навыков OpenClaw. Охватывает полноту документации, качество кода, 25 пунктов оценки по рубрикам, многомодельное тестирование. Ключевые слова (китайский): 评估技能、技能评分、技能审计、对比技能、批量评估、技能质量检查、静态分析、基准测试、触发词检测、幽灵工具检测 Ключевые слова (английский): evaluate skill, compare skills, audit skill, benchmark skill, static analysis, skill quality, skill assessment Используется, когда вам нужно оценить, проверить, протестировать или улучшить навыки OpenClaw.

машинный переводПоказать оригиналСкрыть оригинал«集成化多方法技能评估系统。整合静态分析(skill-assessment)、Rubric质量打分(skill-evaluator)和自主基准…»

集成化多方法技能评估系统。整合静态分析(skill-assessment)、Rubric质量打分(skill-evaluator)和自主基准测试(skill-eval)。用于全面评估、对比、审计或改进OpenClaw技能。覆盖文档完整性、代码质量、25项Rubric打分、多模型基准测试。 触发词(中文): 评估技能、技能评分、技能审计、对比技能、批量评估、技能质量检查、静态分析、基准测试、触发词检测、幽灵工具检测 触发词(English): evaluate skill, compare skills, audit skill, benchmark skill, static analysis, skill quality, skill assessment Use when you need to evaluate, audit, benchmark, or improve OpenClaw skills.

ClawHub Agent Skills автор: wangzairong v1.0.2 MIT-0 16 файлов тело ≈ 2 892 токенов Открыть источникclawhub.ai проанализирован 2 дн назад

Интегрированная система оценки навыков по нескольким методам.

Как процесс B 65/100 · Почти готов — слабые места: входы и предусловия, повторный запуск, отчётность по ходу

АнализаторИнфраструктуратип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
98/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
94
Прогон на моделях
не было
Процессный рейтинг
B
65/100
Почти готов
Входы и предусловия вес 11
0
Отчётность по ходу вес 2
0
Повторный запуск вес 4
30
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 0

    ✓ Критических и высоких находок нет

    Просканировано файлов: 16. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 65/100

    • 0Входы и предусловия. Не сказано, что нужно иметь на входе
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 30Повторный запуск. Изменяющих операций: 10, без проверки текущего состояния
    • 50Когда включается. Не сказано, при каком запросе скилл включается
    • 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
    • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
    • 100Шаги. Шагов: 85
    • 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Стоимость исполнения. Тело инструкции 2892 токенов

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +3Длина description 412 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 24 заголовков
    • +3Пошаговые инструкции: 85 пунктов
    • +3Формат ответа описан явно
    • +4Есть примеры (12 блоков кода)
    • +4Справочные файлы упоминаются в инструкциях (1 из 1)
    • +3Все 5 скриптов описаны в инструкциях

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 94.

    Внешние проверки

    ClawHub: suspicious
    This appears to be a real skill-evaluation toolkit, but it needs Review because some broad benchmark/rewrite workflows and generated HTML outputs are not safely bounded.
    LLM: suspicious (high) · VirusTotal: · 29 мая 2026 г.