SKILLEMALL.ai

AC evalscope

Тестирование производительности LLM и оценка качества через CLI evalscope. Преобразует запросы на естественном языке в команды evalscope для: (1) Оценки точности модели — запускает 160+ тестов для локальных чекпоинтов или API (OpenAI-совместимых, Anthropic, LiteLLM); (2) Тестирования производительности — TTFT, TPOT, пропускная способность, задержка при настраиваемой параллельности; (3) Оценки RAG — метрики качества RAGAS, тесты эмбеддингов MTEB, поиск CLIP; (4) Поиска тестов — список/фильтр/просмотр тестов по тегу. Активировать по: evaluate / benchmark / score a model, throughput / latency / QPS / stress test, find benchmarks, view results, 评测模型, 压测, 跑 benchmark, 性能测试, 查看评测结果, 有哪些评测集, RAG 评测, embedding 评测. НЕ активировать для: обучения модели / дообучения / развертывания / запросов на обслуживание.

машинный переводПоказать оригиналСкрыть оригинал«LLM evaluation & inference performance testing via the evalscope CLI.…»

LLM evaluation & inference performance testing via the evalscope CLI. Translates natural language requests into evalscope commands for: (1) Model accuracy evaluation — runs 160+ benchmarks against local checkpoints or API endpoints (OpenAI-compatible, Anthropic, LiteLLM); (2) Performance stress testing — TTFT, TPOT, throughput, latency under configurable concurrency; (3) RAG evaluation — RAGAS quality metrics, MTEB embedding benchmarks, CLIP retrieval; (4) Benchmark discovery — list/filter/inspect benchmarks by tag. Trigger on: evaluate / benchmark / score a model, throughput / latency / QPS / stress test, find benchmarks, view results, 评测模型, 压测, 跑 benchmark, 性能测试, 查看评测结果, 有哪些评测集, RAG 评测, embedding 评测. Do NOT trigger for: model training / finetuning / deployment / serving requests.

ClawHub Agent Skills автор: Yunlin Mao v1.0.2 MIT-0 7 файлов тело ≈ 1 652 токенов Открыть источникclawhub.ai проанализирован 2 дн назад

Тестирование производительности LLM и оценка качества через CLI evalscope.

Как процесс C 62/100 · Есть пробелы — слабые места: результат и критерий готовности, согласованность

ИнтеграцияИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
93/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
82
Прогон на моделях
не было
Процессный рейтинг
C
62/100
Есть пробелы
Результат и критерий готовности вес 14
0
Согласованность вес 8
40
Ошибки и развилки вес 10
50
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 0

    ✓ Критических и высоких находок нет

    Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 62/100

    • 0Результат и критерий готовности. Не сказано, что считать результатом
    • 40Согласованность. Имя во frontmatter (evalscope) не совпадает с папкой (skill-evalscope)
    • 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
    • 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
    • 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
    • 70Входы и предусловия. Входные данные и предусловия перечислены
    • 100Шаги. Шагов: 28
    • 100Стоимость исполнения. Тело инструкции 1652 токенов
    • 100Повторный запуск. Изменяющих операций нет
    • 100Отчётность по ходу. Скилл сообщает о ходе работы
    • low Разделов верхнего уровня: 10. Похоже на несколько доменов в одном скилле
    • low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
    • low Ответ описан самодельной разметкой (4 тегов): типизированный вызов надёжнее

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +3Формат ответа не описан: модель каждый раз решает сама
    • -2Ссылки на localhost: у другого пользователя не заработает
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +3Длина description 792 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 11 заголовков
    • +3Пошаговые инструкции: 28 пунктов
    • +4Есть примеры (7 блоков кода)

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 82.

    Внешние проверки

    ClawHub: suspicious
    This skill is mostly a coherent EvalScope helper, but it gives users commands that can expose dashboards, send private evaluation data to model APIs, and run code-benchmark sandboxes without enough safety scoping.
    LLM: suspicious (medium) · VirusTotal: · 5 июн. 2026 г.