AC evalscope
Тестирование производительности LLM и оценка качества через CLI evalscope. Преобразует запросы на естественном языке в команды evalscope для: (1) Оценки точности модели — запускает 160+ тестов для локальных чекпоинтов или API (OpenAI-совместимых, Anthropic, LiteLLM); (2) Тестирования производительности — TTFT, TPOT, пропускная способность, задержка при настраиваемой параллельности; (3) Оценки RAG — метрики качества RAGAS, тесты эмбеддингов MTEB, поиск CLIP; (4) Поиска тестов — список/фильтр/просмотр тестов по тегу. Активировать по: evaluate / benchmark / score a model, throughput / latency / QPS / stress test, find benchmarks, view results, 评测模型, 压测, 跑 benchmark, 性能测试, 查看评测结果, 有哪些评测集, RAG 评测, embedding 评测. НЕ активировать для: обучения модели / дообучения / развертывания / запросов на обслуживание.
машинный переводПоказать оригиналСкрыть оригинал«LLM evaluation & inference performance testing via the evalscope CLI.…»
LLM evaluation & inference performance testing via the evalscope CLI. Translates natural language requests into evalscope commands for: (1) Model accuracy evaluation — runs 160+ benchmarks against local checkpoints or API endpoints (OpenAI-compatible, Anthropic, LiteLLM); (2) Performance stress testing — TTFT, TPOT, throughput, latency under configurable concurrency; (3) RAG evaluation — RAGAS quality metrics, MTEB embedding benchmarks, CLIP retrieval; (4) Benchmark discovery — list/filter/inspect benchmarks by tag. Trigger on: evaluate / benchmark / score a model, throughput / latency / QPS / stress test, find benchmarks, view results, 评测模型, 压测, 跑 benchmark, 性能测试, 查看评测结果, 有哪些评测集, RAG 评测, embedding 评测. Do NOT trigger for: model training / finetuning / deployment / serving requests.
Тестирование производительности LLM и оценка качества через CLI evalscope.
Как процесс C 62/100 · Есть пробелы — слабые места: результат и критерий готовности, согласованность
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 62/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 40Согласованность. Имя во frontmatter (evalscope) не совпадает с папкой (skill-evalscope)
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 100Шаги. Шагов: 28
- 100Стоимость исполнения. Тело инструкции 1652 токенов
- 100Повторный запуск. Изменяющих операций нет
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- low Разделов верхнего уровня: 10. Похоже на несколько доменов в одном скилле
- low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
- low Ответ описан самодельной разметкой (4 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -2Ссылки на localhost: у другого пользователя не заработает
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 792 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 11 заголовков
- +3Пошаговые инструкции: 28 пунктов
- +4Есть примеры (7 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 82.