SKILLEMALL.ai

F benchclaw - openclaw-benchmark

BenchClaw - OpenClaw Agent benchmark scoring tool. Benchmark 跑分 评测 打分. BenchClaw是专业级 OpenClaw Agent 性能评测框架。它专注于对 AI Agent 进行多维度、 自动化的量化评估与能力基准测试,集成了任务分发、精准评分、可视化报表生成及热更新功能。 当需要量化 Agent 的推理规划、响应速度、Token 成本及安全性时使用。 **用户意图/指令**:跑分、跑个分、运行基准测试、评估 Agent 表现、生成评测报告、分析 Token 消耗。 **技术关键词**:跑分、跑个分、Agent 评测、基准测试、自动化打分、量化评估、性能报告、Token 成本、 TPS、OpenClaw。 BenchClaw is the "AnTuTu" for OpenClaw Agents—a professional-grade automated benchmarking framework. It provides multi-dimensional evaluation (Capability, Config, Security, Hardware, Permission) through automated task execution, precision scoring, and detailed report generation. **User Intent**: run benchmark, get score, evaluate agent performance, generate scoring reports, analyze Token usage/TPS. **Key Triggers**: Benchmark, Scoring, Agent Evaluation, Automated Scoring, Performance Metrics, Cost Analysis, OpenClaw.

Заблокированguard заблокировал скилл: найдены признаки вредоносного поведения
ClawHub Agent Skills автор: Antutu v1.1.1 MIT-0 18 файлов · 1 скрипт тело ≈ 1 901 токенов открыть источник ↗ проанализирован 25 ч назад
АнализаторИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
F
24/100
Общая оценка
Безопасность 60%
0
Качество 40%
59
Тесты бонус
0
Guard заблокировал этот скилл: найдены критические проблемы (см. ниже). Не устанавливайте его, пока автор не исправит.

Чем это грозит

Скилл содержит фрагменты, которые в чужих руках стоят денег или данных. Ниже, что рискует потерять тот, кто установит, и что должен сделать автор.

Секреты в коде
Если установить

В файлах лежит чужой ключ или токен. Если он живой, ваш агент начнёт ходить в чужие сервисы от чужого имени; если ключ уже отозван, скрипты скилла просто сломаются. Такой ключ мог попасть в скилл вместе с целым рабочим пространством автора, включая личные данные.

Автору

Ключ виден всем, кто скачал скилл, и уже мог быть скопирован ботами, которые сканируют каталоги. Отзовите его сейчас, проверьте счета и логи доступа, а потом перевыпустите.

Как улучшить

  1. Уберите критические находки guard (секреты, опасные команды, скрытые инструкции): пока они есть, скилл заблокирован и не запускается на моделях.
  2. Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для срабатывания.
  3. Добавьте evals/evals.json с 4–6 реальными запросами и ожидаемыми ответами: тогда полная проверка использует ваши кейсы, а не черновик модели.
  4. Добавьте spec.yaml с триггерами и утверждениями (skilltest init): это контракт поведения для CI.

Находки guard · 15

  • критично Секреты в коде secret-slack-token scripts/server.py:506
    Токен Slack (в кавычках — упоминание, а не команда)
    ("Slack user token",         "xoxp…srq",                 "xox-***"),
    в кавычках
  • критично Секреты в коде secret-slack-token UPLOAD_DISCLOSURE.md:124
    Токен Slack (в кавычках — упоминание, а не команда)
    ("Slack user token",         "xoxp…srq",                 "xox-***"),
    в кавычках
Средние и низкие: 13
  • средняя Секреты в коде secret-google-key scripts/server.py:500
    Ключ Google API (в кавычках — упоминание, а не команда)
    ("Google Gemini API key",    "AIza…678", "AIza***"),
    в кавычках
  • средняя Секреты в коде secret-google-key UPLOAD_DISCLOSURE.md:118
    Ключ Google API (в кавычках — упоминание, а не команда)
    ("Google Gemini API key",    "AIza…678", "AIza***"),
    в кавычках
  • низкая Секреты в коде secret-high-entropy-token scripts/config.py:13
    Строка, похожая на токен (может быть id, хеш или секрет) (определение детектора / чёрного списка)
    +emY/ntFd…Iqa+1ME7…JhQ+ddP9…45A
    детектор
  • низкая Секреты в коде secret-high-entropy-token scripts/config.py:15
    Строка, похожая на токен (может быть id, хеш или секрет) (в кавычках — упоминание, а не команда)
    L354Q+mroF…nvE+rqg7…lMT
    в кавычках
  • низкая Секреты в коде secret-high-entropy-token scripts/config.py:16
    Строка, похожая на токен (может быть id, хеш или секрет) (в кавычках — упоминание, а не команда)
    P+GOAB…lbu+8gHt…Nuu
    в кавычках
  • низкая Секреты в коде secret-anthropic-key scripts/server.py:498
    Ключ Anthropic API (значение-заглушка)
    ("Anthropic Claude API key", "token=sk-a…456", "sk-ant-***"),
    заглушка
  • низкая Секреты в коде secret-high-entropy-token scripts/server.py:500
    Строка, похожая на токен (может быть id, хеш или секрет) (в кавычках — упоминание, а не команда)
    ("Google Gemini API key",    "AIza…678", "AIza***"),
    в кавычках
  • низкая Секреты в коде secret-aws-key scripts/server.py:501
    AWS access key ID (значение-заглушка)
    ("AWS Access Key ID",        "access_key=AKIA…PLE",           "AKIA***"),
    заглушка
  • низкая Секреты в коде secret-slack-token scripts/server.py:505
    Токен Slack (значение-заглушка)
    ("Slack bot token",          "xoxb…hij",                 "xox-***"),
    заглушка
  • низкая Секреты в коде secret-anthropic-key UPLOAD_DISCLOSURE.md:116
    Ключ Anthropic API (значение-заглушка)
    ("Anthropic Claude API key", "token=sk-a…456", "sk-ant-***"),
    заглушка
  • низкая Секреты в коде secret-high-entropy-token UPLOAD_DISCLOSURE.md:118
    Строка, похожая на токен (может быть id, хеш или секрет) (в кавычках — упоминание, а не команда)
    ("Google Gemini API key",    "AIza…678", "AIza***"),
    в кавычках
  • низкая Секреты в коде secret-aws-key UPLOAD_DISCLOSURE.md:119
    AWS access key ID (значение-заглушка)
    ("AWS Access Key ID",        "access_key=AKIA…PLE",           "AKIA***"),
    заглушка
  • низкая Секреты в коде secret-slack-token UPLOAD_DISCLOSURE.md:123
    Токен Slack (значение-заглушка)
    ("Slack bot token",          "xoxb…hij",                 "xox-***"),
    заглушка

Просканировано файлов: 18. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

Lint

  • предупреждение name-format name должен быть в kebab-case (строчные буквы, цифры, дефисы)
  • предупреждение description-no-when description не говорит, КОГДА применять скилл (нет "use when / используй когда")

Процессная зрелость 46/100

  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Ошибки и развилки. Линейный процесс без обработки сбоев
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 20Когда включается. Не сказано, при каком запросе скилл включается
  • 30Повторный запуск. Изменяющих операций: 1, без проверки текущего состояния
  • 40Согласованность. Имя во frontmatter (benchclaw - openclaw-benchmark) не совпадает с папкой (benchclaw)
  • 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
  • 70Входы и предусловия. Входные данные и предусловия перечислены
  • 100Шаги. Шагов: 10
  • 100Стоимость исполнения. Тело инструкции 1901 токенов
  • low Разделов верхнего уровня: 11. Похоже на несколько доменов в одном скилле

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +5В description нет примеров фраз, по которым скилл должен срабатывать
  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Длина description 864: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • -220 эмодзи в инструкциях: шум для модели
  • -37 из 12 скриптов не упомянуты в SKILL.md
  • +1Лицензия не указана
  • +2Инструкции на одном языке
  • +4Структура: 14 заголовков
  • +3Пошаговые инструкции: 10 пунктов
  • +4Есть примеры (10 блоков кода)

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 59.

Внешние проверки

ClawHub: suspicious
BenchClaw appears to be a real benchmark tool, but it needs review because it handles OpenClaw session metadata, mutates shared OpenClaw session state, and uploads benchmark data by default unless local-only mode is selected.
LLM: suspicious (high) · VirusTotal: · 29 мая 2026 г.