SKILLEMALL.ai

AF webcrawler-deep-crawl

Глубокое сканирование любого веб-сайта, начиная с указанных URL, возврат готового для LLM текста/markdown/HTML для каждой страницы плюс метаданные (заголовок, описание, автор, язык, канонический URL, OG) и исходящие ссылки в пределах области. Используйте, когда пользователь упоминает глубокое сканирование веб-сайта, рекурсивное сканирование, сканирование всего сайта, скрейпинг всего веб-сайта, скрейпинг сайта с документацией, скрейпинг документации, скрейпинг базы знаний, скрейпинг блога, создание корпуса RAG, создание векторной базы данных из веб-сайта, база знаний для чат-бота, файлы знаний GPT, llms.txt, сканирование sitemap, BFS-сканирование, скрейпинг с ограничением глубины или страниц, включение/исключение URL-шаблонов, удаление шаблонного контента, удаление навигации, заголовка, нижнего колонтитула, преобразование веб-сайта в markdown, преобразование веб-сайта в текст, извлечение нескольких страниц, массовый скрейпинг страниц, получение чистого markdown из URL, преобразование сайта документации в корпус markdown, преобразование сайта в чистый корпус. Также применимо для создания RAG-конвейеров, индексации сайта клиента, синхронизации документов в векторное хранилище, генерации обучающих корпусов из любого центра документации или расширения одного начального URL в чистый корпус каждой достижимой страницы в пределах области.

машинный переводПоказать оригиналСкрыть оригинал«Deep-crawl any website from start URLs, return per-page LLM-ready text…»

Deep-crawl any website from start URLs, return per-page LLM-ready text/markdown/HTML plus metadata (title, description, author, language, canonical URL, OG) and in-scope outbound links. Use when user mentions deep crawl website, recursive crawl, crawl a whole site, scrape entire website, scrape docs site, scrape documentation, scrape knowledge base, scrape blog, build RAG corpus, build vector database from website, knowledge base for chatbot, GPT knowledge files, llms.txt, sitemap crawl, BFS crawl, scrape with depth or page limit, include exclude URL globs, remove boilerplate, strip navigation header footer, website to markdown, website to text, multi-page extraction, bulk page scraping, clean markdown from URL, docs site to markdown corpus, site to clean corpus. Also applies to building RAG pipelines, indexing a customer site, syncing docs into a vector store, generating training corpora from any docs hub, or expanding a single start URL into a clean corpus of every reachable in-scope page.

ClawHub Agent Skills автор: browser-act skill v1.0.0 MIT-0 6 файлов тело ≈ 4 021 токенов Открыть источникclawhub.ai проанализирован 18 ч назад

Глубокое сканирование любого веб-сайта, начиная с указанных URL, возврат готового для LLM текста/markdown/HTML для каждой страницы плюс метаданные (заголовок…

Как процесс F 53/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: scripts/*.py

ПроцедураИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
91/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
78
Прогон на моделях
не было
Процессный рейтинг
F
53/100
Не запустится
Скилл ссылается на файлы, которых нет в архиве: scripts/*.py
Инструменты и файлы вес 18
0
Когда включается вес 12
20
Результат и критерий готовности вес 14
40
три самых слабых из десяти параметров · все десять

Как улучшить

  1. В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 1. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение missing-ref ссылка на отсутствующий файл: scripts/*.py

Процессный рейтинг: все десять параметров 53/100

Не запустится. Скилл ссылается на файлы, которых нет в архиве: scripts/*.py
  • 0Инструменты и файлы. Не хватает 1 файла(ов): scripts/*.py
  • 20Когда включается. Не сказано, при каком запросе скилл включается
  • 40Результат и критерий готовности. Не сказано, что считать результатом
  • 60Шаги. Шагов: 39, расплывчатых формулировок: 4
  • 70Входы и предусловия. Входные данные и предусловия перечислены
  • 70Стоимость исполнения. Тело инструкции 4021 токенов
  • 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Повторный запуск. Изменяющие операции проверяют текущее состояние
  • 100Отчётность по ходу. Скилл сообщает о ходе работы
  • low Разделов верхнего уровня: 10. Похоже на несколько доменов в одном скилле
  • low Ответ описан самодельной разметкой (5 тегов): типизированный вызов надёжнее

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +5В description нет примеров фраз, по которым скилл должен срабатывать
  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Длина description 1006: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • +1Лицензия не указана
  • +2Инструкции на одном языке
  • +4Структура: 18 заголовков
  • +3Пошаговые инструкции: 39 пунктов
  • +4Есть примеры (6 блоков кода)
  • +3Все 4 скриптов описаны в инструкциях

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 78.

Внешние проверки

ClawHub: suspicious
This skill is a useful web crawler, but it asks for broad authenticated crawling and includes rate-limit evasion guidance that users should review before installing.
LLM: suspicious (high) · VirusTotal: · 27 июн. 2026 г.