AB glmocr-sdk
Активировать, когда: (1) Пользователь хочет извлечь текст, таблицы, формулы или структурированные данные из изображений/PDF/сканированных документов, (2) Пользователь упоминает «OCR», «文字识别», «文档解析», (3) У пользователя есть документ (снимок экрана, отсканированная страница, счет-фактура, бумага, фото доски) и ему нужно его содержимое в структурированном виде, (4) Пользователь просит разобрать, оцифровать или извлечь содержимое из визуального документа. Вызывает GLM-OCR SDK (pip install glmocr) для разбора документов через облачный API Zhipu. Графический процессор не требуется. Возвращает структурированный JSON (регионы с метками + ограничивающие рамки) и Markdown. Агент может работать полностью через CLI — файлы YAML не нужны. НЕ для: потоков с камеры в реальном времени, транскрипции аудио или изображений, не являющихся документами (фотографии, иллюстрации).
машинный переводПоказать оригиналСкрыть оригинал«Trigger when: (1) User wants to extract text, tables, formulas, or str…»
Trigger when: (1) User wants to extract text, tables, formulas, or structured data from images/PDFs/scanned documents, (2) User mentions "OCR", "文字识别", "文档解析", (3) User has a document (screenshot, scanned page, invoice, paper, whiteboard photo) and needs its content in structured form, (4) User asks to parse, digitize, or extract content from a visual document. Invokes the GLM-OCR SDK (pip install glmocr) to parse documents via Zhipu's cloud API. No GPU required. Returns structured JSON (regions with labels + bounding boxes) and Markdown. Agent can operate entirely via CLI — no YAML files needed. NOT for: real-time camera feeds, audio transcription, or non-document images (photos, illustrations).
Активировать, когда: (1) Пользователь хочет извлечь текст, таблицы, формулы или структурированные данные из изображений/PDF/сканированных документов, (2)…
Как процесс B 66/100 · Почти готов — слабые места: входы и предусловия
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 1. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 66/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 60Инструменты и файлы. Используются инструменты (bash, python), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 64Шаги. Шагов: 3, расплывчатых формулировок: 1
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 2448 токенов
- 100Повторный запуск. Изменяющих операций нет
- 100Отчётность по ходу. Скилл сообщает о ходе работы
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Описание говорит, когда скилл НЕ применять
- +3Длина description 707 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 26 заголовков
- +3Пошаговые инструкции: 3 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (20 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 91.