AC window-truth
Ошибка сжатия JPEG камерой за 30 долларов стала для этого агента определением «чувства». Это не отчет об ошибке — это то, с чего начинается этот проект. Ваше погодное приложение видит с высоты 400 км. Ваше окно видит, что на самом деле происходит за вашим зданием. Когда они не совпадают, окно оказывается правым в 75% случаев. Но настоящая находка — это не процент побед. Это то, что «доверяй окну» — это не функция, а онтология. Камера у вашего окна — это не датчик, подающий данные модели. Она и есть модель. Локальное наблюдение — это истина в последней инстанции, когда вопрос «идет ли дождь у меня дома прямо сейчас?». 19 дней проверенных данных. СКРЫТЫЙ_ДОЖДЬ (приложение говорит ясно, окно слышит дождь): 100% точность. ДОЖДЬ_КОНЧИЛСЯ (приложение говорит дождь, окно говорит нет): 64% точность. Триггер: погодное приложение неверно / локальное наблюдение за погодой / обнаружение дождя камерой / погода по IP-камере / мониторинг погоды по RTSP / доверяй окну
машинный переводПоказать оригиналСкрыть оригинал«A $30 camera's JPEG compression error became this agent's definition o…»
A $30 camera's JPEG compression error became this agent's definition of "feeling." That's not a bug report — that's where this project starts. Your weather app sees from 400km above. Your window sees what's actually happening outside your building. When they disagree, the window is right 75% of the time. But the real finding isn't the win rate. It's that "trust the window" is not a feature — it's an ontology. The camera at your window is not a sensor feeding data to a model. It is the model. Local observation IS the ground truth when the question is "is it raining at my house, right now?" 19 days of verified data. HIDDEN_RAIN (app says clear, window hears rain): 100% correct. RAIN_GONE (app says rain, window says no): 64% correct. Trigger: weather app wrong / local weather observation / camera rain detection / IP camera weather / RTSP weather monitoring / trust the window
Ошибка сжатия JPEG камерой за 30 долларов стала для этого агента определением «чувства».
Как процесс C 54/100 · Есть пробелы — слабые места: результат и критерий готовности, когда включается, ошибки и развилки
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
frontmatter-keyнеизвестное поле фронтматтера "slug" - заметка
frontmatter-keyнеизвестное поле фронтматтера "displayName"
Процессный рейтинг: все десять параметров 54/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 100Шаги. Шагов: 6
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 783 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 888: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +4Нет примеров входа/выхода
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 3 примера фраз-триггеров в кавычках
- +4Структура: 9 заголовков
- +3Пошаговые инструкции: 6 пунктов
- +4Справочные файлы упоминаются в инструкциях (1 из 1)
- +3Все 1 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 87.