Оглавление: почему пилоты не доходят до production · матрица зрелости harness · шесть шагов внедрения · цифры для RFC · аренда Mac и покупка.
Почему enterprise-пилоты AI Harness застревают до production
1. Нет разделения сценариев по риску. Один и тот же агент получает и read-only анализ логов, и право писать в production-репозиторий. Без tier policy любой успешный демо-прогон создаёт ложное ощущение готовности. Enterprise начинается с каталога use-case: аналитика, codegen в sandbox, изменения только через approval.
2. Аудит разорван между чатом, CI и облаком. Регулятор и внутренний SOC хотят цепочку: prompt → tool call → stdout → diff → тест. Если run id не сквозной, расследование инцидента снова сводится к переписке в мессенджере. Harness обязан экспортировать JSONL или OTLP в SIEM, а не хранить историю только в UI вендора.
3. Среда выполнения привязана к ноутбуку. Локальный диск разработчика не масштабируется как compute tier: разные версии CLI, утечки токенов, ночные job, убивающие сон ноутбука. Production harness требует выделенного узла с фиксированным образом, квотами CPU/RAM и SSH-доступом по роли — типичный кандидат для арендованного Mac mini M4.
Матрица зрелости: от демо к enterprise AI Harness
Зрелость измеряется не размером модели, а контролем контура. Используйте таблицу на архитектурном ревью — она показывает, что блокирует переход на следующий уровень.
| Контур | Уровень L1 (пилот) | Уровень L2 (команда) | Уровень L3 (enterprise) |
|---|---|---|---|
| Policy | Ручной allowlist в конфиге | Policy-as-code по репозиторию | Центральный каталог + делегирование RBAC |
| Compute | Ноутбук инженера | Выделенный Mac mini M4 по SSH | Пул узлов с квотами и изоляцией tenant |
| Наблюдаемость | Логи в терминале | Run id + JSONL на узле | OTLP/SIEM, биллинг по task-run |
| Данные | Без маскирования PII | Redaction stdout | Классификация данных + residency |
| Экономика | Без лимита токенов | Budget на задачу | Chargeback по командам и средам |
Практическое правило: не поднимайте L3, пока L2 не отработал на одном реальном потоке — миграция schema, ночной RAG-индекс или Xcode-сборка с notarization. Именно здесь удалённый Mac даёт честные цифры p95 и failure rate без риска для prod-кластера.
Шесть шагов production-внедрения harness
- Каталог сценариев. Зафиксируйте не более пяти потоков с владельцем, SLA и классом данных. Отклоните «универсального агента на всё».
- Контракт инструментов. Для каждого tool опишите cwd, timeout, схему входа, маскирование секретов и запрещённые домены сети.
- Изолированный узел. Арендуйте Mac mini M4: отдельный workspace (repo read-only, scratch write, logs append-only), SSH по ключу, без общего VNC для prod-секретов.
- SSO и RBAC. Привяжите запуск harness к корпоративной учётке; разделите роли operator, reviewer и auditor без общих токенов.
- Soak две недели. Прогоните реальные задачи: codegen с тестами, индексация, Apple pipeline. Снимите p95 tool-call, долю повторных failure и стоимость часа узла.
- Gate в production. Введите ручной approval на write-инструменты, freeze windows и автоматический stop при одинаковой ошибке три раза подряд.
Цифры и тезисы для архитектурного ревью
- До 70% инцидентов agent workflow в enterprise связаны с tool runtime (timeout, cwd, права, сеть), а не с «галлюцинацией» модели — это аргумент за harness до масштабирования LLM tier.
- 5–10 секунд — верх для интерактивного tool-call; дольше — только background job с heartbeat, иначе очередь съедает экономику токенов.
- 16 GB unified memory на Mac runner — минимум для Xcode 16 и одного агента; 24 GB — если параллельно идут симулятор и локальная модель sidecar.
- Один сквозной run id сокращает расследование с часов до минут при экспорте в SIEM — обязательное требование для regulated отраслей.
- UTF-8 end-to-end критичен для русскоязычных команд: кириллица в ветках, логах и failure summary ломает наивные парсеры и провоцирует бесконечные ретраи.
Итог: сначала измерьте harness на Mac, затем масштабируйте CAPEX
Enterprise AI Harness — это операционная дисциплина вокруг модели: policy, узел, аудит и экономика task-run. Покупка флота Mac или расширение лицензий LLM до пилота на выделенном узле — типичная ошибка 2026 года.
На LlmMac вы арендуете Mac mini M4 с SSH, закрепляете workspace, подключаете observability и за две недели получаете цифры для CFO и CISO: утилизация, очередь, failure rate, стоимость часа. Если метрики зелёные — масштабируйте пул; если нет — меняйте policy и tier без капитала в железо. Так вы отделяете эксперимент с моделью от закупки compute tier.
Частые вопросы
Нужен ли отдельный harness, если уже есть Copilot в IDE? IDE-помощник не заменяет audit trail, изоляцию и лимиты на production-изменения. Harness дополняет IDE контуром выполнения.
Можно ли держать harness только в Kubernetes? Для stateless tool — да; для Xcode, Keychain, notarization и локальных моделей на Metal нужен Mac вне кластера.
Как связать LlmMac с корпоративным SSO? Доступ к консоли и SSH-ключам оформляется на уровне аренды; harness на узле использует сервисные учётки без персональных паролей в промпте.