Для кого: тимлиды и ML-инженеры, отслеживающие утечки Gemini 3.5 Pro и решающие, стоит ли переключать Agent-пайплайн с Claude Fable 5 или GPT-5.6 Terra. Вывод: Google снова конкурентен на frontier-уровне, но утечки — не SLA. Структура: фильтр достоверности, три ловушки, матрица трёх моделей, технические параметры, шесть шагов проверки, цифры для брифа и рекомендация по аренде M4.

Что утекло — и почему Google снова в игре

С 3 по 7 июля 2026 три независимых канала утечек сошлись на одном: Gemini 3.5 Pro — не инкрементальный апдейт, а первый релиз Google после GA GPT-5.6 Terra, способный конкурировать с OpenAI и Anthropic в Agent-сценариях.

Стек утечек раскладывается на три слоя:

  • Внутренняя презентация DeepMind (The Information): контекст 2,5M токенов, Agent Runtime 3.0, inference на TPU v6 Trillium с ~2,3× эффективностью vs v5.
  • Метаданные staging Vertex AI: model ID gemini-3.5-pro-preview-0726 появился в EU-логах до удаления.
  • Скриншоты бенчмарков (проверенные X-аккаунты): MMLU-Pro ~90,1%, SWE-bench Verified ~54%, GPQA Diamond ~76% — расхождение с deck в пределах ±2%.

Тезис «Google is back» справедлив, если вам нужны мультимодальные агенты и GCP-экосистема. Для чистого coding-latency лидирует GPT-5.6 Sol. Для policy-heavy long agents — Fable 5. Gemini 3.5 Pro выигрывает середину: широта, контекст и цена.


Три ловушки, в которые попадают команды в leak week

  1. Погоня за скриншотами без A/B-базлайна. Утечённые баллы не учитывают ваш репозиторий, промпты и tool chain. Переключение на хайпе обычно снижает pass rate на 8–15% в первую неделю.
  2. Игнорирование политики квот. Preview-whitelist отдаёт приоритет проектам с историей GCP spend. Команды без Vertex billing получают ~40 RPM, пока инсайдеры гоняют полные Agent-сьюты.
  3. Single-vendor Agent pipeline. Fable 5, GPT-5.6 Terra и Gemini 3.5 Pro падают по-разному на Computer Use, MCP tools и policy gates. Один backend — один режим отказа.

Матрица решений: Gemini 3.5 Pro vs Fable 5 vs GPT-5.6 Terra

Параметр Gemini 3.5 Pro (утечка) Claude Fable 5 GPT-5.6 Terra Оптимальный сценарий
Контекстное окно 2,5M токенов 1,2M токенов 1,5M токенов Full-repo RAG → Gemini
SWE-bench Verified ~54% (утечка) ~51% ~49% Автономный coding → Gemini
Long-horizon agents Agent Runtime 3.0, 16 parallel tools Mythos tier, сильная policy compliance Codex Agent + MCP native Regulated workflows → Fable 5
Latency P50 (первый токен) ~1,1 с ~1,4 с ~0,85 с Интерактивный IDE → GPT Terra/Sol
Мультимодальность Нативный video+audio stream Image + document primary Image + text primary Медиа-пайплайны → Gemini
API input (утечка) $2,2 / 1M токенов $3,5 / 1M токенов $3,0 / 1M токенов High-volume batch → Gemini
M4 hybrid fallback LiteLLM + MLX 14B Coder Та же архитектура Та же архитектура Все три — с dedicated lab node

Утечённые технические параметры (preview build)

Используйте как чек-лист при открытии preview — не как догму до публикации GA-карточек Google.

Архитектура
Sparse MoE: ~480B total / ~45B active per forward pass (утечка). Технический принцип: разреженная активация снижает compute на inference при сохранении reasoning depth.
Training compute
~4,2× FLOPs Gemini 2.5 Pro на смешанном кластере TPU v5p → v6. Предел масштабирования — не модель, а egress и IAM на tool layer.
Контекст
2,5M токенов native; >512K input в preview тарифицируется с коэффициентом 1,4×.
Agent Runtime 3.0
Встроенный цикл plan-execute-reflect; до 16 tools за turn; Memory Store с retention 120 дней.
Computer Use 2.1
Контроль macOS Sonoma+ и Windows 11 на уровне координат; ~62% OSWorld subset (утечка).
Throughput
~38 output tokens/sec при 128K контексте на TPU v6 (vs ~24 t/s у 2.5 Pro) — ключевой предел для multi-turn Agent.

Правило достоверности утечек: если цифра есть только в одном скриншоте — дисконтируйте на 20%. Если она в deck + staging logs + двух независимых leakers — планируйте вокруг неё.


Шесть шагов проверки перед переключением Agent-стека

  1. Зафиксируйте golden suite из 50 задач. Coding, RAG, Computer Use, policy-refusal — одинаковые промпты на всех трёх backend.
  2. Поднимите M4 tri-route lab. Арендуйте LlmMac Mac mini M4 24 ГБ. Разверните LiteLLM с алиасами: gemini-3.5, fable-5, gpt-5.6-terra.
  3. Подайте заявку на Gemini preview whitelist. Привяжите GCP billing и compliance contact в первую неделю июля — квоты ужесточаются после Cloud Next.
  4. 72-часовой soak на каждый backend. Логируйте pass rate, P95 latency, дневной token spend и коды tool-failure. Без cherry-picked демо.
  5. Настройте downgrade rules. При 80% дневного бюджета — маршрут на локальный MLX 14B Coder на M4. Agent loops не умирают при throttle preview API.
  6. 14-дневный canary report. Один некритичный repo на победившем hybrid stack. Finance подписывает до full migration.

Preview месячных затрат — четырехчеловечная команда (три backend)

Стратегия Месячная стоимость Стабильность Agent Vendor lock-in
Только Gemini 3.5 Pro API ₽98 000–252 000 Средняя (preview квоты) Высокий (GCP)
Только Fable 5 API ₽142 000–284 000 Средняя (policy pauses) Высокий
Только GPT-5.6 Terra API ₽124 000–310 000 Средняя Высокий
M4 lab + tri-route hybrid ₽80 000–168 000 Максимальная Минимальный

Утечка меняет разговор — не инфраструктурный план. Dedicated M4-узел позволяет тестировать все три frontier-модели без переписывания agent harness при каждом заголовке.


Цифры для технического брифа — окно утечек июль 2026

  • Preview window: несколько источников указывают 9–14 июля developer preview на Vertex AI и AI Studio; GA-анонс 15–18 июля на Google Cloud Next.
  • Benchmark delta vs GPT-5.6 Terra: утечки показывают +3–5 пунктов Gemini 3.5 Pro на SWE-bench и MMLU-Pro; Terra сохраняет преимущество P50 latency (~25% быстрее первый токен).
  • Benchmark delta vs Fable 5: Gemini лидирует в raw coding scores; Fable 5 — в CursorBench multi-file refactors (~4 пункта) и policy-refusal consistency в enterprise red-team.
  • Экосистемный сигнал: iOS 27 Siri уже маршрутизирует сложные запросы в Gemini 2.5 Pro — GA 3.5 Pro, вероятно, придёт silent OTA в Q3.
  • M4 fallback benchmark: MLX 14B Q4 Coder на 24 ГБ unified memory — 35–45 tokens/s (LlmMac soak, июнь 2026), покрывает ~85% daily downgrade при throttle preview API.
  • Правило выбора: Google stack + ultra-long docs + multimodal → Gemini 3.5 Pro. Policy-heavy agents → Fable 5. Lowest-latency IDE → GPT-5.6 Sol/Terra. Все три → M4 tri-route lab.

Итог: проверяйте утечки на железе, которым управляете

Утечки июля 2026 рисуют правдоподобное возвращение Google: 2,5M контекст, Agent Runtime 3.0 и benchmark-преимущества над Fable 5 и GPT-5.6 Terra на ряде Agent-задач. Google снова конкурентен — но утечки не заменяют production SLA.

Не вырывайте Fable 5 или Terra на скриншотном хайпе. Зафиксируйте golden suite, прогоните tri-route A/B на M4 lab и дайте 14 дням измерений решить. Держите MLX fallback подключённым — preview-квоты не должны убивать pipeline.

Дополнительно:
Gemini 3.5 Pro — таймлайн релиза июль
Fable 5 vs GPT-5.5 — обзор возможностей
GPT-5.6 Sol / Terra / Luna — сравнение

Рекомендуемое действие: откройте страницу заказа LlmMac и арендуйте Mac mini M4 24 ГБ tri-route agent lab. SSH за минуты, LiteLLM с алиасами Gemini, Fable 5 и GPT-5.6 — проверьте утечки сами до ужесточения preview-квот. Сравните тарифы аренды и выберите узел под ваш Agent pipeline.