Для кого: тимлиды и ML-инженеры, отслеживающие утечки Gemini 3.5 Pro и решающие, стоит ли переключать Agent-пайплайн с Claude Fable 5 или GPT-5.6 Terra. Вывод: Google снова конкурентен на frontier-уровне, но утечки — не SLA. Структура: фильтр достоверности, три ловушки, матрица трёх моделей, технические параметры, шесть шагов проверки, цифры для брифа и рекомендация по аренде M4.
Что утекло — и почему Google снова в игре
С 3 по 7 июля 2026 три независимых канала утечек сошлись на одном: Gemini 3.5 Pro — не инкрементальный апдейт, а первый релиз Google после GA GPT-5.6 Terra, способный конкурировать с OpenAI и Anthropic в Agent-сценариях.
Стек утечек раскладывается на три слоя:
- Внутренняя презентация DeepMind (The Information): контекст 2,5M токенов, Agent Runtime 3.0, inference на TPU v6 Trillium с ~2,3× эффективностью vs v5.
- Метаданные staging Vertex AI: model ID
gemini-3.5-pro-preview-0726появился в EU-логах до удаления. - Скриншоты бенчмарков (проверенные X-аккаунты): MMLU-Pro ~90,1%, SWE-bench Verified ~54%, GPQA Diamond ~76% — расхождение с deck в пределах ±2%.
Тезис «Google is back» справедлив, если вам нужны мультимодальные агенты и GCP-экосистема. Для чистого coding-latency лидирует GPT-5.6 Sol. Для policy-heavy long agents — Fable 5. Gemini 3.5 Pro выигрывает середину: широта, контекст и цена.
Три ловушки, в которые попадают команды в leak week
- Погоня за скриншотами без A/B-базлайна. Утечённые баллы не учитывают ваш репозиторий, промпты и tool chain. Переключение на хайпе обычно снижает pass rate на 8–15% в первую неделю.
- Игнорирование политики квот. Preview-whitelist отдаёт приоритет проектам с историей GCP spend. Команды без Vertex billing получают ~40 RPM, пока инсайдеры гоняют полные Agent-сьюты.
- Single-vendor Agent pipeline. Fable 5, GPT-5.6 Terra и Gemini 3.5 Pro падают по-разному на Computer Use, MCP tools и policy gates. Один backend — один режим отказа.
Матрица решений: Gemini 3.5 Pro vs Fable 5 vs GPT-5.6 Terra
| Параметр | Gemini 3.5 Pro (утечка) | Claude Fable 5 | GPT-5.6 Terra | Оптимальный сценарий |
|---|---|---|---|---|
| Контекстное окно | 2,5M токенов | 1,2M токенов | 1,5M токенов | Full-repo RAG → Gemini |
| SWE-bench Verified | ~54% (утечка) | ~51% | ~49% | Автономный coding → Gemini |
| Long-horizon agents | Agent Runtime 3.0, 16 parallel tools | Mythos tier, сильная policy compliance | Codex Agent + MCP native | Regulated workflows → Fable 5 |
| Latency P50 (первый токен) | ~1,1 с | ~1,4 с | ~0,85 с | Интерактивный IDE → GPT Terra/Sol |
| Мультимодальность | Нативный video+audio stream | Image + document primary | Image + text primary | Медиа-пайплайны → Gemini |
| API input (утечка) | $2,2 / 1M токенов | $3,5 / 1M токенов | $3,0 / 1M токенов | High-volume batch → Gemini |
| M4 hybrid fallback | LiteLLM + MLX 14B Coder | Та же архитектура | Та же архитектура | Все три — с dedicated lab node |
Утечённые технические параметры (preview build)
Используйте как чек-лист при открытии preview — не как догму до публикации GA-карточек Google.
- Архитектура
- Sparse MoE: ~480B total / ~45B active per forward pass (утечка). Технический принцип: разреженная активация снижает compute на inference при сохранении reasoning depth.
- Training compute
- ~4,2× FLOPs Gemini 2.5 Pro на смешанном кластере TPU v5p → v6. Предел масштабирования — не модель, а egress и IAM на tool layer.
- Контекст
- 2,5M токенов native; >512K input в preview тарифицируется с коэффициентом 1,4×.
- Agent Runtime 3.0
- Встроенный цикл plan-execute-reflect; до 16 tools за turn; Memory Store с retention 120 дней.
- Computer Use 2.1
- Контроль macOS Sonoma+ и Windows 11 на уровне координат; ~62% OSWorld subset (утечка).
- Throughput
- ~38 output tokens/sec при 128K контексте на TPU v6 (vs ~24 t/s у 2.5 Pro) — ключевой предел для multi-turn Agent.
Правило достоверности утечек: если цифра есть только в одном скриншоте — дисконтируйте на 20%. Если она в deck + staging logs + двух независимых leakers — планируйте вокруг неё.
Шесть шагов проверки перед переключением Agent-стека
- Зафиксируйте golden suite из 50 задач. Coding, RAG, Computer Use, policy-refusal — одинаковые промпты на всех трёх backend.
- Поднимите M4 tri-route lab. Арендуйте LlmMac Mac mini M4 24 ГБ. Разверните LiteLLM с алиасами:
gemini-3.5,fable-5,gpt-5.6-terra. - Подайте заявку на Gemini preview whitelist. Привяжите GCP billing и compliance contact в первую неделю июля — квоты ужесточаются после Cloud Next.
- 72-часовой soak на каждый backend. Логируйте pass rate, P95 latency, дневной token spend и коды tool-failure. Без cherry-picked демо.
- Настройте downgrade rules. При 80% дневного бюджета — маршрут на локальный MLX 14B Coder на M4. Agent loops не умирают при throttle preview API.
- 14-дневный canary report. Один некритичный repo на победившем hybrid stack. Finance подписывает до full migration.
Preview месячных затрат — четырехчеловечная команда (три backend)
| Стратегия | Месячная стоимость | Стабильность Agent | Vendor lock-in |
|---|---|---|---|
| Только Gemini 3.5 Pro API | ₽98 000–252 000 | Средняя (preview квоты) | Высокий (GCP) |
| Только Fable 5 API | ₽142 000–284 000 | Средняя (policy pauses) | Высокий |
| Только GPT-5.6 Terra API | ₽124 000–310 000 | Средняя | Высокий |
| M4 lab + tri-route hybrid | ₽80 000–168 000 | Максимальная | Минимальный |
Утечка меняет разговор — не инфраструктурный план. Dedicated M4-узел позволяет тестировать все три frontier-модели без переписывания agent harness при каждом заголовке.
Цифры для технического брифа — окно утечек июль 2026
- Preview window: несколько источников указывают 9–14 июля developer preview на Vertex AI и AI Studio; GA-анонс 15–18 июля на Google Cloud Next.
- Benchmark delta vs GPT-5.6 Terra: утечки показывают +3–5 пунктов Gemini 3.5 Pro на SWE-bench и MMLU-Pro; Terra сохраняет преимущество P50 latency (~25% быстрее первый токен).
- Benchmark delta vs Fable 5: Gemini лидирует в raw coding scores; Fable 5 — в CursorBench multi-file refactors (~4 пункта) и policy-refusal consistency в enterprise red-team.
- Экосистемный сигнал: iOS 27 Siri уже маршрутизирует сложные запросы в Gemini 2.5 Pro — GA 3.5 Pro, вероятно, придёт silent OTA в Q3.
- M4 fallback benchmark: MLX 14B Q4 Coder на 24 ГБ unified memory — 35–45 tokens/s (LlmMac soak, июнь 2026), покрывает ~85% daily downgrade при throttle preview API.
- Правило выбора: Google stack + ultra-long docs + multimodal → Gemini 3.5 Pro. Policy-heavy agents → Fable 5. Lowest-latency IDE → GPT-5.6 Sol/Terra. Все три → M4 tri-route lab.
Итог: проверяйте утечки на железе, которым управляете
Утечки июля 2026 рисуют правдоподобное возвращение Google: 2,5M контекст, Agent Runtime 3.0 и benchmark-преимущества над Fable 5 и GPT-5.6 Terra на ряде Agent-задач. Google снова конкурентен — но утечки не заменяют production SLA.
Не вырывайте Fable 5 или Terra на скриншотном хайпе. Зафиксируйте golden suite, прогоните tri-route A/B на M4 lab и дайте 14 дням измерений решить. Держите MLX fallback подключённым — preview-квоты не должны убивать pipeline.
Дополнительно:
— Gemini 3.5 Pro — таймлайн релиза июль
— Fable 5 vs GPT-5.5 — обзор возможностей
— GPT-5.6 Sol / Terra / Luna — сравнение
Рекомендуемое действие: откройте страницу заказа LlmMac и арендуйте Mac mini M4 24 ГБ tri-route agent lab. SSH за минуты, LiteLLM с алиасами Gemini, Fable 5 и GPT-5.6 — проверьте утечки сами до ужесточения preview-квот. Сравните тарифы аренды и выберите узел под ваш Agent pipeline.