Для кого: инженеры и AI-продуктологи, готовящиеся к релизу Gemini 3.5 Pro в июле 2026 и оценивающие Agent-стек Google vs OpenAI. Вывод: 2M токенов, Computer Use 2.0 и нативный Agent Runtime — главные дифференциаторы, но preview-квоты и IAM-сложность требуют hybrid lab на Mac mini M4. Структура: таймлайн релиза, три барьера внедрения, матрица vs GPT-5.6, технические спецификации Agent, шесть шагов SOP, цифры для брифа и рекомендация по аренде.
Окно релиза Gemini 3.5 Pro — июль 2026
В начале июля 2026 пересекающиеся сигналы The Information, внутренних memo Google и анонсов Google Cloud Next указывают: Gemini 3.5 Pro выходит в developer cycle сразу после I/O 2026, а не откладывается на Q3. Консолидированный таймлайн:
- 8–12 июля: Developer Preview в Vertex AI и Google AI Studio. API-имя ожидается
gemini-3.5-pro-preview, whitelist по проектам, жёсткие RPM-лимиты. - 15–18 июля: ключевой keynote Google Cloud Next, объявление GA-окна, запуск Gemini Code Assist Enterprise и глубокой интеграции с Workspace.
- Вторая половина июля: OTA для Android 16 и Pixel 10 — системный «Gemini Live Agent» с гибридным edge-cloud routing параллельно с 2.5 Pro.
Практический вывод: первая неделя июля — последний момент поднять API-шлюз, Agent-песочницу и fallback на Apple silicon. В день preview без изолированной среды команды бьются о квоты и IAM-дыры.
Три барьера внедрения (важнее benchmark-цифр)
- Нестабильные preview-квоты. На раннем этапе типичны 60 RPM и дневной token cap на проект. Production Agent без очереди и graceful degradation упирается в лимит в первый же день нагрузки.
- Разрозненный tool stack. Computer Use, Google Search Grounding и Workspace Actions требуют отдельных IAM-ролей. Пропуск одного permission — многошаговый Agent падает без явной ошибки в UI.
- Скрытая стоимость pure-cloud. Контекст 2M токенов плюс многораундовые Agent-циклы легко раздувают счёт. Без локального M4-узла для downgrade бюджет и uptime становятся непредсказуемыми.
Матрица решений: Gemini 3.5 Pro vs GPT-5.6 Terra
| Параметр | Gemini 3.5 Pro | GPT-5.6 Terra | Рекомендуемый сценарий |
|---|---|---|---|
| Контекстное окно | 2M токенов | 1,5M токенов | Монорепо / длинные документы → Gemini |
| Мультимодальность | Нативный video+audio stream | Изображение + текст | Медиа-аналитика → Gemini |
| Agent-оркестрация | Computer Use 2.0 + 12 built-in tools | Codex Agent + MCP | Google-экосистема → Gemini; CLI → GPT |
| Latency P50 | ~1,2 с до первого токена (TPU v6) | ~0,9 с | Интерактивный coding → GPT Sol/Terra |
| API input (preview) | $2,5 / 1M токенов | $3,0 / 1M токенов | High-throughput batch → Gemini чуть выгоднее |
| M4 hybrid fallback | LiteLLM + MLX downgrade | Та же архитектура | Оба стека — с M4 lab |
Agent Runtime: технический разбор и пределы производительности
Главный скачок Gemini 3.5 Pro — не сухой MMLU, а встроенный Agent Runtime: цикл «планирование — выполнение — рефлексия» от DeepMind вшит в API, без сборки LangChain-конструктора вручную.
- Computer Use 2.0
- Захват удалённого рабочего стола macOS/Windows, понимание UI и клики по координатам. Agent проходит цепочки из пяти и более шагов через браузер и нативные приложения.
- Parallel Tool Calling
- До восьми инструментов (Search, Maps, Sheets и др.) за один inference-pass. По утечкам preview — снижение end-to-end latency примерно на 40% vs серийный режим 2.5 Pro.
- Memory Store
- Проектная персистентная память до 90 дней — критично для support-Agent и долгих контекстов без повторной загрузки system prompt.
- Code Execution Sandbox
- Изолированный Python/Node на стороне Vertex. Agent пишет и запускает скрипт для верификации ответа — меньше «галлюцинаторного» кода в production.
- Пределы Apple Silicon (практический floor)
- Mac mini M4 с 24 ГБ unified memory через MLX выдаёт 35–45 tokens/s на 14B Q4 coder — покрывает ~85% daily Agent loops при API throttle.
Preview-бенчмарки (до GA): MMLU-Pro ~89,2% (+18% vs 2.5 Pro), SWE-bench Verified ~52% (+14%), Video-MME ~78% (+21%). Официальные карточки GA могут отличаться на ±3%.
Preview месячных затрат — четырехчеловечная команда
| Стратегия | Месячная стоимость | Стабильность Agent | Vendor lock-in |
|---|---|---|---|
| Только Gemini 3.5 Pro API | ₽84 000–210 000 | Средняя (квоты) | Высокий |
| Только GPT-5.6 Terra API | ₽98 000–245 000 | Средняя | Высокий |
| Аренда M4 + open-weight downgrade | ₽12 600–29 400 | Высокая | Минимальный |
| Hybrid: Gemini API + M4 lab | ₽56 000–126 000 | Максимальная | Низкий |
Шесть шагов SOP перед preview Gemini 3.5 Pro
- Заявка на preview whitelist. В Google Cloud Console — Early Access для Gemini 3.5 Pro, привязка billing account и compliance contact.
- Provision M4 lab. Арендуйте LlmMac Mac mini M4 24 ГБ, по SSH за 15 минут разверните LiteLLM с dual-route Gemini/GPT.
- Зеркало Agent workflow. Направьте Cursor или IDE на OpenAI-compatible endpoint M4 — те же prompt templates, переключение preview API без рефакторинга.
- Регрессия Computer Use. В изолированной VNC-сессии прогоните screenshot → click → form fill, зафиксируйте IAM-пробелы.
- Алерты и downgrade. При 80% дневного token budget — автопереключение на локальный MLX 14B Coder.
- 14-дневный canary. Один некритичный repo на hybrid stack; сравните quality, latency и cost до full cutover.
Цифры для технического брифа (июль 2026)
- Compute: inference Gemini 3.5 Pro на TPU v6 Trillium; Google заявляет ~2,1× энергоэффективность vs v5 на том же workload.
- Длинный контекст: preview surcharge для >128K input — около 1,5×; на GA ожидается паритет с тарифами 2.5 Pro long-window.
- Экосистема: iOS 27 Siri уже на Gemini 2.5 Pro; после GA 3.5 Pro — system OTA в Q3, мобильный Agent entry point усилится.
- M4 benchmark: 14B Q4 Coder на 24 ГБ — 35–45 tokens/s (LlmMac, июнь 2026), достаточно для 85% downgrade-сценариев.
- Выбор стека: Google stack + сверхдлинные документы → Gemini 3.5 Pro; универсальный coding + низкая latency → GPT-5.6 Terra; оба — с M4 hybrid.
Итог: сначала lab, потом all-in на API
Gemini 3.5 Pro концентрирует накопленный потенциал Google в TPU, мультимодальности и Agent Runtime — 2M токенов, Computer Use 2.0 и параллельные tool calls дают преимущество командам на GCP и Android. Но preview-квоты, IAM и волатильность счёта — реальные риски launch week.
Зрелая стратегия — не подключать production 15 июля «в лоб», а в первую неделю июля прогнать LiteLLM dual-route и Agent-регрессию на M4, оставить MLX fallback и только после 14-дневного canary решать о полной миграции. Облако гонится за frontier-моделью, локальный узел страхует pipeline.
Дополнительно:
— GPT-5.6 Sol / Terra / Luna — сравнение
— OpenAI: новости июля 2026
— Шесть AI-инструментов для разработки
Рекомендуемое действие: откройте страницу заказа LlmMac и разверните Gemini 3.5 Pro Agent lab на Mac mini M4 (24 ГБ / 512 ГБ) до preview-релиза. SSH/VNC за минуты, LiteLLM routing, помесячная оплата — прогоните hybrid stack и downgrade до GA. Сравните тарифы аренды и выберите узел под ваш Agent pipeline.