« À qui s'adresse ce guide ? » Aux responsables techniques et aux ingénieurs ML qui doivent choisir entre Sol, Terra et Luna avant que le budget d'inférence de juillet ne se fige. « Qu'allez-vous en retirer ? » Un comparatif palier par palier avec tarifs, benchmarks et règles de routage. « Contenu : » trois risques de sélection, une matrice décisionnelle, des repères techniques, six étapes opérationnelles et une conclusion orientée achat.

Instantané juillet 2026 — trois paliers, une génération

Le 26 juin 2026, OpenAI a officiellement présenté la famille GPT-5.6. La convention de nommage évolue : le chiffre marque la génération, le nom désigne le palier de capacité permanent.

Trois modèles déploient ensemble leurs forces complémentaires :

  • Sol — palier phare pour le raisonnement complexe, le codage agentique et la cybersécurité. Seul palier avec les modes max de raisonnement et ultra de sous-agents parallèles.
  • Terra — palier équilibré de production. Performances comparables à GPT-5.5 à environ la moitié du coût, idéal pour les workflows quotidiens des équipes produit.
  • Luna — le plus rapide et le moins cher. Conçu pour les tâches routinières à haut volume et les réponses à faible latence.

L'accès a débuté en aperçu limité pour une vingtaine de partenaires API et Codex de confiance. OpenAI prévoit une disponibilité élargie sur ChatGPT, Codex et l'API dans les semaines à venir — les estimations sectorielles visent mi-juillet 2026.


Trois frictions de sélection de palier en juillet

  1. Sur-provisionner Sol. Sol Ultra exécute des sous-agents parallèles — puissant, mais coûteux à 30 $/M tokens en sortie. Les équipes qui routent du RAG batch ou des éditions simples via Sol consomment trois à cinq fois plus de budget que Terra ne l'exige.
  2. Sous-utiliser Luna. Luna gère classification, résumés et routage à 1 $/6 $ par million de tokens. Ignorer ce palier et tout diriger vers Terra laisse 40 à 60 % d'économies potentielles sur la table.
  3. Écart d'accès preview. La plupart des développeurs n'ont pas encore de clés API pendant l'aperçu coordonné. Sans nœud de repli local, les sprints s'immobilisent lorsque les quotas partenaires se remplissent.

Matrice décisionnelle : Sol vs Terra vs Luna

Paler Charge de travail idéale Entrée / Sortie ($/M tokens) Rôle Mac mini M4
Sol Codage agentique, raisonnement multi-étapes, cybersécurité 5 $ / 30 $ Nœud de staging pour politiques Sol Ultra avant dépense production
Terra API production, revue de code, workflows dev quotidiens 2,50 $ / 15 $ Reproduire le comportement Terra avec modèles locaux 14B sur M4
Luna Classification, routage, jobs batch haut volume 1 $ / 6 $ Décharger les tâches équivalentes Luna localement ; réserver l'API pour les pics
Sol sur Cerebras Inférence frontière sensible à la latence (juillet 2026) Palier premium Benchmark 750 t/s Cerebras vs latence M4 locale avant engagement
Repli GPT-5.5 Baseline stable pendant la fenêtre preview Tarification legacy Routage bulk vers modèles open-weight sur M4 jusqu'à stabilisation GA

Principe directeur : Sol pour l'intelligence de pointe, Terra pour la production quotidienne, Luna pour le volume. Un stack hybride avec un labo Mac mini M4 comble l'écart preview et réduit la dépense mensuelle de 55 à 70 %.


Repères techniques à suivre en juillet

Benchmarks Sol (sortie OpenAI, juin 2026)
Terminal-Bench 2.1 : Sol Ultra atteint 91,9 %, devant Claude Mythos 5 sur le codage agentique. Efficacité token cybersécurité améliorée versus GPT-5.5.
Plafond de performance Terra
Égale GPT-5.5 sur les benchmarks standards à deux fois moins cher. Recommandation par défaut pour les charges API métier à la GA.
Profil de débit Luna
Palier à plus faible latence de la famille. Optimisé pour la réactivité plutôt que la profondeur maximale de raisonnement.
Cache de prompts (tous paliers)
Points de rupture explicites avec durée minimale de 30 minutes. Écritures cache à 1,25× le prix d'entrée. Lectures cache à 90 % de remise.
Plancher matériel local (routage hybride)
Un Mac mini M4 avec 24 Go de mémoire unifiée exécute des modèles codeur 14B Q4 à 40 t/s — suffisant pour 85 % des boucles quotidiennes de classe Terra et Luna.

Aperçu des coûts mensuels — équipe de quatre développeurs (juillet 2026)

Stratégie de routage Coût mensuel Risque semaine preview Verrouillage fournisseur
API Sol seule 2 900–5 800 € Élevé (quotas + surcharges Ultra) Élevé
Mix Sol + Terra 1 650–3 300 € Moyen Moyen
Hybride trois paliers (Sol/Terra/Luna + M4) 620–1 140 € Faible Faible
Open-weight + M4 local 400–850 € Minimal Minimal

Le routage intelligent ne consiste pas à éviter Sol : il s'agit de réserver les paliers frontière aux tâches qui en ont réellement besoin, tout en maintenant les boucles quotidiennes prévisibles sur Apple silicon.


Six étapes de préparation avant la GA GPT-5.6 en juillet

Cette procédure couvre le mappage des paliers, le provisionnement et la bascule progressive. Chaque étape reste réalisable en moins de deux heures si un nœud LlmMac M4 est déjà actif.

  1. Cartographier les charges vers les paliers. Étiqueter chaque pipeline Sol, Terra ou Luna avant l'ouverture GA. Sol uniquement pour les agents multi-étapes.
  2. Provisionner un nœud de staging. Louer un Mac mini M4 24 Go LlmMac ; confirmer l'accélération Metal via SSH en quelques minutes.
  3. Benchmarker Terra localement. Exécuter votre suite de tests contre la baseline GPT-5.5 ; confirmer que les modèles locaux de classe Terra couvrent plus de 80 % des tâches quotidiennes.
  4. Configurer le routage hybride. Diriger classification et batch vers Luna API ou M4 local. Revue de code vers Terra. Réserver Sol pour les pics agentiques.
  5. Tester les politiques Sol Ultra. Reproduire le comportement sous-agents sur sandbox M4 avant d'activer le mode Ultra en production.
  6. Déployer un canari sur 14 jours. Migrer un workflow non critique ; comparer coûts, latence et échecs avant bascule complète.

Checklist de routage à trois paliers — juillet 2026

  • Le nœud M4 local gère plus de 80 % des tâches de classe Terra et Luna sans appel API.
  • Sol Ultra invoqué uniquement pour les workflows agent multi-étapes qui échouent sur Terra.
  • Cache de prompts configuré avec points de rupture explicites sur les prompts système répétés.
  • Le burn mensuel reste stable si quotas preview ou tarifs surge GA s'activent.
  • L'équipe peut basculer de palier principal en 48 heures selon des règles documentées.

Repères citables GPT-5.6 juillet 2026

  • Date de sortie : aperçu limité lancé le 26 juin 2026. GA élargie attendue mi-juillet sur ChatGPT, Codex et API.
  • Tarification : Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens entrée/sortie.
  • Benchmark Sol Ultra : 91,9 % sur Terminal-Bench 2.1 — devant Claude Mythos 5 sur le codage agentique (OpenAI, juin 2026).
  • Déploiement Cerebras : Sol sur matériel Cerebras jusqu'à 750 tokens par seconde, prévu juillet 2026 pour clients sélectionnés.
  • Portée preview : environ 20 partenaires de confiance via API et Codex pendant la sortie limitée coordonnée.
  • Économies hybrides : les équipes en routage trois paliers + Mac mini M4 rapportent 55–70 % d'économies mensuelles vs stacks Sol-only (enquête LlmMac, juin 2026).

Synthèse : choisir le bon palier, acheter intelligemment en juillet

Juillet 2026 marque le passage d'OpenAI vers des paliers de capacité permanents. Sol apporte le codage agentique de pointe. Terra remplace GPT-5.5 comme défaut production à moitié prix. Luna débloque les charges volumineuses auparavant trop coûteuses à automatiser.

Les équipes qui réussiront ce mois ne dirigeront pas tout vers Sol par défaut. Elles opéreront des stacks hybrides à trois paliers : Sol pour l'intelligence de pic, Terra et Luna pour la production quotidienne, et un labo Mac mini M4 dédié pour couvrir l'écart preview et les sandboxes conformité.

Lectures complémentaires :
OpenAI juillet 2026 : actualités et calendrier GPT-5.6
GPT-5.6 : fenêtre de lancement et 1,5M tokens
GPT-5.6 : préparation workflows Agent développeur

Prêt à agir ? Ouvrez la page d'achat LlmMac et déployez dès aujourd'hui votre laboratoire de routage GPT-5.6 juillet : facturation mensuelle, SSH prêt en quelques minutes, 24 Go de mémoire unifiée — testez Sol, Terra et Luna sur du matériel réel avant d'engager votre budget d'inférence.