Inhalt: Drei Risikoachsen · GraphRAG auf M4 · OpenClaw onboard · Timeouts & Breaker · Fehler-Summary PR/CI · Embedding-FAQ
Kontext für Chunking und Vektor-Kontingente: lokale RAG-Entscheidungsmatrix. Routing und Multi-Modell-Aliase: OpenClaw × LiteLLM auf Remote-Mac. Einstieg über Startseite und Miete eines LLM-Remote-Knotens.
Drei Risikoachsen in der GraphRAG-Index-Pipeline
1. Ungebremste Community-Batches: Zu große Community-Detection-Partitionen füllen RAM während Embedding und Clustering — der Job stirbt ohne Checkpoint. 2. Gateway-Umgehung: Direkte LLM- oder Embedding-URLs umgehen Tool-Whitelist und Audit; ein geleakter Key exponiert das gesamte Corpus-Netz. 3. Stille Nachtläufe: Auf dem Remote-Mac multiplizieren sich Minutenkosten mit Retries; ohne Fehler-Summary in PR/CI debuggt das Team blind.
GraphRAG auf M4: Umgebung und Community-Batch-Schwellen
Python 3.11+, GraphRAG-CLI und ein dedizierter Arbeitsbaum unter ~/graphrag-edge mit read-only Corpus-Mount. TMPDIR und Artefaktpfade auf die interne SSD legen; Unified Memory teilt sich mit parallelen Embedding-Workern. Für Wissensdatenbank-Teams gilt: jede Nacht-Indexierung erhält eine feste run_id, damit Gateway-Logs, GraphRAG-Artefakte und CI-Summary dieselbe Korrelation tragen.
| RAM (M4) | Community-Batch (Start) | Embedding-Batch | Breaker-Regel | Stabilitätsnotiz |
|---|---|---|---|---|
| 16 GB | 8 bis 16 Knoten | 4 bis 8 | 3× OOM → Pause 15 min | Nur ein paralleler Worker; API-Embeddings bevorzugen. |
| 24 GB | 16 bis 32 | 8 bis 16 | 3× OOM → Batch halbieren | Checkpoint nach jeder Community-Phase. |
| 32 GB+ | 32 bis 64 | 16 bis 32 | 5× Timeout → Schaltkreis offen | Getrennte Queues für Index vs. Query. |
| Remote-Mac | −20 % gegenüber lokal | identisch sweepen | Wall-Clock-Deckel pro Nacht | RTT zum Gateway in Batch-Kalibration einrechnen. |
openclaw onboard, Gateway-Token und ausgehende Domain-Whitelist
Nach openclaw onboard und grünem openclaw doctor erzeugen Sie ein Loopback-Gateway-Token mit kleinstem Scope (nur embed, chat, Observability). GraphRAG-Clients zeigen OPENAI_BASE_URL auf das Gateway — niemals auf Roh-Upstreams. Dokumentieren Sie im Runbook, welche Skill-IDs GraphRAG beim Index-Lauf aufruft; jede neue Tool-Registrierung durchläuft ein Security-Review, bevor die Whitelist in Staging und Produktion identisch versioniert wird.
| Schicht | Pflichtfeld | Beispielwert | Sicherheitsnotiz |
|---|---|---|---|
| Tool-Whitelist | erlaubte Tool-IDs | graphrag_index, graphrag_query | Standard-Allowlists ablehnen; Änderung per MR. |
| Egress-Domains | Host-Suffix-Liste | *.openai.azure.com, OTel-Collector | Kein Wildcard-* in Produktion. |
| Token-Rotation | max. Lebensdauer | 15 bis 60 Minuten | Secrets nie in GraphRAG-settings.yaml committen. |
| Audit | Korrelations-ID | X-Request-ID durchgängig | Gateway-Log und GraphRAG-JSONL joinen. |
Index- und Query-Timeout, Schaltkreis und Retry-Vorlage
Indexierung toleriert längere Wall-Clock mit Checkpoints; interaktive Queries brauchen harte First-Byte-Grenzen. Retries nur mit Idempotenz-Key und Jitter. Die zweite Matrix trennt bewusst Batch-Phasen von Online-Abfragen — SRE können damit Alarme pro Phase schärfen, ohne Query-Latenz für Index-Last zu opfern.
| Phase | Connect (s) | First-Byte (s) | Gesamt (s) | Retries |
|---|---|---|---|---|
| Index / embed | 10 | — | 7200 | 2 mit Jitter |
| Community detect | 10 | — | 3600 | 1, dann Breaker |
| Query / local | 5 | 8 | 45 | 1, kein Retry bei 4xx |
| Query / global | 5 | 12 | 90 | 2 nur bei 502/503 |
# Retry-Vorlage (logische Einheiten)
index_connect_timeout_s = 10
index_total_timeout_s = 7200
query_first_byte_timeout_s = 8
query_total_timeout_s = 45
max_retries = 2
breaker_open_after_failures = 5
breaker_cooldown_s = 120Interpretation: zwei Stunden Gesamt-Budget für Voll-Index mit Checkpoint; acht Sekunden First-Byte für Query schützt UX; nach fünf Serienfehlern öffnet der Schaltkreis zwei Minuten — verhindert Token-Stürme auf dem Remote-Mac.
Fehler-Summary in Pull-Request und CI zurückspielen
- JSONL-Envelope definieren. Felder:
run_id,phase(embed|community|summarize),retryable,summary(max. 500 Zeichen). - CI-Artefakt hochladen.
graphrag-failures.jsonlals Workflow-Artefakt; keine Rohtoken in Logs. - PR-Kommentar via Bot. Letzte drei Envelopes als Markdown-Tabelle; Link zum Gateway-Audit mit gleicher
run_id. - Gate vor Merge. Schwellen: >5 % Schema-Fehler oder ein offener Breaker → Build rot.
- Canary auf Remote-Mac. Drei identische Nachtläufe; Speicherpeak und Minutenkosten dokumentieren.
- Observability verknüpfen. OTel-Spans für jede GraphRAG-Phase mit Gateway-
X-Request-IDlabeln, damit Incidents ohne Log-Archäologie geschlossen werden.
FAQ: Embedding-Speicher auf Apple Silicon
OOM trotz kleiner Dokumente? Parallele Community-Phasen plus Embedding-Worker — Worker auf eins setzen, Batch halbieren, Quantisierung prüfen. Siehe auch die RAG-Matrix.
Gateway 403 bei Embedding? Host fehlt in Egress-Whitelist oder Token-Scope zu eng — openclaw doctor und Allowlist diffen.
Index hängt ohne Fehler? Connect-Timeout zu kurz vs. Total zu lang — Phase in JSONL markieren und Breaker manuell schließen nach Cooldown.
Unified Memory bei M4? Beobachten Sie memory_pressure während Community-Detection: ab „warn“ Embedding-Batch halbieren und parallele GraphRAG-Worker stoppen, bevor der Kernel Prozesse beendet.
- Batch-Startwert 16/8 auf 24-GB-M4 für mittlere Korpora — danach sweepen.
- Drei Canary-Läufe vor Produktions-Corpus — identische Whitelist-Version.
- Fünfzehnminütiger Rollback inklusive Gateway-Token-Revocation und GraphRAG-Checkpoint-Pfad.
Vertiefung: LiteLLM-Routing, LlamaIndex QueryEngine. Öffentlich: Startseite, Miete, Preise.
Verwandte Artikel: Lokales RAG, LiteLLM-Gateway, Vektorindex M4.