Ressourcenschutz und Lastgrenzen neben Qwen festlegen #9

Closed
opened 2026-08-10 13:40:05 +02:00 by zwuge · 1 comment
Owner

Question

Welche Batch-, Request-, Parallelitäts-, Speicher- und Backpressure-Grenzen braucht der Embedding-Dienst, damit Vault-Backfill den produktiven Qwen-/VLM-Betrieb nicht beeinträchtigt?

Parent map: Wayfinder: Embedding-Schnittstelle neben Qwen im DGX Spark

Starting assumptions

Die bestätigten Wayfinder-Empfehlungen gelten als Ausgangspunkt: separater Dienst neben Qwen, nomic zuerst, kleiner /embed-Vertrag, Sicherheits- und Live-Verifikationsziel.

## Question Welche Batch-, Request-, Parallelitäts-, Speicher- und Backpressure-Grenzen braucht der Embedding-Dienst, damit Vault-Backfill den produktiven Qwen-/VLM-Betrieb nicht beeinträchtigt? Parent map: [Wayfinder: Embedding-Schnittstelle neben Qwen im DGX Spark](https://git.platz-consulting.de/zwuge/dgx-spark/issues/6) ## Starting assumptions Die bestätigten Wayfinder-Empfehlungen gelten als Ausgangspunkt: separater Dienst neben Qwen, nomic zuerst, kleiner /embed-Vertrag, Sicherheits- und Live-Verifikationsziel.
zwuge self-assigned this 2026-08-10 15:11:17 +02:00
Author
Owner

Resolution

Der Embedding-Service erhält konservative, konfigurierbare Schutzgrenzen neben Qwen:

  • Genau ein aktiver Embedding-Request; keine interne Warteschlange und keine automatische Parallelisierung.
  • Maximal 16 Texte je Request.
  • Maximal 16.000 Zeichen je Text und 256.000 Zeichen je Gesamt-Request.
  • Bei belegtem Worker, Ressourcenknappheit oder unterschrittenem freien Unified-Memory-Schwellenwert liefert der Dienst 429 bzw. 503 als retrybaren Zustand.
  • Der freie-Speicher-Schwellenwert wird nach einer Baseline-Messung festgelegt und nicht aus alten Momentaufnahmen abgeleitet.
  • Kein aggressives Swapping; Qwen-/OCR-Spitzenlast hat Vorrang.
  • Retry, Backoff und erneute Einreihung bleiben bei secondbrain-mcp.

Damit ist die Schutzgrenze für einen ersten Betrieb entschieden; konkrete Grenzwerte dürfen nur über Messung und eine explizite Konfigurationsänderung angepasst werden.

## Resolution Der Embedding-Service erhält konservative, konfigurierbare Schutzgrenzen neben Qwen: - Genau ein aktiver Embedding-Request; keine interne Warteschlange und keine automatische Parallelisierung. - Maximal 16 Texte je Request. - Maximal 16.000 Zeichen je Text und 256.000 Zeichen je Gesamt-Request. - Bei belegtem Worker, Ressourcenknappheit oder unterschrittenem freien Unified-Memory-Schwellenwert liefert der Dienst 429 bzw. 503 als retrybaren Zustand. - Der freie-Speicher-Schwellenwert wird nach einer Baseline-Messung festgelegt und nicht aus alten Momentaufnahmen abgeleitet. - Kein aggressives Swapping; Qwen-/OCR-Spitzenlast hat Vorrang. - Retry, Backoff und erneute Einreihung bleiben bei secondbrain-mcp. Damit ist die Schutzgrenze für einen ersten Betrieb entschieden; konkrete Grenzwerte dürfen nur über Messung und eine explizite Konfigurationsänderung angepasst werden.
zwuge closed this issue 2026-08-10 15:25:00 +02:00
Sign in to join this conversation.
No milestone
No project
No assignees
1 participant
Notifications
Due date
The due date is invalid or out of range. Please use the format "yyyy-mm-dd".

No due date set.

Reference
zwuge/dgx-spark#9
No description provided.