Embedding-Modell und Runtime auf dem Spark festlegen #8
Labels
No labels
agent
bereit
ready-for-agent
wayfinder:grilling
wayfinder:map
wayfinder:research
wayfinder:task
No milestone
No project
No assignees
1 participant
Notifications
Due date
No due date set.
Blocks
#9 Ressourcenschutz und Lastgrenzen neben Qwen festlegen
zwuge/dgx-spark
Reference
zwuge/dgx-spark#8
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
Question
Wie wird nomic-embed-text-v1.5 auf dem Spark geladen und betrieben, welche Modellrevision wird gepinnt und welche Runtime-/Packaging-Form passt neben dem bestehenden Qwen-Dienst?
Parent map: Wayfinder: Embedding-Schnittstelle neben Qwen im DGX Spark
Starting assumptions
Die bestätigten Wayfinder-Empfehlungen gelten als Ausgangspunkt: separater Dienst neben Qwen, nomic zuerst, kleiner /embed-Vertrag, Sicherheits- und Live-Verifikationsziel.
Resolution
Die Embedding-Runtime wird als eigenständiger Python-Service im
dgx-spark-Repo umgesetzt:fastembed/ONNX mitnomic-embed-text-v1.5; keine Qwen-/vLLM-Erweiterung und kein neuer Qdrant-Vaultdienst.latestund kein unpinned Modellstart.Update- und Rollback-Regel: Ein Modellupdate erfolgt ausschließlich explizit und versioniert. Die neue Revision wird parallel geladen und per Health-, Contract-, Dimensions- und Embedding-Smoke-Test geprüft. Erst danach wird die aktive Revision umgestellt und der Dienst kontrolliert neu gestartet. Die alte Revision bleibt zunächst für Rollback erhalten.
secondbrain-mcpbehandelt die neue Modellrevision als neue Index-Generation; alte und neue Embeddings werden nie vermischt. Bei Problemen wird auf alte Revision und alte Index-Generation zurückgeschaltet.Die konkrete Modell-Commit-ID wird im Implementierungsticket beim ersten reproduzierbaren Download ermittelt und dokumentiert.