1. Projektüberblick
MemPalace ist ein lokal ausgerichtetes, quelloffenes KI-Speichersystem, das den Gesprächsverlauf eines KI-Agenten wortgetreu speichert und mit semantischer Suche wiederfindet. Es löst das Problem, dass Coding-Agenten und Chatbots alles „vergessen“, sobald eine Sitzung endet oder das Kontextfenster komprimiert wird.
2. Hintergrund & Positionierung
MemPalace wurde geschaffen, um einen ganz bestimmten Schmerzpunkt zu beheben: Lang laufende Agentensitzungen (in Werkzeugen wie Claude Code) verlieren nach der Komprimierung früheren Kontext, sodass der Agent selbst nach stundenlanger Vorarbeit fragt: „Woran arbeiten wir heute?“ Die Kernaufgabe besteht darin, zwei Dinge zu vereinen, die bei den meisten Speicherwerkzeugen im Widerspruch zueinander stehen: alles mit voller Wiedergabetreue zu speichern und zugleich die richtige Stelle sofort zu finden – auch bei einer vagen, halb erinnerten Anfrage.
Architektonisch lehnt es sich an die Zettelkasten-Methode an (kleine, querverwiesene Karteikarten) und organisiert das Gedächtnis in einer Hierarchie aus Flügeln (Personen/Projekte), Räumen (Themen), Schränken (komprimierte, KI-lesbare Indexeinträge) und Schubladen (der ursprüngliche, wortgetreue Inhalt). Das unterscheidet sich in zweierlei Hinsicht von den meisten Gedächtnis-Frameworks: Es fasst das Gespeicherte niemals zusammen oder paraphrasiert es (die Abfrage liefert immer den Originaltext zurück), und sein Abfrage-Backend ist austauschbar statt an eine Vektordatenbank gebunden. Teams können daher rein lokal beginnen und später auf einen servergestützten Speicher umziehen, ohne die übrige Systemarchitektur zu verändern.
3. Funktionskategorien
- 🗂️ Palace-Speicher — wortgetreue, strukturierte Speicherung über Flügel/Räume/Schränke/Schubladen; Kernoperationen umfassen
mine,search,wake-upund das nachrichtenweisesweep; Zweck: die volle Gesprächstreue bewahren und zugleich navigierbar halten. - 🔌 Austauschbare Backends — 5 unterstützte Speicher:
chroma(Standard, eingebettet),sqlite_exact,milvus,qdrant,pgvector; Zweck: Nutzer können lokal starten und ohne Architekturumbau auf einen gemeinsam genutzten Server skalieren. - 🕸️ Wissensgraph — ein temporaler Entitäts-Beziehungs-Graph mit Gültigkeitsfenstern, gestützt auf lokales SQLite; unterstützt Operationen zum Hinzufügen, Abfragen, Invalidieren und für Zeitachsen; Zweck: nachvollziehen, wie sich Fakten und Beziehungen im Lauf der Zeit verändern, statt nur statische Momentaufnahmen zu liefern.
- 🔧 MCP-Server & Werkzeuge — 45 MCP-Werkzeuge für Palace-Lese-/Schreibzugriffe, Wissensgraph-Operationen, flügelübergreifende Navigation, Schubladenverwaltung, Agententagebücher und Multi-Agenten-Koordination; Zweck: Gedächtnis als erstklassige Fähigkeit für jeden MCP-kompatiblen Agenten bereitstellen.
- 🪝 Automatische Speicher-Hooks — Hooks für Claude Code, Codex CLI und Cursor IDE, die regelmäßig und vor der Kontextkomprimierung speichern; Zweck: Sitzungen automatisch erfassen, ohne einen manuellen Schritt wie „bitte merke dir das“.
- 🤖 Multi-Agenten-Unterstützung — jeder Spezialagent erhält einen eigenen Flügel und ein eigenes Tagebuch, zur Laufzeit über
mempalace_list_agentsauffindbar; Zweck: Mehrere Agenten können ein gemeinsames Speichersystem nutzen, ohne sich gegenseitig den Kontext oder den System-Prompt zu verunreinigen.
4. Wichtige Highlights
- Wortgetreue Abfrage statt Zusammenfassung — Suchergebnisse liefern den Originaltext zurück, sodass unterwegs nichts durch verlustbehaftete Komprimierung verloren geht.
- Lokal ausgerichtet und offlinefähig — der zentrale Benchmark-Pfad (96,6 % R@5 bei LongMemEval) benötigt in keiner Phase einen API-Schlüssel, keine Cloud und keinen LLM-Aufruf.
- Benchmarkgeprüfte, reproduzierbare Ergebnisse — jede veröffentlichte Zahl (LongMemEval, LoCoMo, ConvoMem, MemBench) wird mit den exakten Befehlen ausgeliefert, um sie aus dem Repository zu reproduzieren.
- Optionale Hybrid- und LLM-Neusortierungspipeline — Schlüsselwort-Boosting, zeitliche Nähe-Boosting und die Extraktion von Präferenzmustern heben die Trefferquote auf 98,4 % bei zurückgehaltenen Daten; mit LLM-Neusortierung sind ≥99 % erreichbar, und das Verfahren ist modellunabhängig (getestet mit Claude sowie mit offenen Modellen über Ollama Cloud).
- Stiller Hintergrundbetrieb — nach dem aktuellen Design laufen Tagebucheinträge und Palace-Ablage in Hintergrund-Hooks bzw. -Subagenten statt im sichtbaren Chat, wodurch der Token-Overhead durch erneut übertragene Statusmeldungen sinkt.
- Multi-Architektur-Docker-Unterstützung — ein veröffentlichtes Container-Image läuft nativ sowohl auf amd64 als auch auf arm64 (einschließlich Apple Silicon), mit einem separaten CUDA-Build für GPU-Workloads.
5. Anwendungsfälle nach Rolle
- Allgemeine Entwickler — den Projektkontext eines KI-Coding-Assistenten über Sitzungen hinweg behalten, statt Entscheidungen nach jeder Komprimierung oder jedem Neustart erneut erklären zu müssen.
- Daten- und Forschungswissenschaftler — große Mengen früherer Gespräche oder Notizen semantisch durchsuchen und erschließen sowie die eigenen Abruf-Benchmarks des Projekts als Referenzimplementierung reproduzieren.
- Projektmanager / Teams — gemeinsame Claude-Code-Transkripte in einen gemeinsamen Palace (einen „Shared-Brain-Hub“) überführen, damit Teamwissen und Entscheidungen an einem Ort durchsuchbar bleiben, statt über einzelne Chatverläufe verstreut zu sein.
6. Erste Schritte
Finden, was du brauchst — durchstöbere die Dokumentationsseite nach Anleitungen und Referenzmaterial:
https://mempalaceofficial.com/guide/getting-started.html
Installieren / Integrieren — empfohlen ist eine isolierte Installation über uv, anschließend einen Palace initialisieren:
uv tool install mempalace
mempalace init ~/projects/myapp
mempalace mine ~/projects/myapp
mempalace search "why did we switch to GraphQL"
Eine agentengeführte Einrichtung ist ebenfalls verfügbar, indem du die Skills des Projekts installierst:
npx skills add MemPalace/mempalace
Mitwirken — lies den Beitragsleitfaden, bevor du einen PR eröffnest:
https://github.com/MemPalace/mempalace/blob/main/CONTRIBUTING.md
7. Projektstruktur
mempalace/
├── backends/ # austauschbare Speicher-Backend-Implementierungen (chroma, qdrant, pgvector, ...)
├── data/ # gebündelte Datenressourcen
├── i18n/ # Internationalisierungsressourcen
├── instructions/ # agentengerichtete Anweisungssätze
├── integrations/ # Integrationen von Drittanbieter-Werkzeugen
├── sources/ # Aufnahmequellen für das Mining
├── cli.py # `mempalace`-Kommandozeilen-Einstiegspunkte
├── mcp_server.py # MCP-Server-Implementierung (Werkzeugbereitstellung)
├── knowledge_graph.py # temporaler Entitäts-Beziehungs-Graph
├── palace.py # zentrale Palace-Lese-/Schreiblogik
├── miner.py / convo_miner.py # Pipelines für Inhalts- und Gesprächs-Mining
├── searcher.py # semantische Such-/Abfragelogik
└── onboarding.py # Ersteinrichtung und Auswahl des Einbettungsmodells
Weitere wichtige Verzeichnisse auf oberster Ebene: benchmarks/ (reproduzierbare Benchmark-Skripte und -Ergebnisse), hooks/ (Auto-Save-Hook-Implementierungen für unterstützte Editoren/Agenten), skills/ (installierbare Agenten-Skills) und website/ (Quelle der Dokumentationsseite).
8. Verwandtes Ökosystem
- Vorgelagerte Abhängigkeiten: ChromaDB (Standard-Vektorspeicher), mit optionaler Unterstützung für Milvus, Qdrant und pgvector; ONNX Runtime und Einbettungsmodelle (
all-MiniLM-L6-v2,embeddinggemma-300m) für lokale Einbettungen. - Agenten-/Editor-Integrationen: Claude Code, Codex CLI, Cursor IDE, Gemini CLI und Antigravity, verbunden über das Model Context Protocol (MCP).
- Ergänzende Werkzeuge: Jeder OpenAI-kompatible
/v1/embeddings-Endpunkt (LM Studio, llama.cpp, vLLM, Ollama) kann für entfernte oder GPU-beschleunigte Einbettung anstelle lokaler Berechnung verwendet werden.
9. Lizenz
- ✅ Kommerzielle Nutzung, Veränderung, Weitergabe und private Nutzung sind unter der MIT-Lizenz erlaubt.
- ❌ Die Lizenz bietet keine Gewährleistung und keine Haftungsübernahme für die Autoren.
- ℹ️ Der ursprüngliche Urheberrechts- und Lizenzhinweis muss in Kopien oder wesentlichen Teilen der Software erhalten bleiben.
10. FAQ
F: Benötigt MemPalace einen API-Schlüssel oder einen Cloud-Dienst, um zu funktionieren?
A: Nein. Der zentrale Benchmark-Pfad, einschließlich des rohen Abrufwerts von 96,6 % R@5 bei LongMemEval, läuft vollständig lokal mit dem Standard-Backend chroma und ohne LLM-Aufrufe.
F: Welche Vektordatenbank verwendet MemPalace?
A: Standardmäßig ChromaDB, mit austauschbarer Unterstützung für sqlite_exact, milvus, qdrant und pgvector, wählbar über --backend <name> oder MEMPALACE_BACKEND.
F: Kann MemPalace ohne eine lokale Python-Umgebung laufen?
A: Ja, über das veröffentlichte Multi-Architektur-Docker-Image:
docker pull ghcr.io/mempalace/mempalace:latest
F: Wie behalte ich den Kontext einer Claude-Code-Sitzung nach der Komprimierung?
A: Richte die Auto-Save-Hooks ein, die in der Checkliste zur Kontextbewahrung für Claude Code beschrieben sind, und fülle anschließend bestehende Transkripte nach mit:
mempalace mine ~/.claude/projects/ --mode convos
F: Gibt es offizielle Websites außer dem GitHub-Repository?
A: Die einzigen offiziellen Quellen sind das GitHub-Repository, das PyPI-Paket (mempalace) und die Dokumentation unter mempalaceofficial.com; andere ähnlich benannte Domains sind nicht mit dem Projekt verbunden.
11. Schnelllinks
- Repository: https://github.com/MemPalace/mempalace
- Offizielle Dokumentation: https://mempalaceofficial.com
- Beitragsleitfaden: https://github.com/MemPalace/mempalace/blob/main/CONTRIBUTING.md
- Community: https://discord.com/invite/ycTQQCu6kn
12. Zusammenfassung
MemPalace schließt eine praktische Lücke für alle, die lang laufende KI-Agenten entwickeln oder nutzen: Es bewahrt den vollständigen, wortgetreuen Gesprächsverlauf, der schnell und präzise durchsuchbar bleibt, statt die Wahl zwischen „alles speichern“ und „irgendetwas wiederfinden“ zu erzwingen. Entwickler, die Coding-Agenten wie Claude Code, Codex oder Cursor integrieren, erhalten ein persistentes, benchmarkgeprüftes Gedächtnis ohne zwingende Cloud-Abhängigkeit, während Teams dasselbe System von einem privaten lokalen Palace bis zu einem gemeinsam genutzten Backend skalieren können, wenn ihre Anforderungen wachsen.