Wie es funktioniert.
Acht Schritte von einem Dokument auf Ihrer Festplatte zu einer Antwort, die ihre Quelle nennt.
Diese Seite erklärt, was Provenize technisch tut — ohne dass Sie dafür etwas Technisches wissen müssen. Jeder Schritt steht zuerst in normalen Worten da.
Unter jedem Schritt steht das Fachwort, das Entwickler dafür benutzen. Nützlich, wenn Sie weiterlesen wollen — überlesen Sie es ruhig, wenn nicht.
Acht Schritte. Alles davon existiert heute, außer wo wir es anders sagen.
Alles läuft auf Ihrem eigenen Computer
Provenize ist ein Programm auf Ihrem Rechner, neben den Programmen, die Sie schon nutzen. Kein Server von uns dazwischen. Schalten Sie das Internet ab, arbeitet es weiter.
local-first · ein kleines Hilfsprogramm neben Ihrer eigenen App
Ihre Dokumente werden eingelesen und in Stücke geschnitten
Ein PDF mit zweihundert Seiten ist zu groß, um es auf einmal zu überblicken. Provenize schneidet es in Stücke von wenigen Absätzen und hält zu jedem Stück fest, aus welcher Datei und welcher Seite es kam. Genau dieses Festhalten macht später eine Quellenangabe möglich.
Ingestion · Chunking · PDFs, Tabellen und Texterkennung für Scans
Jedes Stück bekommt einen Fingerabdruck seiner Bedeutung
Neben dem wörtlichen Text speichert Provenize eine Zahlenreihe, die zusammenfasst, worum es in diesem Stück geht. Stücke zum selben Thema bekommen Zahlen, die nahe beieinanderliegen. So finden Sie etwas später auch dann, wenn Sie andere Wörter benutzen als die im Text. Diese Rechnung läuft auf Ihrem eigenen Computer.
Embeddings · Vektorindex · das Modell dafür läuft lokal
Gesucht wird auf zwei Wegen gleichzeitig
Eine Suche schaut auf die wörtlichen Begriffe, die andere auf die Bedeutung. Die beiden Listen werden zu einer Rangfolge zusammengeführt. Wörtliche Suche ist scharf bei Namen und Nummern, Bedeutungssuche bei Beschreibungen — zusammen übersehen sie weniger.
hybride Suche · Stichwortsuche plus Vektorsuche, kombiniert
Erst dann kommt ein KI-Modell ins Spiel
Das Modell bekommt zwei Dinge: Ihre Frage und die wenigen gefundenen Textstellen. Nicht Ihre ganze Akte — die bleibt, wo sie ist. Wollen Sie ein Modell aus der Cloud nutzen, entfernen wir vorher Namen, E-Mail-Adressen und Ausweisnummern. Das klappt nicht immer, und das sagen wir.
Antworten auf Basis gefundener Textstellen · persönliche Daten vor dem Senden entfernen
Keine Quelle, keine Antwort
Jede Tatsache in einer Antwort muss an einer dieser Textstellen hängen. Kann das Modell das nicht, gibt es keine Antwort — dann sagt es, dass es nichts Belastbares gefunden hat. Diese Regel steckt im Code, nicht in einer höflichen Bitte an das Modell.
Quellenangaben im Code erzwungen · Quelle, Seite und wie gut die Stelle passt
Jede Handlung kommt in ein Protokoll, dessen Zeilen aneinanderhängen
Zu jeder Zeile im Protokoll wird eine kleine Zahl berechnet, und die vorherige Zeile geht in diese Rechnung ein. Ändern Sie eine Zeile, stimmt ihre Zahl nicht mehr — und die aller folgenden Zeilen auch nicht. Manipulation fällt also immer auf. Es kann nur etwas hinzukommen; es geht nie etwas heraus.
eine Kette berechneter Zahlen · ein Protokoll, an das nur angehängt wird
Löschen, ohne den Beweis zu verlieren
Daten über eine Person sind mit einem Schlüssel verschlüsselt, der nur dieser Person gehört. Eine Löschanfrage wirft diesen Schlüssel weg: der Inhalt wird unlesbar, während die Kette der Zahlen unversehrt bleibt. Sie können also belegen, dass Sie gelöscht haben, ohne zu behalten, was dort stand.
ein Schlüssel pro Person · Löschen durch Entfernen des Schlüssels
Ein Wort dabei, das Sie nicht kennen? Schauen Sie ins Glossar.
Drei Zeilen: einlesen, suchen, Quelle dabei.
from ai_memory import AIMemory
mem = AIMemory("./vault")
mem.ingest("reports/report-2025.pdf")
hits = mem.search("TLS misconfiguration")
print(hits[0].citation) # report-2025.pdf · p. 41 · 0.93Die vollständige Beschreibung steht auf der SDK-Seite.
Die echten Namen, mit dem, was sie in normalen Worten tun.
- Pythondie Sprache, in der es geschrieben ist
- SQLitedie Datenbank für eine Person: alles in einer Datei
- PostgreSQLdie Datenbank fürs Team: jeder sieht nur eigene Daten
- Vektorsucheder Teil, der über die Bedeutung sucht
- Lokale Sprachmodelledie Bedeutungsrechnung, auf Ihrem eigenen Rechner
- SHA-256die Zahl, die die Protokollzeilen aneinanderknüpft
- ed25519die digitale Signatur unter einem Export oder Nachweis
- MCPder Anschluss, über den andere KI-Werkzeuge Ihr Gedächtnis lesen dürfen
- 2.700+ Testsrund neunzig Prozent des Codes automatisch geprüft
- Es führt nie Code aus, den es in einem Dokument findet. Ein Dokument ist Text zum Lesen, kein Auftrag zum Ausführen.
- Es sendet nie ein ganzes Dokument hinaus. Nur Ihre Frage und die Stellen, die als Quelle dienen — und das nur, wenn Sie ein externes Modell einschalten.
- Es erfindet nie eine Quelle. Gibt es die Quelle nicht, gibt es keine Antwort.
- Es spricht nicht mit uns. Wir haben keinen Server, der Ihre Daten sieht — bei uns kann also nichts austreten.
Lieber prüfen als glauben?
Zum Nachweis