Semantik & Suche
Zwei Dinge, die zusammengehören: eine Semantikschicht, die Kennzahlen einmal verbindlich festlegt, und eine Suche, die Bedeutung und exakte Wörter zusammenführt.
Auf dieser Seite
Die Semantikschicht
Eine Kennzahl besteht aus einem Maß und den Dimensionen, in denen es sinnvoll geschnitten werden darf. Eine Semantische Sicht verbindet mehrere Tabellen über hinterlegte, geprüfte Verknüpfungen. Beides pflegt die Administration unter KI & Semantik → Kennzahlen; abgefragt wird danach über den Namen.
Das SQL einer Kennzahl wird ausschließlich aus gespeicherten Ausdrücken zusammengesetzt. Es gibt keinen Weg, über den Namen einer Kennzahl fremdes SQL einzuschleusen.
Der praktische Nutzen liegt weniger in der Bequemlichkeit als in der Eindeutigkeit: „Umsatz“ ist danach eine Definition und nicht vier, je nachdem, wer den Export gebaut hat.
Drei Suchverfahren
| Verfahren | Wie es sucht | Wofür |
|---|---|---|
| Vektor | Kosinus-Ähnlichkeit über pgvector | Bedeutung – findet auch, was anders formuliert ist |
| Stichwort | Volltextsuche in PostgreSQL | Exakte Wörter – Artikelnummern, Namen, Fehlercodes |
| Hybrid | Beide Ergebnislisten, fusioniert per Reciprocal Rank Fusion | Der Normalfall: Bedeutung, ohne den exakten Treffer zu verlieren |
Reine Vektorsuche verfehlt eine exakte Artikelnummer erstaunlich zuverlässig; reine Stichwortsuche verfehlt jede Umschreibung. Die Hybridsuche mischt nicht Punktzahlen, sondern Ränge – deshalb muss niemand einen Gewichtungsfaktor einstellen, der ohnehin nur geraten wäre.

Das Einbettungsmodell liegt bei
Einbettungen erzeugt ein lokal betriebenes Modell (nomic-embed-text über Ollama) hinter einer OpenAI-kompatiblen Schnittstelle. Es läuft auf CPU, wird im Leerlauf entladen und braucht keinen Cloud-Schlüssel. Die Suche funktioniert damit unmittelbar nach der Installation. Der Anbieter bleibt unter KI & Semantik → Embeddings austauschbar.
Die Dimension gehört zum Index
Die Vektorspalte hat eine feste Dimension (EMBEDDING_DIMENSIONS). Ein Modell mit anderer Dimension heißt: Index einmal neu aufbauen.
Governance gilt auch für Treffer
Der Index enthält Einbettungen, keine Nutzdaten. Was ein Treffer tatsächlich enthält, holt die Suche vor der Anzeige unter Ihrer Kennung aus Trino. Eine durch Richtlinie verborgene Zeile taucht deshalb nicht als Suchergebnis auf – und eine maskierte Spalte bleibt auch im Treffer maskiert.
Was durchsuchbar ist
- Tabellendaten, die über einen der Ingestion-Wege in das Lakehouse geladen wurden.
- Dokumente – PDF, Word und Text – nach Extraktion und Zerlegung, als eigene Abschnittstabellen.
Stand: Diese Seite beschreibt lavalake 0.16.0. Produkt und Dokumentation liegen in getrennten Repositories – im Zweifel gilt, was die Konsole zeigt.
Etwas fehlt?
Wenn diese Seiten Ihre Frage nicht beantworten, zeigen wir die Plattform in einer halben Stunde an Ihrem Fall.
Demo vereinbaren