Zum Inhalt springen
Alle Insights Die Finanzdatenebene

GraphRAG für Finanzentitäten und ihre Beziehungen

Wenn Beziehungen wichtiger sind als Ähnlichkeit, ist ein Vector Store das falsche Werkzeug. So nutzen wir Graph-Retrieval über Emittenten, Kontrahenten und Beteiligungsverhältnisse.

4 Min. Lesezeit #daten#graphrag#knowledge-graph
Fachleute aus dem Finanzsektor bei der Arbeit an einer KI-Initiative

Ein Vector Store liefert Text, der Ihrer Anfrage ähnelt. Das ist das falsche Instrument, wenn die Antwort davon abhängt, wie Entitäten zusammenhängen, und nicht davon, wie sie sich lesen. Fragen wie „Wie hoch ist unsere Exposure gegenüber allem, was die Familie Petrov kontrolliert?” oder „Welche Kontrahenten liegen zwei Hops von einem sanktionierten Emittenten entfernt?” sind Traversierungsprobleme. GraphRAG beantwortet sie, indem es einen Graphen aus Emittenten, Kontrahenten und Beteiligungen durchläuft.

Der Fehlermodus von reinem Vector-RAG in der Finanzwelt ist leise. Sie fragen nach der obersten Muttergesellschaft eines Unternehmens, der Retriever holt drei Chunks, die das Unternehmen namentlich erwähnen, und das Modell fasst sie flüssig zusammen. Keiner dieser Chunks nennt tatsächlich die Beteiligungskette, weil sich diese Kette über vier Filings erstreckt, die nie dasselbe Vokabular teilen. Das Modell füllt die Lücke. Sie erhalten eine selbstbewusste Antwort mit einer erfundenen Muttergesellschaft darin, und nichts in der Pipeline hat markiert, dass die Beziehung nie abgerufen wurde.

Wo Ähnlichkeit aufhört zu funktionieren

Embedding-Ähnlichkeit kollabiert Bedeutung in Distanz. Das ist in Ordnung für „finde Dokumente über Zinsänderungsrisiko” und nutzlos für „finde den kürzesten Kontrollpfad zwischen diesen beiden Fonds”. Ein paar konkrete Fälle, in denen wir nicht mehr zum Vektorindex greifen:

  • Indirekte Exposure. Direkte Bestände sind ein Lookup. Exposure über eine Kette zwischengeschalteter Holdinggesellschaften ist eine Graph-Traversierung, und die Tiefe ist vorab nicht bekannt.
  • Wirtschaftliches Eigentum. Der wirtschaftlich Berechtigte ist über Kontrollschwellen definiert, die entlang von Pfaden akkumuliert werden. Sie können ihn aus keinem einzelnen Dokument berechnen, und Sie kommen mit Embeddings nicht dorthin.
  • Kontrahenten-Ansteckung. „Wer ist betroffen, wenn dieser Emittent ausfällt?” ist eine Erreichbarkeitsabfrage über Garantie-, Mutter- und Kreditkanten.
  • Zirkularität und Interessenkonflikte. Überkreuzbeteiligungen und Related-Party-Strukturen sind Zyklen im Graphen. Die Ähnlichkeitssuche kennt kein Konzept eines Zyklus.

Der rote Faden ist, dass die Retrieval-Einheit ein Pfad oder eine Nachbarschaft ist, kein Textabschnitt. Ein Store, der nur weiß, wie man Passagen nach Cosinus-Distanz rankt, hat keine Möglichkeit, das darzustellen, geschweige denn zurückzugeben, was Sie brauchen.

Den Graphen bauen, über den GraphRAG abruft

Die Retrieval-Qualität eines GraphRAG-Systems wird fast vollständig stromaufwärts festgelegt, durch den Graphen selbst. Zwei Entscheidungen dominieren.

Erstens müssen die Knoten aufgelöst sein, bevor sie nützlich sind. Wenn „Meta Platforms”, „Facebook, Inc.” und ein LEI als drei getrennte Knoten enden, fragmentiert jede Traversierung, und die Beteiligungskette bricht an den Nähten. Entity Resolution ist die Voraussetzung, keine Optimierung. Die kanonische Entität aus Ihrer Resolution-Schicht wird zum Knoten; jeder Roh-Identifier aus jedem Feed wird zu einem Alias, der auf sie zeigt.

Zweitens müssen die Kanten typisiert und datiert sein. Eine generische „bezogen auf”-Kante ist so gut wie wertlos. Wir modellieren unterschiedliche Beziehungen und behalten ihre Provenienz:

  • Beteiligungskanten tragen einen Prozentsatz und eine Richtung, sodass Kontrollschwellen entlang eines Pfades aufsummiert werden können.
  • Garantie-, Mutter-Tochter- und Kreditkanten sind eigene Typen, weil eine Ansteckungsabfrage sie unterschiedlich behandelt.
  • Jede Kante trägt ein Gültig-von- und Gültig-bis-Datum, das aus dem Filing stammt, das sie belegt hat, plus einen Verweis zurück auf dieses Quelldokument.

Diese zeitliche Schicht macht den Graphen sicher für historische Abfragen. Ein Backtest, der nach Beteiligungen „zum Stand Q2 2024” fragt, darf nur die Kanten durchlaufen, die damals aktiv waren. Ohne Gültigkeitszeit auf den Kanten sickert eine Umstrukturierung von 2025 rückwärts in eine Antwort für 2024, und Sie haben Lookahead-Bias auf die unsichtbarste denkbare Weise erzeugt. Zeitpunktgenauigkeit in einem Graphen ist eine Eigenschaft der Kanten, kein nachträglicher Einfall in der Abfrage.

Der Graph ist nicht statisch. Corporate Actions schreiben ihn ständig um: Eine Fusion faltet zwei Knoten zu einem, ein Spin-off spaltet einen in zwei, ein Kontrollwechsel dreht die Richtung einer Beteiligungskante um. Wir behandeln das Ingestion von Corporate Actions als erstklassige Pipeline mit eigener Lineage, sodass jede strukturelle Änderung am Graphen auf das Filing zurückführbar ist, das sie verursacht hat. Wenn ein Prüfer fragt, warum das System glaubte, Entität A habe Entität B an einem bestimmten Datum kontrolliert, ist die Antwort eine Kante mit Dokumentverweis und Datumsbereich, kein Vektor-Ähnlichkeitswert.

Retrieval, und warum hybrid meistens gewinnt

Zur Abfragezeit erledigt GraphRAG die Traversierung, die der Vector Store nicht kann. Eine Frage wird zerlegt in einen Anker (die Entität, von der Sie ausgehen), ein Beziehungsmuster und eine Tiefenbegrenzung. Der Retriever durchläuft den Graphen, sammelt den relevanten Teilgraphen und serialisiert ihn in Kontext, den das Modell lesen kann: Knoten mit ihren kanonischen Namen, Kanten mit ihren Typen und Datumsangaben und den angehängten Quellverweisen.

Der Teilgraph, nicht ein Haufen loser Passagen, ist es, der die Generierung erdet. Weil jede Kante ihr Quell-Filing nennt, kann die Antwort des Modells das tatsächliche Dokument zitieren, das jede Verbindung begründet hat. Wenn der Graph keinen Pfad zwischen zwei Entitäten enthält, lautet die ehrliche Ausgabe „keine Beziehung im Graphen zu diesem Stichtag gefunden”, und das ist eine weit bessere Antwort als eine plausible Erfindung.

Fast keine reale Frage ist jedoch rein strukturell. „Fasse unsere Exposure gegenüber dem Petrov-Netzwerk zusammen und erkläre die Art jeder Beziehung” braucht den Graphen für das Netzwerk und unstrukturierten Text für die Art. Also betreiben Produktivsysteme beide Retriever und führen sie zusammen. Der Graph klärt, wer mit wem verbunden ist; der Vektorindex über Filings und Memos liefert das beschreibende Detail, das die Kanten nicht tragen. Halten Sie die beiden Indizes gegen dieselbe aufgelöste Entitätsmenge abgeglichen, sonst führen Sie die Fragmentierung wieder ein, die der Graph beseitigen sollte.

Der Graph beseitigt nicht die Notwendigkeit der Evaluierung. Bauen Sie ein Eval-Set aus Beziehungsfragen mit bekannten Antworten auf, einschließlich der schwierigen: Multi-Hop-Kontrolle, zyklische Beteiligungen und Stichtagsabfragen, die die Gültigkeitszeit respektieren müssen. Bewerten Sie Retrieval getrennt von der Generierung, denn eine korrekte Antwort, die auf dem falschen Teilgraphen aufgebaut ist, ist Glück, und Glück überlebt die nächste Corporate Action nicht.

Häufige Fragen

Wann sollte ich zu einem Graphen statt zu einem Vector Store greifen?

Wenn es um Pfade und Struktur geht statt um Ähnlichkeit: gemeinsame Beteiligungen, indirekte Exposure, wirtschaftlich Berechtigter oder wer zwischen zwei Kontrahenten steht. Die Vektorsuche findet Text, der ähnlich aussieht; sie kann keine Hops zählen.

Brauche ich noch Embeddings, wenn ich einen Knowledge Graph baue?

Meistens ja. Der Graph beantwortet die strukturelle Hälfte der Frage, der Vektorindex die beschreibende. Die meisten Produktivsysteme betreiben beides und führen die Ergebnisse zusammen.

Wie hält man den Beteiligungsgraphen zeitpunktgenau korrekt?

Jeder Knoten und jede Kante trägt ein Gültig-von- und Gültig-bis-Datum, das aus dem Filing stammt, das sie belegt hat. Eine Abfrage zu einem vergangenen Stichtag durchläuft nur die Kanten, die damals aktiv waren, sodass eine spätere Umstrukturierung nicht rückwärts in die Antwort einsickert.

Arbeiten Sie an etwas Ähnlichem?

Erzählen Sie uns von Ihren Daten und dem Workflow drumherum, und Sie bekommen eine ehrliche Einschätzung.

30-minütiges Erstgespräch buchen