AI-Anwendungen & Wissen

RAG-Entwicklung

Ein Sprachmodell ist nur so gut wie das, was man ihm vorlegt. Die meisten enttäuschenden KI-Antworten sind Abruffehler im Gewand eines Modells: die richtige Passage existierte und wurde nie geholt. Wir bauen und justieren die Abrufschicht und messen sie, damit das Modell aus den korrekten Belegen argumentiert.

Die geschäftliche Herausforderung

Die Demo funktionierte, weil der Bestand klein war

Naive Vektorsuche funktioniert bei einigen hundert Dokumenten gut und verschlechtert sich jenseits einiger hunderttausend deutlich. Die Zerlegung trennt eine Tabelle von ihrer Überschrift. Semantisch ähnliche Passagen verdrängen die tatsächlich maßgebliche. Aktualität verliert gegen Ähnlichkeit, sodass eine abgelöste Richtlinie die geltende überholt. Nichts davon ist ohne Messung sichtbar, also gehen Teams live, erhalten plausible Antworten und entdecken die Fehlerquote erst, wenn jemand nach einer falschen handelt.

Was wir tun

Den Abruf bauen und dann belegen

Wir beginnen damit, aus echten Fragen und bekannt korrekten Quellen einen Evaluationssatz zu bauen, denn man kann nicht justieren, was man nicht bewerten kann. Dann arbeiten wir die Pipeline durch: eine Zerlegung, die die Dokumentstruktur achtet, hybride Suche aus Stichwort und Vektor, Metadatenfilter für Aktualität und Verbindlichkeit, und ein Reranking auf der Auswahlliste. Wo Beziehungen zwischen Entitäten mehr zählen als Passagenähnlichkeit, nutzen wir einen Graphen, statt so zu tun, als reichten Vektoren. Jede Änderung wird gegen denselben Satz bewertet, sodass Verbesserung belegt und nicht behauptet wird.

RAG-Entwicklung

Leistungsumfang

  • Enterprise RAG

  • Advanced RAG

  • GraphRAG

  • Hybrid Search

  • Vector Search

  • Retrieval Optimization

  • RAG Evaluation

Typische Anwendungsfälle

Typische Anwendungsfälle

  • Einen kundenseitigen Assistenten so verankern, dass jede Aussage auf ein veröffentlichtes Dokument zurückführt.
  • Über Verträge hinweg abrufen, wo die Antwort davon abhängt, welche Vereinbarung gilt, nicht von der Wortähnlichkeit.
  • Technische Dokumentation durchsuchen, in der die richtige Passage eine Tabelle oder eine Bildunterschrift ist.
  • Einen bestehenden Assistenten neu bauen, der plausibel antwortet, aber oft genug falsch liegt, um das Vertrauen verloren zu haben.

Unser Vorgehen

Unser Vorgehen

  1. Rahmen setzen

    Die Anfrage in eine Spezifikation überführen: wer nutzt es, was ist korrekt, wer entscheidet.

  2. Verankern

    Mit Inhalten und Systemen verbinden, die die Antworten halten, unter Wahrung bestehender Rechte.

  3. Evaluieren

    An einem gelabelten Set aus Ihren echten Fällen bewerten, bevor es nach aussen geht.

  4. Ausliefern & betreiben

    Stufenweises Release mit Monitoring, Kostenkontrolle und Regressionssuite zur Qualitätssicherung.

Technologie

Technologie

  • OpenAI
  • Anthropic
  • Azure OpenAI
  • pgvector
  • Elasticsearch
  • Microsoft 365
  • SharePoint
  • Confluence
  • Salesforce

Sicherheit & Governance

Sicherheit & Governance

Antworten sind in Ihren eigenen Inhalten verankert und mit Quellen belegt, sodass sie überprüfbar sind. Retrieval respektiert die an der Quelle gesetzten Rechte: Nutzende sehen über die Anwendung nichts, was sie direkt nicht sehen dürften. Prompts, Kontext und Antworten werden für Audits protokolliert, und die Evaluation läuft kontinuierlich.

Zusammenarbeitsmodelle

Zusammenarbeitsmodelle

AI-Projekt

Wir übernehmen Verantwortung für Konzeption und Umsetzung einer definierten AI-Lösung.

Dediziertes AI-Team

Langfristige, dedizierte Engineering-Kapazität, zugeschnitten auf Ihren Stack und Ihr Liefermodell.

Managed AI

Wir betreiben, überwachen und verbessern produktive AI-Systeme kontinuierlich.

Warum TeamExtension.ai

Wir messen, bevor wir optimieren

Abrufarbeit geschieht meist nach Gefühl: die Blockgröße ändern, ein paar Antworten lesen, entscheiden, dass es sich besser anfühlt. Wir bauen zuerst den beschrifteten Satz, was unspektakulär ist und den ganzen Unterschied zwischen Justieren und Raten ausmacht. Es hinterlässt Ihnen zudem eine Regressionssuite, sodass ein Modellwechsel in sechs Monaten die Qualität nicht still verschlechtern kann, ohne dass es jemand merkt.

Ausgewählte Kunden

Häufige Fragen

Häufige Fragen

Wie messen Sie, ob der Abruf gut ist?
An einem beschrifteten Satz echter Fragen, gepaart mit den Passagen, die sie wirklich beantworten. Wir berichten, ob die richtige Passage überhaupt abgerufen wurde und an welcher Stelle sie stand. Die Antwortqualität wird getrennt bewertet, denn eine gute Antwort aus der falschen Quelle bleibt ein Fehler.
Brauchen wir eine Vektordatenbank?
Oft nicht. pgvector in einer bestehenden PostgreSQL-Instanz bewältigt sehr viele Unternehmenslasten, ohne Infrastruktur hinzuzufügen, die betrieben werden muss. Einen dedizierten Vektorspeicher empfehlen wir, wenn Umfang oder Funktionsanforderungen ihn rechtfertigen, nicht standardmäßig.
Was ist GraphRAG und brauchen wir das?
Es ruft über einen Graphen aus Entitäten und Beziehungen ab statt über einzelne Passagen. Es verdient seine zusätzliche Komplexität, wenn Antworten von Verbindungen über Dokumente hinweg abhängen, etwa Eigentümerketten oder Abhängigkeitsstrukturen. Für die meisten Fragen an Fließtext liefern hybride Suche und Reranking mit weniger Aufwand bessere Ergebnisse.
Können Sie ein System verbessern, das wir bereits gebaut haben?
Ja, und das kommt häufig vor. Wir beginnen damit, den Evaluationssatz zu bauen und zu messen, was Sie haben. Das lokalisiert den Fehler meist genau, und die Behebung ist häufig enger als ein Neubau.
Wie bleibt das genau, während sich Inhalte ändern?
Die Indizierung folgt der Quelle nach Zeitplan oder bei Änderungsmeldung, und der Evaluationssatz läuft fortlaufend statt einmalig. Die Abrufqualität wird überwacht wie jede andere Produktionskennzahl.

Ihre AI-Initiative besprechen

Retrieval-Systeme, die Antworten in Ihren Inhalten verankern, mit Quellenangaben und messbarer Genauigkeit.