2xOS 2xOS Studio 2xos.studio

KI-Systeme, die nicht nur in der Demo funktionieren.

Geprüft, repariert und gebaut werden RAG- und Agenten-Systeme. Mit Tests, Sichtbarkeit, Freigaben und kontrollierter Fehlerbehandlung.

Positionierung

Kein Rätsel. Ein Regal mit Werkzeugen, die jeder mit KI braucht.

Hinter 2xOS steht ein einzelnes, über Monate gebautes System, in dem genau die Fragen schon gelöst sind, die durch autonome Agenten gerade überall aufkommen: Woher weiß ich, dass der Ausgabe zu trauen ist?

Das eigene System ist der Beweis, nicht das Produkt. Verkauft wird nicht der Apparat, sondern das Ergebnis: KI-Abläufe werden belastbar, schneller und nachvollziehbar.

13Bausteine laufen im Eigenbetrieb live Eigene Werk-Bilanz, Reifegrad-Zeile · gemessen 2026-07-27
135erprobte Bau-Mechanismen, geerntet aus 16 eigenen Projekten Eigener Mechanismen-Katalog · gemessen 2026-07-27
204ausgewertete Korrekturen, verdichtet zu 17 Qualitätsklassen Eigenes Korrektur-Register · gemessen 2026-07-27
01

Prüfen: Herausfinden, was hakt und was sich lohnt.

Audit

Ein kleiner, klar begrenzter Einstieg. Am Ende steht ein belegter Befund statt Bauchgefühl: wo das KI-System heute wirklich steht. Risikoarm und leicht verständlich.

Agent Reliability Audit

Einstieg: auf Anfrage · Praxis: 3 bis 5 Arbeitstage

Der Agent überzeugt in der Demo. Im Alltag liefert er sicher klingende Fehler, und niemand merkt es rechtzeitig.

Ergebnis
  • Eine geordnete Fehlerkarte: wo der Agent kippt, nach Klassen sortiert.
  • Jede Aussage mit Härtegrad: geprüft, behauptet oder widerlegt.
  • Prioritätenliste, welche Fehler zuerst Geld oder Vertrauen kosten.
Beweis
17 Qualitätsklassen, destilliert aus 204 echten Korrekturen am eigenen System. Die häufigste Klasse, verfrühte Fertig-Meldung, trägt allein das Gewicht 28.
Eigenes Korrektur-Register · gemessen 2026-07-27

AI Cost Audit

Einstieg: auf Anfrage · Praxis: 2 bis 4 Arbeitstage

Die Modellrechnung wächst. Welche Aufrufe, Kontexte und Wiederholungen das Geld kosten, sagt niemand.

Ergebnis
  • Aufstellung der teuersten Aufruf-Muster mit gemessenem Kostenanteil.
  • Konkrete Hebel: Cache, kürzere Feld-Formate, Modell-Wahl nach Rolle.
  • Schätzung, wie viel ein Kosten-Sprint realistisch einspart.

RAG Quality Audit

Einstieg: auf Anfrage · Praxis: 4 bis 6 Arbeitstage

Ein Wissens-Assistent antwortet mal genau, mal frei erfunden. Woran es liegt, bleibt offen.

Ergebnis
  • Prüfung der Retrieval-Kette: Zerlegung, Quellenwahl, Rangfolge, Deckung.
  • Nachweis, wo der Assistent lieber schweigen sollte statt zu raten.
  • Messpunkte, an denen sich die Qualität künftig laufend prüfen lässt.
Beweis
Frische Messung am eigenen Gedächtnis-Dienst auf LongMemEval-S, beurteilt von einem unabhängigen Richter: 371 von 500 richtig, also 74,2 Prozent. Nicht mit Leaderboard-Zahlen vergleichbar.
Eigener Volllauf-Bericht, Lauf vom 21.07.2026 · gemessen 2026-07-27
02

Reparieren: Bestehende Systeme reparieren.

Rescue

Etwas ist schon gebaut und läuft irgendwie, aber nicht zuverlässig genug. Daraus wird ein Ablauf, dem man im Betrieb vertrauen kann.

Agent Rescue Sprint

Einstieg: auf Anfrage · Praxis: 8 bis 12 Arbeitstage

Ein Agent läuft unzuverlässig und ist so nicht produktionsreif. Er fällt an Stellen aus, die vorher niemand sieht.

Ergebnis
  • Trennung von Ausführung und Abnahme: eine unabhängige Instanz prüft jedes Ergebnis, bevor es durchgeht.
  • Feste Prüfschritte nach jeder KI-Stufe, damit Fehler früh auffallen.
  • Ein Stand zum Weiterbetreiben, mit dokumentierten Abbruchregeln.
Beweis
Der eigene Bau-Ablauf zog einen kompletten Lauf mit 42 parallelen Agenten vollständig grün durch, mit unabhängig bestätigter Prüfung.
Eigene Werk-Bilanz, Lauf RL-1 · gemessen 2026-07-27

LLM Cost und Latency Sprint

Einstieg: auf Anfrage · Praxis: 5 bis 8 Arbeitstage

Antwortzeiten und laufende Modellkosten sind zu hoch für den Dauerbetrieb.

Ergebnis
  • Eingebauter Cache, damit gleicher Eingabetext nie zweimal bezahlt wird.
  • Kürzere Feld-Formate und Modell-Wahl nach Aufgabe.
  • Ein fester Ersatzpfad, der greift, wenn das Modell ausfällt.

RAG Rescue Sprint

Einstieg: auf Anfrage · Praxis: 8 bis 14 Arbeitstage

Retrieval, Zerlegung und Antwortqualität eines bestehenden RAG-Systems sind zu schwach.

Ergebnis
  • Überarbeitete Retrieval-Kette mit Facetten und Schutz vor Dubletten.
  • Zeitlich korrektes Gedächtnis: der Assistent nutzt den Wissensstand, der damals galt.
  • Ein Deckungs-Tor, das lieber nachfragt als falsch zu antworten.
Beweis
Der eigene Gedächtnis-Dienst hält für einen Mandanten 12.611 aktive Einträge, heute live am laufenden Dienst gemessen.
Live-Abfrage des eigenen Gedächtnis-Dienstes · gemessen 2026-07-27
03

Kontrollieren: Kontroll- und Abnahmeschichten einbauen.

Control

Autonome Agenten brauchen ein Netz: automatische Tests, Sichtbarkeit über das echte Tun und eine Freigabe, bevor etwas nach außen geht.

AI Evaluation Harness

Einstieg: auf Anfrage · Praxis: 7 bis 12 Arbeitstage

Es gibt keine automatischen Tests für Antworten und Abläufe. Rückschritte fallen erst beim Kunden auf.

Ergebnis
  • Automatische Prüfläufe für Antworten, Abläufe und Rückschritte.
  • Jede Dimension als Messwert über die Zeit, sichtbar statt gefühlt.
  • Verkettete Prüfschritte statt einer einzelnen Note am Ende.
Beweis
Eigene Messlatte: 98,5 Prozent je Dimension. In verketteten Abläufen multiplizieren sich Fehler: 0,92 hoch 10 ergibt rund 43 Prozent, 0,985 hoch 10 rund 86 Prozent.
Eigenes Qualitätsmaß, Kettenrechnung nachgerechnet · gemessen 2026-07-27

Agent Observability Setup

Einstieg: auf Anfrage · Praxis: 5 bis 9 Arbeitstage

Was ein Agent wirklich getan hat, bleibt unsichtbar. Sichtbar ist nur seine Fertig-Meldung.

Ergebnis
  • Ein Nachzähler liest aus dem Protokoll die echten Lese-, Schreib- und Befehls-Schritte.
  • Kosten, Fehler und Qualität je Lauf sichtbar an einem Ort.
  • Ein Melder für läuft, aber wirkt nicht: erkennt Stillstand trotz ok-Meldung.
Beweis
Ein eigenes Nachzähl-Werkzeug prüft jede Fertig-Meldung gegen das echte Protokoll. Eine Fluss-Ampel meldet Rückstau auch dann, wenn ein Dienst formal weiter ok meldet.
Eigene Werkzeuge: Nachzähler und Fluss-Stau-Ampel · gemessen 2026-07-27

Human Approval Layer

Einstieg: auf Anfrage · Praxis: 5 bis 8 Arbeitstage

Ein Agent kann etwas senden, ändern oder veröffentlichen, bevor ein Mensch zustimmt.

Ergebnis
  • Eine Freigabe-Schranke vor jeder Aktion nach außen, mit befristeter Zustimmung.
  • Drei Stufen: Vorschau, Freigabe, Ausführung. Kein Seitenweg umgeht das Tor.
  • Klare Regeln je Kanal. Im Zweifel bleibt das Tor zu.
Beweis
Im eigenen System darf eine Aktion nach außen nur mit ausdrücklicher, befristeter Freigabe laufen. Das ist als stehende Schranke verankert, nicht als Bitte.
Eigene Freigabe-Schranke, stehender Eintrag F2-073 · gemessen 2026-07-27
04

Bauen: Neue Systeme bauen.

Build

Wenn der Einstieg sitzt: ein klar abgegrenztes System, gebaut und übergeben in festem Rahmen, mit Tests, Sichtbarkeit und Freigaben von Anfang an.

Internal Knowledge Assistant

Einstieg: auf Anfrage · Praxis: 3 bis 5 Wochen

Firmenwissen liegt verstreut, und niemand findet verlässlich den aktuellen Stand.

Ergebnis
  • Ein quellen-gebundener Assistent für interne Dokumente, mit Herkunft je Antwort.
  • Zeitlich korrektes Gedächtnis: was wann galt, alte Stände bleiben lesbar.
  • Ein Deckungs-Tor, das bei dünner Quellenlage nachfragt statt zu raten.
Beweis
Der eigene Gedächtnis-Dienst hält für einen Mandanten 12.611 aktive Einträge, heute live gemessen, und unterscheidet, was wann galt.
Live-Abfrage des eigenen Gedächtnis-Dienstes · gemessen 2026-07-27

Production Agent Sprint

Einstieg: auf Anfrage · Praxis: 2 bis 4 Wochen

Gebraucht wird ein klar abgegrenzter Agent, der wirklich in Produktion läuft, nicht nur in der Demo.

Ergebnis
  • Ein Agent mit festen Zuständen, Regeln und Fehlerbehandlung.
  • Ein fester Ersatzpfad und eine Warteschlange, damit nichts verloren geht.
  • Übergabe mit Tests, Sichtbarkeit und Dokumentation.
Beweis
Grundlage ist ein Katalog von 135 erprobten Bau-Mechanismen, geerntet aus dem Code von 16 eigenen Projekten.
Eigener Mechanismen-Katalog · gemessen 2026-07-27

System und Repo Census

Einstieg: auf Anfrage · Praxis: 3 bis 6 Arbeitstage

Datei- und System-Wildwuchs, und niemand weiß, was ungenutzt ist oder wem was gehört.

Ergebnis
  • Ein Durchlauf über das Repo, der ungenutzten Code und offene Enden findet.
  • Eine Besitz-Karte: wo Dinge doppelt liegen, wo Umbenennung ohne Plan droht.
  • Ein Playbook, um Wildwuchs auf eine einzige Wahrheitsquelle umzustellen.
Beweis
Das Prüf-Werkzeug läuft als eigenständiges Kommandozeilen-Werkzeug über fremde Repos, in drei Schutzstufen: nur Bericht, Quarantäne, Löschen. Jede Stufe hat einen dokumentierten Rückweg.
Eigenes Prüf-Werkzeug, portabler Mantel · gemessen 2026-07-27
Arbeitsweise

Verifizierte Ketten statt Versprechen.

Jede Aussage trägt ihren Härtegrad: geprüft, behauptet oder widerlegt. Was nicht gemessen ist, steht nicht als Zahl da.

Was nach außen wirkt, läuft erst nach ausdrücklicher Freigabe. Was nicht trägt, wird abgeräumt statt versteckt.

  • Praxisdauer ist realistische Kalenderarbeit bei klarem Umfang und Zugang.
  • Festpreis je Auftrag nach kurzer Bestandsaufnahme.
  • Die Beweis-Kästen auf dieser Seite nennen nur gemessene Werte aus dem Eigenbetrieb, jeweils mit Quelle und Messdatum.
Kontakt
hello@2xos.studio