
Thomas FritschAI Engineer für RAG & selbstgehostete LLMs
Retrieval-Systeme, die ihre Quellen belegen — und die Infrastruktur, um sie auf eigener Hardware zu betreiben.
Zuständig für die ganze Kette: Retrieval, Modellbetrieb und die Anwendung darum — von der Architekturentscheidung bis zu dem Moment, in dem das System produktiv läuft.
Services & Expertise
RAG, LLMOps, selbstgehostetes Inferencing und Agenten-Workflows — gebaut für den Produktivbetrieb, nicht nur fürs Notebook.
RAG Systeme
Entwicklung intelligenter Retrieval-Augmented Generation Systeme für präzise, kontextbasierte KI-Antworten
- Custom Embedding Strategien
- Vector Database Integration
- Semantische Suchoptimierung
- Kontextbasiertes Retrieval
Chunking- und Embedding-Strategie, Vector Store in ChromaDB oder FAISS, Retrieval-Evaluation gegen einen festen Referenzfragenkatalog, und Antworten, die sich bis zur Quellpassage zurückverfolgen lassen.
LLMOps
End-to-End Operationalisierung von Large Language Models für Produktionsumgebungen
- Model Deployment & Serving
- Prompt Engineering & Versionierung
- Fine-tuning Pipelines
- Kostenoptimierung
Versionierte Prompts, reproduzierbare Deployments über Docker, Kosten- und Latenz-Tracing pro Request, und Regressionstests gegen ein festes Evaluationsset vor jedem Rollout.
Self-Hosted AI Infrastrukturen
Sichere, datenschutzkonforme KI-Lösungen auf eigener Hardware oder Private Cloud
- On-Premise Model Deployment
- Datenschutz & Compliance
- Custom Model Training
- GPU Optimierung
Modell-Serving auf eigener GPU-Hardware oder EU-Hosting, Zugriffskontrolle und Monitoring — die Daten verlassen die eigene Infrastruktur nicht, was DSGVO-Konformität überhaupt erst handhabbar macht.
AI Automation & Agents
Entwicklung autonomer AI-Agenten für komplexe Workflow-Automatisierung
- Multi-Agent Systeme
- Tool & API Integration
- Autonome Entscheidungsfindung
- Workflow Orchestrierung
Agenten-Workflows mit Tool- und API-Anbindung, definierte Fehlerpfade statt stillem Scheitern, und Human-in-the-Loop-Freigaben an den Schritten, an denen ein Fehlgriff teuer wird.
Quelldaten werden eingebettet und im Vektorspeicher abgelegt; zur Laufzeit liefert das Retrieval nur die relevanten Passagen an das Modell.
Web-Apps end-to-end
Nicht nur das AI-Teil, sondern das ganze Produkt: Frontend, Backend, Datenbank, Deployment. Von der ersten Zeile bis zum laufenden Betrieb.
Frontend
Responsive Web-Oberflächen, Komponentenbibliotheken, barrierearme BedienungReactNext.jsTypeScriptBackend & API
REST- und Realtime-APIs, Authentifizierung, Hintergrundjobs, IntegrationenFastAPIPythonRedisDatenbank
Datenmodellierung, Migrationen, Indizierung — inklusive Vektorsuche, wo AI im Spiel istPostgreSQLpgvectorSupabaseDeployment
Container, CI/CD, Monitoring und Betrieb auf EU-Infrastruktur statt HyperscalerDockerHetznerGrafanaAlle Ebenen aus einer Hand — ohne Übergaben zwischen Frontend-, Backend- und Infrastruktur-Teams. Das hält Entscheidungen konsistent und den Weg von der Idee zum Deployment kurz.
Tournio ist genau dieser Stack im Echtbetrieb: React-Frontend, FastAPI-Backend, PostgreSQL, Redis, Hetzner-Hosting — allein gebaut, live getestet.
Aktuelles Projekt
Mein Fokus liegt gerade auf einem einzigen Produkt — von Anfang bis Ende selbst gebaut.
Tournio
Von der Idee zum Produkt
Ich entwickle Tournio von Grund auf – allein, ohne Team, ohne Investor.
Tournio ist eine SaaS-Plattform für Sportturniere. Veranstalter erstellen damit Turniere, verwalten Spielpläne und Ergebnisse in Echtzeit – und betten die Live-Ansicht per iFrame direkt in ihre eigene Website ein. Abgerechnet wird pro Turnier, kein Abo.
Der erste echte Einsatz war Ende Juni 2026: der Busse-Kamine Beach Soccer Cup in Neubrandenburg. Liveergebnisse auf der Leinwand vor Ort, Turniertabelle auf den Handys der Zuschauer – alles über Tournio.
Erster Live-Test abgeschlossen. Nächste Schritte: Payment-Integration, öffentlicher Beta-Launch, weitere Sportarten.
Über mich
Von der Retrieval-Pipeline bis zum laufenden Deployment
Thomas Fritsch
Seit 2000 in der Softwareentwicklung, dazu Web- und Grafikdesign — aus dieser Verbindung kommt beides: die Engineering-Präzision und der Blick für Gestaltung.
Heute liegt der Fokus auf produktionsreifen AI-Systemen mit Blick auf Kostenkontrolle, Datenhaltung in der EU und Architekturen, die auch im Betrieb nachvollziehbar bleiben — Retrieval-Augmented Generation, autonome Agenten und die Infrastruktur darunter.
Werdegang & Meilensteine
Aufbau von Produktions-RAG-Systemen und selbstgehosteten LLM-Stacks
Implementierung autonomer AI-Agenten und Workflow-Orchestrierung
Kombination traditioneller Software-Entwicklung mit neuen AI-Technologien
Entwicklung skalierbarer Web-Anwendungen und Cloud-nativer Systeme
Über zwei Jahrzehnte Praxis in Entwicklung und Gestaltung — die Grundlage für alles Spätere
Kernkompetenzen & Technologien
Aufbau kosteneffizienter RAG-Systeme mit fortgeschrittenen Retrieval-Strategien, Optimierung selbstgehosteter LLM-Infrastrukturen und Erforschung von Multi-Agent-Architekturen für komplexe Automatisierungs-Workflows.
Kontakt aufnehmen
Beschreib mir das System, das du bauen willst — ich sage dir, was dafür nötig ist.
Nachricht senden
Fülle das Formular aus und ich melde mich innerhalb von 24 Stunden
Typische Antwortzeit: 24-48 Stunden