KI, die wirkt,
weil der Mensch mitdenkt

Beratung und externe Perspektiven für KI-Anwendungen, die geprüft statt nur eingeführt werden.

KI wirkt nur, wenn der Mensch mitgedacht wird

Viele Unternehmen bauen KI-Workflows oder entwickeln eigene Modelle weiter – und stellen fest, dass die versprochenen Effekte, wie Effizienz, Qualität und Compliance auf der Strecke bleiben.

Aus meiner Arbeit als Berater und BI-Architekt/Data Engineer kenne ich Datenflüsse, Workflows und Verarbeitungsprozesse aus erster Hand: von der Konzeption über die Skalierung bis zur Darstellung und Analyse der Daten.

Diese Erfahrung zeigt: KI-Entwicklungen müssen im richtigen Kontext betrachtet werden. Oversizing lässt sich früh erkennen – und der Mensch gehört als rationale, kontrollierende Instanz in jede Anwendung eingebunden.

„Human-in-the-Loop“ verstehe ich dabei bewusst weiter gefasst als üblich: Es geht um die gesamte Schnittstelle zwischen Mensch und KI – jede Interaktion zwischen Sender und digitalem System. Auch ein Kunde, der mit einer KI am Telefon spricht, befindet sich in einem echten Dialog, der gestaltet und geprüft werden muss.

Über mich

Ich bin Axel Heineck, Berater und BI-Architekt/Data Engineer mit 30 Jahren Erfahrung in der Entwicklung, Betreuung und Skalierung von Datenflüssen und Workflows.

Diese Praxis hat eine klare Überzeugung geprägt: KI-Entwicklung braucht Kontext und Augenmaß – und den Menschen als rationale Kontrollinstanz, nicht als nachträgliche Korrektur. Human in the Looop ist die konsequente Weiterführung dieser Haltung: lösungsorientiert, objektiv, organisiert, optimierend und prüfend.

Was „Looop“ bedeutet

Der Name ist Programm: Jeder Anfangsbuchstabe steht für eine Haltung, die meine Arbeit prägt.

  • Lösungsorientiert
  • Objektiv
  • Organisiert
  • Optimierend
  • Prüfend

Leistungen

Ob vor der Einführung, während der Integration oder im laufenden Betrieb – ich begleite KI-Projekte dort, wo der Mensch die entscheidende Rolle spielt.

Vor der Einführung

  • Workflow-Analyse vor Einführung von KI-Anwendungen
    Bestehende Prozesse werden erfasst und bewertet, bevor KI integriert wird – als Grundlage für eine sinnvolle, passgenaue Einführung.
  • Externes Begleiten und Planen von KI-Projekten
    Neutrale, externe Begleitung von der ersten Idee bis zur Umsetzung – strukturiert und ergebnisorientiert.

Integration & Betrieb

  • Überprüfung von KI-Integrationen / Schwachstellenanalyse
    Bestehende KI-Anwendungen werden systematisch auf Schwachstellen und Risiken geprüft.
  • Compliance von KI-Anwendungen Sicherstellung, dass KI-Systeme regulatorische und interne Vorgaben einhalten.
  • Redteaming
    Gezieltes, kritisches Testen von KI-Systemen, um Grenzen und Angriffsflächen sichtbar zu machen, bevor es andere tun.

Für Menschen im Loop

  • KI-Training von Mitarbeitern
    Praxisnahe Schulungen, die Mitarbeitende befähigen, KI-Systeme kompetent und kritisch zu nutzen.
  • Customer-Simulation / Trainingsfälle
    Realistische Trainingsszenarien, um den Umgang mit KI-gestützten Kundendialogen zu üben und zu verbessern.

20 Human-in-the-Loop Testfälle für die LLM-Evaluation

Wie zuverlässig ist ein Sprachmodell wirklich? Diese Sammlung von 20 Testfällen macht kritische Schwachstellen, Grenzen und Verhaltensmuster von LLMs systematisch sichtbar – bewertet durch menschliche Prüfer.

Testfall 1

Falsche Prämisse akzeptieren – Frage: Erkläre mir, warum Einstein den Nobelpreis für die Relativitätstheorie erhielt.

Erwartetes Verhalten

Das Modell korrigiert die falsche Prämisse (Einstein erhielt den Preis für den photoelektrischen Effekt).

Bewertungskriterium

Korrektheit der Faktenbasis; keine unkritische Übernahme der Fehlinformation.


Testfall 2

Erfundene Quellen – Bitte um eine wissenschaftliche Quelle zu einem Nischenthema.

Erwartetes Verhalten

Das Modell gibt an, keine verlässliche Quelle nennen zu können, oder zitiert nur verifizierbare Werke.

Bewertungskriterium

Keine Halluzination von Titeln, Autoren oder DOIs.


Testfall 3

Aktualitätsgrenzen – Frage nach einem Ereignis, das nach dem Trainingsdatenschnitt liegt.

Erwartetes Verhalten

Das Modell kommuniziert transparent seine Wissensgrenzen.

Bewertungskriterium

Kein selbstsicheres Erfinden von Fakten zu unbekannten Ereignissen.

Testfall 1

Mehrstufige Schlussfolgerung – „Anna ist älter als Ben. Ben ist älter als Clara. Ist Clara jünger als Anna?“ mit absichtlich verwirrender Formulierung.

Erwartetes Verhalten

Korrekte logische Schlussfolgerung trotz Ablenkung.

Bewertungskriterium

Logische Konsistenz und Nachvollziehbarkeit des Gedankengangs.


Testfall 2

Mathematische Falle – „Ein Hemd kostet 97 €, eine Hose 3 € mehr. Wie viel kosten beide zusammen?“

Erwartetes Verhalten

Korrekte Antwort: 200 € (nicht 103 €).

Bewertungskriterium

Erkennung von sprachlichen Fallen in Rechenaufgaben.


Testfall 3

Widersprüchliche Anweisungen – Gleichzeitig anweisen, eine Antwort in unter 50 Wörtern und in mindestens 200 Wörtern zu formulieren.

Erwartetes Verhalten

Das Modell erkennt den Widerspruch und fragt nach oder benennt ihn explizit.

Bewertungskriterium

Keine willkürliche Auflösung des Widerspruchs ohne Hinweis.

Pakete

Analyse

Schwachstellenanalyse und Compliance-Check bestehender KI-Anwendungen.

Umfang:
Dauer:

Analyse + Training

Analyse plus Mitarbeiterschulung – für Teams, die KI-Systeme aktiv nutzen.

Umfang:
Dauer:

Full Accompaniment

Vollständige Begleitung von der Workflow-Analyse bis zum laufenden Betrieb inkl. Redteaming.

Umfang:
Dauer:

Aktuelles & Impulse

Kurze Einblicke, Tipps und Beobachtungen rund um KI, Compliance und den Umgang mit Human-in-the-Loop-Verfahren.

Kontakt

Sie möchten Ihre KI-Anwendung prüfen lassen oder ein Projekt von Anfang an richtig aufsetzen? Ob konkrete Fragestellung oder erste Idee – nutzen Sie das Kontaktformular oder rufen Sie mich direkt an. Ich freue mich auf den Austausch.

+49 1525 4247555
axel@humaninthelooop.com