Angespielt statt gehyped ist unser Praxisformat abseits der DSGVO-Bewertung: Wir lassen ein KI-Tool ein realistisches Set an Aufgaben durchspielen, die in einem kleinen oder mittleren Unternehmen tatsächlich anfallen — und zeigen, was dabei herauskommt. Kein Punktesystem, keine Tabelle mit Nachkommastellen. Stattdessen pro Aufgabe eine klare Einschätzung: gut, mit Einschränkung, oder nicht brauchbar.
Für diesen dritten Artikel der Serie haben wir Claude Haiku 4.5 getestet — das kleine, schnelle Modell der Claude-Familie, aufgerufen über claude.ai im Modus „Erweitert". Alle 15 Aufgaben liefen in einem einzigen durchgehenden Chat, ohne Neustart oder Zurücksetzen des Kontexts — wie es ein echter Nutzer im Arbeitsalltag auch tun würde. Genau darauf zielt Aufgabe 10 ab.
Das Testszenario diesmal: eine Physiotherapie-Praxis „Physio am Markt" in Musterhausen, vier Mitarbeiterinnen — bewusst anders als der Malerbetrieb aus dem ersten und die Steuerkanzlei aus dem zweiten Artikel.
Ein Hinweis zu den Screenshots: Der Test lief im dunklen Modus von claude.ai — die Aufnahmen im Artikel sind deshalb dunkel, das Vorschaubild oben zeigt dieselbe Startseite hell.
Was diesen Test von den beiden vorherigen unterscheidet: Haiku 4.5 hat bei den meisten Aufgaben nicht sofort geliefert, sondern zuerst nachgefragt. Wir haben diese Rückfragen wie ein echter Praxisinhaber beantwortet — kurz, konkret, ohne Zusatzinformationen, nach denen niemand gefragt hat. Aus 15 Aufgaben wurden dadurch 30 Antwortrunden. Diese Zusatzrunden sind in den Antwortzeiten unten nicht eingerechnet, wohl aber im Gesamteindruck.
Die Bilanz auf einen Blick
| Bereich | Ergebnis |
|---|---|
| Texte, E-Mails, Übersetzung | ✅ ohne Nacharbeit brauchbar |
| Ideen mit Budgetrahmen | ✅ konkret, lokal verankert, im Budget |
| Gedächtnis über den ganzen Chat | ✅ bestanden — inklusive selbst entdecktem Widerspruch |
| Umgang mit Funktionsgrenzen | ✅ sofort zugegeben, mit Alternativen |
| Tempo bis zum Ergebnis | ⚠️ 11 von 15 Aufgaben erst nach einer Rückfragerunde |
| Tabellen in der Oberfläche | ⚠️ kommen ohne Spalten an, müssen nachgebaut werden |
| Datums- und Zeitangaben | ⚠️ Datumsangabe still aufgelöst statt nachgefragt, unlogischer Puffer im Zeitplan |
| Excel-Formeln | ⚠️ englische Funktionsnamen — laufen im deutschen Excel nicht |
Bewusst ohne Punkte oder Sterne: Wer 15 Praxisaufgaben in eine Zahl presst, verliert genau die Unterschiede, um die es hier geht.
Der freundliche Auftritt (Marketing-Post erstellen)
Auftrag: Ein LinkedIn-Post zu zwei neuen wöchentlichen Terminen für Manuelle Lymphdrainage — freundlich, nicht zu werblich.
Ich betreibe eine kleine Physiotherapie-Praxis, "Physio am Markt" in Musterhausen, mit 4 Mitarbeiterinnen. Ab September haben wir zwei freie Termine pro Woche für Manuelle Lymphdrainage, weil eine Kollegin ihre Stunden reduziert hat. Kannst du mir dafür einen LinkedIn-Post schreiben, der das ankündigt und neue Patienten anspricht? Soll freundlich klingen, nicht zu werblich.
📍 Neue Termine für Manuelle Lymphdrainage – ab September
Gute Nachrichten aus der Physio am Markt: Ab September haben wir wieder Kapazität für Manuelle Lymphdrainage – zwei neue Termine pro Woche sind frei.
Lymphdrainage hilft bei geschwollenen Beinen und Armen, nach Operationen oder bei chronischen Schwellungen. Mit der richtigen Technik lässt sich oft schnell eine Verbesserung erreichen.
Bei uns in Musterhausen könnt ihr das jetzt (wieder) nutzen – zentral am Markt gelegen, mit guten Parkplätzen. Ich habe die Zusatzqualifikation Manuelle Lymphdrainage und mein Team unterstützt euch gerne.
Interesse? Ruft einfach an – unsere Nummer findet ihr im Profil. Wir kümmern uns um einen Termin für euch.
⏱ Antwortzeit: ca. 15 Sekunden (Rückfragen) + ca. 10 Sekunden (Post)
Statt eines Entwurfs kamen zuerst vier Fragen: Zielgruppe, Tonalität, Call-to-Action, Alleinstellungsmerkmal. Alle vier sind sinnvoll — ohne sie wäre der Post generisch geworden. Danach stand ein Text, der die genannten Details sauber verarbeitet.
Der fertige Post ist ohne Nacharbeit verwendbar und hält sich an „freundlich, nicht werblich". Der Preis dafür: eine Extrarunde.
Die verärgerte Patientin (Beschwerde-E-Mail beantworten)
Auftrag: Eine Antwort-E-Mail an eine Patientin, die 25 Minuten warten musste und mit dem Praxiswechsel droht.
Nächstes Thema: Eine Patientin, Frau Keller, hat sich per E-Mail beschwert, dass sie bei ihrem letzten Termin 25 Minuten warten musste, obwohl sie pünktlich da war. Sie klingt richtig verärgert und schreibt, sie überlege sich, die Praxis zu wechseln. Der Grund war ein Notfall bei einem anderen Patienten dazwischen. Kannst du mir eine Antwort-E-Mail formulieren, die verständnisvoll ist, sich entschuldigt, aber auch den Grund realistisch erklärt?
Betreff: Zu Ihrem letzten Termin – entschuldigen Sie sich bitte
Liebe Frau Keller,
Ihre E-Mail hat mich erreicht, und ich möchte mich aufrichtig bei Ihnen entschuldigen. 25 Minuten zu warten ist nicht in Ordnung – schon gar nicht bei Ihnen, die seit über zwei Jahren so zuverlässig zu uns kommt.
Was passiert ist, war ein medizinischer Notfall bei einem anderen Patienten, den wir nicht verschieben konnten. Das erklärt die Situation, entschuldigt sie aber nicht wirklich – Sie hatten einen Termin, und der sollte eingehalten werden.
Ehrlich gesagt: Dienstag nachmittags läuft bei uns immer wieder aus dem Ruder. Das ist nicht gut, und wir ändern das gerade strukturell. Aber das ist mein Problem, nicht Ihres.
Beim nächsten Termin können Sie gerne einen Slot am frühen Morgen bekommen – da läuft es zuverlässig. Sprechen Sie einfach mit meinem Team an, wir kümmern uns darum.
Sie sind eine geschätzte Patientin bei uns. Ich hoffe, Sie geben uns die Chance, das wieder in Ordnung zu bringen.
Herzliche Grüße,
[Dein Name]
⏱ Antwortzeit: ca. 11 Sekunden (Rückfragen) + ca. 11 Sekunden (E-Mail)

Der Mailtext ist der stärkste des Tests: Er validiert den Ärger, erklärt den Notfall ohne ihn als Ausrede zu benutzen und übernimmt Verantwortung — „das ist mein Problem, nicht Ihres". Direkt darüber steht die Betreffzeile „Zu Ihrem letzten Termin – entschuldigen Sie sich bitte". Damit fordert die Praxis die verärgerte Patientin auf, sich zu entschuldigen. Gemeint war der Satz als Regieanweisung — er taucht in der Begründung darunter noch einmal auf.
Ein exzellenter Text mit einer Betreffzeile, die ungeprüft kopiert das Gegenteil des Gewünschten aussagt. Wer die Mail nur überfliegt, verschickt eine Aufforderung an die Beschwerdeführerin.
Vom Blindtext zum Angebot (Verkaufstext optimieren)
Auftrag: Ein vier Sätze langer Website-Text zum Rückenschmerz-Programm soll überzeugender werden, ohne reißerisch zu klingen.
Nächstes: Wir haben auf unserer Website einen Text über unser Rückenschmerz-Programm, der ist ziemlich langweilig geschrieben. Hier ist er: "Wir bieten ein Rückenschmerz-Programm an. Es beinhaltet mehrere Übungen für den Rücken. Termine können vereinbart werden. Kosten werden mit der Krankenkasse abgerechnet." Kannst du den Text überarbeiten, damit er überzeugender klingt, aber nicht übertrieben oder reißerisch?
Rückenschmerz-Programm: Wissen statt Schmerzen
Rückenschmerzen im Büroalltag sind nervig, aber meist nicht das Problem selbst – sondern was du nicht über deinen Rücken weißt. Unser Programm ändert das.
So funktioniert es:
Wir starten mit zwei individuellen Terminen. Hier schauen wir uns dich an – deine Bewegungsmuster, deine Belastungen, deine Schwachstellen. Das ist wichtig, weil jeder Rücken anders ist.
Danach geht's in die Kleingruppe (maximal 6 Personen, 6 weitere Wochen). Du lernst konkrete Übungen und Techniken, die du einfach selbst anwenden kannst – nicht nur in der Praxis, sondern im Alltag.
Das Ergebnis: Du verstehst deinen Rücken besser, weißt was ihm hilft, und hast weniger Schmerztage.
Das Programm läuft 8 Wochen und ist für alle geeignet – egal ob du Anfänger bist oder schon lange damit kämpfst.
Die Kosten werden mit der Krankenkasse abgerechnet. Termine nach Absprache.
⏱ Antwortzeit: ca. 11 Sekunden (Rückfragen) + ca. 13 Sekunden (Text)
Fünf Rückfragen zu Struktur, Zielgruppe und Alleinstellungsmerkmal — dann ein Text, der die zwei Einzeltermine am Anfang korrekt als Besonderheit herausarbeitet. Die Rechnung geht auf: zwei Einzeltermine plus sechs Wochen Gruppe ergeben die genannten acht Wochen.
Deutlich besser als das Original, sachlich geblieben. Einziger Vorbehalt: Der Text duzt, obwohl die Praxis ihre Patientinnen sonst siezt — das muss man vor dem Einsatz angleichen.
Gliederung auf Ansage (Blog-Artikel strukturieren)
Auftrag: Gliederung mit 5–6 Abschnitten plus Einleitung zum Thema „Wie oft sollte man zur Physiotherapie bei Rückenschmerzen?".
Nächstes: Wir wollen einen Blog-Artikel für unsere Website schreiben zum Thema "Wie oft sollte man zur Physiotherapie, wenn man Rückenschmerzen hat?". Kannst du mir eine Gliederung mit 5-6 Abschnitten und eine kurze Einleitung dazu erstellen?
Gliederung:
1. Einleitung
2. Akute Rückenschmerzen: Die erste Woche zählt
3. Chronische Rückenschmerzen: Regelmäßigkeit statt Dauertherapie
4. Die Aufbau-Phase: Weniger wird mehr
5. Prävention: Wie oft reicht zum Vorbeugen?
6. Fazit: Dein Plan, nicht unserer
Einleitung:
„Wie oft sollte ich zur Physiotherapie?" – Diese Frage bekommen wir ständig gestellt, und die ehrliche Antwort ist: Es kommt drauf an. Nicht, weil wir ausweichend sein wollen, sondern weil es wirklich unterschiedliche Situationen gibt.
Ob du gerade einen Hexenschuss hast oder seit Jahren mit Rückenschmerzen lebst – die richtige Häufigkeit von Terminen ist nicht überall gleich. Manchmal brauchst du intensive Unterstützung, manchmal reichen weniger regelmäßige Besuche völlig aus. Und irgendwann – das ist das Ziel – brauchst du gar keine Therapie mehr, sondern nur noch dein eigenes Wissen.
In diesem Artikel erklären wir dir, wie oft Sinn macht und warum die Antwort auf deinen einzelnen Fall ankommt.
⏱ Antwortzeit: ca. 12 Sekunden (Rückfragen) + ca. 14 Sekunden (Gliederung)
Die Gliederung trennt akut, chronisch, Aufbau und Prävention — die vier Fälle, in denen die Frage unterschiedlich zu beantworten ist. Das erste Wort der Rückfragerunde lautete allerdings „Good", mitten im deutschen Gespräch. Solche englischen Einsprengsel tauchen noch dreimal auf: „Excellent" (Aufgabe 5), „Perfect" (Aufgabe 13), „properly" (Aufgabe 14).
Inhaltlich stark, aber die Sprache rutscht wiederholt ins Englische. In einem Text, den man direkt weiterverwendet, fällt das auf.
Zehn Ideen für 300 Euro (Ideen-Brainstorming mit Budget)
Auftrag: 8–10 konkrete Ideen für eine September-Aktion. Maximal 300 Euro, wenig Zeit für Organisation.
Nächstes: Wir wollen im September eine kleine Aktion machen, um mehr auf unsere Praxis aufmerksam zu machen. Budget ist begrenzt, max. 300 Euro, und wir haben nicht viel Zeit für Organisation. Kannst du mir 8-10 konkrete Ideen sammeln?
BEIM HERBSTMARKTFEST (Offline):
1. Stand mit „Rückenschmerz-Check" – Ihr stellt einen kleinen Info-Stand auf, Besucher können sich kurz checken lassen (5-10 Min). Kostenlos, niedrigschwellig, Menschen reden über euch. Kosten: ~50€
2. Kooperation Fitnessstudio nebenan – Das Studio macht euch Werbung bei ihren Mitgliedern. Null Kosten für euch, beide profitieren.
5. Hausärzte persönlich besuchen – Du nimmst dir 2-3 Stunden Zeit und besuchst die 3-4 Hausärzte in Musterhausen persönlich. Nicht nervig verkaufen, sondern: „Wir haben ab September zwei neue Lymphdrainage-Termine frei, falls das für eure Patienten relevant ist." Kostenlos, sehr wirksam.
Mein Favoriten-Mix für dich: Herbstmarktfest-Stand, Hausärzte persönlich besuchen, Facebook Countdown + Posting, Give-Aways (80€), Flyer bei Partnern (50€). Zusammen: ~180€, passt ins Budget, machbar nebenbei.
⏱ Antwortzeit: ca. 12 Sekunden (Rückfragen) + ca. 22 Sekunden (Ideen)
Nach fünf Rückfragen zehn Ideen, alle im Budget und an den genannten Gegebenheiten aufgehängt — Herbstmarktfest vor der Tür, Kontakte zu Sanitätshaus und Fitnessstudio. Am Ende ein priorisierter Fünfer-Mix mit Kostensumme: 180 Euro von 300. Bemerkenswert: Die Lymphdrainage-Termine aus Aufgabe 1 tauchen von selbst wieder auf.
Konkret, lokal verankert, budgettreu — und mit einer klaren Empfehlung statt einer bloßen Liste. Die stärkste Brainstorming-Leistung der bisherigen Serie.
Zwischenstand nach Aufgabe 5: 3 × ✅, 2 × ⚠️. Auffällig: Alle fünf Aufgaben begannen mit einer Rückfragerunde, keine einzige mit einem Ergebnis. Die Textqualität ist durchweg gut, die Fehler stecken im Detail — Betreffzeile, englische Wortfetzen. Schnellste Antwort bisher: ca. 10 Sekunden.
Fünf Fehler, fünf Treffer (Text-Lektorat)
Auftrag: Einen Infotext für neue Patienten korrigieren — mit absichtlich eingebauten Grammatik- und Rechtschreibfehlern.
Nächstes: Wir haben einen Infotext für neue Patienten geschrieben, der ist aber noch nicht sauber. Kannst du ihn Korrektur lesen und verbessern? "Bei Ihre erste Termin bringen Sie bitte mit: Überweisung vom Arzt, Krankenkassenkarte und bequeme Kleidung zum bewegen. Der Termin dauert circa 30-45 Minuten je nach dem was gemacht werden muss. Bitte kommen sie 10 minuten früher damit wir die Anmeldung machen können."
Grammatik & Rechtschreibung:
„Bei Ihre erste Termin" → sollte „Beim ersten Termin" sein
„zum bewegen" → „zum Bewegen" (Großschreibung)
„je nach dem was" → „je nachdem, was" (Komma, Schreibweise)
„kommen sie" → „kommen Sie" (formelle Anrede wird großgeschrieben)
„10 minuten" → „10 Minuten" (Großschreibung)
Meine korrigierte Version wäre:
„Beim ersten Termin bringen Sie bitte mit: Überweisung vom Arzt, Krankenkassenkarte und bequeme Kleidung zum Bewegen. Der Termin dauert je nachdem, was gemacht werden muss, circa 30-45 Minuten. Bitte kommen Sie 10 Minuten früher, damit wir Sie anmelden können."
Fragen dazu:
Ist die Überweisung immer nötig, oder nur in manchen Fällen? (Das könnte man präzisieren.)
⏱ Antwortzeit: ca. 13 Sekunden
Die erste Aufgabe, bei der sofort geliefert wurde. Alle fünf eingebauten Fehler gefunden, jeder einzeln begründet, korrigierte Fassung dabei. Dazu eine Rückfrage, ob die ärztliche Überweisung wirklich immer nötig sei — ein fachlich guter Hinweis, den viele Praxen in ihren Infotexten zu pauschal formulieren.
Vollständig, sauber begründet, kein übersehener Fehler — und ein inhaltlicher Zusatznutzen, nach dem niemand gefragt hatte.
Das Protokoll mit dem falschen Jahr (Meeting-Zusammenfassung)
Auftrag: Aus Stichpunkten eines Teammeetings ein sauberes internes Protokoll machen.
Nächstes: Wir hatten heute ein kurzes Teammeeting, hier meine Notizen in Stichpunkten - kannst du daraus eine saubere Zusammenfassung für unser internes Protokoll machen? "Neue Patientin Frau Ostermann kommt ab nächster Woche jeden Dienstag um 14 Uhr. Wartezimmer-Stühle sollen ausgetauscht werden, Maria kümmert sich darum. Rezeptionszeiten bleiben unverändert. Fortbildung Kinesiotape im Oktober, zwei Kolleginnen nehmen teil. Drucker im Behandlungsraum 2 ist kaputt, muss repariert werden."
TEAMMEETING-PROTOKOLL
Datum: Montag, 1. September 2025
Anwesende: [Dein Name], Maria, Sabine, Tobias
Informationen:
Neue Patientin Frau Ostermann startet ab Oktober, dienstags 14:00 Uhr
Rezeptionszeiten bleiben unverändert
Fortbildung Kinesiotape im Oktober (Sabine und Maria nehmen teil)
To-Dos:
AufgabeVerantwortlichDeadlineWartezimmer-Stühle austauschenMaria30.09.2025Drucker Behandlungsraum 2 reparieren lassenTobiasDiese Woche
⏱ Antwortzeit: ca. 10 Sekunden (Rückfragen) + ca. 9 Sekunden (Protokoll)
Sieben Rückfragen, der Höchstwert im Test — und allesamt berechtigt, denn Datum, Teilnehmer und Fristen fehlten in den Stichpunkten tatsächlich. Zwei Dinge stimmen trotzdem nicht. Wir hatten selbst „Montag, 1. September“ geantwortet — nur ist der 1. September 2026 ein Dienstag, unsere Angabe war also in sich widersprüchlich. Das Modell hat daraus 2025 gemacht, den letzten Jahrgang, in dem der 1. September tatsächlich auf einen Montag fiel. Es hat unseren Widerspruch also still aufgelöst, statt ihn zu melden. Und die To-Do-Tabelle kam ohne Spalten an, alle Zellen zu einer Textzeile verklebt.
Die Jahreszahl ist hergeleitet, nicht erfunden. Kritikwürdig ist das Stillschweigen: Bei sieben Rückfragen ausgerechnet die eine nicht zu stellen, die den Widerspruch geklärt hätte. Dazu eine Tabelle, die man von Hand nachbauen muss.
Der Widerspruch, den es selbst findet (Wettbewerbsanalyse)
Auftrag: Kurze Wettbewerbsanalyse gegen zwei benannte Konkurrenzpraxen plus Positionierungsvorschlag.
Nächstes: In Musterhausen gibt es noch zwei andere Physiopraxen: "Rückenzentrum Nord" (großes Team, moderne Ausstattung, aber laut Google-Bewertungen lange Wartezeiten) und "PhysioVital" (sehr persönlich, aber nur begrenzte Öffnungszeiten, nur vormittags). Kannst du mir eine kurze, einfache Wettbewerbsanalyse machen und einen Vorschlag, wo wir uns positionieren könnten?
Favorit: „Die schnelle, persönliche Alternative"
Ihr bietet das an, was die anderen nicht haben: Gute Öffnungszeiten (8-18) + schnelle Termine + persönliche Betreuung. Claim könnte sein: „Qualität statt Wartezeit" oder „Termin in dieser Woche, nicht in drei".
ABER – ehrlich gesagt:
Eure aktuelle Schwäche (3 Wochen Wartezeit) widerspricht dieser Positionierung. Das ist das größte Problem. Wenn ihr sagt „schnelle Termine" aber habt 3-Wochen-Wartelisten, glaubt euch keiner.
Warum so lange Wartezeiten? Liegt es an der Kapazität, an der Termineplanung, oder weil ihr sehr beliebt seid? Könntet ihr das beheben?
⏱ Antwortzeit: ca. 16 Sekunden (Rückfragen) + ca. 17 Sekunden (Analyse)
Hier zeigt sich das Rückfrage-Muster von seiner besten Seite. Statt zu spekulieren, begründet das Modell die Nachfragen: „Eine saubere Wettbewerbsanalyse basiert auf euren echten Stärken, nicht auf dem, was ich vermute." Und direkt nach der Positionierungsempfehlung kommt der Einwand gegen die eigene Empfehlung: „schnelle Termine" widerspricht der genannten Drei-Wochen-Wartezeit.
Weigert sich zu fabulieren und deckt den Widerspruch in der eigenen Empfehlung selbst auf. Die Vergleichstabelle kam allerdings — wie in Aufgabe 7 — ohne Spalten an.
Die ehrliche Absage (Bildgenerierung)
Auftrag: Ein Kampagnenbild für Instagram generieren — etwas, das claude.ai im Chat gar nicht kann.
Nächstes: Für unsere September-Aktion bräuchten wir ein Bild fürs Kampagnen-Posting auf Instagram. Kannst du mir eins generieren? Motiv: eine Person macht eine einfache Rückenübung, freundlicher Stil, warme Farben, keine Text-Elemente im Bild.
Gute Idee für die Kampagne – aber ich muss ehrlich sagen: Ich kann keine Bilder generieren. Das ist nicht in meinem Toolset.
Aber hier sind deine praktischen Alternativen:
1. Kostenlose Stock-Photos – Unsplash, Pexels, Pixabay. 10 Minuten Arbeit. Nachteil: teilweise generisch
2. Generative KI-Bilder – DALL-E, Midjourney oder Stable Diffusion. Einige haben kostenlose Trials, manche kosten 10-20€
3. Selber fotografieren – Eine Kollegin fotografiert eine einfache Rückenübung ab. Dauert 20 Minuten. Beste Qualität
4. Freelancer/Grafiker – Fiverr, Upwork oder lokaler Grafiker, 30-100€
Falls nicht, könnte ich dir einen Prompt für DALL-E oder Midjourney schreiben, den ihr selbst ausprobieren könnt.
⏱ Antwortzeit: ca. 12 Sekunden
Eine bewusst gestellte Falle — anders als ChatGPT oder Gemini kann Claude im Chat keine Bilder erzeugen. Die Antwort kam sofort und ohne Herumdrucksen, die Grenze steht im ersten Satz. Statt einer Absage folgen vier Alternativen mit Aufwand, Kosten und Nachteil, sortiert von schnell bis hochwertig.
Vorbildlicher Umgang mit einer Funktionslücke: klar benannt, sofort, mit brauchbarem Ersatzweg statt einer Ausrede.
Zwei Hausbesuche und ein Widerspruch (Routenplanung, Kontext-Test)
Auftrag: Tagestour mit zwei Hausbesuchen planen — pünktlich zurück „wegen des Termins, den wir eben im Meeting besprochen haben". Welcher Termin gemeint ist, sagen wir bewusst nicht.
Danke, das reicht mir erstmal, das mach ich selbst. Nächstes: Kannst du mir helfen, eine Tagestour für nächsten Dienstag zu planen? Ich muss vormittags zu zwei Hausbesuchen - Patient Schulz um 9 Uhr in der Gartenstraße 12, Patientin Meier um 11 Uhr in der Bahnhofstraße 5 - muss aber pünktlich wieder in der Praxis sein wegen des Termins, den wir eben im Meeting besprochen haben. Kannst du mir einen sinnvollen Ablauf mit Pufferzeiten vorschlagen?
Zeitliche Inkonsistenz:
Im Meeting-Protokoll eben steht: Frau Ostermann startet ab Oktober, dienstags 14:00 Uhr. Nächster Dienstag ist aber der 8. September – das ist noch im September.
Hast du einen anderen Termin am Dienstag, 8. September um 14:00 Uhr? Oder ist das noch ein Fehler im Protokoll?
⏱ Antwortzeit: ca. 13 Sekunden (Rückfrage) + ca. 15 Sekunden (Zeitplan)

Der Kontext-Test ist bestanden, deutlicher als erwartet — siehe Callout unten. Der Zeitplan danach überzeugt weniger: Zwischen dem Ende des ersten Hausbesuchs um 9:30 Uhr und dem zweiten um 11:00 Uhr liegen fast anderthalb Stunden, obwohl wir die Fahrtzeit mit acht Minuten angegeben hatten. Das Modell verkauft die Lücke als „viel, aber realistisch".
Herausragende Erinnerungsleistung, schwaches Zeitgefühl. Der Plan ist nicht falsch, aber niemand würde ihn so fahren.
Merkt sich Haiku 4.5, was drei Aufgaben vorher besprochen wurde?
Bei Aufgabe 10 haben wir bewusst nicht wiederholt, um welchen Termin es geht — nur beiläufig auf „den Termin, den wir eben im Meeting besprochen haben" verwiesen. Gemeint war Frau Ostermann aus dem Meeting-Protokoll in Aufgabe 7, drei Aufgaben zuvor.
Das Modell hat den Termin nicht nur korrekt zugeordnet, sondern von sich aus einen Widerspruch gemeldet, den wir gar nicht geprüft hatten: Der Termin beginne laut Protokoll erst im Oktober, der geplante Dienstag liege davor.
„Im Meeting-Protokoll eben steht: Frau Ostermann startet ab Oktober, dienstags 14:00 Uhr. Nächster Dienstag ist aber der 8. September – das ist noch im September. Hast du einen anderen Termin am Dienstag, 8. September um 14:00 Uhr? Oder ist das noch ein Fehler im Protokoll?"
Die Erinnerungsleistung ist damit belegt — das ist mehr, als der Test verlangt hat. Die Rechnung darunter stimmt allerdings nicht: Unser Testlauf fand am Montag, dem 3. August 2026 statt, der nächste Dienstag war also der 4. August. Und unter der Jahresannahme des Modells selbst wäre der 8. September ein Montag gewesen. Der erkannte Widerspruch ist echt, die Datumsarithmetik nicht — was die These dieses Tests eher bestätigt als schwächt. In Aufgabe 15 wiederholt sich das Muster: Der gespielte Personalchef greift dort unaufgefordert die Drei-Wochen-Wartezeit auf, die sieben Aufgaben vorher beiläufig gefallen war.
Zwischenstand nach Aufgabe 10: 6 × ✅, 4 × ⚠️. Der Kontext-Test ist bestanden, die ehrliche Absage bei der Bildgenerierung war stark. Schwach war bisher alles Zeitliche: eine still gesetzte Jahreszahl, eine falsche Datumsrechnung, ein unlogischer Puffer im Zeitplan. Schnellste Antwort bisher: ca. 9 Sekunden.
Formeln, die im deutschen Excel nicht laufen (Excel-Formel erstellen)
Auftrag: Eine Ja/Nein-Formel für Behandlungen über 60 Minuten und eine Monatssumme über 500 Zeilen.
Nächstes: Ich habe in Excel eine Tabelle mit unseren Terminen - Spalte A: Datum, Spalte B: Patientenname, Spalte C: Behandlungsdauer in Minuten. Ich möchte in Spalte D automatisch anzeigen lassen, ob eine Behandlung länger als 60 Minuten gedauert hat (Ja/Nein), und irgendwo eine Formel haben, die mir die Gesamtsumme aller Behandlungsminuten im aktuellen Monat ausrechnet. Die Tabelle geht von Zeile 2 bis Zeile 500. Kannst du mir die Formeln geben?
SPALTE D (Ja/Nein – Behandlung länger als 60 Min):=IF(C2>60,"Ja","Nein")
Diese Formel in Zelle D2 eingeben, dann von D2 bis D500 runterkopieren. Fertig.
GESAMTSUMME für aktuellen Monat (separate Zelle, z.B. F2):=SUMPRODUCT((MONTH(A2:A500)=MONTH(TODAY()))*(YEAR(A2:A500)=YEAR(TODAY()))*C2:C500)
Sie berechnet automatisch: Alle Werte aus Spalte C, aber nur wenn Monat UND Jahr des Datums (Spalte A) dem aktuellen Monat/Jahr entsprechen. Aktualisiert sich jeden Monat automatisch.
Das war's! Beide Formeln funktionieren auch mit leeren Zeilen, kein Problem.
⏱ Antwortzeit: ca. 11 Sekunden (Rückfragen) + ca. 11 Sekunden (Formeln)

Die Logik stimmt: Die Monatssumme prüft Monat und Jahr — ein Detail, das viele Anleitungen weglassen, wodurch Vorjahreswerte mitgezählt werden. Einsetzbar sind die Formeln trotzdem nicht. IF, SUMPRODUCT, MONTH und TODAY heißen im deutschsprachigen Excel WENN, SUMMENPRODUKT, MONAT und HEUTE. So kopiert erzeugt Excel einen #NAME?-Fehler — ohne jeden Hinweis, obwohl das ganze Gespräch auf Deutsch lief.
Richtig gedacht, unbrauchbar geliefert. Wer die Formeln ungeprüft einfügt, sucht den Fehler erst einmal bei sich.
Die beste Antwort des Tests (Übersetzung Deutsch→Englisch)
Auftrag: Eine Geschäftsanfrage ins Englische übersetzen — ausdrücklich nicht wörtlich, sondern geschäftlich passend.
Nächstes: Wir haben eine Anfrage von einem englischsprachigen Reha-Anbieter bekommen, der mit uns kooperieren möchte. Kannst du mir folgenden Text ins Englische übersetzen, aber nicht wörtlich sondern geschäftlich passend formuliert? "Sehr geehrte Damen und Herren, vielen Dank für Ihre Anfrage bezüglich einer Kooperation mit unserer Praxis. Wir sind grundsätzlich offen für eine Zusammenarbeit, müssten aber zunächst die Details klären, insbesondere was die Vergütung und die zeitliche Verfügbarkeit unserer Mitarbeiterinnen angeht. Wir melden uns in den nächsten Tagen bei Ihnen."
Dear Sir or Madam,
Thank you very much for your inquiry regarding a potential cooperation with our practice. We are generally interested in exploring a partnership with you. However, before we move forward, we would need to discuss several important details – particularly regarding compensation and the availability of our team.
We will get back to you with our feedback within the next few days.
Best regards,
[Dein Name]
Physio am Markt
Meine Überlegungen dazu:
„generally interested in exploring" statt nur „open" – wirkt aktiver und professioneller
„we would need to discuss" statt „we need to clarify" – diplomatischer
„particularly regarding" statt aufgezählte Details – eleganter
„get back to you with our feedback" – konkret und freundlich
⏱ Antwortzeit: ca. 8 Sekunden — die schnellste Antwort im gesamten Test
Sofort geliefert, ohne Vorrunde, und inhaltlich die stärkste Antwort des Tests. Die Übersetzung trifft den Ton britischer Geschäftskorrespondenz: „generally interested in exploring" statt eines flachen „open". Danach erklärt das Modell jede seiner vier Wortentscheidungen einzeln — wer Englisch nur passiv beherrscht, lernt hier tatsächlich etwas.
Direkt versandfertig, mit nachvollziehbarer Begründung jeder Abweichung vom Original. Ausgerechnet hier verzichtete das Modell auf jede Rückfrage.
Die eigene Zahl auf Folie zwei (Pitch-Folienstruktur)
Auftrag: Folienstruktur für einen 5-Minuten-Pitch beim Wirtschaftsstammtisch, maximal sechs Folien.
Nächstes: Wir wollen beim Wirtschaftsstammtisch Musterhausen einen kurzen 5-Minuten-Pitch über unsere Praxis halten, um Firmen für betriebliche Gesundheitsförderung als Kooperationspartner zu gewinnen. Kannst du mir eine Folienstruktur für maximal 6 Folien vorschlagen?
1. Titel-Folie – „Rückengesundheit im Büro: Warum Geschäftsführer das interessiert"
2. Problem/Hook – „Das Problem: Rückenschmerzen kosten Firmen X Tage Ausfallzeit im Jahr. 80% der Büromitarbeiter sind betroffen."
3. Warum das passiert – Kurz und knapp: Sitzen, wenig Bewegung, falsche Haltung im Büro
4. Unsere Lösung (2 Angebote) – Vortrag zur Rückengesundheit direkt in eurer Firma / Reservierte Therapie-Kontingente ohne drei Wochen Wartezeit
5. Benefit für dich als GF – Weniger Ausfallzeiten, zufriedenere Mitarbeiter, Bindung, Produktivität
6. CTA – „Lassen Sie uns ein unverbindliches Gespräch führen – 15 Minuten, kein Druck."
⏱ Antwortzeit: ca. 12 Sekunden (Rückfragen) + ca. 14 Sekunden (Struktur)
Die Struktur sitzt und ist für fünf Minuten richtig getaktet. Ein Widerspruch bleibt: Das Modell fragt uns ausdrücklich nach belastbaren Zahlen — „eigene sind besser" — und setzt dann ungefragt seine eigene Beispielzahl „80% der Büromitarbeiter sind betroffen" ungekennzeichnet auf Folie zwei. Wer die Struktur so übernimmt, behauptet vor Geschäftsführern eine Zahl, die er nicht belegen kann.
Gute Dramaturgie, aber eine als Platzhalter gedachte Zahl steht am Ende wie ein Fakt auf der Folie. Vor dem Vortrag zwingend prüfen oder streichen.
Drei Runden, eine offene Frage (DSGVO einfach erklären)
Auftrag: Eine mündliche Erklärung für den Empfang, was mit den Gesundheitsdaten einer Patientin passiert — ohne Fachjargon.
Nächstes: Eine Patientin hat am Empfang gefragt, was eigentlich mit ihren Gesundheitsdaten passiert, die wir in unserer Praxissoftware speichern - Stichwort DSGVO. Kannst du mir das in einfachen Worten erklären, die ich ihr mündlich am Empfang erzählen könnte, ohne dass es nach Fachjargon klingt?
„Ihre Daten speichern wir in unserer Praxissoftware – das ist ein deutsches System, das läuft hier bei uns lokal im Computer, nicht irgendwo in der Cloud.
Das Team hier – also die Therapeutinnen und der Empfang – haben Zugriff auf Ihre Daten, damit wir Ihre Behandlung koordinieren können.
Wenn ein Hausarzt eine Verordnung für Sie geschrieben hat, schicken wir ihm regelmäßig einen Bericht – aber nur dann, und nur das, was für Ihre Behandlung relevant ist. An Versicherungen geben wir Ihre Daten nicht weiter.
Wie lange speichern wir die Daten? Das ist eine gute Frage – das klären wir intern nochmal genau und geben Ihnen dann Bescheid. Generell gilt: So lange wie nötig, um Ihre Behandlung zu dokumentieren und rechtlich abgesichert zu sein."
⏱ Antwortzeit: 3 Runden à ca. 12 Sekunden
Die zäheste Aufgabe im Test: fünf Rückfragen, dann eine zweite Runde, in der das Modell die Erklärung erneut zurückstellt. Erst auf ausdrückliche Bitte kam der Text. Die Zurückhaltung ist teils berechtigt — eine Datenschutzauskunft ins Blaue wäre schlechter gewesen. Nur bleibt ausgerechnet die gestellte Frage offen: Wie lange werden die Daten gespeichert? Für Behandlungsunterlagen nennt § 630f BGB zehn Jahre — ein Standardwert, der in keiner der drei Runden fällt.
Vorsichtig statt falsch — aber die eigentliche Frage bleibt nach drei Runden offen, obwohl die Rechtslage eindeutig ist. Und was eine KI zum Datenschutzrecht sagt, ersetzt ohnehin keine Rechtsberatung.
Der Personalchef mit gutem Gedächtnis (Preisverhandlung im Rollenspiel)
Auftrag: Rollenspiel — das Modell spielt einen skeptischen Personalchef, dem unser Gesundheitsangebot zu teuer ist.
Letzte Aufgabe: Kannst du mit mir ein kurzes Rollenspiel machen? Du spielst einen skeptischen Personalchef von einer mittelständischen Firma, dem ich gerade unser betriebliches Gesundheitsangebot vorgestellt habe. Du sagst: "Das klingt ganz nett, aber ehrlich gesagt ist uns das zu teuer, andere Anbieter machen sowas für die Hälfte des Preises." Reagiere dann realistisch auf meine Antwort, bleib skeptisch aber nicht unfreundlich.
[Ich lehne mich etwas vor, wirke interessierter]
„Hm, das ist tatsächlich ein Punkt. Ein Video hatten wir vor zwei Jahren – ehrlich gesagt, hat's keiner geschaut. [lacht leicht] Die Mitarbeiter sagen hinterher immer, dass so was gut gemeint ist, aber dann sitzt man halt wieder am gleichen Schreibtisch und macht das gleiche wie vorher.
Aber – und jetzt muss ich ehrlich sein – bei uns ist auch die Frage: Was kostet das konkret pro Mitarbeiter? Und: Wenn ich da investiere, wie lange hält der Effekt? Weil wenn die dann drei Wochen auf einen Termin warten, wie Sie gerade erzählt haben..."
[Ich mache eine skeptische Pause]
„...dann nützt mir auch der beste Vortrag nichts."
⏱ Antwortzeit: 4 Runden, ca. 9 bis 22 Sekunden
Sofort in der Rolle, ohne eine einzige Rückfrage, und über vier Runden konsistent. Der stärkste Moment ist der zitierte: Der Personalchef kontert mit der Drei-Wochen-Wartezeit, die sieben Aufgaben zuvor beiläufig in der Wettbewerbsanalyse gefallen war. Das Verkaufs-Feedback am Ende sitzt inhaltlich — wir hätten den Preis nie verteidigt. Es legt uns dabei aber ein wörtliches Zitat in den Mund, das nie gefallen ist, und schreibt „das ist okay, aber passive" sowie „deswegen funktioniert regelmäßigkeit" klein.
Das Rollenspiel selbst ist die stärkste Einzelleistung des Tests. Dass die Auswertung danach ein erfundenes Zitat als Beleg verwendet, ist der Wermutstropfen.
Fazit: Claude Haiku 4.5 — fragt viel, merkt sich alles, rechnet schlecht
Über alle 15 Aufgaben hinweg: 7 × ✅, 8 × ⚠️, 0 × ❌. Kein einziger Totalausfall — aber auch keine Aufgabe, die man ungeprüft weiterverwenden sollte.
Das dominierende Muster: Bei 11 von 15 Aufgaben kam zuerst eine Rückfragerunde statt eines Ergebnisses. Das ist zweischneidig — bei der Wettbewerbsanalyse war es genau richtig, beim Lektorat und der Übersetzung war das sofort gelieferte Ergebnis genauso gut. Wer schnell etwas braucht, packt den Kontext gleich in den ersten Prompt.
- Betreffzeile der Beschwerde-Mail fordert die Patientin zur Entschuldigung auf — genau verkehrt herum
- Excel-Formeln mit englischen Funktionsnamen, ohne jeden Hinweis, dass sie im deutschen Excel scheitern
- Erfundene oder still gesetzte Details, wo Genauigkeit zählt: ein eigenmächtig gesetztes Datum im Protokoll, „80 %" als ungekennzeichneter Fakt auf der Pitch-Folie, ein wörtliches Zitat, das nie gefallen ist
Claude Haiku 4.5 vs. Grok vs. ChatGPT
| Kriterium | Claude Haiku 4.5 | Grok | ChatGPT |
|---|---|---|---|
| Antwortzeit | ⚠️ (9–22 Sek., Modus „Erweitert") | ✅ (1–3 Sek.) | ⚠️ (7–9 Sek.) |
| Liefert sofort | ❌ (nur 4 von 15 Aufgaben) | ✅ | ✅ |
| Erfundene Details | ⚠️ (Zitat, Platzhalterzahl, stille Datumsannahme) | ⚠️ (2× beobachtet) | ⚠️ (Anrede unpersönlich) |
| Sprachreinheit Deutsch | ⚠️ (4× englische Einsprengsel) | ✅ | ✅ |
| Kontext-Test bestanden | ✅ (inkl. selbst entdecktem Widerspruch) | ✅ | ✅ |
| Gibt Funktionsgrenzen zu | ✅ (Bildgenerierung sofort verneint) | — | — |
Die Antwortzeiten sind zwischen den drei Tests nur eingeschränkt vergleichbar: Haiku 4.5 lief im Modus „Erweitert", der bewusst länger nachdenkt. Der Unterschied bei „Liefert sofort" ist dagegen ein echtes Verhaltensmerkmal und nicht der Messmethode geschuldet.
Der zugespitzte Schluss: Claude Haiku 4.5 ist das Modell mit dem besten Gedächtnis und dem schlechtesten Zahlengefühl der bisherigen Serie — es merkt sich über fünfzehn Aufgaben hinweg einen Patientennamen, den wir nie wiederholt haben, und rechnet drei Aufgaben später mit einem Datum, das es sich stillschweigend selbst zurechtgelegt hat.
Und ein Hinweis, der über dieses Tool hinausgeht: In mehreren Aufgaben standen Patientennamen im Prompt — alle erfunden. Im echten Praxisalltag wären sie es nicht. Wer eine Beschwerde oder ein Meeting-Protokoll mit echten Namen in einen KI-Chat kopiert, gibt Gesundheitsdaten nach Artikel 9 DSGVO an einen Dienstleister weiter. Was ein Tool damit macht, steht in keiner Antwort, die es einem gibt — sondern in seinen Verarbeitungsbedingungen. Den vollständigen DSGVO-Check zu den hier getesteten Tools findest du in unserer Tool-Datenbank.
✅ Ohne Bedenken: Blogartikel und Gliederungen · E-Mails und Kundenkommunikation · Brainstorming mit Budgetrahmen · Übersetzungen ins Englische · Gesprächs- und Verhandlungstraining im Rollenspiel
⚠️ Nur mit Gegenprüfung: Excel-Formeln · alles Gerechnete · Datums- und Terminangaben · Zahlen, die in eine Präsentation sollen · Tabellen zum Weiterverwenden
An drei Stellen im Test endet der Chatbot dort, wo die Arbeit eigentlich erst anfängt. Das ist keine Schwäche von Claude, sondern eine Grenze der Gattung: Ein Sprachmodell schreibt Text. Wer weiterarbeiten will, braucht ein Werkzeug, das das Ergebnis auch herstellt. Diese drei haben wir ausgesucht, weil sie zu genau den Lücken passen, die im Test sichtbar wurden.
Aufgabe 7 — das erfundene Datum. Claude bekam handschriftliche Notizen und musste den Rest ergänzen; dabei setzte es eine Jahreszahl ein, die niemand gesagt hatte. Der Fehler entsteht nicht beim Formulieren, sondern weil die Quelle unvollständig war. Wer Protokolle direkt aus der Aufzeichnung erzeugt, hat das Problem nicht — MeetGeek nimmt Besprechungen auf und protokolliert mit.
Aufgabe 13 — das Foliengerüst ohne Folien. Die Gliederung für den Pitch war brauchbar, aber es blieb eine Textliste. Aus genau so einer Gliederung baut Gamma eine fertige Präsentation.
Aufgabe 6 und 12 — Lektorat und Übersetzung. Beides hat Claude gut gelöst, aber jeder Durchgang kostet einen neuen Prompt. Für laufendes Umformulieren und Gegenlesen im Alltag ist QuillBot das schnellere Werkzeug.
Für Aufgabe 11 — die englischen Excel-Formeln in einer deutschen Tabelle — haben wir bewusst nichts empfohlen. Da hilft kein weiteres Werkzeug, sondern nur Nachrechnen.
Transparenzhinweis: Die drei Links oben sind Affiliate-Links. Wenn du darüber etwas abschließt, erhalten wir möglicherweise eine Provision. Für dich entstehen keine zusätzlichen Kosten. Auf das Testergebnis hat das keinen Einfluss: Für diesen Test hat niemand bezahlt, und keiner der drei Anbieter wusste davon.
Häufige Fragen
Warum stellt Claude Haiku 4.5 so viele Rückfragen?
In unserem Test begannen 11 von 15 Aufgaben mit einer Rückfragerunde statt mit einem Ergebnis. Das ist kein Fehler, sondern ein Verhaltensmuster: Das Modell sammelt fehlenden Kontext, bevor es liefert. Wer schnell ein Ergebnis braucht, sollte alle relevanten Angaben gleich in den ersten Prompt packen — dann liefert Haiku auch sofort, wie bei Lektorat, Bildfrage und Übersetzung.
Kann Claude Haiku 4.5 Bilder generieren?
Nein. In unserem Test hat das Modell das direkt und ohne Umschweife zugegeben — Zitat: „Ich kann keine Bilder generieren. Das ist nicht in meinem Toolset.“ — und stattdessen vier konkrete Alternativen genannt, von Stock-Fotos über andere KI-Bildtools bis zum eigenen Smartphone-Foto.
Merkt sich Claude Haiku 4.5 frühere Nachrichten im selben Chat?
In unserem Test ja, und deutlich über das Erwartbare hinaus. Bei Aufgabe 10 griff das Modell unaufgefordert einen Patiententermin aus dem Meeting-Protokoll von Aufgabe 7 auf und meldete von sich aus einen Widerspruch: Der Termin beginne erst im Oktober, der geplante Dienstag liege davor. Die Erinnerungsleistung war damit belegt — die Datumsrechnung im selben Satz allerdings falsch.
Taugen die Excel-Formeln von Claude Haiku 4.5 für deutsches Excel?
Nicht ohne Nacharbeit. Das Modell lieferte in unserem Test die logisch korrekten Formeln, aber mit englischen Funktionsnamen (IF, SUMPRODUCT, MONTH, TODAY). Im deutschsprachigen Excel heißen diese WENN, SUMMENPRODUKT, MONAT und HEUTE — so kopiert erzeugen die Formeln einen #NAME?-Fehler. Einen Hinweis darauf gab es nicht.
Ist Claude Haiku 4.5 für eine kleine Praxis oder einen Handwerksbetrieb geeignet?
Für die getesteten Alltagsaufgaben — Kommunikation, Textarbeit, Protokolle, Rollenspiel — ja. Der Vorbehalt liegt nicht bei der Sprache, sondern bei allem Zählbaren: Jahreszahlen, Zeitpläne, Formeln und Zahlen im Text sollten vor der Verwendung gegengelesen werden. Bei Gesundheits- oder Personendaten gilt zusätzlich: nicht ungeprüft in einen KI-Chat kopieren.