KI-Antworten sind nicht deterministisch. Dieselbe Frage liefert nicht immer dieselbe Liste, und die Quellen wechseln von Tag zu Tag. Studien zeigen, dass Einzelmessungen stark schwanken. Wir gehen damit auf drei Arten um: Wir stellen viele Fragen statt weniger, damit einzelne Ausreißer weniger Gewicht haben. Wir bewerten den Trend über Monate, nicht den Unterschied zwischen zwei Wochen. Und wo es auf eine genaue Zahl ankommt, messen wir dieselbe Liste mehrfach und mitteln.
Kleine Stichproben sind Rauschen. Drei Fragen auf einem System sagen nichts. Erst ab etwa 60 bis 80 Messungen pro Durchlauf werden die Quoten aussagekräftig, und selbst dann ist ein Sprung von 8 auf 11 Prozent noch kein Beweis. Ein Kunde erfährt das vorher, nicht erst, wenn die Zahl mal schlechter ausfällt.
Und die Systeme ändern sich. Ein Modellwechsel bei einem Anbieter kann die Antworten über Nacht verschieben, ohne dass am Betrieb etwas anders geworden ist. Deshalb steht bei jeder Messung das Modell dabei, und deshalb versprechen wir keine Platzierung. Was wir versprechen: sauberes Handwerk an den Stellschrauben, die die KI nachweislich liest, und eine ehrliche Zahl dazu.