Unsere Methodik
Die gewichteten Kriterien, der Prüfprozess und die Offenlegungen hinter jedem Urteil auf dieser Seite, dazu ein laufendes Protokoll der Fälle, in denen wir danebenlagen.
Wie bewerten wir ein KI-Tool? Wir setzen es an echter Arbeit aus unserem eigenen Betrieb ein, bewerten es anhand von sechs gewichteten Kriterien, gleichen jede Anbieterangabe mit einer Primärquelle ab und prüfen das Urteil planmäßig erneut. Keine Anbieter-Benchmarks für bare Münze, keine bezahlte Platzierung und kein „kommt darauf an“ ohne die konkreten Details.
Kurz gesagt. Urteile stammen aus praktischen Tests, bewertet anhand von sechs gewichteten Kriterien, gegen Primärquellen geprüft und planmäßig erneut kontrolliert. Wenn wir bei einem danebenliegen, sagen wir es.
Wie wir ein Tool bewerten
Sechs Kriterien, gewichtet. Die Gewichte ergeben zusammen 100 % und sind für jedes Tool einer Kategorie gleich. Wir gewichten nicht um, um einem Favoriten zu schmeicheln.
30 %
20 %
15 %
15 %
10 %
10 %
Wie wir ein Urteil prüfen
Ein Urteil ist eine Behauptung, also trägt es eine Nachweiskette, vom praktischen Test bis zu einer veröffentlichten, erneut prüfbaren Spur.
Schritt 1
Schritt 2
Schritt 3
Schritt 4
Was wir offenlegen
Vertrauen ist nur so viel wert wie das, was wir zugeben. Drei Dinge, die wir schriftlich festhalten.
Wir bauen konkurrierende Produkte
Neomanex baut und verkauft KI-Produkte: ConvOps, Gnosari und andere. Erscheint eines davon im Verzeichnis, wird es als unseres gekennzeichnet, nach denselben sechs Kriterien wie alles andere bewertet und nie über einen Wettbewerber gestellt, der es bei den Zahlen schlägt.
Keine bezahlte Platzierung
Niemand kann einen Eintrag, einen höheren Rang oder ein milderes Urteil kaufen. Es gibt keine von Affiliate-Provisionen getriebenen Rankings und keine gesponserten Einträge im Verzeichnis. Sollte sich das je ändern, wird es zuerst auf dieser Seite offengelegt.
Wo wir Lücken haben
Stand Juli 2026 sind manche Urteile dünner als andere. Enterprise-Funktionen, die hinter einem Vertriebsgespräch verschlossen sind, und Tools, die wir noch nicht in unserem eigenen Betrieb eingesetzt haben, tragen ein vorläufiges Urteil und sagen das im Profil. Lieber kennzeichnen wir eine ungeprüfte Angabe, als sie zu einer selbstsicheren zu schönen.
Wo wir danebenlagen
Ein für dauerhaft erklärtes Urteil ist ein Urteil, das nur darauf wartet, falsch zu sein. Wir halten unsere Fehlgriffe öffentlich fest.
Wir haben RAG für die Analyse langer Dokumente zu oft empfohlen
Monatelang haben wir eine Retrieval-Pipeline (RAG) für die Analyse langer Dokumente empfohlen, ohne Wenn und Aber. Als Claude 4.6 Opus im Mai 2026 ein Kontextfenster von 1 Million Token auslieferte, haben wir unseren Vergleich wiederholt. Unter rund 50 Dokumenten schlug die Analyse in einem einzigen Durchgang das Retrieval sowohl bei der Genauigkeit als auch bei den Einrichtungskosten. Wir hatten den Leuten geraten, eine Chunking-Infrastruktur aufzubauen und zu pflegen, die sie nicht brauchten.
Was wir gelernt haben: Grenze ein Urteil anhand der Variable ab, die es wirklich entscheidet. Wir teilen diese Empfehlung jetzt nach Korpusgröße auf, statt eine einzige Antwort für jeden Fall auszuliefern. Unter rund 50 Dokumenten nimm einen einzigen Durchgang; bei einem lebenden Korpus in großem Umfang behalte RAG.
Die vollständige Urteilsänderung lesenFragen dazu, wie wir arbeiten
Die Dinge, die Leute fragen, bevor sie einem Urteil vertrauen.