[ KLASSIFIKATION IM GROSSEN STIL ]
Zehntausend Einträge sortieren, ohne zehntausend Einträge zu lesen.
Sammelpostfächer, Archive und Ticket-Queues werden von Hand sortiert, und die Kategorien driften. Kompakte Embedding-Klassifikatoren labeln Einträge in grossen Mengen, günstig und schnell, und werden an deiner gelabelten Stichprobe gemessen, bevor etwas live geht.
[ 01 — WO ES SCHIEFGEHT ]
Warum Klassifikationsprojekte enttäuschen.
Das Modell ist selten das Problem. Die Kategorien und der Massstab sind es.
- [ 01 ]Labeln zwei Personen dieselbe Mail unterschiedlich, kann kein Modell richtig liegen. Das Label-Schema muss zuerst auf dem Papier geklärt werden.
- [ 02 ]
Ein grosses Modell für alles
Bei 500 Einträgen funktioniert das, bei 50'000 wird es langsam und teuer. Das Volumen ändert das richtige Werkzeug. - [ 03 ]
Eine Zahl ohne Massstab
Ein Anbieter sagt, 95 Prozent genau. Auf wessen Daten, und pro Kategorie? Nur eine zurückgehaltene Stichprobe deiner Fachleute beantwortet das. - [ 04 ]
Raten bei unsicheren Fällen
Ein Klassifikator, der bei jedem Eintrag eine Antwort erzwingt, schleust falsche Labels still in deinen Prozess. Unsichere Einträge brauchen einen Weg zu einer Person.
[ 02 — DAS BEKOMMST DU ]
Ein Klassifikator, den du testen kannst.
Grosse Sprachmodelle können klassifizieren, aber bei Volumen sind sie langsam und teuer. Kompakte Modelle erledigen die Masse, ein grosses Modell oder eine Person den unsicheren Rest.
- [ 01 ]
Label-Schema
Ein klarer Satz von Kategorien mit Definitionen und Grenzfällen, abgestimmt mit den Menschen, die das Ergebnis nutzen. - [ 02 ]
Gelabelte Baseline
Eine von deinen Fachleuten gelabelte Stichprobe. Sie ist der Massstab für jede Version des Klassifikators. - [ 03 ]
Kompakter Klassifikator
Ein Embedding-basiertes Modell, etwa ein JEPA-artiges Modell, quelloffen und lokal betrieben, oder über die API eines Anbieters, je nachdem, was zu deinen Datenregeln passt. - [ 04 ]
Konfidenz und Routing
Jeder Eintrag bekommt einen Score. Einträge mit tiefer Konfidenz gehen an eine Person oder ein grösseres Modell, statt geraten zu werden. - [ 05 ]
Gemessene Genauigkeit
Precision und Recall pro Kategorie auf zurückgehaltenen Daten, und jeden Monat eine Prüfung an frischen Stichproben.
[ 03 — SO NEHMEN WIR DAS RISIKO RAUS ]
Wie niivo das Risiko rausnimmt.
Du siehst die Genauigkeit, bevor du dich auf einen Rollout festlegst.
- [ 01 ]
Eine Schwelle, die du setzt
Wir gehen nur live, wenn die Genauigkeit pro Kategorie das von dir definierte Niveau erreicht. Eine Zahl versprechen wir vorab nicht. - [ 02 ]
Lokal, wenn es sein muss
Quelloffene Embedding-Modelle laufen auf deinen eigenen Servern, der Inhalt bleibt also bei dir. Eine API kommt nur zum Einsatz, wo deine Datenregeln es erlauben. - [ 03 ]
Eine Review-Queue von Anfang an
Einträge mit tiefer Konfidenz gehen an eine Person, und ihre Korrekturen fliessen in die nächste Version. Die Fehlerquote sinkt sichtbar. - [ 04 ]
Monatliche Nachprüfung
Kategorien ändern sich, Daten driften. Jeden Monat wird eine frische Stichprobe geprüft, und Versionen und Ergebnisse bleiben zum Vergleich erhalten.
[ 04 — ABLAUF ]
Labeln, trainieren, messen, betreiben.
Die gelabelte Stichprobe entscheidet, was gut genug ist.
- 01
Kategorien definieren
Wir erarbeiten mit deinem Team ein Label-Schema und klären die Grenzfälle auf dem Papier.1 Woche - 02
Baseline aufbauen
Deine Fachleute labeln eine Stichprobe. Wir unterstützen mit Tooling und prüfen die Übereinstimmung zwischen den Labelnden.1 bis 2 Wochen - 03
Trainieren und auswerten
Wir vergleichen Kandidaten auf zurückgehaltenen Daten und weisen die Genauigkeit pro Kategorie aus, auch dort, wo sie versagt.2 Wochen - 04
Betreiben und überwachen
Batch- oder Live-Klassifikation mit Konfidenzschwellen, einer Review-Queue und monatlichen Nachprüfungen.Laufend
[ 05 — ANWENDUNGSFÄLLE ]
Mengen, die passen.
Typische Szenarien. Keines davon beschreibt einen bestimmten Kunden.
Sammelpostfach sortieren
- Heute
- Mitarbeitende lesen jede Mail, um zu entscheiden, welches Team zuständig ist.
- Mit dem Workflow
- Der Klassifikator weist Team und Thema zu. Mails mit tiefer Konfidenz landen in einer Review-Queue.
Dokumentarchiv verschlagworten
- Heute
- Scans und PDFs aus Jahren haben keinen einheitlichen Typ und keine Metadaten.
- Mit dem Workflow
- Ein Batch-Lauf vergibt die Dokumenttypen einmal, und neue Dokumente werden beim Eingang verschlagwortet.
Tickets kategorisieren
- Heute
- Kategorien werden von Hand gewählt und driften mit der Zeit.
- Mit dem Workflow
- Der Klassifikator schlägt eine Kategorie mit Score vor. Agents bestätigen oder korrigieren, und die Korrekturen fliessen in die nächste Version.
[ 06 — UMFANG & PREIS ]
Ein Proof of Concept mit gemessenem Ergebnis.
Manuelles Sortieren kostet bei jedem Eintrag ein wenig, für immer. Vergleiche den Proof of Concept mit deinem aktuellen Volumen mal den Minuten pro Eintrag. Das Ergebnis ist eine Genauigkeitstabelle, der Go-Entscheid wird also Rechnen statt Glauben.
Klassifikation: Proof of Concept · 4 bis 6 Wochen
Die laufenden Kosten hängen von Volumen und Hosting ab und stehen vor dem Rollout fest. Erweiterungen: CHF 2'200 pro Tag.
- Label-Schema und gelabelte Baseline
- Kandidaten-Klassifikatoren auf zurückgehaltenen Daten verglichen
- Genauigkeit pro Kategorie, inklusive Fehlern
- Konfidenzschwellen und Design der Review-Queue
[ 07 — FRAGEN ]
Was Leute über Klassifikation fragen.
Wie genau wird es sein?
Eine Zahl versprechen wir vorab nicht. Wir messen sie an deiner gelabelten Stichprobe und gehen nur live, wenn sie die von dir gesetzte Schwelle erreicht.
Wie viele gelabelte Daten brauchen wir?
Oft reichen für den Start ein paar hundert Beispiele pro Kategorie, bei einfachen Schemata weniger. Nach einem ersten Test sagen wir es dir.
Warum nicht einfach ein grosses Sprachmodell?
Bei kleinen Mengen kannst du das. Bei zehntausenden Einträgen sind kompakte Klassifikatoren schneller und günstiger, und für die unsicheren Fälle können wir trotzdem ein grosses Modell einsetzen.
Geht es, ohne Dokumente an einen externen Anbieter zu schicken?
Ja. Quelloffene Embedding-Modelle laufen auf deinen eigenen Servern, der Inhalt bleibt also bei dir.
Was passiert, wenn sich Kategorien ändern?
Wir aktualisieren das Schema, ergänzen gelabelte Beispiele und werten neu aus. Versionsverlauf und Ergebnisse bleiben erhalten, damit du vergleichen kannst.
Was, wenn etwas Wichtiges falsch gelabelt wird?
Einträge mit tiefer Konfidenz gehen an eine Person, statt geraten zu werden, und für kritische Kategorien kannst du strengere Schwellen setzen. Fehler werden pro Kategorie gemessen, du weisst also, wo das Risiko liegt.
Bring eine Stichprobe mit, die sortiert werden muss.
Wir testen ein kleines Set und zeigen dir die Genauigkeit, bevor du entscheidest.