Welches KI-Modell von Sally passt zu deinen Meetings?
Sally transkribiert mit fünf KI-Modellen. Jedes ist für eine andere Aufgabe gebaut. Zwei schreiben jedes „ähm" mit, weil der genaue Wortlaut zählt. Eines ist das Modell für den Alltag, ohne Füllwörter und auf deutschsprachige Meetings abgestimmt. Zwei sind für die schweren Aufnahmen gemacht, bei denen viele durcheinander sprechen und der Ton alles andere als sauber ist.
Diese Seite stellt sie nebeneinander, damit du erkennst, welches zu der Art passt, wie in deinem Team aufgenommen wird. Welche davon du wählen kannst, hängt von deinem Tarif ab. Wo du das Modell einstellst, steht unter Transkriptionsmodell.
Sallys KI-Modelle werden niemals mit Kundendaten trainiert. Audioaufnahmen, Transkripte und Zusammenfassungen aus Kundensystemen werden nicht für das Training genutzt und sind für uns als Anbieter nicht zugänglich.
Schnellnavigation
- Die fünf Modelle auf einen Blick
- Die Modelle im Einzelnen
- Was in deinem Tarif steckt
- Welches Modell du wählen solltest
- Wie die Modelle trainiert werden
1. Die fünf Modelle auf einen Blick
| Modell | Füllwörter & Lautäußerungen | Sprecher-Trennung | Genauigkeit | Tempo |
|---|---|---|---|---|
| Jade v1 | Ja | Stark | Sehr hoch | Standard |
| Jade v2 | Ja | Sehr stark | Sehr hoch | Standard |
| Opal v1 | Nein | Gut | Hoch | Standard |
| Topaz v1 | Nein | Stark | Hoch | Schnell |
| Topaz v2 | Nein | Sehr stark | Sehr hoch | Schnell |
Alle fünf werden vollständig auf der Sally-Plattform verarbeitet. Kein Teil einer Aufnahme geht also zur Transkription an Dritte.
Neben den fünf Modellen gibt es Automatisch, markiert als Empfohlen. Damit startet ein neues Konto. Sally schaut sich dann jede Aufnahme an und nimmt das passende Modell, damit du dich nicht jedes Mal neu entscheiden musst.
2. Die Modelle im Einzelnen
2.1. Jade v1
Unser detailliertestes Modell, das dem gesprochenen Wort am nächsten bleibt.
- Transkribiert wortwörtlich: Füllwörter wie „äh" und „ähm" sowie nonverbale Hinweise wie „(lacht)"
- Bewertung: Genauigkeit sehr hoch, Sprecher-Trennung stark, Tempo Standard
- Erste Wahl bei: Forschungsinterviews, Beratungsgesprächen und allem, was später wortgetreu belegt werden soll
Das ist der Zweck und keine Nebenwirkung. In einem qualitativen Interview oder einem sensiblen Gespräch ist ein Zögern eine Information. Jade v1 hält sie fest.
2.2. Jade v2
Die nächste Generation von Jade v1, gebaut für Runden mit vielen Stimmen.
- Transkribiert wortwörtlich: wie Jade v1, Füllwörter und nonverbale Hinweise inklusive
- Bewertung: Genauigkeit sehr hoch, Sprecher-Trennung sehr stark, Tempo Standard
- Erste Wahl bei: Fokusgruppen, Beiräten und Gruppendiskussionen
Der Fortschritt liegt bei der Sprecher-Trennung. Bei einem wortgetreuen Mitschnitt ist das die Stelle, an der es zählt: jeder Satz bleibt bei der Person, die ihn gesagt hat, auch wenn mehrere durcheinander sprechen. Danach kannst du direkt zitieren, statt die Aufnahme noch einmal durchzuhören.
2.3. Opal v1
Das Allround-Modell für den Alltag, abgestimmt auf Deutsch.
- Transkribiert bereinigt: ohne Füllwörter und nonverbale Laute, damit sich das Transkript flüssig liest
- Bewertung: Genauigkeit hoch, Sprecher-Trennung gut, Tempo Standard
- Erste Wahl bei: deutschsprachigen Meetings und dem täglichen Betrieb
Laufen deine Meetings auf Deutsch und legst du Wert darauf, wie sich das Deutsche liest, ist das das richtige. Sallys eigene Kurzfassung dazu: „Auf deutschsprachige Online-Meetings optimiert (DACH), beste deutsche Ausgabe".
2.4. Topaz v1
Die bewährte Generation der Topaz-Reihe, breit aufgestellt und schnell.
- Transkribiert bereinigt: ohne Füllwörter und nonverbale Laute
- Bewertung: Genauigkeit hoch, Sprecher-Trennung stark, Tempo schnell
- Erste Wahl bei: internationalen Runden und Gesprächen, die mitten im Satz die Sprache wechseln
Seine besondere Stärke ist die Breite: Topaz v1 hält über viele Sprachen und Audio-Bedingungen hinweg stand. Topaz v2 baut darauf mit der neuesten Engine-Version auf.
2.5. Topaz v2
Unser präzisestes Modell für die schweren Fälle.
- Transkribiert bereinigt: ohne Füllwörter und nonverbale Laute, wie Opal v1 und Topaz v1
- Bewertung: Genauigkeit sehr hoch, Sprecher-Trennung sehr stark, Tempo schnell
- Erste Wahl bei: Besprechungen und Workshops mit mehreren Sprechern in unruhigen Räumen
Es bleibt auch bei lauten Aufnahmen mit vielen Teilnehmern robust und hält die Stimmen dabei zuverlässig auseinander. Damit trägt es die höchsten Bewertungen für Genauigkeit und Sprecher-Trennung.
3. Was in deinem Tarif steckt
Nicht jeder Tarif bietet jedes Modell. Die leistungsfähigeren Modelle kommen mit den höheren Tarifen:
| Tarif | Wählbare Modelle |
|---|---|
| Starter | Jade v1, Opal v1, Topaz v1 |
| Pro | Jade v1, Jade v2, Opal v1, Topaz v1 |
| Enterprise | Jade v1, Jade v2, Opal v1, Topaz v1, Topaz v2 |
Jeder Tarif kann also mit Jade v1 wortwörtlich transkribieren, mit Opal v1 ein sauberes deutsches Alltagstranskript erzeugen und mit Topaz v1 auch gemischtsprachige Runden abdecken. Pro bringt Jade v2 dazu, oben auf allem, was Starter schon hat. Topaz v2 bleibt Enterprise vorbehalten.
Automatisch gibt es in jedem Tarif. Sally wählt dabei aus den Modellen, die dein Tarif tatsächlich enthält.
4. Welches Modell du wählen solltest
Die kurze Fassung:
- Du bist unsicher oder deine Meetings unterscheiden sich stark → Automatisch
- Genauer Wortlaut, Tonfall und Zögern zählen → Jade v1
- Wortwörtlich, aber mit mehreren Personen im Raum → Jade v2
- Sauberes, gut lesbares Transkript für Alltagsmeetings, vor allem auf Deutsch → Opal v1
- Deine Aufnahmen umfassen mehrere Sprachen, manchmal innerhalb eines Satzes → Topaz v1
- Viele Sprecher, laute Räume, Ton, den du nicht in der Hand hast → Topaz v2
4.1. Unsere allgemeine Empfehlung
Lass die Vorgabe auf Automatisch und überlass Sally die Entscheidung je Aufnahme. Meetings gleichen sich selten. Das Modell, das zu einem ruhigen Gespräch unter vier Augen passt, passt nicht zu einem Workshop mit acht Personen in einem Raum mit harter Decke.
Ein festes Modell lohnt sich, wenn deine Aufnahmen wirklich eine gemeinsame Eigenschaft haben und du willst, dass genau die jedes Mal bedient wird. Eine Praxis, die Interviews führt, läuft auf Jade v1. Ein deutschsprachiges Vertriebsteam läuft auf Opal v1. Ein Unternehmen mit großen, lauten Besprechungen läuft auf Topaz v2.
4.2. Nur für eine einzelne Aufnahme wählen
Nichts davon legt dich fest. Ein einzelner Termin kann ein anderes Modell nutzen als die Vorgabe des Unternehmenskontos. Ein vorhandenes Transkript lässt sich außerdem mit einem anderen Modell neu schreiben. Beides steht unter Transkriptionsmodell und Transkription optimieren.
5. Wie die Modelle trainiert werden
Der Schutz deiner Daten hat bei Sally oberste Priorität. Wir trainieren unsere KI-Modelle niemals mit Kundendaten.
Weder Audioaufnahmen noch Transkripte oder Zusammenfassungen aus Kundensystemen fließen in das Modelltraining ein. Für uns als Anbieter sind sie technisch nicht zugänglich.
5.1. Keine Nutzung von Kundendaten
Konkret bedeutet das:
- Kundendaten werden nicht gespeichert, analysiert oder wiederverwendet.
- Es findet kein Training, Fine-Tuning oder Prompt-Learning mit Kundendaten statt.
- Inhalte aus Meetings bleiben ausschließlich im Besitz der Kunden.
- Die Verarbeitung erfolgt isoliert, zweckgebunden und gemäß geltender Datenschutz- und Sicherheitsstandards.
5.2. Training mit eigenen, kontrollierten Datensätzen
Unsere KI-Modelle werden ausschließlich mit internen, anonymisierten und rechtssicher erhobenen Datensätzen trainiert, darunter:
- Über 120.000 Stunden eigens erzeugtes und lizenziertes Audiomaterial.
- Mehr als 25 Millionen annotierte Sätze für Transkription, Sprechertrennung und Kontextverständnis.
- Tausende simulierte Meeting-Szenarien mit variierender Audioqualität, Sprecheranzahl und Fachsprache.
- Kontrollierte Datensätze für Akzente, Dialekte und branchenspezifische Terminologie.
Diese Datensätze werden kontinuierlich erweitert, überprüft und qualitätsgesichert, ohne reale Kundengespräche.
5.3. Was das für dich bedeutet
- Maximale Datensicherheit ohne versteckte Zweitverwertung.
- Reproduzierbare und erklärbare Modellqualität.
- Klare Trennung zwischen Produktnutzung und Modelltraining.
- Einsatz auch in sensiblen, regulierten oder vertraulichen Umgebungen.