Modell-Auswahl: Welches Modell für welchen Anwendungsfall?
Die noris “LLM as a Service”-Plattform bietet mehrere Modelle unterschiedlicher Größe und Stärke. Die richtige Wahl hängt vom Anwendungsfall ab: Kleine Modelle punkten mit Geschwindigkeit und niedrigen Kosten, große mit Reasoning-Qualität und Kontextlänge. Diese Entscheidungsmatrix hilft beim schnellen Einstieg.
Entscheidungsmatrix
Abschnitt betitelt „Entscheidungsmatrix“| Anwendungsfall | Empfohlenes Modell | Warum |
|---|---|---|
| Einfacher Chat, Klassifikation | Gemma 4 31B | Schnell, kostengünstig, multimodal |
| Komplexes Reasoning, Mathematik | GPT-OSS 120B | Reasoning-Levels, Chain-of-Thought |
| Coding, Repository-Level | Qwen 3.6 27B | SWE-bench 77,2 %, agentic Coding |
| Lange Dokumente (1M+) | GLM 5.2 | 1M Context, IndexShare |
| RAG-Embedding | Harrier OSS 0.6B | Kompakt, schnell, RAG-optimiert |
| RAG-Reranking | BGE Reranker v2 M3 | Multilingual, präzise |
| Multilingual RAG-Reranking | Jina Reranker v2 | 0,3B, hohe Durchsatzraten |
Weitere Faktoren
Abschnitt betitelt „Weitere Faktoren“Neben dem primären Anwendungsfall beeinflussen weitere Kriterien die Auswahl:
- Context Length: Wie viele Tokens müssen in einen Prompt passen? Für lange Dokumente oder komplette Repositories bevorzugen Sie GLM 5.2 mit bis zu 1M Tokens Kontext. Kleinere Modelle reichen oft aus, wenn Sie ohnehin über RAG nur kurze Kandidaten einspeisen.
- Cost: Größere Modelle verbrauchen mehr Tokens pro Anfrage und kosten mehr AI-Punkte. Für Massen-Klassifikationsaufgaben lohnt sich ein kompaktes Modell wie Gemma 4 31B.
- Latency: Große Modelle reagieren langsamer, besonders bei langen Kontexten. Für interaktive Chat-Anwendungen mit hohen Anforderungen an die Antwortzeit wählen Sie eher kleinere Modelle oder aktivieren Streaming.
- Tier: Achten Sie auf LTS-Versionen für Produktivumgebungen. Experimentelle oder kurzzyklische Releases eignen sich für Tests und Evaluationen, sollten aber nicht direkt in geschäftskritische Pipelines integriert werden.
Einen vollständigen Überblick aller verfügbaren Modelle samt Kontextlängen und Status finden Sie in der Modell-Übersicht.
