llmrouter: Alias-Art schwelle (Index + Mindestkontext), Stufen 25/40/47/50

billigsterUeberSchwelle in openrouter-auswahl, gemeinsamer klasseFiltern
mit dem Referenzmodus. Stufen jetzt als Schwelle: low 25/256k, medium
40/256k, high 47/500k, max 50/500k (Andreas 2026-09-05).

Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
This commit is contained in:
2026-09-05 07:27:34 +02:00
co-authored by Claude Fable 5.1
parent d8cc9b5dbb
commit 3b9ad85825
4 changed files with 36 additions and 18 deletions
+4
View File
@@ -22,6 +22,10 @@ Zwei Arten:
Die Effort-Stufe des Ziels wird als `reasoning.effort` gesetzt; ein vom
Client mitgeschicktes `reasoning_effort` wird verworfen, die Klasse gehört
zum Alias.
- **`schwelle`** — Index-Schwelle (0100) plus Mindestkontext, ohne Referenzmodell:
das günstigste Modell, das beides erfüllt, mit der niedrigsten ausreichenden
Effort-Stufe. Stand 2026-09-05: low 25/256k, medium 40/256k, high 47/500k,
max 50/500k. Stabiler als eine Referenz, sagt aber weniger über die Bedeutung.
- **`fest`** — Upstream und Modell stehen fest (lokales Qwen, TTS/STT,
Embeddings, kira auf deizo). Optional ein `body`-Patch, etwa
`chat_template_kwargs.enable_thinking` für die Qwen-Stufen.