llmrouter: Alias-Art schwelle (Index + Mindestkontext), Stufen 25/40/47/50
billigsterUeberSchwelle in openrouter-auswahl, gemeinsamer klasseFiltern mit dem Referenzmodus. Stufen jetzt als Schwelle: low 25/256k, medium 40/256k, high 47/500k, max 50/500k (Andreas 2026-09-05). Co-Authored-By: Claude Fable 5.1 <noreply@anthropic.com>
This commit is contained in:
@@ -22,6 +22,10 @@ Zwei Arten:
|
||||
Die Effort-Stufe des Ziels wird als `reasoning.effort` gesetzt; ein vom
|
||||
Client mitgeschicktes `reasoning_effort` wird verworfen, die Klasse gehört
|
||||
zum Alias.
|
||||
- **`schwelle`** — Index-Schwelle (0–100) plus Mindestkontext, ohne Referenzmodell:
|
||||
das günstigste Modell, das beides erfüllt, mit der niedrigsten ausreichenden
|
||||
Effort-Stufe. Stand 2026-09-05: low 25/256k, medium 40/256k, high 47/500k,
|
||||
max 50/500k. Stabiler als eine Referenz, sagt aber weniger über die Bedeutung.
|
||||
- **`fest`** — Upstream und Modell stehen fest (lokales Qwen, TTS/STT,
|
||||
Embeddings, kira auf deizo). Optional ein `body`-Patch, etwa
|
||||
`chat_template_kwargs.enable_thinking` für die Qwen-Stufen.
|
||||
|
||||
Reference in New Issue
Block a user