minOutput je Profil senkbar, neue Rolle coder
Das 64K-Output-Gate war global und trieb auto/mass:fast auf solar-pro4 (0,42 statt 0,27 $/1M), weil ling-3.0-flash mit 32768 Output-Token durchfiel. Gemessen 09.09.: 1.415 Masse-Requests, 1.146 davon unter 100 Completion-Token — das Gate verfehlte dort seinen Zweck. Jetzt kann je Schwelle-Profil minOutput gesetzt werden (Default 65536); auto/mass:fast laeuft mit 32768, max_output unbekannt bleibt abgelehnt. Dazu role/coder -> auto/coding:junior (ACL fuer persona-spark), damit Code-Arbeit nicht ueber role/worker in die Masse faellt; der engineer-Agent der Mac-opencode.json wechselt auf role/coder. Refs #1283
This commit is contained in:
+17
-3
@@ -59,7 +59,7 @@ ohne Deploy, ohne Container anzufassen (42i/intern#1252).
|
||||
| Profil | Regel | trifft am 2026-09-07 | $/1M gew. |
|
||||
|---|---|---|---|
|
||||
| `auto/mass` | fest: lokales Qwen, Ausweich auf `mass:fast` | qwen36:35b | 0 |
|
||||
| `auto/mass:fast` | Index ≥ 25 | ling-3.0-flash | 0,27 |
|
||||
| `auto/mass:fast` | Index ≥ 25, Output ≥ 32768 (je Profil senkbar, sonst 65536) | ling-3.0-flash | 0,27 |
|
||||
| `auto/allround:junior` | Index ≥ 40 | glm-5.3-flash | 0,95 |
|
||||
| `auto/allround:senior` | Index ≥ 49 | grok-4.6:high | 26,00 |
|
||||
| `auto/coding:junior` | Coding ≥ 68, Agentic ≥ 45 | glm-5.3-flash | 0,95 |
|
||||
@@ -72,10 +72,13 @@ Agentic **41,2** — es schreibt guten Text und trägt den Werkzeug-Rundlauf nic
|
||||
Ein einzelner Index sieht diesen Unterschied strukturell nicht.
|
||||
|
||||
**Rollenbelegung:** `xo`, `teamleader`, `lead` → `auto/leader:junior`;
|
||||
`worker`, `engineer`, `qa`, `perf` → `auto/coding:junior`; alle übrigen →
|
||||
`worker` → `auto/mass:fast`; `coder`, `engineer`, `qa`, `perf` →
|
||||
`auto/coding:junior`; alle übrigen →
|
||||
`auto/allround:junior`; `inka` fest auf `openrouter/openai/gpt-5.6-luna`.
|
||||
**Keine Rolle steht auf einer Senior-Stufe** (Andreas, 2026-09-07) — hochgestuft
|
||||
wird einzeln und mit Anlass, nicht vorsorglich.
|
||||
wird einzeln und mit Anlass, nicht vorsorglich. `role/coder` existiert seit
|
||||
2026-09-09 neben `engineer`, damit Code-Arbeit nicht über `role/worker` (Masse)
|
||||
läuft.
|
||||
|
||||
**Der Ausweich** gilt für Ziele ohne eigenen Rückfall — festes Ziel wie
|
||||
`auto/mass` (lokales Qwen) oder Schwelle auf einem Ausfall-Modell wie
|
||||
@@ -283,6 +286,17 @@ starten — LiteLLM bedient die `2608`-Namen weiter, die `2609`-, `alt/`- und
|
||||
|
||||
## Verlauf
|
||||
|
||||
- 2026-09-09: **Output-Gate je Profil senkbar, neue Rolle `coder`.** Das
|
||||
64K-Output-Gate (MIN_OUTPUT) trieb `auto/mass:fast` auf `solar-pro4`
|
||||
(0,42 $/1M), weil ling mit 32768 Output-Token durchfiel — gemessen 09.09.:
|
||||
1.415 Masse-Requests, 1.146 davon unter 100 Completion-Token; das Gate
|
||||
verfehlte dort seinen Zweck und kostete ~35 % Aufschlag. Jetzt ist
|
||||
`minOutput` pro Profil in `config.json` setzbar (Default bleibt 65536),
|
||||
`auto/mass:fast` läuft mit 32768. Dazu `role/coder` →
|
||||
`auto/coding:junior` neben `engineer`, ACL für `persona-spark`, der
|
||||
engineer-Agent in der Mac-opencode.json von `role/worker` auf
|
||||
`role/coder` umgezogen.
|
||||
|
||||
- 2026-09-09: **Umstieg aufs Image vollzogen.** Prod läuft als OCI-Container
|
||||
(`llmrouter_llmrouter_1`, podman-compose hinter der Unit `llmrouter`, Bild
|
||||
`:latest` von Run #7/e144034). Laufzeitdaten wanderten nach
|
||||
|
||||
Reference in New Issue
Block a user