Router: Namensraum auto/ mit acht Profilen auf drei Achsen (42i/intern#1252)

Der Preisfinder waehlte bisher ueber EINE Zahl. Ein Modell kann generalistisch
gut aussehen und agentisch durchfallen -- gemini-3.8-flash hat Coding 76,3 und
Agentic 41,2 und traegt den Werkzeug-Rundlauf nicht.

- openrouter-auswahl: billigsterUeberSchwelle reicht minCoding/minAgentic an
  klasseFiltern durch (nahm es bereits entgegen, wurde nur nie gefuettert)
- config: art "schwelle" hat jetzt index, coding und agentic, jede optional;
  "fest" kennt ausweich
- resolver: Beschreibung nennt die geforderten Achsen
- server: ein festes Ziel weicht bei Upstream-Ausfall EINMAL auf den
  konfigurierten Alias aus. Ohne das haengt mit dem lokalen Knoten jede
  Titelzeile jedes Agenten, weil auto/mass ueberall als small_model haengt.
- acht Profile, Rollen darauf umgehaengt, 42i/marvin-2609:* bleiben als Namen

Aufgeloest (ohne Last-Probe, alle Ziele laufen bereits ueber bestehende
Aliasse): coding:junior und leader:junior -> glm-5.3-flash, coding:senior ->
grok-4.6:high, leader:senior -> glm-5.3:max (15,66 statt 26 gewichtet -- die
Regel findet etwas Billigeres als die Schaetzung im Ticket), mass:fast -> ling.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-09-07 13:20:10 +02:00
committed by andreas
co-authored by Claude Opus 5
parent a95c525a2c
commit 7fea5c82c4
5 changed files with 137 additions and 32 deletions
+79 -21
View File
@@ -150,32 +150,90 @@
}
},
"_doku": "Test-Hirn fuer Inka (2026-09-06): Qwen 3.8 27B OHNE Denkstufe und mit festen Providern (fp8, Cache-Treffer $0,05/1M, Uptime >99,6 %), damit der Prompt-Cache ueber die Zuege traegt. Erster Qwen-Anruf ohne das: 5,2 s je Zug, 700 Reasoning-Token, Cache in 3 von 8 Zuegen."
},
"auto/mass": {
"art": "fest",
"upstream": "qwen",
"model": "qwen36:35b",
"body": {
"chat_template_kwargs": {
"enable_thinking": true
}
},
"ausweich": "auto/mass:fast",
"_doku": "Massenarbeit ohne Latenzanspruch: Mail-Ingest, Triage, Zusammenfassungen, opencodes small_model. Laeuft auf der eigenen Karte und kostet nichts. Steht der Knoten oder ist die Karte belegt, weicht der Router einmal auf auto/mass:fast aus -- ohne das haengt sonst jede Titelzeile jedes Agenten (42i/intern#1252)."
},
"auto/mass:fast": {
"art": "schwelle",
"index": 25,
"minContext": 256000,
"_doku": "Wie auto/mass, aber wenn es schnell gehen muss: billigstes Cloud-Modell ueber der Mindestschwelle. Andreas 2026-09-06: 'bei masse ist halt: brauchst du es schnell, nimm ling, ist geschwindigkeit nicht wichtig, nimm core'."
},
"auto/allround:junior": {
"art": "schwelle",
"index": 40,
"minContext": 256000,
"_doku": "Standard fuer alles ohne besondere Achse: Text, Service, Assistenz, Doku."
},
"auto/allround:senior": {
"art": "schwelle",
"index": 49,
"minContext": 256000,
"_doku": "Wie allround, aber wenn der generalistische Index zaehlt -- begutachten und entwerfen statt Werkzeugschleife."
},
"auto/coding:junior": {
"art": "schwelle",
"coding": 68,
"agentic": 45,
"minContext": 256000,
"_doku": "Code schreiben und pruefen. Agentic als Untergrenze, weil der Werkzeug-Rundlauf (lesen, patchen, testen, Fehler deuten) sonst nicht traegt."
},
"auto/coding:senior": {
"art": "schwelle",
"coding": 76,
"agentic": 50,
"minContext": 256000,
"_doku": "Schwerere Code-Aufgaben. Ausdruecklich anfordern (/model auto/coding:senior); keine Rolle zeigt von sich aus hierher."
},
"auto/leader:junior": {
"art": "schwelle",
"index": 45,
"agentic": 50,
"minContext": 256000,
"_doku": "Fuehren und koordinieren: lange Schleifen ueber fremde Tickets, Subagenten ansetzen, fremde Fehler erkennen. Latte 50 (Andreas 2026-09-06): tiefer zu gehen laesst nur Schlechteres zu, nichts Billigeres."
},
"auto/leader:senior": {
"art": "schwelle",
"coding": 74,
"agentic": 53,
"minContext": 256000,
"_doku": "Die teure Stufe. Latte 53 statt 55 (Andreas 2026-09-06): damit erfuellt grok-4.6 das Profil, Opus 5 bleibt erreichbar, wird aber nicht mehr automatisch gewaehlt. Stand 2026-09-07 zeigt KEINE Rolle hierher."
}
},
"_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.",
"_fallback_entfernt": "Bis 2026-09-07 gingen unbekannte Modellnamen (die 2608-Reihe) an LiteLLM durch. Mit der Abschaltung von LiteLLM ist der Weg weg: unbekannte Namen sind jetzt ein Fehler statt einer stillen Weiterleitung. Das ist Absicht -- eine Weiterleitung an einen toten Dienst waere ein Timeout ohne Hinweis, und seit Caddy auf :4000 auf den Router zeigt, waere es sogar eine Schleife auf sich selbst.",
"_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/<id>[:effort] (1:1) oder alt/<id>[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.",
"_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Seit 2026-09-07 zeigen die Rollen auf auto/-Profile (42i/intern#1252) statt direkt auf eine Index-Stufe: die Wahl haengt jetzt an der Achse, die zur Aufgabe passt. xo, teamleader und lead auf auto/leader:junior (Andreas 2026-09-07: keine Rolle mehr auf der teuren Stufe); worker, engineer, qa und perf auf auto/coding:junior; alles uebrige auf auto/allround:junior. role/inka bleibt fest auf Luna (Telefon-Hirn, Cache-Verhalten gemessen). Die 42i/marvin-2609:*-Stufen bleiben als eigene Namen bestehen, damit direkte Aufrufe weiter gehen.",
"rollen": {
"xo": "42i/marvin-2609:medium",
"architect": "42i/marvin-2609:medium",
"teamleader": "42i/marvin-2609:medium",
"lead": "42i/marvin-2609:medium",
"worker": "42i/marvin-2609:medium",
"engineer": "42i/marvin-2609:medium",
"po": "42i/marvin-2609:medium",
"speaker": "42i/marvin-2609:medium",
"support": "42i/marvin-2609:medium",
"assistant": "42i/marvin-2609:medium",
"privacy": "42i/marvin-2609:medium",
"service": "42i/marvin-2609:medium",
"ops": "42i/marvin-2609:medium",
"marketing": "42i/marvin-2609:medium",
"qa": "42i/marvin-2609:medium",
"perf": "42i/marvin-2609:medium",
"i18n": "42i/marvin-2609:medium",
"docs": "42i/marvin-2609:medium",
"ar": "42i/marvin-2609:medium",
"archivist": "42i/marvin-2609:medium",
"xo": "auto/leader:junior",
"architect": "auto/allround:junior",
"teamleader": "auto/leader:junior",
"lead": "auto/leader:junior",
"worker": "auto/coding:junior",
"engineer": "auto/coding:junior",
"po": "auto/allround:junior",
"speaker": "auto/allround:junior",
"support": "auto/allround:junior",
"assistant": "auto/allround:junior",
"privacy": "auto/allround:junior",
"service": "auto/allround:junior",
"ops": "auto/allround:junior",
"marketing": "auto/allround:junior",
"qa": "auto/coding:junior",
"perf": "auto/coding:junior",
"i18n": "auto/allround:junior",
"docs": "auto/allround:junior",
"ar": "auto/allround:junior",
"archivist": "auto/allround:junior",
"inka": "openrouter/openai/gpt-5.6-luna"
},
"_namen_doku": "Namensraeume: 42i/* = konfigurierte Aliasse (aliases); deizo/* = Modelle im Prod-RZ deizo (kira, fest); openrouter/<id>[:effort] = 1:1 an OpenRouter, Effort als reasoning.effort; alt/<id>[:effort] = guenstigste Alternative derselben Klasse (Intelligence, Coding, Agentic je >= 95 % der Referenz, Kontext >= 90 %, billiger), aufgeloest bei der ersten Anfrage und im 12h-Takt erneuert, OHNE Last-Probe; role/<name> = Rolle (rollen). Alles andere -> fallback (LiteLLM).",
+4 -2
View File
@@ -61,7 +61,8 @@
"42i/marvin-tts-turbo",
"role/*",
"openrouter/*",
"alt/*"
"alt/*",
"auto/*"
],
"persona-festus": [
"42i/marvin-2609-core:none",
@@ -134,7 +135,8 @@
"deizo/kira-stt",
"deizo/kira-tts",
"role/xo",
"role/*"
"role/*",
"auto/*"
],
"team-copilot": [
"42i/marvin-2609:low",
+7 -2
View File
@@ -13,8 +13,13 @@ import { dirname, resolve } from "path";
export type Upstream = { base: string; keyEnv?: string; maxParallel?: number; /** Client-Token unveraendert weitergeben (Durchreiche an LiteLLM) */ clientKey?: boolean };
export type Alias =
| { art: "alternative"; referenz: string }
| { art: "schwelle"; index: number; minContext: number }
| { art: "fest"; upstream: string; model: string; body?: Record<string, unknown> };
// Schwelle auf bis zu drei Achsen (42i/intern#1252): index = Intelligence,
// coding und agentic je eigene Untergrenze. Fehlt eine, gilt sie nicht.
| { art: "schwelle"; index?: number; coding?: number; agentic?: number; minContext: number }
// ausweich: Alias, auf den bei Upstream-Ausfall gewechselt wird. Nur fuer
// "fest" sinnvoll -- ein festes Ziel hat sonst keinen Rueckfall, und genau
// das trifft das lokale Qwen: steht der Knoten, haengt jede Massenarbeit.
| { art: "fest"; upstream: string; model: string; body?: Record<string, unknown>; ausweich?: string };
export type Config = {
port: number;
logDir: string;
+8 -2
View File
@@ -149,8 +149,14 @@ export async function aufloesen(c: Config, bisher: State, opts?: { dryRun?: bool
const { referenz, auswahl } = await guenstigereAlternative(def.referenz, d.alle, d.key, melden, d.gesperrt, o);
ziel = auswahl === null ? zuordnungAus(referenz, def.referenz, alt?.seit ?? neu.aktualisiert, true) : zuordnungAus(auswahl.candidate, def.referenz, alt?.seit ?? neu.aktualisiert, false);
} else {
const beschreibung = `Index>=${def.index}, Kontext>=${def.minContext}`;
const { auswahl } = await billigsterUeberSchwelle(def.index, def.minContext, d.alle, d.key, melden, d.gesperrt, o);
const teile = [
def.index !== undefined ? `Index>=${def.index}` : null,
def.coding !== undefined ? `Coding>=${def.coding}` : null,
def.agentic !== undefined ? `Agentic>=${def.agentic}` : null,
`Kontext>=${def.minContext}`,
].filter((t): t is string => t !== null);
const beschreibung = teile.join(", ");
const { auswahl } = await billigsterUeberSchwelle(def.index ?? 0, def.minContext, d.alle, d.key, melden, d.gesperrt, { ...o, minCoding: def.coding, minAgentic: def.agentic });
if (auswahl === null) throw new Error(`kein Modell erfuellt ${beschreibung}`);
ziel = zuordnungAus(auswahl.candidate, beschreibung, alt?.seit ?? neu.aktualisiert, false);
}
+39 -5
View File
@@ -73,7 +73,7 @@ async function belegen(name: string, u: Upstream): Promise<() => void> {
}
// --- Aufloesung Name -> Ziel ---------------------------------------------------
type Ziel = { alias: string; upstreamName: string; upstream: Upstream; model: string; effort: Effort | null; body?: Record<string, unknown>; effortSetzen: boolean };
type Ziel = { alias: string; upstreamName: string; upstream: Upstream; model: string; effort: Effort | null; body?: Record<string, unknown>; effortSetzen: boolean; /** Alias, auf den bei Upstream-Ausfall einmal ausgewichen wird (nur "fest", s. config.ts). */ ausweich?: string };
type Fehler = { fehler: string; status: number };
const OR = (): Upstream => config.upstreams.openrouter;
@@ -116,7 +116,7 @@ async function zielBestimmen(angefragtRoh: string, keyName: string, clientEffort
}
const def = config.aliases[name];
if (def !== undefined) {
if (def.art === "fest") return { alias: name, upstreamName: def.upstream, upstream: config.upstreams[def.upstream], model: def.model, effort: null, body: def.body, effortSetzen: false };
if (def.art === "fest") return { alias: name, upstreamName: def.upstream, upstream: config.upstreams[def.upstream], model: def.model, effort: null, body: def.body, effortSetzen: false, ausweich: def.ausweich };
const z = state.zuordnung[name];
if (z === undefined) return { fehler: `${name} ist noch nicht aufgeloest (Zuordnung fehlt) -- spaeter erneut`, status: 503 };
return { alias: name, upstreamName: "openrouter", upstream: OR(), model: z.model, effort: z.effort, effortSetzen: true };
@@ -243,6 +243,7 @@ Bun.serve({
let ziel: Ziel;
const headers = new Headers();
let origJson: Record<string, unknown> | null = null; // fuer den Ausweich: Body muss mit neuem Modellnamen neu gebaut werden
if (JSON_PFADE.has(pfad)) {
let orig: Record<string, unknown>;
try { orig = (await req.json()) as Record<string, unknown>; } catch { return Response.json({ error: { message: "Body ist kein JSON" } }, { status: 400 }); }
@@ -254,6 +255,7 @@ Bun.serve({
ziel = z;
stream = orig.stream === true;
wavGewuenscht = pfad === "/audio/speech" && orig.response_format === "wav";
origJson = orig;
upstreamBody = JSON.stringify(ziel.upstream.clientKey === true ? orig : jsonBody(orig, ziel, pfad));
headers.set("content-type", "application/json");
} else {
@@ -287,14 +289,46 @@ Bun.serve({
try { log.schreiben(eintrag); } catch (e) { sagen(`Log-Fehler: ${(e as Error).message}`); }
};
const freigeben = await belegen(ziel.upstreamName, ziel.upstream);
let freigeben = await belegen(ziel.upstreamName, ziel.upstream);
let antwort: Response;
try {
antwort = await fetch(`${ziel.upstream.base}${pfad}`, { method: "POST", headers, body: upstreamBody, signal: AbortSignal.timeout(600_000) });
} catch (e) {
freigeben();
eintrag.status = 502; eintrag.fehler = (e as Error).message; abschliessen();
return Response.json({ error: { message: `Upstream ${ziel.upstreamName} nicht erreichbar: ${eintrag.fehler}` } }, { status: 502 });
const grund = (e as Error).message;
// Ausweich (42i/intern#1252): ein "festes" Ziel hat keinen Rueckfall --
// steht der lokale LLM-Knoten oder haelt eine fremde Arbeit die Karte,
// bekaeme der Aufrufer gar keine Antwort statt einer langsameren. Genau
// das trifft die Massenarbeit (auto/mass -> lokales Qwen), die ueberall
// als small_model haengt. Deshalb EINMAL auf den konfigurierten Alias
// ausweichen; scheitert auch der, bleibt es beim 502.
const ausweichName = ziel.ausweich;
let gerettet = false;
if (ausweichName !== undefined && origJson !== null) {
const z2 = await zielBestimmen(ausweichName, keyName);
if (!("fehler" in z2)) {
sagen(`Ausweich ${ziel.alias} -> ${ausweichName} (${ziel.upstreamName} nicht erreichbar: ${grund})`);
const h2 = new Headers(headers);
const k2 = upstreamKey(z2.upstream);
if (k2 !== undefined) h2.set("authorization", `Bearer ${k2}`);
if (z2.upstreamName === "openrouter") { h2.set("http-referer", "https://llm.lan"); h2.set("x-title", `llmrouter/${keyName}`); }
const b2 = JSON.stringify(jsonBody(origJson, z2, pfad));
freigeben = await belegen(z2.upstreamName, z2.upstream);
try {
antwort = await fetch(`${z2.upstream.base}${pfad}`, { method: "POST", headers: h2, body: b2, signal: AbortSignal.timeout(600_000) });
eintrag.alias = `${ziel.alias}->${ausweichName}`; eintrag.model = z2.model; eintrag.upstream = z2.upstreamName; eintrag.effort = z2.effort;
ziel = z2;
gerettet = true;
} catch (e2) {
freigeben();
eintrag.fehler = `${grund} / Ausweich: ${(e2 as Error).message}`;
}
}
}
if (!gerettet) {
eintrag.status = 502; eintrag.fehler = eintrag.fehler ?? grund; abschliessen();
return Response.json({ error: { message: `Upstream ${ziel.upstreamName} nicht erreichbar: ${eintrag.fehler}` } }, { status: 502 });
}
}
eintrag.status = antwort.status;
const ct = antwort.headers.get("content-type") ?? "";