LiteLLM-Abschaltung: Fallback raus, alter Port 4000 zeigt auf den Router

- config.json: fallback und der litellm-Upstream entfernt. Unbekannte Namen
  sind ab jetzt ein Fehler statt einer stillen Weiterleitung -- mit totem
  LiteLLM waere daraus ein Timeout ohne Hinweis geworden, und mit Caddy auf
  :4000 sogar eine Schleife auf den Router selbst.
- Caddyfile: :4000 -> localhost:4010. Der Port war ueberall hart verdrahtet
  (Container-Images, spark-desktop, aeltere Skripte); ihn umzubiegen ist
  sicherer, als jeden Aufrufer einzeln zu finden.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-09-07 13:06:38 +02:00
co-authored by Claude Opus 5
parent f5eae167f4
commit a95c525a2c
2 changed files with 10 additions and 8 deletions
+9
View File
@@ -5,3 +5,12 @@
llm.lan { llm.lan {
reverse_proxy localhost:4010 reverse_proxy localhost:4010
} }
# Port 4000 war bis 2026-09-07 LiteLLM. Etliche Clients haben ihn hart
# verdrahtet (Agenten-Container, spark-desktop, aeltere Skripte); statt sie
# einzeln zu jagen, zeigt der alte Port jetzt auf den Router. Wer :4000 ruft,
# landet im selben Gateway wie llm.lan -- nur die Modellnamen muessen stimmen.
# Kein TLS: der Port war auch vorher blankes HTTP im LAN.
:4000 {
reverse_proxy localhost:4010
}
+1 -8
View File
@@ -35,10 +35,6 @@
"kira-tts": { "kira-tts": {
"base": "http://10.6.42.111:8002/v1", "base": "http://10.6.42.111:8002/v1",
"keyEnv": "KIRA_TTS_KEY" "keyEnv": "KIRA_TTS_KEY"
},
"litellm": {
"base": "http://127.0.0.1:4000/v1",
"clientKey": true
} }
}, },
"aliases": { "aliases": {
@@ -157,10 +153,7 @@
} }
}, },
"_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.", "_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.",
"fallback": { "_fallback_entfernt": "Bis 2026-09-07 gingen unbekannte Modellnamen (die 2608-Reihe) an LiteLLM durch. Mit der Abschaltung von LiteLLM ist der Weg weg: unbekannte Namen sind jetzt ein Fehler statt einer stillen Weiterleitung. Das ist Absicht -- eine Weiterleitung an einen toten Dienst waere ein Timeout ohne Hinweis, und seit Caddy auf :4000 auf den Router zeigt, waere es sogar eine Schleife auf sich selbst.",
"upstream": "litellm",
"_doku": "Unbekannte Modellnamen (z.B. 42i/marvin-2608:*) gehen unverändert mit dem Client-Key an LiteLLM. Umstellung je Agent = Modellname 2608 -> 2609. Fällt weg, wenn LiteLLM abgeschaltet wird; dann kommen die 2608-Namen als altnamen zurück."
},
"_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/<id>[:effort] (1:1) oder alt/<id>[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.", "_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/<id>[:effort] (1:1) oder alt/<id>[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.",
"rollen": { "rollen": {
"xo": "42i/marvin-2609:medium", "xo": "42i/marvin-2609:medium",