LiteLLM-Abschaltung: Fallback raus, alter Port 4000 zeigt auf den Router
- config.json: fallback und der litellm-Upstream entfernt. Unbekannte Namen sind ab jetzt ein Fehler statt einer stillen Weiterleitung -- mit totem LiteLLM waere daraus ein Timeout ohne Hinweis geworden, und mit Caddy auf :4000 sogar eine Schleife auf den Router selbst. - Caddyfile: :4000 -> localhost:4010. Der Port war ueberall hart verdrahtet (Container-Images, spark-desktop, aeltere Skripte); ihn umzubiegen ist sicherer, als jeden Aufrufer einzeln zu finden. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
@@ -5,3 +5,12 @@
|
|||||||
llm.lan {
|
llm.lan {
|
||||||
reverse_proxy localhost:4010
|
reverse_proxy localhost:4010
|
||||||
}
|
}
|
||||||
|
|
||||||
|
# Port 4000 war bis 2026-09-07 LiteLLM. Etliche Clients haben ihn hart
|
||||||
|
# verdrahtet (Agenten-Container, spark-desktop, aeltere Skripte); statt sie
|
||||||
|
# einzeln zu jagen, zeigt der alte Port jetzt auf den Router. Wer :4000 ruft,
|
||||||
|
# landet im selben Gateway wie llm.lan -- nur die Modellnamen muessen stimmen.
|
||||||
|
# Kein TLS: der Port war auch vorher blankes HTTP im LAN.
|
||||||
|
:4000 {
|
||||||
|
reverse_proxy localhost:4010
|
||||||
|
}
|
||||||
|
|||||||
+1
-8
@@ -35,10 +35,6 @@
|
|||||||
"kira-tts": {
|
"kira-tts": {
|
||||||
"base": "http://10.6.42.111:8002/v1",
|
"base": "http://10.6.42.111:8002/v1",
|
||||||
"keyEnv": "KIRA_TTS_KEY"
|
"keyEnv": "KIRA_TTS_KEY"
|
||||||
},
|
|
||||||
"litellm": {
|
|
||||||
"base": "http://127.0.0.1:4000/v1",
|
|
||||||
"clientKey": true
|
|
||||||
}
|
}
|
||||||
},
|
},
|
||||||
"aliases": {
|
"aliases": {
|
||||||
@@ -157,10 +153,7 @@
|
|||||||
}
|
}
|
||||||
},
|
},
|
||||||
"_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.",
|
"_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.",
|
||||||
"fallback": {
|
"_fallback_entfernt": "Bis 2026-09-07 gingen unbekannte Modellnamen (die 2608-Reihe) an LiteLLM durch. Mit der Abschaltung von LiteLLM ist der Weg weg: unbekannte Namen sind jetzt ein Fehler statt einer stillen Weiterleitung. Das ist Absicht -- eine Weiterleitung an einen toten Dienst waere ein Timeout ohne Hinweis, und seit Caddy auf :4000 auf den Router zeigt, waere es sogar eine Schleife auf sich selbst.",
|
||||||
"upstream": "litellm",
|
|
||||||
"_doku": "Unbekannte Modellnamen (z.B. 42i/marvin-2608:*) gehen unverändert mit dem Client-Key an LiteLLM. Umstellung je Agent = Modellname 2608 -> 2609. Fällt weg, wenn LiteLLM abgeschaltet wird; dann kommen die 2608-Namen als altnamen zurück."
|
|
||||||
},
|
|
||||||
"_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/<id>[:effort] (1:1) oder alt/<id>[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.",
|
"_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/<id>[:effort] (1:1) oder alt/<id>[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.",
|
||||||
"rollen": {
|
"rollen": {
|
||||||
"xo": "42i/marvin-2609:medium",
|
"xo": "42i/marvin-2609:medium",
|
||||||
|
|||||||
Reference in New Issue
Block a user