diff --git a/caddy/Caddyfile b/caddy/Caddyfile index 10af5b1..690020f 100644 --- a/caddy/Caddyfile +++ b/caddy/Caddyfile @@ -5,3 +5,12 @@ llm.lan { reverse_proxy localhost:4010 } + +# Port 4000 war bis 2026-09-07 LiteLLM. Etliche Clients haben ihn hart +# verdrahtet (Agenten-Container, spark-desktop, aeltere Skripte); statt sie +# einzeln zu jagen, zeigt der alte Port jetzt auf den Router. Wer :4000 ruft, +# landet im selben Gateway wie llm.lan -- nur die Modellnamen muessen stimmen. +# Kein TLS: der Port war auch vorher blankes HTTP im LAN. +:4000 { + reverse_proxy localhost:4010 +} diff --git a/config.json b/config.json index e9bf248..6c79846 100644 --- a/config.json +++ b/config.json @@ -35,10 +35,6 @@ "kira-tts": { "base": "http://10.6.42.111:8002/v1", "keyEnv": "KIRA_TTS_KEY" - }, - "litellm": { - "base": "http://127.0.0.1:4000/v1", - "clientKey": true } }, "aliases": { @@ -157,10 +153,7 @@ } }, "_stufen_doku": "Stufen als Index-Schwelle (Artificial-Analysis-Intelligence-Index, 0-100) mit Mindestkontext (Andreas 2026-09-05): low 25/256k, medium 45/256k, high 49/500k, max 53/500k. Die Art \"alternative\" mit Referenzmodell (z.B. anthropic/claude-opus-5:medium) bleibt möglich. Namen versioniert wie bei LiteLLM (2608): 42i/marvin-2609:*.", - "fallback": { - "upstream": "litellm", - "_doku": "Unbekannte Modellnamen (z.B. 42i/marvin-2608:*) gehen unverändert mit dem Client-Key an LiteLLM. Umstellung je Agent = Modellname 2608 -> 2609. Fällt weg, wenn LiteLLM abgeschaltet wird; dann kommen die 2608-Namen als altnamen zurück." - }, + "_fallback_entfernt": "Bis 2026-09-07 gingen unbekannte Modellnamen (die 2608-Reihe) an LiteLLM durch. Mit der Abschaltung von LiteLLM ist der Weg weg: unbekannte Namen sind jetzt ein Fehler statt einer stillen Weiterleitung. Das ist Absicht -- eine Weiterleitung an einen toten Dienst waere ein Timeout ohne Hinweis, und seit Caddy auf :4000 auf den Router zeigt, waere es sogar eine Schleife auf sich selbst.", "_rollen_doku": "Rollen entkoppeln Agenten von Modellnamen: ein Agent ruft role/worker, welches Modell dahintersteht, stellt man HIER um -- aus der Ferne, ohne Container-Deploy. Ziele: 42i/*-Alias, openrouter/[:effort] (1:1) oder alt/[:effort] (guenstigste Alternative). Vorbelegung 2026-09-05 (Elton): Fuehrungsrollen high, Rest medium. Feinjustierung Andreas 2026-09-07: teamleader, lead UND xo auf medium (= leader:junior nach 42i/intern#1252). Der xo kam am selben Tag von Claude Code/Max-Abo auf opencode ueber den Router -- ausdruecklich als Versuch, hochstufen ist eine Zeile hier. Damit steht KEINE Rolle mehr auf high: architect folgte am selben Tag (Andreas). Alle 21 Rollen liegen auf der guenstigen Stufe; hochgestuft wird einzeln und mit Anlass. role/inka (2026-09-06): Inkas Telefon-Hirn = Luna (Cloud-Optimum: 1,8 s/Zug, Cache greift). Getestet und verworfen: Qwen 3.8 27B via OpenRouter (mit Denken 5,2 s/Zug; ohne Denken 1,4 s, aber kein Cache-Treffer bei AkashML -> 3-4x Kosten) und lokales qwen36:35b auf der B70 (Prefill 7,5 s, Decode 19 s). Alias 42i/inka-qwen bleibt fuer weitere Tests.", "rollen": { "xo": "42i/marvin-2609:medium",