Modelle
Kommerzielle und Open-Weight-Modelle – gleicher Template für beide, um Vergleichbarkeit und einfache Aktualisierung bei Versionwechseln zu gewährleisten. Jede Zeile zeigt das letzte Verifikationsdatum; Modelle entwickeln sich schnell, vertrauen Sie nicht auf veraltete Zeilen.
| Modell | Typ | Veröffentlichung | Kontext | Selbst-hostbar | Stärke | Urteil | Quelle |
|---|---|---|---|---|---|---|---|
| Claude (Anthropic) Anthropic |
kommerziell | 2026 · Generation 5 | 200k | Nein | Vier Ebenen (Haiku 4.5 / Sonnet 5 / Opus 5 / Fable 5) – von günstig und schnell bis hin zu komplexem agentischem Code. Ein gutes Kosten-Qualitäts-Verhältnis auf der Ebene Sonnet. | Der vernünftige Standard, wenn Ihnen die Abhängigkeit von der Cloud egal ist und Sie das beste Qualitäts-Kosten-Verhältnis pro Ebene wollen | Quelle ↗ verified 2026-08-21 |
| ChatGPT/GPT-5.6 + Codex (OpenAI) OpenAI |
kommerziell | 2026 · Familie GPT-5.6 | 128k | Nein | Codex ist kein separates Produkt mehr – es ist ein vereinheitlichtes GPT-5+Codex-Stack. Das aktuelle Code-Modell ist GPT-5.3-Codex, mit einer Max-Variante für langfristige Agentenarbeit und einer günstigeren Mini-Version. | Besonders stark bei langformatigen/agentischen Code-Aufgaben via Codex; ChatGPT Standard für alles andere. | Quelle ↗ verified 2026-08-21 |
| Gemini (Google) Google DeepMind |
kommerziell | 2026 · Familie 3.x | 1000k | Nein | 3.1 Pro und 3 Deep Think für Frontier-Reasoning; 3.5/3.6 Flash für Agenten und Code bei geringeren Kosten; Kontext bis zu 1M Tokens in den Top-Varianten. | Die Option für das größte Kontextfenster, falls Sie enorme Dokumente auf einmal hochladen müssen. | Quelle ↗ verified 2026-08-21 |
| Qwen3.6 (Alibaba) Alibaba (Qwen Team) |
Open-Weight | April 2026 | 262k | yes | Familie mit der aktivsten Release-Frequenz im H1 2026. Die dichte Variante 27B ist der Sweet Spot für echtes Self-Hosting: nativer 262K-Kontext, multimodal, gute Code-Leistung. | Die beste praktische Option für den lokalen Betrieb heute mit 1-2 Consumer-GPUs – das ist, was diese Seite in der Produktion betreibt. | Quelle ↗ verified 2026-08-21 |
| Kimi K3 (Moonshot AI) Moonshot AI |
Open-Weight | Juli 2026 | 1048k | Nein | Das bis heute größte Open-Source-Modell mit hybrider Aufmerksamkeit (Kimi Delta Attention) und immer aktivem Reasoning-Modus. Kontext von ca. 1M Tokens | Offen bedeutet nicht immer selbst-hostbar – dies ist das Beispiel: Die Lizenz ist frei, die erforderliche Hardware nicht. | Quelle ↗ verified 2026-08-21 |
| DeepSeek V4 (DeepSeek) DeepSeek |
Open-Weight | April 2026 (Vorschau) | 1000k | Nein | Architektonischer Reset auf hybride Aufmerksamkeit, die stärkste Effizienzgeschichte der open-weight-Gruppe im Bezug auf Tokens pro Rechenleistung trotz Größe. | Bestes Verhältnis Kapazität/Rechenleistung im open-weight-Batch, aber echtes Self-Hosting nur mit eigener Multi-GPU-Infrastruktur. | Quelle ↗ verified 2026-08-21 |
Hinweise zur lokalen Hosting-Umgebung
Claude (Anthropic)Nur API/Cloud – ohne offene Gewichte.
ChatGPT/GPT-5.6 + Codex (OpenAI)Nur API/Cloud.
Gemini (Google)Nur API/Cloud (der offene Bruder ist Gemma, nicht Gemini).
Qwen3.6 (Alibaba)Die dichte Variante 27B läuft auf 1-2 Consumer-GPUs (Q4) – dieselbe Größe wie Sol, das primäre Modell dieser Website.
Kimi K3 (Moonshot AI)Offene Gewichte, aber 2,8T Parameter sind Datacenter-Skala — passen nicht in Consumer-Hardware, auch wenn es 'open-weight' ist.
DeepSeek V4 (DeepSeek)V4-Flash (die kleine Variante) benötigt immer noch ~172 GB VRAM in Q4 – außerhalb der Reichweite einer einzelnen Consumer-GPU, machbar in einem dedizierten Multi-GPU-Rack.