Paulo Vila AI Tier 0: 96.2% | Eingespart: 148,50 USD

Modelle

Kommerzielle und Open-Weight-Modelle – gleicher Template für beide, um Vergleichbarkeit und einfache Aktualisierung bei Versionwechseln zu gewährleisten. Jede Zeile zeigt das letzte Verifikationsdatum; Modelle entwickeln sich schnell, vertrauen Sie nicht auf veraltete Zeilen.

ModellTypVeröffentlichungKontextSelbst-hostbarStärkeUrteilQuelle
Claude (Anthropic)
Anthropic
kommerziell 2026 · Generation 5 200k Nein Vier Ebenen (Haiku 4.5 / Sonnet 5 / Opus 5 / Fable 5) – von günstig und schnell bis hin zu komplexem agentischem Code. Ein gutes Kosten-Qualitäts-Verhältnis auf der Ebene Sonnet. Der vernünftige Standard, wenn Ihnen die Abhängigkeit von der Cloud egal ist und Sie das beste Qualitäts-Kosten-Verhältnis pro Ebene wollen Quelle ↗
verified 2026-08-21
ChatGPT/GPT-5.6 + Codex (OpenAI)
OpenAI
kommerziell 2026 · Familie GPT-5.6 128k Nein Codex ist kein separates Produkt mehr – es ist ein vereinheitlichtes GPT-5+Codex-Stack. Das aktuelle Code-Modell ist GPT-5.3-Codex, mit einer Max-Variante für langfristige Agentenarbeit und einer günstigeren Mini-Version. Besonders stark bei langformatigen/agentischen Code-Aufgaben via Codex; ChatGPT Standard für alles andere. Quelle ↗
verified 2026-08-21
Gemini (Google)
Google DeepMind
kommerziell 2026 · Familie 3.x 1000k Nein 3.1 Pro und 3 Deep Think für Frontier-Reasoning; 3.5/3.6 Flash für Agenten und Code bei geringeren Kosten; Kontext bis zu 1M Tokens in den Top-Varianten. Die Option für das größte Kontextfenster, falls Sie enorme Dokumente auf einmal hochladen müssen. Quelle ↗
verified 2026-08-21
Qwen3.6 (Alibaba)
Alibaba (Qwen Team)
Open-Weight April 2026 262k yes Familie mit der aktivsten Release-Frequenz im H1 2026. Die dichte Variante 27B ist der Sweet Spot für echtes Self-Hosting: nativer 262K-Kontext, multimodal, gute Code-Leistung. Die beste praktische Option für den lokalen Betrieb heute mit 1-2 Consumer-GPUs – das ist, was diese Seite in der Produktion betreibt. Quelle ↗
verified 2026-08-21
Kimi K3 (Moonshot AI)
Moonshot AI
Open-Weight Juli 2026 1048k Nein Das bis heute größte Open-Source-Modell mit hybrider Aufmerksamkeit (Kimi Delta Attention) und immer aktivem Reasoning-Modus. Kontext von ca. 1M Tokens Offen bedeutet nicht immer selbst-hostbar – dies ist das Beispiel: Die Lizenz ist frei, die erforderliche Hardware nicht. Quelle ↗
verified 2026-08-21
DeepSeek V4 (DeepSeek)
DeepSeek
Open-Weight April 2026 (Vorschau) 1000k Nein Architektonischer Reset auf hybride Aufmerksamkeit, die stärkste Effizienzgeschichte der open-weight-Gruppe im Bezug auf Tokens pro Rechenleistung trotz Größe. Bestes Verhältnis Kapazität/Rechenleistung im open-weight-Batch, aber echtes Self-Hosting nur mit eigener Multi-GPU-Infrastruktur. Quelle ↗
verified 2026-08-21

Hinweise zur lokalen Hosting-Umgebung

Claude (Anthropic)Nur API/Cloud – ohne offene Gewichte.
ChatGPT/GPT-5.6 + Codex (OpenAI)Nur API/Cloud.
Gemini (Google)Nur API/Cloud (der offene Bruder ist Gemma, nicht Gemini).
Qwen3.6 (Alibaba)Die dichte Variante 27B läuft auf 1-2 Consumer-GPUs (Q4) – dieselbe Größe wie Sol, das primäre Modell dieser Website.
Kimi K3 (Moonshot AI)Offene Gewichte, aber 2,8T Parameter sind Datacenter-Skala — passen nicht in Consumer-Hardware, auch wenn es 'open-weight' ist.
DeepSeek V4 (DeepSeek)V4-Flash (die kleine Variante) benötigt immer noch ~172 GB VRAM in Q4 – außerhalb der Reichweite einer einzelnen Consumer-GPU, machbar in einem dedizierten Multi-GPU-Rack.