Qwen 3.8 MaxAlibabaQwen 3.8 Max ist das neueste Flaggschiff von Alibaba und Nachfolger von Qwen 3.7 Max. Es ist ein Sparse-Mixture-of-Experts-Modell (MoE) mit 2,4 Billionen Parametern, von denen 95 Mrd. pro Token-Inferenz aktiviert werden. Neu gegenüber dem Vorgänger ist native visuelle Verarbeitung (Text, Bild, Video, Dokumente) im Billionen-Parameter-Bereich sowie der Post-Training-Fokus auf langen, Coding-Aufgaben als KI-Agent. Alibaba stuft Qwen 3.8 Max selbstebewusst hinter Anthropics Fable 5 auf Platz zwei ein. Wir gehen aber von einem subjektiven Empfinden aus, dass Modelle wie GPT-5.6 Sol (max) noch einmal intelligenter sein werden, als Qwen 3.8. Die Open Weights von Qwen 3.8 max hat Alibaba für die Woche nach Veröffentlichung des Modells angekündigt.Parameter2.400 Mrd.VeröffentlichungAugust 2026TrainingUnbekanntLizenzProprietärMultimodalWeb SearchFinetuning
DeepSeek V4 FlashDeepSeek AIDeepSeek V4 Flash 0731 ist eine neue Version von DeepSeek V4-Flash, die die Preview-Version aus April 2026 ablöst. Laut Entwickler blieben Architektur und Größe unverändert (Mixture-of-Experts mit 284 Mrd. Parametern, davon ~13 Mrd. aktiv pro Token), über erneutes Post-Training, wurde allerdings ein riesiger Sprung in Benchmark-Scores, v.a. für Agentic- und Coding-Tasks erreicht. Das Modell lässt sich also in guter Geschwindigkeit bereits auf zwei NVIDIA Spark DGX ausführen, einem Setup, das man sich theoretisch Zuhause gut einrichten könnte. In Terminal-Bench 2.1 erreicht das Modell 82,7 % und liegt damit über GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der große Sprung ließ viele Leute aus der AI Community spekulieren, dass es sich um "Benchmark-Maxxing" handeln könnte, also das gezielte Training auf Aufgaben aus den Benchmarks. Bislang konnte sich das aber noch nicht bestätigen. Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token und einem Kontextfenster von 1 Mio. Token positioniert sich das Modell als günstige API-Alternative zum großen Bruder, DeepSeek-V4 Pro. Damit unterbietet das Modell sogar das vergleichbare GPT-5.6 Luna (max), dessen Preis OpenAI einen Tag vor Veröffentlichung von V4-Flash noch um 80% reduziert hatte.Parameter284 Mrd.VeröffentlichungJuli 2026TrainingUnbekanntLizenzMITWeb SearchFinetuning
Inkling SmallThinking Machines LabInkling-Small ist die kleine Variante des ersten Open-Weights-Modells von Thinking Machines Lab (dem Startup von Mira Murati). Es ist ein Mixture-of-Experts-Modell mit 276 Mrd. Parametern insgesamt, von denen 12 Mrd. Parametern während der Token-Inferenz aktiviert werden. Das Modell wurde per Distillation aus dem größeren Inkling (975B/41B aktiv) trainiert. Trotz der kleinen Größe zieht Inkling-small in einigen Benchmarks mit dem großen Inkling-Modell gleich oder überholt es sogar (z.B. 82,2 % in IFBench (Inkling: 79,8 %) oder 80,2 % in SWEBench-Verified (Inkling: 77,6 %)). Wie die große Inkling Version auch, bringt es natives Reasoning über Text, Bild und Audio, ein Kontextfenster von bis zu 1 Mio. Token und anpassbare Thinking-Effort-Stufen mit. Thinking Machines positioniert die Familie ausdrücklich nicht als stärkstes Modell am Markt, sondern als offene Basis zum Fine-Tuning über die hauseigene Plattform Tinker.Parameter276 Mrd.VeröffentlichungJuli 2026TrainingUnbekanntLizenzApache 2.0MultimodalFinetuning