Kimi
Kimi

Kimi

Moonshot AI

Große Sprachmodelle (LLMs)

Große Sprachmodelle (LLMs)

Kimi

Kimi

Kimi K3 ist die seltene Modelleinführung, die sowohl Maßstäbe als auch Märkte bewegt hat. Seine Agentenergebnisse sind wirklich überzeugend, aber das 2,8T-Parametersystem ist noch kein einfacher oder vollständig bewährter Unternehmenseinsatz.

CURRENT MODEL SNAPSHOT

Anbieter: Moonshot AI
Aktueller Anker: Kimi K3
Lebenszyklus: Aktuell
Gewichte: Offene Gewichte für den 27. Juli 2026 angekündigt
Bewertet: 20. Juli 2026

Abstrakter blauer und violetter Farbverlauf

Kimi K3 ist das Modell, das die Märkte bewegte, bevor seine Gewichte veröffentlicht wurden

Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026 als 2,8 Billionen Parameter umfassendes Expertenmischungsmodell mit nativer Vision und einem Kontextfenster von einer Million Token. Pro Token sind nur 16 der 896 Experten aktiv; Kimi Delta Attention und Attention Residuals sind die Architekturideen, die diese Skalierung für lange Aufgaben praktisch machen sollen.

Das Bemerkenswerte daran war nicht nur die technische Spezifikation. Am 17. Juli fiel Z.ai um etwa 28 % und MiniMax um etwa 16 %, da Anleger den Wettbewerbswert chinesischer KI-Entwickler neu bewerteten. Auch US-Technologiewerte gaben nach: Der Nasdaq verlor 1,4 % und der Nvidia 2,2 %. Kimi war ein Katalysator, nicht die alleinige Ursache – Unternehmensgewinne, Ölpreise und geopolitische Risiken wirkten sich ebenfalls auf den Handelstag aus, und Technologieaktien erholten sich am darauffolgenden Montag teilweise.

Die Marktinterpretation war immer noch rational. Wenn ein chinesisches Labor die Leistung eines geschlossenen Modells erreichen, seinen API aggressiv bepreisen und dann seine Gewichte freigeben kann, erscheinen Knappheit und Preissetzungsmacht im gesamten Sektor weniger sicher. Das ist ein wirtschaftliches Signal, kein Maßstab.

Zum Zeitpunkt dieser Überprüfung am 20. Juli 2026 ist die Veröffentlichung der vollständigen Gewichtungen für den 27. Juli geplant und noch nicht verfügbar. K3 sollte daher beschrieben werden als eine angekündigte Open-Weight-Veröffentlichung, kein offenes Modell, das bereits eingesetzt werden kann.

Was die Tests tatsächlich sagen

Die unabhängigen Ergebnisse rechtfertigen die Aufmerksamkeit, nicht jedoch die Mythologie. Artificial Analysis erzielte K3 bei 57 auf seinem Intelligence Index. In seinem kommerziellen Aufgabenbereich erreichte K3 a GDPval-AA v2 Elo von 1668– über GPT-5,5 und Claude Opus 4,8 in diesem Test, hinter Claude Fable 5. K3 führte ebenfalls AutomationBench-AA bei 53 % und belegte mit AA-Briefcase den zweiten Platz.

Dies sind aussagekräftige Ergebnisse für KI-Agenten, da sie die Erledigung von Aufgaben testen und nicht nur die Beantwortung von Kurzfragen. Sie legen auch die Kompromisse offen:

  • Artificial Analysis geschätzt ca 0,94 $ pro abgeschlossener Benchmark-Aufgabe. Das liegt nahe an führenden proprietären Modellen, liegt aber deutlich über kostengünstigeren Konkurrenten wie GLM und DeepSeek.

  • K3 wird grob generiert 132 Millionen Ausgabe-Token quer durch die Suite. Eine bessere Aufgabenökonomie bedeutet nicht unbedingt eine präzise Bedienung.

  • Genauigkeit stieg von 33 % bei K2.6 bis 46 % bei K3, während sich die gemessene Halluzinationsrate von verschlechterte 39 % bis 51 %. Leistungsfähigkeit und Zuverlässigkeit entwickelten sich in unterschiedliche Richtungen.

  • Laut Moonshots eigener Einführungsnotiz liegt K3 immer noch darunter Claude Fable 5 und GPT-5.6 Sol gesamt.

Von Anbietern durchgeführte Demonstrationen liefern nützliche Beweise: 24-Stunden-Kernel-Optimierung, eine 48-Stunden-Chip-Design-Aufgabe, ein MiniTriton-Compiler und Forschungsworkflows, die viele Tools umfassen. Behandeln Sie diese als Designbeweise und nicht als neutrale Benchmarks. Ein Käufer sollte die Struktur der Arbeit – nicht die Demonstrationsaufforderung des Anbieters – anhand seines eigenen Repositorys, seiner Dokumente, Tools und Fehlerfälle reproduzieren.

Der Unternehmensfall: beeindruckend, operativ jung

K3 ist ein ernsthafter Kandidat für langfristige Automatisierung, Programmierung im Repository-Maßstab und multimodale Forschung. Sein stärkstes Argument ist der nachhaltige Einsatz von Werkzeugen in grenzüberschreitender Qualität – nicht die Zahl von einer Million Token allein.

Das operative Bild ist weniger ausgereift. Moonshot hat neue Abonnements vorübergehend ausgesetzt, da die Nachfrage die Kapazität überstieg. Das Unternehmen empfiehlt 64 oder mehr Beschleuniger für Selbsthosting, daher wird die zukünftige Open-Weight-Version die Kontrolle verbessern, ohne die Bereitstellung einfach oder kostengünstig zu machen. Der Preis für gehostete API beträgt 3 US-Dollar pro Million nicht zwischengespeicherter Eingabe-Tokens und 15 US-Dollar pro Million Ausgabe-Tokens, wobei zwischengespeicherte Eingaben 0,30 US-Dollar kosten.

Wie wir es bewerten würden

Führen Sie einen vollständigen Geschäftsprozess mit widersprüchlichen Beweisen, Tool-Timeouts, einem absichtlich schlechten Zwischenergebnis, erwarteter Enthaltung und einem harten Ausgabeschema aus. Verfolgen Sie abgeschlossene Ergebnisse, nicht unterstützte Ansprüche, Prüferkorrekturen, Wiederherstellungsrate, Endlatenz und Gesamttokens. Vergleichen Sie es sowohl mit einem geschlossenen Spitzenmodell als auch mit einem günstigeren Kandidaten mit offenem Gewicht.

Beweise verwendet

Beam AI Supportstatus

In Evaluierung. Dies ist eine Referenz zur Modellauswahl und keine Bestätigung einer Beam-Integration, eines Benchmark-Ergebnisses, einer regionalen Verfügbarkeit oder einer Produktionsempfehlung. Validieren Sie die genaue K3-Oberfläche und -Version im vorgesehenen Workflow, bevor Sie eine Kundenverpflichtung eingehen.

Use case 1

Engineering-Agent auf Repository-Ebene

Geben Sie K3 eine echte, begrenzte Änderung, die eine Repository-Suche, Implementierung, Tests, Dokumentation und Wiederherstellung nach einem fehlgeschlagenen Tool-Aufruf erfordert. Messen Sie akzeptierte Patches, Regressionen, Sicherheitsprobleme, Prüferkorrekturen, Ausgabetokens und prüfen Sie, ob der langfristige Horizont einen zerlegten Workflow übertrifft.

Use case 2

Benchmark für Langzeitoperationen

Testen Sie einen mehrstündigen Back-Office-Workflow mit Browser- oder API-Tools, Prüfpunkten, Wiederaufnahmebarkeit und menschlicher Genehmigung. AutomationBench macht dies zu einer vielversprechenden Hypothese; Nur Ihre Abschlussquote, die Wiederherstellung nach Fehlern und die Kosten pro akzeptiertem Fall können dies bestätigen.

Use case 3

Multimodale Beweisraumanalyse

Verwenden Sie Dokumente, Tabellen, Screenshots und Bilder, um eine quellenbezogene Problemkarte zu erstellen. Fügen Sie Widersprüche und irrelevantes Material ein und bewerten Sie dann Zitatunterstützung, fehlende Beweise, nicht unterstützte Schlussfolgerungen, Datenminimierung und Gutachterzeit.

Use case 4

Offene Einsatzstudie

Vergleichen Sie nach dem Versand der Gewichte den gehosteten Endpunkt mit einem genehmigten selbstverwalteten Build. Berücksichtigen Sie Artefaktherkunft, Quantisierung, 64+-Beschleunigerkapazität, Durchsatz, Sicherheitsschicht, Überwachung, Patching, Gesamtkosten und Betriebspersonal – nicht nur die Modellqualität.

Andere LLMs

Hier ist eine Liste von LLMs, die mit Beam verwendet werden können

Heute starten

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

Heute starten

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

Heute starten

Build AI agents with the right model

See how Beam can orchestrate governed AI workflows across the model family that fits your requirements.

Häufig gestellte Fragen

Häufig gestellte Fragen

Model selection, deployment, governance, and Beam support questions answered.

Hat Kimi K3 den Ausverkauf der KI-Aktie im Juli 2026 verursacht?

Es war ein wichtiger Katalysator, insbesondere für direkt exponierte chinesische KI-Entwickler: Z.ai fiel am 17. Juli um etwa 28 % und MiniMax um etwa 16 %. Der allgemeine Ausverkauf in den USA spiegelte auch Gewinn-, Öl- und geopolitische Risiken wider, und Technologieaktien erholten sich am darauffolgenden Montag teilweise. Die nützliche Schlussfolgerung ist, dass K3 die Annahmen der Anleger über die Knappheit und Preisgestaltung des Frontier-Modells in Frage stellte – nicht, dass ein Handelstag bewiesen hätte, dass es sich um das beste Modell der Welt handelte.

Wie stark ist Kimi K3 in unabhängigen Benchmarks?

Artificial Analysis erzielte K3 mit 57 auf seinem Intelligence Index, 1668 Elo auf GDPval-AA v2 und 53 % auf AutomationBench-AA, wo es zum Zeitpunkt der Überprüfung führte. Die gleiche Auswertung ergab ein hohes Ausgabevolumen und eine Halluzinationsrate von 51 %, sodass die Seite die Benchmark-Story als stark, aber nicht uneingeschränkt betrachtet.

Ist Kimi K3 heute offenes Gewicht?

Zum Zeitpunkt dieser Überprüfung am 20. Juli 2026 noch nicht. Moonshot kündigte an, dass die vollständigen Gewichte am 27. Juli veröffentlicht würden. Bis die Artefakte versandt werden und überprüft werden können, sollte K3 als gehostetes Modell mit einer angekündigten Open-Weight-Veröffentlichung beschrieben werden.

Kann ein Unternehmen Kimi K3 wirtschaftlich selbst hosten?

Möglicherweise, aber nicht zufällig. Moonshot empfiehlt mindestens 64 Beschleuniger, wobei Kapazitätsplanung, Inferenztechnik, Sicherheitskontrollen, Beobachtbarkeit, Patching und Bereitschaftsverantwortung im Mittelpunkt der Entscheidung stehen. Offene Gewichtungen reduzieren die Anbieterabhängigkeit; Sie beseitigen keine Infrastrukturkosten.

Unterstützt Beam Kimi K3 in der Produktion?

Die Unterstützung für Beam wird derzeit evaluiert. Diesem CMS-Eintrag ist keine genehmigte Produktionsintegration oder Beam-Benchmark beigefügt. Validieren Sie den Endpunkt oder die zukünftige Gewichtsfreigabe, die Region, die Datenkontrollen, die Tools, das Fehlerverhalten und das Betriebsmodell, bevor Sie eine Kundenverpflichtung eingehen.