Kimi
Kimi de Moonshot AI : un modèle chinois open-weight qui excelle en code, avec un contexte de 262K tokens et une architecture agentique poussée. K2.6, K2.5, K2.7 Code : ma rotation avec DeepSeek et GLM.
Tarifs
Gratuit avec limites. Abonnements : Moderato, Allegro, Allegretto, Vivace. API : K2.6 à $0.66/$3.41 par million tokens
Kimi, c'est un de ces modèles chinois que j'ai découvert sur le tard et qui a fini par s'imposer dans ma rotation.
Développé par Moonshot AI (月之暗面, la face cachée de la lune), une startup de Pékin fondée en 2023 par d'anciens chercheurs de Tsinghua, Kimi est d'abord devenu connu pour son contexte long : 128K tokens dès 2023, puis 2 millions de caractères en 2024. Mais là où le modèle a vraiment attiré mon attention, c'est avec la série K2.
Je l'ai adopté à partir de Kimi K2.5, et honnêtement, il m'a bluffé sur le code. Depuis, il fait partie de mon trio chinois avec DeepSeek et GLM.
L'histoire : de K1.5 aux modèles agentiques
Janvier 2025 : Moonshot sort Kimi K1.5, un raisonneur qui rivalise avec OpenAI o1 sur les benchmarks de maths et de code.
Juillet 2025 : Kimi K2 débarque. Un modèle MoE de 1 trillion de paramètres, 32 milliards d'actifs, open-weight sous licence MIT modifiée. Il cartonne sur SWE-bench et LiveCodeBench. C'est le moment où le monde commence à regarder Kimi sérieusement.
Septembre 2025 : K2 0905 améliore le codage et passe le contexte à 256K tokens. Moonshot lance aussi OK Computer, un mode agent capable de créer des sites web, des slides, et de traiter jusqu'à 1 million de lignes de données en une fois.
Novembre 2025 : Kimi K2 Thinking, le raisonneur de la famille. Pensée step-by-step, appels d'outils sur des centaines de tours, benchmarks de référence sur HLE et BrowseComp.
Janvier 2026 : Kimi K2.5, multimédia (vision + langage). Là où je suis monté à bord. Un modèle qui code en regardant des images, qui raisonne en mode instant et en mode thinking, et qui commence à montrer une vraie capacité agentique.
Avril 2026 : Kimi K2.6, le saut agentique. Une architecture de swarm : des centaines de sous-agents parallèles qui décomposent des tâches complexes et les exécutent de manière autonome. Du code longue durée en Python, Rust, Go. De la génération d'UI/UX complète à partir d'une capture d'écran.
Juin 2026 : Kimi K2.7 Code, un modèle spécialisé codage avec mode thinking activé en permanence. Le meilleur de la série pour le code, avec une consommation de tokens réduite.
Les modèles K2 aujourd'hui
| Modèle | Date | Paramètres | Actifs | Contexte | Prix API (input/output par 1M tokens) |
|---|---|---|---|---|---|
| K2 Thinking | Nov 2025 | 1T | 32B | 262K | $0,60 / $2,50 |
| K2.5 | Jan 2026 | 1T | 32B | 262K | $0,375 / $2,025 |
| K2.6 | Avr 2026 | 1T | 32B | 262K | $0,66 / $3,41 |
| K2.7 Code | Juin 2026 | ~1T | 32B | 262K | $0,719 / $3,49 |
Tous les modèles K2 partagent la même architecture MoE (Mixture of Experts) avec 32 milliards de paramètres actifs sur 1 trillion totaux. Le contexte est de 262K tokens pour tous depuis K2.5.
Ce que j'en pense
Je vais être honnête : Kimi n'a pas été mon premier choix. Pendant longtemps, DeepSeek était mon chinois de prédilection. Mais K2.5 m'a fait changer d'avis.
Sur le code, K2.5 est excellent. Je l'ai utilisé pour des refactors complexes et de la génération de composants. Il comprend bien le contexte, il produit du code idiomatique, et son raisonnement multi-tours est solide. Sur SWE-bench, les K2 ont toujours été dans le haut du classement des modèles open-weight.
K2.6, c'est une autre bête. L'architecture swarm, avec des centaines d'agents qui bossent en parallèle, c'est impressionnant sur le papier. Dans la pratique, je l'ai trouvé très lent. Peut-être que c'était les serveurs d'inférence à ce moment-là, peut-être que le modèle est intrinsèquement plus lourd. Toujours est-il que j'ai fini par revenir à K2.5 pour mon usage quotidien.
K2.7 Code, je l'ai testé rapidement. Le mode thinking permanent est un plus, et la conso de tokens est effectivement plus basse. Si tu codes uniquement, c'est probablement le meilleur choix dans la gamme aujourd'hui.
Kimi CLI existe. Franchement, rien de spécial. Un client en ligne de commande pour discuter avec le modèle. Ça fait le job, mais ça n'a pas la sophistication de Claude Code ou de Codex. Moonshot mise visiblement plus sur ses agents (OK Computer, le swarm) que sur un CLI.
Les abonnements portent des noms de tempos musicaux : Moderato, Allegro, Allegretto, Vivace. Un clin d'œil qui m'a fait sourire. Les plans donnent accès à K2 Turbo (version accélérée), plus de quota, et des fonctionnalités agentiques étendues.
Kimi dans ma rotation
Kimi, DeepSeek, GLM : c'est mon trio chinois. Je les utilise en alternance selon les tâches.
DeepSeek reste mon daily driver. Mais Kimi K2.5, je le sors pour les gros refactors ou quand j'ai besoin d'un modèle qui raisonne différemment. La diversité des approches, c'est un vrai plus : parfois, un modèle bute sur un problème que l'autre résout en une passe.
Et puis il y a la philosophie open-weight. Moonshot publie ses modèles sous licence MIT modifiée. Tu peux les télécharger, les inspecter, les héberger. Dans un monde où l'IA devient de plus en plus verrouillée par les géants américains, avoir des alternatives chinoises ouvertes, c'est une bonne nouvelle pour tout le monde.
Pour aller plus loin
Vidéos associées
Aucune vidéo ne porte spécifiquement sur Kimi pour l'instant. Mais j'en parle dans ma rotation de modèles chinois sur Twitch.
Formations
- Prenez en main les IA génératives : la formation Contournement pour maîtriser les bases des IA génératives, animée par Alexis. Le point de départ si tu veux comprendre comment utiliser Kimi et les autres LLMs.
- Développez des apps avec l'IA : la formation idéale pour apprendre le vibe coding de A à Z.