← Tous les outils

Kimi

Freemium

Kimi de Moonshot AI : un modèle chinois open-weight qui excelle en code, avec un contexte de 262K tokens et une architecture agentique poussée. K2.6, K2.5, K2.7 Code : ma rotation avec DeepSeek et GLM.

Tarifs

Gratuit avec limites. Abonnements : Moderato, Allegro, Allegretto, Vivace. API : K2.6 à $0.66/$3.41 par million tokens

Kimi, c'est un de ces modèles chinois que j'ai découvert sur le tard et qui a fini par s'imposer dans ma rotation.

Développé par Moonshot AI (月之暗面, la face cachée de la lune), une startup de Pékin fondée en 2023 par d'anciens chercheurs de Tsinghua, Kimi est d'abord devenu connu pour son contexte long : 128K tokens dès 2023, puis 2 millions de caractères en 2024. Mais là où le modèle a vraiment attiré mon attention, c'est avec la série K2.

Je l'ai adopté à partir de Kimi K2.5, et honnêtement, il m'a bluffé sur le code. Depuis, il fait partie de mon trio chinois avec DeepSeek et GLM.

L'histoire : de K1.5 aux modèles agentiques

Janvier 2025 : Moonshot sort Kimi K1.5, un raisonneur qui rivalise avec OpenAI o1 sur les benchmarks de maths et de code.

Juillet 2025 : Kimi K2 débarque. Un modèle MoE de 1 trillion de paramètres, 32 milliards d'actifs, open-weight sous licence MIT modifiée. Il cartonne sur SWE-bench et LiveCodeBench. C'est le moment où le monde commence à regarder Kimi sérieusement.

Septembre 2025 : K2 0905 améliore le codage et passe le contexte à 256K tokens. Moonshot lance aussi OK Computer, un mode agent capable de créer des sites web, des slides, et de traiter jusqu'à 1 million de lignes de données en une fois.

Novembre 2025 : Kimi K2 Thinking, le raisonneur de la famille. Pensée step-by-step, appels d'outils sur des centaines de tours, benchmarks de référence sur HLE et BrowseComp.

Janvier 2026 : Kimi K2.5, multimédia (vision + langage). Là où je suis monté à bord. Un modèle qui code en regardant des images, qui raisonne en mode instant et en mode thinking, et qui commence à montrer une vraie capacité agentique.

Avril 2026 : Kimi K2.6, le saut agentique. Une architecture de swarm : des centaines de sous-agents parallèles qui décomposent des tâches complexes et les exécutent de manière autonome. Du code longue durée en Python, Rust, Go. De la génération d'UI/UX complète à partir d'une capture d'écran.

Juin 2026 : Kimi K2.7 Code, un modèle spécialisé codage avec mode thinking activé en permanence. Le meilleur de la série pour le code, avec une consommation de tokens réduite.

Les modèles K2 aujourd'hui

Modèle Date Paramètres Actifs Contexte Prix API (input/output par 1M tokens)
K2 Thinking Nov 2025 1T 32B 262K $0,60 / $2,50
K2.5 Jan 2026 1T 32B 262K $0,375 / $2,025
K2.6 Avr 2026 1T 32B 262K $0,66 / $3,41
K2.7 Code Juin 2026 ~1T 32B 262K $0,719 / $3,49

Tous les modèles K2 partagent la même architecture MoE (Mixture of Experts) avec 32 milliards de paramètres actifs sur 1 trillion totaux. Le contexte est de 262K tokens pour tous depuis K2.5.

Ce que j'en pense

Je vais être honnête : Kimi n'a pas été mon premier choix. Pendant longtemps, DeepSeek était mon chinois de prédilection. Mais K2.5 m'a fait changer d'avis.

Sur le code, K2.5 est excellent. Je l'ai utilisé pour des refactors complexes et de la génération de composants. Il comprend bien le contexte, il produit du code idiomatique, et son raisonnement multi-tours est solide. Sur SWE-bench, les K2 ont toujours été dans le haut du classement des modèles open-weight.

K2.6, c'est une autre bête. L'architecture swarm, avec des centaines d'agents qui bossent en parallèle, c'est impressionnant sur le papier. Dans la pratique, je l'ai trouvé très lent. Peut-être que c'était les serveurs d'inférence à ce moment-là, peut-être que le modèle est intrinsèquement plus lourd. Toujours est-il que j'ai fini par revenir à K2.5 pour mon usage quotidien.

K2.7 Code, je l'ai testé rapidement. Le mode thinking permanent est un plus, et la conso de tokens est effectivement plus basse. Si tu codes uniquement, c'est probablement le meilleur choix dans la gamme aujourd'hui.

Kimi CLI existe. Franchement, rien de spécial. Un client en ligne de commande pour discuter avec le modèle. Ça fait le job, mais ça n'a pas la sophistication de Claude Code ou de Codex. Moonshot mise visiblement plus sur ses agents (OK Computer, le swarm) que sur un CLI.

Les abonnements portent des noms de tempos musicaux : Moderato, Allegro, Allegretto, Vivace. Un clin d'œil qui m'a fait sourire. Les plans donnent accès à K2 Turbo (version accélérée), plus de quota, et des fonctionnalités agentiques étendues.

Kimi dans ma rotation

Kimi, DeepSeek, GLM : c'est mon trio chinois. Je les utilise en alternance selon les tâches.

DeepSeek reste mon daily driver. Mais Kimi K2.5, je le sors pour les gros refactors ou quand j'ai besoin d'un modèle qui raisonne différemment. La diversité des approches, c'est un vrai plus : parfois, un modèle bute sur un problème que l'autre résout en une passe.

Et puis il y a la philosophie open-weight. Moonshot publie ses modèles sous licence MIT modifiée. Tu peux les télécharger, les inspecter, les héberger. Dans un monde où l'IA devient de plus en plus verrouillée par les géants américains, avoir des alternatives chinoises ouvertes, c'est une bonne nouvelle pour tout le monde.

Pour aller plus loin

Vidéos associées

Aucune vidéo ne porte spécifiquement sur Kimi pour l'instant. Mais j'en parle dans ma rotation de modèles chinois sur Twitch.

Formations