Tarifs Kimi K3 expliqués : forfaits et coûts API

8 min de lecture2026-07-25
Tarifs Kimi K3

Kimi K3 est le premier modèle open de classe 3T au monde, un modèle phare de 2,8T de paramètres conçu pour une intelligence de pointe dans le codage à long terme, le travail intellectuel et le raisonnement, avec une vision native et une fenêtre de contexte de 1 million de tokens. Il est disponible sur Kimi.com, Kimi Work, Kimi Code et la Kimi API. Voici un aperçu des forfaits d'abonnement Kimi et de la tarification de l'API Kimi K3 pour vous aider à choisir la meilleure façon d'y accéder.

Forfaits d'abonnement et niveaux d'utilisation de Kimi K3

La façon la plus simple d'utiliser Kimi K3 est de souscrire un abonnement Kimi. Kimi propose des forfaits à plusieurs niveaux qui s'adaptent à vos besoins, d'un usage quotidien occasionnel à des workflows agentiques intensifs. Les niveaux supérieurs débloquent plus de crédits d'agent, une concurrence plus élevée, et une capacité de chat extra-long allant jusqu'à 1 million de tokens grâce à Kimi K3.

AdagioModeratoAllegrettoAllegroVivace
Facturation annuelle (équivalent mensuel)0 $ / mois15 $ / mois31 $ / mois79 $ / mois159 $ / mois
Tâches simultanées de l'agent1 tâche2 tâches2 tâches4 tâches4 tâches
File d'attente prioritaire de l'agent×Vitesse ×4Vitesse ×4Vitesse ×4Vitesse ×4
Capacité de discussion très étendue K3 (jusqu'à 1 M de tokens)×××
Tableau de bord personnalisable
Tâches planifiées2 tâches10 tâches15 tâches20 tâches25 tâches
Tâche par widget2 tâches10 tâches15 tâches20 tâches25 tâches
Plugins15+ types pris en charge15+ types pris en charge15+ types pris en charge15+ types pris en charge15+ types pris en charge
Swarm×
Sous-tâches exécutées par le swarm×2 sous-agents4 sous-agents8 sous-agents8 sous-agents
Mémoire de rêve×
Compétence auto-évolutive×
Objectif××
Kimi Claw (Web, Android, PC)××
Chat de groupe avec Claw××10 chats de groupe10 chats de groupe10 chats de groupe
Déployer un site web avec une base de données×

Tous les prix ci-dessus reflètent une facturation annuelle. Une facturation mensuelle est également disponible à 19 $, 39 $, 99 $ et 199 $ par mois respectivement. Allegro et Vivace débloquent la capacité de chat extra-long de K3, prenant en charge jusqu'à 1 million de tokens de contexte pour des conversations très longues, de grandes bases de code et des recherches riches en documents. Pour les derniers détails des forfaits, consultez la page officielle d'abonnement.

Tarification de l'API Kimi K3

La tarification de l'API Kimi K3 utilise un modèle basé sur les tokens, avec une facturation par tranche de 1 million de tokens (1 000 000 tokens) pour le traitement en entrée comme en sortie, offrant un contrôle des coûts clair et prévisible.

ModèleUnitéPrix d'entrée (cache trouvé)Prix d'entrée (cache non trouvé)Prix de sortieFenêtre de contexte
kimi-k31 M de tokens$0.30$3.00$15.001 048 576 tokens

Kimi K3 est le modèle phare de Kimi pour le codage à long terme et le travail intellectuel de bout en bout. Il raisonne toujours, avec un effort de raisonnement défini via le champ de premier niveau reasoning_effort. Le modèle prend en charge la mise en cache automatique du contexte, les appels d'outils, le mode JSON, les sorties structurées et une fenêtre de contexte complète de 1 million de tokens en une seule requête.

Comment fonctionne la facturation de l'API Kimi K3

L'API Kimi K3 utilise un modèle de tarification basé sur les tokens pour chaque requête, où chaque interaction avec le modèle consomme des tokens facturés selon leur type. Dans ce modèle, les tokens se répartissent généralement en trois catégories : les tokens d'entrée, les tokens d'entrée mis en cache et les tokens de sortie.

Tokens d'entrée

Les tokens d'entrée représentent tout ce qui est envoyé au modèle, notamment :

  • Les prompts utilisateur

  • Les instructions système

  • L'historique ou le contexte de la conversation Ces tokens déterminent la quantité de contexte que le modèle doit traiter avant de générer une réponse. Avec une fenêtre de contexte de 1 million de tokens, Kimi K3 peut prendre en compte des bases de code entières, de longs documents et des historiques multi-tours étendus en une seule requête.

Tokens d'entrée mis en cache

Les tokens d'entrée mis en cache surviennent lorsqu'un contexte déjà traité est réutilisé.

  • Si le même contexte ou un contexte similaire est réutilisé, il est facturé à 0,30 $ par million de tokens au lieu de 3,00 $, soit une réduction de 90 %

  • Cela améliore considérablement l'efficacité pour les workflows répétitifs

  • C'est particulièrement utile pour les applications à contexte long et les interactions multi-tours, où un contexte partagé important est envoyé à répétition

Tokens de sortie

Les tokens de sortie sont générés par le modèle en réponse à une requête. Ils représentent le contenu réellement généré par l'IA, comme :

  • Les réponses textuelles

  • La génération de code

  • Les sorties structurées Comme la génération de sortie nécessite un calcul supplémentaire, elle est généralement facturée plus cher que les tokens d'entrée.

Conclusion

Kimi K3 offre une tarification flexible aussi bien pour les utilisateurs du quotidien que pour les développeurs : des forfaits d'abonnement pour l'expérience Kimi complète, et une API basée sur les tokens avec mise en cache automatique du contexte qui réduit les coûts d'entrée de 90 %. Choisissez l'option adaptée à votre workflow et commencez dès aujourd'hui avec Kimi K3.

FAQ

Comment est calculé le tarif de l'API Kimi K3 ?
Le tarif de l'API Kimi K3 est calculé en fonction de l'utilisation des tokens, facturée par tranche de 1 M de tokens (1 000 000 tokens). Les tokens d'entrée sont facturés 3,00 $ par 1 M de tokens en cas de cache non trouvé, ou 0,30 $ par 1 M de tokens en cas de cache trouvé. Les tokens de sortie sont facturés 15,00 $ par 1 M de tokens. Tous les prix sont hors taxes applicables, calculées lors du paiement selon votre région de facturation.
Combien puis-je économiser avec la mise en cache du contexte ?
Lorsqu'un contexte déjà traité est réutilisé, les tokens d'entrée mis en cache sont facturés 0,30 $ par 1 M de tokens au lieu de 3,00 $, soit une réduction de 90 % des coûts d'entrée. Cela est particulièrement utile dans les applications à contexte long et les interactions multi-tours où le même contexte est envoyé de manière répétée.
Dois-je utiliser l'API ou un forfait d'abonnement Kimi ?
Utilisez un forfait d'abonnement Kimi si vous souhaitez accéder directement à Kimi K3 depuis l'espace de travail Kimi, avec des capacités d'agent et une capacité de discussion très étendue incluses. Utilisez l'API si vous développez des outils personnalisés, des agents ou des applications de production nécessitant un accès programmatique et un contrôle précis de la consommation de tokens.
Combien de tokens Kimi K3 prend-il en charge par requête ?
Kimi K3 prend en charge une fenêtre de contexte de 1 M de tokens (1 048 576 tokens), ce qui lui permet de traiter des bases de code entières, des documents longs et des tâches agentiques complexes en plusieurs étapes au sein d'une seule requête.
Quels forfaits d'abonnement incluent la capacité de chat extra-long de K3 ?
Les forfaits Allegro et Vivace débloquent la capacité de chat extra-long de K3, prenant en charge des conversations avec un contexte allant jusqu'à 1 million de tokens. Toutes les autres fonctionnalités de l'abonnement, comme les tâches d'agent et Swarm, évoluent selon les niveaux, comme indiqué dans le tableau comparatif des forfaits.
Vous pourriez aussi aimer
Kimi Work Dashboard : tableau de bord et widgets IA personnalisés
Kimi Work Dashboard : tableau de bord et widgets IA personnalisés
2026-07-23
Kimi Code : l'agent de code IA nouvelle génération pour le terminal et l'IDE
Kimi Code : l'agent de code IA nouvelle génération pour le terminal et l'IDE
2026-07-22
Kimi Claw : déploiement OpenClaw Cloud en 1 clic et Agent IA 24/7
Kimi Claw : déploiement OpenClaw Cloud en 1 clic et Agent IA 24/7
2026-07-22
Système multi-agent : définition, avantages et cas d’usage
Système multi-agent : définition, avantages et cas d’usage
2026-07-22
Agents parallèles expliqués : architecture, patterns et cas d'usage
Agents parallèles expliqués : architecture, patterns et cas d'usage
2026-07-22