J'ai fait bosser 3 IA sur le même business : Kimi K3 vs Claude vs GPT

Besoin de parler avec un expert ?

Contactez un expert

J'ai fait bosser 3 IA sur le même business : Kimi K3 vs Claude vs GPT

24 juillet 2026
Temps de lecture : 10 min

Quelle IA crée la meilleure application ? Pour le savoir, j'ai donné le même brief à trois IA (Kimi K3, Claude Fable 5 et GPT-5.6 Sol) et je leur ai demandé de livrer trois choses : une app, le site pour la vendre, et la pub vidéo. Mêmes prompts, même temps, zéro coup de pouce, et un test à l'aveugle pour ne pas me laisser influencer par les logos. Voici le protocole, le classement complet, et un écart de coût qui va de 144 $ à 10 $ pour la même mission. Tout le défi est aussi en vidéo.

Le plus dur, ce n'est pas l'app, c'est la vidéo. Pas un générateur magique : chaque IA doit la monter en code, avec Remotion, à partir de captures d'écran de sa propre app. Des captures qu'elle prend elle-même, dans un vrai navigateur, comme un humain le ferait. Et pour ne pas me laisser influencer par les logos, j'ai caché qui était qui pendant tout le test : Rouge, Bleu, Vert. Les noms tombent à la fin, avec le classement et le coût réel de chacune.

Le protocole du défi

Sans règles, un test comme celui-là ne veut rien dire. Alors voilà le cadre :

  • Même point de départ. Un dossier par IA, avec trois sous-dossiers vides déjà prêts (app, site, vidéo). Et pas dans un chat : dans un terminal, en agent. Elles ont le droit d'écrire des fichiers, de lancer des commandes et d'ouvrir un navigateur.
  • Trois manches chronométrées. Les mêmes prompts pour les trois, collés en même temps. L'app en 20 minutes, le site en 10, la pub vidéo en 15. 45 minutes en tout.
  • Zéro coup de pouce. Une fois un prompt collé, je ne réponds à rien, je ne corrige rien, je ne relance pas jusqu'à la fin de la manche. Celle qui n'a pas fini quand ça sonne, on la juge dans l'état.

Les trois harness, pour la transparence : Claude Fable tournait dans Claude Code, GPT Sol dans Codex, Kimi K3 dans opencode. Toutes avec les mêmes droits et la même antisèche navigateur.

Les six critères de notation

Chaque IA est notée sur dix, sur six critères, soit 60 points au total :

  • Le design. Est-ce que c'est beau, est-ce que ça donne envie.
  • La compréhension du besoin. Est-ce que l'IA a compris à qui elle parle.
  • La qualité du produit. Complet et crédible, pas une coquille vide.
  • Le fonctionnement réel. Les boutons marchent, le parcours va au bout.
  • La vidéo promo. Est-ce qu'elle existe, est-ce qu'elle se lit, est-ce qu'elle vend.
  • L'autonomie. Tout fait toute seule, zéro question, y compris ses propres captures.

À côté, trois infos affichées mais pas notées : le temps réel de chacune, l'abonnement qu'il faut pour refaire ça chez soi, et ce que le run a consommé en tokens. On y revient, parce que c'est là que se cache la vraie surprise.

Le brief : SOS Parents

L'idée que je leur donne est un vrai petit business. Ça s'appelle SOS Parents. Le concept en une phrase : un parent est crevé, en panne d'idées, et l'appli lui propose tout de suite une activité pour son enfant, selon son âge, le temps qu'il a, le lieu et le matériel qu'il a à la maison. Cible : parents d'enfants de 2 à 10 ans. Positionnement : simple, rassurant, chaleureux, jamais culpabilisant. Prix : 4,99 € par mois.

Et je ne demande pas juste une app. Je demande le pack de lancement complet : l'app qu'on utilise, le site qui la vend, la pub qu'on posterait sur les réseaux. Un prompt par manche, écrit comme un vrai brief de prestataire, pas une ligne jetée dans un chat. Facile à comprendre, très dur à livrer en entier. Le test parfait.

Manche 1 : créer l'application (20 minutes)

Trois terminaux côte à côte. Je colle le prompt dans les trois en même temps, chrono lancé. Le brief est précis : un parcours en 4 questions maximum, un moteur qui pioche dans au moins 20 activités crédibles écrites par l'IA, un écran de résultat soigné avec un bouton "une autre idée", un parcours d'abonnement (3 suggestions gratuites puis 4,99 €/mois simulé), et du mobile-first parce que je juge d'abord sur un écran de téléphone.

Ce que je regarde pendant que ça build : laquelle affiche un résultat visuel en premier, laquelle explique ce qu'elle fait, laquelle bosse en silence. Et surtout le moment que j'attends, celui où une IA ouvre le navigateur toute seule pour vérifier son app. C'est ça, un agent.

Voici les trois apps rendues, côte à côte :

Les trois apps SOS Parents générées par les IA du défi : Rouge (Claude Fable 5), Bleu (GPT-5.6 Sol), Vert (Kimi K3)

Envie de les voir cliquer pour de vrai, le parcours en entier ? Je teste les trois apps une par une dans la vidéo en haut.

Manche 2 : le site qui vend (10 minutes)

Deuxième manche, la landing page. Le prompt est exigeant sur un point : le site doit montrer les vraies captures de l'app de la manche 1, pas des images génériques. Un hero clair, les bénéfices côté parent, quelques témoignages crédibles, une section prix, une FAQ courte, un footer propre. Mobile-first, encore.

C'est une belle preuve d'enchaînement : pour réussir cette manche, l'IA doit rouvrir sa propre app, la capturer, et intégrer ces captures dans un site cohérent avec l'identité qu'elle vient d'inventer.

Les trois sites de vente SOS Parents créés par les IA : Rouge (Claude Fable 5), Bleu (GPT-5.6 Sol), Vert (Kimi K3)

Les trois landing pages en entier, avec le scroll, les sections prix et les vraies captures d'app, tu les vois défiler dans la vidéo.

Manche 3 : la pub vidéo (15 minutes)

La plus dure, le piège du test. Une pub verticale de 30 à 45 secondes, montée en code avec Remotion, à partir de captures que l'IA prend elle-même de son app et de sa landing page. Pas de maquette inventée, pas de générateur vidéo magique : du vrai montage programmatique.

Si une IA y arrive, c'est qu'elle sait enchaîner construire, vérifier, capturer, monter. Le sommet agentique de l'épisode, c'est là : l'IA qui ouvre le navigateur, screenshote son propre travail, et assemble le tout dans une timeline. Quarante-cinq minutes de chrono cumulé plus tard, les trois ont rendu quelque chose. Certaines plus que d'autres.

Les trois pubs vidéo SOS Parents montées en code par les IA : Rouge (Claude Fable 5), Bleu (GPT-5.6 Sol), Vert (Kimi K3)

Ce ne sont que des images fixes ici. Les trois pubs tournent en entier, avec le rythme et les animations, dans la vidéo du défi.

Le classement final et le reveal

J'ai testé les neuf livrables à l'aveugle, dans le même ordre pour chaque couleur : première impression sur la landing, parcours complet dans l'app, lecture des activités à voix haute, passage en vue mobile, test du bouton d'abonnement, et la pub vidéo en plein écran. Puis les six notes, à voix haute. Voici le classement final, avec le reveal des modèles :

IACouleurNoteCoût API mesuré
GPT-5.6 SolBleu52 / 6051 $
Claude Fable 5Rouge50 / 60144 $
Kimi K3Vert35 / 6010 $

Les deux premières se tiennent en deux points sur soixante. GPT Sol l'emporte d'un cheveu : c'est elle qui a rendu le pack le plus proche de ce que je pourrais montrer à un client. Claude Fable est juste derrière. Kimi K3 décroche nettement, surtout sur le fonctionnement réel et l'autonomie.

Le vrai twist : le coût

Regarde la dernière colonne. La même mission, lancée en même temps sur les trois, va de 144 $ à 10 $. Et la surprise, c'est que la gagnante n'est pas la plus chère. GPT Sol termine première pour 51 $. La plus chère, c'est Claude Fable, à 144 $, et elle finit deuxième, deux points derrière.

Le détail qui pique : Fable et Sol ont consommé quasiment le même volume de tokens (3,26 millions contre 3,28). L'écart de prix, un facteur trois, ne vient pas de la quantité de travail, il vient du tarif par token (l'API de Claude Fable est facturée plus cher que celle de Sol). Autrement dit, sur ce défi, tu payais 93 $ de plus pour deux points de moins.

Et Kimi ? Tout le défi, les trois livrables, pour 10 $. Quatorze fois moins cher que Fable. Elle finit dernière (35 sur 60) et c'est la plus lente, elle passait de longues minutes à réfléchir avant d'agir. Mais tester une idée complète pour 10 $, ça ne coûte plus rien.

Une nuance d'honnêteté quand même : les tokens de Kimi, Claude et GPT ne se comparent pas au token près (les tokenizers diffèrent), et les prix sont calculés aux tarifs API relevés le jour du test. Regarde toujours les deux colonnes, pas juste la note.

Kimi K3 vs Claude vs GPT : laquelle choisir ?

Le classement qualité et le classement coût ne se superposent pas, donc le bon choix dépend de ce que tu cherches. Pour le meilleur rendu brut, GPT-5.6 Sol, qui gagne ce défi. Pour un rapport qualité-prix redoutable, Claude Fable 5 : deux points de moins pour trois fois moins cher n'aurait pas été un mauvais deal si son tarif API était plus doux. Pour dégrossir en quasi-gratuit, Kimi K3 fait le job pour 10 $, à condition d'accepter plus de lenteur et de reprises. Si ta question porte plutôt sur l'assistant de code au quotidien que sur un one-shot chronométré, j'ai un comparatif dédié : Claude Code vs Cursor vs Copilot.

La leçon : un prototype n'est pas un produit

En 45 minutes de chrono, avec trois briefs écrits comme pour un prestataire, la meilleure de ces IA a sorti une app qu'on peut cliquer, un site qui donne envie, et une pub montée en code avec ses propres captures. Il y a trois ans, ce boulot-là, c'était trois métiers différents et des semaines de travail. Ça, c'est la partie bluffante, et elle est réelle.

Maintenant, la partie que personne ne te montre. Ce que tu as vu, c'est un prototype. Il est beau, il donne le change en démo. Mais entre ce prototype et un produit qu'un vrai client paie tous les mois, il reste tout ce qui ne se voit pas : les paiements qui encaissent vraiment, les comptes, la donnée qui tient, ce qui casse quand mille parents cliquent en même temps. L'IA t'amène jusqu'à la porte. Le vrai boulot est derrière.

Pour dégrossir une idée, tester une intuition, montrer une direction, ces agents sont une arme, et je m'en sers tous les jours pour ça (je détaille comment j'orchestre mes agents IA au quotidien). Pour livrer un produit qui tourne pour de vrai, c'est le point de départ, pas la ligne d'arrivée. C'est exactement le métier qu'on fait chez Noxcod : prendre un prototype prometteur et le transformer en produit qui tient en production.

Questions fréquentes

Quelle est la meilleure IA pour créer une application ?

Sur ce défi à l'aveugle, GPT-5.6 Sol a rendu le pack le plus complet (52/60), juste devant Claude Fable 5 (50/60), Kimi K3 fermant la marche (35/60). Mais "la meilleure" dépend de ton critère : la meilleure qualité brute n'est pas forcément le meilleur rapport qualité-prix.

Combien coûte la création d'une app avec l'IA ?

Pour ce défi (une app, un site et une pub vidéo générés en une matinée), la facture API mesurée va de 10 $ avec Kimi K3 à 144 $ avec Claude Fable 5, GPT Sol se situant à 51 $. Même mission, même volume de travail : l'écart vient surtout du tarif par token de chaque modèle.

Une IA peut-elle créer une application complète toute seule ?

Elle peut créer un prototype bluffant en autonomie : une app cliquable, son site et sa pub, sans intervention. Mais un prototype n'est pas un produit. Les paiements réels, les comptes, la donnée qui tient et la montée en charge restent un vrai travail d'ingénierie derrière la démo.

Le kit du défi (à télécharger)

Tout ce que les trois IA ont généré, je te le donne : les trois applications, les trois sites, les trois pubs vidéo, et même les océans 3D de la manche bonus. Mes trois briefs exacts sont dedans aussi, si tu veux rejouer le défi sur tes propres outils. Tu télécharges, tu double-cliques, tu testes tout chez toi et tu te fais ton avis. C'est gratuit, sur kit-defi-3-ia.noxcod.com.

Dominique Silvestre
Par
Dominique Silvestre

Noxcod

On cadre votre produit avant de le construire

Application métier, SaaS, agent IA ou automatisation : on vous aide à choisir la bonne stack, le bon périmètre et les prochaines étapes.

Stack Périmètre Plan d'action