Dr. Nagib Moatassime — RPPS 10002078391
115 bd de Lamballe, 45400 Fleury-les-Aubrais
Données sécurisées · Tiers payant 7,50 € · Remboursement CPAM
📌 L’essentiel en un coup d’œil
1. Ce qui est annoncé
Trois types de réponse, des chiffres spectaculaires, tous mesurés par l’entreprise elle-même.
2. Le vrai problème
Pourquoi un agent IA qui rédige seul se trompe dans un cas sur trois.
3. Neuro + symbolique
Laisser l’IA percevoir, confier la décision à des règles écrites.
4. Le test des 200 mails
De 60 % à 97 % de réponses valides : comment, et ce que ce chiffre vaut.
5. Cinq démos à l’épreuve
Courriels, vidéos, SMS : ce qui marche, et les pièges où il hésite.
6. Vrai, faux, exagéré
« Ne hallucine jamais », « 400 fois moins cher » : le tri.
7. Et en médecine ?
Pourquoi ce principe est exactement celui qu’il faut pour un dossier patient.
8. Jev dans un agent
Hermes, DeepSeek Harness : comment le brancher, et ce qui ne se transpose pas.
9. Questions fréquentes
Faut-il l’utiliser ? Peut-on le reproduire ? Et les données ?
📣 Ce qui est annoncé
Un modèle qui ne répond que dans des cases
Jev est le premier modèle de TypeSafe AI, fondée en 2024 à San Francisco par Diogo Almeida — qui revendique d’avoir contribué aux premières versions de ChatGPT chez OpenAI —, Erik Gafni et Sasha Sheng. L’entreprise a levé 40 millions de dollars en amorçage, menés par le fonds DCVC, et présenté son modèle le 15 septembre 2026 en accès anticipé limité. L’annonce a dépassé, selon la vidéo, 38 millions de vues.
L’entreprise le range dans une catégorie qu’elle baptise System One models, en référence au « système 1 » de la psychologie : la pensée rapide, intuitive, qui tranche sans rédiger. On lui donne un contexte et des questions, en langage courant. Il ne répond que de trois façons :
Un choix
Une option parmi une liste que vous avez définie, avec sa probabilité
Un score
Un niveau sur une échelle ordonnée : frustration, urgence, gravité
Une probabilité
Oui ou non, exprimé de 0 à 100 %
Jamais de texte
Il est incapable d’écrire une phrase — c’est voulu
La réponse arrive dans un format que le logiciel lit directement, sans interprétation. Exemple de la vidéo : un courriel de client entre ; en une seconde sortent l’équipe à laquelle l’adresser, un niveau de frustration et une probabilité d’urgence.
| Annonce | Chiffre | Qui l’a mesuré |
|---|---|---|
| Temps de réponse | 70 à 500 millisecondes | TypeSafe |
| Vitesse face aux grands modèles | jusqu’à ~190 fois plus rapide | TypeSafe, sur ses propres tâches |
| Coût face aux grands modèles | jusqu’à ~440 fois moins cher | TypeSafe, sur ses propres tâches |
| Prix | 0,042 $ par million de mots-jetons lus, réponse gratuite | Tarif publié |
| Options par question | jusqu’à 255 | Limite technique publiée |
| Texte d’entrée | jusqu’à 32 000 jetons | Selon la vidéo |
⚠️ À lire avant de s’enthousiasmer
Tous les chiffres de performance viennent de l’entreprise, sur des tâches qu’elle a choisies, dans un format de test qu’elle a elle-même conçu — et elle le reconnaît en évoquant un « biais possible ». Aucune architecture, aucun article scientifique, aucun poids du modèle n’a été publié. L’accès se fait par une API hébergée — directement, ou par des passerelles comme celle de Vercel —, sans aucune option d’installation locale. La vidéo annonce d’ailleurs « 20 à 200 fois plus rapide » là où les sources écrites disent 40 à 200 : les ordres de grandeur circulent avant d’être vérifiés.
🧩 Le vrai problème : un agent qui rédige seul
Trente à quarante pour cent de réponses à retoucher
L’auteur de la vidéo gère un service client. Son premier système confiait tout à un grand modèle de langage : le courriel entrait, le modèle avait accès à des outils — les accès du client, ses factures, le site, les contenus de formation — et rédigeait un brouillon. Malgré des mois d’amélioration des consignes, 30 à 40 % des brouillons devaient être corrigés. Le modèle inventait parfois, appliquait les règles de l’entreprise de façon inégale, glissait des phrases qu’on ne voulait pas voir partir.
Le diagnostic est juste : un grand modèle de langage est une machine à prédire le mot suivant. Il est excellent pour comprendre et pour rédiger, mais rien dans son fonctionnement ne garantit qu’il applique une règle. Quand une entreprise a 110 règles — c’est le cas de l’auteur —, demander au modèle de les lire toutes et de choisir la bonne, c’est accepter, selon lui, au moins 10 % de décisions fantaisistes.
🔎 L’hallucination n’est pas un bug, c’est la nature du procédé
Un modèle de langage ne « sait » pas qu’il se trompe : il produit la suite la plus plausible. Une règle mal appliquée et une règle bien appliquée ont, pour lui, la même forme — une phrase bien construite. C’est pourquoi on ne supprime pas l’erreur en améliorant la consigne : on la supprime en retirant au modèle les décisions qu’il ne doit pas prendre.
🧠 Neuro + symbolique : percevoir d’un côté, décider de l’autre
Une idée plus ancienne que ChatGPT
L’approche dite neurosymbolique sépare deux métiers. La partie neuronale perçoit : elle lit un texte libre, souvent mal écrit, et en comprend le sens. La partie symbolique décide : elle applique des règles écrites, vérifiables, qui donnent toujours le même résultat pour la même entrée. On garde la souplesse de l’IA pour comprendre, et la rigueur du code pour trancher.
C’est là que Jev trouve sa place : il ne remplace pas le grand modèle de langage, il se glisse avant lui. Il fait la perception, de façon rapide et bon marché, et rend des réponses que du code peut lire. Le modèle de langage n’intervient plus qu’à la fin, pour mettre en forme une décision déjà prise.
📬 Le test des 200 mails
Trois appels à Jev, un seul rédacteur, et plus aucun outil
L’auteur a reconstruit son circuit de support client. Le courriel entre ; du code rassemble tout le contexte du client — ses accès, ses paiements, l’historique de ses messages. Ensuite, trois décisions sont confiées à Jev, et une seule rédaction à un grand modèle.
Rejouée sur les 200 derniers courriels, l’ancienne chaîne donnait à peine 60 % de brouillons valides selon les règles de l’auteur ; la nouvelle en donne 97 %. Chaque décision a coûté, selon lui, de l’ordre du centième de centime.
✅ Ce qu’il faut retenir de ce test — plus que le chiffre
- La méthode d’évaluation est la bonne : rejouer un historique réel et compter les réponses acceptables, avant et après.
- Les règles sont écrites par l’entreprise, avec un identifiant, une condition et une action. C’est elles qui portent la fiabilité, pas le modèle.
- Le modèle ne lit jamais les 110 règles : du code n’en garde que les candidates, et Jev ne fait que les classer.
- Un humain relit toujours le brouillon et exécute lui-même les actions.
⚠️ Et ce qu’il vaut
C’est le témoignage d’un seul utilisateur, sur 200 messages, selon ses propres critères de validité. Le gain vient d’ailleurs autant de la réorganisation du circuit — règles écrites, présélection, contrôle final — que du modèle lui-même : la même architecture avec un autre outil de classement aurait probablement donné un résultat voisin.
🧪 Deuxième avis : cinq démos à l’épreuve
Une IA qui répond comme à un QCM
La seconde vidéo propose l’image la plus claire : Jev répond comme à un questionnaire à choix multiples. Demandez de quelle couleur est un site ; un modèle conversationnel regarde, raisonne, puis écrit « il semblerait que le site soit bleu ». Jev reçoit cinq options — noir, bleu, rouge, blanc, aucune — et rend une probabilité très haute pour l’une, très basse pour les autres. Pas de phrase, pas de raisonnement écrit : d’où la vitesse.
Autre enseignement pratique : le modèle n’est plus réservé à une liste d’attente. Quand la console de l’entreprise était saturée, l’auteur l’a utilisé par des intermédiaires — la passerelle d’IA de Vercel, qui l’a ajouté à son catalogue, et, selon lui, OpenRouter.
| Démo | Ce qui a été fait | Résultat annoncé |
|---|---|---|
| 📧 Trier des courriels | Catégorie, priorité, probabilité de pourriel, besoin de réponse ; traitement par lots de 64 | 10 courriels en 2 secondes ; 24 courriels pour 0,002 $ |
| ♟️ Jouer aux dames | Le plateau lui est envoyé en données structurées ; il choisit le meilleur coup | ~300 ms par coup — démonstration visuelle, pas un usage |
| 🎞️ Traquer les fuites | Une vidéo découpée image par image, texte extrait par OCR, puis question : « contenu confidentiel ? » par catégorie (courriel, IBAN, clé, carte) | Une vidéo de 27 minutes analysée en 1 min 30, zones floutées automatiquement |
| 💼 Qualifier des propositions | 100 sollicitations commerciales classées selon des critères écrits : budget, livrable, calendrier | 200 à 300 ms par message |
| 📱 SMS, avis, offres | Arnaque / douteux / légitime ; client ravi / mitigé / furieux | 541 ms pour le lot de SMS, 0,002 $ |
Là où il se plante — la partie la plus utile
L’auteur a posé des pièges : compter des lettres, compter des mots, retrouver un jour de la semaine.
| Question piège | Bonne réponse | Jev |
|---|---|---|
| « anticonstitutionnellement » contient-il 5 fois la lettre n ? | Oui (vérifié : 5) | Oui… à 59 % seulement |
| Cette phrase contient-elle exactement 18 mots ? | Oui, selon l’auteur | Oui à 53 % — autant dire pile ou face |
| Le 10 janvier 2026 est-il un samedi ? | Oui — le 1er janvier 2026 était un jeudi | L’auteur affirme que c’est un jeudi et que Jev « s’est planté » |
🗓️ La leçon cachée du troisième piège
Le 10 janvier 2026 était bien un samedi : c’est le testeur qui s’est trompé, pas nécessairement le modèle. L’anecdote vaut mieux qu’une démonstration : ni l’IA ni la mémoire humaine ne sont faites pour les calculs de dates, de comptage ou d’arithmétique. Ces calculs-là se confient à du code, qui ne se trompe jamais de jour.
✅ La règle pratique qu’en tire l’auteur
Surveiller la probabilité rendue. En dessous de 70 à 75 %, ne pas suivre la réponse : la faire vérifier par un autre modèle, ou par un humain. C’est précisément l’intérêt d’une IA qui donne un chiffre plutôt qu’une phrase assurée : elle dit quand elle hésite. Face à GPT-5.4 mini, Jev est nettement plus rapide et se trompe moins souvent sur les courriels ; face à un modèle de raisonnement plus puissant, il reste beaucoup plus rapide — 7 secondes par courriel d’un côté, quelques centaines de millisecondes de l’autre.
⚠️ Son verdict, et sa limite
Pour trier de gros volumes, quand la vitesse ou le budget comptent, Jev remplace avantageusement un grand modèle ; pour le reste, un abonnement classique suffit. Mais ce sont des tests d’un après-midi, sur des exemples fictifs, sans comptage systématique des erreurs : une démonstration convaincante, pas une évaluation.
🛡️ Surveiller ce qu’un agent a le droit de faire
L’usage le plus intéressant n’est pas le support client
Les assistants qui agissent — écrire un fichier, envoyer un message, modifier une base — demandent une autorisation à chaque action. En pratique, on finit par tout autoriser pour ne pas être dérangé toutes les dix secondes. Et les consignes écrites dans le texte ne sont jamais garanties : le modèle peut les oublier.
L’idée proposée dans la vidéo : placer un contrôle rapide avant chaque action. Une règle dit « tu n’écris dans les notes que sur demande explicite » ; l’agent veut écrire ; le contrôle regarde la conversation, constate que personne ne l’a demandé, refuse l’action et rappelle à l’agent la règle qu’il allait enfreindre.
🤝 Jev dans un agent : Hermes, et DeepSeek Harness
Le cerveau reste un grand modèle ; les décisions passent à Jev
La troisième vidéo pousse l’idée un cran plus loin. Hermes est un agent — un assistant qui enchaîne des tâches et agit, développé en source ouverte par Nous Research. Il continue de réfléchir avec un grand modèle classique, mais chaque fois qu’il doit trancher — classer, choisir, noter —, il fait appel à Jev. « Le cerveau reste le modèle de langage ; l’exécution et la prise de décision passent par Jev. » C’est exactement l’architecture décrite plus haut, installée dans un outil de travail quotidien.
| Ce que montre la vidéo | Chiffre annoncé |
|---|---|
| 24 heures de tests, tout compris | 0,154 $ dépensé |
| Crédit offert à l’ouverture d’un compte | 5 $ (offre du moment, sans garantie de durée) |
| Tri de courriels : prospection, fournisseurs, pourriel | quelques centaines de millisecondes par message, contre ~3 s avec Claude |
| 300 commentaires YouTube analysés | 2 400 décisions, 17 secondes, 0,015 $, 586 ms en moyenne |
| Projection sur un million de commentaires | ~51 $ avec Jev, ~22 000 $ avec un grand modèle |
⚠️ Trois affirmations de la vidéo à corriger
- « Un score de 1, il est sûr à 100 %, il ne peut pas se tromper » — non. Une probabilité de 0,99 dit que le modèle se croit sûr ; qu’elle corresponde à la réalité est justement ce qu’aucun test indépendant n’a encore vérifié.
- « Zéro erreur » sur les 300 commentaires — il s’agit de zéro plantage et zéro relance, pas de zéro mauvais classement : personne n’a vérifié les 2 400 décisions une à une.
- « Jusqu’à 1 000 fois moins cher » — les chiffres publiés par l’entreprise elle-même vont jusqu’à environ 440 fois. Et le livre de Kahneman cité, Thinking, Fast and Slow, date de 2011, pas de 2013.
✅ Le conseil le plus utile de la vidéo
Avant d’installer une « compétence » ou une extension dans un agent, demander à l’agent d’en lire le code et de signaler toute instruction suspecte. Un agent qui a le droit d’agir sur votre ordinateur exécute ce qu’on lui a appris : une extension malveillante devient une porte d’entrée.
Comment on branche Jev sur Hermes
Il existe désormais plusieurs extensions communautaires. Le principe est toujours le même : une clé d’API TypeSafe, rangée dans une variable d’environnement, et une extension qui expose à l’agent des outils de décision.
| Usage | Ce que fait l’extension |
|---|---|
| Outils de décision | L’extension jev-typesafe ajoute quatre outils — évaluer, vérifier (oui / non), aiguiller (un choix), noter (un score) — que l’agent appelle quand il doit trancher |
| Approbation des commandes | Avant qu’Hermes exécute une commande, Jev répond à quelques questions fermées (dangereuse ? conforme à la règle ?) et rend : accepter, refuser ou demander à l’humain |
| Aiguillage des compétences | Jev choisit, parmi les compétences installées, celle qui correspond à la demande — au lieu de laisser le grand modèle hésiter entre toutes |
# Hermes — installation de l'extension communautaire (d'après sa documentation) hermes plugins install jev-typesafe # la clé se range dans la variable d'environnement : TYPESAFE_API_KEY=votre-clé
Extension communautaire, créée le 19 septembre 2026, non officielle. Chaque appel envoie la question et le contexte à l’API de TypeSafe : n’y faites transiter aucune donnée personnelle.
Et avec DeepSeek Harness ?
DeepSeek Harness est l’agent en source ouverte publié par DeepSeek le 13 août 2026, encore en version de développement. Sa devise : « tout est une extension » — le modèle, les outils, les compétences, la mémoire. Les commandes montrées pour Hermes ne s’y appliquent pas telles quelles : ce sont deux logiciels différents. Mais les trois usages se transposent, par trois mécanismes que DeepSeek Harness possède déjà :
| Usage vu avec Hermes | Équivalent dans DeepSeek Harness | État |
|---|---|---|
| Outils de décision Jev | Le client MCP officiel : on y déclare un serveur MCP qui expose Jev — il en existe deux, communautaires. Les outils apparaissent alors sous la forme mcp__jev__… | Faisable |
| Approbation des commandes | Les hooks : un petit programme lancé à l’événement PreToolUse, avant chaque action ; s’il sort avec le code 2, l’action est bloquée. Ce programme peut interroger Jev | À écrire — aucune extension toute faite trouvée |
| Aiguillage des compétences | Les skills (fichiers Markdown) et le hook UserPromptSubmit, qui peut injecter une consigne avant chaque demande | À écrire |
| Jev comme modèle principal | — | Impossible : Jev n’écrit pas, il ne peut pas être le « cerveau » d’un agent |
# DeepSeek Harness — déclarer un serveur MCP dans cordis.yml # (structure de l'exemple officiel ; la commande exacte dépend du serveur Jev MCP choisi) - id: mcp-jev name: '@deepseek-ai/dsh-mcp-client' config: serverName: jev transport: stdio command: <commande du serveur Jev MCP> args: [<ses arguments>] env: TYPESAFE_API_KEY: !!js process.env.TYPESAFE_API_KEY
🧭 En résumé pour DeepSeek Harness
Oui, c’est faisable, et c’est même plus propre qu’avec Hermes sur un point : les hooks y sont un mécanisme officiel pour bloquer une action avant qu’elle ne s’exécute. Mais il n’existe pas encore d’extension « clé en main » : le branchement MCP se fait en quelques lignes de configuration, le garde-fou d’approbation demande un petit programme à écrire. Et DeepSeek Harness étant en version de développement, sa configuration peut changer d’une mise à jour à l’autre : lisez toujours la documentation de la version installée.
🔧 Sous le capot : rien de neuf, et pourtant un progrès
Deux familles de modèles depuis 2018
Les grands modèles conversationnels sont des décodeurs : on les entraîne à deviner le mot suivant d’une phrase dont on cache la fin. C’est ce qui leur apprend la grammaire, le vocabulaire, la logique — et ce qui les rend bavards par nature. L’autre famille, celle des encodeurs, apparue avec BERT en 2018, s’entraîne autrement : on masque des mots au hasard au milieu d’une phrase, et le modèle a le droit de lire ce qui précède et ce qui suit. Il n’apprend pas à écrire ; il apprend à saisir le sens d’un texte entier d’un seul regard. C’est l’outil idéal pour ranger un document dans une catégorie.
Classer un texte avec un encodeur, on sait donc le faire depuis 2018. Ce qui est nouveau, si l’on en croit l’entreprise, tient en quatre points :
- Pas de réentraînement : jusqu’ici, chaque nouveau classement — textes juridiques, fiches comptables — exigeait de réentraîner le modèle avec des exemples. Jev reçoit les questions et les définitions des options directement en langage courant, dans la même requête.
- Un long texte d’entrée, jusqu’à 32 000 jetons selon la vidéo.
- Toutes les questions traitées en parallèle, en une seule lecture : d’où la vitesse et le prix.
- Des probabilités « honnêtes » : un modèle spécialisé répond souvent 0 ou 1 sans nuance. TypeSafe affirme avoir entraîné le sien — par une méthode qu’elle appelle RLCD — à donner des probabilités qui correspondent à la fréquence réelle de ses erreurs. C’est le point le plus utile… et le seul qu’aucun test indépendant n’a encore vérifié.
🧪 Refait en deux heures ?
Dans les jours qui ont suivi, des développeurs ont publié des dizaines de reproductions libres — l’auteur de la vidéo cite une page de recensement qui en comptait 49. L’une des méthodes est d’une simplicité désarmante : faire lire la question à un petit modèle de langage ordinaire, l’arrêter juste avant qu’il écrive le premier mot de sa réponse, et lire les probabilités qu’il attribuait à chaque option. La vidéo conclut, avec un commentateur de Hacker News, que dire « Jev, c’est juste BERT » revient à dire « Dropbox, c’est juste un serveur de fichiers » : l’innovation technique est modeste, le produit — prix, vitesse, simplicité d’emploi — ne l’est pas.
⚖️ Ce qui est démontré, ce qui est exagéré
Affirmation par affirmation
| Affirmation | Statut | Précision |
|---|---|---|
| « Jev n’hallucine jamais » | Faux | Il ne peut pas inventer de texte hors des cases. Mais il peut choisir la mauvaise case, avec assurance. Le risque change de forme ; il ne disparaît pas. |
| Jusqu’à ~190 fois plus rapide, ~440 fois moins cher | Auto-évalué | Mesuré par l’entreprise, sur ses tâches, dans son format de test. Aucune mesure indépendante publiée. |
| Des probabilités fiables, « calibrées » | Non vérifié | C’est l’argument le plus précieux et le moins prouvé : aucun test externe de calibration à ce jour. |
| 60 % → 97 % de réponses valides | Témoignage | Un utilisateur, 200 messages, ses propres critères. Et le gain vient surtout de la réorganisation du circuit. |
| Le rédacteur sans outils « ne peut pas se tromper » | Faux | Il peut toujours mal formuler ou ajouter une promesse — c’est précisément pourquoi un troisième contrôle vérifie son texte. |
| Une innovation technique majeure | Exagéré | Le classement par encodeur existe depuis 2018. Le progrès réel : questions en langage courant sans réentraînement, vitesse, prix. |
| « Refait en deux heures sur mon ordinateur » | Exagéré | Un prototype, oui. Des probabilités dignes de confiance sur des milliers de cas réels, non. |
| « Le 10 janvier 2026 est un jeudi, Jev s’est planté » | Faux | C’était un samedi. L’erreur est celle du testeur — preuve que les dates se calculent par programme, pas de mémoire. |
| Une probabilité sous 70 % doit être revérifiée | Exact | À 53 ou 59 %, le modèle signale lui-même qu’il hésite : c’est l’avantage d’un chiffre sur une phrase assurée. |
| « Un score de 1 : il ne peut pas se tromper » | Faux | Une probabilité mesure la confiance du modèle, pas la vérité. Sa calibration n’est pas vérifiée de façon indépendante. |
| « Jusqu’à 1 000 fois moins cher » | Exagéré | Les chiffres de l’entreprise elle-même culminent vers 440 fois. |
| Séparer perception et décision rend un système plus fiable | Exact | C’est le cœur juste de toute l’affaire, et il ne dépend pas de Jev : on peut l’appliquer avec d’autres outils. |
| Contrôler chaque action d’un agent par une règle écrite | Exact | Une consigne dans un texte peut être oubliée ; une règle examinée avant chaque action ne l’est pas. |
🩺 Et en médecine ? Le seul modèle d’IA acceptable
Une ordonnance ne se « génère » pas
En médecine, le défaut des grands modèles de langage n’est pas un inconfort : c’est un danger. Une molécule plausible mais inadaptée, une posologie inventée, une contre-indication oubliée ont exactement la même allure, sur l’écran, qu’une prescription juste. Une IA qui rédige librement une ordonnance est, par construction, inacceptable.
Le principe neurosymbolique décrit ici est exactement celui qui convient. L’IA lit la demande du patient, souvent écrite vite, sur un téléphone, avec ses mots à lui. Elle la traduit en cases : quel type de consultation, quel degré d’urgence, quels signes d’alerte présents ou absents. Ensuite, ce ne sont plus elle qui décide, mais des règles écrites par le médecin, et au bout de la chaîne, le médecin lui-même.
✅ Ce qu’une IA peut faire dans un dossier
- Comprendre une demande écrite librement
- La ranger dans une liste fermée de motifs
- Repérer la présence ou l’absence de signes d’alerte
- Estimer un degré d’urgence pour trier les demandes
- Retrouver le protocole du médecin qui correspond
- Signaler quand elle n’est pas sûre
🚫 Ce qu’elle ne doit jamais faire
- Écrire une molécule qui ne vient pas de la base de médicaments
- Inventer une posologie
- Décider seule qu’une contre-indication ne s’applique pas
- Envoyer quoi que ce soit au patient sans le médecin
- Transmettre des données identifiantes à un service étranger
- Se passer de l’examen clinique quand il est nécessaire
- Calculer un âge, une date ou une durée : c’est le travail du programme
🏥 Là où nous en sommes au cabinet
La pré-consultation en ligne du cabinet fonctionne déjà selon cette logique : le type de consultation est choisi dans une liste fermée, l’urgence est classée en trois degrés, et aucune proposition — d’ordonnance comme d’arrêt de travail — n’existe tant qu’elle n’a pas été relue et validée par le médecin après la consultation. Ce que l’annonce de Jev apporte, c’est surtout un vocabulaire et une confirmation : la fiabilité ne viendra pas d’une IA plus puissante, mais d’une IA qu’on empêche de décider.
⚠️ Et Jev lui-même, pour des données de santé ?
Pas aujourd’hui. C’est une API hébergée aux États-Unis, en accès anticipé, sans installation locale possible et sans publication technique. Des données de santé exigent un hébergement et des garanties que ce service ne présente pas à ce stade. Le principe, lui, peut être appliqué dès maintenant avec d’autres outils, y compris des modèles qui tournent sur l’ordinateur du cabinet, sans que rien ne sorte.
📰 Le reste de la semaine, en bref
Les autres annonces de la vidéo
La seconde partie de la vidéo parcourt d’autres nouveautés. Elles sont résumées ici telles qu’elles y sont présentées ; elles n’ont pas été vérifiées une à une pour cette page.
| Sujet | Ce qu’en dit la vidéo |
|---|---|
| Claude (Anthropic) | La conversation et le mode de travail sur ordinateur réunis dans une seule interface, avec la production de documents et de présentations directement dans l’application. L’auteur y voit une stratégie d’écosystème fermé et conseille de rester capable de changer de modèle. |
| Odyssey-3 | Un modèle qui apprend la physique du monde en regardant des vidéos ; on lui greffe ensuite une petite « tête » d’action. Quelques dizaines d’heures suffiraient pour piloter un bras robotisé ou conduire dans une circulation difficile. |
| Bonsai 2 (PrismML) | Un modèle de 27 milliards de paramètres compressé de 55 à 6 Go en réduisant chaque poids à −1, 0 ou 1, pour moins de 2 % de perte sur les tests choisis. |
| Needle 3 | Un modèle de 29 Mo, incapable de rédiger mais bon pour extraire de l’information et déclencher des actions, destiné aux téléphones, montres et robots. |
| Traduction vocale (Alibaba) | Une traduction orale en moins de deux secondes, en service payant, poids non publiés. |
| Gemini Live (Google) | Des modèles vocaux qui répondent sans repasser par le texte, pour une conversation en temps réel. |
| Octop (Tencent) | Un environnement de travail libre, auto-hébergé, pour partager agents, compétences et outils en équipe avec le modèle de son choix. |
🔗 Le fil commun
Needle 3 et Bonsai 2 vont dans le même sens que Jev : des modèles plus petits, spécialisés, qui tournent localement et font une seule chose bien. Pour un cabinet médical, c’est la direction la plus intéressante — celle où les données ne quittent pas l’ordinateur du médecin.
❓ Questions fréquentes
🤔 En quoi est-ce différent de ChatGPT ?▼
ChatGPT écrit : il produit une suite de mots, aussi longue qu’il le faut. Jev ne fait que répondre dans des cases que vous avez définies à l’avance — un choix, un score, une probabilité. Il ne peut pas vous surprendre par une phrase ; il ne peut que se tromper de case.
🎯 Est-il vrai qu’il n’hallucine jamais ?▼
Non. Il ne peut pas inventer de texte, mais il peut choisir une mauvaise option en lui attribuant une forte probabilité. L’erreur devient plus facile à détecter et à contrôler par des règles — c’est tout l’intérêt —, mais elle ne disparaît pas.
🛠️ Faut-il l’utiliser ?▼
Pour une entreprise qui fait déjà tourner des automatisations avec des données sans sensibilité particulière, il vaut l’essai : prix et vitesse le justifient. Pour des données de santé, pas en l’état — hébergement étranger, accès anticipé, aucune option locale. Dans tous les cas, ce qui compte le plus est l’architecture : des règles écrites, une présélection par le code, un contrôle final, un humain qui valide.
🤖 Peut-on le brancher sur son propre agent ?▼
Oui. Sur Hermes, par une extension communautaire à installer en une commande. Sur DeepSeek Harness, par son client MCP officiel pour les outils de décision, et par un hook pour bloquer une action non conforme — ce dernier reste à écrire. Dans tous les cas, faites relire le code de l’extension avant de l’installer, et n’y faites transiter aucune donnée personnelle.
🔬 Peut-on l’essayer soi-même ?▼
Oui : par la console de TypeSafe quand elle n’est pas saturée, ou par des passerelles comme celle de Vercel, qui l’a ajouté à son catalogue. La seconde vidéo montre un après-midi de tests pour 5 dollars de crédit. Pour un essai, n’y mettez que des textes sans aucune donnée personnelle.
🧪 Peut-on obtenir la même chose autrement ?▼
Oui. Des dizaines de reproductions libres existent déjà. On peut aussi demander à un modèle de langage classique une réponse limitée à une liste fermée d’options, ou lire les probabilités qu’un petit modèle local attribue à chaque option. La qualité des probabilités sera différente ; le principe, le même.
🩺 L’IA du cabinet décide-t-elle de mon traitement ?▼
Non. Elle aide à comprendre votre demande et à la classer, pour que le médecin la traite plus vite et mieux. Toute prescription, tout arrêt de travail, tout certificat est décidé par le médecin, après la consultation.
🔐 Mes données partent-elles à l’étranger ?▼
Le cabinet n’utilise pas Jev. Quand une aide par intelligence artificielle est employée dans le dossier médical, les éléments transmis sont pseudonymisés : ni nom, ni date de naissance, ni numéro de sécurité sociale, ni coordonnées.
💡 Pourquoi ce sujet sur un site médical ?▼
Parce que la question que pose Jev — comment rendre une IA fiable en l’empêchant de tout faire — est exactement celle qui se pose à tout médecin tenté d’utiliser l’intelligence artificielle dans ses dossiers. La réponse vaut bien au-delà du support client.
📚 Sources
- La vidéo — Eliott Meunier, JEV : l’IA qui secoue internet (actu IA), 23 septembre 2026. Consulter
- La seconde vidéo — Shubham Sharma, JEV expliqué simplement (+ 5 démos), série « Anti-hype ». Consulter
- La troisième vidéo — Dr Firas, Jev × Hermes. Consulter
- Hermes Agent (Nous Research) — extension communautaire jev-typesafe. Consulter
- DeepSeek Harness — dépôt officiel et documentation du client MCP. Consulter · client MCP
- The New Stack — DeepSeek open sources an agent harness where everything is a plugin, août 2026. Consulter
- Vercel — TypeSafe AI’s Jev now available on AI Gateway. Consulter
- Jev (AI model) — Wikipédia (anglais) : date de lancement, fondateurs, financement, chiffres revendiqués. Consulter
- TrueFoundry — TypeSafe AI’s Jev: What “System One Models” Actually Are : tarif, limites, absence de test indépendant. Consulter
- DataCamp — Jev: TypeSafe’s System One Model. Consulter
- GreenNode — What is Jev? TypeSafe’s decision-making AI model and real benchmarks. Consulter
- daily.dev — Jev: System One models for Prod, not God — with Diogo Almeida. Consulter
- Devlin J, Chang MW, Lee K, Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, 2018 — l’article fondateur des encodeurs. Consulter
- Kahneman D. Système 1 / Système 2 : les deux vitesses de la pensée, Flammarion, 2012 — l’origine du nom « System One ».
À lire également sur ce site : l’IA médicale gratuite, nos autres décryptages IA et autres sujets.
🤖 Une IA qui aide, un médecin qui décide
L’assistant du cabinet vous aide à décrire votre situation et à savoir si une consultation est nécessaire — gratuitement, sans inscription. La décision reste médicale.
💬 Essayer l’IA médicaleOu prenez rendez-vous : tiers payant 7,50 € · Remboursement CPAM
