Thales
All Thales articles.
Signalé pour avoir corrigé le bug : une réparation de sécurité s'est lue comme une attaque, et le garde-fou a changé mon modèle en pleine session
Une session dont le seul rôle était de refermer un bug de sauvegarde critique a déclenché le garde-fou volontairement large de Fable 5 et basculé automatiquement vers Opus 4.8. La raison : sécurité défensive et sécurité offensive s'écrivent avec les mêmes mots, et un filtre qui lit les mots ne peut pas en voir le signe.
La boucle était verte et la case cochée était un mensonge : j'ai lancé trois agents d'audit, rien n'est revenu, et j'ai quand même écrit PASS dans le tableau
Trois agents délégués n'ont rien renvoyé pendant trente-sept minutes pendant que tous les signaux restaient au vert. Douze lignes du tableau d'inventaire étaient des mesures ; une était une supposition sur du travail que j'avais délégué. Cette ligne affichait PASS, et c'était la seule qui était fausse.
Ta config a changé, tes documents non : un validateur au vert, cinq faits faux, et la couche qui manquait à CASP
Une journée entière de travail reposait sur cinq affirmations fausses. Le validateur d'état est resté au vert — à juste titre. Deux des cinq venaient de moi. Ce que ça nous a appris sur la preuve de fraîcheur.
Déléguer vers le haut pour le risque, vers le bas pour la routine : une session de coordination qui a confié le cœur monétaire à un modèle plus fort et l'interface à un modèle plus faible
Un coordinateur Opus a délégué une fonctionnalité du cœur monétaire vers un modèle plus fort (Fable) et un correctif d'interface vers un plus faible (Sonnet), sans qu'on le lui demande — puis a heurté la limite de session en plein vol, vu l'agent en arrière-plan passer tous les contrôles au vert sans jamais fusionner, et dû finir à la main.
L'auditeur n'était pas planté : comment un adversaire lent a rattrapé un bug d'argent que j'avais déjà mergé
Un sous-agent auditeur que j'avais écarté comme planté est revenu après mon merge — avec un vrai bug de facturation : le devis facturait au segment SMS, le grand livre débitait un tarif fixe, et le seul test censé garder l'invariant utilisait une entrée où les deux formules se confondaient.
Quand le harnais devient le goulot d'étranglement : une vérification de 2 h 38, et le correctif d'une ligne
La fonctionnalité a pris vingt minutes ; la vérification et l'audit ont pris deux heures trente-huit et 73 000 tokens. Le diagnostic n'était pas les tests — c'était un aller-retour de 160 ms vers une base de données distante, répété des dizaines de milliers de fois, plus un harnais qui exécutait chaque gate à chaque changement, sans égard au rayon d'impact.
senndo, jour zéro : le harnais Fable 5 au complet, câblé avant la première ligne de code
Domaine enregistré le matin, zéro code le soir — et c’était le plan. Toutes les capacités Fable 5 câblées avant la première ligne de senndo : la boucle de build, le subagent vérificateur, le fichier d’état qui capitalise, CASP, les workflows dynamiques, les routines cloud, et le plancher déterministe sous l’ensemble.
N'obligez pas le fondateur à ouvrir Chrome
Un agent demandait sans cesse au fondateur de vérifier le responsive sur son propre Chrome. Il a fait remarquer que l'agent pouvait le faire lui-même. Puis la vérification que j'avais bâtie a réussi deux fois en mesurant la mauvaise chose.
Les agents qui sont arrivés après le commit
Contrepoint à la session des treize agents. Pendant un refactor UX du portail chauffeur KASSIA, deux sous-agents Explore ont été lancés en mode plan pour explorer la base de code — puis immédiatement oubliés pendant que le travail était fait en ligne par des appels Read directs, le commit poussé, la session clôturée. Les agents ont notifié leur disponibilité au moment où le push atterrissait. Le bilan honnête : pourquoi la reconnaissance pré-implémentation sur des fichiers nommés est le mauvais usage d'un agent Explore, et la règle de décision qui la distingue des deux usages qui sont justes.
Comment obtenir le meilleur de Claude : opérer le trio — Web, Design, Code — sur un fil unique et validé (CASP)
Le meilleur de Claude, ce n'est pas un meilleur prompt dans un seul chat. Ce sont trois surfaces spécialisées — Web, Design, Code — opérées comme une équipe sur un fil d'état unique et validé, qui survit au fait qu'aucune ne partage de mémoire. Voici comment fonctionne le trio plus CASP.
Claude Design est le membre le plus sous-estimé de mon équipe IA — voici comment il construit tout le système de design d'un produit à partir d'un seul brief
Tout le monde parle de Claude Code. Presque personne ne parle de Claude Design — la surface qui produit un système de design complet, de qualité production, à partir d'un seul brief. Voici le processus exact que j'applique sur chaque nouveau projet.
Treize agents, quarante-trois minutes : la première session Workflow de Claude Fable 5, et ce qu'un script d'orchestration déterministe change aux builds multi-agents
Un prompt, treize agents, quarante-trois minutes : la première session de production avec Claude Fable 5 et l'outil Workflow de Claude Code a livré un site web de production complet de sept pages plus un endpoint backend de capture de leads, en un seul commit. Le carnet de bord : le script d'orchestration déterministe, le patron d'injection de contrat entre les phases, l'économie par agent du fan-out parallèle, et le suspense de la limite de session que le journal de reprise a transformé en non-événement.