MainCarto · note de fabrication

La Fabrique des Mains

Comment on va extraire une trentaine de mains de vidéos de cartomancie, et pourquoi chaque étape est un choix — dont plusieurs t'appartiennent.

Ce qu'on fabrique

Le point d'arrivée

Une page qu'on lit sur un téléphone. Du texte en colonne — le tien. Par-dessus, une trentaine de mains détourées, chacune large comme deux mots.

Quand on fait défiler, les mains avancent moins vite que le texte. Elles dérivent donc vers le bas à travers les lignes, et ce qu'elles cachaient se libère à mesure qu'on descend. À l'arrêt, elles continuent de respirer légèrement. La main est un voile qui s'attarde, pas une illustration posée à côté du texte.

Ces mains viennent de vidéos de cartomancie publiées sur TikTok et Instagram. Des gestes réels, filmés par des dizaines de personnes qui ne se connaissent pas, et qui font tous à peu près la même chose : battre, couper, poser, désigner. C'est cette répétition anonyme qu'on veut rendre visible.

Pourquoi c'est un problème de photographe

Ce qui rend la chose difficile

Trois difficultés, et aucune n'est informatique au fond.

Une vidéo n'est pas une photographie. Elle est compressée pour tenir dans un réseau social, sa couleur est échantillonnée à moitié de sa définition, et une main qui manipule des cartes bouge — donc il y a du flou de mouvement sur la plupart des images. Sur trois mille images tirées de quarante vidéos, peut-être deux cents valent vraiment quelque chose.

Une main n'est pas un rectangle. La machine sait très bien dire « il y a une main à cet endroit », et elle te répond par un cadre. Mais nous, il nous faut le contour : les doigts, les intervalles entre eux, le bord du poignet. Passer du cadre au contour est une opération à part entière — c'est le même écart qu'entre repérer un sujet dans le viseur et le détourer proprement pour un tirage.

Le fond noir est impitoyable. Dans une grille serrée, un détourage moyen passe inaperçu : il est enfermé dans sa case. Sur du noir, avec la main affichée grande, chaque défaut devient une tache — un bout de manche resté accroché, un doigt rogné, un liseré clair autour du contour. La qualité perçue de la page finale n'est pas la moyenne des mains. C'est leur pire élément.

La chaîne

Ce qui se passe, dans l'ordre

Sept opérations, chacune indépendante et rejouable. Ce qui compte, ce n'est pas leur liste : c'est que la chaîne multiplie d'abord, puis réduit brutalement — et que le seul moment où quelqu'un regarde vraiment se situe au point le plus étroit.

402 700400301 vidéosimages fixesmains repéréesmains retenuespage échantillonnagedétection · détouragecomposition casting le seul endroit où quelqu'un regarde
La chaîne multiplie avant de réduire. Quarante vidéos donnent près de trois mille images fixes ; la machine y repère quatre cents mains exploitables ; un humain en garde une trentaine. Le jugement intervient là où il coûte le moins cher et décide le plus — pas au début, quand il faudrait trier trois mille images, ni à la fin, quand il serait trop tard.

Dans l'ordre : on repère les vidéos par mots-clés, on les télécharge, on en tire une image et demie par seconde, la machine y localise les mains, on recadre serré autour de chacune, on détoure, on finit. Puis quelqu'un choisit.

Chaque opération écrit son résultat sur le disque et ne refait jamais le travail de la précédente. Concrètement : si on change d'avis sur le détourage dans trois semaines, on relance le détourage seul, sans retélécharger une seule vidéo — et surtout sans perdre les choix déjà faits pendant le casting.

Trois choix qui ne vont pas de soi

Là où l'intuition se trompe

On ne demande pas à la machine « enlève le fond »

C'est le réflexe, et il produirait exactement le contraire de ce qu'on veut. Les outils de suppression de fond ne cherchent pas un objet : ils cherchent le sujet le plus saillant de l'image, et n'ont aucun moyen d'en désigner un autre. Sur une vidéo de cartomancie, le sujet saillant, c'est la cartomancienne, ou la table avec son jeu. On récupérerait des bustes détourés.

l'image entière « le sujet » = la personne le cadrage serré « le sujet » = la main
Le recadrage retourne le handicap en atout. Le même outil, incapable de choisir un objet parmi plusieurs, devient le meilleur détoureur possible dès qu'on ne lui montre plus qu'une main. C'est pour cette raison que l'étape « recadrer » existe : elle ne sert pas à gagner du temps, elle change ce que la machine croit regarder.

La netteté se mesure dans la silhouette, pas dans l'image

Il faut écarter automatiquement les mains floues, donc mesurer la netteté. Le piège est qu'une vidéo de cartomancie est presque toujours tournée à faible profondeur de champ : le fond est volontairement flou. Si on mesure la netteté sur l'image entière, une main parfaitement nette sur un arrière-plan fondu obtient une mauvaise note, et on la jette.

On mesure donc la netteté uniquement sur les pixels retenus par le détourage. Autrement dit : on juge la netteté de ce qu'on garde, jamais de ce qu'on va supprimer.

Corollaire vérifié à la mesure : la confiance du détecteur n'est pas un indice de netteté. Il reconnaît très bien des mains franchement floues. Un outil vous dit toujours sa confiance dans sa tâche, jamais dans la vôtre — il est sûr qu'il y a une main, il ne dit rien sur le fait qu'elle soit belle.

Le halo

Celui-là, tu l'as déjà rencontré en compositing. Quand on détoure, les pixels du bord sont semi-transparents, et ils contiennent encore, dans leur couleur, le fond d'origine. Les vidéos de cartomancie sont tournées sur des fonds plus clairs que notre noir. Résultat : un liseré clair tout autour de la main, d'autant plus visible qu'on l'affiche grand.

Le remède est une opération à part — on recalcule la couleur du premier plan sous la zone transparente. Sans elle, on aurait livré trente mains cerclées de halo en cherchant le problème au mauvais endroit.

Ce que la machine ne décidera jamais

Les arbitrages qui te reviennent

Plusieurs décisions ressemblent à des réglages techniques et n'en sont pas. Les voici séparément, parce que ce sont celles sur lesquelles on a besoin de toi.

À toi · la découpe du poignet

Aucun modèle ne sait où couper l'avant-bras — c'est un cadrage, pas un calcul. On applique un masque droit ou courbe avec un dégradé de transparence de vingt à soixante pixels.

Et ce réglage doit être identique sur les trente mains. C'est très exactement ce qui fera qu'on lit une série plutôt que trente images. Une découpe qui varie d'une main à l'autre se lit comme une négligence, même si chaque main est belle isolément.

À toi · le casting

La machine classe les quatre cents candidates par netteté et par qualité de contour. Elle ne saura jamais dire « cette main-là raconte quelque chose ». Le tri se fait au clavier, une main par écran, sur fond sombre et à la taille d'affichage finale — juger dans le médium d'arrivée, pas sur une vignette blanche.

À toi · le texte

C'est toi qui l'écris — c'est acté. Ce qu'il nous reste à savoir tient à sa forme, parce qu'elle détermine la géométrie de la page : une colonne continue, ou des sections nommées comme le sont les arcanes ? Quelle longueur approximative ? Le prototype tourne sur six sections d'environ cent mots, soit une dizaine d'écrans.

Une piste qu'on garde de côté sans vouloir te l'imposer : un texte trouvé, monté à partir des légendes des vidéos elles-mêmes. Le corpus parlerait alors avec ses propres mots. À toi de voir si ça t'intéresse, en complément ou pas du tout.

Ce qu'on s'interdit

Le cadre qu'on se donne

Ces vidéos appartiennent à leurs auteurs, et leur collecte automatisée contrevient aux conditions d'utilisation des plateformes. On ne prétend pas le contraire. On limite la chose par trois décisions inscrites dans la fabrication même, pas dans une déclaration d'intention :

Le débit est plafonné. Un seul navigateur, aucune parallélisation, des délais irréguliers. On prend quarante vidéos, pas quarante mille.

L'attribution est portée jusqu'au bout. Le nom de l'auteur, la plateforme et le lien vers la vidéo d'origine voyagent avec chaque main à travers toute la chaîne, et s'affichent quand on touche une main sur la page. Ce n'est pas une option qu'on pourrait désactiver pour faire plus propre — c'est ce qui sépare un collage d'une appropriation.

Aucune image collectée n'entre dans l'archive du projet. Les vidéos et les images restent sur la machine d'Ismaël. Ce qui est versionné et partagé, ce sont les programmes et les décisions, jamais le matériau d'autrui.

Point à trancher

On a écarté par principe tous les outils dont la licence interdit un usage commercial, pour ne pas se fermer de porte si la pièce devient un jour exposée ou vendue. C'est une contrainte qu'on s'est imposée sans en discuter — dis-nous si elle est excessive, elle a un coût en qualité sur un ou deux modèles.

Ce qu'on attend de toi

Maintenant, concrètement

  1. La forme du texteTu l'écris — reste à fixer sa structure : colonne continue ou sections nommées, et quelle longueur. C'est ce qui donne sa hauteur à la page, donc sa respiration.
  2. Les mots-clésLa liste actuelle mélange français, anglais et termes ciblés sur le geste. Elle est provisoire — c'est toi qui connais le terrain et la veille.
  3. Le nombre de mainsUne trentaine aujourd'hui. Le prototype a un curseur : c'est un jugement de densité, il se prend en regardant.
  4. La découpe du poignetDroite ou courbe, haute ou basse, dégradé court ou long. Une seule valeur pour toute la série.

Cette note accompagne le prototype du Voile, où le mécanisme de défilement se teste en vrai, et le comparatif technique des détecteurs. Les trois sont dans le site du projet, avec le journal des décisions — y compris celles qu'on a prises puis annulées, laissées visibles exprès.

Le texte du Voile s'écrit désormais dans le site lui-même, sans passer par Ismaël.