Vision d'Écran
Une IA de vision qui regarde ton jeu en temps réel
La vision d'écran de Sidekick AI lit ta partie image par image. Le compagnon connaît déjà le boss, la phase et le loot — le coaching vocal colle donc au moment au lieu d'attendre que tu le décrives.
Jouer gratuitement sur SteamComment ça marche
Il lit ton écran image par image
Le compagnon voit ce que tu vois, à la cadence des images. La barre de vie du boss, ta position, le curseur sur un coffre, l'icône du sort qui vient de partir — tout.
Il identifie l'état du jeu, pas juste des pixels
La vision IA transforme les images brutes en compréhension structurée : quel jeu, quelle rencontre, quelle phase, quelle mécanique s'amorce. Le compagnon parle de la situation, pas de l'écran.
Il agit sur le moment, pas sur ta description
Comme le compagnon voit déjà la scène, tu sautes toute la boucle décrire-puis-répondre. Tu réagis à la voix de Sidekick ; Sidekick réagit à ton jeu.
Filtre léger en local, analyse côté serveur
Un détecteur de changement tourne sur ta machine pour décider quelles images valent une analyse — dans une session, la plupart ne bougent pas assez pour compter. Celles qui passent le filtre partent vers le modèle de vision de Sidekick pour la vraie analyse.
Pourquoi la vision d'écran est la fonctionnalité phare
Tous les compagnons IA pour le jeu prétendent aider en temps réel. Le test honnête, c'est de savoir si le compagnon peut agir sur le moment sans que tu le décrives. Un chatbot qui a besoin que tu tapes « je suis à mi-vie et Malenia vient de lancer la Waterfowl Dance » avant de donner un conseil a déjà perdu le moment. Le temps que tu finisses de taper, le combat est terminé.
La vision d'écran écrase cette boucle. Le compagnon voit la barre de vie du boss, voit l'animation de charge de la Waterfowl, voit ton endurance, et annonce le timing d'esquive à la voix avant même que tu puisses formuler ce qui se passe. C'est tout l'argument du coaching IA en temps réel, et c'est la vision d'écran qui le rend réel au lieu de le laisser au marketing.
Ce que « lire ton écran » veut dire concrètement
La vision IA ne balance pas juste des pixels dans un modèle de langage. Le pipeline transforme chaque image capturée en signaux structurés : quel jeu tourne, quelle scène est à l'écran, quels éléments d'interface sont visibles, ce que fait ton personnage, quels ennemis sont là, dans quel état sont le joueur et les ennemis. Ce sont ces signaux que la couche de coaching manipule vraiment.
C'est cette structure qui permet à Sidekick de faire des appels précis au lieu d'observations vagues. Le compagnon peut dire « tu es à 30 % de PV, décroche et bois une Estus » parce que la couche de vision a extrait tes PV et ton nombre de fioles — pas parce que le modèle a deviné.
En quoi Sidekick diffère de Character.AI, ChatGPT et Replika
La plupart des assistants IA et des chatbots sont aveugles à ton jeu. Character.AI, ChatGPT, Replika — aucun d'eux ne peut voir ce que tu vois. Ils peuvent discuter d'un jeu que tu leur décris, mais ils ne peuvent pas te coacher pendant que tu joues, parce que la boucle est trop lente.
La catégorie des compagnons IA pour le jeu existe parce que la vision d'écran a changé ce qui était possible. Sidekick AI est construit autour de ce changement. L'avatar 3D, la couche vocale et le workflow de highlights HypeReel reposent tous sur une couche de vision assez bonne pour que le compagnon sache déjà ce qui se passe quand il parle.
Comment fonctionne vraiment le pipeline de vision
La capture d'images se fait au niveau du système d'exploitation — les mêmes API de capture de fenêtre Windows.Graphics.Capture et Core Graphics qu'utilisent OBS et les autres outils de capture. Pas d'injection de DLL, pas de hook sur la mémoire du jeu, pas d'instrumentation au niveau driver. Le compagnon ne s'attache jamais au processus de ton jeu, donc l'anti-cheat traite Sidekick comme n'importe quel outil de capture. Le coût de ce design, c'est que Sidekick ne voit que ce qui est rendu à l'écran ; l'avantage, c'est que ça marche avec n'importe quel jeu PC, sans intégration par titre.
Une fois l'image capturée, un détecteur de changement léger tourne sur ta machine et décide si elle vaut la peine d'être envoyée — dans une session, la plupart des images consécutives se ressemblent trop pour que le modèle ait quelque chose de neuf à dire. Celles qui passent le filtre partent vers le modèle vision-langage de Sidekick avec un prompt de coaching qui connaît les jeux. Le modèle renvoie une réponse structurée (quel jeu, quelle scène, quelle interface est visible, quelles entités sont dans l'image, ce que fait le joueur). C'est sur cette réponse structurée que la couche de coaching raisonne, pas sur les pixels bruts, quand elle décide quoi dire dans ton casque. C'est cette forme de pipeline qui permet au coaching de coller au moment — le compagnon connaît déjà la situation avant de parler.
Ce qu'il voit pendant que tu joues
La partie « compréhension structurée » reste abstraite. La version concrète, c'est ce que le compagnon peut annoncer en session, dans les genres pour lesquels Sidekick est calibré. Le modèle de vision est généraliste : il reconnaît les éléments ci-dessous parce que les grands modèles multimodaux ont vu ces jeux dans leurs données d'entraînement, pas parce que Sidekick embarque des extracteurs par jeu.
Dans un combat de boss Souls — la barre de vie et la jauge de posture du boss, tes barres de PV et d'endurance, l'animation de charge qui annonce une attaque, ton nombre de fioles, les cooldowns de tes compétences, les changements de phase du boss. C'est comme ça que Sidekick peut dire « tu es à 30 %, fiole maintenant » ou « la Waterfowl se charge, cours pendant la première rafale » au lieu d'un conseil d'esquive générique.
Dans un metroidvania — l'état de la mini-carte (salles visitées, salles inexplorées), tes capacités de déplacement, l'icône du charme ou de la relique que tu viens de ramasser, les portes verrouillées de l'étage. C'est comme ça que Sidekick peut te pousser vers la salle inexplorée deux écrans au nord-ouest sans te spoiler toute la carte.
Dans un tour de RPG — l'ordre des tours, les cooldowns et les ressources, les choix de dialogue à l'écran, les dangers du terrain, les icônes d'état sur chaque combattant. C'est comme ça que le compagnon peut signaler « la surface élémentaire s'enflamme si tu lances cette boule de feu, ton allié est dedans » avant que tu cliques.
Dans un survival horror — tes munitions, ta réserve d'herbes ou de soins, la machine à écrire pour sauvegarder, la position des ennemis sur le radar, l'état de tes armes. C'est comme ça que Sidekick peut dire « quatre balles de pistolet et une herbe verte, le prochain marchand est après l'église » au lieu d'un conseil générique sur la pénurie.
Vie privée et contrôle — ce que le compagnon voit et ne voit pas
Sidekick lit la surface que tu lui désignes. En multi-écrans, tu choisis la fenêtre ou l'écran que le compagnon voit ; un second moniteur avec Discord, OBS, un onglet wiki ou tes mails reste privé. La couche de vision ne va jamais chercher dans des fenêtres que tu n'as pas sélectionnées.
Mettre la vision en pause, c'est un clic. En pause, le compagnon continue de discuter mais arrête de capturer et d'analyser l'écran — pratique pour les cinématiques que tu veux vivre sans commentaire limite-spoiler, pour les moments de scénario où le coaching serait intrusif, ou juste quand tu veux de la compagnie sans analyse. La pause vaut pour la session ; au prochain lancement, tu repars de ton état par défaut.
Les clips HypeReel sont un workflow séparé, en opt-in. Ces clips existent parce que tu les as déclenchés — un highlight qui mérite d'être gardé — et ils sont à toi : à garder, à modifier, à partager ou à supprimer de ton compte. Le pipeline de clips utilise la même couche de vision pour détecter les highlights, mais la vidéo qui en sort est sous ton contrôle, pas sous celui de la couche de vision.
Questions fréquentes
Comment marche vraiment la vision d'écran de Sidekick AI ?
Avec quels jeux la vision d'écran fonctionne-t-elle ?
Est-ce que la vision d'écran fait ramer mon jeu ?
Est-ce que Sidekick voit le HUD, les menus et l'inventaire ?
Et les spoilers ? Sidekick va me révéler du contenu de fin de jeu ?
La vision d'écran, c'est différent du streaming ou de l'enregistrement d'écran ?
La vision d'écran marche en multi-écrans ?
Je peux couper la vision d'écran temporairement ?
Sidekick capture les images par injection de DLL, ou par un truc que l'anti-cheat va signaler ?
Je peux faire tourner Sidekick à côté d'un setup de stream comme OBS ?
Related Resources
Prêt à jouer plus malin ?
Sidekick AI utilise la vision IA pour observer ton écran et te coacher en temps réel. Jouable gratuitement en accès anticipé sur Steam.
Jouer gratuitement sur Steam