Visión de Pantalla
IA de visión que mira tu partida en tiempo real
La visión de pantalla de Sidekick AI lee tu partida fotograma a fotograma. El compañero ya conoce al jefe, la fase y el botín, así que el coaching por voz encaja con el momento en vez de esperar a que se lo describas.
Juega gratis en SteamCómo funciona
Lee tu pantalla fotograma a fotograma
El compañero ve lo que tú ves a la cadencia nativa de fotogramas. La barra de vida del jefe, tu posición, el cursor sobre un cofre, el icono del hechizo que acaba de saltar: todo.
Identifica el estado del juego, no solo píxeles
La IA de visión convierte los fotogramas en bruto en comprensión estructurada: qué juego, qué encuentro, qué fase, qué mecánica se está cargando. El compañero habla de la situación, no de la pantalla.
Actúa sobre el momento, no sobre la descripción
Como el compañero ya ve la escena, te saltas entero el bucle de describir y esperar respuesta. Tú reaccionas a la voz de Sidekick; Sidekick reacciona a tu partida.
Filtro ligero en tu equipo, análisis en el servidor
Un detector de cambios corre en tu máquina para decidir qué fotogramas merece la pena analizar: la mayoría de los fotogramas de una sesión no cambian lo suficiente como para importar. Los que pasan el filtro se envían al modelo de visión de Sidekick para el análisis de verdad.
Por qué la visión de pantalla es la función estrella
Todos los compañeros de IA para juegos dicen que ayudan en tiempo real. La prueba honesta es si el compañero puede actuar sobre el momento sin que se lo describas. Un chatbot que necesita que escribas «estoy a media vida y Malenia acaba de empezar la Waterfowl Dance» antes de darte un consejo ya perdió el momento. Para cuando terminas de escribir, la pelea se acabó.
La visión de pantalla colapsa ese bucle. El compañero ve la barra de vida del jefe, ve la animación previa de Waterfowl, ve tu resistencia y canta el momento de la esquiva por voz antes de que puedas articular lo que está pasando. Esa es toda la propuesta del coaching de IA en tiempo real, y la visión de pantalla es lo que la hace real en vez de marketing.
Qué significa «lee tu pantalla» en la práctica
La IA de visión no se limita a volcar píxeles en un modelo de lenguaje. El pipeline convierte cada fotograma capturado en señales estructuradas: qué juego está corriendo, qué escena hay en pantalla, qué elementos de interfaz se ven, qué está haciendo tu personaje, qué enemigos hay y en qué estado están el jugador y los enemigos. Sobre esas señales es sobre lo que razona de verdad la capa de coaching.
Esa estructura es la razón de que Sidekick pueda cantar avisos precisos en vez de observaciones vagas. El compañero puede decir «estás al 30% de vida, sal y bébete una Estus» porque la capa de visión extrajo tu vida y tu número de frascos, no porque el modelo lo adivinara.
En qué se diferencia Sidekick de Character.AI, ChatGPT y Replika
La mayoría de asistentes de IA y chatbots son ciegos a tu partida. Character.AI, ChatGPT, Replika: ninguno puede ver lo que tú ves. Pueden charlar sobre un juego que les describas, pero no pueden entrenarte mientras juegas porque el bucle es demasiado lento.
La categoría de compañeros de IA para juegos existe porque la visión de pantalla cambió lo que era posible. Sidekick AI está construido alrededor de ese cambio. El avatar 3D, la capa de voz y el flujo de clips destacados de HypeReel se apoyan todos en que la capa de visión sea lo bastante buena como para que el compañero ya sepa qué está pasando cuando habla.
Cómo funciona de verdad el pipeline de visión
La captura de fotogramas ocurre a nivel de sistema operativo: las mismas APIs de captura de ventana Windows.Graphics.Capture y Core Graphics que usan OBS y otras herramientas de captura. No hay inyección de DLL, ni hook a la memoria del juego, ni instrumentación a nivel de driver. El compañero nunca se engancha al proceso de tu juego, así que el anti-cheat trata a Sidekick como cualquier otra herramienta de captura. El coste de este diseño es que Sidekick solo ve lo que se renderiza en tu pantalla; la ventaja es que funciona con cualquier juego de PC sin integración título a título.
Una vez capturado el fotograma, un detector de cambios ligero corre en tu máquina y decide si merece la pena enviarlo: la mayoría de los fotogramas consecutivos de una sesión se parecen lo bastante como para que el modelo no tenga nada nuevo que decir. Los que pasan el filtro se envían al modelo de visión y lenguaje de Sidekick con un prompt de coaching que entiende de juegos. El modelo devuelve una respuesta estructurada (qué juego, qué escena, qué interfaz se ve, qué entidades hay en el fotograma, qué está haciendo el jugador). La capa de coaching razona sobre esa respuesta estructurada, no sobre los píxeles en bruto, cuando decide qué decirte en los auriculares. Esa forma del pipeline es la razón de que el coaching pueda encajar con el momento: el compañero ya conoce la situación antes de hablar.
Qué ve mientras juegas
La parte de la comprensión estructurada es abstracta. La versión concreta es lo que el compañero puede cantar durante una sesión en los géneros para los que Sidekick está afinado. El modelo de visión es de propósito general: reconoce los elementos de abajo porque los grandes modelos multimodales han visto estos juegos en sus datos de entrenamiento, no porque Sidekick lleve extractores juego a juego.
En una pelea de jefe de Souls: la barra de vida y el medidor de postura del jefe, tus barras de vida y resistencia, la animación previa que avisa de un ataque, tu número de frascos, los tiempos de recarga de tus habilidades, los cambios de fase del jefe. Así es como Sidekick puede decir «estás al 30%, frasco ya» o «Waterfowl se está cargando, corre durante la primera ráfaga» en lugar de consejos genéricos de esquiva.
En un metroidvania: el estado del minimapa (salas visitadas, salas sin explorar), tus habilidades de movimiento, el icono del amuleto o la reliquia que acabas de recoger, las puertas cerradas y sus llaves en la planta actual. Así es como Sidekick puede empujarte hacia la sala sin explorar dos pantallas al noroeste sin revelarte el mapa entero.
En un turno de RPG: el orden de turnos, los tiempos de recarga y los recursos, las opciones de diálogo en pantalla, los peligros del entorno en el encuentro, los iconos de estado de cada combatiente. Así es como el compañero puede avisarte de que «la superficie elemental se prende si lanzas esa bola de fuego; tu aliado está encima» antes de que hagas clic.
En un survival horror: tu munición, la pila de hierbas u objetos de curación, si hay máquina de escribir para guardar, las posiciones de enemigos en el radar, el estado de tus armas. Así es como Sidekick puede decir «te quedan cuatro balas de pistola y una hierba verde, el siguiente mercader está pasada la iglesia» en vez de consejos genéricos de escasez.
Privacidad y control: qué ve y qué no ve el compañero
Sidekick lee la superficie a la que lo apuntas. En montajes con varios monitores eliges qué ventana o qué pantalla ve el compañero; un segundo monitor con Discord, OBS, una pestaña de wiki o tu correo se queda en privado. La capa de visión nunca se mete en ventanas que no has seleccionado.
Pausar la visión es un clic. En pausa, el compañero sigue conversando pero deja de capturar y de analizar la pantalla: útil para cinemáticas que quieres vivir sin comentarios que rocen el spoiler, momentos de historia donde el coaching se sentiría intrusivo, o simplemente ratos en los que quieres compañía sin análisis. La pausa es un control por sesión; el siguiente arranque empieza en tu estado por defecto.
Los clips de HypeReel son un flujo aparte y opcional. Esos clips existen porque tú los disparaste, un momento destacado que merece guardarse, y son tuyos para conservarlos, editarlos, compartirlos o borrarlos de tu cuenta. El pipeline de clips usa la misma capa de visión para detectar los momentos destacados, pero el video resultante está bajo tu control, no bajo el de la capa de visión.
Preguntas frecuentes
¿Cómo funciona de verdad la visión de pantalla de Sidekick AI?
¿Con qué juegos funciona la visión de pantalla?
¿La visión de pantalla ralentiza mi juego?
¿Sidekick puede ver el HUD, los menús y las pantallas de inventario?
¿Y los spoilers? ¿Sidekick va a revelar contenido de fases avanzadas?
¿La visión de pantalla es lo mismo que emitir o grabar la pantalla?
¿La visión de pantalla funciona con varios monitores?
¿Puedo apagar la visión de pantalla temporalmente?
¿Sidekick captura fotogramas con inyección de DLL o algo que el anti-cheat marcaría?
¿Puedo usar Sidekick junto a un montaje de directo como OBS?
Related Resources
Chat de Voz
Cómo te habla la capa de coaching: voz que entra, voz que sale, las manos siguen en el control.
Avatar 3D
El compañero VRM en vivo que se sienta junto a tu partida.
Sidekick AI vs. Character.AI
Por qué un chatbot sin visión de pantalla no puede sustituir a un compañero de juego en tiempo real.
¿Listo para jugar más inteligente?
Sidekick AI usa visión por IA para ver tu pantalla y coachearte en tiempo real. Ya disponible gratis en acceso anticipado en Steam.
Juega gratis en Steam