화면 인식

게임을 실시간으로 보는 비전 AI

Sidekick AI의 화면 인식은 플레이 화면을 프레임 단위로 읽어요. 보스도, 페이즈도, 전리품도 동반자가 이미 알고 있어서 음성 코칭이 설명을 기다리지 않고 그 순간에 맞아떨어져요.

Steam에서 무료 플레이

작동 방식

화면을 프레임 단위로 읽어요

동반자는 내가 보는 걸 게임 프레임 속도에 맞춰 봐요. 보스 체력 바, 내 위치, 상자 위에 올린 커서, 방금 뜬 스킬 아이콘 — 전부요.

픽셀이 아니라 게임 상황을 읽어요

비전 AI는 날것의 프레임을 구조화된 이해로 바꿔요. 어떤 게임인지, 어떤 전투인지, 어떤 페이즈인지, 어떤 패턴이 시동을 걸고 있는지. 동반자가 말하는 건 화면이 아니라 상황이에요.

설명이 아니라 순간에 반응해요

동반자가 이미 장면을 보고 있으니 설명하고 답을 기다리는 루프를 통째로 건너뛰어요. 나는 Sidekick의 목소리에 반응하고, Sidekick은 내 게임에 반응해요.

가벼운 로컬 관문, 서버 쪽 분석

어떤 프레임이 분석할 가치가 있는지는 내 PC에서 도는 변화 감지가 판단해요. 세션 중 프레임 대부분은 의미 있을 만큼 바뀌지 않거든요. 관문을 통과한 프레임만 실제 분석을 위해 Sidekick의 비전 모델로 보내져요.

화면 인식이 간판 기능인 이유

AI 게임 동반자는 다들 실시간으로 돕는다고 말해요. 정직한 시험은 설명하지 않아도 동반자가 그 순간에 움직일 수 있느냐예요. 조언을 받기 전에 “체력 절반인데 말레니아가 물새 난격 시작했어”라고 쳐 넣어야 하는 챗봇은 이미 그 순간을 놓쳤어요. 다 치고 나면 전투는 끝나 있어요.

화면 인식은 그 루프를 접어버려요. 동반자는 보스 체력 바를 보고, 물새의 선딜 모션을 보고, 내 스태미나를 보고, 무슨 일이 벌어지는지 내가 말로 옮기기도 전에 회피 타이밍을 목소리로 알려줘요. 실시간 AI 코칭이라는 주장은 통째로 여기에 걸려 있고, 화면 인식이 그걸 마케팅이 아니라 실물로 만드는 부분이에요.

“화면을 읽는다”가 실제로 하는 일

비전 AI는 픽셀을 언어 모델에 그냥 쏟아붓지 않아요. 파이프라인은 가져온 프레임마다 구조화된 신호로 바꿔요. 어떤 게임이 돌고 있는지, 어떤 장면이 떠 있는지, 어떤 UI 요소가 보이는지, 플레이어 캐릭터가 뭘 하고 있는지, 어떤 적이 있는지, 플레이어와 적이 어떤 상태인지. 코칭 레이어가 실제로 따지는 재료가 이 신호예요.

이 구조가 있어서 Sidekick은 두루뭉술한 감상 대신 정확한 판단을 내놔요. “HP 3할, 물러나서 에스트 병 마셔요”라고 말할 수 있는 건 비전 레이어가 HP와 병 개수를 뽑아냈기 때문이지, 모델이 찍었기 때문이 아니에요.

Character.AI, ChatGPT, Replika와 다른 점

대부분의 AI 비서와 챗봇은 내 게임을 못 봐요. Character.AI, ChatGPT, Replika — 어느 쪽도 내가 보는 걸 볼 수 없어요. 설명해 준 게임을 놓고 수다는 떨 수 있지만, 루프가 너무 느려서 플레이 중 코칭은 못 해요.

AI 게임 동반자라는 카테고리가 생긴 건 화면 인식이 가능한 범위를 바꿔놨기 때문이에요. Sidekick AI는 그 변화를 축으로 만들어졌어요. 3D 아바타, 음성 레이어, 그리고 HypeReel 하이라이트 작업 — 이 전부가, 입을 열 때 동반자가 이미 상황을 안다는 비전 레이어의 수준 위에 얹혀 있어요.

비전 파이프라인이 실제로 도는 방식

프레임 캡처는 운영체제 수준에서 일어나요. OBS를 비롯한 캡처 도구가 쓰는 것과 같은 Windows.Graphics.Capture와 Core Graphics 창 캡처 API예요. DLL 인젝션도, 게임 메모리 후킹도, 드라이버 수준 계측도 없어요. 동반자가 게임 프로세스에 붙지 않으니 안티치트 입장에서 Sidekick은 다른 캡처 도구와 다를 게 없어요. 이 설계의 대가는 화면에 그려진 것만 볼 수 있다는 점이고, 대신 게임별 연동 없이 어떤 PC 게임에서도 돌아가요.

프레임을 가져온 뒤에는 내 PC에서 도는 가벼운 변화 감지가 그 프레임을 보낼 값어치가 있는지 판단해요. 세션 중 연속된 프레임은 모델이 새로 할 말이 없을 만큼 비슷한 게 보통이거든요. 관문을 통과한 프레임은 게임을 이해하도록 짜인 코칭 프롬프트와 함께 Sidekick의 비전 언어 모델로 보내져요. 모델은 구조화된 응답(어떤 게임인지, 어떤 장면인지, 어떤 UI가 보이는지, 프레임에 뭐가 있는지, 플레이어가 뭘 하는지)을 돌려줘요. 헤드셋으로 무슨 말을 할지 정할 때 코칭 레이어가 따지는 건 날것의 픽셀이 아니라 이 구조화된 응답이에요. 코칭이 순간에 맞아떨어지는 건 파이프라인이 이런 모양이기 때문이에요. 동반자는 입을 열기 전에 이미 상황을 알고 있어요.

플레이 중에 보이는 것들

구조화된 이해라는 말은 추상적이에요. 구체적인 건 Sidekick이 맞춰진 장르에서 한 세션 동안 동반자가 뭘 짚어줄 수 있느냐예요. 비전 모델은 범용이에요. 아래 요소들을 알아보는 건 큰 멀티모달 모델이 학습 데이터에서 이 게임들을 봤기 때문이지, Sidekick이 게임별 추출기를 넣어서가 아니에요.

소울류 보스전이라면 — 보스의 체력 바와 자세 게이지, 내 HP와 스태미나, 공격 전조가 되는 선딜 모션, 병 개수, 스킬 쿨다운, 보스의 페이즈 전환. 그래서 뻔한 회피 조언 대신 “HP 3할, 지금 병”이나 “물새 모으고 있어요, 첫 연타는 달려서 피해요”라고 말할 수 있어요.

메트로배니아라면 — 미니맵 상태(가본 방, 안 가본 방), 이동 능력, 방금 주운 부적이나 유물 아이콘, 지금 층의 잠긴 문과 열쇠. 그래서 Sidekick은 지도 전체를 스포일러하지 않고 북서쪽 두 화면 앞의 안 가본 방으로 슬쩍 밀어줄 수 있어요.

RPG 턴 중이라면 — 행동 순서, 스킬 쿨다운과 자원 수치, 화면에 뜬 대화 선택지, 전투장의 환경 위험, 각 캐릭터에 붙은 상태이상 아이콘. 그래서 클릭하기 전에 “그 파이어볼 쓰면 원소 지면에 불붙어요, 아군이 거기 서 있어요”라고 짚어줄 수 있어요.

서바이벌 호러라면 — 탄약 수, 허브나 회복 아이템 보유량, 세이브 타자기 여부, 레이더 위 적 위치, 무기 상태. 그래서 뻔한 아껴 쓰라는 조언 대신 “권총탄 네 발에 초록 허브 하나 남았어요, 다음 상인은 교회 지나서예요”라고 말할 수 있어요.

프라이버시와 통제 — 동반자가 보는 것과 못 보는 것

Sidekick이 읽는 건 내가 지정한 면뿐이에요. 멀티 모니터 환경에서는 동반자가 볼 창이나 디스플레이를 직접 고르고요. Discord, OBS, 공략 위키 탭, 메일을 띄운 두 번째 모니터는 사적인 공간으로 남아요. 비전 레이어가 고르지 않은 창에 손을 뻗는 일은 없어요.

비전 일시정지는 클릭 한 번이에요. 멈추면 동반자는 계속 대화하지만 화면을 가져오거나 분석하지 않아요. 스포일러 근처 코멘트 없이 보고 싶은 컷신, 코칭이 실례가 되는 스토리 장면, 아니면 분석 없이 그냥 같이 있어주길 바랄 때 쓸 만해요. 일시정지는 세션 단위 설정이라 다음 실행은 기본 상태로 시작해요.

HypeReel 클립은 따로 켜는 별개의 흐름이에요. 그 클립이 존재하는 건 저장할 값어치가 있는 하이라이트라고 내가 만들라고 했기 때문이고, 남기든 편집하든 공유하든 계정에서 지우든 전부 내 몫이에요. 하이라이트 감지에는 같은 비전 레이어를 쓰지만, 완성된 영상을 쥐고 있는 건 비전 레이어가 아니라 나예요.

자주 묻는 질문

Sidekick AI의 화면 인식은 실제로 어떻게 작동하나요?
Sidekick은 일정한 간격으로 플레이 중인 창에서 프레임을 가져와, 게임을 이해하도록 짜인 코칭 프롬프트와 함께 비전 언어 모델에 넣어요. 모델은 화면에 있는 것 — 게임, 장면, 진행 중인 패턴, 플레이어 상태 — 을 짚어내고 그 구조화된 이해를 코칭 레이어로 넘겨요. 무엇을 말할지, 아니면 아무 말도 안 할지는 코칭 레이어가 정해요. 그래서 나오는 건 일반론이 아니라 지금 실제로 벌어지는 일에 맞는 음성 팁이에요.
화면 인식은 어떤 게임에서 되나요?
일반적인 창으로 도는 PC 게임이면 다 돼요. 비전 레이어는 게임 내부 상태가 아니라 그려진 화면을 읽으니까 게임별 연동 작업이 필요 없어요. 체험이 가장 날카로운 쪽은 싱글과 협동 타이틀이에요. 코칭 내용도 거기에 맞춰 다듬어져 있거든요 — Elden Ring, Baldur's Gate 3, Hollow Knight, Dark Souls 3, Resident Evil 4, Silent Hill 2, Lethal Company, Phasmophobia, Minecraft 등.
화면 인식 때문에 게임이 느려지지 않나요?
대부분의 환경에서 잴 수 있을 만한 영향은 없어요. 프레임 캡처는 가볍고, 게임의 렌더 루프 바깥에서 일어나요. 비전 분석은 별도 스레드나 별도 장치에서 돌고요. 프레임레이트와 입력 지연이 원래 자리에 그대로 있도록 설계했어요. 가치는 코칭이지 병목이 아니니까요.
HUD, 메뉴, 인벤토리 화면도 보나요?
네. 비전 레이어는 그려진 프레임 전체를 읽어서 체력 바, 미니맵, 인벤토리 칸, 대화 상자 같은 UI 요소도 포함해요. 그래서 Sidekick이 “체력 3할이에요, 일단 빠져요”라거나 “그 전리품에 있는 주문서는 주울 값어치가 있어요” 같은 말을 할 수 있어요.
스포일러는요? 후반 내용을 먼저 말해버리지 않나요?
코칭 레이어는 지금 화면에 있는 것을 두고 말하도록 맞춰져 있고, 아직 도달하지 않은 내용을 먼저 꺼내지 않아요. 스토리 장면이 터지려는 순간에 앞질러 말하지도 않고요. 해법이 후반 요소와 얽힌 퍼즐에서 직접 도움을 청하면, 동반자가 그 점을 먼저 알려주고 어떻게 할지는 직접 정하게 해요.
화면 인식은 스트리밍이나 화면 녹화와 다른가요?
달라요. 스트리밍 도구는 화면을 잡아서 불특정 다수에게 내보내요. 화면 녹화는 화면을 로컬 파일로 저장하고요. Sidekick의 화면 인식이 실시간으로 프레임을 가져오는 건 코칭 레이어가 그 순간에 움직일 수 있게 하기 위해서예요. 목표는 헤드셋에 들리는 음성 팁이지 방송도 저장된 영상도 아니에요. Sidekick은 지금 쓰는 스트리밍 환경을 대체하는 게 아니라 옆에서 같이 돌도록 만들어졌어요.
멀티 모니터 환경에서도 되나요?
네. Sidekick이 어떤 창이나 디스플레이를 읽을지는 직접 골라요. 동반자는 지정한 면만 보니까 Discord, OBS, 공략 위키 탭을 띄운 두 번째 모니터는 그대로 사적인 공간이에요.
화면 인식을 잠깐 꺼둘 수 있나요?
네. 비전 캡처를 일시정지하는 토글이 눈에 띄게 있어요. 멈춘 동안에도 동반자는 계속 말하지만 화면 얘기는 그만둬요. 컷신, 스토리 장면, 아니면 코칭 없이 그냥 곁에 있어주길 바랄 때 쓸 만해요.
Sidekick은 DLL 인젝션처럼 안티치트가 걸고넘어질 방식으로 프레임을 가져오나요?
아니요. Sidekick은 OBS 같은 화면 캡처 도구와 똑같은 방식 — 운영체제 표준 창 캡처 API — 으로 게임 창을 읽어요. DLL 인젝션도, 게임 메모리 후킹도, 드라이버 수준 계측도 없어요. 안티치트 입장에서 Sidekick은 그냥 데스크톱 앱이고, 실제로도 그게 전부예요. 동반자가 게임 프로세스에 손대는 일은 없어요.
OBS 같은 스트리밍 환경과 같이 돌릴 수 있나요?
네. Sidekick은 게임 창에서 가져오고, OBS는 내가 짜 둔 장면에서 가져와요. 같은 면을 두고 다투지 않아서 서로 망가뜨리지 않고 동시에 돌아가요. 동반자를 방송에 올리고 싶으면 아바타 창을 창 소스로, Sidekick의 음성 출력을 오디오 소스로 OBS에 넣으면 돼요.

더 똑똑하게 플레이할 준비됐어?

Sidekick AI는 비전 AI로 화면을 보면서 실시간으로 코칭해줘. 지금 Steam 앞서 해보기에서 무료로 플레이할 수 있어.

Steam에서 무료 플레이