화면 인식
게임을 실시간으로 보는 비전 AI
Sidekick AI의 화면 인식은 플레이 화면을 프레임 단위로 읽어요. 보스도, 페이즈도, 전리품도 동반자가 이미 알고 있어서 음성 코칭이 설명을 기다리지 않고 그 순간에 맞아떨어져요.
Steam에서 무료 플레이작동 방식
화면을 프레임 단위로 읽어요
동반자는 내가 보는 걸 게임 프레임 속도에 맞춰 봐요. 보스 체력 바, 내 위치, 상자 위에 올린 커서, 방금 뜬 스킬 아이콘 — 전부요.
픽셀이 아니라 게임 상황을 읽어요
비전 AI는 날것의 프레임을 구조화된 이해로 바꿔요. 어떤 게임인지, 어떤 전투인지, 어떤 페이즈인지, 어떤 패턴이 시동을 걸고 있는지. 동반자가 말하는 건 화면이 아니라 상황이에요.
설명이 아니라 순간에 반응해요
동반자가 이미 장면을 보고 있으니 설명하고 답을 기다리는 루프를 통째로 건너뛰어요. 나는 Sidekick의 목소리에 반응하고, Sidekick은 내 게임에 반응해요.
가벼운 로컬 관문, 서버 쪽 분석
어떤 프레임이 분석할 가치가 있는지는 내 PC에서 도는 변화 감지가 판단해요. 세션 중 프레임 대부분은 의미 있을 만큼 바뀌지 않거든요. 관문을 통과한 프레임만 실제 분석을 위해 Sidekick의 비전 모델로 보내져요.
화면 인식이 간판 기능인 이유
AI 게임 동반자는 다들 실시간으로 돕는다고 말해요. 정직한 시험은 설명하지 않아도 동반자가 그 순간에 움직일 수 있느냐예요. 조언을 받기 전에 “체력 절반인데 말레니아가 물새 난격 시작했어”라고 쳐 넣어야 하는 챗봇은 이미 그 순간을 놓쳤어요. 다 치고 나면 전투는 끝나 있어요.
화면 인식은 그 루프를 접어버려요. 동반자는 보스 체력 바를 보고, 물새의 선딜 모션을 보고, 내 스태미나를 보고, 무슨 일이 벌어지는지 내가 말로 옮기기도 전에 회피 타이밍을 목소리로 알려줘요. 실시간 AI 코칭이라는 주장은 통째로 여기에 걸려 있고, 화면 인식이 그걸 마케팅이 아니라 실물로 만드는 부분이에요.
“화면을 읽는다”가 실제로 하는 일
비전 AI는 픽셀을 언어 모델에 그냥 쏟아붓지 않아요. 파이프라인은 가져온 프레임마다 구조화된 신호로 바꿔요. 어떤 게임이 돌고 있는지, 어떤 장면이 떠 있는지, 어떤 UI 요소가 보이는지, 플레이어 캐릭터가 뭘 하고 있는지, 어떤 적이 있는지, 플레이어와 적이 어떤 상태인지. 코칭 레이어가 실제로 따지는 재료가 이 신호예요.
이 구조가 있어서 Sidekick은 두루뭉술한 감상 대신 정확한 판단을 내놔요. “HP 3할, 물러나서 에스트 병 마셔요”라고 말할 수 있는 건 비전 레이어가 HP와 병 개수를 뽑아냈기 때문이지, 모델이 찍었기 때문이 아니에요.
Character.AI, ChatGPT, Replika와 다른 점
대부분의 AI 비서와 챗봇은 내 게임을 못 봐요. Character.AI, ChatGPT, Replika — 어느 쪽도 내가 보는 걸 볼 수 없어요. 설명해 준 게임을 놓고 수다는 떨 수 있지만, 루프가 너무 느려서 플레이 중 코칭은 못 해요.
AI 게임 동반자라는 카테고리가 생긴 건 화면 인식이 가능한 범위를 바꿔놨기 때문이에요. Sidekick AI는 그 변화를 축으로 만들어졌어요. 3D 아바타, 음성 레이어, 그리고 HypeReel 하이라이트 작업 — 이 전부가, 입을 열 때 동반자가 이미 상황을 안다는 비전 레이어의 수준 위에 얹혀 있어요.
비전 파이프라인이 실제로 도는 방식
프레임 캡처는 운영체제 수준에서 일어나요. OBS를 비롯한 캡처 도구가 쓰는 것과 같은 Windows.Graphics.Capture와 Core Graphics 창 캡처 API예요. DLL 인젝션도, 게임 메모리 후킹도, 드라이버 수준 계측도 없어요. 동반자가 게임 프로세스에 붙지 않으니 안티치트 입장에서 Sidekick은 다른 캡처 도구와 다를 게 없어요. 이 설계의 대가는 화면에 그려진 것만 볼 수 있다는 점이고, 대신 게임별 연동 없이 어떤 PC 게임에서도 돌아가요.
프레임을 가져온 뒤에는 내 PC에서 도는 가벼운 변화 감지가 그 프레임을 보낼 값어치가 있는지 판단해요. 세션 중 연속된 프레임은 모델이 새로 할 말이 없을 만큼 비슷한 게 보통이거든요. 관문을 통과한 프레임은 게임을 이해하도록 짜인 코칭 프롬프트와 함께 Sidekick의 비전 언어 모델로 보내져요. 모델은 구조화된 응답(어떤 게임인지, 어떤 장면인지, 어떤 UI가 보이는지, 프레임에 뭐가 있는지, 플레이어가 뭘 하는지)을 돌려줘요. 헤드셋으로 무슨 말을 할지 정할 때 코칭 레이어가 따지는 건 날것의 픽셀이 아니라 이 구조화된 응답이에요. 코칭이 순간에 맞아떨어지는 건 파이프라인이 이런 모양이기 때문이에요. 동반자는 입을 열기 전에 이미 상황을 알고 있어요.
플레이 중에 보이는 것들
구조화된 이해라는 말은 추상적이에요. 구체적인 건 Sidekick이 맞춰진 장르에서 한 세션 동안 동반자가 뭘 짚어줄 수 있느냐예요. 비전 모델은 범용이에요. 아래 요소들을 알아보는 건 큰 멀티모달 모델이 학습 데이터에서 이 게임들을 봤기 때문이지, Sidekick이 게임별 추출기를 넣어서가 아니에요.
소울류 보스전이라면 — 보스의 체력 바와 자세 게이지, 내 HP와 스태미나, 공격 전조가 되는 선딜 모션, 병 개수, 스킬 쿨다운, 보스의 페이즈 전환. 그래서 뻔한 회피 조언 대신 “HP 3할, 지금 병”이나 “물새 모으고 있어요, 첫 연타는 달려서 피해요”라고 말할 수 있어요.
메트로배니아라면 — 미니맵 상태(가본 방, 안 가본 방), 이동 능력, 방금 주운 부적이나 유물 아이콘, 지금 층의 잠긴 문과 열쇠. 그래서 Sidekick은 지도 전체를 스포일러하지 않고 북서쪽 두 화면 앞의 안 가본 방으로 슬쩍 밀어줄 수 있어요.
RPG 턴 중이라면 — 행동 순서, 스킬 쿨다운과 자원 수치, 화면에 뜬 대화 선택지, 전투장의 환경 위험, 각 캐릭터에 붙은 상태이상 아이콘. 그래서 클릭하기 전에 “그 파이어볼 쓰면 원소 지면에 불붙어요, 아군이 거기 서 있어요”라고 짚어줄 수 있어요.
서바이벌 호러라면 — 탄약 수, 허브나 회복 아이템 보유량, 세이브 타자기 여부, 레이더 위 적 위치, 무기 상태. 그래서 뻔한 아껴 쓰라는 조언 대신 “권총탄 네 발에 초록 허브 하나 남았어요, 다음 상인은 교회 지나서예요”라고 말할 수 있어요.
프라이버시와 통제 — 동반자가 보는 것과 못 보는 것
Sidekick이 읽는 건 내가 지정한 면뿐이에요. 멀티 모니터 환경에서는 동반자가 볼 창이나 디스플레이를 직접 고르고요. Discord, OBS, 공략 위키 탭, 메일을 띄운 두 번째 모니터는 사적인 공간으로 남아요. 비전 레이어가 고르지 않은 창에 손을 뻗는 일은 없어요.
비전 일시정지는 클릭 한 번이에요. 멈추면 동반자는 계속 대화하지만 화면을 가져오거나 분석하지 않아요. 스포일러 근처 코멘트 없이 보고 싶은 컷신, 코칭이 실례가 되는 스토리 장면, 아니면 분석 없이 그냥 같이 있어주길 바랄 때 쓸 만해요. 일시정지는 세션 단위 설정이라 다음 실행은 기본 상태로 시작해요.
HypeReel 클립은 따로 켜는 별개의 흐름이에요. 그 클립이 존재하는 건 저장할 값어치가 있는 하이라이트라고 내가 만들라고 했기 때문이고, 남기든 편집하든 공유하든 계정에서 지우든 전부 내 몫이에요. 하이라이트 감지에는 같은 비전 레이어를 쓰지만, 완성된 영상을 쥐고 있는 건 비전 레이어가 아니라 나예요.
자주 묻는 질문
Sidekick AI의 화면 인식은 실제로 어떻게 작동하나요?
화면 인식은 어떤 게임에서 되나요?
화면 인식 때문에 게임이 느려지지 않나요?
HUD, 메뉴, 인벤토리 화면도 보나요?
스포일러는요? 후반 내용을 먼저 말해버리지 않나요?
화면 인식은 스트리밍이나 화면 녹화와 다른가요?
멀티 모니터 환경에서도 되나요?
화면 인식을 잠깐 꺼둘 수 있나요?
Sidekick은 DLL 인젝션처럼 안티치트가 걸고넘어질 방식으로 프레임을 가져오나요?
OBS 같은 스트리밍 환경과 같이 돌릴 수 있나요?
Related Resources
더 똑똑하게 플레이할 준비됐어?
Sidekick AI는 비전 AI로 화면을 보면서 실시간으로 코칭해줘. 지금 Steam 앞서 해보기에서 무료로 플레이할 수 있어.
Steam에서 무료 플레이