螢幕視覺

即時看著你遊戲的視覺 AI

Sidekick AI 的螢幕視覺逐格讀你的遊戲過程。夥伴已經知道是哪隻 BOSS、打到第幾階段、掉了什麼,所以語音指導貼著當下的瞬間,而不是等你把狀況描述一遍。

在Steam免費暢玩

運作方式

逐格讀你的螢幕

夥伴用原生影格率看到你看到的東西。BOSS 血條、你的站位、游標停在寶箱上、剛亮起來的技能圖示——全都算在內。

辨識的是遊戲狀態,不只是像素

視覺 AI 把原始畫面變成結構化理解:哪款遊戲、哪場戰鬥、第幾階段、哪個機制正在起手。夥伴談的是局勢,不是螢幕。

對當下反應,而不是對描述反應

因為夥伴本來就看得見這一幕,你直接跳過了「先描述、再回應」的整個循環。你對 Sidekick 的聲音做反應,Sidekick 對你的遊戲做反應。

本機輕量篩選,伺服器端負責分析

一個變化偵測跑在你自己的電腦上,判斷哪些畫面值得分析——一場下來大多數畫面的變化都小到無關緊要。過了這道閘的畫面,才會送到 Sidekick 的視覺模型去做真正的分析。

為什麼螢幕視覺是這個產品的頭號功能

每個 AI 遊戲夥伴都說自己能即時幫上忙。誠實的檢驗只有一條:不用你描述,它能不能對當下做出反應。一個要你先打出「我血量剩一半,瑪蓮妮亞剛起手水鳥亂舞」才肯給建議的聊天機器人,早就錯過那個瞬間了。等你打完字,這場架已經結束了。

螢幕視覺把這個循環壓沒了。夥伴看得見 BOSS 血條,看得見水鳥的抬手動作,看得見你的耐力,在你還來不及把話講清楚之前,就用語音喊出翻滾時機。這才是即時 AI 指導真正的賣點,而螢幕視覺是讓它落地、而不是停在文案上的東西。

「讀你的螢幕」具體是什麼意思

視覺 AI 不是把像素一股腦丟進語言模型。整條管線會把每一格擷取到的畫面變成結構化訊號:現在跑的是哪款遊戲、螢幕上是什麼場景、有哪些介面元素、玩家角色在做什麼、場上有哪些敵人、玩家和敵人各處在什麼狀態。指導層真正拿來推理的,就是這些訊號。

正因為有這層結構,Sidekick 才給得出精確的判斷,而不是含糊的觀察。它講得出「你只剩 30% 血,先脫離,喝原素瓶」,是因為視覺層把你的血量和藥瓶數量抓了出來——不是模型在猜。

Sidekick 跟 Character.AI、ChatGPT、Replika 的差別在哪

大多數 AI 助手和聊天機器人對你的遊戲是瞎的。Character.AIChatGPTReplika——它們都看不到你看到的東西。你描述一款遊戲,它們可以陪你聊,但沒辦法在你玩的時候指導你,因為這個循環太慢了。

AI 遊戲夥伴這個類別之所以存在,是因為螢幕視覺改變了可能的邊界。Sidekick AI 就是繞著這個改變做出來的。3D 角色、語音層,還有HypeReel 精華工作流,全都建立在同一件事上:視覺層夠好,好到夥伴一開口就已經知道現在發生了什麼。

視覺管線到底是怎麼跑的

畫面擷取發生在作業系統這一層——用的就是 OBS 和其他擷取工具在用的 Windows.Graphics.Capture 與 Core Graphics 視窗擷取 API。沒有 DLL 注入,沒有遊戲記憶體掛鉤,也沒有動到驅動層級。夥伴從來不掛進你遊戲的行程,所以反作弊看 Sidekick 就跟看別的擷取工具一樣。這個設計的代價是它只看得見算圖到你螢幕上的東西;好處是任何 PC 遊戲都能用,不需要逐款做整合。

畫面擷取下來之後,本機會跑一個很輕的變化偵測,判斷這一格值不值得送出去——一場下來絕大多數連續畫面長得太像,模型根本沒有新東西可講。過了這道閘的畫面,會帶著一個懂遊戲的指導提示詞送到 Sidekick 的視覺語言模型。模型回傳的是結構化結果:哪款遊戲、什麼場景、介面上有什麼、畫面裡有哪些實體、玩家在做什麼。指導層拿來推理的是這份結構化結果,而不是原始像素,然後才決定在你耳機裡講什麼。管線長成這樣,正是指導能貼住當下的原因——夥伴在開口之前就已經知道狀況了。

實際玩起來它都看見了什麼

「結構化理解」這幾個字太抽象。具體的版本,是夥伴在 Sidekick 調校過的那些類型裡,一場下來喊得出什麼。視覺模型本身是通用的;它認得下面這些元素,是因為大型多模態模型在訓練資料裡看過這些遊戲,而不是因為 Sidekick 內建了逐款遊戲的擷取器。

魂系 BOSS 戰裡——BOSS 的血條和削韌條、你的血量和耐力、預告下一擊的抬手動作、你還剩幾瓶藥、技能冷卻、BOSS 的階段轉換。所以 Sidekick 講得出「你只剩 30%,現在補血」或者「水鳥起手了,第一段先跑」,而不是泛泛地叫你翻滾。

銀河惡魔城裡——小地圖狀態(走過哪些房間、哪些還沒探)、你的移動能力、你剛撿到的護符或遺物圖示、當前樓層那些要鑰匙的門。所以 Sidekick 能把你往西北方向兩個畫面外那間沒探過的房間帶,又不至於把整張圖劇透掉。

回合制 RPG 裡——出手順序、技能冷卻和資源數量、螢幕上的對話選項、這場戰鬥裡的環境危險、每個單位身上的狀態圖示。所以夥伴能在你點下去之前提醒你:「這發火球會點燃地上的元素表面,你隊友還站在裡面。」

生存恐怖裡——子彈數量、藥草或治療道具的存量、存檔打字機還能不能用、雷達上的敵人位置、武器的耐久狀態。所以 Sidekick 講得出「手槍剩四發,綠草一株,過了教堂就有下一個商人」,而不是泛泛地跟你說資源吃緊。

隱私與控制權——夥伴看得見什麼,看不見什麼

Sidekick 只讀你指給它的那塊畫面。多螢幕的機器上,由你選夥伴看哪個視窗或哪個螢幕;另一個螢幕上開著的 Discord、OBS、wiki 分頁或者信箱,都不在它的視野裡。視覺層從來不會伸手去看你沒有選到的視窗。

暫停視覺只要點一下。暫停之後夥伴照樣能聊天,但不再擷取也不再分析畫面——過場動畫想乾乾淨淨地看完、劇情時刻不想被指導打擾、或者只是想要有人陪著而不需要分析的時候,都用得上。暫停是單次對話內的控制項;下次啟動會回到你的預設狀態。

HypeReel 剪輯是另一條獨立、要你自己開啟的流程。那些片段之所以存在,是因為你自己觸發了它們——某個值得留下來的精華——之後要留著、要剪、要分享還是從帳號裡刪掉,都歸你。剪輯管線用的是同一套視覺層來找精華,但產出的影片歸你控制,不歸視覺層。

常見問題

Sidekick AI 的螢幕視覺到底是怎麼運作的?
Sidekick 會按固定節奏從你的遊戲視窗擷取畫面,送進一個帶著懂遊戲的指導提示詞的視覺語言模型。模型辨識出螢幕上有什麼——哪款遊戲、什麼場景、正在觸發哪個機制、玩家什麼狀態——再把這份結構化理解交給指導層。要不要講、講什麼,由指導層決定。結果就是語音提示貼著真正在發生的事情,而不是罐頭建議。
螢幕視覺支援哪些遊戲?
任何跑在一般視窗裡的 PC 遊戲。視覺層讀的是算圖出來的畫面,而不是遊戲內部狀態,所以不需要逐款做整合。單人和合作類的體驗最銳利,因為指導內容就是照著它們調的——《艾爾登法環》《柏德之門 3》《空洞騎士》《黑暗靈魂 3》《惡靈古堡 4》《沉默之丘 2》《致命公司》《恐鬼症》《Minecraft》等等。
螢幕視覺會讓遊戲變卡嗎?
在大多數配備上量不出影響。畫面擷取很輕,而且發生在遊戲算圖迴圈之外。視覺分析跑在另外的執行緒或裝置上。Sidekick 的設計前提就是你的 FPS 和輸入延遲維持原樣——指導是價值,不該變成瓶頸。
Sidekick 看得到 HUD、選單和道具欄嗎?
看得到。視覺層讀的是整張算圖畫面,包括血條、小地圖、道具欄格子、對話框這些介面元素。所以 Sidekick 才講得出「你只剩 30% 血,先退」或者「掉落裡那卷法術卷軸值得撿」這種話。
劇透怎麼辦?Sidekick 會講出後期內容嗎?
指導層是調過的:它只談現在螢幕上的東西,不會主動交代你還沒走到的內容。劇情節點快要觸發的時候,Sidekick 不會搶在前面。如果你主動問一個解法牽涉到後期內容的謎題,夥伴會先提醒你一聲,再讓你自己決定。
螢幕視覺跟實況或錄影是同一回事嗎?
不是。實況軟體把你的螢幕擷取下來推給公開觀眾。錄影把你的螢幕存成本機檔案。Sidekick 的螢幕視覺是即時擷取畫面,好讓指導層對當下做出反應——目標是耳機裡的語音提示,不是一場實況,也不是一支存下來的影片。Sidekick 是設計成跟你現有的實況環境共存的,不是來取代它的。
多螢幕的機器能用嗎?
可以。由你選 Sidekick 讀哪個視窗或哪個螢幕。夥伴只看得見你指給它的那一塊,所以第二個螢幕上開著的 Discord、OBS 或者 wiki 分頁都是私密的。
可以暫時把螢幕視覺關掉嗎?
可以。有一個很清楚的開關能暫停畫面擷取。暫停期間夥伴照樣講話,但不再提螢幕上的東西——過場動畫、劇情時刻,或者你只是想要有人陪著而不需要指導的時候,都用得上。
Sidekick 會用 DLL 注入之類反作弊會標記的手法擷取畫面嗎?
不會。Sidekick 讀遊戲視窗的方式跟 OBS 或任何螢幕擷取工具一樣——用作業系統標準的視窗擷取 API。沒有 DLL 注入,沒有遊戲記憶體掛鉤,也沒有動到驅動層級。反作弊系統看 Sidekick 就是一支普通的桌面程式,因為它本來就是。夥伴從來不碰遊戲的行程。
可以跟 OBS 這類實況環境一起跑嗎?
可以。Sidekick 從遊戲視窗擷取,OBS 從你自己排的場景擷取。兩邊不搶同一個來源,可以同時跑而互不影響。想讓夥伴上實況的話,角色視窗和 Sidekick 的語音輸出都能當成視窗來源和音訊來源接進 OBS。

準備好玩得更聰明了嗎?

Sidekick AI用視覺AI即時觀察你的螢幕,並為你提供即時指引。現已在Steam搶先體驗,免費遊玩。

在Steam免費暢玩