屏幕视觉
实时看着你游戏的视觉 AI
Sidekick AI 的屏幕视觉逐帧读你的游戏过程。伙伴已经知道是哪个 BOSS、打到第几阶段、掉了什么,所以语音指导贴着当下的瞬间,而不是等你把情况描述一遍。
在Steam免费畅玩工作原理
逐帧读你的屏幕
伙伴按原生帧率看到你看到的东西。BOSS 血条、你的站位、光标停在宝箱上、刚亮起来的技能图标——全都在内。
识别的是游戏状态,不只是像素
视觉 AI 把原始画面变成结构化理解:哪款游戏、哪场战斗、第几阶段、哪个机制正在起手。伙伴谈的是局势,不是屏幕。
对当下反应,而不是对描述反应
因为伙伴本来就看得见这一幕,你直接跳过了“先描述、再回应”的整个循环。你对 Sidekick 的声音做反应,Sidekick 对你的游戏做反应。
本机轻量筛选,服务端负责分析
一个变化检测跑在你自己的机器上,判断哪些帧值得分析——一局里大多数帧的变化根本不足以说明什么。过了这道闸的帧,才会送到 Sidekick 的视觉模型去做真正的分析。
为什么屏幕视觉是这个产品的头号功能
每个 AI 游戏伙伴都说自己能实时帮上忙。诚实的检验只有一条:不用你描述,它能不能对当下做出反应。一个要你先打出“我血量剩一半,玛莲妮亚刚起手水鸟乱舞”才肯给建议的聊天机器人,早就错过了那个瞬间。等你打完字,这场架已经结束了。
屏幕视觉把这个循环压没了。伙伴看得见 BOSS 血条,看得见水鸟的抬手动作,看得见你的耐力,在你还来不及把话说清楚之前,就用语音喊出翻滚时机。这才是实时 AI 指导真正的卖点,而屏幕视觉是让它落地、而不是停在宣传语上的东西。
“读你的屏幕”具体是什么意思
视觉 AI 不是把像素一股脑丢进语言模型。整条管线会把每一帧采集到的画面变成结构化信号:现在跑的是哪款游戏、屏幕上是什么场景、有哪些界面元素、角色在做什么、场上有哪些敌人、玩家和敌人各处在什么状态。指导层真正拿来推理的,就是这些信号。
正因为有这层结构,Sidekick 才能给出精确的判断,而不是含糊的观察。它能说“你只剩 30% 血,先脱离喝药”,是因为视觉层把你的血量和药瓶数量提取了出来——不是模型在猜。
Sidekick 跟 Character.AI、ChatGPT、Replika 的区别在哪
大多数 AI 助手和聊天机器人对你的游戏是瞎的。Character.AI、ChatGPT、Replika——它们都看不到你看到的东西。你描述一款游戏,它们可以陪你聊,但没法在你玩的时候指导你,因为这个循环太慢了。
AI 游戏伙伴这个品类之所以存在,是因为屏幕视觉改变了可能的边界。Sidekick AI 就是围着这个变化做出来的。3D 形象、语音层,还有HypeReel 高光工作流,全都建立在同一件事上:视觉层足够好,好到伙伴一开口就已经知道现在发生了什么。
视觉管线到底是怎么跑的
画面采集发生在操作系统这一层——用的就是 OBS 和其他画面采集工具在用的 Windows.Graphics.Capture 与 Core Graphics 窗口捕获接口。没有 DLL 注入,没有游戏内存钩子,没有驱动层插桩。伙伴从不挂进你游戏的进程,所以反作弊看 Sidekick 就跟看别的画面采集工具一样。这个设计的代价是它只看得见渲染到你屏幕上的东西;好处是任何 PC 游戏都能用,不需要逐款做适配。
画面采下来之后,本机会跑一个很轻的变化检测,判断这一帧值不值得发出去——一局里绝大多数连续帧长得太像,模型根本没有新东西可说。过了这道闸的帧,会带着一个懂游戏的指导提示词送到 Sidekick 的视觉语言模型。模型返回的是结构化结果:哪款游戏、什么场景、界面上有什么、画面里有哪些实体、玩家在做什么。指导层拿来推理的是这份结构化结果,而不是原始像素,然后才决定在你耳机里说什么。管线长成这样,正是指导能贴住当下的原因——伙伴在开口之前就已经知道情况了。
实际玩起来它都看见了什么
“结构化理解”这几个字太抽象。具体的版本,是伙伴在 Sidekick 调校过的那些品类里,一局下来能喊出什么。视觉模型本身是通用的;它认得下面这些元素,是因为大型多模态模型在训练数据里见过这些游戏,而不是因为 Sidekick 内置了逐款游戏的提取器。
魂系 BOSS 战里——BOSS 的血条和削韧条、你的血量和耐力、预示下一击的抬手动作、你还剩几瓶药、技能冷却、BOSS 的阶段转换。所以 Sidekick 能说“你只剩 30%,现在喝药”或者“水鸟起手了,第一段先跑”,而不是泛泛地叫你翻滚。
银河恶魔城里——小地图状态(走过哪些房间、哪些还没探)、你的移动能力、你刚捡到的护符或遗物图标、当前楼层那些要钥匙的门。所以 Sidekick 能把你往西北方向两个屏幕外那间没探过的房间引,又不至于把整张图剧透掉。
回合制 RPG 里——出手顺序、技能冷却和资源数量、屏幕上的对话选项、这场战斗里的环境危险、每个单位身上的状态图标。所以伙伴能在你点下去之前提醒你:“这发火球会点燃地上的元素表面,你队友还站在上面。”
生存恐怖里——子弹数量、草药或治疗道具的存量、存档打字机还能不能用、雷达上的敌人位置、武器的耐久状态。所以 Sidekick 能说“手枪剩四发,绿草一株,过了教堂就有下一个商人”,而不是泛泛地跟你说资源紧张。
隐私与控制权——伙伴看得见什么,看不见什么
Sidekick 只读你指给它的那块画面。多显示器的机器上,由你选伙伴看哪个窗口或哪块屏幕;另一台显示器上开着的 Discord、OBS、wiki 页面或者邮箱,都不在它的视野里。视觉层从不伸手去看你没有选中的窗口。
暂停视觉只要点一下。暂停之后伙伴照样能聊天,但不再采集也不再分析画面——过场动画想干干净净地看完、剧情时刻不想被指导打扰、或者只是想有人陪着而不需要分析的时候,都用得上。暂停是单次会话内的控制项;下次启动会回到你的默认状态。
HypeReel 剪辑是另一条独立的、要你主动开启的流程。那些片段之所以存在,是因为你自己触发了它们——某个值得留下来的高光——之后要留着、要剪、要分享还是从账号里删掉,都归你。剪辑管线用的是同一套视觉层来找高光,但产出的视频归你控制,不归视觉层。
常见问题
Sidekick AI 的屏幕视觉到底是怎么工作的?
屏幕视觉支持哪些游戏?
屏幕视觉会让游戏变卡吗?
Sidekick 看得到 HUD、菜单和背包界面吗?
剧透怎么办?Sidekick 会说出后期内容吗?
屏幕视觉跟直播或者录屏是一回事吗?
多显示器的机器能用吗?
可以临时关掉屏幕视觉吗?
Sidekick 会用 DLL 注入之类反作弊会标记的手段来采集画面吗?
可以跟 OBS 这样的直播方案一起跑吗?
Related Resources
准备好更聪明地玩了吗?
Sidekick AI用视觉AI实时观察你的屏幕并为你提供指导。现已在Steam抢先体验,免费游玩。
在Steam免费畅玩