3D 形象
有情绪、有动作的实时 VRM 伙伴
Sidekick AI 以一个真正的 3D 形象活在你游戏旁边——会动,有表情,真的在场。这就是“用一个工具”和“跟队友一起玩”的区别。
在Steam免费畅玩工作原理
完整的 3D VRM 形象
真正的 3D 模型,在你游戏旁边的悬浮窗口里实时渲染。不是头像,不是立绘,不是一张静态图——是有骨骼、有表情、真的在场的一个身体。
情绪和动作
形象会反应:你打出神操作时它笑,你死掉时它皱眉,会指着你屏幕上的东西,打 BOSS 的时候会往前凑。这些反应你是真的感觉得到,因为你看得见。
口型跟着语音层走
嘴型跟音频对得上。你听到的那句提示,是从一张真的在说这句话的脸上出来的,不是一个没有身体的喇叭。
伙伴可以自己挑
挑一个、或者调一个符合你想要的氛围的形象。伙伴的身份在每一局之间是连续的,不会每次都从头开始。
为什么“在场感”是功能,不是装饰
3D 形象是 Sidekick AI 里最不动声色、但最有主张的一个选择。大多数 AI 产品把视觉层当 logo 处理——一张头像、一个聊天气泡,最多一个 2D 角色。Sidekick 把它当成一个有身体的队友。差别就在“在场感”:有人在跟你一起玩,而不只是在对你说话。
在场感是只有语音给不了的东西。语音给你信息,形象给你陪伴。到了凌晨两点你打开 Sidekick 硬啃一个难 BOSS 的那种时刻,陪伴反而比信息更重要。
反应是怎么来的
屏幕视觉会标出值得一提的瞬间——击杀 BOSS、极限翻滚、阵亡、稀有掉落、致命一击、一场新战斗的开始。这些信号会和语音一起送到形象层。形象的表情、姿态和动作接住这个瞬间。你又一次死在玛莲妮亚手上,伙伴叹了口气。你终于打过了,形象把手举了起来。这些都没人解说——你就是看见了。
反应的时机是照着“一个队友注意到了什么”来调的,不是照着卡通来调的。它不会为每一次击杀欢呼,也不会为每一次挨打皱眉。它只对真正重要的瞬间做反应,一局下来通常比你以为的少。
形象和头像——这是品类差别
游戏圈里别的 AI 伙伴大多靠 2D 头像、静态立绘或者风格化的聊天窗。那些用来聊天没问题,但给不了“有个队友就在这一局里”的体感。一个会动、会表达、会反应的 3D VRM 形象是实打实不同的产品形态——离虚拟主播更近,离聊天机器人更远;离合作队友更近,离工具更远。更长的对比在这里:Sidekick AI 对比 Character.AI 和 Sidekick AI 对比 Questie.ai。
话说回来,如果视觉层不是你想要的东西,这个产品当纯语音用也完全成立。把形象窗口藏掉,Sidekick 就只是你耳机里的一个声音。3D 层是给想要的人准备的,不是对不想要的人收的税。
3D 渲染到底是怎么做的
形象是一个完整的 VRM 模型——骨骼、BlendShape、表情绑定,跟虚拟主播推实时动作用的是同一套格式。它不是预渲染的视频,不是一串 2D 图片,也不是一个风格化的聊天气泡。你在悬浮窗里看到的伙伴,是一个有骨架的实时 3D 角色,随着 Sidekick 的判断实时动起来。
渲染发生在跟游戏分开的窗口里,这带来几个好用的性质。形象窗口跑自己的帧率,所以就算你的游戏掉帧,它也依然顺滑。渲染管线不碰你游戏的内存,也不钩它的渲染循环——反作弊系统看 Sidekick 就是一个普通的桌面应用,因为它本来就是。相对现代 3A 大作,它的显卡开销很小——一台能 60 帧跑《艾尔登法环》的机器上,基本可以忽略。
动画有两个来源。形象会对屏幕视觉的信号做反应(BOSS 抬手、阵亡、大暴击、战斗开始),也会对语音事件做反应(嘴型跟着正在说的音频走)。两者的时机都是照着“队友注意到了什么”调的,不是一个一直在喊的啦啦队。结果是按帧率呈现的在场感,而不是一张假装还活着的静态头像。
人设——挑一个配得上你打法的伙伴
3D 形象不是一个套了声音的通用人偶。每一位可选伙伴都带着自己的性格,这决定了它怎么说话、对什么有反应、反应有多外放,以及一局下来它是个什么样的队友。Nova(冷静、讲策略)会干净利落地丢一句“往右翻”,配一个很小的偏头。Luna(热血、能量拉满)会直接喊“往右翻!”然后把手举起来。Mika(温柔、鼓励型)会用平稳又安心的语气说同一句话。同样的指导信息,三个不同的队友。
另外三位人设各自对应一种打法。Kaze(冷淡、神秘)会把同一句提示多压一秒才开口——Kaze 开口的时候,你会想听。Aura(锐利、精确)会按帧报时机:“现在翻——三帧,有窗口。”Ren(大胆、无畏)会把你从后手推回前手:“这里回血后撤才是陷阱——打后摇,你有机会。”
现在有六位人设——Nova、Luna、Kaze、Aura、Mika 和 Ren——每一位都有自己的肢体语言、声音和反应方式。完整立绘在形象画廊,你可以一路翻过去,挑一个符合你想被怎么带的。
人设之所以能决定体验,是因为形象的肢体语言和语气承担了大部分情绪工作,而不只是那几句话。声音和视觉是一起设计的,所以伙伴读起来是一个完整的角色,而不是一张头像在念别人的台词。这里赌的是:一个人设一路陪你打完一周目,会长出魂系玩家在真实联机搭档身上得到的那种队友感。跟这个对照的是 Questie.ai 那种可随时替换的角色市集:不同的赌注,不同的产品形态。
每一位人设默认都是直播能用的。没有毒舌模式,没有跑偏模式,也没有“黑化”人设。别的 AI 伙伴产品里那种角色扮演式的关系模式,不在 Sidekick 的人设范围内,这是有意为之。产品形态是队友;人设只是这一个形态的不同口味。
声音——形象的另一半
Sidekick 是语音优先的。形象的嘴在动,但你耳机里的音频才是主通道——喊 BOSS 时机、在银河恶魔城里给你指出口的方向、给 HypeReel 片段配解说,靠的都是它。3D 形象之所以存在,是因为“声音配上一张看得见的脸”正是在场感成立的方式。嘴型(视位)实时跟着音频走;说这句话的形象,就是你看着在说这句话的那一位。
声音的性格是跟人设的性格绑在一起的。Nova 听起来分析、平稳;Luna 听起来有劲、更响;Mika 听起来安心、有耐心;Kaze 说话短促精准;Aura 用帧级的清晰度报时机窗口;Ren 声音里有底气,一直把你往前推。同一位人设在每一局里都是同一把声音——不是每次启动都换一个。语气、节奏、音量和形象的肢体语言是一起调的,所以一局下来像是在跟同一个队友玩,而不是一张头像在念稿。
语言覆盖很广,而且是母语级的,不是翻译腔。Sidekick 的多语言层为葡萄牙语、西班牙语、俄语、中文、阿拉伯语、意大利语、日语、韩语、法语、德语和英语都准备了专门的声音——不是一把基础声音带着口音去说每种语言。形象的口型会跟着当前启用的那门语言走。游戏里的专有名词(BOSS 名、道具名、任务名)优先用你那门语言的官方译名,没有官方译名才保留原文,这样去对 wiki 依然对得上;围着它们的解释是本地化的。
常见问题
什么是 VRM 形象?
玩的时候形象待在哪?
3D 形象会让游戏变卡吗?
3D 形象为什么重要?只有语音不行吗?
可以导入我自己的 VRM 模型吗?
我做直播的话,形象需要避开镜头吗?
形象怎么知道什么时候该做反应?
可以把形象完全关掉吗?
在视觉这一层,Sidekick 的 3D 形象跟 Questie.ai 或 Character.AI 比怎么样?
可以给形象换一个声音吗?
形象会说英语以外的语言吗?
Related Resources
准备好更聪明地玩了吗?
Sidekick AI用视觉AI实时观察你的屏幕并为你提供指导。现已在Steam抢先体验,免费游玩。
在Steam免费畅玩