2 分•作者: emptybits•大约 2 个月前
返回首页
最新
1 分•作者: Sphinx_321•大约 2 个月前
1 分•作者: ankushKun•大约 2 个月前
1 分•作者: bryanrasmussen•大约 2 个月前
1 分•作者: jandeboevrie•大约 2 个月前
3 分•作者: yanko•大约 2 个月前
4 分•作者: ablazevics•大约 2 个月前
3 分•作者: matt_d•大约 2 个月前
3 分•作者: tosh•大约 2 个月前
3 分•作者: Pamar•大约 2 个月前
2 分•作者: tieanderson•大约 2 个月前
2 分•作者: JumpCrisscross•大约 2 个月前
2 分•作者: kristianp•大约 2 个月前
4 分•作者: JumpCrisscross•大约 2 个月前
4 分•作者: ms7892•大约 2 个月前
15 分•作者: mcptokensaver•大约 2 个月前
2 分•作者: DevFoundry-labs•大约 2 个月前
2 分•作者: niceshot-ai•大约 2 个月前
我过去 26 个月一直在开发 NiceShot AI,以此来实验用于游戏分析的计算机视觉技术。
基本理念是将录制的长时间游戏会话自动转化为结构化的游戏信息和精彩集锦。这弥合了比赛统计数据(太短)和生涯统计数据(太长)之间的表现分析鸿沟。
当前的流程是:
游戏视频 → YOLO 检测 → 事件跟踪 → OCR/上下文过滤 → 事件时间戳 → 片段 → 精彩集锦编译 → 会话统计
例如,我可以微调一个 YOLO 模型来识别特定游戏的 HUD 元素,然后配置流程将这些检测解释为击杀、死亡或获得奖章等事件。
我希望避免让整个系统都针对特定游戏。支持另一款游戏主要应该只需要一个新的检测器/模型和配置,而不是重写整个流程。目前我正在为此努力。
我还使用 OCR 来处理不应计入游戏事件的状态。例如,在《使命召唤》游戏中,击杀提示可能会出现在“回放”(KillCam)或“观战”(Spectating)状态下,因此 OCR 层可用于过滤这些情况。
然后,该系统可以围绕检测到的事件生成片段,并将它们编译成精彩集锦,包括适用于 Shorts/TikTok 风格内容的竖屏版本。
最近,我也一直在尝试在事件检测后使用轻量级的视频大语言模型(Video LLM)。我没有将整个数小时的游戏会话发送给 Video LLM 模型,而是提取围绕某个有趣事件的短片段,然后让模型解释发生了什么。最终目标是将其发展成一个轻量级的对话式游戏教练。
该项目目前在 NVIDIA GPU 上本地运行。我曾在一台配备旧款 GTX1650 4GB 显存的笔记本电脑上进行过实验,运行效果还可以,但速度当然比较慢。
最后,我知道实时事件检测应该是未来的方向,这也是我最初的目标,但我选择了离线处理,因为我不想让计算机视觉推理干扰玩家的实际游戏表现。
我也很想听听其他人会如何处理,才能让检测器/推理层足够快以支持实时游戏,同时又不会造成明显的 GPU/CPU 开销。请记住,我输入模型的是 1080p 帧。
该项目仍在不断发展中,因此非常欢迎技术批评和建议。
谢谢。
2 分•作者: yarianaguileraa•大约 2 个月前
1 分•作者: MrBuddyCasino•大约 2 个月前