5 分•作者: 0xchamin•4 个月前
我经常看斯坦福/伯克利的讲座和 YouTube 上关于 AI 智能体、MCP 和安全性的内容。厌倦了反复翻看长达数小时的视频来寻找一个解释。几个月前,我构建了 mcptube 的 v1 版本。它执行转录搜索,并将问答功能实现为 MCP 服务器。它获得了一些关注(34 个星标,我的第一个开源 PR,一些著名的星标者,比如 Trail of Bits 的 CEO)。
但 v1 版本每次查询都会从头开始重新搜索原始片段。所以我重构了它。
v2 版本 (mcptube-vision) 遵循 Karpathy 的 LLM Wiki 模式。在摄入时,它提取转录文本,使用 ffmpeg 检测场景变化,通过视觉模型描述关键帧,并编写结构化的 wiki 页面。知识在视频之间积累,而不是被重新发现。使用 FTS5 + 两阶段智能体(先缩小范围,然后推理)进行检索。
MCPTube 既可以作为 CLI (BYOK),也可以作为 MCP 服务器。我用 Claude Code、Claude Desktop、VS Code Copilot、Cursor 等测试了 MCPTube。服务器端无需 API 密钥。
即将推出:我还在构建 SaaS 平台。该平台支持播放列表摄入、团队 wiki 等。我很乐意分享抢先体验注册:<a href="https://0xchamin.github.io/mcptube/" rel="nofollow">https://0xchamin.github.io/mcptube/</a>
欢迎讨论架构权衡——FTS5 与向量、基于文件的 wiki 与数据库、场景变化与固定间隔采样。通过 `pip install mcptube` 试用一下。另外,如果喜欢我的贡献,请为该项目点亮星标 (<a href="https://github.com/0xchamin/mcptube" rel="nofollow">https://github.com/0xchamin/mcptube</a>)