2 分•作者: essina•3 个月前
您好, 我们目前正在寻找一位拥有治理经验的高级开发人员或高级解决方案架构师,以及一位高级网络安全分析师,协助为贸易合规平台创建技术架构和安全设计。如果您具备相关经验,请发送邮件至 muna@essinasolutions.com。
3 分•作者: olwal•3 个月前
大家好!我们很高兴终于开源了 SpeechCompass(这是我在 Google 工作期间的项目,并与 Google DeepMind 一同发布)。如果您在群组对话中使用过实时字幕,您就会发现不同说话人的声音是如何混杂在一起,变成一整段文字的。在我们对 263 名字幕重度用户进行的调查中,说话人混淆是一个主要问题(占 46%)。 SpeechCompass(荣获 ACM CHI 2025 最佳论文奖,论文和视频均在代码库中)通过显示每位说话人的方向来解决这个问题。字幕会根据颜色编码,并带有指向语音来源方向的箭头。我们在配备 2 个以上麦克风的手机上(180°)展示了这一功能,并发布了用于全方位 360° 麦克风手机壳的固件和硬件。 它使用了快速到达时间差算法,可以在小型、低功耗的微控制器上运行。它在设计上注重隐私,并且完全在设备上运行:它利用空间方向,而不是声纹,并且音频不会离开手机(用于方向识别)。 代码库中包含 Android 应用(在 Releases 中提供预编译的 APK)、便携式 C11 DSP 库、固件和 PCB 设计,所有内容均采用 Apache 2.0 许可。 我们很乐意回答您的问题,并对您的反馈感兴趣,特别是来自日常使用字幕的用户。
1 分•作者: nyrikki•3 个月前
虽然我明确回避了具体操作方法,但你们中有没有人通过使用预先明确的个人身份信息(PII)协议,在接受一份与行业有重叠但应用不重叠的工作的同时,成功被项目批次录取? 或者这会带来太多问题?
2 分•作者: lechebs•3 个月前
分享我之前的一个项目,在我的RTX 500 Ada笔记本GPU上,使用Barnes-Hut算法,可以模拟多达400万个粒子,每步耗时约400毫秒,占用了全部4GB显存。 八叉树的构建和遍历速度都很快。主要的瓶颈在于显存使用(100万个粒子需要约1GB显存),这可能通过重用中间缓冲区来减半,以及粒子到叶节点的评估,这会受益于更多的fp32浮点运算能力。此外,我仍然没有一个好的启发式方法来预先确定BFS队列的大小,也许某种内存分页可以解决这个问题。
5 分•作者: tasoeur•3 个月前
你好, 我是 Clem,一名独立开发者,已经有几年经验了,主要探索 XR 和智能体工作流等前沿技术在创意/互动工作中的应用。 我一直在构建创作工具,其中一个常见的挑战是如何为工具设定合适的抽象级别。你可以选择非常高级和复杂的低级概念(如着色器组合、实际代码等),但这会导致工具的复杂性和学习曲线很高。另一方面,如果你的工具过于高级,一开始可能更容易使用,但用户最终很可能会遇到瓶颈,并开始与你的工具“斗争”来完成他们的特殊需求(这在移动端很常见)。 通过这个原型(名为 SubjectiveZero),我想设想我们可以调整抽象层的“滑块”,这意味着你可以从描述目标的提示开始,并且可以根据需要选择高级(保持抽象提示)或低级(更具体的提示,甚至直接编辑生成的代码)的抽象级别! 智能体编排实际上会理解你的上下文,并与你一起协作,找出最适合你项目的节点图结构(以及一些有趣的、在节点级别实现的程序化 UI)。 如果用 30 秒来介绍,我会说:“想象一下 TouchDesigner 及类似工具,但加入了智能体编排。” 当你使用它时,它会生成真实的本地代码(目前是 Swift/Metal),你可以直接进行热重载和迭代,无论是手动还是通过智能体。这仍然是一个早期原型,目前仅支持 macOS,但我非常希望得到真实的反馈,以帮助我决定这个项目下一步的发展方向(或者是否继续)。 最后,我完全公开并坦诚地承认,我使用了智能体编码来完成这项工作,但正如人们所说:“被牢牢控制着”。架构和规格都经过了相对周密的考虑,我个人更倾向于全程参与并审查所有生成的代码,以确保其朝着正确的方向发展。 哦,它还是开源的 :-) 希望你喜欢! https://sxp.studio/apps/subz