按住说话文字即出现:VoiceBox 把语音输入做成即时闭环

按住说话文字即出现:VoiceBox 把语音输入做成即时闭环

_

一款名为 VoiceBox 的开源语音转文字工具已在 GitHub 亮相,开发者按住快捷键说话,文字自动出现在光标位置——无需切换窗口或手动粘贴。

从想法到文字的闭环

语音输入不是新技术,但把「说完就出现在聊天框里」这件事做简单,并不容易。传统方案通常需要先录音、再转写、再手动复制粘贴,步骤繁琐。VoiceBox 的设计目标是让整个流程对用户透明:按住 Ctrl+Cmd,工具捕捉当前焦点窗口的上下文信息;开始说话时,屏幕上出现音量指示器;说完松开快捷键,音频流直接推送到云端,Whisper 完成转写后由大语言模型按上下文格式化,最终结果直接落入剪贴板并自动粘贴进刚才的输入框。整个过程无需用户主动操作剪贴板或切换应用。

技术架构:桌面端与云端协作

桌面客户端基于 Wails 框架构建,使用 Go 作为后端、原生 WebView 渲染 React 前端。这种组合的优势在于既能利用 Go 处理高效的系统级任务(音频捕获、快捷键注册、窗口管理),又能借助 Web 技术快速构建界面。

音频捕获模块采用 malgo/miniaudio 库,采集 16kHz、16 位单声道 PCM 数据,每 128 毫秒打包一次发送。客户端通过 WebSocket 与云端保持长连接,传输前会先发送当前焦点窗口的上下文信息——包括应用名称、输入框占位符、当前内容——帮助服务端的大模型生成更贴合语境的格式化结果。

服务端部署在 Cloudflare Workers,利用 Durable Object 维护会话状态。收到的音频流先拼接为完整 WAV,再调用 Whisper 模型(whisper-large-v3-turbo)转写为文字,随后交给 Qwen3-30B 模型按上下文格式化。由于会话信息保存在 Durable Object 中,多次调用间可以保持上下文连贯。

macOS 平台的自动粘贴借助 Accessibility API 实现。工具通过 AXUIElement API 获取当前焦点元素,插入格式化后的文字。macOS 会在首次使用时弹出权限申请提示,用户也可手动在「系统设置 → 隐私与安全性 → 辅助功能」中授权。

可替换的后端接口

当前默认使用 Cloudflare Workers AI 的托管模型,但项目代码中预留了清晰的接口层:internal/stt/ 和 internal/formatter/ 分别定义语音识别和格式化的抽象接口。开发者可以自行实现本地方案——用 faster-whisper 替代云端 Whisper,或用 Ollama 替代 Qwen——只需实现对应接口即可,无需改动核心逻辑。

编注:信源为 GitHub 仓库 README,材料侧重技术架构与部署步骤,未涉及用户规模、发布计划或竞品对比。


Fleet填补GPU编程模型空白:芯粒级任务抽象让LLM推理省三成延迟 2026-07-16
SpaceX股价破发背后:套现压力与债务融资隐忧浮现 2026-07-16