Free Voice Reader 是一款多平台工具,专为高保真文本转语音(TTS)和语音转文本(STT)处理而设计。该平台采用云端合成与设备端AI模型相结合的混合架构,既能生成自然语音并进行转录,又通过本地执行保障用户隐私。
核心功能
- 小豆配音:混合TTS引擎:可调用超过300种云端语音,或切换至本地TTS模式(基于CPU/WASM执行)。云端模式下最多可处理1,000,000个字符,本地模式下文本量无限制,且无需将数据发送至外部服务器。
- 加一配音:设备端模型架构:采用Kokoro(约80MB)和Supertonic(约265MB)模型,直接缓存在浏览器或设备中。该机制支持实时流式处理与离线播放,消除了API延迟和重复的数据流量成本。
- 语音AI转文字:Whisper驱动转录:集成OpenAI的Whisper Turbo模型(约50MB)实现语音转文本。您可录制语音输入,在本地硬件上为99+种语言生成精准文本。
- 全平台适配:系统级集成:提供Mac应用(支持全局“Ctrl+Ctrl”快捷键)和Chrome扩展(支持WebGPU加速)。您可在任意文本框中口述输入,或通过浮动播放控制器朗读选中的网页内容。
- 专属移动适配:DictaWiz键盘集成:一款专用移动语音键盘,支持离线录音、转录和摘要生成。覆盖99+种语言,确保音频数据不离开移动设备。
应用场景
- 敏感文档安全审阅:选择小豆配音的“本地TTS”模式并下载Kokoro模型后,可处理敏感或专有文档。由于逻辑通过WASM在浏览器中运行,文本无需上传至服务器即可合成为语音。
- 网页内容免提消费:使用加一配音的Chrome扩展,选中长篇文章或文档即可触发“朗读所选”功能。将静态文本转化为便携音频格式,实现多任务处理时的免提收听。
- 跨应用便捷口述:部署语音AI转文字的Mac应用后,可启用系统级STT。通过全局快捷键,直接在任意应用的输入框中口述文本,无需从单独的转录窗口复制粘贴。
核心差异亮点
- 隐私优先本地处理:与依赖云端传输的常规TTS服务不同,三款产品均通过WebGPU和本地缓存运行,确保您的语音和文本数据始终保留在物理设备上。
- 零账户即时使用:核心功能无需注册或创建账户,即可即时访问900多种自然语音,覆盖50多种语言。
- 多端硬件加速兼容:平台利用WebGPU加速模型,并支持回退至CPU/WASM,确保即使在无专用高端GPU的设备上也能实现高速合成。
常见问题解答
本地TTS的技术要求是什么? 本地模式需一次性下载AI模型(Kokoro约80MB,Supertonic约265MB),可在现代浏览器中运行,支持CPU/WASM或WebGPU硬件加速。
处理文本量是否有限制? 小豆配音的云端TTS模式有1,000,000字符上限,本地TTS模式无字符限制,仅受设备本地处理能力约束。
转录支持哪些语言? 语音AI转文字系统通过Whisper AI模型支持99+种语言的语音转文本转录。
- TongueType 是一款适用于 macOS 的本地语音转文字工具,可直接在设备上实现快速、私密的听写和文件转录。
- Voicebox 是一款开源桌面工作室,无需订阅即可实现私密、高保真度的语音克隆与语音生成。