SayType 语音输入
在任意 macOS 输入位置,把口语可靠地转成符合当前场景的文字
本地优先桌面产品案例 / 02
SayType 把语音输入设计成一条可靠的 macOS 系统链路:在原应用里开始说话,本地转写,按场景整理,再回到原输入位置粘贴。
它不是会议转写工具,也不是给 Whisper 包一层界面。真正的产品问题是:用户如何在微信、飞书、邮件、文档和 AI 工具里持续完成输入,并在权限、网络、模型或自动粘贴失败时仍然不丢内容。
面向中文为主、中英混合输入的 macOS 用户;日常使用不需要反复打开主窗口。
当前已实现本地录音、Whisper 转写、全局快捷键、悬浮录音条、转写与最终文本分离、自动粘贴和本地历史。
语音识别与文字整理被拆成两层;AI 整理失败时,仍返回本地校正文本。
v1.0 正式版仍在规划中:提供商路由、按应用选模式、完整词典、首次引导、诊断导出、签名与公证等尚未完成。
真正的问题不只是识别准确率
日常输入发生在很多上下文中:微信要简洁,邮件要完整,文档要有结构,给 AI 的指令要清晰。用户并不想先打开一个转写工具,再把文字搬回原应用;他们想在当前焦点里直接完成输入。
因此,SayType 的价值不是“生成一段转写”,而是“完成一次输入”。这要求快捷键、录音状态、任务保存、文字整理与粘贴回填形成同一条产品链路。
产品闭环:从说话到原地粘贴
用户在任意输入框触发全局快捷键,悬浮条显示录音状态;音频作为一个可追踪任务保存,本地 Whisper 先产出原始转写,再进行确定性校正与按模式整理,最终回到原应用粘贴。
主窗口被定义为配置与恢复中心,而不是日常必经之路。用户可在这里检查麦克风、Whisper 和快捷键状态,查看历史,或处理失败任务。
转写与整理分离
SayType 始终保留原始转写,最终文本另行生成。整理可以去掉语气词、恢复标点和调整结构,但不允许补充用户没有说过的事实。这让用户能随时对照,也为失败降级保留底稿。
当前已有智能、日常、结构化、口播、原文和自定义模式。工作邮件、AI 提示词以及按应用自动选择模式,被作为后续版本能力,不在当前案例中写成已交付。
失败也要完成输入
可靠性不是一条成功路径,而是一张降级网。LLM 整理失败时返回本地校正结果;粘贴失败时保留到剪贴板并引导手动粘贴;权限缺失时给出明确状态和修复动作;本地识别失败时保留音频和任务以便恢复。
历史记录默认保存在本地,当前不设账号、云端历史或团队空间。后续接入更多云端提供商时,仍需继续明确告知哪些内容离开本机,以及如何退回本地路径。
PROCESS
关键决策
本地转写是地基,不是装饰
即使断网或 AI 整理服务失效,用户仍应得到可使用的文字。云端能力是增强层,不是完成一次输入的唯一前提。
原始转写与最终文本并存
这个选择让 AI 的修改可见、可比较、可退回,也把“识别错了”和“整理过度”变成可分开诊断的问题。
日常输入不经过主窗口
主窗口承担配置、历史和恢复;日常使用由全局快捷键、悬浮状态和自动粘贴完成,减少应用切换。
语音指令延后,先保证输入安全
普通口述不应被误触发为删除、发送或剪贴板操作。指令能力需要独立模式、二次确认和可撤销机制,因此不进入当前基础版。
我的角色与协作
我作为产品与体验主导,负责从“完成输入”重新定义产品目标,并完成用户路径、信息架构、转写与整理分层、模式系统、失败降级、隐私边界和正式发布门槛的设计。
AI 参与工程实现、测试辅助、文档整理和问题排查;产品定位、优先级、模式边界、安全取舍、发布判断与最终体验验收由我负责。
验证、结果与反思
当前可确认的是内测版已上线,并已跑通录音、本地转写、快捷键、悬浮状态、文本整理、失败回退、粘贴回填和本地历史等主链路。
当前不把内测版写成 v1.0 正式交付。在新机安装、签名公证、首次引导、诊断导出、按应用规则和完整个人词典等验收完成前,产品仍处于内测阶段。
语音输入产品的成功不是屏幕上出现一段转写,而是最终文字准确地出现在用户原本要输入的地方。因此,权限、焦点、剪贴板和失败恢复与模型准确率同样重要。
下一步应先把基础链路做到可安装、可诊断、可恢复,再通过个人词典、按应用模式和多提供商路由增加个性化,避免在基础可靠性之前过早堆叠功能。
DEMO / 02
产品演示视频
13 秒公开版操作片段,展示本地就绪状态、语音输入主界面与输出模式。已从你提供的 720p 演示中移除私人对话和提供商配置片段。


