轻语输入 / Whisper Input(github.com/EthanYoQ/whisper-input,Apache 2.0)是中文 AI 语音输入工具:按下全局快捷键说话,把中文口述整理成去口头语、可分段和结构化的文字,再插入当前光标。它不是传统输入法也不是会议记录软件——重点是把口述变成可直接使用的文字,而不是只生成原始转写。插入失败自动复制到剪贴板兜底。
四种输出风格:📝 原文(保留原始表达只做断句标点);🧹 轻度润色(去口头语/重复词保持原顺序);🧱 清晰结构(整理成 1/1.1/2 层级编号);🧑💼 正式表达(转成邮件/请示/反馈/交接文档)。其他能力:中文转英文(用中文说意思直接输出英文工作文本)、格式规范(金额/时间/数字自动整理如「三块二毛八」→3.28 元、「明天下午两点」→14:00)、用户词典(保留人名/公司名/产品名/术语)、历史记录(本地回看/复制/删除)、剪贴板兜底。工作链路:全局快捷键→录音→云端实时 ASR→LLM 整理润色→插入当前光标。适合:日常沟通、给老板汇报、任务拆解、英文输出、数字格式化。
| 维度 | CelebShout | 听成文 AI | NanoAvatar |
|---|---|---|---|
| 定位 | AI 明星语音吆喝带货 | 本地音视频转写与摘要工具 | Android 数字人应用 |
| 核心功能 | 明星语音合成用于街头吆喝 | B站/抖音链接或本地文件转文稿/SRT/AI 摘要 | 录音驱动数字人,离线可用 |
| 价格 | 未提及 | 未提及 | 免费开源 |
| 开源/部署 | 未提及 | 未提及 | 是 |
| 适合谁 | 名人语音营销 | 转写已有音视频 | 手机生成说话数字人 |
结论:四者同属「AI 语音音频」类但定位不同:whisper-input 是实时语音输入(口述即结构化文字+插入光标),CelebShout 是明星语音营销,听成文是离线转写,NanoAvatar 是数字人——「说话直接变成正式文字」选它。
开源免费(Apache 2.0);云端 ASR/LLM 需自备服务商 Key。
Windows。
依赖云端 ASR/LLM(自选服务商)。
自动复制到剪贴板兜底。
中文 AI 语音输入工具:按快捷键说话,在 Windows 任意应用把口述整理成去口头语、可分段和结构化的文字并插入当前光标;支持四种输出风格、中文转英文、用户词典与自选云端 ASR/LLM
中文 AI 语音输入工具,按快捷键说话,在 Windows 任意应用把口述整理成去口头语、可分段和结构化的文字并插入当前光标;支持用户词典、中文转英文和自选云端 ASR/LLM