NanoAvatar 是一款在 Android 手机本地运行的高保真数字人(talking avatar)应用:用自己的录音驱动数字人说话,无需云端 GPU。核心卖点是「改变数字人应用能多频繁用、能服务多少用户」——2023 年芯片即可跑到 41 FPS、首帧延迟 103ms(Lite 版),老款 2021 年芯片也有 18 FPS。
两种模式:Experience 模式按住录音键说话即可离线驱动数字人(无需 API key);Conversation 模式接入阿里云 API key 实现 AI 对话。两个安装包:Full(25 FPS,模型更大)与 Lite(12.5 FPS,体积小、算力要求低)。支持流式生成:搭配流式 LLM+TTS 时约 0.3 秒开始说话,不用等完整音频。模型权重发布在 Hugging Face(wpydcr/NanoAvatar),另有 Web 版(需 NVIDIA GPU + CUDA PyTorch)可体验。
| 维度 | CelebShout | 听成文 AI | ScribeToAny |
|---|---|---|---|
| 定位 | AI 生成明星语音街头吆喝带货 | 本地音视频转写与摘要工具 | AI 音视频转录与字幕生成工具 |
| 核心功能 | 明星语音合成用于吆喝带货 | B站/抖音链接或本地文件转文稿、SRT/VTT、AI 摘要,批量+说话人区分,数据不上云 | 说话人识别、多语言翻译、字级高精度时间戳,导出 SRT/VTT/TXT,免费试用 |
| 价格 | 未提及 | 未提及 | 免费试用 |
| 开源/部署 | 未提及 | 未提及 | 未提及 |
| 适合谁 | 需要名人语音营销的用户 | 需要本地转写/摘要的 Windows 用户 | 需要音视频转录与字幕的用户 |
结论:三者与 NanoAvatar 同属「AI 语音音频」类但方向不同:NanoAvatar 是端侧数字人视频生成(录音驱动+可离线),CelebShout 是明星语音带货,听成文/ ScribeToAny 是音视频转写——「在手机上离线生成说话数字人」选 NanoAvatar。
录音体验(Experience 模式)不需要;AI 对话模式需阿里云 API key。
不需要,完全在手机本地运行。
能,Lite 版在 2021 年芯片上约 18 FPS。
开源免费,APK 与模型权重公开下载。
Android 数字人应用:用自己的录音在手机上驱动逼真流畅的数字人,无需云 GPU、无需 API key 即可离线体验,老款手机也能跑
Android 数字人应用,用自己的录音在手机上驱动逼真、流畅的数字人,响应快,老款手机也可运行,录音体验可离线使用,无需 API key