首页 / 开源宝库 / NanoAvatar
NanoAvatar
// project.info

NanoAvatar

NanoAvatar 是什么

NanoAvatar 是一款在 Android 手机本地运行的高保真数字人(talking avatar)应用:用自己的录音驱动数字人说话,无需云端 GPU。核心卖点是「改变数字人应用能多频繁用、能服务多少用户」——2023 年芯片即可跑到 41 FPS、首帧延迟 103ms(Lite 版),老款 2021 年芯片也有 18 FPS。

两种模式:Experience 模式按住录音键说话即可离线驱动数字人(无需 API key);Conversation 模式接入阿里云 API key 实现 AI 对话。两个安装包:Full(25 FPS,模型更大)与 Lite(12.5 FPS,体积小、算力要求低)。支持流式生成:搭配流式 LLM+TTS 时约 0.3 秒开始说话,不用等完整音频。模型权重发布在 Hugging Face(wpydcr/NanoAvatar),另有 Web 版(需 NVIDIA GPU + CUDA PyTorch)可体验。

主要功能

01端侧数字人:手机上本地生成高保真说话视频,无云 GPU
02Experience 模式:按住录音说话即可驱动,离线可用
03Conversation 模式:接阿里云 API key 实现 AI 对话
04无需 API key:录音体验开箱即用
05双版本:Full(25 FPS)/ Lite(12.5 FPS,更小更快)
06老机可跑:2021 芯片 18 FPS(Lite)
07高性能:2023 芯片 41 FPS、首帧 103ms
08流式生成:约 0.3 秒开始说话(配流式 LLM+TTS)
09实时指标:界面实时显示 FPS 与首帧时间
10模型开源:权重发布 Hugging Face
11Web 版:NVIDIA GPU 可本地试跑

如何使用 NanoAvatar

1从 GitHub Releases 下载 APK(Full 或 Lite)并安装
2打开应用,进入 Experience 模式
3按住录音键说话,松开发布,数字人用你的声音说话
4需要 AI 对话:切 Conversation 模式,填入阿里云 API key
5查看实时 FPS 与首帧时间
6想本地跑 Web 版:Python 3.11 + NVIDIA GPU + CUDA PyTorch 拉源码运行

使用示例

在手机上装 Lite 版,老款 2021 年手机也能 18 FPS 流畅驱动数字人:按住录音说一句「大家好」,松手数字人即用你的声音开口;接上阿里云 key 后还能跟它对话。

核心优势

✓零门槛离线:录音体验无需 API key、无需云 GPU
✓端侧高性能:2023 芯片 41 FPS/103ms,体验流畅
✓老设备友好:Lite 版让老手机也能用数字人
✓开源开放:模型权重+源码公开
✓流式快响应:约 0.3 秒开口,对话自然

与同类工具对比

维度CelebShout听成文 AIScribeToAny
定位AI 生成明星语音街头吆喝带货本地音视频转写与摘要工具AI 音视频转录与字幕生成工具
核心功能明星语音合成用于吆喝带货B站/抖音链接或本地文件转文稿、SRT/VTT、AI 摘要,批量+说话人区分,数据不上云说话人识别、多语言翻译、字级高精度时间戳,导出 SRT/VTT/TXT,免费试用
价格未提及未提及免费试用
开源/部署未提及未提及未提及
适合谁需要名人语音营销的用户需要本地转写/摘要的 Windows 用户需要音视频转录与字幕的用户

结论:三者与 NanoAvatar 同属「AI 语音音频」类但方向不同:NanoAvatar 是端侧数字人视频生成(录音驱动+可离线),CelebShout 是明星语音带货,听成文/ ScribeToAny 是音视频转写——「在手机上离线生成说话数字人」选 NanoAvatar。

使用方式与技巧

使用方式

  • Android APK(Full/Lite)
  • Web 版(NVIDIA GPU 本地试跑)

功能模式

  • Experience 模式(录音驱动,离线)
  • Conversation 模式(AI 对话,需 API key)
  • 流式生成模式(配流式 LLM+TTS)

使用技巧

  • 老设备装 Lite 版,算力与体积更友好
  • 体验/演示用 Experience 模式零配置
  • 做对话应用接流式 LLM+TTS,约 0.3 秒开口

进阶玩法

01性能基准:2023 Snapdragon 8 Gen 3 → 39-41 FPS / 103-115ms / ~700-834MiB;2021 Snapdragon 8 Gen 1(Lite)→ 18 FPS / 183ms;RTX 4090 Windows CUDA → 224-333 FPS
02模型权重:https://huggingface.co/wpydcr/NanoAvatar
03Web 版要求:Python 3.11 + NVIDIA GPU + CUDA PyTorch

常见问题

需要 API key 吗?

录音体验(Experience 模式)不需要;AI 对话模式需阿里云 API key。

需要云 GPU 吗?

不需要,完全在手机本地运行。

老手机能跑吗?

能,Lite 版在 2021 年芯片上约 18 FPS。

免费吗?

开源免费,APK 与模型权重公开下载。

// more.info

项目信息

Android 数字人应用:用自己的录音在手机上驱动逼真流畅的数字人,无需云 GPU、无需 API key 即可离线体验,老款手机也能跑

Android 数字人应用,用自己的录音在手机上驱动逼真、流畅的数字人,响应快,老款手机也可运行,录音体验可离线使用,无需 API key

AI 语音音频 适合人群:开发者 / 程序员
// 商业项目:在数据 affiliate 字段填入 CPS 推广链接后,按钮自动改跳你的推广链接
← 返回开源宝库

站长熬夜整理 · 开源大礼包

点击一键转存《2329 件副业装备大礼包》,内含分类 Excel 表,找工具不再大海捞针

一键转存《2329 个开源大礼包》
资料整理自公开开源渠道,仅供学习交流使用;如涉及版权问题请联系删除。