Demo 1 · 端侧 皮克猫 AI 语音交互 App
已打通端到端语音链路:自定义任意声线(克隆)+ 语音多轮对话 + 支持打断。模型使用 Gemma,TTS 支持一段音频克隆声线。
- 声线克隆:一段音频即可复刻任意声线,自定义角色人格
- 全双工打断:对话中可以随时插话,无需等 AI 说完
- 聊天气泡:语音内容实时以气泡形式呈现,便于回顾
- 端侧优先:核心交互在本地完成,保障私密
说明:整体语音交互流程已打通,但当前 demo 尚未实现描述中的前端宠物形象、养成系统与相册识别处理;最核心的 AI 语音交互(声线克隆 + 多轮 + 打断)已经实现并验证。
注:受 iOS 审核政策影响,该 App 暂未上架 App Store,目前以演示视频展示核心能力。
关于这个想法:端侧 AI 宠物
纯端侧运行,跨设备、主动地深度融入用户的生活与工作。它常驻在手机和电脑端,像当年的 QQ 宠物,但更主动、更懂你,且绝对私密。
Demo 2 · 抖音式 AI 互动短视频
模拟抖音式视频流,以争议话题「考研党转手卖视频只收费 1 元,被罚款 4 万,你怎么看?」为例。右下角小猫可听多方用户口头评价,并随时插入与之全双工对话。
- 评论区产品化:把高赞/争议评论变成"数字人脱口秀"
- 实时切换:用户介入即从离线演绎切到在线 LLM 实时互怼
- 冷启动燃料:公开评论数据可跨平台无感导入
当前版本仅为粗略实现:不支持手机端、不支持 Safari 浏览器,推荐用电脑端 Chrome 打开。后台实时对话服务为演示环境,偶发启动失败可等待约 30 秒后重试。
🚀 立即体验 Demo 2(电脑端 Chrome)关于这个想法:AI 原生的可交互式短视频平台
核心洞察:短视频评论区是被忽视的万亿级流量金矿。我们用 AI 把高赞/争议评论分类、改写,离线生成"辩论/脱口秀"衍生短视频无缝承接原视频;当用户介入时,无缝切换到实时 LLM 多轮互怼。这也是申请材料中提到的「其他创新想法」。
面试后两周进展
在上一次提交的两个 Demo 之外,这两周完成了新的关键突破:两个核心模型已经可以在端侧跑通。
① Ditto 数字人 · 端侧可行性验证通过,初步开发完成
完成 Ditto 数字人模型端侧可行性研究,已验证可行,并初步完成端侧开发——数字人形象可在本地设备实时合成。
② DiffSinger · 端侧推理 SDK 初版完成
完成 DiffSinger 端侧推理 SDK 初版,覆盖 Python 与 Swift(iOS)两个平台,AI 歌唱合成同样可在端侧运行。
为什么这两块很重要
辅以端侧大模型、语音识别、文字转语音等模型,使用以上两个关键 SDK,就可以轻松组合出当下众多仅限云端使用的 App——不仅赋能开发者,也显著降低普通用户的使用成本。
从具体产品,转向通用基础设施:OmniAI
为什么转方向
在开发端侧 AI 宠物、Galgame、数字人等产品的过程中,我发现它们反复遇到同一个问题:模型端侧化、硬件适配和端云协同。因此我的方向从做某个具体 AI 产品,转向做这层通用基础设施:OmniAI。
发展路径
- 早期:专注于模型端侧化与性能优化,核心壁垒是积累真实设备 Model × Backend × Quantization 的速度、内存和功耗数据。
- 长期:积累用户后,自建云端。根据设备性能、网络、延迟要求和 GPU 成本,自动决定每一部分计算应该在哪里执行。
基于 OmniAI SDK,可以直接组合
- ASR + LLM + TTS + Ditto → AI Companion
- DiffSinger + Ditto → Virtual Singer
- 之后逐渐扩展到图像、音乐和视频生成
商业模式:Open Core
- 端侧 SDK · 开源免费:个人开发者和小团队能够免费使用并自行部署。
- OmniAI Cloud · 按量付费:端侧无法满足要求时,可 fallback 到云端,按实际使用量收费。
- OmniAI Enterprise · 私有部署:面向游戏、社交、金融、汽车等大型客户,将完全相同的 OmniAI Cloud 部署到企业自有 GPU 集群,用户数据无需经过我们的服务器;按年度 License、SLA 和技术支持收费。