奇绩创坛 2026 秋季营 · 申请
Prototype 1

Demo 1 · 端侧 皮克猫 AI 语音交互 App

已打通端到端语音链路:自定义任意声线(克隆)+ 语音多轮对话 + 支持打断。模型使用 Gemma,TTS 支持一段音频克隆声线。

  • 声线克隆:一段音频即可复刻任意声线,自定义角色人格
  • 全双工打断:对话中可以随时插话,无需等 AI 说完
  • 聊天气泡:语音内容实时以气泡形式呈现,便于回顾
  • 端侧优先:核心交互在本地完成,保障私密

说明:整体语音交互流程已打通,但当前 demo 尚未实现描述中的前端宠物形象、养成系统与相册识别处理;最核心的 AI 语音交互(声线克隆 + 多轮 + 打断)已经实现并验证。

注:受 iOS 审核政策影响,该 App 暂未上架 App Store,目前以演示视频展示核心能力。

关于这个想法:端侧 AI 宠物

纯端侧运行,跨设备、主动地深度融入用户的生活与工作。它常驻在手机和电脑端,像当年的 QQ 宠物,但更主动、更懂你,且绝对私密。

"它是升级版的汤姆猫,能和你互怼;是相册里旅行的青蛙,会把自己 PS 进照片埋怨你没带它;是进阶版拓麻歌子,让你有养成的乐趣;更是你的人生记录官,自动帮你整理生活和谈话。"
Prototype 2

Demo 2 · 抖音式 AI 互动短视频

模拟抖音式视频流,以争议话题「考研党转手卖视频只收费 1 元,被罚款 4 万,你怎么看?」为例。右下角小猫可听多方用户口头评价,并随时插入与之全双工对话。

  • 评论区产品化:把高赞/争议评论变成"数字人脱口秀"
  • 实时切换:用户介入即从离线演绎切到在线 LLM 实时互怼
  • 冷启动燃料:公开评论数据可跨平台无感导入

当前版本仅为粗略实现:不支持手机端、不支持 Safari 浏览器,推荐用电脑端 Chrome 打开。后台实时对话服务为演示环境,偶发启动失败可等待约 30 秒后重试。

🚀 立即体验 Demo 2(电脑端 Chrome)

关于这个想法:AI 原生的可交互式短视频平台

核心洞察:短视频评论区是被忽视的万亿级流量金矿。我们用 AI 把高赞/争议评论分类、改写,离线生成"辩论/脱口秀"衍生短视频无缝承接原视频;当用户介入时,无缝切换到实时 LLM 多轮互怼。这也是申请材料中提到的「其他创新想法」。

"4G 推动了从图文到视频的革命;大模型必然推动从单纯观看,到用户亲身参与的革命。"
Interview +2 Weeks

面试后两周进展

在上一次提交的两个 Demo 之外,这两周完成了新的关键突破:两个核心模型已经可以在端侧跑通。

① Ditto 数字人 · 端侧可行性验证通过,初步开发完成

完成 Ditto 数字人模型端侧可行性研究,已验证可行,并初步完成端侧开发——数字人形象可在本地设备实时合成。

② DiffSinger · 端侧推理 SDK 初版完成

完成 DiffSinger 端侧推理 SDK 初版,覆盖 Python 与 Swift(iOS)两个平台,AI 歌唱合成同样可在端侧运行。

为什么这两块很重要

辅以端侧大模型、语音识别、文字转语音等模型,使用以上两个关键 SDK,就可以轻松组合出当下众多仅限云端使用的 App——不仅赋能开发者,也显著降低普通用户的使用成本。

一句话解释:做全模态的 Ollama——让语音、歌声、数字人这些多模态能力,全部在本地端侧跑起来。
The Pivot

从具体产品,转向通用基础设施:OmniAI

为什么转方向

在开发端侧 AI 宠物、Galgame、数字人等产品的过程中,我发现它们反复遇到同一个问题:模型端侧化、硬件适配和端云协同。因此我的方向从做某个具体 AI 产品,转向做这层通用基础设施:OmniAI。

一句话类比 —— 面向端云多模态 AI 的 Unsloth:让多模态模型在真实设备上跑得更快、更省、更简单。

发展路径

  • 早期:专注于模型端侧化与性能优化,核心壁垒是积累真实设备 Model × Backend × Quantization 的速度、内存和功耗数据。
  • 长期:积累用户后,自建云端。根据设备性能、网络、延迟要求和 GPU 成本,自动决定每一部分计算应该在哪里执行。

基于 OmniAI SDK,可以直接组合

  • ASR + LLM + TTS + Ditto AI Companion
  • DiffSinger + Ditto Virtual Singer
  • 之后逐渐扩展到图像、音乐和视频生成

商业模式:Open Core

  • 端侧 SDK · 开源免费:个人开发者和小团队能够免费使用并自行部署。
  • OmniAI Cloud · 按量付费:端侧无法满足要求时,可 fallback 到云端,按实际使用量收费。
  • OmniAI Enterprise · 私有部署:面向游戏、社交、金融、汽车等大型客户,将完全相同的 OmniAI Cloud 部署到企业自有 GPU 集群,用户数据无需经过我们的服务器;按年度 License、SLA 和技术支持收费。
目标:让开发者用一套 SDK,把多模态 AI 自动运行在手机或云端,无需关心设备适配
🚧

页面正在建设中

敬请期待