2026/06 — 至今

MyJavis — 私人实时语音 AI 伙伴

记得住 · 认得出 · 看得见 · 开口不到 1 秒

独立项目 · 独立构建者 / 产品架构师

实时语音声纹识别视觉感知AI 记忆隐私设计Vibe Coding

语音 AI 的分水岭不在「能不能对话」,在「像不像一个真的伙伴」。我给伙伴感定了三个可以验收的硬标准:记得住、认得出、看得见——每一条都做到了真机可用。

「记得住」:记忆分两层。涉及隐私的记忆只存在自己电脑上,云端零留存——这不是口号,是用「把云端数据库整个导出来逐字检查」的笨办法验证过的。答应过的事它会主动提醒:时间理解不靠 AI 猜("明天下午"到底是几点,宁可反问确认也绝不记错),到点用三种方式确保你收到——正在通话就顺口插一句,不在就发通知念出来,错过了下次开口时补报。

「认得出」:听声音就知道是你,开口会叫你的名字(声纹识别在本机完成,26MB 的小模型,不上传声音)。

「看得见」:视觉分三层,既要看得见又不能变卡。第一层在本机实时看——你回到座位它会打招呼,你不在它就不白念提醒;第二层是说话时自然带上看到的("看你笑得这么开心");只有你说「仔细看看这个」,才动用云端大模型认真看一眼。

「快」:说完话到它开口,感知上不到 1 秒。背后是一套抠到毫秒的工程:两个大模型同时起跑、谁先出声用谁(解决了「快时不到 1 秒、网络抖时等 40 秒」的顽疾);放着音乐也能随时插话打断(全双工——像面对面聊天,不用等对方说完);唤醒词「贾维斯」完全在本机识别(4.5MB 的小模型),不联网也叫得应。

这个项目由我一个人 vibe coding 完成,没有团队,AI 是我的手脚——从产品定义、架构设计到全部代码,两个月里发了十几个版本,每一版都过我本人真机验收。本站首页「陈川的战略镜像」的实时语音,就跑在这套底座上,可以在线体验 2 分钟。

Key Highlights

  • 伙伴感三个硬标准全部真机可用:记得住约定、认得出声音、看得见状态
  • 私密记忆只存本机、云端零留存——用「数据库全量导出逐字检查」验证过
  • 声纹叫出你的名字,并实测出「注册和使用必须同一个话筒」的行业级经验
  • 视觉三层设计:常看不上传、开口带一句、说「仔细看」才调云端大模型
  • 开口感知不到 1 秒:双模型赛跑取最快,根治「网络一抖等 40 秒」
  • 放音乐时也能随时插话(全双工),唤醒词「贾维斯」本机识别不联网
  • 一个人 vibe coding(无团队),两个月十几个版本全部真机验收

Key Wins

感知首响 < 1 秒隐私记忆云端零留存声纹/视觉/提醒全链真机上线

Video Demos

全双工双向流式实时语音对话 Agent1:04