7.8 KiB
康康 · Google 赛道重定位与改造说明
面向「入围 Top 30」评审表(完成度与传播 25% / Google AI 深度 25% / 创新与 Vibe Coding 20% / Tech for Good 出海 20% / 第 5 维度 ~10% 待补全)。 本文是把原 MNN/SME2 赛道作品改投 Google 赛道的定位与技术映射。改造日期:2026-07-01。
0. 一句话定位(新)
A privacy-first, offline-capable health companion for low-connectivity and underserved communities — understand your medical reports and medicines even without a doctor or internet, in your own language.
中文:给弱网/缺医地区与跨国语言障碍人群的隐私优先健康助手——没有医生、没有网络,也能读懂自己的化验单和药盒,用你的母语。
注意叙事转向:旧版讲「中国人不想把体检报告传云端」(纯国内隐私焦虑);新版讲「全球低资源人群 + 跨境语言障碍」(出海 + Tech for Good)。同一套 App、同一套 UI/数据,主要改模型底座 + 叙事,代码改动集中在 AI 层。
1. hybrid 架构:为什么这样用 Google 技术(评审 25% 核心)
评审明确要求「Google 技术参与核心能力构建,不是包装卖点」并「说明为什么用这些 Google 技术」。康康的回答:
| 能力 | 用的 Google 技术 | 为什么非它不可 |
|---|---|---|
| 端侧离线推理(默认) | Gemma-3n E2B(Google 开源多模态小模型,端侧 4bit) | 弱网/无网地区要「飞行模式也能用」。Gemma-3n 是 Google 专为手机优化的开源模型,离线、隐私、不依赖账号——这是低资源场景的刚需,云模型做不到。 |
| 读报告/药盒原图 → 结构化(联网增强) | Gemini 2.5 Flash 多模态 API | 端侧小模型读密集化验单小字不稳;Gemini 多模态能直接读图出结构化指标 + 证据位置框。这是产品第一卖点「拍一张→变档案」的真正承载者。 |
| 深度解读 / 多语言 | Gemini 2.5 Flash | 跨国用户拿到外语报告,需要「翻译 + 大白话解读」。Gemini 的多语言与推理能力正对口出海语言障碍痛点。 |
| Prompt 设计 / 调试 | Google AI Studio | 所有 Gemini/Gemma 的 prompt 在 AI Studio 里迭代;API key 也由 AI Studio 免费签发。 |
hybrid 的产品逻辑:隐私优先——默认端侧 Gemma-3n,数据不出设备;只有用户在「我的 · 云端 AI」主动开启后,「读原图 / 深度解读 / 多语言」才走 Gemini 云端。断网或额度耗尽自动回退端侧,功能不中断。 这既拿满「Google 产品深度」,又守住隐私品牌,还天然适配「时有时无的网络」这一低资源现实。
代码落点:
GeminiBackend.swift(REST 直调,SSE 流式 + 多模态)、AIRuntime.generateCloud / analyzeReportCloud(不进 OOM 闸门,可与端侧并发)、CaptureService.runVL(云端优先读图、失败回退端侧 OCR+文本)、InferenceSettingsView(云端开关 + key)。
生产级升级路径(写给评委看工程成熟度)
demo 用 AI Studio 直发 key 的 REST 方案(零新增 SPM 依赖、即时可编译)。生产应升级到 Firebase AI Logic(Swift SDK):App Check 防盗用、客户端不裸存 key、内建端侧↔云端 hybrid 回退。迁移点已在 GeminiBackend 注释标注,换 SDK 不动上层 Service。
2. 重定位:目标用户 / 市场 / 影响路径(评审 Tech for Good 20% + 创新 20%)
评审要「真实人群 / 弱势 / 低资源 / 全球化」+「海外落地可行性,不只是善意叙事」+「目标用户、场景、影响路径、后续扩展」。
- 目标人群
- 低资源/弱网地区居民:缺医少药、网络不稳,拿到化验单无人解读。
- 跨境人群:移民、留学生、外派、旅居者,面对外语医疗文件看不懂。
- 慢病/老人照护者:替家人留存报告、复查前整理重点。
- 真实问题:看不懂(术语+外语)、找不到(报告散落)、不敢传(隐私)、没医生在身边。
- 海外落地可行性(不是善意叙事)
- 离线即可用 → 适配低带宽市场,不依赖稳定网络与数据套餐。
- 隐私默认端侧 → 契合 GDPR 等严监管市场的健康数据合规。
- 多语言 → 一套产品覆盖多语种,边际成本低。
- 影响路径:个人读懂自己 → 家庭健康档案管理 → 低资源社区的基层健康工作者辅助工具。
- 后续扩展:更多语种、更多文档类型(疫苗本/处方/影像)、与本地公共健康项目对接、可选导出给当地医生。
3. 逐维度自检(改造后该拿的分)
| 维度 | 权重 | 改造后状态 |
|---|---|---|
| 完成度与传播 | 25% | 可运行 App + 闭环(拍报告→识别→档案→趋势→问答→摘要);Gemini 恢复真·读图。待补:3-5 分钟 demo 视频(见 §4)+ 重写图文(§5) |
| Google AI 深度 | 25% | Gemma-3n(端侧)+ Gemini 多模态(读图)+ Gemini(深度/多语言)+ AI Studio。均在核心链路,非包装。 |
| 创新 & Vibe Coding | 20% | hybrid 隐私优先 + 离线可用 + 多语言;Claude Code/Gemini Code Assist 全程 vibe coding。叙事已转出海。 |
| Tech for Good 出海 | 20% | 低资源/弱网/跨国语言障碍,见 §2。 |
| 第 5 维度(~10%) | ? | 未知,待补全(见 §6 开放项) |
4. 现场 Demo 脚本(3-5 分钟,先证「能跑」)
评审第一条:核心功能可实际运行,3-5 分钟讲清主要价值。把最强证据放最前。
- (0:00-0:30)问题:一句话——「全球很多人拿到化验单看不懂,身边没医生,也不敢把隐私报告传云端。」
- (0:30-1:30)拍一张 → 变档案:现场拍/导入一张报告 → Gemini 多模态读出结构化指标 + 异常高亮 → 存进档案。这是第一卖点。
- (1:30-2:15)飞行模式离线:开飞行模式,演示端侧 Gemma-3n 仍能做文本解读/问答——「没网也能用」。这是低资源场景的杀手锏。
- (2:15-3:00)多语言:拿一张外语报告 → Gemini 翻译 + 母语大白话解读。出海痛点直球。
- (3:00-3:45)长期价值:趋势页 AI 解读 + 「就诊前 30 秒整理重点」摘要。
- (3:45-4:30)隐私 + 技术收尾:「我的 · 云端 AI」开关讲 hybrid;一句话点出 Gemma-3n + Gemini + AI Studio。
视频素材:片头/转场可用 Veo / Google Flow 生成;录屏需真机配合(端侧 + 飞行模式只能真机)。
5. 传播物料改写要点(小红书图文)
- 标题从「MNN/SME2 端侧」改为「不上传、断网也能用的健康 AI(Gemma + Gemini)」。
- 9 宫格替换:把旧「MNN-SME2 性能自检」图换成「云端 AI 设置页(Gemini 开关)」+「飞行模式离线生成」+「外语报告→母语解读」。
- 正文三个创新点改为:① 隐私优先 hybrid;② 端侧离线可用(低资源);③ 多语言出海。
- 删除一切「100% 本地、不上云」绝对化表述,统一为「隐私优先,云端可选」。
6. 你需要做的事 + 开放项(不阻塞已完成代码)
必须由你操作(我无法代办)
- 去 aistudio.google.com 免费签发 Gemini API Key。
- App「我的 · 推理引擎 · 云端 AI · Gemini」打开开关、粘贴 key。
- 真机录 demo 视频(端侧 + 飞行模式只能真机)。
开放项(需要你提供信息) 4. 评分表第 5 个维度(~10%)被截断——把完整评审标准或比赛出处发我,补进 §3,别再漏考核点。 5. 平台权衡:当前保 iOS。若评委更看重 Android 生态(Android Studio/Flutter/Gemini Nano),可再评估,但 2-3 周内不建议重写。
7. 一句话给你自己
上一个比赛输在「为命题做的东西没按被考核的点证明」。这次的红线是:Gemini 必须在核心链路里被看到在跑(读图/多语言),而不是设置页里一个没人点的开关。 demo 视频里 Gemini 读出一张报告的那 10 秒,比任何文案都值钱。