拍照 → 识别 → 记录
一句话 Idea:用相机替代所有手动录入——拍一张照,AI 自动识别内容,结构化存进对应的记录本。
核心洞察
手动录入是一切记录 App 的最大杀手。
用户不是不想记录,是太懒得打字。
而相机是手机上最自然的输入方式。
现在的流程:
拍照 → 然后还要打开 App → 手动输入 → 太麻烦 → 放弃
理想的流程:
拍照 → 完成
为什么现在可以做:多模态 AI(GPT-4o Vision / Gemini / Claude)
已经强大到一张图片就能提取结构化信息,
不再需要为每个品类单独训练模型。
这个 idea 在 2022 年之前根本跑不通,现在时机刚好。
使用场景(无限延伸)
| 拍什么 | 自动记录什么 | 存入哪个本子 |
|---|---|---|
| 辅食 / 餐食照片 | 食材、估算热量、时间 | 饮食记录本 |
| 购物小票 | 商品明细、金额、商店 | 账本 |
| 药盒 / 药瓶 | 药名、剂量、服用说明 | 用药记录本 |
| 一瓶水 / 饮料 | 容量、品牌、时间 | 饮水记录本 |
| 书的封面 | 书名、作者、ISBN | 读书清单 |
| 停车牌 / 停车票 | 停车场、时间、金额 | 停车记录 / 提醒 |
| 酒瓶 | 品牌、年份、价格 | 酒窖记录本 |
| 运动记录(跑步截图) | 距离、配速、卡路里 | 运动本 |
| 体检报告单 | 各项指标、正常范围 | 健康档案 |
| 名片 | 姓名、公司、联系方式 | 通讯录 |
| 宝宝辅食 | 食材、份量、宝宝反应 | 育儿本(与美柚 idea 联动) |
规律:任何"你想记但懒得打字"的场景,都是这个产品的入口。
产品形态
核心 UI:极简拍照界面
┌─────────────────────────┐
│ │
│ [ 取景框 ] │
│ │
│ │
│ [📷 拍摄] │
│ │
│ 最近记录: │
│ ● 午饭 - 番茄炒蛋 12:30 │
│ ● 购物 - ¥47.5 11:00 │
└─────────────────────────┘
- 打开 App → 直接是相机
- 拍照 → AI 识别 → 弹出确认卡片(3 秒内)
- 确认 or 微调 → 保存
- 全程不需要打字
识别后的确认卡片
┌─────────────────────────┐
│ 📷 识别结果 │
│ │
│ 类型:购物小票 │
│ 商店:全家便利店 │
│ 金额:¥23.5 │
│ 商品:矿泉水 x2, 面包 x1│
│ 时间:2026-08-12 14:23 │
│ │
│ 存入:[账本 ▼] │
│ │
│ [✓ 保存] [✎ 编辑] │
└─────────────────────────┘
记录本管理
- 系统预设常用本子(账本、饮食、健康……)
- 用户可自建任意本子
- 每个本子有自己的数据视图(时间轴、统计图、表格)
- 数据可导出 CSV / Excel
技术方案
核心:Vision LLM
用户拍照
→ 图片上传
→ GPT-4o Vision / Gemini Vision 一次调用
→ Prompt:"识别这张图片,提取结构化信息,返回 JSON"
→ 前端渲染确认卡片
Prompt 设计关键:
- 自动判断"这是什么类型的图片"
- 针对不同类型提取不同字段
- 置信度低时说明哪里不确定,让用户补充
成本估算
| 模型 | 每张图片成本 | 每月 100 张 |
|---|---|---|
| GPT-4o mini | ~$0.002 | ~$0.2 |
| GPT-4o | ~$0.01 | ~$1 |
| Gemini 1.5 Flash | ~$0.001 | ~$0.1 |
成本极低,完全可以给免费用户提供基础额度。
技术栈
| 功能 | 方案 |
|---|---|
| 移动端 | React Native / Flutter(跨平台) |
| 图像识别 | GPT-4o Vision API / Gemini Vision |
| 本地存储 | SQLite |
| 云同步 | Supabase / Firebase |
| 账单 OCR 增强 | 百度 OCR API(国内小票识别更准) |
商业模式
| 模式 | 方案 |
|---|---|
| 免费额度 | 每月 50 次识别免费 |
| 订阅 Pro | ¥18/月 / ¥128/年,无限次 + 高级统计 |
| 自带 API Key | 填入自己的 OpenAI Key,无限使用,适合极客用户 |
核心变现逻辑:API 成本低,用户愿意付钱的核心是"节省的时间和精力",
不是功能堆砌。
差异化对比
| 产品 | 能力 | 缺陷 |
|---|---|---|
| Expensify | 专门做报销小票 | 只做小票,企业向 |
| 随手记 | 手动记账,有 OCR | OCR 弱,只做账 |
| Google Lens | 识别能力强 | 只识别不记录 |
| Apple 相册 Live Text | 提取文字 | 没有结构化,不记录 |
| 薄荷营养 | 食物识别 | 只做饮食,需要手动确认很多步骤 |
空白:通用的"拍 → 记"工具,覆盖多个生活场景,一个 App 搞定。
MVP 路径
Week 1-2:单场景验证
选最简单、最高频的一个场景先跑通
推荐:购物小票记账(小票结构清晰,OCR 准确率高)
- 用 GPT-4o Vision API 跑通小票识别
- 手动构建简单 UI:拍照 → 显示识别结果 → 保存
- 给 10 个朋友用,观察准确率和体验
Week 3-4:扩展到 3 个场景
- 加上:辅食记录 + 饮水记录
- 自动路由(识别类型后跳到对应记录本)
Month 2:发布 TestFlight / 安卓内测
- 小红书发"我用 AI 自动记账"测评
- 收集反馈,哪个场景最常用 → 重点打磨
Month 3:正式上架 App Store
- 定价:免费 50 次 / ¥18 月订阅
与其他 Idea 的联动
美柚导出 + 拍照记录
→ 辅食记录完全自动化:拍辅食 → AI 识别食材 → 自动存入宝宝饮食档案
时间轴相册 + 拍照记录
→ 照片不只是照片:拍一张,同时存图 + 存数据
→ 时间轴上的每张照片都有上下文(吃了什么、花了多少、喝了多少水)
三个 idea 形成一套完整的"生活自动记录系统":
- 美柚导出 = 历史数据解放
- 时间轴相册 = 视觉记录
- 拍照识别记录 = 日常自动录入
风险
| 风险 | 评估 |
|---|---|
| 识别准确率不够高 | 模型还会继续变强;加"人工确认"步骤兜底 |
| API 成本随规模上升 | 用户付费覆盖;自带 Key 选项给高频用户 |
| 大厂做同类功能 | Apple / 微信可能集成,但通用工具有机会跑得更快更专注 |
| 隐私问题(图片上传) | 提供本地模式选项;或用设备端小模型处理敏感图片 |
See Also
- wiki/ideas/美柚喂养记录导出工具.md — 辅食记录场景的上游数据源
- wiki/ideas/时间轴相册-亲子对比.md — 照片层,可与记录数据打通
- wiki/ideas/Indie-Hacker-选品方法论.md — 原则一:自己就是用户(懒得手动录入)
Sources
- 对话整理,2026-08-12