拍照 → 识别 → 记录

一句话 Idea:用相机替代所有手动录入——拍一张照,AI 自动识别内容,结构化存进对应的记录本。


核心洞察

手动录入是一切记录 App 的最大杀手。

用户不是不想记录,是太懒得打字。
而相机是手机上最自然的输入方式。

现在的流程:
  拍照 → 然后还要打开 App → 手动输入 → 太麻烦 → 放弃

理想的流程:
  拍照 → 完成

为什么现在可以做:多模态 AI(GPT-4o Vision / Gemini / Claude)
已经强大到一张图片就能提取结构化信息,
不再需要为每个品类单独训练模型。
这个 idea 在 2022 年之前根本跑不通,现在时机刚好。


使用场景(无限延伸)

拍什么 自动记录什么 存入哪个本子
辅食 / 餐食照片 食材、估算热量、时间 饮食记录本
购物小票 商品明细、金额、商店 账本
药盒 / 药瓶 药名、剂量、服用说明 用药记录本
一瓶水 / 饮料 容量、品牌、时间 饮水记录本
书的封面 书名、作者、ISBN 读书清单
停车牌 / 停车票 停车场、时间、金额 停车记录 / 提醒
酒瓶 品牌、年份、价格 酒窖记录本
运动记录(跑步截图) 距离、配速、卡路里 运动本
体检报告单 各项指标、正常范围 健康档案
名片 姓名、公司、联系方式 通讯录
宝宝辅食 食材、份量、宝宝反应 育儿本(与美柚 idea 联动)

规律:任何"你想记但懒得打字"的场景,都是这个产品的入口。


产品形态

核心 UI:极简拍照界面

┌─────────────────────────┐
│                         │
│      [ 取景框 ]          │
│                         │
│                         │
│       [📷 拍摄]          │
│                         │
│  最近记录:              │
│  ● 午饭 - 番茄炒蛋 12:30 │
│  ● 购物 - ¥47.5  11:00  │
└─────────────────────────┘
  1. 打开 App → 直接是相机
  2. 拍照 → AI 识别 → 弹出确认卡片(3 秒内)
  3. 确认 or 微调 → 保存
  4. 全程不需要打字

识别后的确认卡片

┌─────────────────────────┐
│  📷 识别结果             │
│                         │
│  类型:购物小票           │
│  商店:全家便利店         │
│  金额:¥23.5            │
│  商品:矿泉水 x2, 面包 x1│
│  时间:2026-08-12 14:23 │
│                         │
│  存入:[账本 ▼]          │
│                         │
│  [✓ 保存]  [✎ 编辑]     │
└─────────────────────────┘

记录本管理


技术方案

核心:Vision LLM

用户拍照
  → 图片上传
  → GPT-4o Vision / Gemini Vision 一次调用
  → Prompt:"识别这张图片,提取结构化信息,返回 JSON"
  → 前端渲染确认卡片

Prompt 设计关键

成本估算

模型 每张图片成本 每月 100 张
GPT-4o mini ~$0.002 ~$0.2
GPT-4o ~$0.01 ~$1
Gemini 1.5 Flash ~$0.001 ~$0.1

成本极低,完全可以给免费用户提供基础额度。

技术栈

功能 方案
移动端 React Native / Flutter(跨平台)
图像识别 GPT-4o Vision API / Gemini Vision
本地存储 SQLite
云同步 Supabase / Firebase
账单 OCR 增强 百度 OCR API(国内小票识别更准)

商业模式

模式 方案
免费额度 每月 50 次识别免费
订阅 Pro ¥18/月 / ¥128/年,无限次 + 高级统计
自带 API Key 填入自己的 OpenAI Key,无限使用,适合极客用户

核心变现逻辑:API 成本低,用户愿意付钱的核心是"节省的时间和精力",
不是功能堆砌。


差异化对比

产品 能力 缺陷
Expensify 专门做报销小票 只做小票,企业向
随手记 手动记账,有 OCR OCR 弱,只做账
Google Lens 识别能力强 只识别不记录
Apple 相册 Live Text 提取文字 没有结构化,不记录
薄荷营养 食物识别 只做饮食,需要手动确认很多步骤

空白:通用的"拍 → 记"工具,覆盖多个生活场景,一个 App 搞定。


MVP 路径

Week 1-2:单场景验证
选最简单、最高频的一个场景先跑通
推荐:购物小票记账(小票结构清晰,OCR 准确率高)

- 用 GPT-4o Vision API 跑通小票识别
- 手动构建简单 UI:拍照 → 显示识别结果 → 保存
- 给 10 个朋友用,观察准确率和体验

Week 3-4:扩展到 3 个场景
- 加上:辅食记录 + 饮水记录
- 自动路由(识别类型后跳到对应记录本)

Month 2:发布 TestFlight / 安卓内测
- 小红书发"我用 AI 自动记账"测评
- 收集反馈,哪个场景最常用 → 重点打磨

Month 3:正式上架 App Store
- 定价:免费 50 次 / ¥18 月订阅

与其他 Idea 的联动

美柚导出 + 拍照记录
  → 辅食记录完全自动化:拍辅食 → AI 识别食材 → 自动存入宝宝饮食档案

时间轴相册 + 拍照记录
  → 照片不只是照片:拍一张,同时存图 + 存数据
  → 时间轴上的每张照片都有上下文(吃了什么、花了多少、喝了多少水)

三个 idea 形成一套完整的"生活自动记录系统":


风险

风险 评估
识别准确率不够高 模型还会继续变强;加"人工确认"步骤兜底
API 成本随规模上升 用户付费覆盖;自带 Key 选项给高频用户
大厂做同类功能 Apple / 微信可能集成,但通用工具有机会跑得更快更专注
隐私问题(图片上传) 提供本地模式选项;或用设备端小模型处理敏感图片

See Also

Sources