宠物 CT 影像 AI 辅助诊断系统方案
Context
用户拥有 4000 份猫狗 CT(DICOM 格式)+ 诊断记录,病种分散在 10+ 类,扫描集中在特定部位。目标是 3 个月内做出云端 SaaS MVP,既辅助兽医排查也支持自动筛查。用户有编程经验但没做过 ML,标注人力 1 人。
核心挑战
- 4000 份 / 10+ 病种 = 每个病种平均不到 400 份,部分罕见病种可能只有几十份 → 数据量不足以从零训练专用模型
- 没有 ML 经验 → 需要尽量降低模型训练门槛
- 3 个月 → 必须选最快落地的路径
推荐方案:两阶段混合架构
第一阶段(Month 1-2):多模态大模型 + RAG,快速出 MVP
核心思路:不训练模型,用 GPT-4o / Claude 的视觉能力 + 历史病例检索做辅助诊断。
DICOM 上传
↓
① 预处理:DICOM → 标准化 PNG 切片(窗宽窗位调整)
↓
② 检索相似病例:从历史 4000 份中找最相似的 5-10 份
↓
③ 多模态大模型分析:
输入 = CT 切片图 + 相似病例的诊断记录 + 结构化提示词
输出 = 初步诊断建议 + 置信度 + 建议关注区域
↓
④ 兽医审核界面:展示 AI 建议 + 相似病例对比
技术栈:
- DICOM 处理:
pydicom+SimpleITK - 图像标准化:窗宽窗位调整 → 导出关键切片为 PNG
- 相似病例检索:用医学影像 embedding 模型(BiomedCLIP 或 RAD-DINO)做向量化 → Milvus/Qdrant 向量库
- AI 诊断:三选一测试后决定主力模型(候选:Gemini 3.1 Pro / GPT-5.5 / Claude Opus 4.7)
- 后端:FastAPI
- 前端:React + DICOM 查看器(cornerstone.js)
- 部署:阿里云/AWS
提示词设计(核心):
你是一位经验丰富的兽医影像科医生。
患者信息:
- 物种:{species},品种:{breed},年龄:{age},体重:{weight}
- 扫描部位:{body_part}
- 临床症状:{symptoms}
以下是该患者的 CT 切片图像。
参考病例(与本例最相似的历史诊断):
{similar_cases_with_diagnosis}
请分析:
1. 影像中是否存在异常发现?描述位置、大小、密度特征
2. 最可能的诊断是什么?(给出 Top3 可能性及置信度)
3. 建议进一步检查什么?
4. 与参考病例的异同点
注意:你的分析仅作为辅助参考,最终诊断由兽医做出。
第二阶段(Month 3+):专用检测模型,提升特定病种精度
当 MVP 验证可行后,针对数据量最多的 2-3 个高频病种训练专用检测模型:
技术选型:
- 框架:MONAI(NVIDIA 医学影像专用框架,基于 PyTorch,文档好);PyTorch 与 OpenCV 的关系、四阶段实战例子参见 计算机视觉与深度学习框架.md
- 预训练模型:用 MONAI 提供的预训练权重做迁移学习
- 任务类型:分类(正常/异常)+ 检测(标注病灶位置)
- 训练平台:AutoDL / 阿里云 PAI(按小时租 GPU,不用自建)
数据准备:
- 1 人标注,优先标注高频病种的 Top 2-3 类
- 标注工具:3D Slicer(免费,支持 DICOM,支持体积标注)
- 目标:每个病种至少 200 份高质量标注
与第一阶段的融合:
- 专用模型负责高频病种的精确检测(高置信度直接出结果)
- 大模型负责罕见病种和复杂情况(兜底 + 辅助分析)
- 两者结果合并展示给兽医
3 个月里程碑
| 时间 | 目标 | 交付物 |
|---|---|---|
| Week 1-2 | 数据管线 | DICOM 解析 + 标准化 + 元数据提取脚本 |
| Week 3-4 | 向量检索 | 4000 份 CT 的 embedding 入库 + 相似检索 API |
| Week 5-6 | AI 诊断核心 | 多模态大模型诊断 API(输入 CT + 输出报告) |
| Week 7-8 | 前端 MVP | 上传 DICOM → 查看 → AI 分析 → 报告页面 |
| Week 9-10 | 测试验证 | 兽医试用 + 准确率统计 + 迭代优化提示词 |
| Week 11-12 | 上线 | 部署 + 基础监控 + 用户管理 |
关键风险与应对
| 风险 | 应对 |
|---|---|
| 大模型看不懂宠物 CT | Week 1 先用 20 张典型片子测试,如果完全不行则直接走专用模型路线 |
| 4000 份数据病种分布不均 | 先聚焦 Top3 高频病种,罕见病种用 RAG 兜底 |
| 单人标注速度慢 | 第一阶段不需要标注(用已有诊断记录);第二阶段只标注高频病种 |
| 医疗合规 | MVP 阶段明确标注”仅供参考,不构成诊断”;正式上线前咨询兽医法规 |
成本估算(MVP 阶段)
| 项目 | 月费用 |
|---|---|
| GPT-4o API(按量) | ¥2000-5000(取决于调用量) |
| 向量数据库(云托管) | ¥200-500 |
| 云服务器(2C4G) | ¥200-400 |
| 对象存储(DICOM 原文件) | ¥100-200 |
| 合计 | ¥3000-6000/月 |
验证方式
- 先跑 20 张典型病例的端到端测试(DICOM → AI 报告),请兽医评估准确率
- 如果 Top3 诊断命中率 > 70%,方案可行,继续推进
- 如果 < 50%,需要提前进入第二阶段(专用模型)
需要你现在做的第一步
- 从 4000 份数据中挑 20 份典型病例(覆盖 5 个常见病种,每种 4 份)
- 用 pydicom 导出关键切片为 PNG
- 上传到 GPT-4o 测试它能否识别异常
- 这个测试 1-2 天就能完成,结果决定后续路线
与本知识库其他章节的关联
- 第一阶段的 RAG 实现:第一阶段”相似病例检索”用的就是经典 RAG 思路,见 RAG学习笔记.md
- 第二阶段的 CV 框架:第二阶段 MONAI 是基于 PyTorch 的医学影像专用框架,PyTorch / OpenCV / CV 任务全景及四阶段实战见 计算机视觉与深度学习框架.md
- 候选模型怎么选:候选的 Gemini 3.1 Pro / GPT-5.5 / Claude Opus 4.7 三家定位与多模态能力对比,见 各家LLM模型特点速查.md(VL 系列的能力天花板)
- toB 医疗场景的 API 选型:本方案是典型 toB 场景,5 维度选型框架(能力 / 速度 / 稳定性 / 价格 / 合规)见 LLM-API 选型方法论.md;医疗数据合规性是本方案的关键约束
- 医学场景的提示词方法论:Medprompt 证明了通用大模型 + 复杂提示在医学测试上能超过专用模型,本方案的提示词设计可参考 Medprompt方法论解析.md(动态 few-shot / 自动 CoT / 多数投票三大技巧)
- 第二阶段自训练模型的部署:训练完专用模型后的私有化部署,见 本地部署模型量化选型.md(精度选择 / 量化方案 / 显卡架构匹配)
- API 调用的工程细节:调用多模态大模型 API 的请求格式、流式响应、坑点,见 LLM接口规范实战.md(图片 Base64 + content 数组等)