宠物 CT 影像 AI 辅助诊断系统方案

Context

用户拥有 4000 份猫狗 CT(DICOM 格式)+ 诊断记录,病种分散在 10+ 类,扫描集中在特定部位。目标是 3 个月内做出云端 SaaS MVP,既辅助兽医排查也支持自动筛查。用户有编程经验但没做过 ML,标注人力 1 人。

核心挑战

  • 4000 份 / 10+ 病种 = 每个病种平均不到 400 份,部分罕见病种可能只有几十份 → 数据量不足以从零训练专用模型
  • 没有 ML 经验 → 需要尽量降低模型训练门槛
  • 3 个月 → 必须选最快落地的路径

推荐方案:两阶段混合架构

第一阶段(Month 1-2):多模态大模型 + RAG,快速出 MVP

核心思路:不训练模型,用 GPT-4o / Claude 的视觉能力 + 历史病例检索做辅助诊断。

DICOM 上传
    ↓
① 预处理:DICOM → 标准化 PNG 切片(窗宽窗位调整)
    ↓
② 检索相似病例:从历史 4000 份中找最相似的 5-10 份
    ↓
③ 多模态大模型分析:
   输入 = CT 切片图 + 相似病例的诊断记录 + 结构化提示词
   输出 = 初步诊断建议 + 置信度 + 建议关注区域
    ↓
④ 兽医审核界面:展示 AI 建议 + 相似病例对比

技术栈

  • DICOM 处理:pydicom + SimpleITK
  • 图像标准化:窗宽窗位调整 → 导出关键切片为 PNG
  • 相似病例检索:用医学影像 embedding 模型(BiomedCLIP 或 RAD-DINO)做向量化 → Milvus/Qdrant 向量库
  • AI 诊断:三选一测试后决定主力模型(候选:Gemini 3.1 Pro / GPT-5.5 / Claude Opus 4.7)
  • 后端:FastAPI
  • 前端:React + DICOM 查看器(cornerstone.js)
  • 部署:阿里云/AWS

提示词设计(核心)

你是一位经验丰富的兽医影像科医生。

患者信息:
- 物种:{species},品种:{breed},年龄:{age},体重:{weight}
- 扫描部位:{body_part}
- 临床症状:{symptoms}

以下是该患者的 CT 切片图像。

参考病例(与本例最相似的历史诊断):
{similar_cases_with_diagnosis}

请分析:
1. 影像中是否存在异常发现?描述位置、大小、密度特征
2. 最可能的诊断是什么?(给出 Top3 可能性及置信度)
3. 建议进一步检查什么?
4. 与参考病例的异同点

注意:你的分析仅作为辅助参考,最终诊断由兽医做出。

第二阶段(Month 3+):专用检测模型,提升特定病种精度

当 MVP 验证可行后,针对数据量最多的 2-3 个高频病种训练专用检测模型:

技术选型

  • 框架:MONAI(NVIDIA 医学影像专用框架,基于 PyTorch,文档好);PyTorch 与 OpenCV 的关系、四阶段实战例子参见 计算机视觉与深度学习框架.md
  • 预训练模型:用 MONAI 提供的预训练权重做迁移学习
  • 任务类型:分类(正常/异常)+ 检测(标注病灶位置)
  • 训练平台:AutoDL / 阿里云 PAI(按小时租 GPU,不用自建)

数据准备

  • 1 人标注,优先标注高频病种的 Top 2-3 类
  • 标注工具:3D Slicer(免费,支持 DICOM,支持体积标注)
  • 目标:每个病种至少 200 份高质量标注

与第一阶段的融合

  • 专用模型负责高频病种的精确检测(高置信度直接出结果)
  • 大模型负责罕见病种和复杂情况(兜底 + 辅助分析)
  • 两者结果合并展示给兽医

3 个月里程碑

时间目标交付物
Week 1-2数据管线DICOM 解析 + 标准化 + 元数据提取脚本
Week 3-4向量检索4000 份 CT 的 embedding 入库 + 相似检索 API
Week 5-6AI 诊断核心多模态大模型诊断 API(输入 CT + 输出报告)
Week 7-8前端 MVP上传 DICOM → 查看 → AI 分析 → 报告页面
Week 9-10测试验证兽医试用 + 准确率统计 + 迭代优化提示词
Week 11-12上线部署 + 基础监控 + 用户管理

关键风险与应对

风险应对
大模型看不懂宠物 CTWeek 1 先用 20 张典型片子测试,如果完全不行则直接走专用模型路线
4000 份数据病种分布不均先聚焦 Top3 高频病种,罕见病种用 RAG 兜底
单人标注速度慢第一阶段不需要标注(用已有诊断记录);第二阶段只标注高频病种
医疗合规MVP 阶段明确标注”仅供参考,不构成诊断”;正式上线前咨询兽医法规

成本估算(MVP 阶段)

项目月费用
GPT-4o API(按量)¥2000-5000(取决于调用量)
向量数据库(云托管)¥200-500
云服务器(2C4G)¥200-400
对象存储(DICOM 原文件)¥100-200
合计¥3000-6000/月

验证方式

  1. 先跑 20 张典型病例的端到端测试(DICOM → AI 报告),请兽医评估准确率
  2. 如果 Top3 诊断命中率 > 70%,方案可行,继续推进
  3. 如果 < 50%,需要提前进入第二阶段(专用模型)

需要你现在做的第一步

  1. 从 4000 份数据中挑 20 份典型病例(覆盖 5 个常见病种,每种 4 份)
  2. 用 pydicom 导出关键切片为 PNG
  3. 上传到 GPT-4o 测试它能否识别异常
  4. 这个测试 1-2 天就能完成,结果决定后续路线

与本知识库其他章节的关联

  • 第一阶段的 RAG 实现:第一阶段”相似病例检索”用的就是经典 RAG 思路,见 RAG学习笔记.md
  • 第二阶段的 CV 框架:第二阶段 MONAI 是基于 PyTorch 的医学影像专用框架,PyTorch / OpenCV / CV 任务全景及四阶段实战见 计算机视觉与深度学习框架.md
  • 候选模型怎么选:候选的 Gemini 3.1 Pro / GPT-5.5 / Claude Opus 4.7 三家定位与多模态能力对比,见 各家LLM模型特点速查.md(VL 系列的能力天花板)
  • toB 医疗场景的 API 选型:本方案是典型 toB 场景,5 维度选型框架(能力 / 速度 / 稳定性 / 价格 / 合规)见 LLM-API 选型方法论.md;医疗数据合规性是本方案的关键约束
  • 医学场景的提示词方法论:Medprompt 证明了通用大模型 + 复杂提示在医学测试上能超过专用模型,本方案的提示词设计可参考 Medprompt方法论解析.md(动态 few-shot / 自动 CoT / 多数投票三大技巧)
  • 第二阶段自训练模型的部署:训练完专用模型后的私有化部署,见 本地部署模型量化选型.md(精度选择 / 量化方案 / 显卡架构匹配)
  • API 调用的工程细节:调用多模态大模型 API 的请求格式、流式响应、坑点,见 LLM接口规范实战.md(图片 Base64 + content 数组等)