10万条医疗数据,50万,3个月 2026年Q1,我们为一家医疗AI公司采集了10万条高质量医疗数据(病历+诊断报告+医学文献)。总花费:¥364,000(约$50,000),耗时3个月。
这10万条数据的成本,是通用数据(如Common Crawl)的100倍。 但通用数据无法训练出"专业"的医疗AI——医疗AI需要"专业"的医疗数据。
以下是完整的数据采集过程,每一步都有坑。
第一步:医院合作谈判(1个月) 目标: 与1-2家三甲医院建立数据合作,获取脱敏病历和诊断报告。
谈判过程: 我们联系了5家医院,3家拒绝,2家愿意谈。拒绝的原因:数据安全顾虑(85%)、伦理审批复杂(60%)、缺乏合作动力(40%)。
最终合作: 与1家三甲医院达成合作。合作条件:
数据脱敏后使用(由医院方脱敏,我们拿不到原始数据) 数据只能在医院指定的服务器上使用(不能带出医院) 研究成果(模型)的知识产权归医院和AI公司共有 数据使用费:¥50,000(一次性) 坑: 医院的数据合作流程非常复杂——需要伦理审批、数据安全审批、法律审批。从谈判到签署协议,花了1个月。
第二步:数据脱敏(2周) 目标: 将病历和诊断报告中的PII(个人身份信息)脱敏。
脱敏内容:
患者姓名 → 替换为"患者001" 身份证号 → 替换为"000000000000000000" 手机号 → 替换为"13800000000" 住址 → 替换为"XX省XX市" 就诊日期 → 替换为"202X年X月" 医生姓名 → 替换为"XX医生" 医院名称 → 替换为"XX医院" 坑: 脱敏不是"删除名字"那么简单。病历中充满了"隐含PII"——如"患者是XX公司CEO"(可以推断出身份)、“患者住在XX小区”(可以推断出住址)。 这些"隐含PII"也需要脱敏。
脱敏工具: 正则表达式 + Presidio(微软开源PII检测)+ 人工审核。人工审核是必须的——AI无法100%识别PII。
第三步:数据标注(3周) 目标: 对病历和诊断报告进行标注(诊断结果、治疗方案、药物处方)。
标注方法: 医生标注(2名内科医生)+ AI预标注(GPT-5)+ 交叉验证。
标注流程:
AI预标注(GPT-5):生成初步标注 医生标注:审核AI标注,修正错误 交叉验证:2名医生互相审核对方的标注 标注成本:
AI预标注:¥500(GPT-5 API费用) 医生标注:¥80,000(2名医生 x 3周) 交叉验证:¥20,000(2名医生 x 1周) 总计:¥100,500 坑: 医生标注的"一致性"是个问题。同一个病历,医生A标注为"轻度肺炎",医生B标注为"支气管炎"。 这种不一致性,需要通过"交叉验证+争议仲裁"来解决。
...