准确率不是终点
CNN 在 ChestX-ray、皮肤癌、糖网筛查上动辄 90%+ 的准确率已经写满论文。但 8 年过去,AI 影像产品在临床上真正改变工作流的不到 30%。
为什么?
三个真实场景里被忽视的瓶颈
1. 假阴性比假阳性危险得多
肺结节漏诊 = 错过早期肺癌;过度诊断 = 多做一次 CT。
模型评估如果用 F1 / accuracy 平均,会掩盖召回率(recall)的不足。临床真正在意的是 sensitivity(敏感性),而不是平均准确率。
2. 模型不解释,医生不敢用
放射科医生需要的不是"这是恶性肿瘤 92%“,而是"我标注的这些纹理特征支持恶性判断”。
可解释性不是研究热点,是产品上线的硬门槛。
3. 数据漂移会让模型悄悄退化
不同医院的 CT 机参数、扫描协议、患者人群结构都不同。在 A 医院训练的模型搬到 B 医院,准确率掉 10 个百分点是常态。
给从业者的三条建议
- 把临床指标作为北极星,不是技术 metric
- 可解释性从 day 1 设计进系统,不要事后补
- 持续监测分布漂移,建立模型重训练的触发机制
AI 影像产品的价值不在"打败医生",而在承担医生不愿意做的重复劳动,把高判断力的工作留给人。