问题
医疗 AI 如果没有清晰的文本评审标准、专家基准、缺失数据处理和跨机构漂移验证,结果会很脆弱。
工作流
- 01预处理 NIH R01 申请文本,并在受控条件下调用 6 款模型。
- 02收集专家教授评分作为人类基准,对比模型偏差与稳定性。
- 03搭建骨质疏松特征工程和集成模型流水线。
- 04在中美及跨机构数据差异下做迁移验证,优先使用低门槛生理特征。
证据
合作背景
项目与 UTHSC 和 St. Jude 领域专家合作,公开版保留敏感研究材料边界。
NIH R01 评估
基于 6 款模型和 23 份科研申请,与专家评分基准比较。
骨质疏松建模
跨国跨机构迁移验证处理数据标准不一、严重缺失和漂移问题。
边界
- 不替代临床专家判断。
- 公开站点不发布患者数据、原始申请文本、模型输出或在投论文。
- 项目是 NIH R01 文本评估和骨质疏松建模,不写胰腺癌。
岗位映射
- LLM Eval:把主观文本判断转为 rubric 与专家基准比较。
- 医疗数据产品:处理缺失、漂移和低门槛临床特征。
- AI 辅助决策:明确保留人类基准和复核边界。