Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints

📅 发布时间:2026/7/23 20:45:14
Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints 文章总结与翻译一、主要内容本文针对医疗研究人员缺乏数据库专业知识,难以高效利用电子健康记录(EHR)数据的问题,提出了名为CELEC的框架。该框架基于大型语言模型(LLM),实现自动化EHR数据提取与分析,核心功能包括将自然语言查询转化为SQL语句、执行本地查询及生成数据可视化结果。CELEC的核心设计围绕三大要素:整合数据库模式信息(表名、列名等元数据)、少量示例演示(Few-shot Demonstrations)和思维链推理(Chain-of-Thought),以提升SQL生成的准确性和稳健性。在隐私保护方面,LLM仅接触数据库元数据,所有查询均在机构内部环境安全执行,不向外部传输任何患者级数据。实验基于EHRSQL-2024基准数据集(适配MIMIC系列EHR数据库)进行评估,CELEC取得81.05%的RS(0)准确率,与领先系统性能相当,同时保持低延迟(单查询平均6秒左右)和成本效益。消融实验验证了少量示例演示、模式信息提供、重试机制等组件对性能的关键作用。二、创新点隐私优先的架构设计:严格限制LLM仅访问数据库元数据,患者级数据全程在本地环境处理,彻底避免数据泄露风险,解决了医疗数据与云LLM交互的隐私痛点。高效的SQL生成策略:融合模式信息、少量示例和思维链推理的提示工程,无需额外训练(仅依赖少量示例提示),即可实现复杂医疗场景的SQL生成,平衡了易用性与灵活性。端到端一体化功能:集成自然