{"doi":"10.3233/cbm-230340","title":"Curating retrospective multimodal and longitudinal data for community cohorts at risk for lung cancer","abstract":"BackgroundLarge community cohorts are useful for lung cancer research, allowing for the analysis of risk factors and development of predictive models.ObjectiveA robust methodology for (1) identifying lung cancer and pulmonary nodules diagnoses as well as (2) associating multimodal longitudinal data with these events from electronic health record (EHRs) is needed to optimally curate cohorts at scale.MethodsIn this study, we leveraged (1) SNOMED concepts to develop ICD-based decision rules for building a cohort that captured lung cancer and pulmonary nodules and (2) clinical knowledge to define time windows for collecting longitudinal imaging and clinical concepts. We curated three cohorts with clinical data and repeated imaging for subjects with pulmonary nodules from our Vanderbilt University Medical Center.ResultsOur approach achieved an estimated sensitivity 0.930 (95% CI: [0.879, 0.969]), specificity of 0.996 (95% CI: [0.989, 1.00]), positive predictive value of 0.979 (95% CI: [0.959, 1.000]), and negative predictive value of 0.987 (95% CI: [0.976, 0.994]) for distinguishing lung cancer from subjects with SPNs.ConclusionsThis work represents a general strategy for high-throughput curation of multi-modal longitudinal cohorts at risk for lung cancer from routinely collected EHRs.","journal":"Cancer Biomarkers","year":2024,"id":479735,"datarank":0.0,"base_score":0.0,"endowment":0.0,"self_citation_contribution":0.0,"citation_network_contribution":0.0,"self_endowment_contribution":0.0,"citer_contribution":0.0,"corpus_percentile":null,"corpus_rank":null,"citation_count":1,"citer_count":0,"citers_with_citation_signal":0,"citers_with_endowment":0,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":0.6371,"is_data_producer":false,"deposit_databanks":null,"is_oa":true,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":"2024-01-01","fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":470002,"name":"Kaiwen Xu","orcid":"0000-0002-2664-255X","position":1,"is_corresponding":false},{"id":433814,"name":"Neil C. Chada","orcid":"0000-0003-4566-3564","position":2,"is_corresponding":false},{"id":411028,"name":"Heidi Chen","orcid":"0000-0002-1841-6747","position":3,"is_corresponding":false},{"id":1319138,"name":"Michael Knight","orcid":null,"position":4,"is_corresponding":false},{"id":414113,"name":"Sanja Antic","orcid":"0000-0002-6948-8003","position":5,"is_corresponding":false},{"id":425891,"name":"Kim L. Sandler","orcid":"0000-0003-2989-248X","position":6,"is_corresponding":false},{"id":407102,"name":"Fabien Maldonado","orcid":"0000-0002-6504-2063","position":7,"is_corresponding":false},{"id":104551,"name":"Bennett A. Landman","orcid":"0000-0001-5733-2127","position":8,"is_corresponding":false},{"id":260166,"name":"Thomas A. Lasko","orcid":"0000-0003-2300-9529","position":9,"is_corresponding":false},{"id":901938,"name":"Thomas Li","orcid":"0000-0001-9950-4679","position":0,"is_corresponding":true}],"reference_count":16,"raw_metadata":null,"created_at":"2026-07-19T02:06:54.284166Z","pmid":"38517780","pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}