{"doi":"10.1111/liv.70349","title":"From Guidelines to Real‐Time Conversation: Expert‐Validated Retrieval‐Augmented and Fine‐Tuned <scp>GPT</scp> ‐4 for Hepatitis C Management","abstract":"BACKGROUND AND AIMS: Advances in artificial intelligence, particularly large language models (LLMs), hold promise for transforming chronic disease management such as Hepatitis C Virus (HCV) infection. This study evaluates the impact of retrieval-augmented generation (RAG) and supervised fine-tuning (SFT) on both open-ended question answering (accuracy and clarity) and on LLM-recommended treatment regimens for clinical scenarios. METHODS: We employed OpenAI's GPT-4 Turbo in four configurations-baseline, RAG-Top1, RAG-Top 10 and SFT-using the 2020 EASL HCV guidelines as external knowledge or fine-tuning data. For the question set, guidelines were segmented at the paragraph level and encoded into 3072-dimensional embeddings. Fifteen questions covering general, patient and physician perspectives were scored on a 10-point accuracy scale and binary accuracy/clarity by four experts. Separately, we created 25 simulated clinical scenarios; a consensus of four hepatologists defined the gold-standard DAA regimens. Model performance on these cases was measured by two metrics: 'partial accuracy' (≥ one correct DAA without errors) and 'complete accuracy' (all correct DAAs without errors). RESULTS: On open-ended questions, RAG-Top10 outperformed baseline in accuracy (91.7% vs. 36.6%; p < 0.001) and clarity (91.7% vs. 46.6%; p < 0.001). RAG-Top1 achieved 81.7% accuracy and 86.6% clarity (both p < 0.001), while SFT reached 71.7% accuracy and 88.3% clarity (p < 0.001). Similarly, RAG-Top10 achieved the highest performance in prescribing the correct DAA regimen according to expert consensus in 76% of cases (vs. 24% for baseline model, p < 0.001). CONCLUSIONS: Both RAG-Top10 and SFT markedly enhance LLM performance in guideline-driven HCV management-improving not only response accuracy and clarity but also DAA selection in clinical scenarios. RAG-Top10's broader context retrieval confers the greatest gains, while SFT underscores the value of domain-specific alignment. Rigorous, expert-informed evaluation frameworks are essential for the safe integration of LLMs into clinical practice.","journal":"Liver International","year":2025,"id":532924,"datarank":0.0,"base_score":0.0,"endowment":0.0,"self_citation_contribution":0.0,"citation_network_contribution":0.0,"self_endowment_contribution":0.0,"citer_contribution":0.0,"corpus_percentile":null,"corpus_rank":null,"citation_count":3,"citer_count":0,"citers_with_citation_signal":0,"citers_with_endowment":0,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":0.9518,"is_data_producer":false,"deposit_databanks":null,"is_oa":true,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":"2025-01-01","fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":792263,"name":"Nicola Pugliese","orcid":"0000-0001-6466-1412","position":1,"is_corresponding":false},{"id":1409421,"name":"Simone Kresevic","orcid":"0009-0008-1700-7512","position":2,"is_corresponding":false},{"id":1409423,"name":"Miloš Ajčević","orcid":"0000-0001-8307-4360","position":3,"is_corresponding":false},{"id":693407,"name":"Francesco Negro","orcid":"0000-0003-4046-4806","position":4,"is_corresponding":false},{"id":918689,"name":"Massimo Puoti","orcid":"0000-0003-3278-7138","position":5,"is_corresponding":false},{"id":783590,"name":"Xavier Forns","orcid":"0000-0002-8188-1764","position":6,"is_corresponding":false},{"id":1097652,"name":"Jean–Michel Pawlotsky","orcid":"0000-0003-0745-7559","position":7,"is_corresponding":false},{"id":367428,"name":"Dennis Shung","orcid":"0000-0001-8226-1842","position":8,"is_corresponding":false},{"id":552010,"name":"Alessio Aghemo","orcid":"0000-0003-0941-3226","position":9,"is_corresponding":false},{"id":1267769,"name":"Mauro Giuffrè","orcid":"0000-0002-9910-3514","position":0,"is_corresponding":true}],"reference_count":39,"raw_metadata":null,"created_at":"2026-07-19T02:51:27.893975Z","pmid":"40960299","pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}