Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

10 Commits
 
 
 
 

Repository files navigation

🏥 Awesome Medical & Multilingual
QA/RAG Research Papers

Awesome License: CC BY 4.0 Made with Markdown PRs Welcome

GitHub stars GitHub forks GitHub watchers GitHub last commit Commit activity Repo size

GitHub issues GitHub pull requests GitHub contributors Curated Papers Last Curated

Medical RAG GraphRAG Multilingual Clinical Safety

Star this repository if you use Medical RAG, GraphRAG, clinical QA, biomedical retrieval, or multilingual AI.


Tip

The Definitive Knowledge Hub for Medical AI

Welcome to a meticulously curated collection of 250+ research papers, datasets, and benchmarks. This repository bridges the gap between Structured Medical Knowledge (Knowledge Graphs) and Generative Reasoning (LLMs), focusing on:

  • Retrieval-Augmented Generation (RAG): Techniques to ground AI in factual clinical data.
  • Multilingual Equity: Ensuring medical AI works across diverse languages and cultures.
  • Complex Reasoning: Moving from simple Q&A to multi-hop clinical decision support.

Note

How to Navigate

Organized taxonomically to help you find exactly what you need:

  • By Method: Looking for GraphRAG, PEFT, or Visual QA?
  • By Domain: Interested in Mental Health, Legal, or Finance?

Use the Table of Contents below to jump straight to your area of interest.


📜 Table of Contents


🧭 Research Map

Important

Recommended Reading Path for Medical RAG

Start with the survey and benchmark papers, then move to GraphRAG/KG-enhanced systems, then clinical/EHR RAG, and finally safety-focused evaluation. This makes the list easier to scan for newcomers and more useful for researchers comparing medical RAG pipelines.

Track Best Starting Points Why It Matters
Medical RAG Foundations MIRAGE / MedRAG Toolkit, RAG in Biomedicine Survey, MRAG Gives a practical baseline for corpora, retrievers, prompting, and evaluation.
GraphRAG & Knowledge Graphs Medical Graph RAG, MedRAG, KG-Rank, KRAGEN, DR.KNOWS Adds structured biomedical relations, path reasoning, and explainable evidence.
Clinical & EHR RAG RGAR, i-MedRAG, ClinicalRAG, MedBioRAG Connects retrieved literature with patient-specific or clinical-context evidence.
Safety & Trustworthiness RAG², RAG-X, Contradictions in Context, MedRGB Measures grounding, context use, outdated evidence, and deceptive accuracy.
Multilingual & Multimodal RAG Medical mT5, Japanese KG-RAG, MED-VRAG, EHRXQA Extends medical QA beyond English text-only retrieval.

Tip

For more GitHub stars: keep the first screen attractive, add fresh 2025-2026 papers near the top of each section, label code/dataset/project links clearly, and make it obvious why this list is different from generic RAG lists: medical safety, multilingual equity, and knowledge-graph grounding.


🧬 Medical & Clinical LLMs

Important

Foundational Models & Clinical Adaptations

This section aggregates Large Language Models (LLMs) rigorously adapted for the medical domain. It encompasses a spectrum of methodologies from Continued Pre-training on biomedical corpora to Instruction Fine-tuning and Parameter-Efficient Fine-Tuning (PEFT). These models bridge the gap between general-purpose AI and the high-stakes requirements of clinical reasoning and healthcare NLP.

Topic Full Title Resources Notes
Medical Adaptation HuatuoGPT-II, One-stage Training for Medical Adaptation of LLMs arXiv Code OpenReview One-stage training for medical adaptation.
QA System SPBERTQA: A Two-Stage Question Answering System Based on Sentence Transformers for Medical Texts arXiv Springer 2-Stage QA based on Sentence Transformers.
Medical LLM Medical mT5: An Open-Source Multilingual Text-to-Text LLM for The Medical Domain arXiv ACL HuggingFace Multilingual T5 for medical domain.
Closed-Domain QA Large Language Models Encode Clinical Knowledge (Med-PaLM) Nature arXiv Seminal Med-PaLM paper.
Medical Tuning ClinicalGPT: Large Language Models Finetuned with Diverse Medical Data and Comprehensive Evaluation arXiv ResearchGate Fine-tuning on diverse data.
Clinical Fine-Tune LlamaCare: An Instruction Fine-Tuned Large Language Model for Clinical NLP ACL SemanticScholar Instruction fine-tuned LLaMA.
Virtual Assistant KG-Infused LLM for Virtual Health Assistant: Accelerated Inference and Enhanced Performance IEEE KG-infused LLM assistant.
Safe MedLLM Medical Graph RAG: Towards Safe Medical Large Language Model via Graph RAG ACL arXiv Code MedGraphRAG framework.
Clinical PEFT Parameter-Efficient Fine-Tuning of LLaMA for the Clinical Domain ACL arXiv Clinical LLaMA-LoRA.
French Model DrBERT: A Robust Pre-trained Model in French for Biomedical and Clinical Domains ACL Code HuggingFace BERT for French Bio/Clinical.
Spanish Biomed Pretrained Biomedical Language Models for Clinical NLP in Spanish ACL HuggingFace Beteo / RoBERTa-es.
Vietnamese Health ViHealthBERT: Pre-trained Language Models for Vietnamese in Health Text Mining ACL HuggingFace ViHealthBERT.
TCM Tuning HuaTuo: Tuning LLaMA Model with Chinese Medical Knowledge arXiv Code HuaTuo (LLaMA tuning).
Complex Reasoning HuatuoGPT-o1: Towards Medical Complex Reasoning with LLMs arXiv Code O1-like medical reasoning.
Japanese 70B 70B-parameter Large Language Models in Japanese Medical Question-Answering ResearchGate 70B Japanese Medical LLM.
Clinical Mamba ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical Notes arXiv Mamba model for clinical notes.
Trilingual LLM ELAINE-medLLM: Lightweight English Japanese Chinese Trilingual Large Language Model ACL En-Jp-Zh Medical LLM.
Note Gen A Continued Pretrained LLM Approach for Automatic Medical Note Generation ACL arXiv Auto note generation.
Clinical Needs Do We Still Need Clinical LLMs? arXiv HuggingFace Questioning need for specialized LLMs.
French Biomed AliBERT: A Pre-trained Language Model for French Biomedical Text ResearchGate AliBERT.
Portuguese BioBERTpt: A Portuguese Neural Language Model for Clinical NER ACL Code BioBERTpt.
Portuguese Card CardioBERTpt: Transformer-based Models for Cardiology Language Representation ACL CardioBERTpt.
Spanish Clinical Clinical Flair: A Pre-Trained Language Model for Spanish Clinical NLP ACL Clinical Flair.
Spanish Pre-train Development of pre-trained language models for clinical NLP in Spanish ACL Pre-trained models for Spanish.
Vietnamese Biomed ViPubmedDeBERTa: A Pre-trained Model for Vietnamese Biomedical Text ACL ViPubmedDeBERTa.
Chinese LLM Zhongjing: Enhancing Chinese Medical LLM through Expert Feedback AAAI arXiv Code Zhongjing model.
Textbook Aug Augmenting Black-box LLMs with Medical Textbooks for Biomedical QA arXiv ACL Code Textbook augmentation.
Collaborative MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning arXiv Code Multi-agent collaboration.
BioBERT MSQ-BioBERT: Ambiguity Resolution to Enhance BioBERT Medical QA ACM OpenReview Ambiguity resolution.
EHR Repr MHGRL: An Effective Representation Learning Model for Electronic Health Records ACL Representation learning.
CamemBERT CamemBERT-bio: Leveraging Continual Pre-training on French Biomedical Data ACL arXiv French domain adaptation.
Japanese Eval Evaluating GPT-4 and ChatGPT on Japanese Medical Licensing Examinations arXiv Code IgakuQA Benchmark.
Fine-tuning Effects of Information Masking in the Task-Specific Finetuning of a Transformers-Based Clinical Question-Answering Framework IEEE Info masking in fine-tuning.
Embeddings MedITA_embeddings: Combining Contrastive Learning and Knowledge Graph Embeddings to develop medical word embeddings Code PMC KG + Contrastive embeddings.
Medical RL Breaking Reward Collapse: Adaptive Reinforcement for Open-ended Medical Reasoning with Enhanced Semantic Discrimination arXiv Adaptive RL for medical reasoning.
Reasoning RL CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making arXiv Consistent reasoning via RL.
Medical RL Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning arXiv Code Expert-level reasoning via RL.
Unified Reasoning Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning arXiv Code Unified reasoning via RL.
Reasoning Emergence Med-RLVR: Emerging Medical Reasoning from a 3B Base Model via Reinforcement Learning arXiv RL on 3B model.
Diagnosis Reasoning MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom arXiv RL for CT diagnosis.
Patient-Doctor Dr. Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian ACL arXiv Romanian multi-agent assistant.
Medical Advice PIE-Med: Predicting, Interpreting and Explaining Medical Recommendations ResearchGate Code Predict-Interpret-Explain.
Error Detection Maven at MEDIQA-CORR 2024: Leveraging RAG and Medical LLM for Error Detection and Correction in Medical Notes ACL Error detection in notes.
Structured Ext Structured Extraction of Real World Medical Knowledge using LLMs for Summarization and Search IEEE arXiv Structured extraction.
Machine Reading Towards Medical Machine Reading Comprehension with Structural Knowledge and Plain Text ACL KMQA model.
Virtual Patient A Virtual Patient Dialogue System Based on Question-Answering on Clinical Records SemanticScholar Virtual Patient Dialogue.
Herbal Medicine ViHerbQA: A Robust QA Model for Vietnamese Traditional Herbal Medicine ACL Vietnamese Herbal Medicine QA.
Rule-Free A Rule-Free Approach for Cardiological Registry Filling from Italian Clinical Notes with Question Answering Transformers ResearchGate Springer Cardiological registry filling.
Clinical Cases Using Structured Health Information for Controlled Generation of Clinical Cases in French ACL Generating French clinical cases.
Zero-Shot Clinical Zero-Shot Clinical Questionnaire Filling From Human-Machine Interactions ACL Zero-shot questionnaire filling.
Safety Reports Automatic Job Safety Report Generation using RAG-based LLMs IEEE ResearchGate Job safety report generation.
Biomed Reasoning Hierarchical Representation-based Dynamic Reasoning Network for Biomedical Question Answering (HDRN) ACL HDRN for Biomedical QA.
QA Consistency Are Large Language Models Consistent in Health-Related Question Answering? arXiv Consistency check in Health QA.
Entity Masking Boosting Low-Resource Biomedical QA via Entity-Aware Masking Strategies ACL Entity-aware masking strategies.
Biomed QA Biomedical Question Answering Systems into Practice: A Survey arXiv Journal Survey of BioMed QA systems.
Search / Dialogue Anticipating Follow-Up Questions in Exploratory Information Search ACL Follow-up question prediction.
Exam Generation From Human Days to Machine Seconds: Automatically Answering and Generating Machine Learning Final Exams arXiv ACM ML Exam generation/answering.
French NER A Benchmark Evaluation of Clinical Named Entity Recognition in French arXiv ACL Clinical NER in French.
Chinese Medical Benchmarking Large Language Models on CMExam: A Comprehensive Chinese Medical Examination Dataset arXiv Code CMExam benchmark.
DrQA Reading Wikipedia to Answer Open-Domain Questions (DrQA) ACL Code Seminal DrQA paper.
Few-shot QA Gotta: Generative Few-shot Question Answering by Prompt-based Cloze Data Augmentation SIAM Prompt-based data augmentation.
Spoken QA A Framework for Automatic Generation of Spoken Question-Answering Data ACL Spoken QA data generation.
Non-factoid QA MICRON: Multigranular Interaction for Contextualizing RepresentatiON in Non-factoid Question Answering ACL MICRON model.
Synthetic QA Training Generative Question-Answering on Synthetic Data Obtained from an Instruct-tuned Model ACL Synthetic training data.
Hebrew NLP Transformer-based Hebrew NLP models for Short Answer Scoring in Biology ACL Hebrew Short Answer Scoring.
Data Selection Data Selection for Language Models: A Survey arXiv Code Survey on data selection.
QA Eval Evaluating Open-QA Evaluation NeurIPS Code Evaluation of QA evaluation.
Explainable QA Explainable Bilingual Medical-Question-Answering Model Using Ensemble Learning Technique MDPI Bilingual Explainable QA.
Hint Gen HintQA: Exploring Hint Generation Approaches in Open-Domain Question Answering arXiv ACL Code Hint generation for ODQA.
Memory QA Omne-R1: Learning to Reason with Memory for Multi-hop Question Answering arXiv Reasoning with Memory.

📚 Multilingual & Cross-Lingual QA

Important

Breaking Language Barriers

This section is dedicated to democratizing AI access through Cross-Lingual Transfer and Multilingual RAG. It features benchmarks for under-represented languages (e.g., Amharic, Tigrinya, Kazakh), techniques for cultural alignment, and strategies to bridge the performance gap between high-resource and low-resource linguistic domains.

Topic Full Title Resources Notes
Multilingual Adapters Adapters for Enhanced Modeling of Multilingual Knowledge and Text arXiv ACL Code Enhanced modeling adapters.
Entity Alignment Aligning Cross-Lingual Entities with Multi-Aspect Information arXiv ACL Code Multi-aspect alignment.
Arabic Medical AraMed: Arabic Medical Question Answering using Pretrained Transformer Language Models ACL Arabic Medical QA.
Multi-Domain QA M2QA: Multi-domain Multilingual Question Answering arXiv Code HuggingFace M2QA benchmark.
Cross-Lingual XLM-K: Improving Cross-Lingual Language Model Pre-training with Multilingual Knowledge AAAI Code Pre-training with multilingual knowledge.
Prompt Transfer Cross-Lingual Transfer for Natural Language Inference via Multilingual Prompt Translator arXiv Multilingual prompt translation.
Thai LLM Representing the Under-Represented: Cultural and Core Capability Benchmarks for Thai LLMs ACL Thai cultural/core benchmarks.
ICL Alignment Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment ACL Code Cross-lingual alignment for ICL.
Kazakh QA KazQAD: Kazakh Open-Domain Question Answering Dataset ACL arXiv Code Kazakh open-domain QA.
Multilingual RAG Not All Languages are Equal: Insights into Multilingual Retrieval-Augmented Generation arXiv Linguistic inequalities in RAG.
Machine Translation Enhancing Machine Translation Experiences with Multilingual Knowledge Graphs AAAI MT with Multilingual KG.
Amharic QA Low Resource Question Answering: An Amharic Benchmarking Dataset (Amh-QuAD) ACL Code Amh-QuAD / AmQA.
Tigrinya QA Question-Answering in a Low-resourced Language: Benchmark Dataset and Models for Tigrinya ACL arXiv Tigrinya QA benchmark.
Portuguese QA Pirá: A Bilingual Portuguese-English Dataset for Question-Answering ACM Code Pirá dataset.
Zero-shot CoT AutoCAP: Towards Automatic Cross-lingual Alignment Planning for Zero-shot Chain-of-Thought ACL AutoCAP.
Cultural QA NativQA: Multilingual Culturally-Aligned Natural Query for LLMs ACL Code Culturally-aligned questions.
Swedish NLP A Benchmark for Swedish Clinical Natural Language Processing arXiv ACL Swedish Clinical NLP benchmark.
Transferability On the Cross-lingual Transferability of Monolingual Representations ACL arXiv Monolingual transferability.
Linguistic Inc URIEL+: Enhancing Linguistic Inclusion and Usability in a Typological and Multilingual Knowledge Base ACL arXiv Code URIEL+ Knowledge Base.
Prompt Transfer Is Prompt Transfer Always Effective? An Empirical Study of Prompt Transfer for Question Answering ACL Code Empirical study on prompt transfer.
Romanian Eval Evaluation of Language Models on Romanian XQuAD and RoITD datasets Journal Romanian XQuAD/RoITD.

🔗 Knowledge Graphs & Reasoning

Warning

Bridging Structured & Unstructured Knowledge

This section dives into the complex integration of Knowledge Graphs (KGs) with Large Language Models. It covers advanced reasoning tasks such as Multi-hop Reasoning, Subgraph Extraction, and Neuro-Symbolic approaches. Papers here explore how to ground LLM generation in factual graph structures to improve accuracy and interpretability.

Topic Full Title Resources Notes
KG Alignment MRAEA: An Efficient and Robust Entity Alignment Approach for Cross-lingual KG ACM ResearchGate Cross-lingual KG alignment.
Reasoning Eval DIVKNOWQA: Assessing the Reasoning Ability of LLMs via Open-Domain QA over KB and Text arXiv Reasoning over KB and Text.
KG + LLM ChatDoctor: A Medical Chat Model Fine-Tuned on LLaMA Using Medical Domain Knowledge arXiv Code LLaMA + Medical KG.
KG Prompting KG-CoT: Chain-of-Thought Prompting of LLMs over Knowledge Graphs IJCAI CoT over Knowledge Graphs.
KG Sync Domain Knowledge Exploration by Synchronizing Knowledge Graph and LLMs arXiv Synchronizing KG and LLMs.
Dynamic Reasoning Dynamic Hierarchical Reasoning with Language Model and Knowledge Graph (DRLK) arXiv ResearchGate Hierarchical reasoning with KG.
Subgraph Reasoning ReasoningLM: Enabling Structural Subgraph Reasoning in Pre-trained Language Models ACL arXiv Code Structural subgraph reasoning.
Graph Reasoning RoG: Reasoning on Graphs (Faithful and Interpretable LLM Reasoning) ICLR arXiv Code Reasoning paths for QA.
Graph Reasoning KG-GPT: A General Framework for Reasoning on Knowledge Graphs Using LLMs ACL arXiv Code KG-GPT framework.
KG Integration Bridging the Gap: Integrating Knowledge Graphs into LLMs for Complex QA OpenReview KG + LLM for complex QA.
Multilingual KG Joint Completion and Alignment of Multilingual Knowledge Graphs ACL arXiv JMAC model.
Knowledge Injection KIMERA: Injecting Domain Knowledge into Vacant Transformer Heads ACL Retraining vacant heads.
Quotes KG QuoteKG: A Multilingual Knowledge Graph of Quotes ResearchGate Project KG of quotes (55 langs).
TCM KG Traditional Chinese Medicine Knowledge Graph Construction Based on LLMs MDPI TCM KG construction.
Updating KG Up To Date: Automatic Updating Knowledge Graphs Using LLMs Elsevier Auto updating KGs.
Semi-supervised Semi-supervised Entity Alignment via Joint Knowledge Embedding (KECG) ACL Code KECG model.
Alignment Transf. Multi-Modal Knowledge Graph Transformer Framework for Entity Alignment ACL Meaformer.
Contrastive Multi-modal Contrastive Representation Learning for Entity Alignment ACL MCLEA model.
KBQA Framework ChatKBQA: A Generate-then-Retrieve Framework for KBQA with Fine-tuned LLMs ACL arXiv Code Generate-then-Retrieve.
Few-Shot KBQA KB-BINDER: A Unified Semantically Parsing Framework for KBQA arXiv Few-shot semantic parsing.
Semantic Parsing LLM-based Semantic Parsing for Conversational QA over Knowledge Graphs arXiv Semantic parsing for ConvQA.
Complex QA KQA Pro: A Dataset with Explicit Compositional Programs for Complex KBQA ACL Code KQA Pro dataset.
Rule-Guided Rule-KBQA: Rule-Guided Reasoning for Complex KBQA with LLMs ACL Rule-guided reasoning.
Medical KG Research on Medical Question Answering System Based on Knowledge Graph ResearchGate Neo4j-based Medical KG.
Knowledge Injection Infusing Disease Knowledge into BERT for Health QA and Inference ACL arXiv Infusing knowledge into BERT.
Journal KG Construction of Journal Knowledge Graph Based on Deep Learning and LLM MDPI ResearchGate Journal KG construction.
Alzheimer's QA Dynamic Co-Augmentation of Large Language Models and Knowledge Graphs for Question Answering in Alzheimer's Disease Scientific Literature arXiv Co-augmentation for Alzheimer's.
Aviation QA Knowledge Graph – Deep Learning: A Case Study in Question Answering in Aviation Safety Domain ACL Aviation safety KG-QA.
Brain Disorders Knowledge Graph and Its Application in the Study of Neurological and Mental Disorders Frontiers PubMed KG for brain disorders.
Chronic Diseases Research on Question Answering over Knowledge Graph of Chronic Diseases ResearchGate Chronic disease KG.
Entity Alignment Exploring the Impacts of Feature Fusion Strategy in Multi-modal Entity Alignment ACL Feature fusion in alignment.
Object Prediction Evaluating Prompt-based Question Answering for Object Prediction in the Open Research Knowledge Graph ResearchGate Prompt-based object prediction.

🧲 RAG & Retrieval Systems

Tip

Augmenting Generation with External Medical Knowledge

This section focuses on Retrieval-Augmented Generation (RAG) systems that reduce hallucinations, improve clinical grounding, and connect LLMs with biomedical literature, EHRs, guidelines, ontologies, and knowledge graphs. The papers are grouped by use case so readers can quickly compare survey/benchmark work, GraphRAG, clinical and EHR retrieval, safety evaluation, and retrieval optimization.

Warning

Medical RAG is not only retrieval. Strong systems must also handle outdated evidence, contradictory sources, patient-specific context, citation quality, and clinical safety. Prefer papers that report retrieval quality, answer faithfulness, source attribution, robustness, and human/clinical evaluation.

Medical RAG Surveys, Benchmarks & Toolkits

Topic Full Title Resources Notes
Benchmark / Toolkit Benchmarking Retrieval-Augmented Generation for Medicine ACL arXiv Code MIRAGE benchmark and MedRAG toolkit for medical QA.
BioMed Survey Retrieval-Augmented Generation in Biomedicine: A Survey of Technologies, Datasets, and Clinical Applications arXiv Survey of biomedical RAG methods, datasets, and clinical uses.
Clinical Review Retrieval-Augmented Generation in Medicine: A Scoping Review of Technical Implementations, Clinical Applications, and Ethical Considerations arXiv Clinical applications, implementation patterns, and ethics.
Healthcare Review Retrieval augmented generation for large language models in healthcare: A systematic review PubMed PMC Healthcare RAG review across retrieval, augmentation, and generation.
Meta-analysis Retrieval-Augmented Generation and Large Language Models in Biomedicine: A Systematic Review, Meta-analysis, and Clinical Development Guidelines PubMed Evidence synthesis and clinical development guidance.
MRAG Benchmark MRAG: Benchmarking Retrieval-Augmented Generation for Bio-medicine arXiv English/Chinese biomedical RAG benchmark and toolkit.
MedRGB Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering arXiv Tests sufficiency, integration, robustness, and noisy retrieval.
RAG Design A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering arXiv Retrieval design choices on MedQA with modest compute.
RAG Chatbots Automated Question-Answer Generation for Evaluating RAG-based Chatbots ACL Auto QA generation for healthcare RAG evaluation.

Medical GraphRAG & KG-Enhanced RAG

Topic Full Title Resources Notes
Safe MedGraphRAG Medical Graph RAG: Towards Safe Medical Large Language Model via Graph Retrieval-Augmented Generation ACL arXiv Code Triple graph construction and U-Retrieval for safer medical responses.
Healthcare Copilot MedRAG: Enhancing Retrieval-Augmented Generation with Knowledge Graph-Elicited Reasoning for Healthcare Copilot arXiv OpenReview Code Diagnostic KG reasoning with EHR retrieval and follow-up questions.
Ranking/Re-ranking KG-Rank: Enhancing LLMs for Medical QA with Knowledge Graphs and Ranking Techniques ACL arXiv Code KG-based retrieval/ranking for medical QA.
Biomedical Problem Solving KRAGEN: A Knowledge Graph-Enhanced RAG Framework for Biomedical Problem Solving Using Large Language Models Bioinformatics PubMed PMC KG + RAG + graph-of-thought prompting.
Diagnosis KG DR.KNOWS: Leveraging Medical Knowledge Graphs Into Large Language Models for Diagnosis Prediction JMIR AI PMC UMLS paths aligned with patient-specific EHR information.
Biomedical Agent ESCARGOT: An AI Agent Leveraging LLMs, Dynamic Graph of Thoughts, and Biomedical Knowledge Graphs for Enhanced Reasoning Bioinformatics PMC Agentic KG reasoning with dynamic graph-of-thoughts.
Structured Reflection Structured Reflective Reasoning for Precise Medical Knowledge Graph Retrieval-Augmented Generation PubMed Type-aware pre-anchoring and reflective KG reasoning.
KG-RAG Knowledge Graph-extended Retrieval Augmented Generation (KG-RAG) arXiv Project KG-extended RAG with biomedical grounding potential.
TCM GraphRAG OpenTCM: A GraphRAG-Empowered LLM-based System for Traditional Chinese Medicine arXiv GraphRAG for TCM knowledge and consultation.
Japanese KG-RAG Exploring the Role of Knowledge Graph-Based RAG in Japanese Medical Question Answering with Small-Scale LLMs arXiv KG-RAG for Japanese medical QA.
Region-First ReGraM: Region-First Knowledge Graph Reasoning for Medical QA arXiv Region-first graph reasoning for medical QA.

Clinical, EHR & Patient-Specific RAG

Topic Full Title Resources Notes
Heterogeneous Retrieval ClinicalRAG: Enhancing Clinical Decision Support through Heterogeneous Knowledge Retrieval ACL Clinical decision support with heterogeneous evidence.
Factual + Conceptual RGAR: Recurrence Generation-Augmented Retrieval for Factual-aware Medical Question Answering ACL Iteratively combines EHR factual knowledge with corpus knowledge.
Iterative RAG Improving Retrieval-Augmented Generation in Medicine with Iterative Follow-up Questions arXiv Code i-MedRAG uses follow-up queries for complex medical questions.
Literature QA Biomedical Literature Q&A System Using Retrieval-Augmented Generation (RAG) arXiv PubMed-centered biomedical literature QA.
Medical + Biology QA MedBioRAG: Semantic Search and Retrieval-Augmented Generation with Large Language Models for Medical and Biological QA arXiv Semantic and lexical search for biomedical QA.
Guideline Grounding Refine Medical Diagnosis Using Generation Augmented Retrieval from Clinical Practice Guidelines arXiv CPG-grounded diagnosis refinement.
Orthopedic Chatbot Development and Evaluation of a Retrieval-Augmented Generation Chatbot for Orthopedic Health Information in German PubMed German evidence-based orthopedic patient information.
Agentic Clinical RAG A Self-Correcting Agentic Graph RAG for Clinical Decision Support in Hepatology PubMed Self-correcting agentic GraphRAG for hepatology.
Low-Resource QA Two-Layer RAG Framework for Low-Resource Medical QA Using Reddit Data Journal Low-resource medical QA with community data.
Nutrigenetics A Retrieval-Augmented Generation Application for Question-Answering in Nutrigenetics ResearchGate Code Nutrigenetic GraphRAG application.
Multimodal Medical RAG Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering arXiv MED-VRAG retrieves PMC page images, tables, figures, and layouts.

Reliability, Safety & Evaluation

Topic Full Title Resources Notes
Rationale-Guided Rationale-Guided Retrieval Augmented Generation for Medical Question Answering ACL arXiv Code RAG² filters distractors and uses rationales as retrieval queries.
Diagnostic Evaluation RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering arXiv Disentangles retriever vs generator errors with CUE metrics.
Contradiction-aware Contradictions in Context: Challenges for Retrieval-Augmented Generation in Healthcare arXiv Tests outdated and contradictory evidence in healthcare RAG.
RAG Certainty RAG Certainty: Quantifying the Certainty of Context-Based Responses by LLMs IEEE Certainty metric for context-grounded answers.
Confidence Understanding the Impact of Confidence in Retrieval Augmented Generation: A Case Study in the Medical Domain ACL Studies retrieval confidence and medical answer quality.
Adaptive Control TC-RAG: Turing-Complete RAG's Case Study on Medical LLM Systems ACL Memory stack, retrieval halting, and state-aware RAG control.
RAG Credibility How Credible Is an Answer From Retrieval-Augmented LLMs? ACL Credibility estimation for multi-hop QA.
Context Use Desiderata for the Context Use of Question Answering Systems ACL arXiv How QA systems should use retrieved context.
Uncertainty Modeling Uncertainty and Using Post-fusion as Fallback Improves Retrieval-Augmented Generation ACL Uncertainty-aware fallback for RAG.

Retrieval Optimization & General RAG Methods

Topic Full Title Resources Notes
Omni-RAG Towards Omni-RAG: Comprehensive Retrieval-Augmented Generation for Large Language Models in Medical Applications ACL Source planning across diverse medical knowledge sources.
Adaptive RAG Adaptive-RAG: Learning to Adapt RAG LLMs through Question Complexity ACL arXiv Code Chooses retrieval strategy based on question complexity.
RAG Relevance DR-RAG: Applying Dynamic Document Relevance to Retrieval-Augmented Generation arXiv Dynamic document relevance.
Rich Queries RichRAG: Crafting Rich Responses for Multi-faceted Queries in RAG ACL arXiv Better responses for multi-faceted queries.
Dynamic Rank DynRank: Improve Passage Retrieval with Dynamic Zero-Shot Prompting ACL arXiv Dynamic zero-shot prompting for retrieval.
Answer Scent ASRank: Zero-Shot Re-Ranking with Answer Scent for Document Retrieval arXiv Zero-shot re-ranking with answer scent.
Passage Expansion Knowledge Graph-Guided Retrieval Augmented Generation (KG²RAG) arXiv KG-guided chunk expansion.
Knowledge Selection FlexiQA: Leveraging LLM's Evaluation Capabilities for Flexible Knowledge Selection ACL Flexible knowledge selection before generation.
Embedding Efficiency 4-bit Quantization in Vector-Embedding for RAG arXiv Code Efficient vector embeddings for large retrieval indexes.
Low-Resource Retrieval Unsupervised Domain Adaptation of Dense Retrieval via Zero-Shot Sim Transfer arXiv Useful for low-resource biomedical or multilingual retrieval.
Context Generation Imagination Augmented Generation: Learning to Imagine Richer Context for Question Answering over Large Language Models arXiv OpenReview Generates richer intermediate context for QA.

🧠 Specialized Domains (Mental Health, Finance, Legal)

Caution

High-Stakes & Regulatory Compliance

This section covers applications in sensitive domains where error tolerance is low and privacy is paramount. Papers here explore Explainability in financial forecasting, Anonymity in legal court decisions, and Empathy in mental health support. The focus is on domain-specific adaptation and ethical guardrails.

Topic Full Title Resources Notes
Mental Health QA MentalQA: An Annotated Arabic Corpus for Questions and Answers of Mental Healthcare arXiv Code IEEE Arabic Mental Healthcare QA.
Mental Health Chinese MentalBERT: Domain-Adaptive Pre-training on Social Media for Chinese Mental Health arXiv ACL Code Chinese MentalBERT.
Mental Privacy Privacy Aware Question-Answering System for Online Mental Health Risk Assessment ACL Privacy-aware QA.
Financial QA FinReflectKG - MultiHop: Financial QA Benchmark for Reasoning with KG Evidence OpenReview Financial multi-hop reasoning.
Finance KG FinQA: A Training-Free Dynamic Knowledge Graph QA System in Finance Springer Code FinQA (Training-Free).
Legal LLM InLegalLLaMA: Indian Legal Knowledge Enhanced Large Language Model ACL Indian Legal Knowledge LLM.
Legal RAG Interpretable Long-Form Legal QA with Retrieval-Augmented LLMs AAAI arXiv Code Interpretability in Legal QA.
Legal GraphRAG Myanmar Law Cases and Proceedings Retrieval with GraphRAG IEEE GraphRAG for Law.
Legislative RAG LexDrafter: Terminology Drafting for Legislative Documents using RAG ACL arXiv Code Legislative drafting.
Legal Retriever UniLR: Unleashing the Power of LLMs on Multiple Legal Tasks with a Unified Legal Retriever ACL Code Unified Legal Retriever.
Re-Identification Anonymity at Risk? Assessing Re-Identification Capabilities of LLMs in Court Decisions ACL arXiv Re-ID in court decisions.
Crypto QA CryptOpiQA: A new Opinion and Question Answering dataset on Cryptocurrency ACL Dataset Crypto sentiment/QA.
Geopolitical Scaling LLM-Based Knowledge Graph Generation: A Case Study of Italian Geopolitical News IEEE Italian Geopolitical KG.
e-Governance An Open-Domain QA System for e-Governance arXiv ACL HuggingFace Open-domain QA.
Education Enhancing Textbook Question Answering with KG-Augmented LLMs PMLR KG-augmented Textbook QA.
Education Introducing CQuAE: A New French Contextualised QA Corpus for Education ACL CQuAE educational corpus.
Grading SteLLA: A Structured Grading System Using LLMs with RAG arXiv Code SteLLA grading system.
Linguistics ELQA: A Corpus of Metalinguistic Questions and Answers about English ACL arXiv Metalinguistic QA corpus.
Consumer Health Consumer Health Question Answering Using Off-the-Shelf Components Springer Code Off-the-shelf components.
Health Prompting Enhancing Consumer Health Question Reformulation: Chain-of-Thought Prompting Integrating Focus, Type, and User Knowledge Level ACL ResearchGate CoT for question reformulation.

🏆 Benchmarks & Datasets

Note

Evaluating the State-of-the-Art

This section is a comprehensive repository of the gold-standard datasets required to train and evaluate medical QA systems. It spans Multi-Choice Licensing Exams (USMLE, Chinese Medical Exam), Open-Ended Clinical QA, and specialized Shared Tasks (e.g., BioASQ). These resources are essential for benchmarking performance across different modalities, languages, and reasoning complexities.

Topic Full Title Resources Notes
Medical Dataset Huatuo-26M: A Large-Scale Chinese Medical Question Answering Dataset arXiv ACL Code 26M QA pairs dataset.
Multi-Subject QA MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain QA PMLR arXiv Code 194k Indian medical questions.
Open Domain QA MedQA: What Disease does this Patient Have? (USMLE-based) MDPI arXiv Code MedQA (USMLE-based).
Clinical Benchmark M-QALM: A Benchmark to Assess Clinical Reading Comprehension and Knowledge Recall arXiv ACL Clinical Reading Comp & Recall.
French Benchmark DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain ACL 20 tasks for French biomedical.
Multilingual Med Towards Building Multilingual Language Model for Medicine (MMedBench) arXiv Code MMedBench dataset.
Strategy QA StrategyQA: Did Aristotle Use a Laptop? A QA Benchmark with Implicit Reasoning Strategies arXiv Code Implicit reasoning benchmark.
Biomed Dataset PubMedQA: A Dataset for Biomedical Research Question Answering arXiv Code Dataset PubMedQA dataset.
Multilingual FAQ MFAQ: a Multilingual FAQ Dataset ACL Code HuggingFace 6M FAQ pairs.
Literary Fiction LFED: A Literary Fiction Evaluation Dataset for Large Language Models ACL arXiv Code Literary fiction eval.
Dynamic QA Let LLMs Take on the Latest Challenges! A Chinese Dynamic QA Benchmark ACL OpenReview Dynamic QA benchmark.
Arabic Dataset ArabicaQA: A Comprehensive Dataset for Arabic Question Answering arXiv Code Comprehensive Arabic QA.
Chinese Benchmark CMB: A Comprehensive Medical Benchmark in Chinese ACL Code Chinese medical benchmark.
French Medical FrenchMedMCQA: A French Multiple-Choice QA Dataset for Medical Domain ACL HuggingFace Code French Multi-Choice Medical QA.
Realistic QA RealMedQA: A Pilot Biomedical QA Dataset Containing Realistic Clinical Questions PMC Code Real clinical questions (NICE).
Pharmacist Exam ExplainCPE: A Free-text Explanation Benchmark of Chinese Pharmacist Examination ACL Code Pharmacist exam explanations.
Arabic Health AraHealthQA 2025: The First Shared Task on Arabic Health QA ACL arXiv Shared task (Mental/General).
Japanese Eval JMedBench: A Benchmark for Evaluating Japanese Biomedical LLMs ACL JMedBench.
EHR QA DrugEHRQA: A QA Dataset on Structured and Unstructured EHR ACL Code DrugEHRQA.
Radiology QA RadQA: A QA Dataset to Improve Comprehension of Radiology Reports ACL RadQA.
Clinical QA RJUA-QA: A Comprehensive QA Dataset for Clinical Reasoning in Urology arXiv Code Urology clinical reasoning.
Short-Answer ACTA: Short-Answer Grading in High-Stakes Medical Exams ACL Grading medical exams.
Arabic Wikipedia ArTrivia: Harvesting Arabic Wikipedia to Build A New Arabic QA Dataset ACL Arabic Wikipedia QA dataset.
Scientific QA SciQA: Extensive Analysis of the SciQA Benchmark with LLMs Conference Code SciQA benchmark analysis.

📷 Multimodal & Visual QA

Important

Beyond Text: The Convergence of Vision and Language

This section explores the frontier of Multimodal AI, where Large Language Models (LLMs) connect with visual data to "see" and interpret medical contexts. It covers Medical Visual Question Answering (Med-VQA), Radiology Report Generation, and Multimodal Knowledge Graphs. These resources are pivotal for systems that must reason over heterogeneous data sources, such as aligning clinical notes with pixel-level evidence from X-rays, CT scans, and pathology slides.

Topic Full Title Resources Notes
Multimodal QA CLIPSyntel: CLIP and LLM Synergy for Multimodal Question Summarization in Healthcare arXiv Code CLIP + LLM for summarization.
Multimodal KG VisualSem: A High-Quality Knowledge Graph for Vision and Language ACL Code VisualSem KG.
Visual QA Seeing Beyond: Enhancing Visual Question Answering with Multi-Modal Retrieval ACL Multi-modal retrieval for VQA.
EHR + CXR EHRXQA: A Multi-Modal QA Dataset for Electronic Health Records with Chest X-ray Images NeurIPS arXiv Code Multi-modal EHR QA.
VQA Integration Modality-Aware Integration with LLMs for Knowledge-Based Visual Question Answering ACL arXiv MAIL framework for VQA.
Multimodal Sentiment ConKI: Contrastive Knowledge Injection for Multimodal Sentiment Analysis ACL arXiv Contrastive knowledge injection.
Visual Reasoning Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in VLMs arXiv Code RL for VLMs in medicine.
Vietnamese VQA Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text arXiv Vietnamese VQA.
Drug Interaction MKG-FENN: A Multimodal KG Fused End-to-End Neural Network for DDI Prediction AAAI Drug-drug interaction.
Negative Sampling Modality-Aware Negative Sampling for Multi-modal Knowledge Graph Embedding IEEE MANS negative sampling.
Aspect-aware KG AspectMMKG: A Multi-modal Knowledge Graph with Aspect-aware Entities ACM arXiv Code AspectMMKG.
Fact Verification Multi-source Knowledge Enhanced Graph Attention Networks for Multimodal Fact Verification ResearchGate Multi-source graph attention.
Entity Tagging Multimodal Entity Tagging with Multimodal Knowledge Base OpenReview Multimodal Entity Tagging (MET).
Noise-powered Noise-powered Multi-modal Knowledge Graph Representation Framework ACL SNAG method.
Spatial Expl Spatially Grounded Explanations in Vision-Language Models for Document VQA arXiv Spatially grounded explanations.
Structure Guided SGMEA: Structure-Guided Multimodal Entity Alignment ACL SGMEA.
Spoken MRC VlogQA: Task, Dataset, and Baseline Models for Vietnamese Spoken-Based MRC ACL Code VlogQA.
Multimodal Doc T2KG: Transforming Multimodal Document to Knowledge Graph ACL T2KG.
Visual Rel Visual Relationship Detection With Visual-Linguistic Knowledge IEEE Visual relationship detection.
Zero-Shot Rel Zero-Shot Relational Learning for Multimodal Knowledge Graphs arXiv Zero-shot relational learning.
Multimodal Repr Enhancing Multimodal Knowledge Graph Representation Learning through Triple Contrastive Learning IJCAI Triple contrastive learning.

🔭 Future Horizons

This repository chronicles a pivotal shift in Medical AI from static Information Retrieval to dynamic Clinical Reasoning. As the field matures, three defining paradigms are emerging:

  • The Agentic Shift: Moving beyond passive chatbots to proactive Copilots. Systems like MedAgents and Dr. Copilot demonstrate that the future lies in LLMs that can plan, self-correct, and execute multi-step diagnostic workflows.
  • Multimodal Synergy: True clinical understanding requires seeing as well as reading. The next generation of models achieves Multimodal Fluency, seamlessly synthesizing pixel-level evidence (X-rays, Pathology) with textual knowledge (Guidelines, EHRs).
  • Democratization & Safety: As capabilities scale, so must responsibility. The focus is pivoting toward Privacy-Preserving RAG and Linguistic Equity, ensuring that life-saving AI is robust, compliant, and accessible across all languages from English to Amharic.

🌟 Contributing & Star Guide

Tip

Help this list grow

Contributions are welcome, especially for 2025-2026 medical RAG, GraphRAG, multilingual clinical QA, medical safety evaluation, and open-source implementations.

Contribution Type What to Add Preferred Evidence
Paper Title, venue/year, arXiv/ACL/PubMed/DOI link Peer-reviewed venue or stable preprint.
Code Official GitHub, HuggingFace, dataset, project page Maintained repository or reproducible artifact.
Benchmark Dataset, task, metrics, leaderboard Clear evaluation protocol and license.
Medical Safety Guardrails, contradiction checks, citation/grounding metrics Human/clinical evaluation when available.
Multilingual Non-English datasets, models, or RAG pipelines Language coverage and cultural/clinical relevance.

Note

If this repository helps your research, please consider giving it a ⭐ so more medical AI researchers can find it.


This repository is licensed under the Creative Commons Attribution 4.0 International License, granting you the freedom to share and adapt this work for any purpose even commercially as long as you provide appropriate credit to the original research paper authors.

CC BY 4.0

About

⭐ Awesome Medical QA/RAG: A curated collection of 250+ papers, datasets, and benchmarks for Healthcare AI, Medical RAG, Knowledge Graphs, Clinical LLMs, and Multilingual Reasoning.

Topics

Resources

Stars

8 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors