Cross-sectional analysis reveals varying accuracy of LLMs in adhering to clinical practice guidelines in CM, suggesting potential for enhanced knowledge dissemination.
Key Points
DeepSeek-v3 and DeepSeek-r1 achieved superior performance in answering clinical questions in both English and Chinese.
All large language models demonstrated higher accuracy in Chinese than in English, indicating language proficiency influence.
Significant differences in accuracy were noted across question categories, particularly in medication based on differential diagnosis.
Moonshot-v1 provided the highest safety disclaimer rates, showcasing better risk communication in clinical settings.