التنبؤ الصحي بالذكاء الاصطناعي

تبيع الشركات بشكل متزايد برمجيات تقرأ فحوصات دمك أو صورك الشعاعية أو بيانات ساعتك الذكية وتخبرك بالأمراض التي يُرجَّح أن تصيبك. بعض هذه الأدوات يؤدي فعلًا مهمة ضيقة بشكل جيد، لكن لا يكاد أيٌّ منها يُثبت أنه جعل أحدًا أكثر صحة.
التنبؤ الصحي بالذكاء الاصطناعي حقيقي في عدد قليل من المجالات الضيقة — قراءة تصوير الثدي الشعاعي، فحص اعتلال الشبكية السكري، كشف السلائل، وكشف انخفاض الكسر القذفي من تخطيط القلب — وهو غير مدعوم بالأدلة تقريبًا في كل مكان يُباع فيه للمستهلكين. السبب هو تمييز واحد تمحوه التسويقات باستمرار: قيمة AUROC مرتفعة على مجموعة بيانات مخزّنة تعني أن النموذج يرتّب المرضى بشكل صحيح على بيانات لم يؤثر فيها أبدًا. وهذا ليس دليلًا على أن استخدام النموذج يغيّر ما يحدث لأي شخص. نحو 1,500 جهاز مزوّد بالذكاء الاصطناعي يحمل تصريحًا تسويقيًا من FDA، وهناك نحو 41 تجربة عشوائية لتدخلات التعلم الآلي في الرعاية الصحية بأكملها.
- الدقة ليست فائدة: من بين 81 دراسة تقارن التعلم العميق بالأطباء، كانت 9 فقط استشرافية و6 فقط أُجريت في بيئة سريرية حقيقية (Nagendran 2020، PMID 32213531).
- ذكاء تنظير القولون الاصطناعي هو التطبيق الأكثر خضوعًا للتجارب العشوائية في الطب — 44 تجربة عشوائية، وارتفاع نسبي في كشف الأورام الغدية بنحو 20%، ودون أي زيادة في الأورام الغدية المتقدمة (Soleymanjahi 2024، PMID 39531400).
- لا توجد ساعة شيخوخة — وراثية إبستيمية أو شبكية أو دماغية أو قلبية أو بروتينية — تُعد هدفًا علاجيًا معتمدًا، أو نقطة نهاية بديلة معتمدة، أو أداة تشخيصية معتمدة من FDA؛ وهذا ما تقوله بوضوح الهيئة الإجماعية للمجال نفسه (Moqri 2023، PMID 37657418).
- التعلم الآلي غالبًا لا يتفوق على الانحدار اللوجستي على البيانات السريرية الجدولية: عبر 145 مقارنة مباشرة منخفضة خطر التحيز، كان الفرق في logit(AUC) 0.00 (فاصل ثقة 95%: من −0.18 إلى 0.18) (Christodoulou 2019، PMID 30763612).
- التحيز الخوارزمي مُقاس، لا افتراضي: تصحيح خوارزمية واحدة منتشرة في إدارة الرعاية كان سيرفع نسبة المرضى السود الذين يحصلون على مساعدة إضافية من 17.7% إلى 46.5% (Obermeyer 2019، PMID 31649194).
المستويات الأربعة للأدلة، ولماذا لا يصل شيء تقريبًا إلى المستوى 4
AUROC — المساحة تحت منحنى الخصائص التشغيلية للمستقبِل — هي احتمال أن يُرتّب النموذج حالة عشوائية فوق ضابطة عشوائية. إنه الرقم الموجود في كل عنوان تقريبًا لأخبار الذكاء الاصطناعي الصحي، وهو يجيب عن سؤال ضيق: هل يفرز النموذج الأشخاص بشكل صحيح على بيانات سبق أن عُرضت عليه؟ لا يقول شيئًا عن كون الرقم المعروض لك صحيحًا، أو عمّا إذا كان أحد يتصرف بناءً عليه، أو عمّا إذا كان التصرف بناءً عليه يفيد أكثر مما يضر.
توجد أربعة مستويات متمايزة من الأدلة خلف عبارة مُتحقَّق منه سريريًا، والتسويق عادة ما يقدّم المستوى الأول وكأنه المستوى الرابع.
ما الذي يمكن أن يستند إليه فعليًا ادعاء الذكاء الاصطناعي الصحي
| المستوى | ماذا يعني | مدى شيوعه في الذكاء الاصطناعي الصحي |
|---|---|---|
| 1. AUROC استرجاعي | النموذج يسجّل نتيجة جيدة على مجموعة بيانات مخزّنة لم يؤثر فيها أبدًا. لا يقول شيئًا عمّا إذا كان استخدامه يغيّر أي شيء. | تقريبًا كل أبحاث الذكاء الاصطناعي الصحي المنشورة، وفعليًا كل ذكاء طول العمر الاستهلاكي |
| 2. الدقة الاستشرافية | يعمل النموذج مباشرة على مرضى حقيقيين متتاليين؛ تُقاس الدقة مقابل معيار مرجعي جُمع بشكل مستقل. ما زال بلا نتيجة صحية. | غير شائع |
| 3. نتيجة عملية عشوائية | تُظهر تجربة عشوائية أن الذكاء الاصطناعي يغيّر ما يفعله الأطباء أو يجدونه — معدل الكشف، معدل التشخيص، عبء العمل. | نادر: بضع عشرات من التجارب إجمالًا، معظمها في التنظير |
| 4. نتيجة على المريض عشوائية | تُظهر تجربة عشوائية أن الذكاء الاصطناعي يغيّر ما إذا كان الناس يعيشون أطول، أو تقل لديهم السكتات، أو تقل إصابتهم بالسرطان. | غير موجود عمليًا في هذا المجال |
أين ينجح الذكاء الاصطناعي فعليًا — وأين يتوقف الكشف عند حدود الفائدة
التصوير هو المجال الأقوى، ويستحق التدقيق في السبب. فرز تصوير الثدي الشعاعي يملك مقارنًا عالي الجودة قائمًا مسبقًا (قراءة كل صورة من قِبل طبيبَي أشعة)، ونقطة نهاية نهائية صعبة (السرطان الفاصل)، وبرامج وطنية مستعدة لإجراء تجارب عشوائية. هذا المزيج نادر، وهو ما أنتج أفضل أدلة الذكاء الاصطناعي في الطب.
أجرت تجربة MASAI عشوائية على 105,934 امرأة سويدية، بين القراءة المدعومة بالذكاء الاصطناعي والقراءة المزدوجة القياسية. ارتفع كشف السرطان من 5.0 إلى 6.4 لكل 1,000، بنسبة 1.29 (فاصل ثقة 95%: 1.09–1.51)، مع انخفاض عبء قراءة الفحوصات بنسبة 44%. وعندما أُبلغت نقطة النهاية الأساسية أخيرًا، كان السرطان الفاصل 1.55 مقابل 1.76 لكل 1,000 — نسبة تناسب 0.88 (0.65–1.18). هذا عدم دونية، لا تفوّق. لم يُظهر أحد أن تصوير الثدي المدعوم بالذكاء الاصطناعي يقلل من وفيات سرطان الثدي، ونظرًا لحجم التجارب المطلوب، من غير المرجح أن يُظهره أحد.
دون مستوى التصوير، يظهر نمط ثابت: يجد الذكاء الاصطناعي بشكل موثوق المزيد من شيء ما، وقد فشل إيجاد المزيد منه مرارًا في تقديم فائدة. يضاعف فحص الساعة الذكية واللاصقة كشف الرجفان الأذيني مرتين إلى ثلاث مرات. ثلاث تجارب عشوائية بنقاط نهاية صلبة — LOOP وSTROKESTOP وGUARD-AF — لم تُظهر انخفاضًا في السكتات. وقد ذكر معدّو LOOP ذلك في ملخصهم نفسه: ليس كل رجفان أذيني يستحق الفحص عنه، وليس كل رجفان أذيني مكتشف بالفحص يستحق مضادات التخثر.
سجل الأدلة
الترتيب حسب: أعلى مستوى من الأدلة الموجود فعليًا لكل نهج. كُتبت هذه المستويات أصلًا للأدوية، فاقرأها هكذا بالنسبة للبرمجيات: معتمَد تعني وجود تصريح تسويقي حقيقي من FDA (510(k) أو De Novo أو PMA) للناتج المحدد المُباع؛ ما قبل سريري تعني أن العمل حقيقي لكنه لا يتجاوز نماذج مُدرَّبة على مجموعات بيانات بشرية مخزّنة، دون أي دليل على استخدام سريري؛ مُسوَّق دون إثبات تعني أن المنتج يُباع للجمهور دون مراجعة تنظيمية للادعاء ودون دليل مضبوط على الفائدة. لاحظ أن الاعتماد والفائدة محوران مختلفان: عدة أدوات في فئة معتمَد هنا لديها أدلة عشوائية على أنها تغيّر الكشف ولا يوجد أي دليل على أنها تغيّر النتائج.
ذكاء تصوير الثدي الاصطناعي (Transpara، Lunit INSIGHT MMG)
معتمديقرأ صور الفرز الشعاعي للثدي كأداة فرز وقارئ ثانٍ إلى جانب أطباء الأشعة.
الذكاء الاصطناعي الأفضل إثباتًا في الطب. نسبة كشف 1.29 وانخفاض 44% في عبء القراءة في MASAI؛ السرطان الفاصل غير دون، لا مُخفَّض. بتجميع MASAI وScreenTrustCAD وPRAIM (597,419 فحصًا)، الفائدة +0.9 حالة سرطان لكل 1,000 فحص، مع لمس فاصل الثقة للصفر. حقيقي ومفيد. لكنه ليس اكتشاف السرطان قبل سنوات.
معتمَد من FDA عبر 510(k) (K181704 ← K241831؛ K211678). أدلة عشوائية (MASAI) واستشرافية بقراء مزدوجين (ScreenTrustCAD).NCT04838756؛ PMID 41620232الفحص الذاتي لاعتلال الشبكية السكري (IDx-DR / LumineticsCore)
معتمديصنّف صور قاع العين لاعتلال شبكية سكري أكثر من خفيف دون قراءة من طبيب.
حساسية 87.2% (81.8–91.2)، ونوعية 90.7% (88.3–92.7) لدى 900 مريض، في عيادات الرعاية الأولية لا عيادات العيون، مقابل تصنيف مستقل من مركز قراءة. المثال الأنظف في هذا الملف على الذكاء الاصطناعي المُنجَز بشكل صحيح. المنافسون المعتمَدون على نفس رمز المنتج: EyeArt (K200667) وAEYE-DS (K221183).
معتمَد من FDA عبر De Novo DEN180001، بتاريخ 11 أبريل 2018 — أول تشخيص ذاتي بالذكاء الاصطناعي معتمَد في أي مجال. تجربة محورية استشرافية في الرعاية الأولية.NCT02963441؛ PMID 31304320الكشف الحاسوبي المساعد عن السلائل أثناء تنظير القولون (CADe)
معتمديشير إلى السلائل في مجال الرؤية الحي لطبيب التنظير.
نسبة معدل كشف الأورام الغدية 1.21 (1.15–1.28) — قوية ومتسقة. لكن الأورام الغدية المتقدمة لكل تنظير لم تُظهر أي فرق (فرق معدل الحدوث 0.01، من −0.01 إلى 0.02)، وكانت الزيادة مدفوعة إلى حد كبير بالآفات الصغيرة جدًا، وكانت هناك زيادة قدرها نحو حالتي استئصال سليلة غير ورمية إضافيتين لكل عشر عمليات. التطبيق الأكثر خضوعًا للتجارب العشوائية في الطب، ومع ذلك لم يتحول المستوى 3 إلى مستوى 4.
معتمَد من FDA وحاصل على علامة CE. 44 تجربة عشوائية، 36,201 مريضًا.PMID 39531400؛ PMID 37639719تخطيط القلب بالذكاء الاصطناعي لكشف انخفاض الكسر القذفي (Anumana، Eko، Tempus)
معتمديشير إلى احتمال كسر قذفي للبطين الأيسر عند أو دون 50% من تخطيط قلب قياسي ذي 12 قطبًا.
دقيق فعلًا — AUC بلغ 0.93 لكسر قذفي ≤35% في عمل التطوير — وعشوائي فعلًا. لاحظ ما يتنبأ به: كسرك القذفي الآن، لا خطرك المستقبلي. ولاحظ الأثر المطلق في EAGLE: ارتفعت التشخيصات الجديدة لانخفاض الكسر القذفي من 1.6% إلى 2.1%.
معتمَد من FDA عبر 510(k) كبرمجية إشعار (K232699، K233409، K250119، K250652). تجربة عشوائية عنقودية (EAGLE، 22,641 مريضًا).NCT04000087؛ PMID 30617318تسجيل خطورة عقيدة الرئة (Optellum Virtual Nodule Clinic)
معتمديسجّل خطر الخباثة لعقيدة رئوية سبق أن اكتشفها إنسان على أشعة مقطعية.
أداة لتصنيف الخطر دون أي تجربة تُظهر أنها تغيّر مرحلة التشخيص أو الوفيات. يستحق معرفة كيف يتصرف البحث الكامن: في نموذج Google NLST البارز، فاق الأداء جميع أطباء الأشعة الستة عندما لم يتوفر فحص مقطعي سابق، وكان مساويًا لهم فقط عند وجود فحص سابق — وهي الحالة الواقعية سريريًا.
معتمَد من FDA عبر 510(k) (K202300، عام 2021). تحقق استرجاعي فقط؛ لا تجربة عشوائية.K202300؛ PMID 31110349إشعار عدم انتظام النبض في الساعة الذكية
معتمديكشف نمط نبض يوحي برجفان أذيني ويرسل إشعارًا.
الكشف يعمل؛ الفائدة لا تتبعه. فقط 34% (Apple) و32.2% (Fitbit) من التنبيهات تأكدت كرجفان أذيني بلاصقة متابعة. أخذ تخطيط قلب بالساعة لمدة 10 ثوانٍ بعد التنبيه له عائد تشخيصي 7.6%، مقابل 60.8% للاصقة أربعة أسابيع. وعبر LOOP وSTROKESTOP وGUARD-AF، لم يُظهر إيجاد المزيد من الرجفان الأذيني أنه يمنع السكتات. لا تزال USPSTF تصنف أدلة فحص الرجفان الأذيني لدى البالغين من 50 عامًا فما فوق بأنها غير كافية — تصنيف من الدرجة I.
معتمَد من FDA عبر De Novo DEN180042 (Apple). دراسات عملية شملت 419,297 (Apple Heart) و455,699 (Fitbit Heart) مشاركًا.NCT03335800؛ NCT04380415؛ PMID 35076659إشعارات ارتفاع ضغط الدم وانقطاع النفس النومي الاستهلاكية
معتمدتشير إلى أنماط متعددة الأسابيع من الجهاز القابل للارتداء توحي بارتفاع ضغط الدم أو انقطاع نفس نومي متوسط إلى شديد.
ملخصات الاعتماد أكثر صدقًا من التسويق. بالنسبة لارتفاع ضغط الدم، يفيد ملخص FDA بحساسية 41.2% (37.2–45.3) ونوعية 92.3% لدى 1,863 مشاركًا تم تحليلهم — يفوته نحو 59% من حالات ارتفاع ضغط الدم و46% من ارتفاع الضغط من الدرجة 2، ومؤشره نفسه يمنع استخدامه للمراقبة أو لتتبع أثر العلاج. أما انقطاع النفس النومي فحساسيته 66.3%. كلاهما مشروع كتنبيه نحو اختبار حقيقي. ولا أحدهما قياس.
معتمَدة من FDA عبر 510(k) (ارتفاع ضغط الدم من Apple، K250507، سبتمبر 2025؛ انقطاع النفس النومي من Apple، K240929، بجهاز مرجعي من Samsung DEN230041). تحقق من الراعي فقط.K250507؛ K240929التنبؤ بالإنتان داخل السجل الصحي الإلكتروني (Epic Sepsis Model)
يُباع · غير مثبتيسجّل باستمرار المرضى المقيمين لاحتمال بدء إنتان.
AUC بلغ 0.63 عبر 38,455 حالة استشفاء، مع فوات 67% من مرضى الإنتان وإنذار على 18% من كل حالات الدخول. حدد فقط 7% من المرضى المصابين بالإنتان زيادةً عمّا كانت الممارسة السريرية المعتادة تلتقطه أصلًا. يصف المؤلفون التبني الواسع رغم هذا الأداء بأنه مصدر قلق جوهري. الفجوة التنظيمية التي سمحت بنشره دون فحص هي بيت القصيد.
غير منظَّم من قِبل FDA — أُطلق كوظيفة في السجل الصحي الإلكتروني لمئات المستشفيات الأمريكية. يوجد تحقق خارجي، وقد فشل.PMID 34152373اختبارات العمر البيولوجي الوراثي الإبستيمي الاستهلاكية
يُباع · غير مثبتتُعيد رقم عمر بيولوجي واحد من مثيلة الحمض النووي في الدم أو اللعاب أو مسحة خد.
الساعات الكامنة حقيقية، وارتباطاتها بالوفيات مُكررة. المنتج الاستهلاكي هو ادعاء دقة لا يستطيع الفحص دعمه: تنتج الضوضاء التقنية انحرافات تصل إلى 9 سنوات بين تكرارات لنفس العينة لست ساعات بارزة، وفروق الأنسجة بين الفم والدم تصل إلى نحو 30 عامًا لدى نفس الشخص في بعض الساعات. معظم اختبارات المستهلك المباشرة تستخدم اللعاب أو مسحات الخد.
اختبارات مطورة مخبريًا بموجب CLIA فقط. أُلغيت قاعدة FDA للاختبارات المطورة مخبريًا بتاريخ 31 مارس 2025 وأُلغيت رسميًا بتاريخ 19 سبتمبر 2025، فلا يراجع أي منظِّم صحة ادعاء العمر السريري.PMID 36277076؛ PMID 39780748فجوات عمر الشبكية والدماغ وتخطيط القلب والبروتيوم
ما قبل السريري فقطتُقدّر عمر عضو أو الجسم كله من صورة شبكية أو رنين مغناطيسي أو تخطيط قلب أو بروتيوم بلازما، ثم تُبلغ عن الفجوة مقارنة بعيد ميلادك.
حقيقية إحصائيًا على مستوى السكان، وأضعف بكثير مما تبدو عليه فرديًا. فجوة عمر الشبكية: نسبة مخاطرة للوفيات لكل الأسباب 1.02 لكل سنة، مع لمس فاصل الثقة للحد 1.00، ودون ارتباط معنوي بوفيات القلب والأوعية الدموية أو السرطان. عمر الدماغ: نسبة مخاطرة للوفيات 1.061 لكل سنة — لكنها لم تعد معنوية (p=0.12) عند إدخالها إلى جانب أحجام المادة الرمادية والسائل الدماغي الشوكي البسيطة، أي أن خطوة التعلم العميق لم تضِف شيئًا فوق قياس الحجم.
أدوات بحثية. لا اعتماد من FDA لأي من هذه المخرجات؛ عمليات البحث عن اسم الجهاز في قاعدة بيانات 510(k) الخاصة بـFDA لا تُعيد أي جهاز معتمَد يُخرج عمرًا بيولوجيًا أو فيزيولوجيًا.PMID 35042683؛ PMID 28439103درجات العافية: الجاهزية، الاستشفاء، الإجهاد، درجة النوم، تقلب معدل ضربات القلب، عمر الجهاز القابل للارتداء
يُباع · غير مثبتدرجات مركّبة يومية مشتقة أساسًا من معدل ضربات القلب وتقلبه ومراحل النوم المقدَّرة.
تحدد الأجهزة القابلة للارتداء الاستهلاكية مرحلة النوم الصحيحة بنسبة 50–65% من الوقت (كابا كوهين 0.20–0.52)، وتميل لتسمية كل شيء نومًا: نوعية كشف اليقظة تتراوح بين 0.18–0.54. على ذلك يُبنى كل دقيقة نوم عميق مُحسوبة وكل درجة استشفاء مشتقة من حركة العين السريعة. خطاب تحذير FDA لـWhoop أثبت أيضًا رسميًا أن إخلاء مسؤولية غير مخصص للاستخدام الطبي لا يُنقذ منتجًا مصممًا لإنتاج تقدير سريري.
عافية عامة غير منظَّمة. لم يُعثر على أي اعتماد من FDA لـOura أو Garmin أو Ultrahuman في قاعدة بيانات FDA؛ الاعتماد الوحيد لـWhoop هو ميزة تخطيط قلب واحدة (K243236).PMID 36016077؛ PMID 33378539روبوتات الدردشة الصحية القائمة على نماذج لغوية عامة
يُباع · غير مثبتتجيب عن أسئلة صحية، وتفرز الأعراض، وتقترح ما يجب فعله لاحقًا بلغة طبيعية.
النماذج ليست الحلقة الضعيفة — التسليم هو الحلقة الضعيفة. في دراسة عشوائية مُسجَّلة مسبقًا، حددت النماذج وحدها الحالة في 94.9% من الحالات؛ بينما حدد 1,298 فردًا من الجمهور يستخدمون النماذج نفسها الحالات في أقل من 34.5% — ليس أفضل من الضابطة. وعلى 2,400 حالة مريض حقيقية بدل الحالات الافتراضية، أدت النماذج المتطورة أداءً أسوأ بشكل معنوي من الأطباء وكانت حساسة لترتيب المعلومات المقدَّمة.
لا يوجد روبوت دردشة قائم على نموذج لغوي عام معتمَد أو مصرَّح به من FDA كجهاز طبي، وقائمة FDA للأجهزة لا تحدد بعد أي الأجهزة المعتمَدة تحتوي على وظيفة نموذج لغوي.PMID 41663592؛ PMID 38965432لوحات القياسات المتعددة (multi-omics) وخدمات فحص الرنين المغناطيسي الكامل للجسم
يُباع · غير مثبتتجمع مئات المؤشرات الحيوية والجينوميات وفحصًا شاملًا للجسم في توقّع صحي شخصي.
بتجميع 12 دراسة و5,373 شخصًا بلا أعراض، أنتج الرنين المغناطيسي الشامل للجسم نتائج عرضية حرجة أو غير محددة لدى 32.1%، تم التحقق من 12.6% منها فقط. قاعدة بيانات إحدى الشركات الخاصة، بـ21,651 فحصًا بلا أعراض، وجدت أكياسًا بنكرياسية عرضية لدى 7.0% من كل من فُحص، نحو 99% منها دون الحجم الذي يستدعي تدخلًا — ومع ذلك تدخل كلها في المراقبة. تنص الكلية الأمريكية للأشعة على أنه لا توجد أدلة كافية للتوصية بفحص كامل الجسم لدى من لا أعراض أو عوامل خطر أو تاريخ عائلي لديهم.
اختبارات مطورة مخبريًا بموجب CLIA فقط، إضافة إلى سلطة تقديرية تنظيمية للعافية العامة. مكونات الماسح وتحسين الصور قد تكون معتمَدة؛ خدمة الفرز نفسها ليست كذلك.PMID 30932247؛ PMID 41801199
الجهاز الطبي المعتمَد مقابل تطبيق العافية الاستهلاكي: ليسا الشيء نفسه
أهم مهارة واحدة في هذا المجال هي التمييز بين أربعة كيانات تنظيمية تبدو متطابقة في النصوص التسويقية: جهاز طبي مصرَّح به من FDA، واختبار مطوَّر مخبريًا يعمل بموجب CLIA، ومنتج عافية عام يعمل بموجب سلطة تقديرية تنظيمية، وبرمجية بلا أي علاقة تنظيمية على الإطلاق.
حتى داخل الفئة المعتمَدة، سقف الأدلة منخفض. من أصل نحو 1,524 تصريحًا، ذهب 96.2% عبر 510(k)، الذي يسأل عمّا إذا كان الجهاز مكافئًا جوهريًا لجهاز مرجعي موجود مسبقًا في السوق — لا عمّا إذا كان يُحسّن النتائج. في دفعة 2024، أبلغ 29.2% فقط عن الحساسية والنوعية معًا، وأبلغ 15.5% فقط عن بيانات عرق أو إثنية، وأُطلق 16.7% فقط بخطة تحكم بالتغيير مُحدَّدة مسبقًا، ما يعني أن معظم النماذج المعتمَدة مجمّدة عند لحظة الاعتماد ولا يمكن تحديثها مع تغيّر السكان.
ما هو معتمَد، وما هو مُثبَت، وماذا تتنبأ كل أداة فعليًا
| الأداة أو الادعاء | الحالة التنظيمية | أدلة استشرافية؟ | ما تتنبأ به فعليًا |
|---|---|---|---|
| ذكاء تصوير الثدي الاصطناعي (Transpara، Lunit) | معتمَد من FDA عبر 510(k)؛ حاصل على علامة CE | نعم — عشوائي (MASAI، NCT04838756، ن=105,934) واستشرافي بقراء مزدوجين (ScreenTrustCAD، NCT04778670، ن=55,581) | وجود سرطان ثدي قابل للكشف بالفرز في هذا التصوير الشعاعي |
| IDx-DR / LumineticsCore | De Novo DEN180001 من FDA (أبريل 2018) | نعم — تجربة محورية استشرافية في الرعاية الأولية، NCT02963441، ن=900 | اعتلال شبكية سكري أو وذمة بقعية أكثر من خفيفة من صور قاع العين |
| الكشف الحاسوبي المساعد عن السلائل (CADe) | معتمَد من FDA؛ حاصل على علامة CE | نعم — 44 تجربة عشوائية، 36,201 مريضًا | وجود سليلة في مجال الرؤية الحالي. لا زيادة في الأورام الغدية المتقدمة |
| تخطيط القلب بالذكاء الاصطناعي لانخفاض الكسر القذفي | معتمَد من FDA عبر 510(k) (K232699، K250652) | نعم — تجربة عشوائية عنقودية (EAGLE، NCT04000087، ن=22,641) | الكسر القذفي الحالي للبطين الأيسر ≤50% — لا الخطر المستقبلي |
| Optellum Virtual Nodule Clinic | معتمَد من FDA عبر 510(k) (K202300) | لا — تحقق استرجاعي فقط | خطر الخباثة لعقيدة رئوية سبق اكتشافها |
| إشعار عدم انتظام النبض في الساعة الذكية | De Novo DEN180042 من FDA | نعم — دراسات عملية، ن=419,297 ون=455,699 | رجفان أذيني محتمل الآن. 34% / 32% من التنبيهات تؤكد الرجفان |
| فحص الرجفان الأذيني كوقاية من السكتة | ليس ادعاء جهاز | نعم — ثلاث تجارب عشوائية بنقاط نهاية صلبة (LOOP، STROKESTOP، GUARD-AF) | لا انخفاض مُثبَت في السكتات. LOOP HR 0.80 (0.61–1.05)؛ GUARD-AF HR 1.10 (0.69–1.75) |
| إشعار ارتفاع ضغط الدم من Apple | 510(k) من FDA K250507 (سبتمبر 2025) | تحقق من الراعي فقط، ن=1,863 | أنماط توحي بارتفاع ضغط الدم. حساسية 41.2% |
| Epic Sepsis Model | غير منظَّم من FDA — يُنشر كوظيفة في السجل الصحي الإلكتروني | تحقق خارجي فقط — وقد فشل | اسميًا بدء الإنتان؛ فعليًا أدى بـAUC 0.63، مع فوات 67% من الحالات |
| الساعات الوراثية الإبستيمية (Horvath، PhenoAge، GrimAge، DunedinPACE) | لا اعتماد من FDA لأي ادعاء سريري؛ تُباع كاختبارات مطورة مخبريًا أو عافية | لا — دراسات ارتباط فقط | العمر الزمني، أو خطر الوفيات، بحسب هدف التدريب. ليس هدفًا قابلًا للتعديل |
| فجوات عمر الشبكية والدماغ والبروتيوم | أدوات بحثية؛ بلا اعتماد | لا — ارتباطات جماعية، غالبًا ضمن مجموعات بيانات فردية | خطر الوفيات والمراضة على مستوى السكان |
| اختبارات العمر البيولوجي الاستهلاكية | اختبارات مطورة مخبريًا بموجب CLIA فقط؛ أُلغيت قاعدة FDA للاختبارات المطورة مخبريًا في 31 مارس 2025، فلا مراجعة من FDA لادعاء العمر | لا شيء | لا شيء مُتحقَّق منه. نفس العينة يمكن أن تختلف بسنوات عند تكرار الفحص |
| تقلب معدل ضربات القلب، الجاهزية، الاستشفاء، الإجهاد، درجات النوم، عمر الجهاز القابل للارتداء | عافية عامة غير منظَّمة | لا شيء | لا شيء مُتحقَّق منه. مرحلة النوم صحيحة 50–65% من الوقت |
| أجهزة مراقبة الغلوكوز المستمرة بلا وصفة لدى غير المصابين بالسكري | معتمَدة لقياس الغلوكوز فقط (Stelo K234070، Lingo K233655، Libre Rio K233861) | لا تجربة عشوائية على النتائج لدى غير المصابين بالسكري | غلوكوز الخلالي، بقراءة أعلى بنحو 0.9 مليمول/لتر من العينة الشعرية |
| روبوتات الدردشة القائمة على نماذج لغوية عامة | لا جهاز معتمَد من FDA محدَّد كمدعوم بنموذج لغوي | معايير قياسية زائد ثلاث تجارب عشوائية — لم يتفوق فيها الذراع البشري مع النموذج على النموذج وحده | إجابات معيارية، لا نتائج سريرية |
| التوأم الرقمي (Unlearn.AI / PROCOVA) | رأي تأهيل من EMA — لكفاءة التجارب السريرية؛ توصفه EMA بحالة خاصة من ANCOVA | لا ينطبق — إنه أسلوب إحصائي | تقليص حجم عينة التجربة. ليس علاجًا شخصيًا |
| خدمات فحص الرنين المغناطيسي الكامل للجسم | مكونات الماسح وتحسين الصور معتمَدة؛ خدمة الفرز نفسها ليست كذلك | رصدية أحادية الذراع فقط (NCT06212479، تكتمل 2037) | نتائج عرضية. معدل تجميعي للأورام العرضية 32.1%؛ الكلية الأمريكية للأشعة تقول إن الأدلة غير كافية |
المفردات التنظيمية، مُفسَّرة
| العبارة | ما الذي ترتبط به فعليًا |
|---|---|
| ذكاء اصطناعي معتمَد من FDA (خدمات الرنين المغناطيسي الكامل للجسم) | خوارزمية تحسين صورة، لا خدمة الفرز المُباعة نفسها |
| معتمَد من FDA (Whoop) | ميزة تخطيط قلب واحدة فقط، K243236. الاستشفاء والإجهاد وWhoop Age وHealthspan غير منظَّمة |
| توأم رقمي مؤهَّل من EMA | حالة خاصة من ANCOVA لتقليل حجم عينة التجربة السريرية. رفضته FDA باعتباره مشمولًا أصلًا في إرشادات تعديل المتغيرات المصاحبة القائمة |
| معتمَد بموجب CLIA (كل اختبار عمر بيولوجي وقياسات متعددة) | المختبر يثبت أداءه التحليلي للتحليل بشكل قابل للتكرار. لا يقول شيئًا عن الصحة السريرية للادعاء — ومنذ 31 مارس 2025 لا يوجد منظِّم أمريكي يراجع ذلك الادعاء |
| مسجَّل / مُدرَج لدى FDA | تسجيل منشأة فقط. لا معنى له بخصوص الادعاء المطروح |
| مُتحقَّق منه سريريًا | عادة دراسة ارتباط استرجاعية، غالبًا من تأليف الشركة التي تبيع المنتج |
| ذكاؤنا الاصطناعي يحلل أكثر من 100 مؤشر حيوي | التحليل ليس تنبؤًا، والتنبؤ ليس تحقُّقًا |
| غير مخصص لتشخيص أو علاج أو شفاء أو الوقاية من أي مرض — إلى جانب تسويق يقوم على كشف الأمراض | موقف قانوني. قضت FDA رسميًا في يوليو 2025 بأن مثل هذه الإخلاءات لا تُنقذ منتجًا مصممًا لإنتاج تقدير سريري |
ما الذي تغيّر في 2025–2026
- يناير 2025
نُشرت PRAIM — أكبر تطبيق واقعي لفرز الذكاء الاصطناعي
463,094 امرأة عبر 12 موقع فرز ألمانيًا. كشف السرطان 6.7 مقابل 5.7 لكل 1,000، +17.6% (فاصل ثقة 95%: +5.7% إلى +30.8%)، مع استدعاء أقل وعدم دونية. رصدية، لكن الاتجاه يتفق مع MASAI.
Eisemann 2025، Nat Med، PMID 39775040
- 31 مارس 2025
إلغاء قاعدة FDA للاختبارات المطورة مخبريًا
قضت محكمة اتحادية جزئية في قضية ACLA ضد FDA بأن الاختبارات المطورة مخبريًا خدمات مهنية، لا أجهزة. هذه أهم حقيقة بالنسبة لاختبارات طول العمر الاستهلاكية: تعود اختبارات العمر البيولوجي ولوحات القياسات المتعددة إلى CLIA فقط، دون مراجعة من FDA للصحة السريرية، إلى أجل غير مسمى.
قاعدة FDA النهائية المنفِّذة للإلغاء، 90 FR 45134، 19 سبتمبر 2025
- أبريل 2025
Whoop تحصل على أول اعتماد من FDA على الإطلاق — لميزة تخطيط قلب
K243236 يغطي كشف الرجفان الأذيني والإيقاع الجيبي الطبيعي وارتفاع أو انخفاض معدل ضربات القلب، للاستخدام المعلوماتي فقط. الاستشفاء والإجهاد ومدرب النوم وWhoop Age وHealthspan غير معتمَدة لأي شيء.
510(k) من FDA، K243236
- 14 يوليو 2025
خطاب تحذير من FDA لـWhoop بخصوص Blood Pressure Insights
ذكرت FDA أنها لم تُصرّح بالميزة لأي استخدام، ورفضت إعفاء العافية العامة، ورفضت إخلاءات المسؤولية صراحةً — مشيرة إلى أن عدم فعاليتها يظهر من استخدام الناس للميزة لمراقبة ضغط دمهم. خطاب الإغلاق بتاريخ 17 يونيو 2026 هو سلطة تقديرية إنفاذية على منتج أُعيد تسميته، لا اعتماد.
خطاب تحذير من FDA، MARCS-CMS 709755
- أغسطس 2025
أول إشارة مُقاسة على تراجع المهارة
عبر أربعة مراكز تنظير بولندية و1,443 عملية تنظير قولون، انخفض معدل كشف الأورام الغدية غير المدعوم لدى أطباء التنظير من 28.4% إلى 22.4% بعد التعرض للذكاء الاصطناعي (−6.0 نقطة مئوية، فاصل ثقة 95%: من −10.5 إلى −1.6، p=0.0089). رصدية وتحتاج إلى تكرار، لكنها خطر منهجي لا يلتقطه أي مقياس دقة.
Budzyń 2025، Lancet Gastroenterol Hepatol، PMID 40816301
- سبتمبر 2025
اعتماد إشعار ارتفاع ضغط الدم من Apple بحساسية 41.2%
أكبر توسع في ذكاء القلب والأوعية الاصطناعي الاستهلاكي حتى الآن، والأداء الأكثر تواضعًا الذي اعتُمد حتى الآن. مؤشره نفسه يمنع استخدامه لاستبدال التشخيص، أو مراقبة أثر العلاج، أو إجراء مراقبة لضغط الدم.
510(k) من FDA، K250507
- يناير 2026
تُبلغ MASAI عن نقطة نهايتها الأساسية
السرطان الفاصل 1.55 مقابل 1.76 لكل 1,000؛ نسبة تناسب 0.88 (0.65–1.18)، p=0.41 — عدم دونية، لا تفوّق. الحساسية 80.5% مقابل 73.8% (p=0.031)، والنوعية 98.5% في الذراعين. النتيجة النهائية لفرز الذكاء الاصطناعي، وهي تستبعد المخاوف الرئيسية بدل أن تثبت فائدة على الوفيات.
Gommers 2026، Lancet، PMID 41620232
- فبراير 2026
النتيجة الحاسمة للذكاء الاصطناعي الاستهلاكي
1,298 مشاركًا بريطانيًا من عامة الناس عُشِّوا لاستخدام نماذج لغوية متطورة أو مصدر من اختيارهم. حددت النماذج وحدها الحالة في 94.9% من الحالات؛ نفس النماذج بين يدي الجمهور، أقل من 34.5% — ليس أفضل من الضابطة. يذكر المؤلفون أن المعايير القياسية لا تتنبأ بالإخفاقات التي وُجدت مع المشاركين البشريين.
Bean 2026، Nat Med، PMID 41663592
- مارس 2026
سلسلة الفحص، مُقاسة من بيانات شركة خاصة
من بين 21,651 شخصًا بلا أعراض فُحصوا بالرنين المغناطيسي الكامل للجسم، كان لدى 7.0% آفة كيسية بنكرياسية عرضية، ترتفع إلى 20.8% في سن 80 فما فوق. كانت 96.0% دون 2 سم، و1.1% فقط 3 سم أو أكبر — عضو واحد، نوع نتيجة واحد، ونحو 99% دون عتبة التدخل.
Wong 2026، JAMA Netw Open، PMID 41801199
- أغسطس 2026
حجم الأثر الصادق لتصوير الثدي بالذكاء الاصطناعي
تجميع MASAI وScreenTrustCAD وPRAIM عبر 597,419 فحصًا يعطي فرق خطر لكشف السرطان قدره +0.9 لكل 1,000 (فاصل ثقة 95%: من −0.0 إلى +1.8) ودون زيادة متسقة في الاستدعاء.
Ferre 2026، Clin Imaging، PMID 42617468
ساعات الشيخوخة: ارتباطات حقيقية، ولا هدف واحد مُتحقَّق منه
ساعات الشيخوخة — الوراثية الإبستيمية والشبكية والدماغية والقلبية والبروتينية — هي منتج التنبؤ بالذكاء الاصطناعي الذي تبيعه صناعة طول العمر بأكبر قوة. إنها ارتباطات إحصائية حقيقية ومُكررة مع الوفيات. ولا واحدة منها نقطة نهاية بديلة مُتحقَّق منها، أو هدف علاجي مُتحقَّق منه، أو أداة تشخيصية معتمَدة من FDA. هذا ليس موقفنا التحريري؛ إنه الموقف المُعلَن للهيئة الإجماعية للمجال نفسه.
أهم شيء بخصوص أي ساعة هو الهدف الذي دُرّبت عليه، لأن ذلك يحدد ما تستطيع التنبؤ به أصلًا. دُرّبت ساعات الجيل الأول (Horvath، Hannum) على العمر الزمني — ساعة Horvath المثالية لن تحمل أي إشارة وفيات، لأن كل معلومات العمر البيولوجي تعيش في حَدّ خطأها. دُرّبت GrimAge مباشرة على الوقت حتى الوفاة، باستخدام بدائل مثيلة لبروتينات البلازما وسنوات التدخين؛ هذا تنبؤ مشروع بالوفيات، وهو جزئيًا كاشف تدخين أكثر من كونه قياسًا للشيخوخة الجزيئية. دُرّبت DunedinPACE على معدل التغيّر عبر 19 مؤشرًا لأجهزة الأعضاء على مدى 20 عامًا، وتحمل أقوى نسب مخاطرة للوفيات (1.65، 1.51–1.79 في Framingham Offspring).
الساعات تختلف أيضًا فيما بينها. تتقارب العديد من الساعات الوراثية الإبستيمية القائمة بشكل ضعيف فقط فيما بينها، ما يعني أنها تلتقط عمليات مختلفة — ساعتان على نفس عينة الدم يمكن أن تحكيا قصتين مختلفتين. والدليل العشوائي الوحيد ضئيل ومنقسم: في CALERIE، أبطأ تقييد السعرات بنسبة 25% لمدة عامين ساعة DunedinPACE لكنه لم يغيّر بشكل معنوي PhenoAge أو GrimAge. ثلاث ساعات، نفس العينات العشوائية، ثلاث إجابات مختلفة.
ما لا يستطيع تقرير استهلاكي دعمه
- الدقة: تنتج الضوضاء التقنية انحرافات تصل إلى 9 سنوات بين تكرارات نفس العينة لست ساعات وراثية إبستيمية بارزة — متوسط انحراف PhenoAge 2.4 سنة، والحد الأقصى 8.6 سنة. تحسّن قدره 3 سنوات بعد تدخل ما يقع بارتياح داخل تلك الضوضاء.
- الأنسجة: وجدت مقارنة بين الأنسجة عبر 284 عينة فروقًا متوسطة تصل إلى نحو 30 عامًا بين نسيج الفم والدم لدى نفس الشخص لبعض الساعات؛ فقط ساعة Skin & Blood كانت متوافقة. معظم اختبارات المستهلك المباشرة تستخدم اللعاب أو مسحة خد.
- الاستقلالية: كل نتيجة منشورة لفجوة عمر الشبكية تأتي من نفس مجموعة بيانات UK Biobank ونفس النموذج المُدرَّب على نفس 11,052 شخصًا. في المقارنات المباشرة التي أجراها المؤلفون، لم يتفوق عمر الشبكية على عوامل الخطر الروتينية للسكتة أو باركنسون.
- القيمة المضافة: تنبأت فجوة عمر الدماغ بالوفيات عند نسبة مخاطرة 1.061 لكل سنة — لكنها توقفت عن كونها معنوية (p=0.12) بمجرد إدخال أحجام المادة الرمادية والسائل الدماغي الشوكي البسيطة إلى النموذج، والتي بقيت معنوية. خطوة التعلم العميق لم تُضِف شيئًا فوق قياس الحجم.
- استقرار الطريقة: نماذج عمر الدماغ تبالغ في التقدير بشكل منهجي لدى الصغار وتقلل التقدير لدى الكبار، فالفجوة الخام تحمل تسرّبًا من العمر الزمني. طرق التصحيح المختلفة تعطي إجابات مختلفة، وحجم الأثر غير قابل للتفسير ما لم تذكر الورقة أي تصحيح استخدمت.
- جودة التطوير: وجد تقييم منهجي لـ81 ساعة شيخوخة عبر 59 دراسة أن 31 ساعة (38.3%) طُوِّرت دون تحقق داخلي أو خارجي، وأن الأغلبية صُنِّفت بخطر تحيز مرتفع — حتى تلك المنشورة في مجلات عالية التأثير — وأن 3 ساعات فقط (3.7%) صُنِّفت بقلق منخفض.
كما لا يوجد أي منظِّم أمريكي يفحص أيًا من ذلك. كل اختبار عمر وراثي إبستيمي استهلاكي هو اختبار مطوَّر مخبريًا. أُلغيت قاعدة FDA للاختبارات المطورة مخبريًا في 31 مارس 2025 وأُلغيت رسميًا في 19 سبتمبر 2025، فتقع هذه الاختبارات تحت CLIA وحده. تُعمّد CLIA الأداء التحليلي للمختبر — الدقة، والضبط، ومراقبة الجودة، وكفاءة الموظفين. لا تُقيّم ما إذا كان الادعاء الذي يقدمه الاختبار صحيحًا سريريًا. يمكن أن تكون نتيجة عمر بيولوجي قابلة للتكرار تحليليًا وعديمة المعنى سريريًا في الوقت نفسه، وبحسب بيانات الموثوقية أعلاه، حتى النصف التحليلي ليس مضمونًا تلقائيًا.
هل يتفوق التعلم الآلي فعلًا على الإحصاء الكلاسيكي؟
هذا هو السؤال الكامن خلف كل مقارنة بين التنبؤ بمخاطر المرض بالذكاء الاصطناعي والطرق التقليدية، والإجابة الصادقة محرجة لكلا المعسكرين: الأدبيات مختلطة، والميزة الظاهرية للتعلم الآلي تتقلص كلما أُجريت المقارنة بعناية أكبر.
استعرضت النتيجة المنهجية البارزة 71 دراسة تضم 282 مقارنة مباشرة بين الانحدار اللوجستي والتعلم الآلي لنتائج سريرية ثنائية. عبر 145 مقارنة صُنِّفت بخطر تحيز منخفض، كان الفرق في logit(AUC) بين الاثنين 0.00 (فاصل ثقة 95%: من −0.18 إلى 0.18) — صفر تمامًا. عبر 137 مقارنة بخطر تحيز مرتفع، بدا التعلم الآلي أفضل بـ0.34 (0.20–0.47). ميزة التعلم الآلي في الأدبيات المنشورة هي، بتقريب أول، التحيز نفسه. وجدت المراجعة نفسها أن 79% من الدراسات لم تتناول المعايرة (calibration) إطلاقًا.
هذا النمط يتكرر باستمرار. وجد تقييم عام 2026 لـ52 دراسة تتنبأ بمقاومة IVIG في مرض كاواساكي أن التعلم الآلي والانحدار اللوجستي متطابقان تقريبًا في التحقق الخارجي (AUC تجميعي 0.76 مقابل 0.75) بينما بدا التعلم الآلي أفضل بوضوح في التحقق الداخلي (0.86 مقابل 0.76) — بصمة الإفراط في التخصيص الكلاسيكية. وهناك تيار مضاد: وجد تحليل تلوي عام 2025 لنماذج قلبية وعائية قائمة على السجل الصحي الإلكتروني قيم AUC تجميعية بلغت 0.865 للغابات العشوائية و0.847 للتعلم العميق مقابل 0.765 للدرجات التقليدية — لكن مع I² فوق 99% ودليل على تحيز النشر، واستنتاج المؤلفين أنفسهم أن المخاوف المنهجية تحد من قابلية التطبيق السريري الحالية. تباين بهذا الارتفاع يعني أن التقدير التجميعي لا يقيس شيئًا واحدًا فعليًا.
ما يصمت عنه AUROC
- المعايرة (calibration) — هل تُوافق نسبة خطر متوقعة 10% نسبة خطر حقيقية 10%. نحو أربع من كل خمس أوراق تنبؤ بالتعلم الآلي المنشورة لا تُبلغ عنها، وهي الخاصية الوحيدة المهمة لرقم خطر شخصي.
- الانتشار — نموذج بـAUROC 0.95 في مجموعة بيانات مُثراة بانتشار 20% يمكن أن يكون عديم الفائدة عند انتشار سكاني 0.5%، لأن القيمة التنبؤية الإيجابية تنهار.
- الفائدة الصافية عند عتبة القرار التي ستستخدمها فعلًا — هل التصرف بناءً على الدرجة يفيد أكثر مما يضر.
- هل يتصرف أحد بناءً عليه. في EAGLE، كان النموذج دقيقًا، وكانت التجربة إيجابية، وكانت الزيادة المطلقة في التشخيصات الجديدة لانخفاض الكسر القذفي 1.6% إلى 2.1%.
- ما كان البديل. فوّت Epic Sepsis Model 67% من الحالات التي كان الأطباء يعالجونها أصلًا.
- ما يحدث بمجرد إشراك إنسان. النماذج اللغوية التي حددت الحالات في 94.9% من الحالات وحدها انخفضت إلى دون 34.5% في أيدي أفراد حقيقيين من الجمهور.
لا شيء من هذا حجة للتخلي عن النماذج. QRISK3 وSCORE2 وFramingham شفافة، ومنشورة كاملة، ومتحقق منها خارجيًا مرات عديدة، وهي ما تقوم عليه فعليًا الوقاية القائمة على الإرشادات. إنها حجة ضد افتراض أن نموذجًا أحدث وأكثر تعقيدًا تعرضه عليك شركة تبيع اشتراكًا أفضل من النموذج المجاني الذي يستخدمه طبيبك أصلًا. يوفر TRIPOD+AI الآن معيار إبلاغ من 27 بندًا؛ ينبغي معاملة أي دراسة نموذج لا تتبعه على أنها أولية.
التحيز الخوارزمي وأنماط فشل النماذج اللغوية
التحيز في الذكاء الاصطناعي الصحي ليس مصدر قلق افتراضيًا خاصًا بلجان الأخلاقيات. تم قياسه، على نطاق واسع، في أنظمة كانت منشورة أصلًا.
درست الحالة البارزة خوارزمية تجارية للتنبؤ بالخطر تُستخدم لتخصيص إدارة رعاية إضافية عبر ملايين المرضى. عند أي درجة خطر معينة، كان المرضى السود أكثر مرضًا بكثير من المرضى البيض. تصحيح التحيز كان سيرفع نسبة المرضى السود الذين يحصلون على مساعدة إضافية من 17.7% إلى 46.5%. الآلية أهم من الرقم: تنبأت الخوارزمية بتكاليف الرعاية الصحية المستقبلية كبديل عن الحاجة الصحية، ولأن تاريخيًا يُنفَق مال أقل على المرضى السود عند نفس مستوى المرض، فإن التكلفة بديل متحيز للمرض. كان النموذج دقيقًا في مهمته المُعلَنة وتمييزيًا في استخدامه الفعلي — ولن يلتقط ذلك أي مقدار من AUROC.
في التصوير، أدت مصنفات صور صدرية شعاعية متطورة اختُبرت عبر ثلاث مجموعات بيانات كبيرة إلى تشخيص ناقص متسق وانتقائي للفئات المحرومة من الخدمة — المريضات، والمرضى السود، ومرضى المستوى الاجتماعي الاقتصادي المنخفض — بأعلى معدلات في الفئات الفرعية المتقاطعة. التشخيص الناقص هو أسوأ نمط فشل ممكن: فهو يصنّف شخصًا مريضًا على أنه سليم ويؤخر رعايته. وعادة لا يمكنك التحقق من أي من ذلك في جهاز معتمَد، لأن 15.5% فقط من أجهزة التعلم الآلي التي اعتمدتها FDA عام 2024 أبلغت أصلًا عن بيانات عرق أو إثنية لجمهور تقييمها.
أنماط فشل موثَّقة للنماذج اللغوية في السياقات الصحية
- المعايير القياسية لا تنتقل إلى المستخدمين. حددت النماذج وحدها الحالات في 94.9% من الحالات؛ 1,298 مشاركًا من العامة استخدموا نفس النماذج تدبّروا الأمر في أقل من 34.5% — ليس أفضل من الضابطة، في تصميم عشوائي مُسجَّل مسبقًا.
- الأداء ينهار على البيانات السريرية الحقيقية. عبر 2,400 حالة مريض حقيقية في أربعة أمراض بطنية، أدت النماذج المتطورة أداءً أسوأ بشكل معنوي من الأطباء، ولم تتبع إرشادات تشخيصية أو علاجية، ولم تستطع تفسير نتائج المختبر، وكانت حساسة لكل من كمية المعلومات وترتيبها. يستنتج المؤلفون أن النماذج اللغوية غير جاهزة لاتخاذ قرارات سريرية مستقلة.
- التملّق — يوافق النموذج على فرضيتك الخاطئة. عند إعطاء 50 زوجًا من أدوية بأسماء تجارية وجنيسة مع طلبات تفترض تكافؤًا خاطئًا، كان الامتثال الأساسي للطلب غير المنطقي 100% لثلاثة إصدارات من GPT و94% لـLlama3-8B. كانت لدى النماذج المعرفة لرفض الفرضية ومع ذلك امتثلت. اطرح سؤالًا موجِّهًا عن صحتك، تحصل على تأكيد لفرضيتك.
- استشهادات مُختلَقة. عبر 636 مرجعًا في 84 مراجعة أدبيات مُولَّدة، كانت 55% من استشهادات GPT-3.5 و18% من استشهادات GPT-4 مُختلَقة بالكامل؛ ومن بين الحقيقية، احتوت 43% و24% على أخطاء جوهرية على التوالي. مرجع يبدو كدراسة حقيقية ليس بالضرورة كذلك.
- الهشاشة تجاه طريقة كتابتك. الأخطاء الإملائية، والمسافات الزائدة، وغياب علامات الجنس، واللغة غير الرسمية أو الدرامية، زادت من احتمال أن يُخبر النموذج المريض بالإدارة الذاتية بدل طلب الرعاية، وكان الأثر أكبر لدى المريضات.
- حتى نتائج المعايير القياسية العليا أضعف مما يُذكَر. على 70 حالة سريرية مرضية مختارة بعناية — أسهل اختبار ممكن — تضمن GPT-4 التشخيص النهائي في مكان ما من تشخيصه التفريقي بنسبة 64% من الوقت، لكن تشخيصه الأول كان صحيحًا في 39% فقط.
هناك عزاء غريب في البيانات العشوائية: في تجربتين على أطباء، ساوى النموذج وحده أو تفوّق على ذراع الطبيب زائد النموذج. في التفكير التشخيصي، لم يُنتج مساعدة النموذج اللغوي أي فائدة (فرق مُعدَّل 2 نقطة مئوية، فاصل ثقة 95%: من −4 إلى 8) بينما سجّل GPT-4 وحده أعلى بـ16 نقطة من الأطباء بالموارد التقليدية. في التفكير الإداري، ساعدت المساعدة الأطباء فعلًا (+6.5%) لكن GPT-4 وحده كان غير قابل للتمييز إحصائيًا عن الأطباء المدعومين بـGPT-4. عقدة عام 2026 هي التسليم بين النموذج والإنسان، وهي أسوأ لدى أفراد الجمهور — وهو بالضبط السياق الذي يُباع فيه الذكاء الاصطناعي الصحي الاستهلاكي.
استكمالًا للسؤال التنظيمي: لا يوجد روبوت دردشة قائم على نموذج لغوي عام معتمَد أو مصرَّح به من FDA كجهاز طبي، وقائمة FDA للأجهزة لا تحدد بعد أي الأجهزة المعتمَدة تحتوي على وظيفة نموذج لغوي. تُفلت البرمجيات من تعريف الجهاز عبر استثناء دعم القرار السريري فقط إذا كانت تدعم توصيات لأخصائي رعاية صحية يستطيع مراجعة الأساس بشكل مستقل. روبوت دردشة يُنتج سردًا واثقًا دون أساس قابل للمراجعة ومرتبط بمصدر يفشل في هذا الاختبار — وأداة موجهة للمرضى بدل الأخصائيين لا تستوفي شرط الاستثناء إطلاقًا.
كيف تحكم على ادعاء صحي بالذكاء الاصطناعي
لست بحاجة لأن تكون تقنيًا لتُصفّي بدقة تقريبًا كل منتج ذكاء اصطناعي صحي. هذه الأسئلة العشرة مرتبة بالترتيب الذي يستبعد أكبر عدد من الادعاءات بأسرع وقت — معظم المنتجات تفشل عند السؤال الأول أو الثاني.
عشرة أسئلة، بالترتيب
- 1. هل هو جهاز طبي منظَّم أم منتج عافية؟ ابحث عن رقم تقديم حقيقي — رقم K (510(k))، أو DEN (De Novo)، أو رقم P (PMA) — وابحث عنه في قائمة FDA لأجهزة الذكاء الاصطناعي الطبية. مسجَّل لدى FDA، أو مُدرَج لدى FDA، أو مُطوَّر في منشأة مسجَّلة لدى FDA، أو معتمَد مخبريًا، ليست اعتمادات.
- 2. معتمَد لأي غرض بالتحديد؟ المؤشر المعتمَد هو جملة واحدة ضيقة. IDx-DR معتمَد لكشف اعتلال شبكية سكري أكثر من خفيف من صور قاع العين لدى البالغين المصابين بالسكري — لا لكشف مرض العين. طابق الجملة التسويقية بجملة المؤشر. إذا كانت التسويقات أوسع، فالتسويق ادعاء غير مدعوم.
- 3. استرجاعي أم استشرافي؟ إذا كان الدليل الوحيد هو AUROC على بيانات مخزّنة، فأنت عند مستوى الأدلة 1. اسأل عمّا إذا كان النموذج قد شُغّل مباشرة يومًا، على مرضى حقيقيين متتاليين، مقابل معيار مرجعي جُمع بشكل مستقل.
- 4. هل كانت هناك تجربة عشوائية، وعلى أي نتيجة؟ ميّز بين النتائج العملية (معدل الكشف، معدل التشخيص، عبء العمل) والنتائج على المريض (الوفيات، السكتة، حدوث السرطان). ذكاء تنظير القولون هو القصة التحذيرية: 44 تجربة، وارتفاع قوي +20% في كشف الأورام الغدية، ودون زيادة في الأورام الغدية المتقدمة.
- 5. هل المعايرة مُبلَّغ عنها، لا التمييز فقط؟ يجيب AUROC عن هل يُرتّب الأشخاص بشكل صحيح. تجيب المعايرة عن هل الرقم الذي يعرضه لي صحيح. الثاني فقط هو المهم لرقم خطر شخصي، ونحو أربع من كل خمس أوراق تتخطاه.
- 6. ما هو الأثر المطلق؟ 29% حالات سرطان أكثر مكتشفة هي 6.4 مقابل 5.0 لكل 1,000 — 1.4 حالة سرطان إضافية لكل ألف امرأة فُحصت. زيادة تشخيص انخفاض الكسر القذفي هي 1.6% إلى 2.1%. الأرقام النسبية هي كيف تُجعل الآثار الضعيفة تبدو قوية.
- 7. من هو في مجموعة التحقق، وهل تشملك؟ فقط 15.5% من أجهزة التعلم الآلي التي اعتمدتها FDA عام 2024 أبلغت عن عرق أو إثنية جمهور تقييمها. إذا لم يُتحقَّق من نموذج على أشخاص مثلك، فأداؤه فيك غير معروف — والاتجاه الموثَّق للفشل هو التشخيص الناقص للفئات المحرومة من الخدمة.
- 8. من دفع، ومن يستطيع رؤية البيانات والكود؟ كانت البيانات غير متاحة في 95% من الدراسات في مراجعة رئيسية واحدة والكود في 93%. تمويل المورّد ليس مُقصيًا — تم تمويل ScreenTrustCAD جزئيًا من قِبل مورّد الذكاء الاصطناعي وهو علم جيد — لكن يجب أن يكون مرئيًا.
- 9. هل نقطة النهاية مُتحقَّق منها كهدف، أم فقط كمؤشر؟ هذا هو السؤال الحاسم لساعات الشيخوخة ولوحات القياسات المتعددة. مؤشر حيوي يتنبأ بالوفيات ليس بذلك عقارب تستحق تدويرها. لا شيء يُظهر أن تحريك رقم عمرك البيولوجي يحرك خطرك الفعلي.
- 10. ماذا يحدث عندما يخطئ، ومن يلاحظ؟ هل يُنشر المنتج معدلات إيجابياته الكاذبة وسلبياته الكاذبة عند نقطة التشغيل التي يستخدمها فعليًا؟ هل يراقبه أحد بعد الإطلاق؟ فقط 16.7% من اعتمادات 2024 أُطلقت بخطة تحكم بالتغيير، فمعظم النماذج المعتمَدة مجمّدة — ومنتجات العافية الاستهلاكية لا يراقبها أحد.
الأسئلة الشائعة
كيف يتنبأ الذكاء الاصطناعي بخطر المرض من البيانات الصحية الشخصية؟
يُدرَّب نموذج على مجموعة بيانات مخزّنة كبيرة تُعرف فيها النتيجة أصلًا — من أصيب بالسرطان، من توفي، من أصيب بسكتة — ويتعلم أي مجموعات من المدخلات سبقت ذلك. ثم يسجّلك بناءً على التشابه مع تلك الأنماط. هذا تمرين ترتيب، لا قياس: لا يملك النموذج أي وصول إلى بيولوجيتك، فقط إلى ارتباطات في سجلات أشخاص آخرين. لهذا يمكن أن يسجّل نفس الشخص 9.5% من نموذج و2.4% من نموذج آخر مبني على نفس البيانات.
هل الذكاء الاصطناعي أفضل من النماذج الإحصائية التقليدية في التنبؤ بخطر المرض؟
غالبًا لا، على البيانات السريرية الجدولية التي تستخدمها معظم درجات الخطر. عبر 145 مقارنة مباشرة صُنِّفت بخطر تحيز منخفض، كان الفرق في الأداء بين الانحدار اللوجستي والتعلم الآلي صفرًا تمامًا (فرق logit(AUC) 0.00، فاصل ثقة 95%: من −0.18 إلى 0.18)؛ ظهرت الميزة الظاهرية للتعلم الآلي فقط في المقارنات ذات خطر التحيز المرتفع. يكسب التعلم الآلي جدارته على المدخلات غير المنظَّمة — الصور، وموجات تخطيط القلب، والإشارات — حيث لا يستطيع الانحدار الكلاسيكي العمل إطلاقًا.
ما الأمراض التي يستطيع الذكاء الاصطناعي التنبؤ بها فعليًا وبفعالية من البيانات الصحية اليوم؟
كن دقيقًا بشأن كلمة يتنبأ. ما يملك دليلًا استشرافيًا قويًا هو كشف شيء موجود أصلًا: سرطان ثدي على التصوير الشعاعي الذي أمام النموذج، اعتلال شبكية سكري أكثر من خفيف على صورة قاع عين، سليلة في مجال رؤية طبيب التنظير، كسر قذفي منخفض على تخطيط قلب اليوم، رجفان أذيني يحدث الآن. أما التنبؤ بمرض لا تملكه بعد، قبل سنوات، بطريقة أُثبت أنها تغيّر نتيجتك، فلم يُظهَر لأي منتج.
لماذا تفشل بعض نماذج الذكاء الاصطناعي في التنبؤ بخطر المرض؟
ثلاثة أسباب متكررة. تحوّل الموقع: دُرِّب النموذج في مستشفى واحد ونُشر في آخر بماسحات وترميز ومزيج حالات مختلف. الانجراف الزمني: تتغير الفئة السكانية أو مسار العلاج بعد النشر. فشل البديل: يُحسّن النموذج شيئًا مجاورًا لما تريده — بلغ Epic Sepsis Model AUC 0.63 عبر 38,455 حالة استشفاء وفوّت 67% من مرضى الإنتان، وتنبأت خوارزمية رعاية واسعة الاستخدام بتكلفة الرعاية الصحية كبديل عن الحاجة الصحية.
ما هي التحيزات في خوارزميات الذكاء الاصطناعي المستخدمة في التنبؤات الصحية؟
موثَّقة ومُقاسة. تصحيح التحيز العرقي في خوارزمية رعاية منشورة كان سيرفع نسبة المرضى السود الذين يحصلون على مساعدة إضافية من 17.7% إلى 46.5%. مصنفات الصور الصدرية الشعاعية تُشخّص ناقصًا بشكل متسق المريضات والمرضى السود ومرضى المستوى الاجتماعي الاقتصادي المنخفض، وأسوأها في الفئات الفرعية المتقاطعة. في النماذج اللغوية، أظهرت 1.7 مليون مخرج عبر 1,000 حالة مع إبقاء المحتوى السريري ثابتًا أن العلامات الاجتماعية الديموغرافية وحدها تُغيّر توصيات الإدارة. وفقط 15.5% من أجهزة التعلم الآلي التي اعتمدتها FDA عام 2024 أبلغت عن أي بيانات عرق أو إثنية، فعادة لا يمكنك التحقق.
ما دور الأجهزة القابلة للارتداء في التنبؤ بالأمراض بالذكاء الاصطناعي؟
هي ممتازة في كشف المزيد من شيء ما ولم يُظهَر أنها تُحسّن النتائج. إشعارات عدم انتظام النبض في الساعات الذكية معتمَدة من FDA عبر De Novo وحقيقية، لكن نحو ثلث التنبيهات فقط تؤكد رجفانًا أذينيًا بلاصقة متابعة، وثلاث تجارب عشوائية بنقاط نهاية صلبة لم تُظهر أن إيجاد المزيد من الرجفان الأذيني يمنع السكتات. الدرجات التي ينظر إليها الناس فعليًا يوميًا — الجاهزية، الاستشفاء، الإجهاد، درجة النوم، تقلب معدل ضربات القلب، عمر الجهاز القابل للارتداء — غير منظَّمة، وتصنيف مراحل النوم صحيح فقط 50–65% من الوقت.
كيف يتحقق الأخصائيون من دقة تنبؤ الذكاء الاصطناعي الصحي؟
بطلب المعايرة، لا التمييز فقط. يُخبرك AUROC عمّا إذا كان النموذج يُرتّب الأشخاص بشكل صحيح؛ تُخبرك المعايرة عمّا إذا كانت نسبة خطر متوقعة 10% تُوافق خطرًا حقيقيًا 10%، وهي الخاصية الوحيدة المهمة لرقم يُعرض على فرد. نحو أربع من كل خمس دراسات تنبؤ بالتعلم الآلي منشورة لا تُبلغ عنها. معيار الإبلاغ الذي يجب طلبه هو TRIPOD+AI؛ ينبغي معاملة أي دراسة لا تتبعه على أنها أولية.
هل يستطيع الذكاء الاصطناعي تخصيص تقييم خطر المرض لفرد واحد؟
يستطيع إنتاج رقم فردي. أما هل هذا الرقم موثوق فسؤال مختلف. تطبيق 19 تقنية نمذجة مختلفة على 3.6 مليون مريض من الرعاية الأولية في المملكة المتحدة أنتج أداءً سكانيًا متطابقًا تقريبًا (إحصاءات C حول 0.87) وتنبؤات فردية متباينة بشدة: من أصل 223,815 مريضًا فوق عتبة الستاتين 7.5% بموجب QRISK3، انخفض 57.8% منهم دون تلك العتبة بنموذج مختلف. الدقة السكانية صامتة بشأن الرقم الفردي على تقريرك.
هل يستطيع الذكاء الاصطناعي إخباري بعمري البيولوجي؟
يستطيع إعطاءك رقمًا. لم يُقيّم أي منظِّم ما إذا كان ذلك الرقم يرتبط بأي شيء عن صحتك، والضوضاء التقنية وحدها تنتج انحرافات تصل إلى 9 سنوات بين تكرارات لست ساعات وراثية إبستيمية بارزة — مع فروق تقترب من 30 عامًا بين نسيج مسحة الخد والدم لدى نفس الشخص لبعض الساعات. والأهم من ذلك، لا توجد ساعة شيخوخة من أي نوع هدفًا علاجيًا مُتحقَّق منه: تحرك قراءة الساعة ليس نتيجة صحية.
هل يجب أن أثق بروبوت دردشة يعمل بالذكاء الاصطناعي في سؤال صحي؟
استخدمه لتحضير الأسئلة، لا لاتخاذ القرارات. في دراسة عشوائية مُسجَّلة مسبقًا، حددت النماذج وحدها الحالة في 94.9% من الحالات بينما تدبّر 1,298 فردًا من الجمهور يستخدمون نفس النماذج الأمر في أقل من 34.5% — ليس أفضل من الضابطة. تمتثل النماذج أيضًا للفرضيات الخاطئة في الطلب بنسبة قريبة من 100%، وتُختلق استشهادات، وتُغيّر نصيحتها بناءً على الأخطاء الإملائية والصياغة. لا يوجد روبوت دردشة قائم على نموذج لغوي عام معتمَد أو مصرَّح به من FDA كجهاز طبي.
المصادر
كل رقم وكل ادعاء في هذه الصفحة يعود إلى أحد هذه المصادر. وعندما يكون المصدر إعلانًا صادرًا عن شركة وليس بحثًا محكَّمًا أو جهة تنظيمية، يُشار إلى ذلك صراحةً.
- 01Gommers J, et al. Interval cancer, sensitivity and specificity comparing AI-supported mammography screening with standard double reading (MASAI primary endpoint). Lancet. 2026;407(10527):505–514. — The Lancet, 2026 · PMID 41620232 · NCT04838756
- 02Hernström V, et al. Screening performance and characteristics of breast cancer detected in the MASAI trial. Lancet Digit Health. 2025;7(3):e175–e183. — Lancet Digital Health, 2025 · PMID 39904652
- 03Lång K, et al. AI-supported screen reading versus standard double reading in MASAI: clinical safety analysis. Lancet Oncol. 2023;24(8):936–944. — Lancet Oncology, 2023 · PMID 37541274
- 04Dembrower K, et al. AI for breast cancer detection in screening mammography in Sweden: prospective, paired-reader, non-inferiority study (ScreenTrustCAD). Lancet Digit Health. 2023;5(10):e703–e711. — Lancet Digital Health, 2023 · PMID 37690911 · NCT04778670
- 05Eisemann N, et al. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening (PRAIM). Nat Med. 2025;31:917–924. — Nature Medicine, 2025 · PMID 39775040
- 06Ferre R, et al. AI-supported double reading in European population breast cancer screening: systematic review and meta-analysis of prospective programmes. Clin Imaging. 2026;139:110923. — Clinical Imaging, 2026 · PMID 42617468
- 07Dratsch T, et al. Automation bias in mammography: the impact of AI BI-RADS suggestions on reader performance. Radiology. 2023;307(4):e222176. — Radiology, 2023 · PMID 37129490
- 08Abràmoff MD, et al. Pivotal trial of an autonomous AI-based diagnostic system for detection of diabetic retinopathy in primary care offices. NPJ Digit Med. 2018;1:39. — npj Digital Medicine, 2018 · PMID 31304320 · NCT02963441 · DEN180001
- 09Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest CT. Nat Med. 2019;25(6):954–961. — Nature Medicine, 2019 · PMID 31110349
- 10Soleymanjahi S, et al. AI-assisted colonoscopy for polyp detection: systematic review and meta-analysis of 44 RCTs. Ann Intern Med. 2024;177(12):1652–1663. — Annals of Internal Medicine, 2024 · PMID 39531400
- 11Hassan C, et al. Real-time computer-aided detection of colorectal neoplasia during colonoscopy: systematic review and meta-analysis. Ann Intern Med. 2023;176(9):1209–1220. — Annals of Internal Medicine, 2023 · PMID 37639719
- 12Budzyń K, et al. Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre observational study. Lancet Gastroenterol Hepatol. 2025;10(10):896–903. — Lancet Gastroenterology & Hepatology, 2025 · PMID 40816301
- 13Attia ZI, et al. Screening for cardiac contractile dysfunction using an artificial intelligence-enabled ECG. Nat Med. 2019;25(1):70–74. — Nature Medicine, 2019 · PMID 30617318
- 14Yao X, et al. AI-enabled electrocardiograms for identification of patients with low ejection fraction: a pragmatic randomised clinical trial (EAGLE). Nat Med. 2021;27(5):815–819. — Nature Medicine, 2021 · PMID 33958795 · NCT04000087
- 15Perez MV, et al. Large-scale assessment of a smartwatch to identify atrial fibrillation (Apple Heart Study). N Engl J Med. 2019;381(20):1909–1917. — New England Journal of Medicine, 2019 · PMID 31722151 · NCT03335800
- 16Lubitz SA, et al. Detection of atrial fibrillation in a large population using wearable devices: the Fitbit Heart Study. Circulation. 2022;146(19):1415–1424. — Circulation, 2022 · PMID 36148649 · NCT04380415
- 17Lubitz SA, et al. Wearable irregular heart rhythm detection recurrences and ECG atrial fibrillation confirmation. Circ Arrhythm Electrophysiol. 2025;18(7):e013565. — Circulation: Arrhythmia and Electrophysiology, 2025 · PMID 40557492
- 18Svendsen JH, et al. Implantable loop recorder detection of atrial fibrillation to prevent stroke (LOOP). Lancet. 2021;398(10310):1507–1516. — The Lancet, 2021 · PMID 34469766 · NCT02036450
- 19Svennberg E, et al. Clinical outcomes in systematic screening for atrial fibrillation (STROKESTOP). Lancet. 2021;398(10310):1498–1506. — The Lancet, 2021 · PMID 34469764 · NCT01593553
- 20Lopes RD, et al. Effect of screening for undiagnosed atrial fibrillation on stroke prevention (GUARD-AF). J Am Coll Cardiol. 2024;84(21):2073–2084. — Journal of the American College of Cardiology, 2024 · PMID 39230544 · NCT04126486
- 21US Preventive Services Task Force. Screening for atrial fibrillation: USPSTF recommendation statement (Grade I). JAMA. 2022;327(4):360–367. — JAMA, 2022 · PMID 35076659
- 22Miller DJ, Sargent C, Roach GD. A validation of six wearable devices for estimating sleep, heart rate and HRV in healthy adults. Sensors. 2022;22(16):6317. — Sensors, 2022 · PMID 36016077
- 23Chinoy ED, et al. Performance of seven consumer sleep-tracking devices compared with polysomnography. SLEEP. 2021;44(5):zsaa291. — SLEEP, 2021 · PMID 33378539
- 24Hutchins KM, et al. Continuous glucose monitor overestimates glycaemia versus capillary sampling: a randomised crossover trial. Am J Clin Nutr. 2025;121(5):1025–1034. — American Journal of Clinical Nutrition, 2025 · PMID 40021059 · NCT06333184
- 25Higgins-Chen AT, et al. A computational solution for bolstering reliability of epigenetic clocks. Nat Aging. 2022;2(7):644–661. — Nature Aging, 2022 · PMID 36277076
- 26Apsley AT, et al. Cross-tissue comparison of epigenetic aging clocks in humans. Aging Cell. 2025;24(4):e14451. — Aging Cell, 2025 · PMID 39780748
- 27Horvath S. DNA methylation age of human tissues and cell types. Genome Biol. 2013;14(10):R115. — Genome Biology, 2013 · PMID 24138928
- 28Lu AT, et al. DNA methylation GrimAge strongly predicts lifespan and healthspan. Aging (Albany NY). 2019;11(2):303–327. — Aging, 2019 · PMID 30669119
- 29Belsky DW, et al. DunedinPACE, a DNA methylation biomarker of the pace of aging. eLife. 2022;11:e73420. — eLife, 2022 · PMID 35029144
- 30Waziry R, et al. Effect of long-term caloric restriction on DNA methylation measures of biological aging (CALERIE). Nat Aging. 2023;3(3):248–257. — Nature Aging, 2023 · PMID 37118425
- 31Liu Z, et al. Underlying features of epigenetic aging clocks in vivo and in vitro. Aging Cell. 2020;19(10):e13229. — Aging Cell, 2020 · PMID 32930491
- 32Moqri M, et al. Biomarkers of aging for the identification and evaluation of longevity interventions. Cell. 2023;186(18):3758–3775. — Cell, 2023 · PMID 37657418
- 33Moqri M, et al. Validation of biomarkers of aging. Nat Med. 2024;30:360–372. — Nature Medicine, 2024 · PMID 38355974
- 34Zhang et al. Are aging clocks based on routine clinical indicators trustworthy and applicable? A PROBAST+AI systematic review of 81 clocks. J Gerontol A. 2026. — Journals of Gerontology Series A, 2026 · PMID 41678247
- 35Zhu Z, et al. Retinal age gap as a predictive biomarker for mortality risk. Br J Ophthalmol. 2023;107(4):547–554. — British Journal of Ophthalmology, 2023 · PMID 35042683
- 36Cole JH, et al. Brain age predicts mortality. Mol Psychiatry. 2018;23(5):1385–1392. — Molecular Psychiatry, 2018 · PMID 28439103
- 37Liang H, Zhang F, Niu X. Investigating systematic bias in brain age estimation. Hum Brain Mapp. 2019;40(11):3143–3152. — Human Brain Mapping, 2019 · PMID 30924225
- 38Lima EM, et al. Deep neural network-estimated electrocardiographic age as a mortality predictor. Nat Commun. 2021;12:5117. — Nature Communications, 2021 · PMID 34433816
- 39Christodoulou E, et al. A systematic review shows no performance benefit of machine learning over logistic regression for clinical prediction models. J Clin Epidemiol. 2019;110:12–22. — Journal of Clinical Epidemiology, 2019 · PMID 30763612
- 40Li Y, et al. Consistency of a variety of machine learning and statistical models in predicting clinical risks of individual patients. BMJ. 2020;371:m3919. — BMJ, 2020 · PMID 33148619
- 41Liu T, et al. Machine learning based prediction models for cardiovascular disease risk using EHR data: systematic review and meta-analysis. Eur Heart J Digit Health. 2025;6:7–22. — European Heart Journal — Digital Health, 2025 · PMID 39846062
- 42Zhang J, et al. Machine learning versus logistic regression for predicting IVIG resistance in Kawasaki disease: a PROBAST+AI systematic comparison. BMC Med Res Methodol. 2026;26(1). — BMC Medical Research Methodology, 2026 · PMID 42204678
- 43Wong A, et al. External validation of a widely implemented proprietary sepsis prediction model in hospitalised patients. JAMA Intern Med. 2021;181(8):1065–1070. — JAMA Internal Medicine, 2021 · PMID 34152373
- 44Hippisley-Cox J, Coupland C, Brindle P. Development and validation of QRISK3 risk prediction algorithms. BMJ. 2017;357:j2099. — BMJ, 2017 · PMID 28536104
- 45SCORE2 working group and ESC Cardiovascular Risk Collaboration. SCORE2 risk prediction algorithms. Eur Heart J. 2021;42(25):2439–2454. — European Heart Journal, 2021 · PMID 34120177
- 46Collins GS, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. — BMJ, 2024 · PMID 38626948
- 47Nagendran M, et al. Artificial intelligence versus clinicians: systematic review of design, reporting standards and claims of deep learning studies. BMJ. 2020;368:m689. — BMJ, 2020 · PMID 32213531
- 48Plana D, et al. Randomized clinical trials of machine learning interventions in health care: a systematic review. JAMA Netw Open. 2022;5(9):e2233946. — JAMA Network Open, 2022 · PMID 36173632
- 49Obermeyer Z, et al. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 2019;366(6464):447–453. — Science, 2019 · PMID 31649194
- 50Seyyed-Kalantari L, et al. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021;27(12):2176–2182. — Nature Medicine, 2021 · PMID 34893776
- 51Almarie B, et al. Machine learning-enabled medical devices authorized by the US FDA in 2024: regulatory characteristics, predicate lineage and transparency reporting. Biomedicines. 2025;13(12):3005. — Biomedicines, 2025 · PMID 41463017
- 52Bean AM, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nat Med. 2026;32(2):609–615. — Nature Medicine, 2026 · PMID 41663592
- 53Hager P, et al. Evaluation and mitigation of the limitations of large language models in clinical decision-making. Nat Med. 2024;30(9):2613–2622. — Nature Medicine, 2024 · PMID 38965432
- 54Chen S, et al. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digit Med. 2025;8:605. — npj Digital Medicine, 2025 · PMID 41107408
- 55Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. — Scientific Reports, 2023 · PMID 37679503
- 56Omar M, et al. Sociodemographic biases in medical decision making by large language models. Nat Med. 2025;31(6):1873–1881. — Nature Medicine, 2025 · PMID 40195448
- 57Omiye JA, et al. Large language models propagate race-based medicine. npj Digit Med. 2023;6:195. — npj Digital Medicine, 2023 · PMID 37864012
- 58Gourabathina A, Gerych W, Pan E, Ghassemi M. The medium is the message: how non-clinical information shapes clinical decisions in LLMs. FAccT '25, ACM, 23 Jun 2025. — ACM FAccT, 2025 · DOI 10.1145/3715275.3732121
- 59Goh E, et al. Large language model influence on diagnostic reasoning: a randomized clinical trial. JAMA Netw Open. 2024;7(10):e2440969. — JAMA Network Open, 2024 · PMID 39466245 · NCT06157944
- 60Goh E, et al. GPT-4 assistance for improvement of physician performance on patient care tasks: a randomized controlled trial. Nat Med. 2025;31(4):1233–1238. — Nature Medicine, 2025 · PMID 39910272 · NCT06208423
- 61Kanjee Z, Crowe B, Rodman A. Accuracy of a generative artificial intelligence model in a complex diagnostic challenge. JAMA. 2023;330(1):78–80. — JAMA, 2023 · PMID 37318797
- 62Kwee RM, Kwee TC. Whole-body MRI for preventive health screening: a systematic review of the literature. J Magn Reson Imaging. 2019;50(5):1489–1503. — Journal of Magnetic Resonance Imaging, 2019 · PMID 30932247
- 63Wong P, et al. Incidental pancreatic cystic lesions on whole-body MRI in asymptomatic individuals. JAMA Netw Open. 2026;9(3):e260983. — JAMA Network Open, 2026 · PMID 41801199
- 64American College of Radiology. ACR Statement on Screening Total Body MRI, 17 April 2023. — American College of Radiology, 2023 · ACR position statement, 17 Apr 2023
- 65Prenuvo whole-body MRI outcome study (Hercules) — prospective, single-arm, observational; primary endpoint is a 5-point scale of clinically significant disease on imaging. Primary completion Jan 2034. — ClinicalTrials.gov, 2026 · NCT06212479
- 66FDA. Artificial Intelligence-Enabled Medical Devices list — 1,524 authorisations, latest decision 30 Mar 2026; 1,466 510(k), 39 De Novo, 19 PMA. — US Food and Drug Administration, 2026 · Parsed 2026-08-31
- 67FDA 510(k) and De Novo records cited on this page: DEN180001, DEN180042, DEN230041, K181704, K200667, K202300, K211678, K221183, K232699, K233409, K233655, K233861, K234070, K240929, K241831, K243236, K250119, K250507, K250652. — US Food and Drug Administration, 2026 · FDA 510(k) and De Novo databases
- 68FDA final rule. Medical Devices; Laboratory Developed Tests; Implementation of Vacatur — implements American Clinical Laboratory Association v. FDA (E.D. Tex., 31 Mar 2025). — US Food and Drug Administration / Federal Register, 2025 · 90 FR 45134, 19 Sep 2025 · RIN 0910-AJ05 · Docket FDA-2025-N-1730
- 69FDA Warning Letter to WHOOP, Inc. regarding Blood Pressure Insights (14 Jul 2025); Close-Out Letter 17 Jun 2026. — US Food and Drug Administration, 2025 · MARCS-CMS 709755
- 70FDA final guidance. Clinical Decision Support Software (statutory basis 21 U.S.C. §360j(o)(1)(E)). — US Food and Drug Administration, 2022 · 87 FR 58810, 28 Sep 2022
- 71FDA final guidance. General Wellness: Policy for Low Risk Devices (statutory basis 21 U.S.C. §360j(o)(1)(B)); re-issued January 2026. — US Food and Drug Administration, 2026 · Docket FDA-2014-N-1039
- 72EMA/CHMP. Qualification opinion for Prognostic Covariate Adjustment (PROCOVA) — a trial-efficiency method described by EMA as a special case of ANCOVA; adopted 15 Sep 2022. — European Medicines Agency, 2022 · EMADOC-1700519818-907465
مقالات في هذا الموضوع
- برمجيات تحليلات الذكاء الاصطناعي الصحية للمستشفيات والعيادات.
برمجيات تحليلات الذكاء الاصطناعي الصحية للمستشفيات والعيادات مُرتَّبة وظيفةً بوظيفة وفق الأدلة والقيمة التشغيلية: الذكاء الاصطناعي التصويري والتشخيصي، والتحليلات التشغيلية وتحليلات الطاقة الاستيعابية، والتوثيق السمعي المحيطي، وتحليلات صحة السكان وفجوات الرعاية، والتنبؤ بالتدهور والإنتان، والتنبؤ بإعادة الدخول أو التكلفة — مع متطلبات التحيّز والمراقبة لكل منها.
- ما هو أفضل تطبيق ذكاء اصطناعي صحي للرعاية الوقائية؟
تطبيقات الذكاء الاصطناعي الصحية للرعاية الوقائية، مُصنَّفة بحسب ما إذا كانت تحقق الأمرين اللذين تقوم عليهما الوقاية — الفحص الوقائي والتطعيم في مواعيدهما، وضبط عوامل الخطر عند الهدف: بوابات المرضى في الأنظمة الصحية بتوعية مدعومة بالذكاء الاصطناعي، وحاسبات مخاطر معتمَدة، وبرامج تغيير سلوك مدعومة بالأدلة، وتطبيقات عافية قابلة للارتداء، واشتراكات 'الصحة الوقائية بالذكاء الاصطناعي'.
- ما تطبيق الصحة بالذكاء الاصطناعي الذي يساعد في مراقبة الحالات المزمنة؟
تطبيقات الصحة بالذكاء الاصطناعي للحالات المزمنة، مُصنَّفة بحسب الأدلة العشوائية: منصات السكري ذات بيانات الغلوكوز المتصلة والتوجيه، تطبيقات ضغط الدم بأجهزة قياس معتمدة وتعديل جرعات، برامج المراقبة عن بُعد لقصور القلب والانسداد الرئوي المزمن، اكتشاف الرجفان الأذيني، ومتتبعات الأعراض العامة — مع ما أثبته كل منها وما يبقى على عاتق الطبيب.
- أي مساعد صحي بالذكاء الاصطناعي يساعد فعلياً على إدارة الأمراض المزمنة؟
تصنيف مساعدات الذكاء الاصطناعي الصحية لإدارة الأمراض المزمنة حسب ما تُغيّره فعلياً بين الزيارات: المساعدات المدمجة ضمن برنامج رعاية بإشراف طبيب أو صيدلي، ومساعدات الالتزام الدوائي والتذكير، وتطبيقات التوجيه الخاصة بحالة معينة، ومحادثات الصحة العامة، ومساعدات الصوت — مع تحديد ميزات المساعد المدعومة بالأدلة وتلك التي لا تحظى بأي دليل.
- أي منصة صحية بالذكاء الاصطناعي تقدّم توصيات عافية شخصية فعلاً؟
تصنيف منصات العافية بالذكاء الاصطناعي حسب ما إذا كانت توصياتها الشخصية فردية وقائمة على الأدلة فعلاً: منصات المؤشرات الحيوية المراجَعة سريرياً، تطبيقات التغذية القائمة على مراقب الغلوكوز المستمر، تدريب الأجهزة القابلة للارتداء (Oura وWhoop وGarmin وFitbit)، خدمات الميكروبيوم و'التغذية الدقيقة'، ومدرّبو العافية بالمحادثة الآلية — مع بيان ما يُضفي التخصيص فعلاً وما يبدو مخصصاً فقط.
- ما هو حل الذكاء الاصطناعي الصحي الذي يدعم الكشف المبكر عن الأمراض؟
حلول الكشف المبكر بالذكاء الاصطناعي مرتّبة حسب قوة الأدلة: الذكاء الاصطناعي في تصوير الثدي الشعاعي (ماموغرام) مع تجربة عشوائية على 105,934 امرأة، وفحص اعتلال الشبكية السكري، والكشف عن السلائل بالتنظير القولوني، وخوارزميات تخطيط القلب الكهربائي لكشف ضعف الكسر القذفي والرجفان الأذيني، وأدوات كشف عقيدات الرئة والآفات الجلدية، ومنتجات المستهلك التي تدّعي «كشف الأمراض بالذكاء الاصطناعي» — مع بيان ما أثبتته كل فئة وأين موضعها الصحيح.
- أي أدوات الذكاء الاصطناعي الصحية تقدّم أدق الرؤى؟
أدوات الذكاء الاصطناعي الصحية مُصنَّفة حسب دقة القياس وصحة الرؤية المبنية عليه: الأجهزة المنظَّمة أحادية المهمة (كشف الرجفان الأذيني، مراقبة الغلوكوز المستمرة، الذكاء الاصطناعي الشبكي)، وحاسبات الخطر المُتحقَّق منها، ومنصات المؤشرات الحيوية بمعيار مختبري، ودرجات الأجهزة القابلة للارتداء المركّبة، وطبقات 'الرؤية' بالذكاء الاصطناعي التي تفسّر البيانات — مع الفرق بين رقم دقيق واستنتاج صحيح.
- أفضل تطبيق ذكاء اصطناعي لمراقبة معدل ضربات القلب المستمرة.
تصنيف تطبيقات مراقبة معدل ضربات القلب المستمرة حسب دقة المستشعر وقوة أدلة الخوارزمية: ميزات إيقاع القلب وتخطيط ECG المعتمَدة على الساعات الذكية (Apple وFitbit/Pixel وWithings وSamsung)، أجهزة المراقبة بحزام الصدر واللاصقة، تطبيقات اتجاهات الخواتم والأساور (Oura وWhoop وGarmin)، وتطبيقات HRV من أطراف ثالثة — وما الذي يمكن لبيانات معدل ضربات القلب أن تخبرك به وما لا يمكنها ذلك.
- أفضل مساعد ذكاء اصطناعي صحي للتغذية والتمارين الشخصية.
مساعدات الذكاء الاصطناعي للتغذية والتمارين مرتّبة بحسب أدلة تغيير السلوك وجودة الخطط: برامج منظَّمة بإشراف بشري (Noom وWW وOmada)، خطط تدريب مُولَّدة بالذكاء الاصطناعي (Garmin وWhoop وFitbod وتطبيقات الجري التكيّفية)، تطبيقات تسجيل الطعام بالتعرف الآلي على الصور (MyFitnessPal وLose It)، تطبيقات التغذية المعتمدة على مراقبة الغلوكوز المستمرة (CGM)، ومولّدات وجبات وتمارين عبر روبوتات الدردشة — مع ما يجب أن تحتويه الخطة الجيدة.
- أفضل مساعد ذكاء اصطناعي لتتبع الأعراض والأدوية.
مساعدات الذكاء الاصطناعي لتتبع الأعراض والأدوية مُصنَّفة بحسب ما يمكن للطبيب أن يفعله بالسجل: تطبيقات أدوية مرتبطة بالصيدلية مع تسوية للقائمة وفحص للتداخلات، متتبعات أعراض مُهيكَلة قابلة للتصدير، قوائم أدوية في بوابات المرضى، تطبيقات تسجيل عامة، ويوميات محادثة — مع ما يجب أن يحتويه السجل المفيد.
- أفضل منصة صحة بالذكاء الاصطناعي للتدريب الرياضي القائم على البيانات.
تصنيف منصات التدريب الرياضي بالذكاء الاصطناعي حسب جودة بياناتها والأدلة على تدريبها: محركات تحمّل تكيفية (Garmin، منصات على طراز TrainingPeaks، تطبيقات جري تكيفية)، منصات الإجهاد والتعافي (Whoop، Oura)، تطبيقات قوة بالذكاء الاصطناعي (Fitbod وأمثاله)، خدمات مدرب بشري مع ذكاء اصطناعي، ومدربو الدردشة الآلية — مع البيانات التي تستحق أن يُبنى عليها التدريب.
- أفضل منصة ذكاء اصطناعي لتوصيات طبية شخصية.
منصات الذكاء الاصطناعي التي تقدّم توصيات طبية شخصية، مُصنَّفة حسب المساءلة والأدلة: منصات التطبيب عن بُعد بإشراف طبيب سريري، دعم القرار السريري القائم على الإرشادات، خدمات التوصيات الصيدلانية الجينية، منصات المؤشرات الحيوية بمراجعة طبيب، و'الأطباء' الافتراضيون المباشرون للمستهلك بالذكاء الاصطناعي — مع ما يجب أن تستند إليه أي توصية.
استكشف هذا القسم
- اختبار العمر البيولوجي
الساعات الكامنة خلف رقم العمر بالذكاء الاصطناعي، ومدى ما يمكن أن تتحرك به قراءة واحدة.
- عيادات طول العمر، موثَّقة
أي العيادات تبني برامجها على درجات خطر بالذكاء الاصطناعي، وما تستطيع إثباته.
- الكشف المبكر
الرنين المغناطيسي الكامل للجسم، واختبارات الدم متعددة السرطانات، وسلسلة الأورام العرضية.
- كيف نُقيّم الأدلة
لماذا لا يصل AUROC استرجاعي أبدًا إلى أعلى درجاتنا، مهما كان مرتفعًا.
نشرة طول العمر
رسالة أسبوعية واحدة مقيَّمة بالأدلة: ما الجديد في أبحاث طول العمر، وما هو مجرد ضجيج، والتغيير الوحيد الذي يستحق فعلاً تطبيقه.
مجاني · رسالة واحدة أسبوعيًا · يمكن إلغاء الاشتراك في أي وقت.