مفاهيم أساسية الهندسة والتكنولوجيا نشر بتاريخ: 29 مايو 2026

”يا هاتفي الذكي، هل لديّ مرض؟”: اكتشاف الأمراض من خلال الصوت

ملخص

يتعلّم البشر مما يدركونه بحواسهم في الحياة اليومية. ويمكن أن تتمتع أجهزة الكمبيوتر بقدرات تعلّم مشابهة، مما يسمح لها بالتعلم مما "تراه" و"تسمعه" واستخدام المعرفة التي حصلت عليها لحلّ المهام في المستقبل. وهذه القدرة اسمها الذكاء الاصطناعي .(AI) والآن، لا يستغني البشر في حياتهم اليومية عن الأجهزة المزوّدة بالذكاء الاصطناعي، مثل الهواتف الذكية أو الساعات الذكية أو مكبرات الصوت الذكية. فهي قادرة على الاستماع إلينا والإجابة عن أسئلتنا، بالإضافة إلى إمكانات أخرى. وهذا النوع من التكنولوجيا يؤدي أيضًا دورًا في الطب تزداد أهميته بمرور الوقت.

في هذه المقالة، نشرح كيف يستطيع الكمبيوتر معرفة ما إذا كان صوت شخص ما أو طريقة تحدثه يدلان على مرض معين. ونوضح ذلك باستخدام مثال على اكتشاف فيروس كورونا ونناقش كلاً من المشكلات والفرص الناشئة عند استخدام الذكاء الاصطناعي للتشخيص.

تحليل الصوت باستخدام الكمبيوتر

هل قال لك أحد والديك يومًا، "عزيزي، صوت سعالك ليس طبيعيًّا!" عندما كنت تعاني من السعال والتهاب الحلق على سبيل المثال؟ أو هل أدركوا إصابتك بالبرد بعد مجرد محادثة قصيرة معهما؟ نتعلّم من هذه القدرة المذهلة أن حالتك الصحية يمكن سماعها من صوت سعالك أو صوتك.

في السنوات القليلة الأخيرة، بدأنا التحدث ليس مع البشر فحسب، بل مع أجهزة الكمبيوتر أيضًا، مثل الهواتف الذكية والساعات الذكية ومكبرات الصوت الذكية. فنحن نطلب منها، مثلاً، تشغيل الأضواء أو إعطاءنا معلومات حول حالة الطقس. ويمكن للأجهزة الذكية الاستماع إلى ما نقوله وفهمه، فهل قد تتمكن في المستقبل من اكتشاف إصابتنا بالمرض مثلما تستطيع الأذن البشرية أو ربما أفضل منها؟ وهل يمكن أن تكتشف نوع المرض الذي يعانيه الشخص؟

للتمكن من ذلك، تحتاج أجهزة الكمبيوتر إلى القدرة على التعلّم واستخدام المعرفة التي تكتسبها لحل المهام المستقبلية. وهذه القدرة اسمها الذكاء الاصطناعي (AI). يُطلق على استخدام الذكاء الاصطناعي للبيانات الصوتية اسم تحليل الصوت باستخدام الكمبيوتر (CA).

حتى تتعلم أجهزة الكمبيوتر، عادةً ما تحتاج إلى بيانات نموذجية والمعلومات المطلوب تعلمها من البيانات، وهي ما إذا كان المرض موجودًا أم لا في حالتنا (الشكل 1). يتعلم البشر بطريقة مماثلة، فقد سمعنا أصوات المرضى والأصحاء عدة مرات، تعلمنا كيف تبدو الأصوات الصحية والمريضة من خلال خصائص صوتية معينة، مثل الخشونة.

رسم توضيحي كرتوني يصور فتاة تسأل هاتفها الذكي: "يا هاتف ذكي، هل أنا مريضة؟" يرد الهاتف الذكي: "نعم، أنت مريضة." فوقهما، تحتوي فقاعة فكرية على ستة وجوه، كل منها يقول إما "أنا بصحة جيدة" باللون الأخضر أو "أنا مريضة" باللون الأحمر، مما يمثل مدخلات من أفراد مختلفين.
  • شكل 1 - "يتعلم" نظام تحليل الصوت باستخدام الكمبيوتر (CA) من العديد من الأصوات النموذجية لأشخاص مرضى وأصحاء حتى يتمكن لاحقًا من تحديد ما إذا كان الشخص مريضًا أم لا.
  • يسترجع نظام CA الأصوات النموذجية للمرضى والأصحاء عندما يُطلب منه تقييم صوت شخص جديد.

استخدم الأطباء المعلومات السمعية لعدة سنوات لتشخيص الأمراض. ومن الأمثلة المعروفة استخدام السماعة الطبية، وهي عبارة عن قرص معدني به أنابيب متصلة بسماعات للاستماع إلى أصوات الرئتين والقلب. قد تتساءل عن سبب حاجتنا إلى مساعدة كمبيوتر. يتفوق الذكاء الاصطناعي على البشر بعدة مزايا، مما يمكن أن يجعل "تحليل الصوت باستخدام الكمبيوتر" أداة مساعدة مهمة في التشخيص. هناك حدود لأعداد المصابين بمرض معين الذين يراهم الأطباء ويسمعونهم في مسيرتهم المهنية. في المقابل، يمكن أن يتعلم الكمبيوتر من كمية ضخمة من البيانات النموذجية خلال بضع ساعات وبدون أي تعب. بالإضافة إلى ذلك، يمكن أن يخزّن الكمبيوتر بأمان المعلومات المكتسبة ولن ينساها بمرور الوقت.

في المستقبل، يمكن أن يؤدي تطبيق "تحليل الصوت باستخدام الكمبيوتر" في الطب إلى الحدّ من الحاجة للفحوصات الطبية التي يمكن أن تكون مزعجة بل ومخيفة لبعض المرضى.

بالإضافة إلى ذلك، سيكون من السهل جدًا للناس أن يسعلوا ثلاث مرات فقط أو ينطقوا بضع كلمات في هاتفهم الذكي أو في أي ميكروفون آخر، وهم على سريرهم في منزلهم، بدلاً من الاضطرار إلى زيارة عيادة الطبيب. باستخدام هذه البيانات، يمكن لنظام CA أن يوفر للطبيب المعلومات اللازمة للتشخيص.

ولكن كيف يستطيع الكمبيوتر معرفة ما إذا كان صوت شخص ما أو طريقة تحدثه (العاطفية أو البطيئة مثلاً) يدلان على مرض معين؟ سنشرح هذا باستخدام مثال اكتشاف فيروس كورونا، وهو أحد أكثر الأمراض المعدية انتشارًا في السنوات القليلة الماضية، ونناقش بعض المشكلات والفرص الناشئة عند استخدام الذكاء الاصطناعي للتشخيص.

تسجيل الصوت وتحليله

كيف يمكن لأجهزة الكمبيوتر الاستماع إلى الصوت البشري على الرغم من عدم امتلاكها لأذنين؟ تعمل الميكروفونات في أجهزة الكمبيوتر والأجهزة الذكية مثل الأذن البشرية، وتلتقط الصوت البشري أثناء انتشاره في الهواء. ثم يتم حفظ التسجيل الصوتي على الجهاز بتنسيق يتيح تحليله فيما بعد.

يتسم صوت كل شخص بعدة خصائص تعتمد على حجم وشكل ووظائف كل أجزاء الجسم المشاركة في إنتاج الصوت، وهي الرئتان والحلق والفم والأنف. والمجموعة الفريدة من هذه الخصائص في كل فرد هي السبب الذي يجعلنا نعرف عادةً مَن يكلمنا حتى لو لم نكن نراه، مثلاً أثناء التحدث عبر الهاتف. وبناءً على هذه الخصائص، يمكننا وصف أصوات مختلف الأشخاص ومقارنتها. على سبيل المثال، يبدو صوت الطفل الصغير على الأرجح أكثر حدة من صوت والده.

يتم استخدام سمات تُسمّى الخصائص الصوتية لوصف الصوت بالتفصيل. يمكن لأجهزة الكمبيوتر استخراج مئات، بل وآلاف الخصائص الصوتية من إشارة صوتية واحدة. في المثال السابق، ستكون بعض الخصائص الدالة على حدة الصوت أعلى قيمةً لطفل صغير، مقارنةً بوالده.

يمكن أيضًا أن تنشئ أجهزة الكمبيوتر صورة من إشارة صوتية تجمع المعلومات من عدة خصائص صوتية. وتُسمّى هذه الصورة مخطط الطيف الصوتي (الشكل 2)، وهو يعرض شكل الصوت في نقطة زمنية محددة، على سبيل المثال من حيث الحدة والخشونة والشدة. ويبين مخطط الطيف الصوتي أيضًا أي صوت كلام، مثل a أو e أو s، تم نطقه في وقت معين ومتى صمت المتكلم بالضبط. يمكن لنظام CA استخدام هذه الخصائص الصوتية أو مخططات الطيف الصوتي للتعلم منها، بل ويمكن لأحدث الأنظمة التعلم مباشرةً من التسجيلات الصوتية.

يوضح الشكل (أ) مخطط طيفي مُسمى "صحي" مع نطاقات تردد واضحة ومتباعدة بانتظام عبر الزمن، بينما يعرض الشكل (ب) المُسمى "مريض" نطاقات تردد مماثلة مع انخفاضات طفيفة في السطوع والوضوح. يستخدم كلا الشكلين مقياس ألوان ديسيبل من -80 إلى 0 ديسيبل ويشتركان في محاور للتردد بالهرتز والزمن بالثواني.
  • شكل 2 - مخططان للطيف الصوتي من (A) شخص بصحة جيدة و (B) شخص مريض يعرضان الشدة (بالديسيبل) لكل تردد (بالهرتز) موجود في الصوت بمرور الوقت.
  • ويوضح كلا المخططين نطق الحرف المتحرك a لمدة 12 ثانية تقريبًا. ويتم تمثيل الحرف المتحرك المنطوق بالخطوط المتوازية فاتحة اللون. كلما زادت ضبابية الخطوط أو تشوهها أو كلما زاد عدد العناصر الفاتحة الإضافية بين الخطوط المتوازية، كانت خشونة الحرف المتحرك أكبر. هل تستطيع تمييز الاختلافات؟

اكتشاف فيروس كورونا عبر تحليل الصوت باستخدام الكمبيوتر

في نهاية عام 2019، انتشر فيروس كورونا بسرعة في العالم كله، مسببًا أعراضًا شبيهة بالإنفلونزا، مثل السعال وضيق النفس والتهاب الحلق والصداع والحمّى. عادةً ما يتم تشخيص فيروس كورونا باختبارات تحلل سوائل الأنف أو الحلق، غير أنها يمكن أن تكون مزعجة ويلزم شراؤها من صيدلية وتنتج نفايات، وهو أمر مضرّ بالبيئة. يمكن أن تؤثر أعراض فيروس كورونا على صوت المرضى وأنفاسهم وأصوات سعالهم [1]. وبالتالي، قد يكون نظام تحليل الصوت باستخدام الكمبيوتر (CA) بديلاً مفيدًا وصديقًا للبيئة للاختبارات الحالية لفيروس كورونا والأمراض المشابهة [2].

وقد هدفت عدة دراسات CA بالفعل إلى اكتشاف فيروس كورونا [3]. لجمع بيانات التعلم لأنظمة CA، طلب الباحثون من المشاركين المصابين وغير المصابين بفيروس كورونا نطق عدة أصوات لأحرف متحركة مفردة مثل a أو e أو o لأطول فترة ممكنة أو قراءة نصوص أو أخذ أنفاس عميقة أو السعال في ميكروفون. واستخدم الباحثون عدة أنظمة CA لمعرفة الأنظمة والأصوات الأفضل في اكتشاف فيروس كورونا.

اختلفت نتائج الدراسات اختلافًا كبيرًا؛ ففي بعض الحالات، تعرّف نظام CA بشكل صحيح على حالة فيروس كورونا لدى 6 أفراد فقط من بين 10 أشخاص، في حين أفادت دراسات أخرى بعدم وجود أي أخطاء تقريبًا [3].

وعلى الرغم من أن هذه النتائج واعدة للغاية، فعلينا تذكّر أن بعض الدراسات لم تشمل سوى تسجيلات لأشخاص مصابين بفيروس كورونا إصابة شديدة وأصحاء غير مصابين بهذا الفيروس. ولذلك، نحتاج إلى إجراء المزيد من الأبحاث لتصميم نظام CA قادر حقًا على اكتشاف ما إذا كان المريض مصابًا بالفعل بفيروس كورونا أو لديه مرض آخر، بدلاً من مجرد إخبارنا بما إذا كان الشخص مريضًا أم بصحة جيدة [4].

حماية البيانات الصوتية الخاصة

في المستقبل، يمكن أن يصبح نظام تحليل الصوت باستخدام الكمبيوتر أداة مساعدة قيّمة لتشخيص الأمراض المعدية، مثل فيروس كورونا وحالات أخرى تؤثر على الصوت. ويمكنه، مثلاً، اكتشاف الاكتئاب بالتعرف على حزن غير معتاد في صوت شخص ما. وربما سيتاح أن نكتشف بشكل متزامن عدة أمراض لدى الشخص نفسه، مثل فيروس كورونا وكذلك الاكتئاب، بافتراض أن البيانات النموذجية من المصابين بعدة أمراض متاحة لنظام CA للتعلم منها.

تعلم الآن على الأرجح أن تصميم أنظمة CA لاكتشاف الأمراض يستلزم أولاً جمع البيانات. بالنسبة للمصابين وغير المصابين بالمرض المعني، سيكون عليهم توفير نماذج للصوت أو السعال أو الأنفاس يمكن أن يتعلم منها نظام CA. ويجب على كل شخص موافق على المشاركة في أي دراسة أن يوقّع على وثيقة تشرح كل الأبحاث المُخطّط لها واستخدام البيانات. وهذه الوثيقة اسمها نموذج الموافقة المستنيرة. يُعدّ الصوت البشري نوعًا من البيانات عالي الحساسية لأن الأشخاص الآخرين، مثل العائلة والأصدقاء والزملاء والمُعلّمين والجيران، يمكنهم التعرف على أي شخص من صوته. ونظرًا لأن التسجيل قد يحتوي على معلومات حول صحة شخص ما أو مشاعره أو مواقفه، فمن المهم للغاية التعامل مع تلك البيانات بطريقة آمنة ومسؤولة لحماية خصوصية المشاركين.

يوفّر نظام CA أفضل أداء عندما لا يتعلم فقط من كمية كبيرة من التسجيلات إجمالاً، بل أيضًا من تسجيلات لأشخاص مختلفين من حيث العمر والجنس واللغة والمهنة والخلفية العائلية. تخيّل وجود نوعين من أنظمة CA. تعلّم النظام 1 فقط من تسجيلات لإناث بالغات، بينما تعلّم النظام 2 من عدد إجمالي مماثل من التسجيلات، ولكن شملت البيانات تسجيلات لإناث بالغات وذكور بالغين وأطفال. وإذا حدّد كلا النظامين ما إذا كان صبيّ يبلغ من العمر 9 أعوام مصابًا بمرض معيّن، فالنظام 2 لديه فرصة أفضل في تحديد الحالة الصحية للطفل بشكل صحيح، لأن النظام 1 لم يتعلم مطلقًا كيف يبدو صوت صبي في عمر التاسعة، سواء كان بصحة جيدة أو مريضًا.

وحتى إذا وفرنا كمية كافية من البيانات المتنوعة لنظام CA للتعلم منها، فلن تكون نتائجه دقيقة بنسبة 100%. ففي بعض الأحيان، سيتنبأ نظام CA بوجود مرض معين على الرغم من سلامة الشخص أو معاناته من مرض آخر، أو سيعجز عن اكتشاف مرض موجود فعلاً. ولذلك، يجب أن ينتبه الأطباء إلى أن الذكاء الاصطناعي، حاله حال كل أدوات التشخيص الأخرى، يمكن أن يخطئ. يجب استخدام نظام CA كإحدى الأدوات المتعددة المساعدة في التشخيص. وبالتالي، لن يحلّ الذكاء الاصطناعي محلّ الأطباء، بل إن فوائد هذه التكنولوجيات تكمن في تزويد الأطباء بمعلومات أفضل يمكنها زيادة دقة تشخيصهم والحدّ من عمليات التشخيص الخاطئة ومساعدتهم على تشخيص الأمراض في وقت أبكر وتقليل الفحوصات المزعجة للمرضى. وبشكل عام، فإن استخدام أنظمة CA والأشكال الأخرى للذكاء الاصطناعي كجزء من "مجموعة أدوات" التشخيص يمكن أن يحسّن رعاية المرضى ونتائجهم الصحية.

مسرد للمصطلحات

الذكاء الاصطناعي (Artificial Intelligence): تكنولوجيا تتيح لأجهزة الكمبيوتر حلّ المهام التي كنا نظن سابقًا أن البشر وحدهم يمكنهم حلّها.

تحليل الصوت باستخدام الكمبيوتر (Computer Audition): استخدام الذكاء الاصطناعي للاستماع إلى الأصوات وفهمها.

سمعي/سمعية (Auditory): يمكن اكتشافه بحاسة السمع.

التشخيص (Diagnosis): قرار الطبيب بشأن المرض الذي يعاني منه الفرد، بناءً على الأعراض المذكورة وفحص طبي.

الخصائص الصوتية (Acoustic Features): الخصائص المادية للأصوات، مثل شدة الصوت أو حدته.

مخطط الطيف الصوتي (Spectrogram): صورة ملونة تعرض بنية صوت معين بمرور الوقت.

الموافقة المستنيرة (Informed Consent): في البداية، يجب إخبار المشاركين في الدراسة حول كل القياسات المخطّط لها والغرض وراء استخدام بياناتهم. وبعد ذلك، يلزم أن يعبروا صراحةً عن موافقتهم من خلال التوقيع على وثيقة ذات صلة.

إقرار تضارب المصالح

يعلن المؤلفون أن البحث قد أُجري في غياب أي علاقات تجارية أو مالية يمكن تفسيرها على أنها تضارب محتمل في المصالح.

شكر وتقدير

تلقى هذا البحث تمويلاً من المؤسسة الألمانية للبحوث (DFG؛ مشروع Reinhart Koselleck AUDI0NOMOUS، رقم 442218748) وكذلك المفوضية الأوروبية [EU Horizon 2020 Research & Innovation Action (RIA)؛ SHIFT، رقم 101060660].

إفصاح أدوات الذكاء الاصطناعي

تم إنشاء النص البديل (alt text) المرفق بالأشكال في هذه المقالة بواسطة "فرونتيرز" (Frontiers) وبدعم من الذكاء الاصطناعي، مع بذل جهود معقولة لضمان دقته، بما يشمل مراجعته من قبل المؤلفين حيثما كان ذلك ممكناً. في حال تحديدكم لأي خطأ، نرجو منكم التواصل معنا.


المراجع

[1] Bartl-Pokorny, K. D., Pokorny, F. B., Batliner, A., Amiriparian, S., Semertzidou, A., Eyben, F., et al. 2021. The voice of COVID-19: acoustic correlates of infection in sustained vowels. J. Acoust. Soc. Am. 149:4377–83. doi: 10.1121/10.0005194

[2] Schuller, B. W., Schuller, D. M., Qian, K., Liu, J., Zheng, H., and Li, X. 2021. COVID-19 and computer audition: an overview on what speech & sound analysis could contribute in the SARS-COV-2 corona crisis. Front. Digit. Health 3:564906. doi: 10.3389/fdgth.2021.564906

[3] Kosar, A., Asif, M., Ahmad, M. B., Akram, W., Mahmood, K., and Kumari, S. 2024. Towards classification and comprehensive analysis of AI-based COVID-19 diagnostic techniques: a survey. Artif. Intell. Med. 151:102858. doi: 10.1016/j.artmed.2024.102858

[4] Coppock, H., Jones, L., Kiskin, I., and Schuller, B. 2021. COVID-19 detection from audio: Seven grains of salt. Lancet Digit. Health 3:e537–8. doi: 10.1016/S2589-7500(21)00141-2