متن‌کاوی چکیده‌های علمی

parsik(62)
Published in
#science
Words
178
Reading
1 min
Listen
Play
9y

گسترش مداوم و سریع اینترنت، دستیابی به مقادیر زیاد داده‌ها را به صورت آنلاین امکان‌پذیر کرده است، به‌طوری‌که به آسانی می‌توانیم به هزاران هزار مقاله‌ی پزشکی و علمی دسترسی داشته باشیم. لیکن یک فرد واحد نمی‌تواند درصد قابل توجهی از اطلاعات موجود را شخصاً بخواند و درک کند، و واقعاً این نیاز وجود دارد که از روش‌های پردازش زبان طبیعی در بسیاری از حوزه‌ها استفاده شود، که این امر موجب تسهیل در بازیابی اطلاعات مفید می‌شود. عرصه‌های مختلف علوم پایه و پزشکی نیز در این زمینه استثنا نیستند. پایگاه‌های داده‌ای از قبیل مدلاین حاوی حجم گسترده‌ای از دانش هستند.

یکی از کارهایی که در این زمینه انجام شده است، استخراج بیماری‌ها و ژن‌های مربوط به آنها از چکیده‌های مدلاین است که به این کار، استخراج رابطه می‌گوییم. در حال حاضر، سیستم‌هایی برای استخراج رابطه از مقالات زیستی-پزشکی وجود دارند.

لیکن این رویکردها، مشکلات چندی دارند. منابع آنها مسلماً دارای موارد مثبت کاذب زیادی هستند، زیرا آنها روابط زیادی را ارائه می‌دهند که صرفاً متکی بر اطلاعات باهم‌آیی هستند؛ لذا خیلی از نتایج آنها ممکن است غیرقابل اعتماد باشند.