گسترش مداوم و سریع اینترنت، دستیابی به مقادیر زیاد دادهها را به صورت آنلاین امکانپذیر کرده است، بهطوریکه به آسانی میتوانیم به هزاران هزار مقالهی پزشکی و علمی دسترسی داشته باشیم. لیکن یک فرد واحد نمیتواند درصد قابل توجهی از اطلاعات موجود را شخصاً بخواند و درک کند، و واقعاً این نیاز وجود دارد که از روشهای پردازش زبان طبیعی در بسیاری از حوزهها استفاده شود، که این امر موجب تسهیل در بازیابی اطلاعات مفید میشود. عرصههای مختلف علوم پایه و پزشکی نیز در این زمینه استثنا نیستند. پایگاههای دادهای از قبیل مدلاین حاوی حجم گستردهای از دانش هستند.
یکی از کارهایی که در این زمینه انجام شده است، استخراج بیماریها و ژنهای مربوط به آنها از چکیدههای مدلاین است که به این کار، استخراج رابطه میگوییم. در حال حاضر، سیستمهایی برای استخراج رابطه از مقالات زیستی-پزشکی وجود دارند.
لیکن این رویکردها، مشکلات چندی دارند. منابع آنها مسلماً دارای موارد مثبت کاذب زیادی هستند، زیرا آنها روابط زیادی را ارائه میدهند که صرفاً متکی بر اطلاعات باهمآیی هستند؛ لذا خیلی از نتایج آنها ممکن است غیرقابل اعتماد باشند.