امروزه تحولات و پیشرفتها در عرصهی زیستشناسی و رشتههای مرتبط با سرعت در جریان است. هر روز اطلاعات جدیدی به دانش موجود دربارهی کارکرد سلولها و بافتهای زنده و مکانیسمهای بدن موجودات زنده افزوده میشود.
حجم زیادی از دانش زیستشناختی تنها از طریق متن کامل مقالات پژوهشی قابل دستیابی است. از آنجا که نه سازندگان پایگاههای دادهای دستی توانایی همپایی با گسترش سریع حجم مقالات علمی دارند و نه کاربران از عهدهی این کار بر میآیند، لذا رویکردهای پردازش زبان طبیعی روز به روز در پروژههای بیوانفورماتیک اهمیت بیشتری پیدا میکنند.
در سیستمهای متنکاوی، سیستم نرمافزاری سعی میکند از متن مقاله اطلاعات مفیدی را استخراج کند. البته استفاده از روشهای یادگیری ماشینی میتواند منجر به درک ماشین از متن شود. اما روشهای متنکاوی بیشتر متمرکز بر استخراج رابطههای ذکر شده در متن و این قبیل اطلاعات است. بهعنوان مثال، میتوان تأثیرات ژنها و پروتئینها و امثال آنها را از متون مقالات تحقیقاتی استخراج کرد.