{"id":4883,"date":"2016-08-22T01:06:29","date_gmt":"2016-08-22T01:06:29","guid":{"rendered":"http:\/\/www.garysieling.com\/blog\/?p=4883"},"modified":"2016-08-22T01:06:29","modified_gmt":"2016-08-22T01:06:29","slug":"extracting-text-wikipedia-article","status":"publish","type":"post","link":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/","title":{"rendered":"Extracting the text from a Wikipedia article"},"content":{"rendered":"<p>Wikipedia has extensive text on articles it discusses &#8211; in some cases so much that a lot of language processing APIs won&#8217;t accept it. Alchemy API (now seemingly marketed as &#8220;IBM Watson&#8221;) has an endpoint to parse text from a website, but it only accepts 600KB pages (50K of output text). Consequently, it quickly becomes easier to just get the text yourself.<\/p>\n<p>To do this, I recommend Apache Tika, which seems to include one of the better \/ best libraries for extracting text, and has every imaginable interface &#8211; Java, command line, REST, and a GUI(!). <\/p>\n<p>You only need a Java jar for this-<\/p>\n<pre lang=\"bash\">\ncurl http:\/\/apache.spinellicreations.com\/tika\/tika-app-1.13.jar > tika-app.jar\n<\/pre>\n<p>Tika has a complex set of options for detecting content types<sup><a href=\"#footnote_1_4883\" id=\"identifier_1_4883\" class=\"footnote-link footnote-identifier-link\" title=\"https:\/\/tika.apache.org\/1.1\/detection.html#Content_Detection\">1<\/a><\/sup>, but it seems to respond to file extensions, and when I was testing this I found that it was more reliable when I specified these:<\/p>\n<pre lang=\"bash\">\ncurl https:\/\/en.wikipedia.org\/wiki\/Barack_Obama > Barack_Obama.html\n<\/pre>\n<p>Invoking Tika is simple:<\/p>\n<pre lang=\"bash\">\njava -jar tika-app.jar -t data\/$1.html > out\/$1.txt\n<\/pre>\n<p>Problem is, Wikipedia has a ton of extra content wrapping the text. You could handle this in a few ways &#8211; pre-process the file to select out what you want, customize Tika to have it parse out the bits you want (probably a good option if you want to get just captions or headings), or hack at the output.<\/p>\n<p>For my case I chose the last option. The following script will remove the table of contents, most captions, and the bogus header \/ footer information that shows up at the end of the file. Tune to your liking (I removed the references as well).<\/p>\n<pre lang=\"python\">\nimport fileinput\nimport re\n\nstart = re.compile(\"Jump to:.*navigation,.*search\")\n \nend = re.compile(\"^Notes and references$\")\n\nstarted = False\nended = False\nblank = False\n\nignore = re.compile(\n  \"^(Main article: .*|\" +\n  \"Main articles: .*|\" + \n  \"See also: .*|\" + \n  \"\\s*[0-9]+.[0-9]+ .*\" + \n  \"|\\s*[0-9]+.[0-9]+.[0-9]+ .*)\\s*$\")\n\nfootnote = re.compile(\"\\[[0-9]+\\]\")\n\nfor line in fileinput.input():\n\n  if (re.match(end, line.strip())):\n    ended = True\n\n  if (started and not ended):\n    if (not blank or line.strip() != \"\"):\n      if (not re.match(ignore, line)):\n        if (\".\" in line or len(line) > 150 or len(line.strip()) == 0):\n          print(re.sub(footnote, \"\", line.strip()))\n\n          if (line.strip() == \"\"):\n            blank = True\n          else:\n            blank = False\n\n  if (not started):\n    if (re.search(start, line) != None):\n      started = True\n\n  pass\n<\/pre>\n<ol class=\"footnotes\"><li id=\"footnote_1_4883\" class=\"footnote\">https:\/\/tika.apache.org\/1.1\/detection.html#Content_Detection<span class=\"footnote-back-link-wrapper\"> [<a href=\"#identifier_1_4883\" class=\"footnote-link footnote-back-link\">&#8617;<\/a>]<\/span><\/li><\/ol>","protected":false},"excerpt":{"rendered":"<p>How to extract text content from Wikipedia articles programmatically<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"om_disable_all_campaigns":false,"_monsterinsights_skip_tracking":false,"footnotes":""},"categories":[12],"tags":[300,447],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 4.9.9 - aioseo.com -->\n\t<meta name=\"description\" content=\"How to extract text content from Wikipedia articles programmatically\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"gary\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 4.9.9\" \/>\n\t\t<meta property=\"og:locale\" content=\"en_US\" \/>\n\t\t<meta property=\"og:site_name\" content=\"Gary Sieling - Software Engineer\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"Extracting the text from a Wikipedia article - Gary Sieling\" \/>\n\t\t<meta property=\"og:description\" content=\"How to extract text content from Wikipedia articles programmatically\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2016-08-22T01:06:29+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2016-08-22T01:06:29+00:00\" \/>\n\t\t<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n\t\t<meta name=\"twitter:title\" content=\"Extracting the text from a Wikipedia article - Gary Sieling\" \/>\n\t\t<meta name=\"twitter:description\" content=\"How to extract text content from Wikipedia articles programmatically\" \/>\n\t\t<script type=\"application\/ld+json\" class=\"aioseo-schema\">\n\t\t\t{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"BlogPosting\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#blogposting\",\"name\":\"Extracting the text from a Wikipedia article - Gary Sieling\",\"headline\":\"Extracting the text from a Wikipedia article\",\"author\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/author\\\/gary\\\/#author\"},\"publisher\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/#organization\"},\"datePublished\":\"2016-08-22T01:06:29+00:00\",\"dateModified\":\"2016-08-22T01:06:29+00:00\",\"inLanguage\":\"en-US\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#webpage\"},\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#webpage\"},\"articleSection\":\"How-To, java, python\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#breadcrumblist\",\"itemListElement\":[{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog#listItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/www.garysieling.com\\\/blog\",\"nextItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/category\\\/how-to\\\/#listItem\",\"name\":\"How-To\"}},{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/category\\\/how-to\\\/#listItem\",\"position\":2,\"name\":\"How-To\",\"item\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/category\\\/how-to\\\/\",\"nextItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#listItem\",\"name\":\"Extracting the text from a Wikipedia article\"},\"previousItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog#listItem\",\"name\":\"Home\"}},{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#listItem\",\"position\":3,\"name\":\"Extracting the text from a Wikipedia article\",\"previousItem\":{\"@type\":\"ListItem\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/category\\\/how-to\\\/#listItem\",\"name\":\"How-To\"}}]},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/#organization\",\"name\":\"Gary Sieling\",\"description\":\"Software Engineer\",\"url\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/\"},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/author\\\/gary\\\/#author\",\"url\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/author\\\/gary\\\/\",\"name\":\"gary\",\"image\":{\"@type\":\"ImageObject\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#authorImage\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/0be925276d848ffe98a6a9dc8cf33e67?s=96&d=identicon&r=g\",\"width\":96,\"height\":96,\"caption\":\"gary\"}},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#webpage\",\"url\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/\",\"name\":\"Extracting the text from a Wikipedia article - Gary Sieling\",\"description\":\"How to extract text content from Wikipedia articles programmatically\",\"inLanguage\":\"en-US\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/#website\"},\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/extracting-text-wikipedia-article\\\/#breadcrumblist\"},\"author\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/author\\\/gary\\\/#author\"},\"creator\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/author\\\/gary\\\/#author\"},\"datePublished\":\"2016-08-22T01:06:29+00:00\",\"dateModified\":\"2016-08-22T01:06:29+00:00\"},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/#website\",\"url\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/\",\"name\":\"Gary Sieling\",\"description\":\"Software Engineer\",\"inLanguage\":\"en-US\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.garysieling.com\\\/blog\\\/#organization\"}}]}\n\t\t<\/script>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"Extracting the text from a Wikipedia article - Gary Sieling","description":"How to extract text content from Wikipedia articles programmatically","canonical_url":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"BlogPosting","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#blogposting","name":"Extracting the text from a Wikipedia article - Gary Sieling","headline":"Extracting the text from a Wikipedia article","author":{"@id":"https:\/\/www.garysieling.com\/blog\/author\/gary\/#author"},"publisher":{"@id":"https:\/\/www.garysieling.com\/blog\/#organization"},"datePublished":"2016-08-22T01:06:29+00:00","dateModified":"2016-08-22T01:06:29+00:00","inLanguage":"en-US","mainEntityOfPage":{"@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#webpage"},"isPartOf":{"@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#webpage"},"articleSection":"How-To, java, python"},{"@type":"BreadcrumbList","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#breadcrumblist","itemListElement":[{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog#listItem","position":1,"name":"Home","item":"https:\/\/www.garysieling.com\/blog","nextItem":{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog\/category\/how-to\/#listItem","name":"How-To"}},{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog\/category\/how-to\/#listItem","position":2,"name":"How-To","item":"https:\/\/www.garysieling.com\/blog\/category\/how-to\/","nextItem":{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#listItem","name":"Extracting the text from a Wikipedia article"},"previousItem":{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog#listItem","name":"Home"}},{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#listItem","position":3,"name":"Extracting the text from a Wikipedia article","previousItem":{"@type":"ListItem","@id":"https:\/\/www.garysieling.com\/blog\/category\/how-to\/#listItem","name":"How-To"}}]},{"@type":"Organization","@id":"https:\/\/www.garysieling.com\/blog\/#organization","name":"Gary Sieling","description":"Software Engineer","url":"https:\/\/www.garysieling.com\/blog\/"},{"@type":"Person","@id":"https:\/\/www.garysieling.com\/blog\/author\/gary\/#author","url":"https:\/\/www.garysieling.com\/blog\/author\/gary\/","name":"gary","image":{"@type":"ImageObject","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#authorImage","url":"https:\/\/secure.gravatar.com\/avatar\/0be925276d848ffe98a6a9dc8cf33e67?s=96&d=identicon&r=g","width":96,"height":96,"caption":"gary"}},{"@type":"WebPage","@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#webpage","url":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/","name":"Extracting the text from a Wikipedia article - Gary Sieling","description":"How to extract text content from Wikipedia articles programmatically","inLanguage":"en-US","isPartOf":{"@id":"https:\/\/www.garysieling.com\/blog\/#website"},"breadcrumb":{"@id":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/#breadcrumblist"},"author":{"@id":"https:\/\/www.garysieling.com\/blog\/author\/gary\/#author"},"creator":{"@id":"https:\/\/www.garysieling.com\/blog\/author\/gary\/#author"},"datePublished":"2016-08-22T01:06:29+00:00","dateModified":"2016-08-22T01:06:29+00:00"},{"@type":"WebSite","@id":"https:\/\/www.garysieling.com\/blog\/#website","url":"https:\/\/www.garysieling.com\/blog\/","name":"Gary Sieling","description":"Software Engineer","inLanguage":"en-US","publisher":{"@id":"https:\/\/www.garysieling.com\/blog\/#organization"}}]},"og:locale":"en_US","og:site_name":"Gary Sieling - Software Engineer","og:type":"article","og:title":"Extracting the text from a Wikipedia article - Gary Sieling","og:description":"How to extract text content from Wikipedia articles programmatically","og:url":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/","article:published_time":"2016-08-22T01:06:29+00:00","article:modified_time":"2016-08-22T01:06:29+00:00","twitter:card":"summary_large_image","twitter:title":"Extracting the text from a Wikipedia article - Gary Sieling","twitter:description":"How to extract text content from Wikipedia articles programmatically"},"aioseo_meta_data":{"post_id":"4883","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":"default","schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"limit_modified_date":false,"created":"2023-02-04 17:04:28","updated":"2026-07-06 02:11:54","ai":null,"breadcrumb_settings":null,"seo_analyzer_scan_date":null},"aioseo_breadcrumb":"<div class=\"aioseo-breadcrumbs\"><span class=\"aioseo-breadcrumb\">\n\t\t\t<a href=\"https:\/\/www.garysieling.com\/blog\" title=\"Home\">Home<\/a>\n\t\t<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\t\t\t<a href=\"https:\/\/www.garysieling.com\/blog\/category\/how-to\/\" title=\"How-To\">How-To<\/a>\n\t\t<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\t\t\tExtracting the text from a Wikipedia article\n\t\t<\/span><\/div>","aioseo_breadcrumb_json":[{"label":"Home","link":"https:\/\/www.garysieling.com\/blog"},{"label":"How-To","link":"https:\/\/www.garysieling.com\/blog\/category\/how-to\/"},{"label":"Extracting the text from a Wikipedia article","link":"https:\/\/www.garysieling.com\/blog\/extracting-text-wikipedia-article\/"}],"amp_enabled":true,"_links":{"self":[{"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/posts\/4883"}],"collection":[{"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/comments?post=4883"}],"version-history":[{"count":0,"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/posts\/4883\/revisions"}],"wp:attachment":[{"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/media?parent=4883"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/categories?post=4883"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.garysieling.com\/blog\/wp-json\/wp\/v2\/tags?post=4883"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}