plaintext
pip install newspaper3k
python
import newspaper
url = 'https://example.com'
article = newspaper.Article(url)
article.download()
article.parse()
plaintext
pip install lxml
python
import newspaper
from lxml import etree
url = 'https://example.com'
article = newspaper.Article(url)
article.download()
article.parse()
html = etree.HTML(article.html)
data = html.xpath('//div[@class="news-content"]/p/text()')
for item in data:
print(item)