[Java] 22 スクレイピングによるテキスト取得

スクレイピングでWebサイトのテキストを取得してみました。

開発サイトから入手したjsoupライブラリは外部ライブラリとして設定しました。VScodeの拡張機能”Java Extension Pack”を使います。

プロジェクトを作るまでもない単独ファイルの場合はVScodeが手軽で便利です。

行の先頭にある波カッコが気になるため、全て行末に置いてみました。これだと一見Pythonっぽくなります。

import java.io.IOException;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

public class Scraping {
	public static void main(String[] args) {
		try {
			Document doc = Jsoup.connect("対象サイトのURL").get();
			Elements elements = doc.select("タブ名");

			for (Element element : elements) {
				System.out.println(element.text());}}

		catch (IOException e) {
			e.printStackTrace();}}}

日	月	火	水	木	金	土
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30