処理の流れ
① 求人ページ
ハローワークの公開求人ページを対象条件で巡回
② 収集エンジン
Python + Selenium / BeautifulSoup でページ解析・抽出
③ 整形・DB格納
重複排除・正規化のうえ MySQL / PostgreSQL に保存
④ 分析基盤連携
社内BI / ダッシュボード / CSV・API 連携で活用
収集
- Python (requests / Selenium / BeautifulSoup)
- 検索条件(地域・職種・雇用形態)ごとの巡回
- ページ構造の変化を検知するチェック処理
保存
- MySQL / PostgreSQL によるデータ管理
- 求人IDベースの重複判定・差分更新
- 定期バックアップ設計
運用
- スケジューラによる定期自動実行
- 失敗時のリトライ & エラー通知(メール/Slack)
- AWS / GCP どちらの環境にも対応可能
安定稼働のための工夫
- アクセス間隔を制御し、サーバー負荷・アクセス制限に配慮
- ページ構造が変わった際に検知して通知
- 全件再取得ではなく差分収集で処理時間を圧縮
- 処理ログを保存し、進捗・件数を可視化
募集要件との対応
- Pythonによるスクレイピング実務・準ずる開発経験
- HTML/CSS構造の理解とページ解析
- Selenium / BeautifulSoup 使用経験(歓迎条件)
- データベース(SQL)操作経験(歓迎条件)
- クラウド環境(AWS/GCP)での開発・運用(歓迎条件)