Skip to content

GOVBR-MMA discovery #508

GOVBR-MMA discovery

GOVBR-MMA discovery #508

name: GOVBR-MMA discovery
on:
schedule:
- cron: "50 * * * *"
workflow_dispatch:
concurrency:
group: pipeline-trigger
cancel-in-progress: false
jobs:
discover-govbr-mma:
runs-on: ubuntu-latest
timeout-minutes: 20
steps:
- name: Checkout scheduler repository
uses: actions/checkout@v4
- name: Set up Python
uses: actions/setup-python@v5
with:
python-version: "3.13"
cache: pip
cache-dependency-path: requirements-ocr-worker.txt
- name: Install OCR worker dependencies
run: pip install -r requirements-ocr-worker.txt
- name: Run GOVBR-MMA discovery, download, OCR, and submission
run: python scripts/discover_govbr_mma_candidates.py
env:
RENDER_APP_URL: ${{ secrets.RENDER_APP_URL }}
PIPELINE_SECRET: ${{ secrets.PIPELINE_SECRET }}
GOVBR_MMA_MIN_NOTICE_YEAR: "2026"
GOVBR_MMA_MAX_CANDIDATES_PER_RUN: "50"
GOVBR_MMA_MAX_DETAILS_PER_RUN: "20"
SCRAPE_MAX_PDF_BYTES: "15000000"
KREUZBERG_PADDLE_LANGUAGE: "latin"
KREUZBERG_PADDLE_MODEL_TIER: "tiny"
KREUZBERG_USE_GPU: "false"
KREUZBERG_FORCE_OCR_DEFAULT: "false"
KREUZBERG_EXTRACTION_TIMEOUT_SECONDS: "120"
FLAGS_use_mkldnn: "0"
PADDLE_PDX_ENABLE_MKLDNN_BYDEFAULT: "0"