import sys
sys.path.insert(0, "/root/gov_crawler")

from crawl_cnjf_hjgs import CnjfHjgsCrawler
from bs4 import BeautifulSoup
import re

c = CnjfHjgsCrawler("cnjf-test6", "www.cnjf.com", "https://www.cnjf.com", sync_delay=0.05)
c.max_pages = 1
c.ensure_site()

html = c.http_get("https://www.cnjf.com/aspx/ch/dutylist.aspx?classid=26")
soup = BeautifulSoup(html, "html.parser")

count = 0
for a in soup.find_all("a", href=re.compile(r"show\.aspx\?")):
    href = a.get("href", "")
    id_m = re.search(r"[?&]id=(\d+)", href)
    if not id_m:
        continue
    detail_id = id_m.group(1)
    raw = a.get_text(strip=True)
    clean_title = re.sub(r"^\d{4}\s?\d{2}-\d{2}\s+", "", raw).strip()
    print(f"id={detail_id} title=[{clean_title[:50]}]")
    count += 1
    if count >= 3:
        break

print(f"Found: {count} items")
