#!/usr/bin/env python3
import re, subprocess
from bs4 import BeautifulSoup

for page in [1, 2, 23]:
    url = "http://www.sdsx.gov.cn/channel_t_273_15736/"
    if page > 1:
        url += "?page=" + str(page)
    
    result = subprocess.run(["curl", "-sL", "--max-time", "15", "-H", "User-Agent: Mozilla/5.0", url],
        capture_output=True, text=True, timeout=30)
    html = result.stdout
    soup = BeautifulSoup(html, "html.parser")
    
    # Count doc_ links
    doc_links = soup.find_all("a", href=re.compile(r"doc_"))
    doc_count = len([a for a in doc_links if len(a.get_text(strip=True)) > 5])
    
    # Find laypage info
    for script in soup.find_all("script"):
        content = script.string or ""
        if "count:" in content:
            m = re.search(r"count:\s*(\d+)", content)
            m2 = re.search(r"curr\s*:\s*(\d+)", content)
            print(f"Page {page}: doc_links={doc_count}, total={m.group(1) if m else '?'}, curr={m2.group(1) if m2 else '?'}")
            break
    else:
        print(f"Page {page}: doc_links={doc_count}, no laypage found")
    
    # First 3 items
    for a in doc_links[:3]:
        text = a.get_text(strip=True)
        if len(text) > 5:
            print(f"  {a['href'][:40]} | {text[:40]}")
