#!/usr/bin/env python3
import re, subprocess
from bs4 import BeautifulSoup

url = "http://www.sdsx.gov.cn/channel_t_273_15736/"
result = subprocess.run(["curl", "-sL", "--max-time", "15", "-H", "User-Agent: Mozilla/5.0", url],
    capture_output=True, text=True, timeout=30)
html = result.stdout
soup = BeautifulSoup(html, "html.parser")

# Find ALL ul structures
for i, ul in enumerate(soup.find_all("ul")):
    lis = ul.find_all("li")
    doc_links = [li.find("a", href=re.compile(r"doc_")) for li in lis]
    doc_links = [a for a in doc_links if a]
    if doc_links:
        print(f"UL[{i}]: {len(doc_links)} doc links")
        for a in doc_links[:3]:
            print(f"  href={a['href']} title={a.get_text(strip=True)[:40]}")
            # Check parent for span
            parent = a.find_parent("li") or a.find_parent()
            spans = parent.find_all("span")
            if spans:
                print(f"  spans: {[s.get_text(strip=True) for s in spans[:3]]}")
    elif len(lis) >= 3:
        # Check if links contain doc_ in some form
        for li in lis[:3]:
            a = li.find("a")
            if a:
                print(f"UL[{i}] li: href={a['href'][:50]} text={a.get_text(strip=True)[:30]}")
