#!/usr/bin/env python3
import sys, re, subprocess, json
from bs4 import BeautifulSoup

url = "http://www.tuoxian.gov.cn/zfxxgkzl/zfbmxxgk/gwh/gyyqgwh/zfxxgk/fdzdgknr_22198/?gk=3"
result = subprocess.run(["curl", "-sL", "--max-time", "15", "-H", "User-Agent: Mozilla/5.0", url],
    capture_output=True, text=True, timeout=30)
html = result.stdout
soup = BeautifulSoup(html, "html.parser")

# Print all links in xxgkItemList with full href
div = soup.find("div", class_="xxgkItemList")
if div:
    for a in div.find_all("a"):
        if a.get("href") and a.get("href") != "javascript:;":
            print(f"  {a['href']} | {a.get_text(strip=True)}")
    print("--- JS links ---")
    for a in div.find_all("a", href="javascript:;"):
        print(f"  onclick={a.get('onclick','')[:80]} | {a.get_text(strip=True)}")
        print(f"  data-*: ", {k:v for k,v in a.attrs.items() if k.startswith("data")})

# Check for any API endpoints
for script in soup.find_all("script"):
    content = script.string or ""
    for m in re.finditer(r'(get|post|ajax|load|url)[:\s\'"]+.*?api[\w/]+', content, re.I):
        print(f"API in script: {m.group()[:80]}")
    for m in re.finditer(r'["\'](https?://[^\s"\']*?api[^\s"\']*?)["\']', content, re.I):
        print(f"API URL: {m.group(1)[:100]}")

# Look at the raw HTML file for the list page URL pattern
text = html
for m in re.finditer(r'(?:href|src)=["\']([^"\']*?page[^"\']*?page[^"\']*?)["\']', text, re.I):
    print(f"Paging: {m.group(1)}")
