#!/usr/bin/env python3
import requests, re, json

url = "https://www.jinjiang.gov.cn/ztzl/lhzt/lyxx/sthj/"
headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"}
r = requests.get(url, timeout=30, headers=headers)
html = r.text

# Find the area around 'leftList'
idx = html.find("leftList")
if idx > 0:
    print("=== around leftList ===")
    print(html[max(0,idx-300):idx+500])

print("\n=== LIST DIV patterns ===")
for m in re.finditer(r'<div[^>]*class=["\']?list[^>]*>', html, re.I):
    start = max(0, m.start()-50)
    end = min(len(html), m.end()+200)
    print("LIST DIV:", html[start:end])
    print("---")

print("\n=== AJAX patterns ===")
for m in re.finditer(r'url|ajaxUrl|dataUrl|apiUrl|loadUrl|getList', html, re.I):
    start = max(0, m.start()-30)
    end = min(len(html), m.end()+100)
    snippet = html[start:end]
    if len(snippet) > 10:
        print(snippet)
        print("---")

print("\n=== Searching for sthj/ subdir pattern ===")
# Look for any links that reference the current directory
for m in re.finditer(r'(sthj/[^"\']*)', html):
    print(m.group(1))

print("\n=== All <a> with 5-80 char text ===")
for m in re.finditer(r'<a[^>]*>([^<]{5,80})</a>', html):
    print(m.group(1)[:60])

print("\n=== Content divs ===")
for m in re.finditer(r'<div[^>]*(?:id|class)=["\']?([^"\'>\s]*)["\']?[^>]*>', html):
    c = m.group(1)
    if any(x in c.lower() for x in ['content','main','right','center','list','article','news','con']):
        start = m.start()
        print(f"DIV: {c} -> {html[start:start+150]}")
