import sys, re
sys.path.insert(0, "/root/gov_crawler")
from base_crawler import GovCrawler

c = GovCrawler("t", "www.cnjf.com")
html = c.http_get("https://www.cnjf.com/aspx/ch/dutylist.aspx?classid=26")
print(f"HTML length: {len(html)}")

# Check the actual link pattern
idx = html.find('show.aspx')
if idx >= 0:
    snippet = html[idx:idx+80]
    print(f"Link snippet: {repr(snippet)}")

# Find ALL links with show.aspx
for m in re.finditer(r'href="([^"]*show\.aspx[^"]*)"', html):
    print(f"Link: {m.group(1)}")
    break

# Also check with different pattern
matches = re.findall(r'show\.aspx\?classid=\d+&id=\d+', html)
print(f"Regex matches: {len(matches)}")
if matches:
    print(f"First match: {matches[0]}")
