import json, re

for fname, label in [('taixing_api.json','p1'),('taixing_p2.json','p2')]:
    with open(f'/root/gov_crawler/{fname}') as f:
        data = json.load(f)
    html = data['data']['html']
    # Find all td content after links
    texts = re.findall(r'href="([^"]+)"[^>]*title="([^"]*)"[^>]*>([^<]+)</a>', html)
    print(f'\n=== {label} ({len(texts)} links) ===')
    for href, title, text in texts[:5]:
        print(f'  {href.split("/")[-1]} -> {text[:50]}')
    pagi = re.search(r'pageNo="(\d+)"', html)
    if pagi:
        print(f'  pageNo={pagi.group(1)}')
    # Find dates
    dates = re.findall(r'>(\d{4}-\d{2}-\d{2})<', html)
    print(f'  dates: {dates[:3]}')
