import json, re

for fname, label in [('taixing_p2a.json','p2a')]:
    with open(f'/root/gov_crawler/{fname}') as f:
        data = json.load(f)
    html = data['data']['html']
    texts = re.findall(r'href="([^"]+)"[^>]*>([^<]+)</a>', html)
    print(f'\n=== {label} ({len(texts)} links) ===')
    for href, text in texts[:5]:
        print(f'  {href.split("/")[-1]} -> {text[:50]}')
    pagi = re.search(r'pageNo="(\d+)"', html)
    if pagi:
        print(f'  pageNo={pagi.group(1)}')
    dates = re.findall(r'>(\d{4}-\d{2}-\d{2})<', html)
    print(f'  dates: {dates[:3]}')
    # Print first differences
    start = html.find('art_')
    if start > 0:
        print(f'  first art link near: {html[start:start+80]}')
