import json, re

with open('/root/gov_crawler/taixing_api.json') as f:
    data = json.load(f)

html = data['data']['html']

# Search for pagination links
pagis = re.findall(r'<a[^>]*page[^>]*>', html, re.IGNORECASE)
print('Pagination links found:', len(pagis))
for p in pagis[:20]:
    print(p)

# Find any page indicators
page_nums = re.findall(r'(\d+)\s*/\s*(\d+)\s*页', html)
print('Page indicators:', page_nums)

# Look for total records
totals = re.findall(r'[共计].*?(\d+).*?[条篇]', html)
print('Total counts:', totals)

# Print last 1000 chars
print('\n--- Last 1000 chars ---')
print(html[-1000:])
