#!/usr/bin/env python3
# -*- coding: utf-8 -*-
"""probe_qdndz5.py —— 定位正文 URL 被切坏的根因（<a> 无闭合？）"""
import re

import requests

requests.packages.urllib3.disable_warnings()
UA = ("Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 "
      "(KHTML, like Gecko) Chrome/124.0 Safari/537.36")
H = {"User-Agent": UA}

D = "https://www.qdndz.gov.cn/zwgk/zdlygk/sthj/hjzfjg/202609/t20260922_90929865.html"
r = requests.get(D, headers=H, timeout=30, verify=False)
r.encoding = "utf-8"
h = r.text

i = h.find('class="Article_Con')
s = h.rfind("<div", 0, i)
body = h[s:s + 12000]
print("=== 正文容器原始 HTML（含 mee.gov.cn 那一段，前后 1500 字符）===")
j = body.find("mee.gov.cn")
print(body[max(0, j - 700):j + 900])
print()
print("=== 该正文片段里 <a 与 </a> 计数 ===")
print("  <a :", body.count("<a "), "| </a>:", body.count("</a>"))
print()
print("=== 所有 <a ... > 开标签（前 12）===")
for m in list(re.finditer(r"<a\b[^>]*>", body))[:12]:
    print("  ", m.group(0)[:150])
print()
print("=== 所有 </a> 位置与前面的文本 ===")
for m in list(re.finditer(r"</a>", body))[:12]:
    print("  ...", re.sub(r"\s+", " ", body[max(0, m.start() - 90):m.end()])[-120:])
