"""查找真正需要OCR的PDF — 文字提取不到联系方式的"""
import sys, os, re
sys.path.insert(0, os.path.expanduser("~/gov_crawler/venv/lib/python3.9/site-packages"))

import pymupdf

PDF_DIR = os.path.expanduser("~/Nutstore Files/Downloads_nuc")

PHONE_PAT = re.compile(r'1[3-9]\d{9}')

# 扫描一批PDF，统计哪些没有电话
no_phone_files = []
total = 0

for fname in sorted(os.listdir(PDF_DIR)):
    if not fname.endswith('.pdf'):
        continue
    total += 1
    fpath = os.path.join(PDF_DIR, fname)
    try:
        doc = pymupdf.open(fpath)
        full_text = ''
        for page in doc:
            full_text += page.get_text()
        doc.close()

        phones = PHONE_PAT.findall(full_text)
        if not phones:
            no_phone_files.append((fname, os.path.getsize(fpath)))
    except Exception as e:
        print(f"[ERR] {fname}: {e}")

print(f"\n总计: {total} 个PDF")
print(f"无电话（需OCR）: {len(no_phone_files)} 个")
print(f"\n无电话的文件:")
for fname, size in sorted(no_phone_files, key=lambda x: -x[1])[:20]:
    print(f"  {fname} ({size//1024}KB)")
