"""将 crawl_cnjf_hjgs 的数据从 crawler_results.db 推送到 search.db"""
import sys, sqlite3, re, os, json, subprocess
sys.path.insert(0, "/root/gov_crawler")
from crawler_lib import push_to_searchdb

# 读取 crawler_results.db 中 cnjf 的数据
db = sqlite3.connect("/root/gov_crawler/crawler_results.db")
db.row_factory = sqlite3.Row
rows = db.execute("""
    SELECT cr.*, cs.name as site_name
    FROM crawl_results cr
    JOIN crawl_sites cs ON cr.site_id = cs.id
    WHERE cs.domain = 'www.cnjf.com'
""").fetchall()
db.close()

print(f"从 crawler_results.db 读取: {len(rows)} 条")

items = []
for r in rows:
    items.append({
        "site_name": "建峰集团-环境公示",
        "source_url": r["url"],
        "url": r["url"],
        "title": r["title"],
        "pub_date": r["publish_date"],
        "summary": r["summary"],
        "content": r["content"],
        "category": "环境公示",
        "tags": "",
        "attachments": "",
        "industry": "环境公示",
    })

if items:
    push_to_searchdb(items, batch_label="cnjf_hjgs")
    print(f"\n推送完成: {len(items)} 条")
else:
    print("无新数据")

# 验证
db2 = sqlite3.connect("/mnt/data/search.db")
count = db2.execute("SELECT COUNT(*) FROM gov_raw WHERE site_name='建峰集团-环境公示'").fetchone()[0]
fts_count = db2.execute("SELECT COUNT(*) FROM gov_search WHERE site_name='建峰集团-环境公示'").fetchone()[0]
db2.close()
print(f"\n验证: gov_raw={count}条, gov_search={fts_count}条")
