基于「本地大模型 + 正则规则」双重检查的敏感信息识别与脱敏工具,快速定位技术报告中的敏感内容。
科研课题、工程项目、计划专项的名称、编号或文号
高校、科研院所、公司、机关事业单位、部队等机构名称
性能指标、规格数值、型号、容量、精度、功率、经费金额等
手机号、身份证号、邮箱、银行卡号、地址等
内网 IP、内部代号、URL 等
正则规则快速扫描 + 本地大模型语义识别,结果自动合并去重,正则漏掉的内容由大模型兜底。
支持直接加载本地 GGUF 模型(llama-cpp-python),也支持连接 LM Studio / Ollama 服务,数据不出本机。
敏感片段在原文中按类别着色高亮,点击结果行即可跳转定位,一目了然。
支持【类别】占位、星号遮盖、自定义标记三种脱敏模式,可复制或保存脱敏结果。
内置 20+ 条正则规则,类别、严重级别、是否启用均可在图形界面中增删改。
检查在后台线程执行,界面不卡顿,支持随时中止;长文档自动分段送入模型。
粘贴报告文本或载入 .txt / .md 文档,自动兼容 UTF-8 / GBK 编码。
先跑正则规则,再加载本地大模型逐段分析,汇总到结果表并高亮定位。
按类别、来源、严重级别查看每条发现,点击任意一条在原文中定位。
一键生成脱敏预览,复制到剪贴板或另存为新的文档。
pip install -r requirements.txt 并安装 llama-cpp-python,即可运行 python main.py。
默认模型为本地 Qwen3.5-9B GGUF 文件,路径可在设置中调整。