🔧注意力工坊 注意力工坊 · 第1期

在用 AI 处理工作文件之前,先给它打个码

· 阅读约 5 分钟

「注意力工坊」· 第1期

一个 370 行的本地脚本,让你在不暴露敏感信息的前提下,放心把 AI 用在工作里

用 AI 处理工作文件,现在大家都有安全和隐私意识,不太会直接在网页对话框中发给大模型。最近很多朋友在问:如果在本地安装了Claude Code 或****小龙虾,在自己电脑上跑,我的文件是不是就不会发给 Anthropic 的服务器了?

答案是否定的。

你每发一条消息,数据是这样走的:

你的电脑 互联网 模型服务器 │ │ │ ├─ Claude Code 读取你的文件 │ │ ├─ 组装成提示词 │ │ ├─ 加上对话历史 │ │ ├─ 加上系统指令 │ │ │ │ │ └────────── HTTP POST ──────────►│ │ 你的文件内容 │ │ 你的对话记录 │ │ 你的项目结构 ──────►│ │ │ │ │ 模型读到了你的 │ │ 每一个字 │ │ │ │◄─── 返回推理结果 ──────┤ │ │ │ Claude Code 收到回复 │ │ ├─ 模型说”执行 ls” → 在你本地跑 │ │ ├─ 模型说”改文件” → 在你本地写 │ │

Agent 框架在你本地。但模型推理在云端。你的文件内容会被组装成提示词,发给模型服务器。意味着你发给 agent的每一个字,或者让agent读取的每一个文件,模型都看到了。

所以我每次把一个文件拖进 AI 对话框之前,会快速过一遍:这个文件里有没有敏感信息,我的信息?单位名称?内部的项目代号?

以前我也是自己手动改完。但改一个文件还好。五个文件就烦了。十份合同——算了,不找 AI 了,自己加班。

但手动打码太累了。感觉回到没有AI 的时代——自己一行一行找、一条一条改。这个是反效率的。

所以我写了一个脚本。在本地跑。

370 行 Python。做的事情很简单:

扫描文件 → 识别公司名、人名、手机号、身份证、邮箱、地址 → 全部替换成 [公司_1]、[人名_2] 这样的占位符。

然后你把打码版发给 AI 处理。处理完了,脚本再把占位符换回原名。

全程只有打码版离开过你的电脑。映射表——占位符和真名的对照——藏在 ~/.mask_maps/ 里,不跟文件走。

自动识别六类:

手机号。身份证。邮箱。公司名。人名。地址。

也支持你自己加词。

Word、PPT、Excel 会自动转成纯文本再处理。不用手动另存。

但它不是完美的。特别短的名字、英文名、带生僻字的名称可能漏掉。保险起见最后再花点时间复核一下。

怎么用。

三步。打开终端,复制粘贴。

第一步,脱敏。

python3 mask.py 工作文件.docx -o 脱敏版.md

跑完目录里多了一个 脱敏版.md。公司名变成 [公司_1],人名变成 [人名_2]。

第二步,发给 AI。

把脱敏版拖进 Claude Code 或任何 AI 工具。该分析分析,该改写改写。模型看到的全是占位符。

第三步,还原。

python3 mask.py —unmask 脱敏版.md -m ~/.mask_maps/工作文件_mapping.json -o 终稿.md

终稿.md 就是 AI 处理完的真实版本。从头到尾,原始文件没被动过。

一个文件这样处理没问题。

但现实中,很多时候可能是一整个文件夹。

比如十几份合同、五六个版本的 PPT。在同一个文件夹里,一个一个手动跑命令,又回到手动打码的累了。

所以脚本也支持批量处理。

第一步,进文件夹,建个脱敏目录。

cd ~/你的文件夹 mkdir -p 脱敏

第二步,按文件类型批量跑。

Markdown 文件:

for f in .md; do echo ”>>> $f” python3 ~/mask.py “$f” -o “脱敏/${f%.}_脱敏.md” done

Word 文件:

for f in *.docx; do echo ”>>> $f” python3 ~/mask.py “$f” -o “脱敏/${f%.docx}_脱敏.md” done

PPT 文件:

for f in *.pptx; do echo ”>>> $f” python3 ~/mask.py “$f” -o “脱敏/${f%.pptx}_脱敏.md” done

每条命令复制粘贴回车,等跑完再贴下一条。

跑完之后,目录长这样:

你的文件夹/ ├── 合同A.docx ← 原文件,没动过 ├── 合同B.docx ← 原文件,没动过 ├── 年度总结.pptx ← 原文件,没动过 ├── … ├── 脱敏/ ← 新生成的 │ ├── 合同A_脱敏.md ← 只含占位符 │ ├── 合同B_脱敏.md │ └── 年度总结_脱敏.md

脱敏/ 文件夹里全是占位符。放心把这个文件夹整个拖给 AI。

处理完之后,批量还原。

cd ~/你的文件夹/脱敏 mkdir -p 还原

for f in *_脱敏.md; do base=”${f%_脱敏.md}” python3 ~/mask.py —unmask “$f”
-m ~/.mask_maps/”${base}_mapping.json”
-o “还原/${base}_还原.md” done

脱敏/还原/ 里的文件就是最终版。占位符全部换回真名。

所有映射表都在 ~/.mask_maps/ 下面。处理完了可以手动删掉:

ls ~/.mask_maps/ # 看看有哪些 rm ~/.mask_maps/*.json # 确认不用了再删

脚本放在微云上了。关注并后台回复「脱敏」自取。

有 Python 就能跑。没有的话装一个,五分钟的事。🧭 认知导航

你刚读完的这篇:「注意力工坊」第1期。一个 370 行的 Python 脚本,帮你把敏感信息锁在本地。

想理解这期背后的思考

→ 根文章:大家好,我是yoyo。这是「注意力进化论」——在 AI 时代,我决定做自己认知的构建者

→ 注意力雷达 #2:Fable 5 屠榜了,但最值得关注的不只是模型本身Harness 在本地,推理在云端 → 注意力解码#1:黄仁勋两小时演讲,本质上是一场注意力工程——看穿叙事”的能力

想获得脚本

→ 关注本号,后台回复「脱敏」获取完整脚本下载

「注意力进化论」 是一个关于如何分配你最稀缺资源的实验。

「注意力解码」拆叙事策略

「注意力雷达」扫行业全景

「注意力深读」消化好书长文

「注意力工坊」动手做工具