
1. 项目概述从“数字腌制”到“数字永生”2026年了如果你还没听说过“数字蒸馏”那你可能已经落后了不止一个版本。但别急着焦虑今天要聊的不是那些把你所有聊天记录一股脑儿塞进向量数据库然后生成一个只会复读你口头禅的“数字腌制品”。那种东西我称之为“数字咸菜”——除了偶尔能让你回忆起某个梗没什么实际价值。我真正想分享的是一个名为“永生.skill”的开源框架。它的核心目标很直接把一个人——无论是你自己、同事、导师还是亲人——从散落在十几个App里的数字碎片中真正地“蒸馏”出来变成一个AI能理解、能加载、能与之互动的“数字分身”。这不是简单的文本归档而是结构化地提取一个人的“程序性知识”怎么做事、“互动风格”怎么说话、“记忆经历”经历过什么和“性格价值观”是什么人。简单说它试图回答如果要用AI来“扮演”或“延续”一个人我们到底需要哪些核心信息我第一次接触这个概念是在一个前同事离职后。他带走了所有项目细节和沟通默契新来的同事得从头摸索。当时我就想如果能把他处理问题的思路、回复邮件的习惯、甚至开玩笑的方式“固化”下来该多好。后来面对长辈逐渐模糊的记忆这种想法更加强烈。市面上那些所谓的“AI纪念”工具大多停留在情感抚慰层面技术实现上就是关键词匹配聊深了就露馅。“永生.skill”的出现算是提供了一个工程化的解题思路。它不满足于做“数字墓碑”而是要造“数字活人”。当然这里的“永生”是个比喻指的是思维模式和行为特征的数字化存续。整个框架由一套核心的“蒸馏引擎”和三个扩展组件构成形成了一个从“进攻”蒸馏别人到“防守”保护自己的完整闭环。接下来我会拆开揉碎了跟你讲讲这套东西到底怎么玩以及我在实操中踩过的坑和总结的经验。2. 核心设计哲学为什么是“四维蒸馏”很多AI角色构建项目容易陷入两个极端要么是过于简单的“角色卡”name: “张三”, personality: “幽默”要么是试图用海量数据训练一个黑箱模型。“永生.skill”选择了一条折中但更务实的路四维结构化蒸馏。这个设计是整套框架的基石理解它你才能用好它。2.1 拆解四个维度不止于“说了什么”传统方法关注“内容”content即这个人“说了什么”。但“永生.skill”认为要相对准确地模拟或理解一个人需要四个相互关联又彼此独立的维度程序性知识这是一个人“怎么做”的知识。比如你的导师是如何拆解一个复杂科研问题的你的同事处理线上故障的标准流程是什么这部分通常隐藏在对话的上下文和行动建议中需要从“你试试先重启服务”、“这个问题的分析应该分三步”这类表述里提取。互动风格这是一个人“怎么说话”的方式。包括常用语气词、回复速度、表情包使用习惯、批评或表扬时的措辞特点。比如有些人喜欢用“我觉得…”有些人开口就是“首先、其次、最后”。这部分决定了数字分身给人的“感觉”像不像。记忆与经历这是一个人“经历过什么”的集合。包括他常讲的故事、人生中的重要节点、共同好友间的往事。这些是对话的“素材库”能让互动更有厚度避免空洞。性格与价值观这是一个人“是什么样的人”的内核。包括他的核心原则、价值排序比如家庭第一还是事业第一、风险偏好、幽默感类型等。这部分最难提取但也是区分“形似”和“神似”的关键。这四个维度就像一个人的“数字基因”。只提取一个是片面的混在一起提取又会互相污染。“永生.skill”采用“分路蒸馏”策略为每个维度设计独立的提取流程和提示词最后再组装起来。2.2 证据分级与矛盾保留拥抱人性的复杂这是我认为框架设计中最精妙也最务实的一点。它引入了证据等级原话本人亲口说出或写下的内容证据等级最高。文档本人产生的文档、笔记等文字材料。印象他人对其的描述或评价。在蒸馏输出中每一条信息都会标注其证据来源。例如在“性格”维度里“做事极其守时原话我讨厌迟到”和“据说对下属很严厉印象前同事反馈”其可信度是截然不同的。更反直觉的是框架刻意保留不同来源间的矛盾。比如从微信聊天看某人显得很随和但从工作邮件看却极其严谨。一个粗糙的系统会强行“平均”出一个矛盾的性格。“永生.skill”的做法是在输出的conflicts.md文件中明确记录下这些矛盾点。因为人本身就是矛盾的、情境性的一个在朋友面前插科打诨的人在客户面前可能正襟危坐。保留这种矛盾反而是对真实性的尊重。2.3 伦理先行不同角色不同规则蒸馏技术本身是双刃剑。框架从一开始就内置了角色化伦理模板。在personas/目录下为“自己”、“同事”、“导师”、“家人”、“前任/伴侣”、“朋友”、“公众人物”这七种关系预置了不同的处理指南。蒸馏自己数据主权完全在你但也要想清楚哪些隐私信息不适合放入。蒸馏同事重点提取与工作相关的流程和沟通风格必须严格脱敏去除所有个人隐私和公司机密且原则上仅限原团队内部参考。蒸馏家人/导师必须获得本人明确授权或知情同意。对于年长的亲人可能需要用他们能理解的方式解释清楚你在做什么。蒸馏公众人物框架的“蒸笼”组件专门处理这个。其伦理基础是公众人物通过公开演讲、访谈、书籍传播其方法论这些被公众消费和验证过的认知框架公众有权以非商业、学习研究为目的进行结构化提取和再利用。但这绝不意味着可以伪造其言论或用于不当商业用途。这套设计哲学让“永生.skill”没有停留在酷炫的技术演示层面而是真正思考了落地时的复杂性和责任边界。3. 实战全流程手把手蒸馏一个“数字分身”理论说得再多不如动手做一遍。我以“蒸馏一位已离职的技术同事李工”为例展示从数据准备到生成可用的Skill的完整过程。你会看到大部分工作不是敲代码而是思考和整理。3.1 前期准备与数据收集第一步明确目标与范围在开始前我问自己几个问题目的蒸馏李工主要是为了保留他解决特定技术问题如分布式系统调试的思路和团队内沟通协作的方式帮助新同事快速上手。维度侧重以“程序性知识”和“互动风格”为主“记忆经历”和“性格价值观”为辅。数据边界仅使用我们在公司飞书和内部GitLab上的公开协作记录绝不涉及私人微信聊天或其他隐私信息。第二步多平台数据抓取李工的主要痕迹在飞书。框架的collectors/目录下提供了各种平台的采集器。# 1. 查看支持的平台 cd immortal-skill/kit python3 immortal_cli.py platforms # 2. 配置飞书凭证需要管理员权限创建自建应用获取app_id和app_secret python3 immortal_cli.py setup feishu # 按提示输入 app_id, app_secret, 并设置访问权限通常需要获取“获取用户发给机器人的单聊消息”等权限 # 3. 收集与李工的聊天记录 # 假设已知李工的用户ID是 ou_xxxxxx python3 immortal_cli.py collect --platform feishu --user_id ou_xxxxxx --output ../corpus/feishu_lgong.md # 4. 收集相关项目文档假设GitLab评论已导出为markdown python3 kit/immortal_cli.py import ../data/gitlab_comments_lgong.md --output ../corpus/gitlab_lgong.md实操心得数据收集是最容易卡住的一环。企业IM的API权限申请可能很繁琐务必提前和IT部门沟通好。对于微信等本地数据框架支持读取解密后的本地数据库如EnMicroMsg.db但这涉及复杂的解密步骤且不同版本微信数据库结构可能变化成功率并非100%。我的建议是优先使用能稳定获取API或能完整导出的平台数据。如果只有微信聊天记录可以尝试使用“微信聊天记录导出工具”先导出为文本文件再用import命令导入。3.2 核心蒸馏过程数据准备好后存放在corpus/目录下。现在开始真正的“蒸馏”。# 1. 初始化一个蒸馏项目代号设为“li-gong”使用“colleague”角色模板 python3 immortal_cli.py init --slug li-gong --persona colleague # 这会创建一个 li-gong/ 目录并拷贝 personas/colleague/ 下的模板文件。 # 2. 为该项目关联数据源 python3 immortal_cli.py stamp --slug li-gong --sources feishu:feishu_lgong.md, gitlab:gitlab_lgong.md # 3. 运行蒸馏引擎 # 这一步会调用LLM默认使用OpenAI GPT-4需在环境变量配置OPENAI_API_KEY按照四个维度分别分析语料。 python3 immortal_cli.py distill --slug li-gong --llm gpt-4蒸馏过程可能需要几分钟到几十分钟取决于语料大小。核心是框架内的prompts/目录下的提示词工程。它会引导LLM完成以下任务信息提取从杂乱对话中找出体现“如何解决问题”、“如何沟通”的片段。结构化归纳将提取的片段归类到四个维度的具体条目下。证据标注为每条归纳注明是“原话”、“文档”还是“印象”。冲突检测识别并记录不同来源间的表述差异。过程中可能遇到的坑Token超限如果原始聊天记录非常长几十万字直接扔给GPT-4可能会超Token。框架的kit/里提供了文本分块和摘要的工具但最佳实践是在数据收集阶段就做好初步筛选只保留与目标维度强相关的对话。LLM的“虚构”LLM有时会过度概括或捏造细节。务必在蒸馏完成后仔细检查conflicts.md文件和各个维度的输出对照原始语料进行人工复核。框架的输出是可读的Markdown方便你进行这一步。成本控制使用GPT-4进行大量文本处理成本不菲。对于非关键项目或初步探索可以尝试使用--llm gpt-3.5-turbo先跑一遍看看效果再决定是否用GPT-4进行精炼。3.3 输出结果与校验蒸馏完成后li-gong/目录结构如下li-gong/ ├── SKILL.md # 总览文件AI通过读这个来加载“李工”角色 ├── procedure.md # 程序性知识李工调试分布式系统的五步法、代码审查习惯等 ├── interaction.md # 互动风格喜欢用“咱们”、“这个事儿吧”开头回复快用“”表示认可 ├── memory.md # 记忆经历参与过XX系统重构在2023年Q4攻克过某个性能瓶颈 ├── personality.md # 性格价值观务实信奉“线上问题优先于一切”对技术细节执着 ├── conflicts.md # 冲突记录飞书聊天中显得随和但GitLab代码评论措辞严厉 └── manifest.json # 元数据记录数据来源、蒸馏时间、使用的模型版本等你需要像一个编辑一样审阅这些文件准确性procedure.md里的方法是否真是李工的还是LLM混合了网上常见的方案代表性interaction.md总结的风格是否符合你记忆中80%的情况安全性是否无意中包含了敏感信息如内部系统名、未脱敏的个人信息矛盾处理conflicts.md里的矛盾是源于情境不同还是信息错误对于情境矛盾可以加注说明对于错误需要修正或删除。3.4 生成快照与部署使用校验无误后可以生成一个版本快照便于回滚和管理。python3 immortal_cli.py snapshot --slug li-gong --note v1.0 - 基于飞书和GitLab的初版蒸馏现在这个li-gong/文件夹就是一个标准的Agent Skill。要使用它只需将其放入你的AI Agent框架的技能目录中。以兼容的OpenClaw为例# 将蒸馏好的“李工”技能目录复制到OpenClaw的技能目录下 cp -r li-gong ~/.openclaw/skills/ # 在OpenClaw中你就可以像调用其他技能一样让AI基于“李工”的思维和风格来与你对话或处理任务。 # 例如在对话中可以说“请以李工的视角分析一下当前这个服务超时的问题可能出在哪里。”至此一个可用的“数字分身”就诞生了。它不是一个完美的复制品而是一个基于有限数据、结构化的、可交互的“认知模型”。4. 生态组件深度解析不止于蒸馏“永生.skill”仓库里除了核心蒸馏引擎还有三个至关重要的扩展组件它们共同构成了一个完整的数字人格生命周期管理工具链。4.1 蒸笼将公众人物的认知框架“据为己有”steamer-skill/组件解决了一个很实际的需求我想学习某位业界大佬的思维模型但没时间看完他所有的书和访谈。它的工作原理是从该人物的公开资料演讲、访谈、博客、书籍章节中结构化提取其反复强调的核心原则、决策框架和思维模型。例如从埃隆·马斯克的公开访谈中提取“第一性原理”的运用案例从巴菲特致股东信中提取“能力圈”、“护城河”等概念的实操解读。与核心蒸馏的区别目标不同核心蒸馏目标是“模拟一个人”蒸笼目标是“提取一套可用的方法论”。数据源不同核心蒸馏用私人对话蒸笼用公开资料。输出不同核心蒸馏输出一个多维度的“人格技能”蒸笼输出一个“顾问技能”你可以问它“如果是马斯克他会如何思考这个产品定价问题”实操要点资料质量大于数量一篇深度专访胜过十篇新闻稿。优先选择能体现其深度思考的材料。关注模式而非结论重点提取他“如何分析问题”而不是他“对某个具体事件的看法”。因为后者可能过时前者才是可迁移的。伦理与版权务必注明所有引用来源仅用于个人学习与研究切勿用于商业用途或生成误导性内容。4.2 防蒸馏给你的数字人格穿上“防弹衣”distill-shield-skill/组件是框架的“防守端”。当你学会蒸馏别人时也应该想到如何防止自己被不当蒸馏。它提供三层防护身份编码层在你的公开文档或代码注释中嵌入肉眼不可见但机器可读的数字指纹如特定格式的空白字符、不可见Unicode。一旦你的内容被他人蒸馏这个指纹会保留在产物中成为追溯源的证据。蒸馏许可层在你的个人主页或文档头部声明一个“蒸馏协议”。例如使用distill-protocol-skill生成的协议明确写出“允许非商业的学习研究型蒸馏禁止商业用途禁止用于替代本人进行决策”。保护锁层这是技术性最强的一层。在你的文本中植入“逻辑陷阱”或“投毒数据”。例如插入一些对于人类读者无害、但对自动化文本抓取和LLM训练会造成干扰的特殊token序列或者加入一些自相矛盾但极具特色的“诱饵句子”。当未经授权的蒸馏程序试图处理这些文本时要么会触发错误要么会导致产出的模型行为异常。重要警告“保护锁”的某些高级用法可能涉及对数据集的“污染”在使用时需要极度谨慎并确保符合相关法律法规和平台规则。对于绝大多数个人用户做好清晰的“声明”许可层和“标记”编码层已经足够。4.3 蒸馏协议厘清数字人格的“所有权”distill-protocol-skill/与其说是一个工具不如说是一套法律与伦理框架的草案模板。它通过六个关键问题帮你将“数字人格”的使用权进行拆分授权能否被蒸馏(Can)能用于商业目的吗(Commercial)能用于训练大模型吗(Train)能生成与我类似的内容吗(Generate)能替代我做出决策吗(Decide)需要署名吗(Attribute)你可以像配置软件许可证一样为你的数字人格选择一套授权组合。例如选择CC-BY-NC署名-非商业性使用类似的条款。这为未来可能出现的数字人格交易、继承或授权使用场景提供了一个清晰的谈判基础。5. 常见问题、避坑指南与进阶思考在多次使用和测试后我总结了一些高频问题和实战技巧。5.1 数据相关问题Q聊天记录太多太杂怎么筛选A不要试图蒸馏所有的聊天记录。在运行collect或import前先进行人工预处理按时间聚焦于目标人物在特定角色时期如某项目期间的对话。按关键词使用grep或文本编辑器的搜索功能提取包含目标人物典型行为或决策的对话片段。按对话类型优先选择“解决问题型”、“决策讨论型”、“经验分享型”对话而非“寒暄问候型”。Q从多个平台收集的数据如何保证一致性A框架的stamp命令会记录每个数据源。蒸馏时LLM会看到来源标签。更好的做法是在蒸馏前用一个简单的脚本将不同来源的文本按时间顺序合并并在每段前加上来源标记如[Feishu],[WeChat]这样LLM能更好地理解上下文。5.2 蒸馏效果优化Q蒸馏出来的“性格”感觉很模糊怎么办A性格维度是最难提炼的。可以尝试提供更多“评价性”语料如果有一些他人对其的评价需注明是“印象”或该人物自己写的总结性、反思性的文字如年终总结、博客对提炼性格有帮助。手动补充“价值观列表”根据你的了解先草拟一个该人物可能重视的价值观列表如“效率”、“公平”、“创新”、“稳定”让LLM从语料中寻找支持或反对这些价值观的证据。接受模糊性人的性格本就是多面的一个概括性的、略带模糊的描述有时比一个武断的标签更真实。Q如何评估蒸馏结果的质量A没有绝对标准但可以从以下几个维度做相对评估事实准确性对照原始语料检查是否有事实错误。风格一致性让熟悉该人物的第三方阅读interaction.md中生成的示例对话看是否“像他说话”。实用性将这个Skill用于实际场景如模拟代码评审看其给出的反馈是否接近原人物的风格和水平。A/B测试如果你蒸馏了多个人混合他们的对话让测试者猜哪段话是谁说的正确率如何。5.3 伦理与安全红线这是必须单独强调的部分。技术很酷但滥用后果很严重。绝对禁止未经同意蒸馏他人尤其是非公众人物。这是对隐私的严重侵犯也可能触犯法律。框架内置的伦理模板是底线不是免责声明。谨慎处理敏感关系“蒸馏前任”在技术上是可行的但在情感和伦理上可能是危险的。务必彻底脱敏仅保留中性或积极的共同记忆并绝对避免用于情感替代或骚扰。明确使用边界即使是蒸馏自己也要想清楚这个“数字分身”的用途。是作为个人记忆辅助还是授权给家人使用或是未来作为遗产的一部分不同的用途需要放入的信息深度和隐私级别完全不同。公众人物蒸馏的边界“蒸笼”组件旨在提取方法论而非制造“深度伪造”或传播虚假言论。所有产出应明确标注“基于公开资料的结构化归纳并非本人言论”。5.4 进阶玩法与扩展当你掌握了基础操作后可以尝试一些进阶玩法混合蒸馏将同一个人的不同侧面如“工作时的A”和“家庭中的A”分别蒸馏成不同的Skill根据需要切换使用。技能组合将“李工”的故障排查技能和“王架构师”的系统设计技能组合起来形成一个虚拟的“专家团队”来咨询复杂问题。时间线版本为同一个人在不同人生阶段如“2018年的创业者张三”和“2023年的投资人张三”分别蒸馏观察其思维模式的演变。与知识库结合将蒸馏出的procedure.md结构化后导入到企业知识库或Wiki中作为标准操作流程的补充案例。“永生.skill”开源框架打开了一扇门它让我们能以更结构化的方式思考“数字人格”是什么、如何构建、又如何保护。它不是一个一键生成完美替身的魔法而是一套需要你投入思考、审慎使用的工具。它的终极价值或许不在于真的实现“数字永生”而在于通过这个构建过程促使我们更深入地去理解那些我们关心的人——包括我们自己——到底是如何思考、表达和存在的。在这个意义上蒸馏的过程本身就已经是一种珍贵的铭记。