- 团队空间资料进入 AI 知识库前,必须先做范围、权限、敏感信息和版本治理
- 石墨文档导出工具适合做本地资料底座:批量导出、保留目录、多格式归档
- AI 平台不会自动继承石墨权限,上传前要重新定义谁能问、问什么、能看到什么
- 历史版本、评论、协作记录和审批上下文通常不能完整迁移,需要单独留档
- 上线标准不是“文件上传成功”,而是权限、来源、拒答、更新和回滚都能通过测试
石墨团队空间做企业 AI 知识库,推荐先把团队空间当成一个需要治理的数据源:按业务用途圈定目录,按公开、内部、受限、敏感给文档分级;用石墨文档导出工具批量导出 Markdown、PDF、Word、Excel,并保留原始文件夹结构;在本地完成脱敏、去重、版本标记和元数据补充;最后把通过审核的资料上传到 ChatGPT Enterprise、Claude Team/Enterprise、Gemini Notebook、Dify、RAGFlow 或自建 RAG 系统。AI 知识库不会自动继承石墨权限,所以权限治理要在上传前完成。
治理资料依据
NIST AI Risk Management Framework 强调 AI 风险需要被治理、映射、度量和管理;NIST 生成式 AI profile 进一步关注数据隐私、信息完整性和有害输出等风险。参考:NIST AI RMF、Generative AI Profile。OWASP Top 10 for LLM Applications 也将提示注入、敏感信息泄露、供应链和过度代理等列为需要管理的风险。参考:OWASP Top 10 for LLM Applications。这些资料不是石墨官方迁移说明,但适合作为企业知识库治理的风险框架。
为什么企业 AI 知识库要先治理?
个人把几篇文档上传给 AI,可以边用边改;企业把团队空间接入 AI,不能这么粗放。团队空间里通常同时存在客户资料、内部流程、草稿、历史版本、权限共享文档、离职员工遗留资料和临时表格。只要其中一类资料处理不好,AI 知识库就可能出现错误回答、越权泄露、引用过期制度或无法追责。
治理不是为了让流程变慢,而是为了把 AI 知识库变成可维护系统。一个可上线的企业知识库,至少要回答这几个问题:资料从哪里来、谁批准上传、谁能访问、什么时候更新、错误怎么回滚、AI 没依据时是否会拒答。
做AI知识库前,先把团队空间导出权限和目录范围核清楚。
第一步:圈定知识库范围
不要从“导出整个团队空间”开始。先定义知识库要服务的场景:客服问答、销售资料、研发规范、HR 制度、产品手册、交付项目库,还是管理层报告查询。不同场景对应不同资料范围和权限边界。
| 知识库场景 | 可优先导入 | 先排除 |
|---|---|---|
| 客服知识库 | FAQ、售后流程、政策说明、话术库 | 客户隐私、未发布政策、财务明细 |
| 研发知识库 | 架构说明、开发规范、故障复盘、运维手册 | 密钥、生产凭证、未脱敏日志 |
| HR制度库 | 公开制度、入职流程、培训材料 | 薪酬明细、绩效记录、个人档案 |
| 销售资料库 | 产品介绍、报价规则、案例材料 | 客户合同、未授权案例、竞争敏感信息 |
第二步:重建 AI 权限模型
石墨里的权限是文档协作权限,AI 知识库里的权限是问答访问权限。两者不能直接等价。一个用户可能不能看原始石墨文档,但如果知识库把内容上传给所有人,他仍然可能通过提问看到摘要。
建议用四级分类:
- 公开:官网文档、公开帮助、公开产品说明,可进入对外 AI 助手。
- 内部:普通内部流程、培训材料,只给公司成员使用。
- 受限:部门政策、项目资料、客户交付资料,只给特定团队使用。
- 敏感:个人信息、密钥、财务、人事、合同敏感条款,默认不进入通用 AI 知识库。
不要用一个企业知识库装所有资料
客服、研发、HR、销售的访问边界不同。把所有资料放进一个知识库,再靠提示词约束模型不要回答敏感问题,风险太高。更稳妥的是按业务和权限拆分知识库。
第三步:批量导出并保留原始证据
权限和范围确认后,再开始批量导出。导出阶段的目标不是直接喂给 AI,而是建立可审计的本地资料底座。
- 按知识库范围导出对应石墨目录,不要混入无关部门资料。
- 优先导出 Markdown 或 Word 作为文本底稿。
- 合同、公告、制度定稿同时导出 PDF 留原貌。
- 表格、台账、排期导出 Excel,避免丢公式和表头。
- 保留导出日期、导出人、目录范围和失败文件清单。
从团队空间导出时,格式和目录层级会影响后续AI知识库治理。
第四步:脱敏、清洗和版本标记
企业知识库的清洗要比个人知识库严格。至少要做三类处理:删除不能上传的内容、改写可以脱敏上传的内容、标记当前生效版本。
敏感信息清单
建议先用人工和自动化规则结合检查这些内容:身份证、手机号、邮箱、客户姓名、合同金额、银行账号、API key、访问 token、数据库连接串、生产日志、员工绩效、薪酬、医疗信息、未发布战略和投融资材料。
历史版本处理
AI 知识库用于日常问答时,通常只应让当前生效版本参与检索。历史版本可以进入归档目录,但不要和当前版本混在同一个索引里。确实需要问历史政策时,应建立单独知识库,并在回答中明确“这是历史版本”。
元数据要写进文件
每份进入 AI 的文档都应至少包含:来源路径、负责人、更新时间、权限等级、版本、生效状态。这样后续出现错误回答时,能追到具体源文件。
---
source_path: "团队空间/客服中心/退款政策.md"
owner: "客服运营"
permission_level: "internal"
effective_status: "current"
updated_at: "2026-07-12"
reviewer: "运营负责人"
---
第五步:按权限拆分上传
上传到 AI 平台时,不建议只按格式拆分,而应按权限和业务拆分。例如:
| 知识库 | 资料范围 | 访问对象 |
|---|---|---|
| 客服内部知识库 | 售后政策、FAQ、处理流程 | 客服和运营 |
| 销售资料知识库 | 产品介绍、案例、报价口径 | 销售团队 |
| 研发规范知识库 | 技术规范、故障复盘、发布流程 | 研发和运维 |
| 公开帮助知识库 | 公开帮助、公开FAQ、官网内容 | 外部用户或官网助手 |
如果使用 RAG 系统,还要确认检索层是否支持权限过滤。否则即使前端隐藏了入口,后端检索仍可能召回不该给某个用户看的 chunk。
自建知识库时,切分、元数据和权限过滤要一起设计。
第六步:上线前验收
企业 AI 知识库上线前,建议至少做一次“红线验收”。不要只测试它能不能答对,还要测试它会不会越权、编造、引用过期资料。
| 验收项 | 测试方式 | 通过标准 |
|---|---|---|
| 权限边界 | 用不同角色提问受限内容 | 无权限用户不能得到敏感答案 |
| 敏感信息 | 搜索手机号、密钥、客户名等模式 | 不应出现在可问答知识库中 |
| 来源引用 | 要求回答附来源文件或章节 | 引用能回到本地导出文件 |
| 过期资料 | 询问已废止政策和旧流程 | AI能区分当前版本和历史版本 |
| 拒答能力 | 问资料中没有的问题 | 明确无法确认,不编造 |
| 回滚演练 | 模拟一次错误导入 | 能恢复上一版资料包和索引 |
第七步:更新、审计和回滚
AI 知识库上线后,每次更新都应有记录。建议用日期或版本号保存资料包,例如 kb-customer-service-2026-07-17。每个版本至少包含原始导出、清洗后文件、元数据表、上传清单、验收结果和问题记录。
如果石墨团队空间仍是日常协作源,AI 知识库应该有固定更新节奏。高频变化的客服政策、销售报价、产品说明按周检查;研发规范和 HR 制度可按月或版本发布时更新;历史归档资料只在有纠错时更新。
常见问题
石墨团队空间可以全部导入企业AI知识库吗?
不建议全部导入。团队空间通常混有公开资料、内部资料、敏感资料、过期资料和个人草稿,应该先按用途、权限和时效筛选。
企业AI知识库需要保留石墨原始目录吗?
需要。原始目录是追踪来源、排查错误回答、做版本回滚和权限复核的重要依据,即使 AI 平台不会完整识别目录,也应该在本地资料包中保留。
哪些石墨内容不能直接进入AI知识库?
客户个人信息、合同敏感条款、密钥、财务明细、人事资料、未发布战略、过期政策和权限不清的共享文档,都不应直接上传。
企业AI知识库怎么处理历史版本?
建议只让当前生效版本参与问答,历史版本放入归档目录。确需查询历史时,应建立单独知识库并在回答中明确版本和时间。
怎么判断团队AI知识库已经可以上线?
至少要通过权限检查、敏感信息抽检、标准问题集、错误拒答测试、来源引用检查和回滚演练。只完成文件上传不能视为上线。