MrDoc使用说明手册
🎊 基本概念
🚀 快速开始
创建文集
创建文档
添加成员协作
📑 文档与知识库基础
文集基础配置
文集置顶
WebHook消息推送
首页隐藏文集
文集关联集
文集选项卡配置
📄 文档编辑与内容创作
添加文档附件
显示文档目录
创建文档快捷方式
设置文档标签
设置文档别名
插入视频
文档自动保存
📦 文档管理与组织
文集目录排序
修改文档排序
下级文档控制
设置文档上下级
文档历史版本
转让文集
转让文档
复制文档/移动文档
文档访问记录
文集导出与下载
文档下载与导出
导出文档PDF
文档拖拽排序
🔐 协作与权限管理
设置文档权限
设置文集访问权限
文档禁止复制
设置文档水印
文集协作/文集成员管理
文档分享
文集分享
开启文档评论
🗄️ 图片与附件管理
配置图片/附件上传限制大小
配置图片上传格式
配置附件上传格式/附件白名单
附件预览
转让附件/转让图片
清理图片
使用manage命令批量提取附件文本内容
🎯 数据导入与迁移
桌面客户端导入
导入 Joplin 笔记本
导入印象笔记
Web 端导入
命令行导入
Web端导出
🔑 第三方登录配置
钉钉扫码登录和钉钉内免登配置
企业微信认证接入
LDAP 认证接入配置
OIDC 认证接入
微信公众号网页授权
📦 第三方存储配置
minio 配置
七牛云OSS配置
阿里云OSS配置
AWS S3 配置
🤖 AI知识库与智能问答
基础配置
AI模型配置
Qdrant部署
Dify 框架配置
重建文档AI索引
AI功能
AI 文档创作
AI知识库问答
AI 问答机器人
企业微信智能机器人
📝 OnlyOffice 接入
📊 Drawio 接入
⚓ 系统设置和管理
站点信息配置
首页模板配置
官网主题首页配置说明
用户与账户配置
统计代码配置
文档广告/信息块/自定义head配置
禁止更新检测
全站搜索模式
文档内图片缩略显示
站点反馈
RSS订阅
站点单标签设置
发件邮件配置
站点数据导出
编辑器配置
文集文档页面显示站点顶部导航栏
站点公告配置
🧑 个人账号管理
设置默认编辑器
设置用户昵称
修改用户密码
绑定第三方账号
🎈 API 与开发者接口
获取用户 Token
获取文集列表
获取文集目录
获取文集文档列表
获取个人文档列表
获取指定文档内容
新建文集
新建文档
更新文档
上传图片
上传附件
验证用户Token
上传本地Office/PDF文件为文档
🖥️ 客户端与生态集成
💻桌面客户端
📱手机客户端
🌐浏览器扩展
⌨️Obsidian 插件
常见使用问题索引
本站点使用「觅思文档专业版」构建
-
+
首页
🗄️ 图片与附件管理
使用manage命令批量提取附件文本内容
使用manage命令批量提取附件文本内容
命令:`extract_attachment_content` ## 一、命令介绍 为站点内已有的历史附件补全可检索的文本内容,供附件预览、站内搜索、AI 知识库问答使用。 | 项 | 说明 | | --- | --- | | 执行对象 | 已升级到新版本、且存有历史附件的站点 | | 执行次数 | 一次即可,已处理过的附件自动跳过 | | 执行位置 | MrDoc 安装目录 | | 执行时段 | 业务低峰期 | | 服务状态 | 保持运行,无需停服 | | 数据安全 | 建议先完成一次数据库备份 | 约束: - 支持读取文字的类型:pdf、doc、docx、xls、xlsx、pptx;其余类型跳过。 - `.doc` 依赖服务器上的 LibreOffice(转换后再读取):Docker 镜像已内置;源码部署需自行安装, 并在配置文件 `config.ini` 的 `preview.libreoffice_path` 中填写其可执行文件路径(默认 `soffice`)。 未安装时 `.doc` 会提取为空,`.docx` 不受影响。 - 云存储(七牛、MinIO 等)附件不处理。 - 超长正文按上限截断,完整内容以附件原件为准。 - 已处理过的附件不重复读取,需重新读取时加 `--force`。 - 需重建 AI 索引后,AI 知识库问答才会读取到附件内容。 - 命令运行期间不要中断进程。 ## 二、使用语法 ```sh python manage.py extract_attachment_content [参数] ``` Docker 部署(容器名以 `docker ps` 实际显示为准): ```sh docker exec -it mrdoc python manage.py extract_attachment_content [参数] ``` ## 三、参数说明 | 参数 | 说明 | | --- | --- | | 无参数 | 处理全部无内容的附件 | | `--dry-run` | 只盘点,不写入 | | `--limit N` | 最多处理 N 个附件 | | `--force` | 已有内容的附件也重新读取 | | `--attachment-id 1,2,3` | 只处理指定附件,逗号分隔 | | `--doc-id N` | 只处理指定文档引用的附件 | | `--reindex` | 补全后重建受影响文档的 AI 索引 | ## 四、使用示例 ### 示例 1:盘点待处理附件 ```sh python manage.py extract_attachment_content --dry-run ``` 核对输出中的「待处理附件」数量,确认与预期相符后继续。 ### 示例 2:全量补全(未启用 AI 问答) ```sh python manage.py extract_attachment_content ``` ### 示例 3:全量补全并重建 AI 索引(已启用 AI 问答) ```sh python manage.py extract_attachment_content --reindex ``` ### 示例 4:定向处理单个文档的附件 ```sh python manage.py extract_attachment_content --doc-id 43090 ``` ### 输出对照 ``` 待处理附件:70 个 提取成功:12 | attachment/2025/03/xxx.pdf | 长度=12345 跳过(不支持格式):13 | xxx.zip 跳过(非本地存储/文件缺失):14 | http://... ========== 提取完成 ========== 处理附件: 70 提取成功: 67 仍为空(提取失败): 1 跳过-不支持的格式: 2 跳过-非本地存储/文件缺失: 0 ``` 使用 `--reindex` 时附加输出: ``` 开始重建AI索引,受影响文档 5 篇 索引重建成功:DocID=43090 | xxx AI索引重建完成:成功=5 失败=0 ``` | 输出项 | 处理动作 | | --- | --- | | 提取成功 | 无需处理 | | 仍为空(提取失败) | 无需处理(扫描版 PDF、加密或损坏文件) | | 跳过-不支持的格式 | 无需处理 | | 跳过-非本地存储/文件缺失 | 记录数量,联系技术支持确认附件存储配置 | | 提示信息 | 含义 | | --- | --- | | 没有需要处理的附件 | 无待补全附件 | | AI索引范围为空白名单 | 后台「AI 配置」未设置知识范围,需先设置 | | 未找到引用这些附件的已发布文档 | 无需重建索引 | ### 验证 1. 打开含附件的文档,查看附件预览是否显示正文; 2. 在站内搜索中检索附件内的一段文字,确认可命中; 3. 已启用 AI 问答的站点,在 AI 问答中检索附件内容,确认可命中。 ### 异常上报 命令报错中断或出现无法判断的输出时,记录以下信息并联系技术支持: 1. 完整报错输出; 2. 执行时间与所用参数; 3. 最后一条处理中的附件信息。
州的先生
2026年9月20日 18:46
转发
收藏文档
上一篇
下一篇
手机扫码
复制链接
手机扫一扫转发分享
复制链接
使用觅思文档遇到问题?扫码联系我们。
扫码加微信 · 使用答疑、部署指导与产品咨询
分享
链接
类型
密码
更新密码
有效期
Markdown文件
Word文件
PDF文档(打印)