Cisdem OCRWizard 是一款专为 macOS 设计的桌面端光学字符识别(OCR)软件。它能够精准地将扫描的 PDF 文档、图片、屏幕截图中的文字内容转换为可编辑、可搜索的文本格式,并支持输出为多种主流文档格式。其核心优势在于对中文等多语言混合文本的高识别准确率,以及对文档原始格式(如排版、表格、列表)的良好保留能力。
一、 软件核心界面与工作区详解
启动软件后,您将看到一个简洁直观的现代化界面,主要分为四个功能区域:
- 顶部菜单栏与工具栏:包含所有核心操作命令的快捷按钮,如“添加文件”、“识别”、“保存”等。
- 左侧导航面板:通常用于显示已添加的文件列表或任务队列,用户可以在此处查看文件状态、选择文件进行操作。
- 中央预览与编辑区:这是最主要的工作区域。上半部分显示原始文件(图像/PDF)的预览,下半部分显示识别后的可编辑文本。用户可以在此区域直接对比和修改识别结果。
- 右侧设置面板:用于配置识别任务的关键参数,包括语言选择、输出格式设置、页面范围选择等。
二、 完整操作流程:从创建项目到导出结果
1. 创建/打开项目(添加源文件)
具体方法:
- 点击工具栏上的 “添加” 按钮(图标通常为“+”号),或使用快捷键
Command + O。 - 在弹出的文件选择器中,定位并选择一个或多个图像文件(JPG, PNG, BMP, TIFF)或 PDF 文件。
- 点击“打开”,文件将立即被导入并显示在左侧的文件列表中,同时中央预览区会显示第一页内容。
位置: 操作入口位于顶部工具栏最左侧或“文件”菜单中。
2. 配置识别参数
在右侧设置面板中进行配置,这是保证识别准确率和输出效果的关键步骤。
- 语言选择: 在“语言”下拉菜单中,勾选文档中包含的语言。例如,对于中英文混合文档,需同时勾选“中文(简体)”和“英语”。软件支持多语言同时识别。
- 输出格式: 在“输出为”下拉菜单中选择目标格式,如可编辑的 Word (.docx)、Excel (.xlsx)、PowerPoint (.pptx)、纯文本 (.txt)、可搜索的 PDF (.pdf) 或保留原样的 PDF。
- 页面范围: 如果添加的是多页 PDF,可以在“页面”选项中选择“全部页面”或指定特定页面范围(如 1, 3, 5-10)。
3. 执行OCR识别
具体方法:
- 确保在左侧文件列表中选中了需要处理的文件。
- 点击工具栏中央醒目的 “识别” 按钮(通常是一个向右的箭头图标),或直接按下快捷键
Command + R。 - 软件将开始处理。处理进度会以进度条形式显示。识别完成后,中央编辑区下半部分将自动显示识别出的可编辑文本。
4. 校对与编辑识别结果
识别完成后,强烈建议在导出前进行校对。
- 对比校对: 上下拖动中央区域的分隔条,可以同时查看原始图像和识别文本,方便逐行比对。
- 直接编辑: 在下方的文本区域,您可以像在任何文本编辑器中一样,直接修改、删除或添加文字,纠正可能的识别错误。
- 格式检查: 如果输出格式选择了 Word 或 PPT,可以检查标题、段落、表格等格式是否被正确保留。
5. 导出最终结果
具体方法:
- 校对编辑完成后,点击工具栏上的 “保存” 按钮(磁盘图标),或使用快捷键
Command + S。 - 在弹出的保存对话框中,选择输出文件的存储位置。
- 在“格式”下拉菜单中确认输出格式(通常已根据之前的设置自动选定)。
- 为文件命名,然后点击“保存”。软件将根据您的设置生成最终的可编辑文档。
三、 常用功能进阶技巧
- 批量处理: 一次性添加数十个文件,在右侧设置面板中统一配置好语言和输出格式,然后点击“识别”。软件将按顺序自动处理所有文件,极大提升效率。
- 保留原始布局: 对于含有复杂排版(如杂志、报告)的文档,在“输出为”中选择“Word”或“保留原样的PDF”,软件会尽力还原原始页面的版式和图片位置。
- 精准识别倾斜文本: 如果扫描的图片页面倾斜,可在识别前使用内置的“旋转”或“裁剪”工具(通常在预览图上方)对页面进行校正,能显著提高识别准确率。
- 从加密PDF中提取文字: OCRWizard 支持打开受“所有者密码”保护(即仅限制打印编辑,不限制打开)的PDF文件并进行OCR识别,是处理此类文档的利器。
四、 常见问题与解决方案
Q1: 识别出的中文文本出现乱码或大量错误。
解决方案: 检查右侧面板的“语言”设置。确保已正确勾选文档实际使用的语言(如“中文(简体)”)。对于中英混排文档,务必同时勾选中文和英文。
Q2: 识别后生成的Word文档排版混乱,图片位置错位。
解决方案: 这是OCR技术的常见挑战。可以尝试:1) 在输出格式中选择“保留原样的PDF”,它能在PDF层上添加文字层,最大程度保持原貌;2) 对于要求严格的文档,将输出格式改为“纯文本(.txt)”,先获取准确文字,再手动在Word中重新排版。
Q3: 软件处理速度很慢,尤其是处理多页高清扫描件时。
解决方案: 处理速度受图片分辨率、文件页数和电脑性能影响。可以尝试:1) 在添加图片前,用预览工具适当降低图片分辨率(尤其是DPI超过300的);2) 在设置中指定只识别必要的页面范围,而非全部。
Q4: 无法打开受“打开密码”保护的PDF文件。
解决方案: OCRWizard 无法破解需要密码才能查看内容的PDF。您需要先使用其他方式获得密码并打开PDF,另存为一份无密码的副本,再用本软件处理。
五、 快捷键汇总表 (Mac版)
| 功能 | 快捷键 | 说明 |
|---|---|---|
| 打开/添加文件 | Command + O |
导入需要识别的图像或PDF文件 |
| 开始OCR识别 | Command + R |
对选中的文件执行识别操作 |
| 保存/导出结果 | Command + S |
将识别结果保存为指定格式 |
| 复制识别文本 | Command + C |
在编辑区选中文本后复制 |
| 粘贴文本 | Command + V |
在编辑区粘贴文本 |
| 全选文本 | Command + A |
在编辑区选中全部识别文本 |
| 查找文本 | Command + F |
在识别结果中查找特定词语 |
| 放大预览 | Command + + |
放大上方原始图像预览 |
| 缩小预览 | Command + - |
缩小上方原始图像预览 |
| 退出软件 | Command + Q |
完全退出 Cisdem OCRWizard |









