.NET 文档智能处理 SDK
DocCore + VisionOCR
文档处理一站式 SDK
面向 .NET 开发者的文档智能处理SDK套装。DocCore 提供 PDF 文档加载、文本提取、搜索能力;VisionOCR 提供 OCR 识别、图像预处理、表格检测能力。
using DocCore.Abstractions.Documents;
var doc = PdfDocument.Load("投标文件.pdf");
var text = doc.ExtractText();
var results = doc.Search("项目名称");
// VisionOCR: 文字识别
using VisionOCR.Abstractions.Core;
var engine = new OcrEngine();
engine.Initialize();
var result = engine.Recognize("扫描件.png");
Console.WriteLine(result.Text);
两大 SDK,各司其职
DocCore 处理 PDF 文档,VisionOCR 处理 OCR 识别,可独立使用也可组合使用
PDF 文档处理
基于 PdfPig + PDFium 的 PDF 文档处理 SDK,提供文档加载、文本提取、内容搜索、页面信息获取等能力。
- PDF 文档加载与页面信息
- 全文文本提取
- 关键字搜索与定位
- 文档保存与导出
- 页面渲染(PDFium)
OCR 文字识别
基于 Tesseract 的 OCR 识别 SDK,内置图像预处理管线和表格检测能力,专为中文工程文档优化。
- 中文/英文 OCR 文字识别
- 图像预处理(ImageSharp)
- 表格结构检测
- 批量识别能力
- 识别结果结构化输出
为 .NET 开发者打造
原生 .NET 体验,开箱即用
NuGet 安装
通过 NuGet 包管理器一键安装,自动处理依赖关系,无需手动配置原生库。
多框架支持
同时支持 .NET 6、.NET 8 和 .NET Framework 4.8,覆盖新旧项目需求。
授权管理
内置完整的授权管理系统,支持设备绑定、在线验证、离线授权等多种模式。
完整文档
提供 API Reference、示例项目、集成指南等完整开发文档,快速上手。
运行环境
.NET 8
推荐版本
.NET 6
LTS 支持
.NET Framework 4.8
旧版兼容
支持 Windows / Linux / macOS(按 .NET 运行时部署)
三步开始集成
安装 SDK
通过 NuGet 安装 DocCore.SDK 和/或 VisionOCR.SDK 包。
激活授权
使用授权 Key 初始化 SDK,支持在线和离线激活。
调用 API
按照文档调用 API,完成 PDF 处理或 OCR 识别功能集成。
文档处理技术选型
帮助开发者选择合适的文档处理方案
为什么选择原生.NET PDF SDK?
在.NET项目中处理PDF文件,开发者通常面临几种选择:调用外部进程(如命令行工具)、COM自动化(如Acrobat Interop)、或使用原生.NET SDK。原生.NET SDK具有明显的优势:
- 类型安全:强类型API设计,编译时即可发现错误,IDE智能提示完善,降低运行时异常风险。
- async/await支持:原生支持异步编程模型,避免外部进程调用的线程阻塞问题,提升应用吞吐量。
- 无外部依赖:不需要安装Acrobat、LibreOffice等第三方软件,部署简单,运维成本低。
- NuGet包管理:通过NuGet一键安装和更新,自动处理依赖关系,与.NET工具链无缝集成。
- 跨框架兼容:同一套API同时支持.NET 6、.NET 8和.NET Framework 4.8,新旧项目均可使用。
DocCore SDK正是基于这些原则设计的原生.NET PDF处理库,底层集成PdfPig和PDFium,提供纯托管代码的文档操作体验。
.NET平台OCR方案对比
.NET开发者在选择OCR方案时,常见的选项包括:
- Tesseract(开源):Google维护的开源OCR引擎,对中日韩(CJK)文字有良好的识别准确率,社区活跃,免费使用。但需要自行处理图像预处理和结果解析。
- ABBYY FineReader(商业):业界公认准确率最高的OCR引擎,支持190+语言,但授权费用较高,适合预算充足的企业级项目。
- IronOCR(商业):.NET原生的商业OCR库,API设计简洁易用,内置Tesseract引擎,按开发者席位授权。
- Azure Cognitive Services(云端):微软的云端OCR服务,按API调用次数计费,需要网络连接,识别结果通过REST API返回。
VisionOCR SDK基于Tesseract引擎构建,针对中文工程文档(图纸、表格、报告)进行了专项优化,内置图像预处理管线和表格结构检测能力。所有处理在本地完成,无需云端依赖,适合对数据安全有要求的工程文档场景。
常见问题解答
DocCore VisionOCR知识库
深入了解产品相关的技术知识、行业规范和使用技巧