.NET 文档智能处理 SDK

DocCore + VisionOCR
文档处理一站式 SDK

面向 .NET 开发者的文档智能处理SDK套装。DocCore 提供 PDF 文档加载、文本提取、搜索能力;VisionOCR 提供 OCR 识别、图像预处理、表格检测能力。

.NET 6 / 8 / FX 4.8
2 SDK 模块
3 跨平台(Win/Linux/mac)
Program.cs
// DocCore: PDF 文档处理
using DocCore.Abstractions.Documents;

var doc = PdfDocument.Load("投标文件.pdf");
var text = doc.ExtractText();
var results = doc.Search("项目名称");

// VisionOCR: 文字识别
using VisionOCR.Abstractions.Core;

var engine = new OcrEngine();
engine.Initialize();
var result = engine.Recognize("扫描件.png");
Console.WriteLine(result.Text);
SDK 模块

两大 SDK,各司其职

DocCore 处理 PDF 文档,VisionOCR 处理 OCR 识别,可独立使用也可组合使用

DocCore SDK

PDF 文档处理

基于 PdfPig + PDFium 的 PDF 文档处理 SDK,提供文档加载、文本提取、内容搜索、页面信息获取等能力。

  • PDF 文档加载与页面信息
  • 全文文本提取
  • 关键字搜索与定位
  • 文档保存与导出
  • 页面渲染(PDFium)
VisionOCR SDK

OCR 文字识别

基于 Tesseract 的 OCR 识别 SDK,内置图像预处理管线和表格检测能力,专为中文工程文档优化。

  • 中文/英文 OCR 文字识别
  • 图像预处理(ImageSharp)
  • 表格结构检测
  • 批量识别能力
  • 识别结果结构化输出
DocCore OCR处理流程
技术优势

为 .NET 开发者打造

原生 .NET 体验,开箱即用

📦

NuGet 安装

通过 NuGet 包管理器一键安装,自动处理依赖关系,无需手动配置原生库。

🎯

多框架支持

同时支持 .NET 6、.NET 8 和 .NET Framework 4.8,覆盖新旧项目需求。

🔒

授权管理

内置完整的授权管理系统,支持设备绑定、在线验证、离线授权等多种模式。

📖

完整文档

提供 API Reference、示例项目、集成指南等完整开发文档,快速上手。

支持平台

运行环境

.NET 8

推荐版本

.NET 6

LTS 支持

.NET Framework 4.8

旧版兼容

支持 Windows / Linux / macOS(按 .NET 运行时部署)

使用流程

三步开始集成

1

安装 SDK

通过 NuGet 安装 DocCore.SDK 和/或 VisionOCR.SDK 包。

2

激活授权

使用授权 Key 初始化 SDK,支持在线和离线激活。

3

调用 API

按照文档调用 API,完成 PDF 处理或 OCR 识别功能集成。

开发者资源

文档与示例

完整的开发文档帮助您快速集成

📖

API Reference

完整 API 文档

查看文档
💻

示例项目

HelloWorld 示例

获取示例
📦

NuGet 包

SDK 安装包

获取评估包
🏢

企业授权

商业授权方案

联系我们
技术文章

文档处理技术选型

帮助开发者选择合适的文档处理方案

为什么选择原生.NET PDF SDK?

在.NET项目中处理PDF文件,开发者通常面临几种选择:调用外部进程(如命令行工具)、COM自动化(如Acrobat Interop)、或使用原生.NET SDK。原生.NET SDK具有明显的优势:

  • 类型安全:强类型API设计,编译时即可发现错误,IDE智能提示完善,降低运行时异常风险。
  • async/await支持:原生支持异步编程模型,避免外部进程调用的线程阻塞问题,提升应用吞吐量。
  • 无外部依赖:不需要安装Acrobat、LibreOffice等第三方软件,部署简单,运维成本低。
  • NuGet包管理:通过NuGet一键安装和更新,自动处理依赖关系,与.NET工具链无缝集成。
  • 跨框架兼容:同一套API同时支持.NET 6、.NET 8和.NET Framework 4.8,新旧项目均可使用。

DocCore SDK正是基于这些原则设计的原生.NET PDF处理库,底层集成PdfPig和PDFium,提供纯托管代码的文档操作体验。

.NET平台OCR方案对比

.NET开发者在选择OCR方案时,常见的选项包括:

  • Tesseract(开源):Google维护的开源OCR引擎,对中日韩(CJK)文字有良好的识别准确率,社区活跃,免费使用。但需要自行处理图像预处理和结果解析。
  • ABBYY FineReader(商业):业界公认准确率最高的OCR引擎,支持190+语言,但授权费用较高,适合预算充足的企业级项目。
  • IronOCR(商业):.NET原生的商业OCR库,API设计简洁易用,内置Tesseract引擎,按开发者席位授权。
  • Azure Cognitive Services(云端):微软的云端OCR服务,按API调用次数计费,需要网络连接,识别结果通过REST API返回。

VisionOCR SDK基于Tesseract引擎构建,针对中文工程文档(图纸、表格、报告)进行了专项优化,内置图像预处理管线和表格结构检测能力。所有处理在本地完成,无需云端依赖,适合对数据安全有要求的工程文档场景。

常见问题

常见问题解答

DocCore 和 VisionOCR 可以独立使用吗?
可以。两个 SDK 完全独立,可以根据需求单独安装和使用。DocCore 负责 PDF 文档处理,VisionOCR 负责 OCR 识别,也可以组合使用实现更强大的文档智能处理能力。
支持哪些 OCR 语言?
VisionOCR 基于 Tesseract 引擎,默认支持中文和英文识别。针对工程文档(图纸、表格、报告)进行了专项优化。可通过配置扩展其他语言支持。
如何获取商业授权?
DocCore VisionOCR 为商业授权产品,提供按项目、按设备、按年等多种授权方案。请联系我们获取详细的授权方案和报价。
是否支持 Linux 或 macOS?
支持。SDK 基于 .NET 构建,可在 Windows、Linux(含国产系统)、macOS 上按对应 .NET 运行时部署。