批量PDF学术论文信息自动提取工具

via Freelancer ·

Budget / Salary$250–750
TypeFreelance project
LocationRemote
Posted1 hour ago
## 项目简介

开发一款面向科研人员的本地桌面工具,用于批量读取 PDF 学术论文,自动提取论文固定章节信息,输出结构化表格。
逻辑:简单论文本地文本解析 + 固定提示词批量抽取;**识别困难、排版乱、扫描类文献,自动调用大模型 API 兜底处理**。
项目分阶段开发,第一阶段交付 MVP 核心功能,后续迭代全部高级功能,需要开发者能承接完整最终版本的开发。

## 完整全部需求(最高需求,写在这里,让对方知道最终能做到什么)

1. 批量导入多篇本地 PDF,批量加载、排队处理
2. 自动提取论文固定字段:研究背景、研究目的、研究方法、试验材料、研究结论、研究不足
3. 智能分流机制:
- 正常可解析 PDF:本地提取文本,内置提示词批量抽取信息
- 排版错乱、公式多、扫描件、识别失败的文献:自动调用 LLM API 做兜底提取
4. 提取结果可视化预览,支持手动编辑、修正 AI 识别错误
5. 全部文献结果汇总,一键导出 Excel 表格,方便横向对比多篇论文
6. 结果本地保存,可二次打开查看历史提取任务
7. 简单用户界面:文件列表、任务进度、结果面板、API 密钥配置入口
8. 后续迭代规划:账号、授权、付费版本功能(二期开发)

## 一期 MVP(第一阶段,优先开发,本次报价的范围)

只做核心基础功能,先落地最小可用版本:

1. 批量导入 PDF,本地提取文本
2. 调用提示词提取 6 个固定字段(背景 / 目的 / 方法 / 材料 / 结论 / 不足)
3. 手动配置 LLM API 密钥,识别失败时,支持手动 / 自动调用 API 兜底
4. 结果预览、手动修改,导出 Excel

>
> 一期**不做**:会员、复杂权限、高级图表识别、Mac 端

## 二期迭代(一期做完之后,再协商预算开发)

完善智能分流、任务历史存储、UI 优化等高级功能,走向完整版。

## 技术、交付、合同要求

1. 技术:可基于现有 PDF 解析开源项目二次开发(Python/Tauri/PyQt 均可)
2. 文件安全:原始 PDF 优先本地读取,不强制上传文件
3. 交付物:一期交付 exe 安装包 + 完整源码 + 使用文档
4. 约定:**开发阶段产生的 Bug 免费修复;新增功能、二期迭代单独谈价格**
5. 验收方式:分阶段验收,每完成一个模块确认后再继续下一阶段
6. 要求:开发者有 PDF 文本提取、对接大模型 API 的开发经验,需要能承接全部最终版本开发。

## 预算与周期

本次招标为**一期 MVP 开发**,预算几百元;完整版二期功能后续单独协商。
请投标者在报价时说明:一期工期,以及完整最高需求版本的预估方案。
python api integration text recognition
Apply on Freelancer →

Project sourced from Freelancer.com. Applications happen directly on the original platform — we never collect your data.