内容概述
搭建论文正文及支撑材料(SI)的全自动下载工作流,面向复杂版式、长上下文和专业化学语义,基于Uni-Parser/MinerU的解析结果,构建“原文证据定位—并行抽取—化学语义实体与合成路径对齐—输出标准化—质量审计修复”的多阶段LLM-Based-Pipeline,将分散于正文、表格和SI中的信息转化为覆盖“结构—合成—性能—应用”的结构化可信信息。
负责工作
定制化设计领域数据Schema与功能节点编排;针对单篇多材料、多合成路线易混淆及长文本输出易截断的问题,设计“整篇→单材料→单路线”分级回退与覆盖校验机制;结合CIF/CCDC、Crossref、PubChem及RDKit核验晶体结构、文献元数据和化学结构,识别并修复OCR噪声与模型抽取错误,降低其对结果的影响。
所获成果
打通文献获取、解析、抽取与质检全链路,实现并发处理、断点续跑和异常定位;产出按材料及合成路线组织的标准化JSON、原文证据及待复核问题清单,为跨文献检索、材料知识图谱和科研RAG提供可追溯的高质量数据基座。


