pdf、word、markdown、html、文件夹)
文章目录1 文档相关类简介1.1 BaseLoader类分析1.2 Document类分析2 文档加载器2.1 加载pdf2.1.1 方式1:PyPDFLoader2.1.2 方式2:MinerU2.2 加载word2.3 加载Markdown2.3.1 示例1:加载md文件2.3.2 示例2:精细分割文档保留结构信息2.4 加载HTML2.5 加载File Directory加载pdf(PyPDFLoader),加载Markdown(UnstructuredMarkdownLoader),加载HTML(UnstructuredHTMLLoader),加载File Directory(DirectoryLoader)。1 文档相关类简介了解:BaseLoader、Document类(1)一方面:LangChain在设计时,要保证Source中多种不同的数据源,在接下来的流程中可以用一种统一的形式读取、调用。(2)另一方面:为什么PDFloader和TextLoader等Document Loader都使用load()去加载,且都使用.page_content和.metadata读取数据?【解答】每一个在LangChain中集成的文档加载器,都要继承自BaseLoader(文档加载器),BaseLoader提供了一个名为"load"的公开方法,用于从配置的不同数据源加载数据,全部作为Document对象。1.1 BaseLoader类分析BaseLoader类定义了如何从不同的数据源加载文档,每个基于不同数据源实现的loader,都需要继承BaseLoader。Baseloader要求不多,对于任何具体实现的loader,最少都要实现load方法。BaseLoader把数据加载成Documents object ,存到 Documents类中的page_content中。