尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

STORM 完整指南:一个 Topic 输入,自动调研并生成带引用的长篇报告

STORM 完整指南:一个 Topic 输入,自动调研并生成带引用的长篇报告 STORM 完整指南一个 Topic 输入自动调研并生成带引用的长篇报告【免费下载链接】stormAn LLM-powered knowledge curation system that researches a topic and generates a full-length report with citations.项目地址: https://gitcode.com/GitHub_Trending/sto/storm想为一个主题写综述却要先花几小时手动检索、整理参考文献、搭大纲STORM 是斯坦福出品的 LLM 知识策展系统输入一个主题它自动完成多轮联网调研产出带引用的维基风格长文报告全程按调研—写作两个可独立重跑的环节解耦。一句话看懂 STORM不是 RAG 问答而是自动化调研系统STORM 是一个基于 dspy 的 Python 包pip 包名knowledge-storm它不回答单个问题而是把选题调研 → 大纲 → 长文这条写作前的完整流水线自动化。直接让 LLM 提问只能得到平庸的问题所以它用两个策略保证问题质量先调研维基上相似主题提炼出多个研究视角persona来引导提问再模拟一位维基作者与领域专家的对话每一轮对话都基于真实网页来源接地可以不断追问。与单次 RAG 问答最大的区别在于它的产出不是答案片段而是分层大纲加逐句带引用的长文。官方 README 也坦诚输出达不到直接发表的水准但资深维基编辑普遍把它用作写作前的准备工具。能力地图从多轮调研到带引文的报告三层拆开看能力上可以分成三块负责深挖的调研层、把你拉进流程的协作层、以及方便替换的管线层。调研层视角引导提问 模拟对话视角引导提问给定主题后先检索维基相似主题自动提炼出多个视角比如研究方法类主题会拆出基础事实作者、实验心理学家、统计学家、实地研究者让每个视角分别控制提问方向避免单视角思维盲区。模拟对话模拟维基作者与领域专家的一对一访谈每轮回答都检索真实来源模型随对话更新对主题的理解并继续追问。两阶段解耦调研产物引用信息表 大纲与写作相互独立四个阶段各自可单独重跑——大纲不满意不必重新调研。协作层Co-STORM 人机共同策展Co-STORMEMNLP 2024把机器写升级成共同写。它定义了一套协作话语协议由 LLM 专家、主持人Moderator和你三方按轮次策略交互每个 LLM 专家的回答都接地于外部来源或基于话语历史提出追问主持人专门从已检索但还没用上的信息里挖掘启发性问题你可以全程旁观也可以随时插入一句话把讨论拉回自己关心的方向。系统还维护一张动态更新的思维导图把收集到的信息组织成层级化概念结构论文实验表明这能明显降低长对话下的人脑负荷。管线层多模型混搭与十种检索源STORM 是多模型系统对话模拟、提问、大纲、成文、润色是五个独立模型位全部走 litellm可以任意混搭——官方建议给对话模拟配便宜快速的模型给生成可核查带引文章节的位置配更强的模型。检索层内置 YouRM、BingSearch、VectorRM、SerperRM、BraveRM、SearXNG、DuckDuckGo、Tavily、GoogleSearch、AzureAISearch 十种实现其中 VectorRM 支持接地你自己的语料一份 CSV 文档加 Qdrant 向量库离线或在线服务都能跑。下面是最典型的多模型配置方式展示了快模型跑对话、强模型跑成文的混搭思路from knowledge_storm.lm import LitellmModel from knowledge_storm.rm import BingSearch fast LitellmModel(modelgpt-4o-mini, max_tokens500) strong LitellmModel(modelgpt-4o, max_tokens3000) lm_configs.set_conv_simulator_lm(fast) # 对话模拟用快模型 lm_configs.set_article_gen_lm(strong) # 带引用成文用强模型 rm BingSearch(k3) runner STORMWikiRunner(engine_args, lm_configs, rm)实战走一遍从一个主题到带引用报告以官方示例跑主题 Ecological Validity 为例输入只是一个主题字符串。调研系统先识别出 4 个研究视角基础作者、实验心理学家、统计学家、实地研究者然后基于搜索结果模拟作者-专家对话边检索边追问每浏览一个来源都会记录进日志。大纲与成文把收集的信息组织成层级大纲再逐节填充来源生成带编号引用的正文。润色追加总结章节、去除重复内容。核心 API 只有一个run方法四个开关对应四个阶段任一阶段都可以选择重算或加载缓存runner.run( topictopic, do_researchTrue, # 模拟多视角对话收集信息 do_generate_outlineTrue, # 生成分层大纲 do_generate_articleTrue, # 基于大纲引用生成长文 do_polish_articleTrue, # 加总结章节、去重 ) runner.post_run()输出目录里你能逐件核对log.json完整调研对话日志、大纲文件、以及带引用编号的报告长文。demo 界面里正文与参考文献并排展示正文中每个上标编号对应左侧 References 列表里的具体来源可点选查看。最小上手路径装包、配 Key、跑第一个报告三步不需要先理解整条管线。第一步安装。只调 API 就pip install knowledge-storm想改模块行为则克隆源码git clone https://gitcode.com/GitHub_Trending/sto/storm cd storm pip install -r requirements.txt第二步配 Key。在项目根目录建secrets.toml写入语言模型与搜索引擎的 API key如OPENAI_API_KEY、BING_SEARCH_API_KEY用 VectorRM 时再加ENCODER_API_TYPE。第三步跑脚本。示例脚本默认 GPT 模型族 Bing 搜索python examples/storm_examples/run_storm_wiki_gpt.py \ --output-dir ./output \ --retriever bing \ --do-research --do-generate-outline \ --do-generate-article --do-polish-articleexamples/storm_examples/ 下还有 Claude、Gemini、DeepSeek、Groq、Ollama、SearXNG 等各种模型组合的现成脚本想看实时过程frontend/demo_light/提供了最小 Streamlit 界面streamlit run storm.py即可启动。和单次 RAG 问答比STORM 赢在哪维度单次 RAG 问答STORM任务粒度一问一答主题级大纲 长文报告 参考文献表检索策略一次 top-k多轮模拟对话追问补源输出形态答案片段带逐句引用的长文可再润色模型构成单一模型五环节多模型贵贱混搭评测资产少见公开FreshWiki100 篇高频编辑维基条目、WildSeek真实用户主题-目标对还有一个实用差异调研层与写作层解耦同一份调研结果可以复用于不同呈现形式模块可换成要点式输出而 VectorRM 让整条流水线可以完全离线跑在你自己的语料上。如果你的目标只是单点 FAQRAG 更快更省目标是综述级长文或多轮信息搜集STORM 的多轮调研机制正是单次 RAG 缺的东西。文档、数据集与贡献入口项目 README 本身就是最完整的文档API 用法与定制指南都写在里面各模块实现在 knowledge_storm/storm_wiki/modules/ 与 knowledge_storm/collaborative_storm/modules/接口统一定义在 knowledge_storm/interface.py。团队路线图聚焦 human-in-the-loop 与信息抽象支持维基报告之外的呈现格式也欢迎提 issue 和 PR尤其是新搜索引擎的接入。【免费下载链接】stormAn LLM-powered knowledge curation system that researches a topic and generates a full-length report with citations.项目地址: https://gitcode.com/GitHub_Trending/sto/storm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表