📰 研报摘要
查看全文 ➔摘要: 本报告探讨了在 AI Agent 时代如何重构投研信息底座,旨在解决“人类友好型数据”与“Agent 友好型数据”之间的错配问题,通过构建稳定、可扩展的转换层来释放 Agent 的投研性能。
核心观点:
- 基础设施是 Agent 性能关键:当前投研 Agent 的瓶颈在于数据形态不匹配,需在专业数据源(外部接入)与知识库(内部沉淀)两个维度构建系统化的转换层。
- 数据源需标准化与接口化:主张通过标准化接口(如问财 SkillHub)替代散乱的爬虫取数,以保证数据的专业性、稳定性与合规性。
- 知识库应实现自动化闭环:采用“LLM-Wiki”模式,利用大模型将 Obsidian 等本地工具转化为动态知识库,实现“采集-归一-沉淀-检索”的自动化流程。
论据支撑:
- 数据源构建:提出了“SkillHub 优先 $\rightarrow$ 数据库兜底 $\rightarrow$ 公开网页补全”的优先级策略,并详细分析了不同 Agent(如 ClawScout, ClawResearch)对数据源的优化程度。
- 知识库架构:设计了由 raw(原始资料)和 wiki(LLM 加工页)组成的目录结构,并定义了录入(Ingest)、查询(Query)、体检(Lint)三大核心工作流。
- 工具链集成:引入 OpenCLI 实现自动化采集,使用 MarkItDown 进行异构资料格式归一化,并采用 qmd 或 RAG 架构提升大规模文档的检索效率。
局限性/风险:
- 模型局限:LLM 存在输出随机性和理解偏差风险,复杂 PDF 的解析仍可能出现结构偏差。
- 规模瓶颈:本地 Markdown 知识库在面对百万级文档时会产生性能瓶颈,需向企业级 RAG 架构迁移。
- 安全风险:Agent 的系统级权限配置不当可能导致信息泄露。