ai-berkshire:把巴菲特四大师方法论变成 Claude Code 可执行的投研流程
AI时代的伯克希尔:基于Claude Code / Codex的价值投资研究框架。巴菲特·芒格·段永平·李录四大师方法论+多Agent毛研究。| AI时代的伯克希尔:为Claude Code / Codex构建的价值投资研究框架。 4种大师方法论+多智能体对抗分析。
秒懂
- 它是什么?
- ai-berkshire 是一套面向 Claude Code 与 Codex 的价值投资研究 Skill 合集,将巴菲特、芒格、段永平、李录的方法论固化为 20 个可复用入口。本文拆解其多 Agent 对抗机制、数据校验工具与适用边界。
- 适合谁用?
- 适合已经熟悉价值投资术语、愿意把研究流程标准化的个人投资者,尤其是同时使用 Claude Code 或 Codex 的开发者。不适合把 AI 当黑盒、指望自动生成买卖信号的人,也不适合没有能力独立核验数据的新手。
- 能商用吗?
- 可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
- 还在维护吗?
- 在维护。仓库最近一次提交在 4 天前。
- 用什么语言写的?
- 主要是 Python(依据 GitHub 的语言统计)。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月14日)和我们的分析,不构成法律意见。
开源项目深度解析
它解决的是决策纪律问题,不是分析能力问题
直接问 Claude 一家公司值不值得买,得到的通常是平衡分析加风险提示。ai-berkshire 的出发点正是反对这种输出。README 里写得很直白:这种分析看起来对,但没法拿来做决策。项目把四位投资大师的方法论拆成可执行的步骤,强制输出通过、不通过或灰色地带的结论,附带具体价格区间和分层建议。它面向的是已经具备投资常识、但苦于每次分析格式和深度不一致的个人研究者。一个没有财务基础的人拿到这份报告,依然不知道如何判断数据是否可靠。
四大师视角的对抗,不是四种说法的堆砌
以拼多多为例,README 给出了四个视角的评分差异。段永平看商业模式给 3.7,巴菲特看财务估值给 4.4,芒格看护城河给 3.5,李录看长期确定性只给 2.0。这不是把同一个 prompt 拆成四段,而是四个独立 Agent 各自搜索、独立判断后产生真实矛盾。巴菲特说便宜,李录说不确定就不买,这种张力才是决策的真实状态。单一 prompt 无法制造这种冲突,因为模型倾向于收敛到一个中庸答案。多 Agent 的价值在于把分歧显性化,让研究者直面自己忽略的风险维度。
反偏见机制是框架的核心,不是附属品
README 列出了五层防错结构。信息丰富度评级防止资料多等于确定性高的幻觉,泡泡玛特被评为 B 级时,推算指标必须标注置信度。芒格式逆向检验强制列出公司可能失败的场景和概率。快速否决清单有八条红线,管理层诚信污点直接一票否决。反共识检查要求回答聪明人为什么在做空。留白原则允许在数据不足时标注灰色地带,不用推测伪装确定性。这套机制的价值在于它把反事实思考变成了流程的一部分,而不是依赖分析师当时的灵感。
数据校验用 exact decimal,不用 float
LLM 心算不可靠,单位混用是真实事故源。README 给出一个案例:分析腾讯时,市值数据存在港币亿和人民币亿两种单位。项目提供 tools/financial_rigor.py 做手算校验,命令格式明确:python3 tools/financial_rigor.py verify-market-cap --price 510 --shares 9.11e9 --reported 4.65e12 --currency HKD。所有计算使用 Python 的 decimal.Decimal,关键数据要求至少两个独立来源交叉验证。这是项目里少数可以直接验证的部分,也是它区别于普通 prompt 工程的地方。但注意,工具只校验算术一致性,不校验数据本身是否来自可靠信源。
20 个 Skill 的划分逻辑与使用场景
Skill 按四类组织。深度研究类包括 /investment-research、/investment-team、/management-deep-dive,其中 /investment-team 启动四个独立 Agent 并行研究,Team Lead 再综合。财报分析类只读原始财报,不依赖二手研报。行业筛选类提供 /quality-screen 用七条硬指标批量排除,/industry-funnel 做全市场到三家公司的漏斗。持仓管理类包含 /thesis-tracker 跟踪买入后论文是否被证伪,/thesis-drift 对比两份报告区分事实变化与措辞变化。思维工具类有 /dyp-ask 以段永平方式思考问题。这种划分意味着用户需要先知道自己处在研究流程的哪一步,再选择对应入口。
成本与模型选择是隐藏的准入门槛
README 在快速开始部分明确提示:深度投研类 Skill 默认进行多轮研究、交叉验证和多 Agent 综合判断,token 消耗较高。这是换取结论可靠性的代价,但 README 没有给出具体数字。对于个人用户,一次 /investment-team 调用可能消耗数万 token,按当前主流 API 定价,单次研究成本可能在几美元到几十美元之间。轻量 skill 如 /investment-checklist 则设计为快进快出,适合先用它做 10 分钟初筛,再决定是否投入重资源跑深度研究。这个分层设计是合理的,但用户需要自己建立成本意识,README 没有提供预算控制机制。
实盘业绩的呈现方式需要谨慎对待
README 公布了 2024 年收益 69.29%、2025 年收益 66.38%,并附上免责声明说历史收益不代表未来表现。这些数字无法从仓库内容验证,截图来源也未公开可查证路径。作为技术编辑,我只能说这些是作者自述,不是可复现的基准测试结果。更值得注意的问题是:如果这套框架真的持续跑赢指数,为什么没有提供回测脚本或模拟盘数据?仓库里只有方法论和报告模板,没有可验证的历史决策记录。读者应当把业绩声明当作营销材料看待,而不是框架有效性的证据。
与 Claude Code 内置 deep-research 的边界
README 明确区分了本项目与 Claude Code 自带的 /deep-research。后者是客户端内置的编排器,流程是把问题拆成五个检索角度并行搜索,每条论断由三个独立 Agent 对抗验证,三票中两票证伪才剔除。ai-berkshire 的建议是:在运行个股或行业 skill 之前,先用 deep-research 对一个关键事实判断做独立核查。这实际上承认了外部工具在事实核查上的优势,也划清了边界。ai-berkshire 擅长的是把投资方法论固化为流程,deep-research 擅长的是对具体事实做对抗验证。两者互补,但用户需要自己决定哪个环节用哪个工具。
编辑结论
适合已经熟悉价值投资术语、愿意把研究流程标准化的个人投资者,尤其是同时使用 Claude Code 或 Codex 的开发者。不适合把 AI 当黑盒、指望自动生成买卖信号的人,也不适合没有能力独立核验数据的新手。采用前先做三件事:检查 skills/ 目录下各 markdown 文件是否与你的 Claude Code 版本兼容,确认 financial_rigor.py 的依赖能正常安装,以及用小市值公司跑一次 /investment-checklist 验证输出格式是否符合预期。这套框架的价值在于流程纪律,不在于预测能力,把它当研究辅助而非决策替代。
社区笔记