博客
Deepseek V4 Pro,能不能成为日常投研的主力?
8 月 13 日,DeepSeek V4 Pro 正式版上线。
市场上已经出现了不少模型评测,但对个人投资者来说,以代码能力、通识问答或单一总分为主的榜单只能提供部分参考。真正影响投研使用的,是模型能否读懂财报、处理估值计算、解释市场逻辑,并在涉及事实、时间和政策性质时避免关键错误。
基于这一问题,nashnova 将 DeepSeek V4 Pro、Claude Opus 5、Qwen3.8-Max、DeepSeek V4 Flash、Kimi K3 和 GLM-5.2 接入同一套投研产品环境,使用相同的金融数据、投研 Skills 和 Agent 流程,分别进行了金融可靠性、研究质量与深度、实际使用体验三套评测。
开放研究题由 GPT 5.6 旗舰模型 sol 参与评分,因此该模型没有进入本次横向对比。
我们希望回答一个具体问题:
DeepSeek V4 Pro 能否成为日常投研的主力模型?
结论是:可以,但它并不是所有任务的最优选择。
DeepSeek V4 Pro 适合估值、标准化研究和批量任务;Claude Opus 5 在复杂公司研究和深度推导中表现更强;Qwen3.8-Max 更适合政策、宏观和事件分析;DeepSeek V4 Flash 适合快速筛选大量资讯、财报和行业材料。
Kimi K3 在长材料和产业信息整理方面有优势,但时间线与政策事实需要额外复核。GLM-5.2 能形成完整的分析结构,但本次测试中关键事实和计算错误相对较多,暂不建议直接用于重要投研任务或金融内容发布。
为什么需要三套评测
一份投研回答可以写得很深,却在关键数字上出错;也可以很少犯错,但推理停留在表面。还有一些模型适合快速处理大量任务,却不适合直接承担高风险研究的最终输出。
如果把这些差异压进一个总分,结果很容易误导用户。因此,nashnova 将评测拆为三个问题:
评测体系 | 主要检查什么 | 适合回答什么问题 |
金融可靠性 | 事实、时间、政策性质、计算、证据和严重错误 | 回答能否进入正式研究或发布流程 |
研究质量与深度 | 数据覆盖、数据准确性、推理、结论和表达质量 | 模型能否完成复杂研究并形成可继续加工的底稿 |
实际使用体验 | 事实与计算、输出长度、等待时间和批量任务适配度 | 模型是否适合日常、重复的研究工作 |
三套评测使用不同标准,结果顺序不完全一致。这不是冲突,而是说明模型选择必须从任务出发。
日常使用:V4 Pro 适合标准化和批量任务
在实际使用体验评测中,DeepSeek V4 Pro 与 Claude Opus 5 的共识分接近。
V4 Pro 的优势主要体现在估值、数量测算和标准化研究。它通常能清楚列出公式、单位和计算过程,便于后续检查。对于批量财报问答、公司初筛或固定模板下的估值任务,这种交付方式比偶尔出现一篇写得很漂亮、但难以稳定复用的答案更实用。
需要说明的是,实际使用体验成绩来自两轮独立评分后的共识分。两轮评分并不等于模型在冻结配置下重新生成了两批答案,因此不能单凭这项结果证明模型的重复生成稳定性。更准确的说法是:在本次评测样本和评分体系中,V4 Pro 呈现出较好的日常任务适配度和标准化交付能力。
Claude Opus 5 的优势出现在需要深入拆解的问题中。它更经常主动说明关键假设、反方证据、证伪条件和后续跟踪指标,适合公司深度研究、行业拆解和复杂情景分析。相应的代价是回答通常更长,等待时间也更久。
Qwen3.8-Max 的信息密度较高,政策、宏观和事件分析表现较好。使用时仍应复算金额、单位和比例,避免计算细节影响结论。
DeepSeek V4 Flash 的定位更明确。它适合先处理大量资讯、财报和行业材料,再把真正重要的问题交给更强的模型继续研究。
Kimi K3 更适合长材料与产业信息整理,但时间顺序、政策状态和关键事实需要复核。GLM-5.2 的分析结构通常完整,本次测试中底层事实和计算错误相对更多。
金融可靠性:写得顺,不代表关键地方不会错
金融研究不能只看答案是否完整、流畅。一个关键事实错误,可能推翻后续整条分析链。
本次测试中出现了几类典型问题:使用后来公布的信息解释此前行情,把监管或许可费用解释成关税,以及把 8 亿元写成 81 亿元。
nashnova 将足以破坏核心结论的错误定义为“红线错误”。这类错误不能被其他部分的高分抵消。
整批测试共确认 5 次红线错误:Qwen3.8-Max 和 Claude Opus 5 没有触发;DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5.2 和 Kimi K3 分别出现一次或多次。
这也解释了 V4 Pro 看似矛盾的结果。它在日常使用和标准化任务中表现较好,但在金融可靠性评测中没有排在最前面,因为其中一次回答将监管或许可费用解释成了关税。
这不是措辞问题。政策性质一旦判断错误,对行业成本、企业盈利和后续政策方向的推导都可能偏离事实。
Qwen3.8-Max 在金融可靠性评测中领先,主要因为它处理政策性质、事件时间线和正式内容时更稳。Claude Opus 5 同样处于第一梯队,并保持了较高的研究深度。但无论模型排名如何,关键数字、来源和计算都仍需人工核验。
研究深度:Claude 更接近可继续加工的研究底稿
避开严重错误,只解决了研究的底线。完成公司研究、行业分析或情景推演,还要看模型是否能展开假设、反证和后续观察项。
这一部分,Claude Opus 5 的优势最明显。
它通常会说明结论依赖哪些条件,哪些证据可能推翻当前判断,以及后续应该跟踪哪些指标。与直接给出答案相比,这种结构更接近可以继续核验和迭代的研究底稿。
Qwen3.8-Max 能提供较高的信息密度,适合形成政策、宏观和事件研究的初稿,但关键计算仍需单独检查。
DeepSeek V4 Pro 的结构更规整,适合按固定模板完成估值、公司问答和标准化研究。遇到多层推导、反方论证和复杂情景分析时,Claude 的完成度更高。
Kimi K3 在产业材料整理方面有一定优势。DeepSeek V4 Flash 适合前期筛选,但不宜直接承担复杂研究终稿。
把三套结果放在一起,V4 Pro 的角色就很清楚了:它可以承担日常的大部分标准化研究工作,但深度、政策或高风险任务应切换模型,或增加更严格的交叉复核。
个人投资者如何按任务选择模型
用户不需要为了这份评测同时订阅所有模型。更实用的方式,是根据自己的高频任务建立主模型和复核模型。
主要任务 | 优先选择 | 复核或补充 | 使用建议 |
深度公司或行业研究 | Claude Opus 5 | Qwen3.8-Max | Claude 完成研究底稿,Qwen 检查政策、事实和时间 |
政策、宏观和事件分析 | Qwen3.8-Max | Claude Opus 5 | 对照政策原文,复算关键数字 |
估值和数量测算 | DeepSeek V4 Pro | Claude 或表格工具 | 保留公式、单位和分母,使用 Excel 等工具复算 |
日常批量研究 | DeepSeek V4 Pro | DeepSeek V4 Flash | Flash 先筛材料,V4 Pro 处理重点问题 |
长材料和产业资料 | Kimi K3 | Claude Opus 5 | Kimi 整理结构,Claude 深挖核心问题 |
正式发布或高风险任务 | Claude 或 Qwen | 另一模型交叉核验 | 最后由人确认公告、政策文件和原始数据 |
重要任务可以采用一个简单的双模型流程:一个模型负责分析,另一个模型只检查事实、时间、单位、分母、政策性质和计算,最后由人确认原始公告或政策文件。
可以在分析完成后单独追加下面这段提示词:
请单独检查事实、时间、单位、分母、政策性质,以及引用是否支持结论。只列可能推翻结论的错误,不要继续润色正文。
这段提示词不能替代人工核验,但可以帮助用户更快发现足以改变结论的问题。
nashnova 为什么不提供一个统一总榜
本次评测比较的是六个模型接入 nashnova 投研环境后的实际表现,而不是官网聊天页面或 API 裸模型能力。
在同一套产品环境中,模型可以使用相同的金融数据、投研 Skills 和 Agent 流程。这样做的目的,是减少数据和工作流差异,让结果更接近用户在真实投研任务中的使用体验。
但这也意味着,评测结果包含模型与产品环境共同作用后的表现,不能直接外推为基础模型在所有场景中的绝对排名。
nashnova 的产品逻辑也不是让用户押注一个永远排名第一的模型。不同研究任务对可靠性、深度、速度和成本的要求不同。用户应根据任务切换模型,并保留来源核验、计算复核、反方检查和人工确认。
因此,回到开头的问题:DeepSeek V4 Pro 能否成为日常投研的主力模型?
可以。
它适合估值、标准化研究和批量任务,也能承担日常大部分研究工作。但“主力”不等于“全能”。复杂研究优先考虑 Claude,政策和宏观问题优先考虑 Qwen,大量材料可以先由 Flash 处理。重要结论则需要交叉核验和人工确认。
附录:三套评测完整成绩
1. 金融可靠性评测
这套评测关注回答能否进入正式研究或发布流程。评分覆盖事实、时间、政策性质、计算、证据、推理和表达。若出现足以推翻结论的严重错误,相关题目会触发封顶。
排名 | 模型 | 质量分 | 最终分 | 红线次数 |
1 | Qwen3.8-Max | 87.65 | 87.65 | 0 |
2 | Claude Opus 5 | 85.89 | 85.89 | 0 |
3 | DeepSeek V4 Flash | 85.71 | 81.15 | 1 |
4 | DeepSeek V4 Pro | 84.83 | 80.57 | 1 |
5 | GLM-5.2 | 83.45 | 78.59 | 1 |
6 | Kimi K3 | 82.29 | 75.29 | 2 |
质量分是红线处理前的综合表现,最终分已经计入严重错误封顶。Qwen3.8-Max 和 Claude Opus 5 没有触发红线;其余模型的质量分并不低,但严重错误拉低了最终成绩。
2. 研究质量与深度评测
这套评测采用五个等权维度:数据覆盖、数据准确性、推理质量、结论质量和回答质量。每项最高 5 分,单题满分 25 分,正式总分来自 13 道盲评题。
排名 | 模型 | 总分 | 得分率 | 单题第一 |
1 | Claude Opus 5 | 323 / 325 | 99.4% | 11 |
2 | Qwen3.8-Max | 292 / 325 | 89.8% | 6 |
3 | Kimi K3 | 282 / 325 | 86.8% | 2 |
4 | DeepSeek V4 Pro | 269 / 325 | 82.8% | 0 |
5 | GLM-5.2 | 261 / 325 | 80.3% | 1 |
6 | DeepSeek V4 Flash | 248 / 325 | 76.3% | 0 |
Claude Opus 5 在复杂研究中的领先较明显。接近满分的结果也提醒我们,单一模型裁判及其写作偏好可能影响开放题评分,因此这张表更适合观察研究上限,不适合单独代表所有投研能力。
3. 实际使用体验评测
这套评测关注模型在产品中的综合使用感受,包括事实与计算质量、输出长度、等待时间和批量任务适配度。成绩采用两轮独立评分后的共识分。
排名 | 模型 | 共识分 | 使用定位 |
1 | Claude Opus 5 | 85.9 | 研究上限较高,输出较长 |
2 | DeepSeek V4 Pro | 84.4 | 适合日常和标准化任务 |
3 | Qwen3.8-Max | 80.7 | 综合能力较强,计算需复核 |
4 | Kimi K3 | 80.3 | 产业和长材料任务较好 |
5 | DeepSeek V4 Flash | 77.0 | 速度优先型选择 |
6 | GLM-5.2 | 61.0 | 尾部错误风险较高 |
部分政策与跨资产题被单列,没有进入这张通用能力主榜。因此,它适合判断日常使用体验,不适合单独判断政策任务风险,也不能证明模型重复生成的稳定性。
三张表应分别阅读:金融可靠性回答“内容能否进入正式研究流程”,研究质量回答“复杂问题能否做深”,实际使用体验回答“日常使用是否顺手”。
本文用于模型能力研究与教育,不构成投资建议,不提供荐股、买卖指令、收益承诺或自动交易服务。DeepSeek V4 Pro 的发布时间及官方能力信息参考 2026 年 8 月 13 日公开资料。
