下载 nashnova App

博客

Deepseek V4 Pro,能不能成为日常投研的主力?

8 月 13 日,DeepSeek V4 Pro 正式版上线。

市场上已经出现了不少模型评测,但对个人投资者来说,以代码能力、通识问答或单一总分为主的榜单只能提供部分参考。真正影响投研使用的,是模型能否读懂财报、处理估值计算、解释市场逻辑,并在涉及事实、时间和政策性质时避免关键错误。

基于这一问题,nashnova 将 DeepSeek V4 Pro、Claude Opus 5、Qwen3.8-Max、DeepSeek V4 Flash、Kimi K3 和 GLM-5.2 接入同一套投研产品环境,使用相同的金融数据、投研 Skills 和 Agent 流程,分别进行了金融可靠性、研究质量与深度、实际使用体验三套评测。

开放研究题由 GPT 5.6 旗舰模型 sol 参与评分,因此该模型没有进入本次横向对比。

我们希望回答一个具体问题:

DeepSeek V4 Pro 能否成为日常投研的主力模型?

结论是:可以,但它并不是所有任务的最优选择。

DeepSeek V4 Pro 适合估值、标准化研究和批量任务;Claude Opus 5 在复杂公司研究和深度推导中表现更强;Qwen3.8-Max 更适合政策、宏观和事件分析;DeepSeek V4 Flash 适合快速筛选大量资讯、财报和行业材料。

Kimi K3 在长材料和产业信息整理方面有优势,但时间线与政策事实需要额外复核。GLM-5.2 能形成完整的分析结构,但本次测试中关键事实和计算错误相对较多,暂不建议直接用于重要投研任务或金融内容发布。

为什么需要三套评测

一份投研回答可以写得很深,却在关键数字上出错;也可以很少犯错,但推理停留在表面。还有一些模型适合快速处理大量任务,却不适合直接承担高风险研究的最终输出。

如果把这些差异压进一个总分,结果很容易误导用户。因此,nashnova 将评测拆为三个问题:

评测体系

主要检查什么

适合回答什么问题

金融可靠性

事实、时间、政策性质、计算、证据和严重错误

回答能否进入正式研究或发布流程

研究质量与深度

数据覆盖、数据准确性、推理、结论和表达质量

模型能否完成复杂研究并形成可继续加工的底稿

实际使用体验

事实与计算、输出长度、等待时间和批量任务适配度

模型是否适合日常、重复的研究工作

三套评测使用不同标准,结果顺序不完全一致。这不是冲突,而是说明模型选择必须从任务出发。

日常使用:V4 Pro 适合标准化和批量任务

在实际使用体验评测中,DeepSeek V4 Pro 与 Claude Opus 5 的共识分接近。

V4 Pro 的优势主要体现在估值、数量测算和标准化研究。它通常能清楚列出公式、单位和计算过程,便于后续检查。对于批量财报问答、公司初筛或固定模板下的估值任务,这种交付方式比偶尔出现一篇写得很漂亮、但难以稳定复用的答案更实用。

需要说明的是,实际使用体验成绩来自两轮独立评分后的共识分。两轮评分并不等于模型在冻结配置下重新生成了两批答案,因此不能单凭这项结果证明模型的重复生成稳定性。更准确的说法是:在本次评测样本和评分体系中,V4 Pro 呈现出较好的日常任务适配度和标准化交付能力。

Claude Opus 5 的优势出现在需要深入拆解的问题中。它更经常主动说明关键假设、反方证据、证伪条件和后续跟踪指标,适合公司深度研究、行业拆解和复杂情景分析。相应的代价是回答通常更长,等待时间也更久。

Qwen3.8-Max 的信息密度较高,政策、宏观和事件分析表现较好。使用时仍应复算金额、单位和比例,避免计算细节影响结论。

DeepSeek V4 Flash 的定位更明确。它适合先处理大量资讯、财报和行业材料,再把真正重要的问题交给更强的模型继续研究。

Kimi K3 更适合长材料与产业信息整理,但时间顺序、政策状态和关键事实需要复核。GLM-5.2 的分析结构通常完整,本次测试中底层事实和计算错误相对更多。

金融可靠性:写得顺,不代表关键地方不会错

金融研究不能只看答案是否完整、流畅。一个关键事实错误,可能推翻后续整条分析链。

本次测试中出现了几类典型问题:使用后来公布的信息解释此前行情,把监管或许可费用解释成关税,以及把 8 亿元写成 81 亿元。

nashnova 将足以破坏核心结论的错误定义为“红线错误”。这类错误不能被其他部分的高分抵消。

整批测试共确认 5 次红线错误:Qwen3.8-Max 和 Claude Opus 5 没有触发;DeepSeek V4 Flash、DeepSeek V4 Pro、GLM-5.2 和 Kimi K3 分别出现一次或多次。

这也解释了 V4 Pro 看似矛盾的结果。它在日常使用和标准化任务中表现较好,但在金融可靠性评测中没有排在最前面,因为其中一次回答将监管或许可费用解释成了关税。

这不是措辞问题。政策性质一旦判断错误,对行业成本、企业盈利和后续政策方向的推导都可能偏离事实。

Qwen3.8-Max 在金融可靠性评测中领先,主要因为它处理政策性质、事件时间线和正式内容时更稳。Claude Opus 5 同样处于第一梯队,并保持了较高的研究深度。但无论模型排名如何,关键数字、来源和计算都仍需人工核验。

研究深度:Claude 更接近可继续加工的研究底稿

避开严重错误,只解决了研究的底线。完成公司研究、行业分析或情景推演,还要看模型是否能展开假设、反证和后续观察项。

这一部分,Claude Opus 5 的优势最明显。

它通常会说明结论依赖哪些条件,哪些证据可能推翻当前判断,以及后续应该跟踪哪些指标。与直接给出答案相比,这种结构更接近可以继续核验和迭代的研究底稿。

Qwen3.8-Max 能提供较高的信息密度,适合形成政策、宏观和事件研究的初稿,但关键计算仍需单独检查。

DeepSeek V4 Pro 的结构更规整,适合按固定模板完成估值、公司问答和标准化研究。遇到多层推导、反方论证和复杂情景分析时,Claude 的完成度更高。

Kimi K3 在产业材料整理方面有一定优势。DeepSeek V4 Flash 适合前期筛选,但不宜直接承担复杂研究终稿。

把三套结果放在一起,V4 Pro 的角色就很清楚了:它可以承担日常的大部分标准化研究工作,但深度、政策或高风险任务应切换模型,或增加更严格的交叉复核。

个人投资者如何按任务选择模型

用户不需要为了这份评测同时订阅所有模型。更实用的方式,是根据自己的高频任务建立主模型和复核模型。

主要任务

优先选择

复核或补充

使用建议

深度公司或行业研究

Claude Opus 5

Qwen3.8-Max

Claude 完成研究底稿,Qwen 检查政策、事实和时间

政策、宏观和事件分析

Qwen3.8-Max

Claude Opus 5

对照政策原文,复算关键数字

估值和数量测算

DeepSeek V4 Pro

Claude 或表格工具

保留公式、单位和分母,使用 Excel 等工具复算

日常批量研究

DeepSeek V4 Pro

DeepSeek V4 Flash

Flash 先筛材料,V4 Pro 处理重点问题

长材料和产业资料

Kimi K3

Claude Opus 5

Kimi 整理结构,Claude 深挖核心问题

正式发布或高风险任务

Claude 或 Qwen

另一模型交叉核验

最后由人确认公告、政策文件和原始数据

重要任务可以采用一个简单的双模型流程:一个模型负责分析,另一个模型只检查事实、时间、单位、分母、政策性质和计算,最后由人确认原始公告或政策文件。

可以在分析完成后单独追加下面这段提示词:

请单独检查事实、时间、单位、分母、政策性质,以及引用是否支持结论。只列可能推翻结论的错误,不要继续润色正文。

这段提示词不能替代人工核验,但可以帮助用户更快发现足以改变结论的问题。

nashnova 为什么不提供一个统一总榜

本次评测比较的是六个模型接入 nashnova 投研环境后的实际表现,而不是官网聊天页面或 API 裸模型能力。

在同一套产品环境中,模型可以使用相同的金融数据、投研 Skills 和 Agent 流程。这样做的目的,是减少数据和工作流差异,让结果更接近用户在真实投研任务中的使用体验。

但这也意味着,评测结果包含模型与产品环境共同作用后的表现,不能直接外推为基础模型在所有场景中的绝对排名。

nashnova 的产品逻辑也不是让用户押注一个永远排名第一的模型。不同研究任务对可靠性、深度、速度和成本的要求不同。用户应根据任务切换模型,并保留来源核验、计算复核、反方检查和人工确认。

因此,回到开头的问题:DeepSeek V4 Pro 能否成为日常投研的主力模型?

可以。

它适合估值、标准化研究和批量任务,也能承担日常大部分研究工作。但“主力”不等于“全能”。复杂研究优先考虑 Claude,政策和宏观问题优先考虑 Qwen,大量材料可以先由 Flash 处理。重要结论则需要交叉核验和人工确认。

附录:三套评测完整成绩

1. 金融可靠性评测

这套评测关注回答能否进入正式研究或发布流程。评分覆盖事实、时间、政策性质、计算、证据、推理和表达。若出现足以推翻结论的严重错误,相关题目会触发封顶。

排名

模型

质量分

最终分

红线次数

1

Qwen3.8-Max

87.65

87.65

0

2

Claude Opus 5

85.89

85.89

0

3

DeepSeek V4 Flash

85.71

81.15

1

4

DeepSeek V4 Pro

84.83

80.57

1

5

GLM-5.2

83.45

78.59

1

6

Kimi K3

82.29

75.29

2

质量分是红线处理前的综合表现,最终分已经计入严重错误封顶。Qwen3.8-Max 和 Claude Opus 5 没有触发红线;其余模型的质量分并不低,但严重错误拉低了最终成绩。

2. 研究质量与深度评测

这套评测采用五个等权维度:数据覆盖、数据准确性、推理质量、结论质量和回答质量。每项最高 5 分,单题满分 25 分,正式总分来自 13 道盲评题。

排名

模型

总分

得分率

单题第一

1

Claude Opus 5

323 / 325

99.4%

11

2

Qwen3.8-Max

292 / 325

89.8%

6

3

Kimi K3

282 / 325

86.8%

2

4

DeepSeek V4 Pro

269 / 325

82.8%

0

5

GLM-5.2

261 / 325

80.3%

1

6

DeepSeek V4 Flash

248 / 325

76.3%

0

Claude Opus 5 在复杂研究中的领先较明显。接近满分的结果也提醒我们,单一模型裁判及其写作偏好可能影响开放题评分,因此这张表更适合观察研究上限,不适合单独代表所有投研能力。

3. 实际使用体验评测

这套评测关注模型在产品中的综合使用感受,包括事实与计算质量、输出长度、等待时间和批量任务适配度。成绩采用两轮独立评分后的共识分。

排名

模型

共识分

使用定位

1

Claude Opus 5

85.9

研究上限较高,输出较长

2

DeepSeek V4 Pro

84.4

适合日常和标准化任务

3

Qwen3.8-Max

80.7

综合能力较强,计算需复核

4

Kimi K3

80.3

产业和长材料任务较好

5

DeepSeek V4 Flash

77.0

速度优先型选择

6

GLM-5.2

61.0

尾部错误风险较高

部分政策与跨资产题被单列,没有进入这张通用能力主榜。因此,它适合判断日常使用体验,不适合单独判断政策任务风险,也不能证明模型重复生成的稳定性。

三张表应分别阅读:金融可靠性回答“内容能否进入正式研究流程”,研究质量回答“复杂问题能否做深”,实际使用体验回答“日常使用是否顺手”。

本文用于模型能力研究与教育,不构成投资建议,不提供荐股、买卖指令、收益承诺或自动交易服务。DeepSeek V4 Pro 的发布时间及官方能力信息参考 2026 年 8 月 13 日公开资料。