Manus-Bot Lite 档位已接入 DeepSeek-V4-Flash High:从脑筋急转弯到可执行工作流

今天,我们宣布 Manus-Bot Lite 档位已接入最新版本的 DeepSeek-V4-Flash High。

这次升级的重点,不只是“回答更聪明”,而是让模型在面对复杂任务时更愿意先拆解、再验证、最后交付。你可以把它用来解一道容易掉坑的逻辑题,也可以把一份需求、几张表格和一堆限制条件交给它,让它以合适的 Agent 角色,调用对应的 Skill,整理成一份可以继续执行的结果。

为什么是 Lite 档位 × DeepSeek-V4-Flash High

DeepSeek 官方资料显示,V4-Flash 是一个面向高效率场景的 MoE 模型,总参数量为 284B、激活参数量为 13B,支持 1M 上下文;官方 API 同时提供 Thinking / Non-Thinking 模式、工具调用和结构化输出能力。DeepSeek 官方发布说明 模型与定价文档

Lite 档位底层使用 DeepSeek-V4-Flash,并启用 High 推理 effort。它不保证每一道题都正确,但更适合以下任务:

  • 条件很多、一步错就全盘错的逻辑推理
  • 需要拆成多个阶段的规划、分析与写作
  • 需要读懂长文档、表格和上下文关系的工作
  • 需要把结论整理成方案、代码、测试清单或交付物的任务

DeepSeek 官方模型卡给出了不同推理档位的参考结果。以 V4-Flash High 为例,模型卡报告的 MMLU-Pro 为 86.4、GPQA Diamond 为 87.4、LiveCodeBench 为 88.4;这些数字来自模型卡的特定评测设置,不是 Manus-Bot 的内部承诺,也不能替代你在真实任务中的验证。DeepSeek-V4-Flash 模型卡

先来四道题,看看它是否真的会“想清楚”

我们挑的不是只考知识记忆的题,而是能暴露推理过程、约束管理和交付质量的题。你可以把下面的 Prompt 直接复制到 Manus-Bot 里测试。

1. 四张牌:专门测试条件命题与反例

桌上有四张牌,朝上的一面分别是:3、8、蓝色、红色。每张牌的另一面要么是数字,要么是颜色。请问为了验证“如果一面是偶数,那么另一面一定是蓝色”,最少必须翻哪几张牌?请先写出可能推翻规则的情况,再给出答案。

这道经典的 Wason selection task 很适合测试模型有没有抓住“只需要寻找可能违反规则的牌”,而不是把所有牌都翻一遍。标准答案是 8 和红色牌;只翻 8 可以检查它背面是否为非蓝色,翻红色可以检查它背面是否为偶数。Wason selection task 介绍与答案

在 Manus-Bot 里,建议再追问一句:“请用反例而不是直觉解释为什么 3 和蓝色牌不必翻。”好的回答应该能把必要性和充分性分开,而不是只报两个选项。

2. 小数与字母:测试多轮对话中的精确性

第一问:9.11 和 9.8 哪个更大?请用位值解释。
第二问:单词 strawberry 里有几个字母 r?请逐个标出位置。
第三问:把前两题的答案压缩成一张两列表格,并说明第二题为什么不能只凭单词外观估计。

这组题看起来简单,却同时测试小数比较、字符计数、跨轮上下文和格式化输出。DeepSeek 官方 Thinking Mode 文档也使用了相近的“小数比较 + strawberry 字母计数”示例,作为多轮推理与内容输出的演示。DeepSeek Thinking Mode 文档

参考答案是 9.8 更大,strawberry 中有 3 个 r。真正值得观察的是:模型能否把“答案”和“验证过程”分开,且不会因为上一轮的结论改变下一轮的计数。

3. 斑马谜题:测试约束是否能被完整保留

请解决经典 Zebra Puzzle:有五栋相邻房屋,每栋房屋的颜色、住户国籍、饮品、香烟品牌和宠物都不相同。请使用完整线索建立逻辑表,逐条标注排除关系,最后回答“谁养鱼”,并检查是否存在第二组同样满足全部线索的解。不要只给最终答案。

Zebra Puzzle 本质上是一个约束满足问题,长期以来也被用来测试程序和大模型的逻辑推理能力。Zebra Puzzle 说明

这道题的验收标准不是“猜中鱼是谁”,而是三点:线索有没有漏掉;中间的排除是否能复核;最终解是不是唯一。对于需要可信交付的工作,High 推理和结构化输出往往比一句看似漂亮的结论更有价值。

4. 从题目到交付物:测试 Agent + Skill 协作

最后把“会解题”换成一项真实工作:

我准备把一个已有的聊天产品拆成可演进的多 Agent 架构。请以“IT 架构师”角色工作,并挂载“产品规划、技术方案、编程实现、代码评审”四个 Skill。请输出:1)目标用户与核心场景;2)Agent、Skill、模型和工具的边界;3)一次请求从输入到交付的流程;4)最小可行版本的接口与数据结构;5)迁移步骤;6)风险、回滚和验收标准。对每一项标注“已知事实 / 设计假设 / 待确认问题”。

这道题没有唯一答案,反而更接近真实工作。Manus-Bot 的 Agent 负责保持工作视角,Skill 负责给当前回合补上做事方法:产品规划帮助澄清目标和验收,技术方案帮助划定边界,编程实现把需求落到代码,代码评审则优先寻找缺陷和测试缺口。一次消息最多可以组合多个 Skill,让输出从“建议”走向“可执行的下一步”。

真正的升级:模型能力被组织成工作流

单独使用一个强模型,得到的可能仍然只是一个更长的答案。Manus-Bot 的设计重点,是把模型能力放进一个可选择、可复用的工作界面里:

Manus-Bot Agent 选择界面

  1. 先选择任务角色:例如写作、产品经理、数据分析师、IT 架构师或测试工程师。
  2. 再选择当前回合需要的 Skill:例如技术方案、写作润色、代码实现或产品规划。
  3. 用 High 推理处理复杂约束,并明确要求输出格式、验收标准和待确认问题。
  4. 让结果继续进入下一轮对话、文档、代码、表格或其他可交付物流程。

这也是我们理解的 Agent:不是让模型“替你想一切”,而是让它在正确的角色、方法和边界里,把一个模糊目标推进到下一步。

你可以马上试试

打开 Manus-Bot,选择 Lite 档位,先从上面的四道题开始。然后换成你自己的任务:一份 PRD、一组会议纪要、一张数据表,或者一段需要重构的代码。

给它一个清楚的目标,挂载合适的 Skill,再要求它列出假设、验证方法和交付格式。你会更容易看到这次升级真正改变的地方:模型不只是给出答案,而是在帮助你把问题变成一条可以继续走下去的路径。

更多产品能力与使用入口,欢迎访问 manus.kim

体验 DeepSeek-V4-Flash High

打开 Manus-Bot Chat,选择 Lite 档位,并用 Agent 与 Skill 处理真实任务。

立即体验