Hermes Agent中文社区
当前位置模型评测
08
MODEL REVIEWS

AI 模型评测

所有优点和缺点,均根据 Hermes Agent 中文社区成员的真实群聊发言整理汇总。

RECENT MODELS

最近6 个月发布的新模型

选择模型,直接查看优缺点和适用场景。

智谱 Z.ai国内模型
发布于 2026年8月14日

代码执行力与稳定性获得早期认可,但模型太主动时也会快速消耗额度。

计费
$1.40 / $4.40常见 API 接入参考价
上下文
1M tokens最大输出 128K
能力
文本输入深度推理工具调用

优点

  • 复杂编码和长任务的完成度反馈较好
  • 部分用户认为它比同价位模型更稳
  • 适合作为关键开发任务的执行模型
社区评价

同价位换到 GLM-5.3 后,长任务明显更稳;开发和严谨项目可以放心交给它。

缺点

  • 发布时间短,长期稳定性仍需观察
  • 问题不够明确时可能直接开工并大量调用子任务
  • 价格和套餐消耗仍是主要顾虑
社区评价

能力不错,但价格不低;有时会自己推进很多步骤,额度掉得很快。

适合复杂编码代码审查长程 Agent
Moonshot AI国内模型
发布于 2026年7月17日

前端设计与复杂编程表现亮眼,社区共识也很明确:能力强,但慢、贵、烧额度。

计费
$3 / $15Moonshot API
上下文
1M tokens最大输出 128K
能力
文本输入图片输入视频输入深度推理工具调用开放权重

优点

  • 前端页面生成和视觉完成度获得高频好评
  • 复杂工程任务中被认为足够聪明、可独立推进
  • 适合不希望依赖组件库的定制化界面
社区评价

前端页面换成 Kimi K3 后,视觉效果一下精致了很多,完成度也更高。

缺点

  • 思考时间长,端到端任务成本容易超预期
  • 套餐和 API 额度消耗快,个人用户压力较大
  • 部分长任务出现卡住或体验波动
社区评价

处理工程图纸时能力够强,但价格高、容易卡,套餐消耗也很快。

适合前端设计复杂编程知识工作
OpenAI海外模型
发布于 2026年7月9日

Sol 常被用作复杂任务的收尾大脑,速度和完成质量突出;成本与额度仍需精细控制。

计费
Sol $5 / $30Terra $2 / $12 · Luna $0.20 / $1.20
上下文
1.05M tokens最大输出 128K
能力
文本输入图片输入PDF深度推理工具调用

优点

  • 复杂开发和严谨任务中,整体完成速度被反复认可
  • 适合给本地小模型工作流做规划、审查和最终交付
  • Luna 降价后成为更容易尝试的轻量入口
社区评价

公司里不赶时间会用 K3,追求速度时就切 GPT-5.6,复杂任务收尾很快。

缺点

  • Sol 长任务仍可能快速消耗套餐额度
  • 不同档位能力差异大,不能只写“GPT-5.6”做比较
  • 少量用户反馈阶段性的体感波动
社区评价

Sol 的长任务还没跑完额度就见底,需要提前规划模型档位和预算。

适合复杂开发最终审查多模型编排
智谱 Z.ai国内模型
发布于 2026年6月16日

代码能力、速度和套餐性价比形成稳定口碑,实际体验主要受接入平台的上下文与路由影响。

计费
$1.40 / $4.40Z.ai API
上下文
1M tokens最大输出 128K
能力
文本输入深度推理工具调用开放权重

优点

  • 编码和工程任务能力在国产模型中认可度高
  • 部分正规接入渠道速度快、额度相对充足
  • 长上下文适合大型代码库和资料处理
社区评价

NVIDIA 接入的 GLM-5.2 响应已经很快,连续调用也很少遇到限流。

缺点

  • 部分第三方接入把上下文截断到约 200K
  • 不同供应商的速度、限流和输出质量差异明显
  • 是否适合全自动 Agent,社区仍有分歧
社区评价

有些平台把上下文压到约 200K,同一个模型换个入口后体验差别很大。

适合日常编码长上下文国产替代
Anthropic海外模型
发布于 2026年6月9日

Claude Fable 5

官方发布

仍被视作复杂工程任务的能力上限之一,但价格、限额与接入稳定性让它难以成为日常默认。

计费
$10 / $50Anthropic API
上下文
1M tokens最大输出 128K
能力
文本输入图片输入PDF深度推理工具调用

优点

  • 复杂技术任务和前端实现的完成度被频繁拿来做标杆
  • 长链路任务中,推理与执行衔接更稳
  • 适合预算充足且结果质量优先的关键工作
社区评价

复杂搭建任务里,Fable 5 仍是少数能同时做得又快又好的模型。

缺点

  • 官方 API 与中转接入成本都偏高
  • 账户、限额和可用性问题增加了使用门槛
  • 也有用户认为实际体感没有榜单宣传那么悬殊
社区评价

官方 API 做一份几千字文档就可能花二十多美元,而且还会受额度限制。

适合核心工程高质量前端长程任务
MiniMax国内模型
发布于 2026年6月1日

MiniMax M3

官方发布

速度、长上下文和多模态让它适合量大管饱的日常任务,幻觉与视觉识别质量是主要短板。

计费
$0.30 / $1.20超过 512K:$0.60 / $2.40
上下文
1M tokens最大输出 128K
能力
文本输入图片输入视频输入深度推理工具调用开放权重

优点

  • 早期速度体验突出,适合高频日常任务
  • 长上下文和多模态覆盖面广
  • 在专业要求不极端时,整体性价比较好
社区评价

M3 刚上线时速度非常快,处理大量普通任务的体验很顺手。

缺点

  • 幻觉、模型身份混乱等可靠性反馈较集中
  • OCR 和细粒度识图效果不够稳定
  • 工具调用多时,套餐额度可能很快耗尽
社区评价

识图和 OCR 不够稳,偶尔会产生幻觉,还会自己改变任务方向。

适合批量日常任务长资料处理多模态入门
DeepSeek国内模型
发布于 2026年4月24日

DeepSeek V4

官方发布

响应速度与缓存效率撑起日常编码口碑,平台调价和路由差异则让性价比评价明显分化。

计费
Flash $0.14 / $0.28Pro $0.435 / $0.87
上下文
1M tokens最大输出 384K
能力
文本输入图片输入(Vision Exp)深度推理工具调用开放权重

优点

  • Flash 响应快,在 Claude Code 等代理工作流中体感顺手
  • 官方 API 的缓存命中反馈稳定,Pro 更适合复杂代码
  • 讨论覆盖最广,常被当作国产模型的比较基线
社区评价

V4 Flash 接进 Claude Code 后响应很快,官方 API 的缓存命中率也很稳定。

缺点

  • 免费入口收缩与平台价格变化影响使用预期
  • 不同平台的缓存、上下文和路由实现差异很大
  • 部分用户反馈阶段性的能力波动
社区评价

同样的 V4 Flash 换到不同平台,缓存和价格差异很大,积分消耗也会明显增加。

适合编码代理高频调用国产基线
OpenAI海外模型
发布于 2026年4月23日

关键编码任务中仍有很强的质量口碑,但价格、真假路由和阶段性降智构成持续争议。

计费
$5 / $30Pro $30 / $180
上下文
1.05M tokens最大输出 128K
能力
文本输入图片输入PDF深度推理工具调用

优点

  • 高难度编码和交付任务中,产出效率被频繁认可
  • 适合把便宜模型的工作结果做最终审查
  • Codex 内的可用性降低了部分用户的尝试门槛
社区评价

GPT-5.5 确实好用,适合把便宜模型完成的结果再做一遍最终审查。

缺点

  • 高质量同时伴随较高调用成本
  • 中转渠道存在模型标识与实际路由不一致的担忧
  • 用户对不同日期、不同入口的能力一致性有分歧
社区评价

能力很强,但 token 消耗让人不敢放开跑;有些中转的实际路由也不够透明。

适合关键编码最终审查复杂知识工作
阿里云通义千问国内模型
发布于 2026年4月2日

本地部署生态与中文体验讨论最热闹,模型能否好用高度依赖具体版本、量化方式和硬件配置。

计费
Plus $0.50 / $335B-A3B $0.248 / $1.485
上下文
Plus 1M tokens开源版本 262K · 最大输出 64K
能力
文本输入图片输入视频输入音频输入(开源版)深度推理工具调用部分开放权重

优点

  • 开放版本和 Apache 2.0 授权方便本地与商用部署
  • 35B-A3B 等 MoE 版本兼顾知识量与显存占用
  • 中文表达与轻量本地任务有稳定拥趸
社区评价

本地的 Qwen3.6 27B 能解决一些云端模型直接放弃的问题,中文任务也够用。

缺点

  • Plus、Max 与多个开源尺寸让横向比较容易失真
  • 高内存、量化和 GPU 卸载方式显著影响实际速度
  • 高难度工程任务的能力反馈分化较大
社区评价

不同尺寸和量化差别很大;同样是 35B,有人觉得快,也有人觉得完全不好用。

适合本地部署中文写作轻量 Agent
HERMES CN COMMUNITY

思之所至,行之所达。

WHERE THOUGHT REACHES, ACTION FOLLOWS.

BUSINESS / 01

商务与合作

商务合作、联合发布和社区项目,请通过邮件联系。

联系社区商务
DESIGN & PRODUCT / 02

网站设计与产品支持

本站的设计与产品系统由 WanderMinds 参与完成。

访问 WanderMinds.ai
LEGAL / NOTICE

本站由 Hermes Agent 中文社区独立维护,不代表 Nous Research 的官方立场。

OPEN SOURCE · COMMUNITY MAINTAINEDHERMES AGENT 中文社区 · 2026

快速导航

选择要前往的页面。