The AI I actually recommend in 2026 — from real use, not benchmarks
At a glance
One subscription? Still ChatGPT Plus. Images: ChatGPT first, Doubao fine in China. Video: Seedance 2.0 first pick, MiniMax H3 closing fast. Claude is strong but hard to access from mainland China. Grok 4.6 deserves a fresh look. Full essay currently in Chinese.
This essay is currently written in Chinese.
网上现在的 AI 排行榜太多了。这个模型第一,那个模型又超过谁,今天刚排完,过两周可能又变了。
所以这篇我不想做成什么"全球十大 AI 权威排名"。我只是从一个普通使用者、做生意和日常运营的角度,说说我自己现在真正愿意用什么、愿意为什么付钱,以及如果朋友第一次问我"AI 到底用哪个",我会怎么推荐。
如果现在只能让我花钱订一个,我还是选 ChatGPT Plus
ChatGPT Plus 现在还是 20 美元一个月。官方提供更高的模型使用额度、推理、文件分析、图片生成、Deep Research 等功能;Plus 现在也可以使用 GPT-5.6 Sol 的推理能力以及 Codex。
为什么我觉得这 20 美元比较值?不是因为它每一项都永远世界第一,而是因为它现在真的比较像一个什么都会一点、而且很多事情都做得很好的全能助理。
我平时直接在网页版跟它聊天,让它查资料、搜公司、分析客户、比较产品、看文件、帮我整理思路,这些工作基本不用另外换软件。很多时候我甚至懒得自己去搜索,直接告诉它:
帮我查一下这家公司到底做什么,有没有官网,规模怎么样,这个人可能是什么职位,最后告诉我这个客户值不值得重点跟。
它自己搜索、整理,然后把结果告诉我。这才是现在 AI 最实用的地方——不是陪你聊天,而是帮你少干很多杂活。
ChatGPT 另外一个让我舍不得换掉的原因:图片真的很好用
这不是我一个人的感觉。目前 Artificial Analysis 的盲测排行榜里,OpenAI 的 GPT Image 2 在文生图排第一,在图片编辑榜也排第一。我自己实际用下来也差不多是这个感觉。
特别是做产品图的时候:
把这个绿色产品改成黑色,其他地方不要动。
包装这里加一个 Logo。
把中文改成英文,背景不要变,产品结构不要乱。
以前这种事情经常要找美工慢慢修,现在很多时候直接把图片丢进去,说人话就可以了。当然它也不是 100% 听话,有时候还是会改错产品细节,但目前整体来说,我个人还是把它放第一选择。
如果你没有条件用 ChatGPT,国内其实也不用纠结:豆包现在做图片也挺不错。普通人本来就不是天天做专业广告大片,做一张海报、改一下产品颜色、弄一张社交媒体图,豆包已经完全值得试。
所以我不会告诉小白"必须订某某海外 AI,不然什么都做不了"。没必要。能解决你的问题,就是好工具。
还有一个容易被普通人忽略的东西:Codex
很多人买了 ChatGPT Plus,就只知道网页版聊天。其实你已经可以继续往前一步,用 Codex。
GPT-5.6 系列目前已经进入 Codex,Plus 用户可以使用 Sol、Terra、Luna 等模型。额度按账号动态管理,不用死记"每周多少条",看自己账号里的剩余额度最准确。
Codex 是什么?最简单理解:
ChatGPT 是坐在旁边告诉你怎么干。
Codex 是开始自己动手帮你干。
比如:帮我改这个网站、帮我看看这个程序为什么报错、帮我整理这些文件、帮我写一个小工具。甚至:
我不懂这个,你先检查一下,告诉我你准备怎么做,确认以后再操作。
它可以自己读文件、运行命令、修改东西、再检查结果。到了这里你会突然发现:AI 跟以前已经不是一个东西了。
Claude:我承认它很强,但国内普通用户我不会优先推荐
这个我要分开说。
如果只讨论能力,Claude 确实非常强。目前 Artificial Analysis 的测试里,Claude Opus 5 和 Fable 5 仍然处在最前沿的位置:Opus 5 得分 61,Fable 5 为 60,GPT-5.6 Sol 为 59。所以没有必要为了站队说 Claude 不行——它是真的强,特别是写代码、长任务、复杂工作,我完全承认它属于第一梯队。
但是问题来了:一个工具再强,你正常用不上,对普通人有什么意义?
Anthropic 官方目前并不在中国大陆提供 Claude 商业访问,中国大陆也不在 Claude 的支持地区名单里。所以如果你是国内普通用户,又不想折腾账号、地区和各种使用条件,我不会第一句就跟你说"赶紧去订 Claude"。
我会告诉你:知道它很强就行。有正规、稳定条件可以用,再考虑。否则先把 ChatGPT、豆包、DeepSeek、Kimi 这些自己能够正常使用的工具玩明白,更实际。
Grok 反而是最近值得重新看一眼的
我以前没有把 Grok 放特别前面,但最近这一波确实起来得很快。
Grok 4.6 已经在 8 月 12 日发布,外部评测显示它相比 4.5 又有明显提升,综合能力已经来到 GPT-5.6 Sol 附近,而且价格竞争力很强。所以最近你会看到越来越多人说"Grok 好像突然变得挺香"——这不是完全没有依据。
而且 Grok 现在也越来越不像单纯聊天机器人:网页搜索、图片、视频、文件、Connectors、Skills、自动化,还有 Grok Build 这样的 Coding Agent。
我的态度是:如果已经有 ChatGPT,不一定马上再付一份钱。但如果你喜欢折腾 AI、做编程、看实时信息,或者想看看 OpenAI 之外现在谁追得比较快,Grok 很值得试。
Gemini:不是不能用,只是我最近没有以前那么想主动打开它
这纯粹是我的个人使用感受。Google 当然没有掉队。
Gemini 3.6 Flash 七月才发布,重点提升的是速度、Token 效率和 Agent 场景。第三方测试里它的 Intelligence Index 大约 50,速度非常快,只是目前最顶级的一批旗舰已经到了接近 60 甚至 60 以上。
所以我的感觉更像是:它不是差,而是目前没有让我产生"非它不可"的感觉。如果你本身重度用 Gmail、Google Drive、Docs、YouTube,Gemini 当然还是很有价值。但如果让我现在从零开始只花一份订阅钱,我个人还是不会先选它。
有趣的是,Google 的视频模型反而很强:Artificial Analysis 当前有声文生视频榜里,Gemini Omni Flash 排第一。所以也不要简单理解成"Gemini 不行了"——AI 现在已经不能只看一个聊天窗口了。
视频这一块:我现在还是觉得 Seedance 2.0 最厉害,H3 最近也跟上来了
如果说图片我现在最常用 ChatGPT,那视频这一块,我目前自己的感受还是:Seedance 2.0 最强。
至少从我自己实际接触和看过的大量生成效果来说,Seedance 2.0 目前给我的感觉是最稳的一个。特别是人物动作、镜头运动、画面完成度,还有复杂提示词的理解,整体成功率比较高。
做视频跟聊天模型不太一样。聊天回答不好,大不了重新问一次;但视频生成一次要等时间、也要花额度,所以我更看重的是:
到底要抽几次,才能拿到一条真正能用的视频?
从这个角度来说,我目前还是最喜欢 Seedance 2.0。不是说它每一条都完美——AI 视频一样会出现人物变形、手不对、物体穿帮、镜头不听话。但综合来看,它还是我认为最值得优先尝试的视频模型。
网上已经有不少 Seedance 2.5 的消息和使用讨论,但我查官方公开资料时,字节 Seed 目前主推、资料最完整的仍然是 Seedance 2.0,第三方公开盲测大量覆盖的也还是 2.0。所以我的态度是:Seedance 2.5 我会重点关注和实际测试,但不急着写"已经世界第一",等公开版本、价格和第三方盲测稳定以后再下结论。
不过 MiniMax H3 最近也明显跟上来了
H3 是最近让我比较意外的一个。以前说视频模型,我可能第一时间不会想到 MiniMax,但 H3 出来以后已经明显进入第一梯队竞争。
它 7 月 31 日正式发布:能理解文本、图片、视频、音频,最高生成 15 秒 2K 视频,自带立体声,还支持视频编辑和动作迁移。真实公开成绩也非常漂亮:Artificial Analysis 有声文生视频盲测里 H3 基本和第一名咬得很紧,视频编辑榜目前直接排第一。
所以我现在的判断不是"Seedance 2.0 天下无敌",而是:
Seedance 2.0 目前还是我的第一选择,但 H3 已经追得很近,而且很值得继续观察。
第一次想试 AI 视频?我的建议很简单:第一选择 Seedance 2.0,先试它;结果不满意或想比较另一种风格,再试 H3。至于排行榜今天谁第一明天谁第二,我反而不太纠结——对普通用户来说最实际的还是:同样一个提示词,我生成几次才能得到满意结果?能让我少抽卡的那个,才是我愿意长期用的。
那普通人到底怎么选?
如果你完全不想研究这么多名字,我的建议特别简单。
第一次用 AI:先找一个你能稳定使用的综合 AI。有条件,我个人首推 ChatGPT Plus;没条件,豆包、DeepSeek、Kimi 这些国内产品先用起来完全没问题。先把"怎么跟 AI 说清楚事情"学会。
等你发现"原来 AI 真的能帮我工作",再继续往 Codex、Claude Code、Grok Build、Cursor 这些 Agent 工具走。
图片也是一样:先用 ChatGPT 或豆包。视频再根据需求试 Seedance、H3。
千万不要一上来注册十几个 AI,然后每天研究哪个 Benchmark 高了两分,最后一个都没真正用起来。
我现在越来越觉得:AI 最重要的不是"谁第一",而是谁真正替你干活
排行榜当然有价值,但我现在判断一个 AI 值不值得用,更看这几个问题:
我每天会不会打开它?
它能不能帮我少做重复工作?
它能不能看懂我的文件、图片和真实业务?
它能不能搜索资料并给我一个靠谱结果?
出了问题,我能不能继续跟它说,让它自己改?
它能不能从"告诉我怎么做",慢慢变成"直接帮我做"?
如果答案越来越多是"可以",这个工具对我就有价值。
所以这篇文章以后我会持续更新。AI 变化太快了,今天的第一,半年以后可能都没人提了。我更愿意记录:现在我真正花钱用什么、为什么用,以及哪些东西用了以后确实帮我省了时间。这比单纯做一张"AI 排行榜",对普通人可能更有参考价值。
What changed since last month?
- 2026-08-18First published.