扫描二维码
手机浏览

这个国产模型还没正式发布,梗图和demo已经先刷屏了

AI新榜
新榜独家
AIGC

作者 | 懒人
编辑 | Kino


Kimi K3刚刚为中国AI模型争了个光,千问Qwen3.8立刻接棒。


7月19日,官方发布称,Qwen3.8很快将发布并开源,并给出了Qwen3.8-Max-Preview预览版模型,可以提前体验。



官方还放出了一句狠话:这可能是除了Fable 5以外,目前最强大的模型。


说实话,看到这句话我们第一反应是:又在这儿营销了。


但实测之后,对不起,刚刚是我们太大声了。


不只是我们,Qwen3.8-Max-Preview官宣后,海外社交媒体上这几天已经玩疯了。



Qwen3.8刷屏的这几天,

网友们都在玩什么


比正式模型先来的,是梗图。


网友“jack”率先贴出了经典的巨龙梗图,Kimi和Qwen俨然成了后来居上的两条“巨龙”。



Kimi和Qwen都宣布会开源,对比OpenAI和Anthropic继续走闭源路线,网友很快又玩起了梗。




美国风投公司FirstMark Capital的合伙人Matt Turck也在X上发了一个视频,配文是:每当中国发布顶级开源模型时OpenAI和Anthropic的表情如下。



评论区还有人调侃,没有什么比中国模型更能刺激这两家公司迅速迭代了。



梗图之外,网友已经把GPT-5.6、Kimi K3、Fable 5和Qwen3.8-Max-Preview拉进同一个竞技场。


网友“岚叔”用同一条提示词让四个模型各自生成可视化场景,进行横向对比。


比如这组“猎豹举杯冲刺”的运动海报。作者的提示词里只要求做一个高质量SVG冠军运动海报,并加入记分牌。Qwen3.8-Max-Preview不仅完成了画面,还加上了绝杀之夜、金豹擎杯等文案。



再看经典的施瓦西黑洞模拟,盘面的色间拉伸以及视角翻转时的效果,Qwen3.8的完成度都还不错。



网友“Thành”还分别让Qwen3.8-Max-Preview和Fable 5制作一段方块像素3D风格的足球动画。两段成片的画质和风格各有偏好,但价格差距相当直观:Fable 5花了1.105美元,而Qwen3.8-Max-Preview只花了0.012美元。



网友“Berryxia.AI”则用它做了一个3D放映机demo,不仅动画和交互比较完整,还支持用户在本地上传PDF、MP4和PPT等文件。



YouTube上,也已经有博主开始拿它跑更重的任务,测试反馈很好。比如基于浏览器的工作流程、地铁场景生成、第一人称射击游戏的开发、C++游戏创作、3D CAD建模、微控制器相关操作,以及城市时间线的生成。



最离谱的是,Qwen3.8-Max-Preview这个模型可能是在按天迭代。


网友“团长”用同样的提示词连续测了两天,第二天的结果里,建筑结构、光影和粒子特效都有明显提升,模型的思考过程也比前一天长了不少。他自己都说,今天的结果,像昨天那个版本又多跑了至少两轮对话。



网友“Harshith”尝试用Qwen3.8-Max-Preview把一张火车图片转换成Three.js 3D场景,结果超出了他的预期。随后他在评论区提醒其他人:如果你几个小时前玩过了这个模型,建议再去试试,感觉它比几小时前更好了。



当然,单个案例可能受到随机性、推理时长和工具环境等因素影响,还不足以证明模型真的每隔几小时就会发生一次能力跃迁。


但至少可以确定,Qwen3.8-Max-Preview并不是一个已经固定下来的正式版本。预览期内,它的能力、稳定性乃至使用成本都仍有可能继续变化。



实测Qwen3.8-Max-Preview,

从零做一个APP


看了这么多demo,我们也决定自己试试。


Qwen3.8-Max-Preview目前可以通过Token Plan订阅,以及Qoder、QoderWork等产品体验。网页版也有一定的免费额度,但从我们的实际体验来看,网页版在执行复杂任务时稳定性一般。



于是,我们也浅浅花了39元,入手了Token Plan个人版Lite档,立马开测。


拿到API Key之后,将Qwen3.8-Max-Preview接入Agent,给它一个任务:


我想做一个方便自己运动的小工具,主要场景是这样:我在抖音和B站刷到觉得适合自己的运动视频,发进来,帮我安排成合理的运动计划,我一周4练,目标减脂。然后每个视频练完后,如果我觉得没用,可以删除,剩下的继续轮练。这是核心功能,其他功能你帮我补齐。


这就是全部的需求描述,没有产品需求文档,没有页面原型,甚至连我自己都不知道,一个完整的产品还应该包含什么。


Qwen3.8-Max-Preview接到任务后,先给自己列了个计划:梳理需求,确定工具形态,核心功能如何实现,补齐配套功能,以及在交付前进行语法检查和逻辑复查。



接着就是按部就班执行。执行过程中,它还主动调用了此前已安装的设计Skill,在没有额外指令的情况下,将界面风格与我的审美偏好做了对齐。



在输出了一通我看不懂的代码和专业术语之后,Qwen3.8-Max-Preview直接把一个成型的产品抬上来了。


同时,它还总结了自己完成的工作,并预判了几个可能遇到的问题:抖音视频不一定能稳定抓取标题;换浏览器后,本地保存的数据可能丢失;重要内容最好及时备份。



打开它给的链接,页面上的功能都是可以正常点击的。除了今日训练,还做了本周计划、视频库和数据(训练记录),右上角的设置里,可以调整训练日和训练次数。


产品大概长这样:



特别惊喜的是,我们试了下粘贴b站链接进去,它会一秒自动识别标题、时长,并做了分类,训练计划也按照这套分类排布。



就最初提出的核心需求而言,这个版本已经达到了可用状态。


但,秉承着测评就得多给模型找麻烦,我们又问了:


可以在手机上使用吗?


Qwen3.8-Max-Preview很快识别出我们需要的不是简单把页面缩小,而是一个真正能在移动端打开的版本。它还顺手多想了两步:手机应该怎么访问?数据应该存在哪里?


因为要做移动端,就必然面临部署服务器和存储数据的问题。它先给出了一个局域网方案:只要电脑开着,并且手机和电脑连接同一个Wi-Fi,就能从手机访问。


但我们不满意,继续加码:


希望不依赖这台mac,同时手机和电脑的数据也要同步


提这个要求的时候,我们其实没觉得它能稳稳接住。毕竟,听上去就是个大工程。


它又开始做计划了,涉及到公网部署和跨设备同步需要的工具,在我的授权下一一搞定。



验证通过后,给出了一个公网访问地址。


但由于IP限制,打不开。于是它开始搜索国内能用的托管途径,改用飞书妙搭创建并发布了应用。



这里还有一个小插曲。


它最初使用海外的Firebase实现跨设备同步。后来考虑到国内访问问题,又准备帮我们换成国内的后端服务。


搜了一圈发现都要付费,于是它又重新设计了一个用同步码的方案,可以让两边的视频和训练记录同步,而且不依赖任何第三方服务。



最终给出了一个实际可用的网页端、手机端地址,我们试了下,添加视频、以及同步、修改训练计划都可以正常使用。


这是移动端截图:



我们还录了个实际使用的视频,全程很流畅:



不过,这个任务比较复杂,做到一半就耗尽了5个小时的700额度。最终整个任务消耗了1530额度,差不多用掉了7天额度的61.2%。



实际体验后的一个很明确的感受是,很多类似的产品更多是做执行者,而Qwen3.8-Max-Preview在做产品经理。我们说了一个很具体的需求,它没有只做那一个点,而是自己往前想了一步,补出了一个真实跑起来的产品形态。这对一个不懂怎么把需求说完整的人来说,体感确实很不一样。



这轮SOTA模型已经卷疯了,

但不只是在卷跑分


过去两个月,Fable 5、GPT-5.6、Kimi K3和Qwen3.8接连出现,几乎每隔一两周,就有一个新的旗舰模型登场。甚至已经卷到GPQA Diamond这类传统考题无法有效区分差距的程度,因为已发布的三个模型得分都在91%至95%区间。


Qwen3.8目前还没有公布完整跑分,但从各家公司发布模型时强调的重点来看,这轮竞争显然已经不只是比谁更会做题了。


Fable 5强调的是长任务和复杂任务的能力上限。Anthropic在官方介绍里称,任务越长、越复杂,Fable 5相对其他Claude模型的领先幅度越明显。其代表案例来自Stripe:在一个拥有5000万行Ruby代码的代码库中,Fable 5在一天内完成了一次大规模迁移,而人工团队预计需要两个多月。


GPT-5.6押注的是效率、工具调用和多Agent协作。OpenAI官方发布的标题是“More intelligence from every token”,也就是让每一个Token产生更多智能。在Ultra模式下,GPT-5.6默认可以协调4个Agent并行执行不同工作流,用更多Token换取更高的任务成功率和更短的完成时间。


Kimi K3的定位是“Open Frontier Intelligence(开放式前沿智能)”。它拥有2.8万亿参数、原生多模态能力和100万Token上下文。月之暗面也坦言,其综合体验目前仍落后于Fable 5和GPT-5.6 Sol,但K3已经在长程编程、知识工作和推理任务上进入前沿模型区间。与此同时,Kimi K3的API输入、输出价格大约是Fable 5的30%,完整模型权重也计划开放。


到了Qwen3.8,官方在预告发布里强调了三点:开源、新模型参数2.4T、正在以“天”为单位持续进化。它想证明的同样不只是“跑分跑得好”。


这可能正是这一轮旗舰模型竞争最明显的变化。过去的竞争是一道题、一个回答或者一段代码,现在的竞争可能正逐步变成需要连续执行几十分钟、几个小时,甚至几天的完整任务。


而且,从我们这次实际体验来看,Qwen3.8虽然还是个预览版,已经在给出令人惊喜的结果:我们只说了自己想要什么,它开始替我们考虑,这件事究竟怎样才能真正做成。

           
           




                      
                      

                            
                            

图片
图片


欢迎分享、点赞、推荐
 一起研究AI

           
           

分享文章链接