vLLM-Omni 上的 MiniMax H3:从系统级优化到基于 FastVideo FastH3 的实时服务
vLLM-Omni 上的 MiniMax H3:从系统级优化到基于 FastVideo FastH3 的实时服务MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。
搜索
MiniMax H3 的服务是一个系统问题。一个请求要经过一个庞大的 Qwen3-VL 编码器、一个长序列的音视频 DiT、相互独立的视频与音频 VAE、设备与进程的边界,最后还要完成 H.264/AAC 的封装。只优化 DiT,其余环节的时延依然留在那里。
杭州自9月20日起向35家市级大学生创业园每人发放一张含1万积分的千问办公token卡,这是千问办公接入Qwen3.8-Max一个月后杭州首次将算力帮扶平铺到个人,标志着其AI产业思路从支持做模型的企业转变为支持用模型的人。
腾讯WorkBuddy、阿里QwenWork等中国大厂AI办公产品出海面临获客成本高企、难以撼动Claude Code和Codex等海外成熟工具用户心智、品牌信任与数据合规门槛较高以及本地化不足等现实阻力,尽管中国AI模型凭借性价比在海外广受欢迎,国产AI办公Agent却尚未打开海外市场。
研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。
前DeepMind AI Scientist团队创立的Inherent获5000万美元种子融资,其基于Qwen3.6-27B后训练的科研判断系统Faraday在AI for Science预留测试集上以0.791的平均得分超越Claude Opus 4.8与GPT-5.5 Codex。
阿里千问新模型,又卷出了新水平。
Perplexity推出本地优先智能体Portable Computer,通过专为端侧模型设计的Harness配合Qwen3.8-27B实现近零成本的本地推理,并在多项基准测试中超越Hermes和Pi等开源通用框架。
Qwen4还没出,架构先开源了。
就在刚刚,阿里交出了一份让人满意的答卷:发布了 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next(两者为同一模型,前者是 API 版本名称,后者是开源版本的正式名称)。它的成绩相当亮眼。在智能体编程基准 DeepSWE 1.1 上,它拿到 58.7 分,而参数规模是它三倍的前代 Qwen3.7-Plus 只有 16.5 分;
Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。