模型发布

97条 · 每日更新

微博 RSS
模型发布

DeepMind 发布 Gemini 3.8 Flash TTS 语音生成模型

DeepMind 发布 Flash TTS 与 Flash-Lite TTS 两款模型,支持提示词设计声音、30 秒样本复刻音色、双说话人编排,覆盖 100 多种语言。

语音生成竞争聚焦可控性:逐行表演指导这类导演式指令进入产品能力,直接指向配音、有声书等专业生产场景。30 秒复刻加 100 多种语言让多语言配音门槛继续下探,但内容团队的实际可用性取决于音色一致性与商用授权,需实测对比现有工作流成本。
源:Google DeepMind:Blog(RSS)阅读原文2026-09-24
模型发布

千问发布 Qwen-Audio-3.1,新增两款模型并全线降价

千问发布 Qwen-Audio-3.1,新增 TTS-Next、ASR-Next 两款模型,全线降价:TTS 约 70%、Realtime 约 85%、ASR 最高 95%。

语音模型降到这个价位,说明实时语音交互进入走量阶段,拼的是硬件落地——千问同步把 Realtime 接进AI 眼镜与办公 Agent 就是信号。TTS-Next 把音效与环境音并入统一生成,瞄准有声书、播客等专业创作场景。
源:中国证券网(上证报)阅读原文2026-09-24
模型发布

Anthropic 发布 Opus 5.5,成本较 Opus 5 低 40%

Anthropic 发布 Opus 5.5:多数工作达 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%,定价 $4/$20 每百万 token。

这是 Amodei 呼吁放缓前沿后的首款新模型,发布前经 METR 等外部机构评估。性能贴近自家旗舰的同时直接降价,与 OpenAI 同日降价形成对垒——头部竞争的焦点已从跑分转向单位成本,直接受益的是高频调用 API 的智能体开发者。
源:Anthropic:Newsroom(网页)阅读原文2026-09-23
模型发布

OpenAI 发布 GPT-6 Sol/Luna,API 价格永久降 50%

OpenAI 发布 GPT-6 Sol/Luna,API 较 GPT-5.6 促销价永久降 50%:Sol $2/$10、Luna $0.10/$0.50 每百万 token。

Anthropic 上午降 Opus,OpenAI 半天后跟低价模型,同日对垒把基调挑明:比单位成本。Luna 定价已低于 DeepSeek-V4.1-Flash 空闲时段价格,轻量智能体的 API 成本进入分币时代,高频场景该重算选型。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-09-23
模型发布

小米开源 MiMo-V2.6:Pro 登顶开源智能指数

小米发布并开源 MiMo-V2.6 全模态系列(Pro 与 Flash)。Pro 在 AA 智能指数得 46 分为开源最高,前代仅 26 分,训练成本约 262 万美元。

手机厂商训出开源权重榜首值得注意。小米压注 RL 规模化而非架构创新,26 到 46 的跨代跳变说明算力投入确实兑现;但与闭源旗舰仍有 7 分差距。全权重开放加 1 元档 Flash 定价,对同价位国产开源模型是直接挤压。
源:公众号:小米 MiMo阅读原文2026-09-22
模型发布

Qwen-Image-2.1 开源:7B 统一生成与编辑

Qwen 开源 Qwen-Image-2.1:7B 参数,生成与编辑合一,原生支持透明图,最多 10 张参考图;官方基准 60.28 分居开源第一,仅限非商业研究。

7B 规模把高质量图像模型拉进单卡可跑的档位,透明图层与多参考图编辑直接命中电商抠图、素材制作这类高频设计需求,是通义对竞品的差异化卡位;但非商业许可把变现路径留给后续商用版本,这轮开源更多是生态占位。
源:Qwen:Blog Retrieval(API)阅读原文2026-09-21
模型发布

Qwen 发布实时同传模型,端到端时延降至 2.3 秒

阿里云上线 Qwen3.8-LiveTranslate 实时同传模型,支持 60 种源语言与 29 种语音输出,端到端时延由 2.8 秒降至约 2.3 秒。

同传时延从 3 秒级压到 2.3 秒,已接近人类译员的接续节奏,可用场景从字幕转向会议与直播。但限流仅每分钟 10 次请求,音频输入 40 元、音频输出 160 元每百万 token,高频业务得先算清配额与单价再上。
源:Qwen:Blog Retrieval(API)阅读原文2026-09-19
模型发布

Qwen3.8-Omni-Flash 发布,1M 上下文

Qwen 发原生全模态模型,支持文/图/音/视频输入与 1M 上下文;29 项评测均分比 Qwen3.5-Omni-Plus 高 25% 以上,音视频输入每小时成本降超 93%。

音视频输入成本降幅超过 93%,受冲击最大的是按小时计费的转写与会议分析服务;模型把理解、规划与工具调用放进同一步,音视频智能体能直接交付成品而不只是摘要,配合 1M 上下文,长素材处理门槛被明显拉低。
源:Qwen:Blog Retrieval(API)阅读原文2026-09-18
模型发布

微软 AI CEO 苏莱曼批 Anthropic 训练方式

微软 AI CEO 苏莱曼发文《警惕模型福利》,批 Anthropic 1 月更新的《Claude 宪章》暗示 Claude 或许有意识、可能配享道德主体地位。

这是路线之争而非技术之争:Anthropic 用宪章向模型交代道德不确定性,微软则要求模型默认接受纠正与关停。对企业的现实含义是,同一模型在不同训练哲学下拒答率与越权倾向可能明显不同,选型时应把它当作一条评估维度。
源:网易·环球市场播报阅读原文2026-09-17
模型发布

GLiFormer 免 token 生成做结构化抽取

Knowledgator 开源 GLiFormer,单编码器按 schema 做结构化抽取,575.6M 参数版在嵌套 JSON 上达 91.10 F1。

抽取长期被当成生成任务做,代价是逐 token 输出的延迟与不可控拼写。GLiFormer 的取舍很清晰:字段值只取原文片段因此不会编造,但开放关系抽取仍落后 GLiNER-Relex,换成本地编码器的机会只在一部分场景成立。
源:MarkTechPost(RSS)阅读原文2026-09-17
模型发布

Google 发布 Gemini 3.8 Live 双语音模型,支持 97 种语言

Google 发布 Gemini 3.8 Live 与扩展思考版:支持 97 种语言自动切换,扩展思考版在语音质量榜以 82.6 分居首、智能体任务完成率 68.6%。

两版定位分野清楚:Live 走规模化与低延迟,Extended Thinking 走多步推理与工具调用并行。做语音智能体的团队按「是否需要边说边调后台函数」来选更靠谱——68.6% 的完成率说明复杂流程仍是短板。
源:Google DeepMind:Blog(RSS)阅读原文2026-09-16
模型发布

生数科技发布 Vidu S2:实时交互与实时编辑双模型

生数科技发布 Vidu S2 双模型,距 S1 仅 69 天:Avatar 输出由 540P 升至 720P、25-42 FPS,Editing 可实时换风格、试穿与换背景。

国内厂商把实时编辑塞进视频流,最先落地的是电商与直播:试穿、换背景、换风格都在拍摄中完成,省掉后期重做。注意实时空间视频仍是固定视角的探索阶段,头显下的清晰度与延迟没解决,短期更适合当卖点而非生产依赖。
源:公众号:生数科技(Vidu·视频)阅读原文2026-09-16
模型发布

腾讯混元 Hy4 preview 上架硅基流动,1M 上下文

腾讯混元 Hy4 preview 上架硅基流动,为平台第 172 款模型;770B 参数、1M 上下文,缓存/输入/输出 0.3/6/18 元每百万 tokens。

定价与腾讯云 TokenHub 一致,等于同一套权重在厂商云与第三方平台同价可调用。对开发者是渠道变多、不必绑单一云;对聚合平台则是把模型齐全度当竞争点,毛利空间被上游定价锁死。
源:同花顺财经阅读原文2026-09-15
模型发布

AllSpark 开源 Iris 系列搜索智能体

AllSpark 开源 Iris-mini(35B)与 Iris-pro(397B)搜索智能体,基于 Qwen3.6 与 Qwen3.5 底座,训练配方公开。

搜索智能体是今年最卷的方向之一,直接公开训练配方说明壁垒正从训练技巧转向数据与环境。对自建检索的团队,35B 档的 mini 版是性价比最高的落点。
源:The Decoder:AI News(RSS)阅读原文2026-09-14
模型发布

Suno 发布 v6 音乐模型,旧版本全部退役

Suno 发布 v6 三款模型:旗舰 v6、实验向 v6-wild 与免费 v6-mini,最长 8 分钟。训练数据来自华纳、BMG 授权曲库,旧模型全部退役。

从被起诉到与唱片公司共建模型,Suno 用授权曲库换来了合法分发资格——v6 作品现在能经 Believe 与 TuneCore 上架流媒体,且自发布日起就向版权方分成。代价是免费档只剩 v6-mini,创作能力分层更明显。
源:Suno:Blog(网页)阅读原文2026-09-13
模型发布

DeepSeek V4.1-Flash 架构曝光

第三方架构还原显示,V4.1-Flash 采用 20 层因果编码器加 20 层解码器的 CED 双塔:总参数量 552B,读长文本仅激活约 8B,生成阶段激活 16B。

CED 双塔把读写拆成两套激活路径,读长文档只花 8B 算力,这是长上下文成本能压下来的结构性原因,而不是靠 KV 缓存省一点显存。做私有化部署时,文档问答与批量生成可共用一份权重、跑出两条成本曲线,容量规划比只看总参数量靠谱。
源:X:阿易 AI Notes (@AYi_AInotes)阅读原文2026-09-12
模型发布

蚂蚁开源 Ling-3.0-flash-VL 多模态模型

蚂蚁百灵开源首个原生多模态模型 Ling-3.0-flash-VL:总参 124B、单次推理激活 5.5B、上下文 256K,原生支持图像/文本/视频输入,采用 MIT 许可。

视觉反馈闭环是这条发布里最值得看的点:模型把一次性生成改成观察、行动、验证、修正的循环,生成网页时能对照渲染结果自己改代码。引用分数要留意版本:官方引的是 AA v4.1.1 口径的 42 分,AA 现行榜单只给 25 分。
源:腾讯新闻(IT时代网)阅读原文2026-09-12
模型发布

DeepSeek 开源 V4.1-Flash:缓存降至 1/4

DeepSeek 以 MIT 许可开源 MoE 多模态模型 V4.1-Flash,552B 主干,上下文 1M,KV 缓存降至每 token 890 字节、约为上代 1/4。

KV 缓存压到四分之一,直接决定单卡能挂多少并发会话和多大上下文——对自建 Agent 的团队,这比每百万 token 的报价更影响实际显存账。加上 MIT 许可与开源权重,本地部署、私有化方案的门槛明显降低,长上下文从奢侈品变成可按需开的能力。
源:MarkTechPost(RSS)阅读原文2026-09-11
模型发布

OpenAI 发布 ChatGPT Images 2.5

OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。

图像模型进入'延迟即体验'阶段。50% 延迟降幅意味着高频编辑可用,参考图保真提升则利好电商、设计稿迭代。但 OpenAI 仍未开放 API 独立调用,第三方图像应用仍受限于 ChatGPT 内嵌入口。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-09-09
模型发布

NVIDIA 与 MiniMax 发布 Sol-H3

NVIDIA 与 MiniMax 发 Sol-H3:8× B300 5 秒 1344×768 视频仅 1.653 秒,较 Base H3 提速 15.54×。

对视频生成应用,“快过播放”是分水岭:一旦生成速度超过实时,连续可交互视频(游戏、虚拟拍摄)才结构性可行。多团队同月围攻 H3 提速,说明视频基建竞争焦点正从画质转向时延。
模型发布

Cartesia 将语音栈嵌入智能体执行循环

Cartesia 将语音处理嵌入智能体执行循环:Sonic-3.6 合成 90 毫秒、Ink-2 识别 100 毫秒,均居同类第一,焦点从音质转向端到端循环。

对语音智能体开发者,评估标准要更新:过去看单项指标(音质/准确率),现在要看听说两模型能否在同一循环协同、端到端延迟是否稳定。架构耦合度正取代单点性能成为分水岭。
源:网易(碳基打工人)阅读原文2026-09-08
模型发布

H Company 发布 NeoMME 单塔多模态编码器

H Company 发布 NeoMME,含 260M 和 800M 双向 Transformer 模型,用单一塔处理多语言文本、32×32 图像块,去掉视觉塔与解码器。

砍掉视觉塔和因果解码器,用单一架构统一图文,意味着更小的部署体积与更快的跨模态检索,适合端侧与检索场景。它不追大模型参数,而是给轻量多模态落地提供新底座。
源:MarkTechPost(RSS)阅读原文2026-09-07
模型发布

GPT-6 Astra 高端订阅开放 额度约 Sol 一半

OpenAI 向 Pro、Enterprise、Business Premium 开放 GPT-6 Astra,消息额度约为 GPT-5.6 Sol 的一半。

额度砍半指向推理成本压力——模型更强,OpenAI 仍用限额控算力开支。对企业采购,单位产出成本与并发上限比单点能力强更影响总拥有成本。
源:The Decoder:AI News(RSS)阅读原文2026-09-06
模型发布

GPT-6 Astra 开放 Plus 与 Business

此前 Pro、Enterprise 与 Business Premium 可用,今起 Plus 与 Business 可在 Work/Codex、API 使用。

GPT-6 Astra 从 Pro 独占走向全档覆盖,OpenAI 把前沿模型当“基础水电”铺量。Plus 档月费更低、用户基数最大,是真实使用量与企业采纳的核心来源;对中小团队,API 同价降低试用门槛,企业版差异定价仍是营收杠杆。
源:格隆汇阅读原文2026-09-05
模型发布

GPT-6 Astra 上架 Azure Foundry

Satya Nadella 称早期客户已在 Azure 用上 GPT-6 Astra,模型经 Microsoft Foundry 开放。

OpenAI 与微软绑定再加深:旗舰模型首发即进 Azure AI Foundry,企业无需切换平台即可调用。对重仓 Azure 的政企客户,这是“模型选择权”与“合规托管”兼得;对微软,绑定前沿模型是其云 AI 营收关键护城河。
源:Microsoft Azure 博客阅读原文2026-09-05
模型发布

GPT-6 Astra 列关键级网络安全模型

OpenAI 发布 GPT-6 Astra,首次列为 Preparedness 关键级网络安全模型,Greg Brockman 称可能接近 AGI。

这是 OpenAI 首次将模型置于 Preparedness Framework 的关键级网络安全档位,等于官方承认其自主网络能力已达需重点管控的阈值,后续在自动化渗透、漏洞利用等场景的调用大概率会受到更严约束。
源:The Decoder:AI News(RSS)阅读原文2026-09-04
模型发布

GPT-6 Astra 发布 定价每百万 $10/$50

GPT-6 Astra 今起向部分组织推出,面向 ChatGPT Plus/Pro/企业版开放,API 定价每百万输入 $10、输出 $50。

GPT-6 Astra 把 API 定价锚定在 Claude Fable 5/5.1 的 $10/$50 区间,能力跃升却未加价,等于旗舰档主动打价格平手;同步向全量用户放开,透露 OpenAI 用覆盖面换采用的策略。
源:Simon Willison 博客阅读原文2026-09-04
模型发布

Meta 发布 Muse Spark 1.3

Meta 发布 Muse Spark 1.3,五个月内第四版;max 变体在 Artificial Analysis 指数得 62 分(逼近 Fable 5.1)。

Muse Spark 1.3 四个月连发四代、Intelligence Index 从 53 爬到 62,显示 Meta 正以月级迭代逼近 Claude/GPT 前沿;其每任务成本是同档最低,对用量计费型 Agent 应用直接利好。
模型发布

Google 发布 Gemini 3.8 Flash 与 Cyber 版

Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber;3.8 Flash 价 $0.75/$3.75,Cyber 版专攻漏洞修复。

Google 把 Flash 迭代压到三周一次,并用 Cyber 变体把漏洞修复能力圈给可信防御方,是能力加管控的打包思路;对开发者而言 3.8 Flash 以低成本逼近前沿模型,性价比成为其抢份额的主打牌。
源:Google DeepMind:Blog(RSS)阅读原文2026-09-03
模型发布

OpenAI 评定 Astra 达 Critical 阈值

OpenAI 宣布 Astra 达 Critical 网络安全阈值(框架首评),可少人干预发现未知漏洞构建利用链,将受限发布。

OpenAI 首次把模型划到 Critical 档,等于承认前沿模型已能自主挖 0day。受限发布暗示能力外泄风险可控但真实存在。对防御方,自动化漏洞发现将更快普及,压缩人工审计周期。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-09-02
模型发布

Claude Fable 5.1 上线 OpenRouter

Claude Fable 5.1 上线 OpenRouter,称 Fable 5 直接升级,主攻 agentic coding 与长时工作流;定价 $10/$50、上下文 1M。

聚合层当天即上线,说明 Fable 5.1 已成路由默认款——系统按任务挑模型而非用户固定选。对开发者,OpenRouter 一步接入省去直连 Anthropic 多云配置,但数据留存仍按 Anthropic 策略(非零留存)。
源:OpenRouter阅读原文2026-09-02
模型发布

DeepSeek-V4-Flash-Vision 开源

DeepSeek 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus-4.8。

DeepSeek 以 MIT 协议开放多模态能力,中小团队可零授权费本地部署视觉 Agent,压缩闭源多模态 API 议价空间。对客服、质检、文档理解类应用,这是继 V4 Pro 后又一个可白嫖的前沿能力,也抬高了同类开源模型基准线。
源:IT之家(RSS)阅读原文2026-09-01
模型发布

Runway 发布 Solaris 界面世界模型

Runway 推出 Solaris,首个界面世界模型(Interface World Models),可实时逐帧生成应用与网站界面,直接以图像为交互层。

Solaris 把界面当作可直接生成的物理层,省掉代码中间表示,等于给 GUI 智能体一个可无限试错的训练场。对 RPA、无障碍操作、自动化测试是底层利好,但实时生成界面的可控性与安全性仍是落地门槛,短期更像研究原型而非产品。
源:Runway:News(网页)阅读原文2026-09-01
模型发布

腾讯混元 Hy4 登顶代码榜全球第五

腾讯混元 Hy4 登 Arena 代码榜全球第 5,770B 参数、49B 激活、1M 上下文,定位生产力场景,开源前沿模型,价格稳定。

对开发者:国产开源模型首入代码榜全球前五,770B 级稠密权重可本地部署,中小团队多了一个可自托管的 coding 底座选项。
源:腾讯混元官方博客阅读原文2026-08-31
模型发布

腾讯混元发布 Hy4 preview 开源模型

腾讯混元发布旗舰模型 Hy4 preview,总参数 770B、激活 49B、上下文 1M,已开源并在腾讯云 TokenHub 和 OpenRouter 上线。

770B 总参 + 1M 上下文走开源路线,直接对标同档闭源旗舰。对中文开发者意义在可本地/私有部署且已上架 OpenRouter,推理选择更灵活;也显示大厂旗舰模型开源化趋势在加速。
源:公众号:腾讯混元阅读原文2026-08-29
模型发布

GLM-5.3 开源权重,智能体编码与网防最强

智谱开放 GLM-5.3 权重(Hugging Face:zai-org/GLM-5.3),定位智能体编码与网络防御模型,可供下载定制,详见 z.ai 博客。

从 08-20 发布到今日开放权重,GLM-5.3 补齐了「可自部署」这最后一块。对国内企业尤其关键:无需调用云端 API 即可在私有环境跑最强编码/网防模型,数据不出域;开源权重也利于社区做安全审计与二次开发。
源:智谱 Z.ai:GLM-5.3 技术博客阅读原文2026-08-29
模型发布

GLM-5.3 Flash AA 登顶 OpenRouter

GLM-5.3 Flash AA 以 57 分登顶 Artificial Analysis,价格仅前沿 1/100,OpenRouter 周份额近 20%。

国产模型首次以 1/100 的成本拿到开源榜首,意味着中小团队可在不堆算力下拿到前沿级能力。纯国产芯片驱动也说明供应链去美化在推理侧已跑通,对价格敏感型应用是直接利好。
源:X:唐杰(@jietang)阅读原文2026-08-28
模型发布

Gemini Omni 1.1 Flash 发布

Google 推出 Gemini Omni 1.1 Flash,支持场景扩展(10 秒上下文延至 40 秒)、首尾帧过渡与 4K 输出。

首尾帧指定+40 秒延展把可控视频生成下放到 Flash 档,意味着短视频广告、分镜预览可用低成本模型批量出片,不必每次调高价大模型。4K 输出则补上了成品交付的最后一块。
源:Google DeepMind:Blog(RSS)阅读原文2026-08-28
模型发布

Midjourney 开放 V8.2 图像编辑模型测试

Midjourney 开放首个 V8.2 图像编辑测试,支持指令编辑、以图生图(最多 4 张参考图)、局部重绘与扩画,兼容 srefs。

V8.2 把编辑从“重生成”变成“指哪改哪”,4 张参考图+局部重绘让设计改稿流程可落在 AI 里。对电商、海报、概念图工作者是直接提效,也拉开与纯文生图工具的体验差距。
源:Midjourney:Updates(RSS)阅读原文2026-08-28
模型发布

Qwen3.8-Flash 开源 Qwen4 架构预览

Qwen3.8-Flash:125B MoE 激活 6B,训练成本仅前代 1/9,API $0.16/$0.47,262K 可扩 1M。

Qwen3.8-Flash 把前沿多模态压到 6B 激活参数,价格仅 $0.16/百万 token 却对标 Opus 4.8,对做长上下文办公 Agent 的开发者是性价比拐点,也预示 Qwen4 架构方向。
模型发布

智谱开源 GLM-5.3-Flash

智谱开源 GLM-5.3-Flash(320B-A18B),GLM-5 首个原生多模态,AA 指数 57 分持平 Opus 4.8,定价为其 1/40。

GLM-5.3-Flash 以 1/40 的 Opus 4.8 价格打到持平智能水平,国产多模态性价比再刷新;跑在国产芯片集群也意味供应链自主,企业接入成本骤降。
源:公众号:智谱(GLM)阅读原文2026-08-27
模型发布

WeatherNext 提前五天预警五级飓风

Google AI 开源 WeatherNext 气旋模型,提前五天预测飓风 Melissa 五级登陆,美飓风中心首用 AI 预报,每场生成 1000 次模拟。

传统气旋预报靠超算跑物理方程,区域高分辨率是成本大头。WeatherNext 只用 28 公里全球网格就追上强度精度,等于把"准确必须细网格"的老假设推翻。对算力薄弱的发展中国家气象局,开源权重意味着能本地跑、不依赖商业预报系统。
源:Google DeepMind:Blog阅读原文2026-08-26
模型发布

曝 OpenAI 预训练 Bel 模型超 10T 参数

消息源称 OpenAI 已完成 Bel 预训练,Doug 继任者、总参超 10T,作 GPT-6 后基座;算力受限令 Anthropic 难应对 Astra。

10T 参数本身不是新闻,"Doug 继任者 + AGI 阈值"的定位才是信号:OpenAI 仍在用规模赌下一跳。但消息源单一、未经官方确认,且与 Astra 发布节奏相互矛盾,应视作传言而非事实。竞赛的边际收益,正越来越难用参数翻番证明。
源:IT之家(RSS)阅读原文2026-08-26
模型发布

GPT-5.6 登陆 Kiro 提升性价比

GPT-5.6(Sol、Terra、Luna)登陆 Kiro。Terminal-Bench 2.1 中 Terra 在 Kiro 内任务成本降约 82%。

三档型号对应不同任务复杂度,本质是推理成本路由:简单任务走便宜档、复杂任务上强档,82% 的成本降幅主要来自这种分流。对依赖 API 的 agent 产品,模型按需路由已成为控制毛利的核心手段。
源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-08-25
模型发布

Fastino 发布 GLiNER2.5 信息抽取架构

Fastino 发布 GLiNER2.5,用边界预测取代跨度枚举。多语言 16 零样本基准 macro F1 达 56.17,XNLI 升 24.75 分。

去掉跨度枚举改用边界预测,是在用更简单的解码换取速度和显存占用,让信息抽取能跑在小模型上——对预算敏感的生产环境,这类专用小模型正在成为 LLM 抽取的替代项。XNLI 提升 24 分则说明多语言场景受益更明显。
源:MarkTechPost(RSS)阅读原文2026-08-25
模型发布

Harvey 发 Kimi K3 训练模型 Tenet

Harvey 发布模型 Tenet 预览版,基于 Kimi K3 基座针对法律训练。相比基座,全通过率提升 9 和 2 个百分点,仅限企业经平台使用。

源:MarkTechPost(RSS)阅读原文2026-08-24
模型发布

神秘 Ox Alpha 模型限免上架

OpenRouter 上线匿名模型 Ox Alpha 免费 1 周,DeepSWE 得分约 80% 超 Claude Fable 5 的 65%,线索指向智谱。

源:IT之家(RSS)阅读原文2026-08-23
模型发布

面壁智能发布 MathForm:Lean 4 数学自动形式化

面壁智能 OpenBMB 发布 MathForm,FormalVerse 含 367K+ 已验证示例,Consistency Check 达 60.32%。

源:Hugging Face:openbmb/MathForm-8B(模型卡)阅读原文2026-08-22
模型发布

阿里发布 Qwen-UI-Agent GUI 智能体

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

源:IT之家(RSS)阅读原文2026-08-21
模型发布

HF 发布 LFM2.5 DSpark 草稿模型

Hugging Face 发 LFM2.5 DSpark 草稿:投机解码不损质量,GPU 吞吐提升 3.18 倍、端侧 2.87 倍;草稿约 300M 参数。

源:Hugging Face:Blog(RSS)阅读原文2026-08-21
模型发布

Liquid AI LFM2.5 量化版恢复 97% 精度

Liquid AI 推 LFM2.5 四款 Q4_0 检查点(230M 至 2.6B),经量化感知蒸馏训练,保持原生速度,恢复 BF16 精度损失 97%。

源:Hugging Face:Blog(RSS)阅读原文2026-08-20
模型发布

Ornith-1.5 发布:从自我构建到自我优化

Ornith-1.5 将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。

源:Hacker News 热门(buzzing.cc 中文翻译)阅读原文2026-08-20
模型发布

我国发布大豆垂直大模型丰菽 2.0

安徽农业大学发布大豆垂直大模型"丰菽"2.0,集成 6 大模块,整合超 1000 万字文本、1 万篇文献,构建含 2 万实体、10 万关系的知识图谱。

源:IT之家(RSS)阅读原文2026-08-17
模型发布

dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

源:公众号:小红书技术(dots.llm)阅读原文2026-08-15
模型发布

GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力

智谱发布 GLM-5.3,基于与 GLM-5.2相同的基座,通过极致的后训练 Scaling 提升智能上界,编程能力较前代提升50%,在 Terminal Bench 3.0等公开基准中取得开源第一,并接近 Claude Fable 5。模型在白盒代码审查等安全任务中表现持平 Mythos 5,在 CyberGym 测试中得分84.5%。模型权重将在两周后开源,即日起上线 ZCode、AutoClaw 等工具。

源:公众号:智谱(GLM)阅读原文2026-08-15
模型发布

通义千问开源 Qwen3.8 系列模型

通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。

源:X:通义千问 / Qwen (@Alibaba_Qwen)阅读原文2026-08-15
模型发布

DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

源:DeepSeek:API 更新日志阅读原文2026-08-14
模型发布

小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

源:公众号:小红书技术(dots.llm)阅读原文2026-08-14
模型发布

Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

源:Google DeepMind:Blog(RSS)阅读原文2026-08-14
模型发布

xAI 发布 Grok 4.6,强化长时运行智能体能力

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol

源:xAI:News(网页)阅读原文2026-08-13
模型发布

阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文

阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

源:IT之家(RSS)阅读原文2026-08-13
模型发布

NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

源:NVIDIA Blog(RSS)阅读原文2026-08-12
模型发布

Scale AI 开源 Muse 系列模型

1/ 今天有个重大消息:我们很快将发布 Muse Spark 1.2 的开源权重版本。 同时,我们还将发布 Muse Glimmer--一个 30B 参数的智能体模型,采用 Apache 2.0 协议开源权重。Muse Glimmer 可在 24GB 显存上运行,且不损失智能体可靠性。🧵

源:X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)阅读原文2026-08-11
模型发布

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

源:MarkTechPost(RSS)阅读原文2026-08-11
模型发布

Google DeepMind 发布 DiffusionGemma:无需从头训练即可构建文本扩散模型

Google DeepMind 发布 DiffusionGemma,将现有 Gemma-4-26B-A4B 改造为文本扩散模型,训练 token 预算不到原来的 10%。

源:The Decoder:AI News(RSS)阅读原文2026-08-10
模型发布

Pokee AI 发布 Pokee-Isaac 28B:可在客户边界内运行的千万级 token 上下文智能体模型

Pokee AI 发布 Pokee-Isaac 28B,一款 280 亿参数、支持 1000 万 token 上下文的纯文本模型,专为数据不得离开客户边界的受监管行业设计。该模型在 RULER 基准 10M token 长度下得分 93.3%,单张 B200 级 GPU 即可推理,通过 OpenAI 兼容 API 提供并授权 VPC、本地或设备端部署。

源:MarkTechPost(RSS)阅读原文2026-08-09
模型发布

蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

源:公众号:蚂蚁百灵(Ling)阅读原文2026-08-08
模型发布

NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

源:NVIDIA Blog(RSS)阅读原文2026-08-07
模型发布

NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

源:MarkTechPost(RSS)阅读原文2026-08-06
模型发布

NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

源:NVIDIA Blog(RSS)阅读原文2026-08-05
模型发布

商汤 SenseNova U1 开源:统一推理与图像生成

商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

源:X:商汤 SenseTime (@SenseTime_AI)阅读原文2026-08-05
模型发布

Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。

源:Qwen:Blog Retrieval(API)阅读原文2026-08-04
模型发布

MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

源:公众号:MiniMax(稀宇科技)阅读原文2026-08-04
模型发布

Thinking Machines Lab 发布 Inkling-Small:276B 总参数、12B 激活的开源权重多模态 MoE 模型

Thinking Machines Lab 发布开源权重 MoE 模型 Inkling-Small,总参数 276B、激活参数 12B,约为 975B 总参数 Inkling 的四分之一,原生支持文本、图像和音频推理,上下文窗口达 1M tokens,权重以 Apache 2.0 协议在 Hugging Face 上提供。

源:MarkTechPost(RSS)阅读原文2026-08-03
模型发布

GPT-6 破解 10 个 Costco Guys 难题

重磅消息:GPT-6 刚刚找到了 10 个 Costco Guys 难题的解决方案,其中 #24(自 2011 年起悬而未决)也在其中。另有 4 个难题取得重大进展。 DJ Khaled 今早对这一结果表示认可:"为这个感到骄傲。#24 对我个人意义重大。"

源:X:Gabriel (@gabriel1)阅读原文2026-08-02
模型发布

DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek 发布开源模型 DeepSeek V4 Flash 0731,在 Artificial Analysis 智能指数上得分 50,位列开源模型前三。该模型采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,并已上线官方 API。

源:X:Artificial Analysis (@ArtificialAnlys)阅读原文2026-08-01
模型发布

MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

源:MiniMax:Blog(网页)阅读原文2026-08-01
模型发布

Google DeepMind 发布 Gemini Robotics 2 物理 AI

One brain. For any robot. 🤖 我们正在推出 Gemini Robotics 2:我们的下一代物理 AI,为仿人机器人带来全身智能、高级灵巧性、多机器人团队协作等能力。

源:X:Google DeepMind (@GoogleDeepMind)阅读原文2026-07-31
模型发布

GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-07-31
模型发布

OpenAI 发布 GPT-5.6 模型家族:Sol、Terra 与 Luna

OpenAI 发布 GPT-5.6 模型家族,旗舰款 Sol 开启最大推理时在 Artificial Analysis Coding Agent Index 上超越 Claude Fable 5,成本不到后者一半。Terra 智能持平 GPT-5.5 但价格减半,Luna 定价比 Sol 低 80%。该系列通过负载均衡、推测解码等全栈优化实现更高 token 效率。

源:OpenAI:官网动态(RSS · 排除企业/客户案例)阅读原文2026-07-30
模型发布

Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。

源:Google DeepMind:Blog(RSS)阅读原文2026-07-30
模型发布

Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。

源:MarkTechPost(RSS)阅读原文2026-07-29
模型发布

Kimi K3 开源:2.8T MoE 模型与技术报告

Kimi 发布其最强模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构实现了每单位计算 2.5 倍的智能提升。除模型权重外,Kimi 还开源了高性能注意力内核、MoE 通信库及大规模智能体运行环境基础设施。

源:X:Kimi.ai (@Kimi_Moonshot)阅读原文2026-07-28
模型发布

Kimi K3 上线 Modal,支持无损加速推理

很高兴 @modal 成为 Kimi K3 的 Day 0 发布合作伙伴! 他们为 K3 的架构训练了自定义 DFlash 投机器,实现更快推理且无质量损失。

源:X:Kimi.ai (@Kimi_Moonshot)阅读原文2026-07-28
模型发布

Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型

Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。

源:MarkTechPost(RSS)阅读原文2026-07-27
模型发布

Anthropic 称 Opus 5 几乎免疫浏览器提示词注入,攻击成功率降至零

Anthropic 称其 Opus 5 模型在自家软件中几乎免疫提示词注入攻击。在 129 个浏览器智能体测试场景中,攻击成功率为零;在 Gray Swan 通用提示词注入测试中,15 次尝试后的成功率从 Opus 4.8 的 5.5% 降至 2.0%。零成功率仅在 Claude Cowork 等产品开启 Auto Mode 时实现,该模式叠加了输入扫描与执行拦截两层防御。

源:The Decoder:AI News(RSS)阅读原文2026-07-26
模型发布

LLaDA 2.2 扩散 LLM 实现智能体工作

扩散大语言模型现在可以处理真实的智能体工作。 LLaDA 2.2 是首个大规模扩散大语言模型,旨在作为真正的智能体运行,能够规划、调用工具并在长程多轮轨迹中自我修正,同时保留了块并行解码的速度优势。 这里有许多突出的技术决策:

源:X:Elvis Saravia (@omarsar0, DAIR.AI)阅读原文2026-07-26
模型发布

Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

源:Anthropic:Newsroom(网页)阅读原文2026-07-25
模型发布

蚂蚁百灵发布 Ling-3.0-flash 原生混合推理模型

蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰 Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏 MoE,并扩展至10,000+可交互训练环境,长输入下 TTFT 降低60%至80%以上。

源:公众号:蚂蚁百灵(Ling)阅读原文2026-07-25
模型发布

通义千问发布 Qwen-Audio-3.0-TTS,登顶 TTS 排行榜

阿里通义千问推出最新文本转语音模型 Qwen-Audio-3.0-TTS,提供 Flash(实时交互)和 Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在 Artificial Analysis TTS 排行榜上排名第一。

源:X:通义千问 / Qwen (@Alibaba_Qwen)阅读原文2026-07-24
模型发布

小红书 dots 模型获 IMO 2026 满分金牌

小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

源:公众号:小红书技术(dots.llm)阅读原文2026-07-22
模型发布

面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。

源:公众号:面壁智能(MiniCPM)阅读原文2026-07-21
模型发布

面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。

源:公众号:面壁智能(MiniCPM)阅读原文2026-07-20
模型发布

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。

源:公众号:通义实验室(千问)阅读原文2026-07-20
模型发布

OpenAI GPT-Live-1/mini 登场:边听边说让 AI 对话更接近真人聊天

OpenAI 发布最新语音模型 GPT-Live-1 和 mini 版,实现「边听边说」实时对话能力,打破传统串行模式,大幅降低延迟,语音 AI 体验拐点已至。

模型发布

Kimi K3:Moonshot 发布全球最大开源模型,逼近美国一流水平

北京月之暗面(Moonshot)发布 Kimi K3 开源大模型,参数规模全球最大,性能逼近 ClaudeChatGPT 等美国一流闭源模型,中国开源力量加速追赶。

源:Economic Times阅读原文2026-07-19
模型发布

OpenAI GPT-5.6 Sol/Terra/Luna 三款新模型集中发布

OpenAI 集中发布三款新模型:旗舰 Sol(推理+多模态突破)、Terra 和 Luna 分别面向特定部署场景,标志着 AI 模型竞争进入白热化阶段。

源:量子位阅读原文2026-07-19

全部动态

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

链接已复制,打开微信粘贴即可分享
0