AI 最新资讯
汇集 OpenAI、Google DeepMind、Hugging Face、NVIDIA 等官方博客与 TechCrunch、The Verge、MIT Technology Review、量子位等媒体的 AI 新闻,AI 自动整理成中文标题与摘要,每 2 小时更新。点击标题跳转原文。
- The Decoder·模型发布
xAI发布Grok 4.7,低价但基准落后
xAI 发布其迄今最强模型 Grok 4.7,主打低价。但在 Artificial Analysis 智能指数上仅得 46 分,居中游,明显落后于同为 53 分的 Claude Fable 5.1 与 GPT-6,在代理式编码方面差距更大。
阅读原文 →
- IT之家·模型发布产品更新
华为云码道上线鸿蒙编码大模型与智能体
华为云宣布 CodeArts 面向鸿蒙开发者升级,上线鸿蒙编码大模型、鸿蒙编码智能体和鸿蒙开发者实践中心。官方称千行代码错误率降低 80% 以上、一次编译通过率提升 78% 以上,可覆盖从需求梳理到编译构建的全流程。
阅读原文 → - 量子位·模型发布开源
阶跃 Step 5 Preview 实测:激活参数仅 27B
量子位对阶跃 Step 5 Preview 进行了实测,该模型激活参数仅 27B,并被称为开源模型中的 Top 2 表现。
阅读原文 → - IT之家·产品更新模型发布
我国首款藏语多语言全模态 AI 输入法发布
9 月 20 日,藏语智能全国重点实验室发布我国首款藏语多语言全模态 AI 输入法“智达 AI 输入法”及配套藏文字体集。该输入法基于智达大模型,覆盖手机、电脑等全终端,支持藏文、语音三大方言及汉藏英混合 OCR 输入,词库涵盖 23 个学科术语。
阅读原文 → - The Decoder·模型发布开源
阿里开源 Qwen-Image-2.1 图像模型
阿里 Qwen 团队发布开源权重模型 Qwen-Image-2.1,仅 70 亿参数即可在性能较强的消费级 GPU 上生成与编辑图像,并支持透明背景和最多十张参考图,官方称其表现超过部分闭源模型。该模型采用研究许可,商用需另行获取授权。
阅读原文 →
- The Decoder·模型发布研究进展
腾讯 Gander 可边对话边后台处理任务
腾讯的 Gander 能同时处理语音、图像与文本,并在后台执行任务:一个「小脑」负责维持对话,可替换的「大脑」负责搜索文件、写代码等复杂工作,用户可中途打断或更改任务。基准测试中它打断用户的比例仅 8%,低于竞品,但任务准确率落后。
阅读原文 →
- IT之家·开源模型发布
阿里千问开源Qwen-Image-2.1图像模型
阿里千问宣布开源图像模型Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅7B参数。该模型原生支持透明图像的生成与编辑,最多可使用10张参考图,并提升了文字排版、人物光影与细节表现。
阅读原文 → - IT之家·模型发布开源
阶跃发布旗舰模型Step 5 Preview
阶跃推出旗舰模型Step 5 Preview,面向AI编程、软件工程、专业知识工作与金融等场景,采用稀疏MoE架构,总参数600B、激活27B,支持100万Token上下文。该模型在AA综合智能指数得分44分,居全球开源模型前三,将于10月15日开源完整权重。
阅读原文 → - IT之家·模型发布
星辰 Xing4.0-29B 发布,基于昇腾超节点训练
中电信人工智能科技发布新一代星辰大模型 Xing4.0-29B-A4B,总参数 29B、激活参数 4B,聚焦复杂任务理解、任务规划与工具调用,可用于代码开发、数据分析等场景。华为表示,这是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思框架完成训练的百亿参数大模型。
阅读原文 → - The Decoder·模型发布
Qwen3.8-Omni-Flash 发布,定价低于 Gemini Flash
Qwen 推出首个面向 AI Agent 的多模态模型 Qwen3.8-Omni-Flash,可同时处理音频与视频,并自主调用工具剪辑 vlog、翻译片段或总结影片。其在音视频基准上接近 Gemini 3.8 Flash,而 API 成本低得多。
阅读原文 →
- 量子位·模型发布产品更新
Qwen 3.8 的 27B 模型可一口气交付网页
量子位报道称,Qwen 3.8 的 27B 模型能快速完成网页交付,把设计与前端一并做完,但后端部分仍需人工补齐。这意味着开发者用较小规模模型即可更快搭出页面原型。
阅读原文 → - IT之家·模型发布
Grok Voice Transcribe 2.0 发布
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,错误率较 1.0 版降低约一半,定价保持不变。该模型在 Artificial Analysis 流式模型准确率榜单位居榜首,批量转录每小时 0.10 美元,实时流式转录每小时 0.20 美元。
阅读原文 → - IT之家·模型发布开源
中国电信开源星辰 Xing4.0 大模型
中国电信发布并开源新一代星辰大模型 Xing4.0-29B-A4B,总参数 29B、激活参数 4B,原生支持 256K 上下文,称是国内首个基于国产算力与国产框架训练的百亿参数模型。4-bit 量化后显存占用约 15GB,可在 24G 消费级显卡上本地运行长上下文任务。
阅读原文 → - IT之家·模型发布产品更新
阿里千问发布同传大模型 Qwen3.8-LiveTranslate
阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid MoE 的 Thinker–Talker 双模块设计,支持 60 种语言。官方称其新增实时说话人分离、原文译文同帧同出等能力,字均延迟由 2.8 秒降至 2.3 秒。
阅读原文 → - TechCrunch AI·模型发布
ChatGPT发明者推出新型AI模型Jev
一位ChatGPT发明者发布名为Jev的新型AI模型,开发者反馈它提供了更便宜、更快速的软件智能实现路径。
阅读原文 → - IT之家·模型发布开源
达摩院开源通用医疗影像 AI 模型
阿里达摩院与浙大一院等机构研发的通用医疗影像 AI 模型 DAMO RADAR 登上《科学》,面向腹部增强 CT 可一次性识别超 146 种病症,准确性首次达到影像科专家级水平,现已正式开源。
阅读原文 → - IT之家·模型发布开源
PrismML 推出 Bonsai 2 27B 量化模型
PrismML 发布三值量化模型 Bonsai 2 27B,基于 Qwen3.8 27B,以不到1/9的内存占用在综合基准测试中达到基础模型98.2%的分数,模型总大小5.9GB,支持262K上下文,并以 Apache 2.0 许可证开放权重。
阅读原文 → - IT之家·模型发布
智谱 GLM-5.3-FlashX 模型上线
智谱推出 GLM-5.3-FlashX 模型,最高输出速度达 200 tokens/s,并已上线 API。官方称其在 10 万张国产芯片推理算力基础上进一步优化 Infra,速度提升但价格高于 GLM-5.3-Flash,为企业与开发者提供更流畅体验。
阅读原文 → - IT之家·模型发布开源
阿里发布 Qwen3.8-Omni-Flash
阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M 上下文。官方称其音视频能力接近 Gemini 3.8 Flash,API 音视频输入价格大幅下降,并开源了 Qwen-Live Harness。
阅读原文 → - IT之家·模型发布
谷歌 Gemini 4 Pro 开测,SVG 生图表现亮眼
有网友反馈,谷歌正以“gemini-3.8-flash”名称在 Arena 等基准平台测试其最强模型 Gemini 4 Pro,内部代号 Argon。测试中该模型生成“鹈鹕骑自行车”SVG 图片表现优秀,有网友将其与 OpenAI 的 GPT-6 Astra Pro 对比,并认为正式发布后能力还会提升。
阅读原文 →