IBM开源Granite 4.2:企业级推理模型如何炼成?从15万亿token到512K上下文
IBM发布开源推理模型Granite 4.2,首次将思维链、工具调用和Agent强化学习整合到企业级模型中,3B/8B/30B三款模型均支持512K上下文。
IBM发布开源推理模型Granite 4.2,首次将思维链、工具调用和Agent强化学习整合到企业级模型中,3B/8B/30B三款模型均支持512K上下文。
Qwen 3.8 27B模型在权威评测中追平GPT-5.6等千亿级巨模型,揭示了小模型在特定任务上实现“降维打击”的新可能。
Qwen 3.8 27B 模型性能强大,默认开启最高级别深度推理,但导致简单任务也极度耗时。
2026年上半年,中国开源模型在参数规模上快速“跳级”,而美国则转向硬件与基础设施绑定,开源生态格局正在重塑。
NVIDIA推出专为AI代理设计的轻量级模型Nemotron 3.5 Lightning,仅3B激活参数却有30B总参数,兼顾高效与能力,vLLM同步提供生产级支持。
Meta 开源 30B 多模态模型 Muse Glimmer,专攻本地隐私 Agent 场景,在多项 Agent 评测中超越 Gemma4、Qwen3.6 等更大模型,预示本地 Agent 智能即将爆发。
DeepMind 在《自然》发文,其 AI 模型 WeatherNext 将飓风路径、强度和风场预报的准确性提前了整整一天,相当于十年的气象进步,并已在 2025 年大西洋飓风季成功预警飓风 Melissa,现正式开源。
AI圈三封重量级公开信密集发声,微软率众支持开源与蒸馏,Anthropic呼吁严防恶意滥用,独立开发者要求分清责任避免扼杀创新——监管天平将如何倾斜?
Ben Thompson提议美国立法明确训练数据为合理使用并禁止限制API蒸馏,以应对中国开源模型竞争,揭示AI政策虚伪与变革。
NVIDIA 发布 4B 参数边缘端世界模型,在内存受限设备上实现实时视觉推理与机器人动作生成,刷新同类模型基准。
Kimi K3 以 2.8T 参数和远超同侪的价格亮相,挑战了“中国模型必低价”的刻板印象,其 SVG 生成能力更揭示出评估 AI 的新维度。
Meta 开放首个 Spark 模型 API,Muse Spark 1.1 在工具调用和计算机使用能力上大幅升级,Simon Willison 火速开发了 CLI 插件,让开发者可以轻松调用。
Simon Willison评测开源模型Ornith-1.0,展示其在智能体任务中高效的工具调用和代码理解能力,揭示开源智能体ic Coding模型的新进展。
智谱发布 GLM-5.2,首次在开源模型上实现稳定 1M 上下文,并在多个长链编码基准上媲美闭源顶级模型。
Holo3.1 在环境适应性、本地部署和实时速度上实现关键突破,证明通用电脑操控智能体正从展示能力进入可规模落地的工程阶段。
Hugging Face发布了六个不同尺寸的Ettin重排模型,旨在通过“检索-重排”两阶段架构,以低成本显著提升搜索和RAG系统的准确性。
IBM发布两款Apache 2.0开源多语言嵌入模型,其中9700万参数的轻量版在多项基准测试中超越了所有同级别模型,展示了“小而精”模型在特定任务上的巨大潜力。
IBM 发布 Granite 4.1 系列模型,其 8B 密集模型通过极致的数据工程和五阶段训练流程,性能竟可匹敌甚至超越上一代 32B 的 MoE 模型,揭示了“数据质量压倒参数规模”的新范式。
微软推出MIT许可的Whisper风格语音模型VibeVoice,内置说话人分离功能,可在Mac上本地高效处理长达一小时的音频转录。
DeepSeek发布V4系列模型,以极低价格(Pro输入$1.74/M,Flash仅$0.14/M)提供接近前沿的性能,可能重塑开源模型的成本效益标准。
DeepSeek-V4通过创新的混合注意力机制,将百万token上下文窗口的推理成本和内存占用大幅降低,使其首次真正适用于长程、多步骤的AI智能体任务。
阿里通义千问发布Qwen3.6-27B,一个仅27B参数的稠密模型在编程基准上全面超越上代397B的MoE旗舰模型,标志着高效能本地编程模型的拐点。
NVIDIA用1200万张合成图像训练出多语言OCR模型Nemotron OCR v2,在六种语言上实现了高精度(NED低至0.035)和高速度(单A100每秒34.7页),证明了合成数据是解决OCR多语言数据瓶颈的关键路径。
Simon Willison 用其著名的“鹈鹕骑自行车”测试对比了本地运行的阿里Qwen3.6与云端Claude Opus 4.7,发现小模型在创意SVG生成上意外胜出,揭示了开源模型在特定任务上的惊人潜力。
Dario Amodei 重申 Anthropic 从未主张禁止开放权重模型,并指出真正的安全威胁来自威权政府的秘密军用 AI 和模型滥用,而保护主义禁令对此基本无效。
LangChain的评估显示,GLM-5和MiniMax M2.7等开源模型在核心智能体任务上已能比肩顶尖闭源模型,同时成本降低高达90%,延迟大幅缩短。