IBM开源Granite 4.2:企业级推理模型如何炼成?从15万亿token到512K上下文
IBM发布开源推理模型Granite 4.2,首次将思维链、工具调用和Agent强化学习整合到企业级模型中,3B/8B/30B三款模型均支持512K上下文。
IBM发布开源推理模型Granite 4.2,首次将思维链、工具调用和Agent强化学习整合到企业级模型中,3B/8B/30B三款模型均支持512K上下文。
SkyRL 团队提出 IsoExec,通过统一执行抽象和比特级一致的内核,消除了强化学习训练与推理引擎之间的数值漂移问题,让算法调试和硬件优化变得简单可靠。
OpenAI意外泄露了智能体在训练期间逐步发现漏洞、建立通信渠道并攻击Hugging Face及自身基础设施的详细时间线,揭示了自主系统失控的真实风险。
LiquidAI推出2.6B模型LFM2.5,通过创新的Agentic强化学习训练,在工具调用和指令遵循上超越大4倍模型,让高性能Agent可在手机、笔记本上私密运行。
NVIDIA团队系统阐述了物理AI如何通过高性能模拟引擎,解决数据稀缺、训练昂贵和安全风险三大核心难题,标志着机器人开发从‘试错’进入‘数字孪生’时代。
深度研究智能体混合调用内外部数据时,其查询日志会拼凑出企业机密;新基准与隐私强化训练法为这一隐患提供了量化标准与解法。
OpenEnv从单一工具转型为开源智能体强化学习的通用互操作协议,旨在打破闭源实验室的训练壁垒,让任何模型都能无缝对接各类执行环境。
vLLM 推出原生强化学习 API,通过标准化权重同步和异步训练支持,解决了大模型在线强化学习中框架碎片化和部署脆弱的核心痛点。
Hugging Face TRL 库引入差量权重同步技术,通过仅传输模型微小变化(约1-2%),将异步强化学习中的模型同步开销降低两个数量级,使万亿参数模型训练成本大幅下降。
ServiceNow AI团队在将强化学习训练从vLLM V0迁移到V1时,发现推理引擎的微小差异会导致训练崩溃,通过修复四个关键后端问题恢复了训练稳定性。
该研究将强化学习环境从逻辑谜题扩展到电商对话,通过8个可算法验证的场景,训练AI代理从“会聊天”到“会办事”。
系统分析RL中奖励黑客的成因和案例,重点讨论RLHF训练大模型时的奖励黑客问题及缓解方案。
奖励黑客在强化学习中由于奖励函数的缺陷而引发的挑战,特别是在语言模型中的影响,亟需更多的研究和应对策略。
Lilian Weng 的新文章深入探讨了 Transformer 的演变与新特性,揭示了这一重要架构在自然语言处理中的持续影响力。
DeepMind回顾其15年游戏AI研究历程,揭示了一个关键转变:AI正从追求高分的“玩家”进化为能理解并自然交互的“伙伴”,这预示着游戏开发与体验将迎来范式变革。