IFM开源K2 Horizon六款模型,参数覆盖0.9B至375B
IFM一次开源K2 Horizon六款模型,规模覆盖0.9B、3.7B、7B、32B、36B-A4B和375B-A23B,并开放数据配方、训练代码、中间检查点、细粒度日志、评测结果及xLLM基础设施。36B-A4B结合MoE与MoVA稀疏注意力,每个Token仅激活约4B参数,性能接近稠密32B。375B模型经奖励作弊审计后,Terminal-Bench 2.1得分由70.2%修正为66.9%。
阅读原文IFM一次开源K2 Horizon六款模型,规模覆盖0.9B、3.7B、7B、32B、36B-A4B和375B-A23B,并开放数据配方、训练代码、中间检查点、细粒度日志、评测结果及xLLM基础设施。36B-A4B结合MoE与MoVA稀疏注意力,每个Token仅激活约4B参数,性能接近稠密32B。375B模型经奖励作弊审计后,Terminal-Bench 2.1得分由70.2%修正为66.9%。
阅读原文Mostik团队提出跨模型桥接技术,让模型直接传递隐藏状态,而非先压缩为文本再由接收端重建语义。实验中,云端753B GLM-5.2仅执行预填充,并通过小型桥接网络向手机端4B Qwen-3.5传递内部表示;两侧模型权重均保持冻结,只训练桥接组件。该方案在ARC-AGI 3演示中将准确率提高25%,弥合约50%的性能差距,困难子集最高提升2倍,同时把大模型推理成本降至约二十分之一。
阅读原文Google与国泰航空在亚太超长航程开展AI凝结尾迹规避试验,系统结合AI预测、卫星图像和天气数据,提前识别容易形成增温尾迹的空域,再通过机上网络和电子飞行文件向调度员与飞行员提供小幅调整高度的建议。首轮超过80次航班试验估算使尾迹增温影响降低约40%,其中香港至新加坡航线贡献逾半减排效果。Google称凝结尾迹约占航空业气候影响的三分之一,并计划扩大第二阶段试验。
阅读原文一项新研究以九款前沿模型和三类部署场景检验LLM代理的道德能力,要求系统同时满足结论稳定性、单调性、决策明确性和帕累托可行性四项结构条件。结果显示,没有模型能在全部场景中形成一致策略;仅改变问题表述、不改变实质条件,单个升级层级的裁决比例就可能变化最多99个百分点。论文据此认为,当前代理尚不能稳定地把道德相关特征映射为一致判断,价值对齐评估应先验证基本政策连贯性。
阅读原文微软发布MAI-Image-2.6-Flash图像生成模型,材料称其生成速度提升2.8倍,使用成本降低超过50%,并支持多图参考与动态宽高比输出。产品定位于高并发、低延迟的工业级生成场景,多图输入可用于综合多个视觉参考,动态比例则减少不同内容规格下的额外裁切与重排工作。此次更新重点并非单纯扩展生成能力,而是同时压缩延迟和单位成本,为批量素材制作及在线应用提供更高吞吐的模型选项。
阅读原文基于LobsterAI百万级真实数据的办公Agent用户报告显示,单任务规模在5个月内增长3.1倍,8月环比增幅达53%,用户正从简单问答转向长周期复杂任务。近60%的Token消耗发生在常规办公时间之外,12.2%的模型调用并非由用户实时发起;定时任务平均由一条指令驱动64次模型调用,约为手动任务的6倍。使用高度集中,前20%用户消耗87.4%的算力,通用编程与调试占全部任务的38.5%。
阅读原文阿里千问办公推出多人工作台,用户可通过自然语言描述需求,生成并在线发布支持最多100人实时协作的网页应用。该功能内置角色权限、云数据库、管理后台和在线发布能力,可承载需要多人填报、查询及流程协同的业务场景,并允许继续用自然语言修改。材料称千问办公上线一个月用户已超过3000万,其中企业用户占比过半;此次更新将Agent从个人内容生成延伸到带权限和持久化数据的组织协作流程。
阅读原文一项Split-LLM隐私研究发现,在双节点训练架构中,将真实数据与诱饵行混合并不能阻止不可信云端识别原始样本。由于损失函数忽略诱饵数据,其返回梯度恰好为零,云端可利用零值分布直接区分真实行与诱饵行,使前向通道已经通过的隐私检查失效。实验表明,梯度裁剪和加噪可以降低该特定信号,但无法证明整体安全,因为跨多个训练步骤累积观测等攻击尚未测试;隐私审计因此需覆盖双向数据流。
阅读原文智象发布具身世界模型HiDream-O1-Embodied,并以0.692分位列RoboColiseum鲁棒性子榜首位。该评测通过改变背景、光照、材质和相机位置检验模型在非理想环境中的泛化能力。模型采用多视角协同感知,并在训练中主动加入光照变化和图像损坏等条件,以降低单路视觉失效造成的整体错误。其数据方案以高精度动作捕捉数据为基础,再利用生成模型构造符合物理约束的变体视频,实现百倍规模的数据增强。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。