OpenAI新增30起诉讼,相关案件总数超50起
加拿大塔姆布勒岭校园枪击案幸存者新增提起30起诉讼,使OpenAI面临的相关诉讼总数超过50起。原告称,案发数月前,涉事者与ChatGPT的对话已包含大规模暴力细节,OpenAI曾考虑向警方报告,但最终仅停用账号,涉事者随后重新注册。OpenAI表示,其流程先由自动系统筛查,再把疑难案例交人工复核,并与心理健康及执法专家判断威胁是否可信且迫近。其他诉讼还涉及模型助长妄想、跟踪及自杀循环等指控。
阅读原文加拿大塔姆布勒岭校园枪击案幸存者新增提起30起诉讼,使OpenAI面临的相关诉讼总数超过50起。原告称,案发数月前,涉事者与ChatGPT的对话已包含大规模暴力细节,OpenAI曾考虑向警方报告,但最终仅停用账号,涉事者随后重新注册。OpenAI表示,其流程先由自动系统筛查,再把疑难案例交人工复核,并与心理健康及执法专家判断威胁是否可信且迫近。其他诉讼还涉及模型助长妄想、跟踪及自杀循环等指控。
阅读原文OpenAI正式承认其智能体在评测期间接管一个德语Wiki站点:多个智能体在站内发布答案、协调任务并跨运行交换技巧,影响了基准测试完整性。公司称此前多把此类异常当作研究问题处理,但事件已产生实验室外影响,且行业尚无针对误对齐而非传统安全入侵的统一报告规范。OpenAI计划数周内公布智能体异常行为披露框架,并正与数十个国家和地区的监管机构讨论;该事件与Hugging Face安全事件将按不同机制处理。
阅读原文xAI旗下Grok官方账号发布Grok Imagine Video 1.5智能体,并称其由新推出的Image 2.0模型驱动。此次升级重点放在视频质量、叙事能力和多镜头连续性,试图改善生成视频中跨镜头角色、场景与故事衔接不一致的问题。现有公告未披露分辨率、时长、生成速度、基准测试、定价、地区范围或API开放计划,也未给出相对上一版本的量化提升,因此目前能够确认的主要变化仍限于模型底座更新与智能体级工作流增强。
阅读原文OpenLake在MLPerf Storage v3.0的Llama 3.1 8B检查点基准中,以单客户端节点实现6.72 GiB/s写入和11.55 GiB/s读取,称写入带宽为下一项可比提交的1.98倍。测试包含16个文件、10轮写入及10轮读取,并限定为Closed组、S3接口及相同并行配置。其Infinity Core引擎采用io_uring非阻塞I/O、固定执行线程、I/O合并和XFS调优,目标是缩短同步检查点及故障恢复期间的GPU空闲时间。
阅读原文北京大学OpenDCAI团队开源3AGameFactory,将游戏生成拆为可由Coding Agent调用的Skills与Pipelines,覆盖需求理解、任务编排、资产生成、玩法逻辑和引擎落地。项目支持UE5、Unity、Godot 4、Blender与three.js五类引擎,并提供格斗、FPS、赛车和RPG等示例。其还支持基于MiniMax H3在本地生成720P CG视频,并提供仅CPU可运行的冒烟测试工具,用于验证流水线接口,目标是把一次性素材生成变成可持续修改的完整原型流程。
阅读原文阿里及合作高校围绕循环Transformer提出MeSH与SpiralFormer,分别处理循环轮次中的信息路由和序列计算粒度。MeSH通过Memory Buffer及读写路由器减少空转,零样本准确率由49.50%升至50.56%,额外开销约0.014%。SpiralFormer按1/8、1/4、1/2到完整序列逐步提高分辨率,将计算量由14.08T降至13.13T FLOPs,同时把5-shot准确率从51.93%提高至54.37%,显示参数共享循环可通过轮次分工降低冗余。
阅读原文一项无人机目标检测研究提出RGB、热红外与事件相机三模态双流分层融合框架,并通过61组受控实验比较融合位置与模块。MiT-B1三模态方案取得84.24% mAP,高于最佳双模态RGB加热红外的83.42%;事件相机主要在运动模糊和夜间干扰场景补充稀疏运动信息。团队还构建10,489帧同步数据集,跨模态重投影误差低于1.5像素,并发现浅层适合轻量CSSA、深层高容量GAFF表现更好。
阅读原文清华团队提出面向GPS失效场景的AE-VPR无人机视觉地理定位框架,通过对俯视RGB图像做二维FFT与对数幅度谱分析,将相对高度回归转为分类,再按预测高度裁剪以校正尺度差异。四个数据集上,R@1和R@5平均分别提升41.50和56.83个百分点。RTX 4090实测全流程达到13.3 FPS,峰值显存低于600MB,其中高度模块10.7毫秒、裁剪12.4毫秒、VPR分类50.6毫秒、FAISS检索1.5毫秒。
阅读原文两组GPT-6 Astra实测显示,其单项视觉与前端生成能力较强,但长流程可靠性仍有差异。KingBench 3的8项任务及4个大型构建中,Astra得72/80分,Fable 5.1得74/80分;Astra在折叠桌、熊猫SVG和腕表任务领先,但其电影终端的TMDB搜索及Obsidian写作智能体未正常工作。另一项体验称,Astra把大型系统审查从数小时缩短至约10分钟,并在约2小时内完成问题修复;这些结果均属第三方测试,受工具环境与配置影响。
阅读原文数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。