返回往期
2026年7月27日星期一
8 点要闻3 分钟阅读

今日要闻

1

Anthropic披露Claude Code系统提示词删减80%,Opus 5/Fable 5编码评测无损失

Claude Code上下文工程Prompt Engineering

Anthropic的Claude Code团队公开新版上下文工程法则:针对Claude Opus 5与Fable 5模型,团队移除了超过80%的系统提示词,编码评测显示无可测量的性能损失。核心思路包括:以判断替代硬性规则(如从「禁止写注释」改为「写与周围代码风格一致的代码」)、以工具接口设计替代堆砌示例、渐进式披露按需加载Skills、以及用自动记忆替代手写CLAUDE.md。团队认为随着模型自主判断力增强,过度细化的规则反而会侵占决策空间、引入冲突并增加推理成本。已有开发者按此原则将个人配置从2.35万token精简至9259,降幅约60%。

阅读原文
2

新智具身联合复旦发布3万小时触觉数据集,插拔任务成功率达85%远超纯视觉

具身智能触觉感知世界模型

新智具身与复旦大学联合发布N0系列触觉技术报告及NeoData数据集,含超3万小时视觉-触觉交互数据、约140万操作片段、33亿时间步、80亿RGB帧与100亿触觉帧,覆盖6种机器人本体与450个真实长程任务,开源5000小时。NeoForce统一表征模型解决了不同触觉传感器数据格式不兼容问题。N0-VTLA通过预测未来50步触觉演变,在插拔任务成功率达85%(纯视觉60%)、拔钥匙任务达99%(纯视觉35%)。N0-TWAM将触觉融入世界模型,采用72亿参数的混合专家架构,仿真平均成功率84.5%(基线36%),8项真机任务平均成功率46.3%(LingBot-VA为21.9%)。

阅读原文
3

快手KAT-Coder-V2.5发布,基于10万+可验证代码仓库环境训练

AI编程智能体强化学习

快手KwaiKAT团队发布智能体编码模型KAT-Coder-V2.5,在超过10万个可验证代码仓库环境中训练,采用新型AutoBuilder与数据扩展飞轮。模型将智能体编码视为基础设施问题而非模型规模问题,通过任务描述、可执行环境与验证测试三元组,依靠真实执行确保正确性。团队发现约16%的训练失败源于沙箱基础设施问题而非模型策略,凸显隔离执行环境的重要性。为防止过拟合与利用测试模式,采用过程级提示与随机化脚手架(工具名、格式),并使用非对称PPO与多层奖励优化复杂行为,其中Critic可访问测试覆盖率等特权上下文。

阅读原文
4

南北阁发布3B参数通用Agent小模型Nanbeige4.2-3B,采用Looped Transformer架构

小模型AgentLooped Transformer

南北阁实验室发布3B参数的Looped Transformer模型Nanbeige4.2-3B,通过架构创新在编码、办公、复杂工具调用与通用推理上实现统一能力。该架构在模型自底向上完成一次前向传播后,将隐藏状态再次送入同一组Transformer层进行第二次计算,两次循环达到效果、速度与稳定性的最佳平衡,相比同规模标准Transformer带来约75%的token效率提升。训练方面构建了覆盖真实代码仓库沙箱、真实在线MCP服务及跨文件依赖办公素材库的Agent数据管线,并采用多阶段后训练策略。在General Agent、Code Agent、推理与对齐四类评测中稳定超越Qwen3.5-9B、Gemma4-12B等更大参数模型。

阅读原文
5

腾讯云发布首个「流程原生」研发智能体CodeBuddy NPC,Token消耗降超90%

AI AgentAI编程腾讯云

腾讯云发布CodeBuddy NPC,一款面向研发流程设计的智能体,将Git仓库作为原生记忆,深度集成CNB平台,推动从AI辅助编码向自主闭环交付演进。该智能体通过整合Git、CI/CD等环节,实现「提交-验证-修复-再验证」的自动化闭环。通过裁剪冗余、标准化SOP、优化工具调用等方法,初始Token消耗从超过2万降至约2000,降幅超过90%。平台支持多角色NPC协作,企业可构建包含产品经理、技术负责人、开发者、测试等角色的虚拟团队进行并行协作,使开发者从「代码生产者」转变为「设定目标、决策、验收结果的监督者」。

阅读原文
6

研究扫描25个Agent框架发现30处漏洞:模型可控参数直达高危操作无授权检查

AI AgentAI安全授权

一项针对25个AI Agent框架的静态分析研究发现30条路径,其中模型可控参数可直接抵达高危操作(如文件写入/删除、Shell执行、网络出口、SQL执行、消息发送)而无任何授权检查,凸显「校验不等于授权」的安全鸿沟。多数Agent工具仅检查请求格式是否规范,却不在运行时校验当前调用者是否有权执行该具体操作。CrewAI发现最多(12处),其次是SuperAGI(6处)与MetaGPT(5处)。研究首轮扫描精确率为81%,修复了12个误报并加入回归测试。作者强调:发现路径不等于漏洞,扫描不证明可利用性,仅表明路径上无授权检查主导。自定义Agent循环未纳入覆盖。

阅读原文
7

阿里千问AI平台发布:统一API调百余模型并开源两个Skills,Agent自主调度产短视频

AI平台模型编排阿里云

阿里通义千问AI平台发布,提供统一API访问超过百个模型(集成Qwen、Kimi、DeepSeek等系列),注册即赠免费额度,开发者用单一API Key即可调用不同模型。平台开源两个官方Skills(qianwen-ai负责选型、调用与计费,qianwenai-deploy负责应用部署),使Agent能通过自然语言指令自主选择模型并上线应用。实测中Agent仅需一句输入即自主完成文本分镜、图像生成、视频合成、语音合成与音视频合成,调用wan2.6-t2i、wan2.6-i2v-flash、qwen3-tts-flash等模型产出15秒短视频,总成本约5.35元。平台强调面向Agent设计,可根据任务复杂度动态切换模型规格以平衡成本与性能。

阅读原文
8

调查揭露LLM Token地下转卖市场:利用免费试用、盗刷信用卡与开源代理牟利

LLM APIAI安全API滥用

Simon Willison整理一项对LLM API token地下转卖市场的调查,该市场通过滥用免费试用、窃取的凭证与开源代理软件,以折扣价转卖模型访问权限。中国的中继市场利用开源的one-api与new-api代理产品,将非法获取的凭证做负载均衡后打折转卖。买方动机包括节省成本、绕过地域限制以及收集数据用于模型蒸馏。调查凸显了公开暴露的LLM应用端点面临的滥用风险——一旦被发现,整个生态可从中牟利导致巨额token账单。作者呼吁LLM厂商为API Key提供严格的按额度硬性支出上限,使应用在触及设定的美元阈值时立即停止工作,以保护开发者免受滥用驱动的成本爆炸。

阅读原文

不要错过明天的 AI 简报

数千位专业人士的首选,用 AI Daily Brief 开启每天的工作与生活。