AgentKernel: The Trust-Native Agentic Operating System
Modern AI agents routinely cross trust boundaries: they ingest untrusted content, combine it with privileged instructions, persist intermediate beliefs in long-term memory, and invoke privileged tools. This creates an attack surface in which malicious payloads can enter through model inputs and cause harmful tool actions.
Agensh: Scaling Organizational Intelligence to 1,024 Agents
我们推出了Agensh ,这是一种可扩展的自组织多智能体线束,没有中央编排器,可扩展到1,024个智能体。并发工作者执行多Agent协作循环,收集上下文,自行分配子任务,采取行动,共享发现,验证结果,异步合并进度。
ACLArena: Agent Continue Learning in Multi-stage Post-training
为工业部署构建通用代理需要集成在不同培训阶段获得的多种功能,但代理持续学习没有完善的配方。我们介绍了ACLArena ,这是一个用于研究和评估代理持续学习的框架,并提出了一种新的配方,该配方将高质量轨迹的离线重播与LoRA专家的路由网络相结合。
BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
商业智能(BI)是企业决策的基石,在Power BI和Tableau等软件中被企业用户广泛使用。在传统的商业智能工作流程中,用户需要通过( 1 )识别相关表格, ( 2 )执行数据转换,以及( 3 )建立加入关系来准备数据,然后才能( 4 )回答他们的业务问题。
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
受过强化学习( RL )训练的多回合代理在每个轨迹上获得单个标量奖励,这激励自我策略提取( OPD ) ,由具有特权任务技能的自学老师提供密集的令牌级监督,让没有技能的学生将它们内化。因此,我们建议RetireOPD (自我退休随机蒸馏) ,它首先优化具有环境奖励的解耦,技能条件的教师,然后与R共同培训无技能的学生
Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents
GUI代理在动态图形用户界面上执行长时间任务,其中弹出窗口、延迟加载和重新定位的小部件通常会使执行前修复的计划无效。我们提出了EvoSkill-GUI ,这是一个无需培训的框架,其中每个技能都是一个结构化的多文件包,包含检索元数据、可执行计划、备份本地化、故障恢复规则、可访问性实用程序和故障情况。
Agentic Societies Need a Social Harness
【arXiv】代理社会是人工智能代理的集合,它们代表目标可能仅部分一致的不同委托人,跨越信任边界进行自主协调。我们通过实验表明,在代理社会中,甚至诚实,有能力
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
座席的使用正在转向编码和科学发现等长远任务,其中终端任务尤为重要。我们引入了T1 ,这是一种专家混合模型,总数为122B ,经过强化学习训练,在云沙箱中操作真实shell ,每个任务最多可调用300多个工具,通过执行每个任务自己的验证器获得奖励。
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
智能体在实现目标的过程中造成的副作用的基准已经存在,但HarvestBench是第一个对避免副作用定价并将该副作用命名为生物的基准。这是一个农场模拟: LLM子代理与田间动物一起驾驶两辆拖拉机通过合作玉米收获。
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
随着代理从研究原型转向部署工具,他们的能力越来越依赖于模型-外部执行基础设施,通常称为代理线束。在保持模型权重固定的同时更改此线束可以大大改变任务性能。