A theoretical framework for analyzing and extending LLM policy optimization algorithms.

Paradigm for executable memory for personalized AI agents using typed Python objects.

ARB4WM

★ 80

An Adversarial Robustness Benchmark for World Models in Continuous Control.

METIS

★ 80

A loss-aware many-shot merging method for mitigating task interference in LLMs.

Trust-native agentic routing infrastructure for secure AI agent communication and billing.

STRIDE

★ 80

Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable RL.

WebStep

★ 80

A benchmark of 1,800 task instances for process-level analysis and evaluation of web agents.

A benchmark of recurrent logic puzzles with BFS-optimal trajectories for evaluating LLM reasoning.

A Python package for implementing uncertainty-aware governance and oversight in delegated AI systems.

Benchmark for solving irregular Time Series Question Answering via tool-grounded reasoning.

Framework for optimizing agentic reasoning via semantic information gain rewards.

AudioDER

★ 80

A reasoning-oriented post-training dataset for Large Audio-Language Models containing ~191k samples.

A file-based collaboration protocol for heterogeneous LLM agent collaboration.

Code for learning continuous-time physical prototypes for link failure detection.

iroh

★ 80

A distributed content-addressable network for decentralized AI and data sharing.

A frequency-aware CNN-Transformer framework for Auditory Attention Decoding.

SimEdit

★ 80

A conditioning-aware framework for stabilizing inversion and attention in diffusion image editing.

STREAM

★ 80

Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

Benchmark for measuring social engineering vulnerabilities in LLM-based code review agents.

A dataset of 342 modules with hierarchy metadata for hardware verification.