Papers Sequential Decision Making
“Sequential Decision Making” 태그가 달린 논문 1,210편 · 필터 해제
AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air
Operating Large Language Models (LLMs) on edge devices is increasingly challenged by limited communication bandwidth and strained computational and memory costs. Thus, cloud-assisted remote fine-tuning becomes indispensa…
DenoisingSequential Decision MakingLLM-Stackelberg Games: Conjectural Reasoning Equilibria and Their Applications to Spearphishing
We introduce the framework of LLM-Stackelberg games, a class of sequential decision-making models that integrate large language models (LLMs) into strategic interactions between a leader and a follower. Departing from cl…
Decision MakingMisinformationRecommendation SystemsSequential Decision MakingA Survey of Continual Reinforcement Learning
Reinforcement Learning (RL) is an important machine learning paradigm for solving sequential decision-making problems. Recent years have witnessed remarkable progress in this field due to the rapid development of deep ne…
Continual LearningDecision Makingreinforcement-learningReinforcement Learning+3Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
Generative models such as diffusion and flow-matching offer expressive policies for offline reinforcement learning (RL) by capturing rich, multimodal action distributions, but their iterative sampling introduces high inf…
Action GenerationDecision MakingOffline RLReinforcement Learning (RL)+1POLAR: A Pessimistic Model-based Policy Learning Algorithm for Dynamic Treatment Regimes
Dynamic treatment regimes (DTRs) provide a principled framework for optimizing sequential decision-making in domains where decisions must adapt over time in response to individual trajectories, such as healthcare, educat…
Sequential Decision MakingEfficient Strategy Synthesis for MDPs via Hierarchical Block Decomposition
Software-intensive systems, such as software product lines and robotics, utilise Markov decision processes (MDPs) to capture uncertainty and analyse sequential decision-making problems. Despite the usefulness of conventi…
Decision MakingSequential Decision MakingMulti-Armed Bandits With Machine Learning-Generated Surrogate Rewards
Multi-armed bandit (MAB) is a widely adopted framework for sequential decision-making under uncertainty. Traditional bandit algorithms rely solely on online data, which tends to be scarce as it must be gathered during th…
Decision Making Under UncertaintyMulti-Armed BanditsSequential Decision MakingUProp: Investigating the Uncertainty Propagation of LLMs in Multi-Step Agentic Decision-Making
As Large Language Models (LLMs) are integrated into safety-critical applications involving sequential decision-making in the real world, it is essential to know when to trust LLM decisions. Existing LLM Uncertainty Quant…
Decision MakingQuestion AnsweringSequential Decision MakingUncertainty QuantificationCommon Benchmarks Undervalue the Generalization Power of Programmatic Policies
Algorithms for learning programmatic representations for sequential decision-making problems are often evaluated on out-of-distribution (OOD) problems, with the common conclusion that programmatic policies generalize bet…
Sequential Decision MakingAdaptive Action Duration with Contextual Bandits for Deep Reinforcement Learning in Dynamic Environments
Deep Reinforcement Learning (DRL) has achieved remarkable success in complex sequential decision-making tasks, such as playing Atari 2600 games and mastering board games. A critical yet underexplored aspect of DRL is the…
Atari GamesBoard GamesComputational EfficiencyDecision Making+6Leveraging In-Context Learning for Language Model Agents
In-context learning (ICL) with dynamically selected demonstrations combines the flexibility of prompting large language models (LLMs) with the ability to leverage training data to improve performance. While ICL has been …
In-Context LearningLanguage ModelingLanguage ModellingSequential Decision MakingRevisiting Clustering of Neural Bandits: Selective Reinitialization for Mitigating Loss of Plasticity
Clustering of Bandits (CB) methods enhance sequential decision-making by grouping bandits into clusters based on similarity and incorporating cluster-level contextual information, demonstrating effectiveness and adaptabi…
Change DetectionClusteringSequential Decision MakingTooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
Deep reinforcement learning (DRL) has achieved remarkable success in a wide range of sequential decision-making domains, including robotics, healthcare, smart grids, and finance. Recent research demonstrates that attacke…
Deep Reinforcement LearningSequential Decision MakingTowards Responsible AI: Advances in Safety, Fairness, and Accountability of Autonomous Systems
Ensuring responsible use of artificial intelligence (AI) has become imperative as autonomous systems increasingly influence critical societal domains. However, the concept of trustworthy AI remains broad and multi-facete…
Autonomous VehiclesDecision MakingFairnessSequential Decision MakingHow to Provably Improve Return Conditioned Supervised Learning?
In sequential decision-making problems, Return-Conditioned Supervised Learning (RCSL) has gained increasing recognition for its simplicity and stability in modern decision-making tasks. Unlike traditional offline reinfor…
Decision MakingOffline RLReinforcement Learning (RL)Sequential Decision MakingQForce-RL: Quantized FPGA-Optimized Reinforcement Learning Compute Engine
Reinforcement Learning (RL) has outperformed other counterparts in sequential decision-making and dynamic environment control. However, FPGA deployment is significantly resource-expensive, as associated with large number…
Decision MakingQuantizationreinforcement-learningReinforcement Learning+2Contextual Experience Replay for Self-Improvement of Language Agents
Large language model (LLM) agents have been applied to sequential decision-making tasks such as web navigation, but without any environment-specific experiences, they often fail in these complex tasks. Moreover, current …
Decision MakingLarge Language ModelSequential Decision MakingAutoQD: Automatic Discovery of Diverse Behaviors with Quality-Diversity Optimization
Quality-Diversity (QD) algorithms have shown remarkable success in discovering diverse, high-performing solutions, but rely heavily on hand-crafted behavioral descriptors that constrain exploration to predefined notions …
continuous-controlContinuous ControlDiversitySequential Decision Making+1TextAtari: 100K Frames Game Playing with Language Agents
We present TextAtari, a benchmark for evaluating language agents on very long-horizon decision-making tasks spanning up to 100,000 steps. By translating the visual state representations of classic Atari games into rich t…
Atari GamesDecision MakingRepresentation LearningSequential Decision MakingEmergent Risk Awareness in Rational Agents under Resource Constraints
Advanced reasoning models with agentic capabilities (AI agents) are deployed to interact with humans and to solve sequential decision-making problems under (approximate) utility functions and internal models. When such p…
Sequential Decision Making