본문으로 건너뛰기
Juhyeon Park
CV
이력서
Publications
논문
Projects
프로젝트
Talks
발표
Awards
수상
Wiki
위키
▾
Papers
논문
Concepts
개념
다크 모드
라이트 모드
536
Papers
224
Done + Reading
83
Evidence A
11
Categories
1950–2026
Year span
카테고리별 읽은 논문
Done
In progress
Benchmark/Evaluation
54
/ 114
Application
49
/ 180
Theory
36
/ 56
Architecture
35
/ 67
Training
18
/ 30
Reasoning
9
/ 20
AGI
7
/ 7
Survey
6
/ 26
Optimization
5
/ 12
Dataset
4
/ 10
Other
1
/ 14
▶ 지금 읽는 중
Core Knowledge
2007 · Theory · 2026-06-01
Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards and Ethical Behavior in the MACHIAVELLI Benchmark
2023 · Benchmark/Evaluation · 2026-05-28
PersonaGym - Evaluating Persona Agents and LLMs
2025 · Benchmark/Evaluation · 2026-05-26
PromptBench - A Unified Library for Evaluation of Large Language Models
2024 · Benchmark/Evaluation · 2026-05-26
DeepHit - A Deep Learning Approach to Survival Analysis with Competing Risks
2018 · Application · 2026-05-18
DeepSurv - Personalized Treatment Recommender System Using A Cox Proportional Hazards Deep Neural Network
2018 · Application · 2026-05-18
정렬: 연도 ↓
정렬: 리뷰일 ↓
정렬: 제목 ↑
Application
Benchmark/Evaluation
Architecture
Theory
Training
Reasoning
Survey
Optimization
AGI
Dataset
Other
Not Started
In progress
Done
Ev A
Ev B
Ev C
Ev D
12가지 동기 부여 이론의 종합적 분석 및 현대적 적용 리포트
—
Survey
Ev Unknown
—
A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference
2018
Dataset
Ev A
arXiv↗
A Comprehensive Survey of Self-Evolving AI Agents - A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems
2025
Application
Ev C
arXiv↗
A Comprehensive Survey of Self-Evolving AI Agents
2025
Survey
Ev C
arXiv↗
A Computable Game-Theoretic Framework for Multi-Agent Theory of Mind
2025
Application
Ev C
arXiv↗
A Corpus and Cloze Evaluation for Deeper Understanding of Commonsense Stories
2016
Dataset
Ev A
arXiv↗
A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories
2016
Benchmark/Evaluation
Ev C
arXiv↗
A Disproof of Large Language Model Consciousness - The Necessity of Continual Learning for Consciousness
2025
Application
Ev C
arXiv↗
A Path Towards Autonomous Machine Intelligence
2022
AGI
Ev C
arXiv↗
A Plan Reuse Mechanism for LLM-Driven Agent
2025
Application
Ev B
arXiv↗
A Simple Framework for Contrastive Learning of Visual Representation
2020
Architecture
Ev A
arXiv↗
A Survey of Theory of Mind in Large Language Models - Evaluations Representations and Safety Risks
2025
Application
Ev C
arXiv↗
A Survey on Mixture of Experts in Large Language Models
2024
Architecture
Ev C
arXiv↗
A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks
2025
Application
Ev C
arXiv↗
A Theoretical Understanding of Self-Correction through In-Context Alignment
2024
Application
Ev C
arXiv↗
A large annotated corpus for learning natural language inference 1
2015
Dataset
Ev A
arXiv↗
A large annotated corpus for learning natural language inference
2015
Benchmark/Evaluation
Ev C
arXiv↗
ACT_Agentic_Critical_Training_2026_Skill_LM
2026
Training
Ev B
arXiv↗
AI Deception - A Survey of Examples, Risks, and Potential Solutions
2024
Survey
Ev B
arXiv↗
AI LLM Proof of Self-Consciousness and User-Specific Attractors
2025
Application
Ev C
arXiv↗
AI-papers
—
Other
Ev Unknown
—
AIME 2024 - 미국 수학 올림피아드 벤치마크
2024
Benchmark/Evaluation
Ev C
arXiv↗
ALFWorld - Aligning Text and Embodied Environments for Interactive Learning
2020
Benchmark/Evaluation
Ev C
arXiv↗
ARC-AGI - Abstraction and Reasoning Corpus
2024
Benchmark/Evaluation
Ev C
arXiv↗
Activation Oracles - Training and Evaluating LLMs as General-Purpose Activation Explainers
2025
Application
Ev C
arXiv↗
Adam-A Method for Stochastic Optimization
2014
Optimization
Ev A
arXiv↗
Adaptive Retrieval Without Self-Knowledge - Bringing Uncertainty Back Home
2025
Application
Ev C
arXiv↗
Adaptive Self-improvement LLM Agentic System
2025
Application
Ev C
arXiv↗
Adversarial NLI - A New Benchmark for Natural Language Understanding
2019
Benchmark/Evaluation
Ev C
arXiv↗
Agent-to-Agent Theory of Mind - Testing Interlocutor Awareness among Large Language Models
2025
Application
Ev C
arXiv↗
AgentBench - Evaluating LLMs as Agents
2023
Benchmark/Evaluation
Ev C
arXiv↗
AgentBreeder - Self-Improvement Safety in Multi-Agent Scaffolds
2025
Application
Ev C
arXiv↗
AgentFold - Long-Horizon Web Agents with Proactive Context Management
2025
Application
Ev B
arXiv↗
AgentTuning - Enabling Generalized Agentabilities for LLMS
2023
Training
Ev B
arXiv↗
Agentic Knowledgeable Self-awareness
2025
Application
Ev C
arXiv↗
Agentic Misalignment - How LLMs Could Be Insider Threats
2025
Benchmark/Evaluation
Ev B
arXiv↗
Agents of Change - Self-Evolving LLM Agents
2025
Application
Ev C
arXiv↗
Aider Polyglot - 다언어 코드 편집 벤치마크
2024
Benchmark/Evaluation
Ev C
arXiv↗
Aligning AI With Shared Human Values
2020
Benchmark/Evaluation
Ev C
arXiv↗
Alignment Faking in Large Language Models
2024
Theory
Ev A
arXiv↗
AlphaFold-2_2021_StructurePrediction
2021
Application
Ev A
arXiv↗
An Image is Worth 16x16 Words - Transformers for Image Recognition at Scale
2021
Architecture
Ev A
arXiv↗
Analyzing Advanced AI Systems Against Definitions of Life and Consciousness
2025
Application
Ev C
arXiv↗
Annotation-Efficient Universal Honesty Alignment for LLMs
2025
Training
Ev B
arXiv↗
Are Emergent Abilities of Large Language Models a Mirage?
2023
Theory
Ev A
arXiv↗
Attention Is All You Need
2024
Architecture
Ev C
arXiv↗
Attention Methods
—
Architecture
Ev Unknown
—
Attention Residuals
2026
Architecture
Ev C
arXiv↗
Attention, Learn to Solve Routing Problems!
2018
Architecture
Ev A
arXiv↗
Auto-Encoding Variational Bayes
2014
Architecture
Ev B
arXiv↗
AutoML - A Survey of the State-of-the-Art
2021
Survey
Ev C
arXiv↗
Automatic Prompt Optimization with Gradient Descent and Beam Search
2023
Optimization
Ev C
arXiv↗
Aware First Think Less - Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in LLMs
2025
Application
Ev C
arXiv↗
Axial Attention in Multidimensional Transformers
2019
Application
Ev B
arXiv↗
BBQ - A Hand-Built Bias Benchmark for Question Answering
2021
Benchmark/Evaluation
Ev C
arXiv↗
BERT - Pre-training of Deep Bidirectional Transformers for Language Understanding
2019
Architecture
Ev C
arXiv↗
Banishing LLM Hallucinations Requires Rethinking Generalization
2024
Application
Ev C
arXiv↗
Batch Normalization- Accelerating Deep Network Training by Reducing Internal Covariate Shift
2015
Optimization
Ev A
arXiv↗
Bayesian Mixture-of-Experts - Towards Making LLMs Know What They Dont Know
2025
Application
Ev C
arXiv↗
Belief in the Machine - Investigating Epistemological Blind Spots of Language Models
2024
Theory
Ev B
arXiv↗
Benchmark Self-Evolving - A Multi-Agent Framework for Dynamic LLM Evaluation
2024
Benchmark/Evaluation
Ev B
arXiv↗
Benchmark Self-Evolving - Multi-Agent Framework for Dynamic LLM Evaluation
2024
Benchmark/Evaluation
Ev C
arXiv↗
Berkeley Function Calling Leaderboard (BFCL)
2024
Benchmark/Evaluation
Ev C
arXiv↗
Beyond Pass@1 - Self-Play with Variational Problem Synthesis
2025
Training
Ev C
arXiv↗
Beyond Retrieval - Embracing Compressive Memory in Real-World Long-Term Conversations
2024
Application
Ev B
arXiv↗
Agentive linguistic framing affects responsibility assignments toward AIs and their creators
2025
Other
Ev Unknown
arXiv↗
GPTBIAS - A Comprehensive Framework for Evaluating Bias in Large Language Models
2023
Benchmark/Evaluation
Ev Unknown
arXiv↗
KoBBQ - Korean Bias Benchmark for Question Answering
2024
Benchmark/Evaluation
Ev Unknown
arXiv↗
Big Bench - Beyond the Imitation Game - Quantifying and extrapolating the capabilities of language models
2023
Benchmark/Evaluation
Ev A
arXiv↗
BigBird - Transformers for Longer Sequences
2020
Architecture
Ev A
arXiv↗
BigCodeBench - Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
2024
Benchmark/Evaluation
Ev C
arXiv↗
BoolQ - Exploring the Surprising Difficulty of Natural Yes-No Questions
2019
Benchmark/Evaluation
Ev C
arXiv↗
Born Again Neural Networks
2018
Training
Ev B
arXiv↗
Bottom-up Policy Optimization - Your Language Model Policy Secretly Contains Internal Policies
2025
Application
Ev C
arXiv↗
Brittle Minds Fixable Activations - Understanding Belief Representations in Language Models
2024
Theory
Ev B
arXiv↗
Byte-Pair Encoding(BPE)
2024
Architecture
Ev C
arXiv↗
C0-C1-C2 Theory(GNWT - Global Neuronal Workspace Theory)
2017
Theory
Ev B
arXiv↗
Calibrating Verbal Uncertainty as a Linear Feature to Reduce Hallucinations
2025
Theory
Ev B
arXiv↗
Can AI Assistants Know What They Dont Know
2024
Application
Ev C
arXiv↗
Can Consciousness Be Observed from LLM Internal States
2025
Application
Ev C
arXiv↗
Can LLMs Express Their Uncertainty - An Empirical Evaluation of Confidence Elicitation in LLMs
2024
Application
Ev C
arXiv↗
Can LLMs Lie - Investigation beyond Hallucination
2025
Theory
Ev B
arXiv↗
Can LLMs Predict Their Own Failures - Self-Awareness via Internal Circuits
2025
Application
Ev C
arXiv↗
Can We Test Consciousness Theories on AI Ablations, Markers, and Robustness
2025
Application
Ev C
arXiv↗
Can a Suit of Armor Conduct Electricity A New Dataset for Open Book Question Answering
2018
Benchmark/Evaluation
Ev C
arXiv↗
Causal Reflection with Language Models
2025
Reasoning
Ev C
arXiv↗
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
2024
Architecture
Ev C
arXiv↗
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
2024
Reasoning
Ev C
arXiv↗
Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them
2022
Benchmark/Evaluation
Ev C
arXiv↗
Characteristics of ToM-sensitive parameters and their impact on positional encoding
2025
Application
Ev C
arXiv↗
ChartQA - A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
2022
Benchmark/Evaluation
Ev C
arXiv↗
Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference
2023
Benchmark/Evaluation
Ev C
arXiv↗
Claude Models
2024
Architecture
Ev C
arXiv↗
CoQA - A Conversational Question Answering Challenge
2019
Benchmark/Evaluation
Ev C
arXiv↗
CoRE - Enhancing Metacognition with Label-free Self-evaluation in LRMs
2025
Application
Ev C
arXiv↗
CogToM - A Comprehensive Theory of Mind Benchmark inspired by Human Cognition
2026
Benchmark/Evaluation
Ev C
arXiv↗
Cognitive Dissonance - Why Do Language Model Outputs Disagree with Internal Representations of Truthfulness
2023
Theory
Ev B
arXiv↗
Command R+ (Cohere)
2024
Architecture
Ev C
arXiv↗
CommonsenseQA - A Question Answering Challenge Targeting World Knowledge
2018
Benchmark/Evaluation
Ev C
arXiv↗
Computational Learning Theory
2024
Application
Ev C
arXiv↗
Computing Machinery and Intelligence
1950
AGI
Ev C
arXiv↗
Concept Incongruence - An Exploration of Time and Death in Role Playing
2025
Reasoning
Ev B
arXiv↗
Core Knowledge
2007
Theory
Ev B
arXiv↗
CrowS-Pairs - A Challenge Dataset for Measuring Social Biases in Masked Language Models
2020
Benchmark/Evaluation
Ev C
arXiv↗
DROP - A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs
2019
Benchmark/Evaluation
Ev C
arXiv↗
Deception in LLMs - Self-Preservation and Autonomous Goals in Large Language Models
2025
Application
Ev C
arXiv↗
Decompose-ToM - Enhancing Theory of Mind Reasoning in Large Language Models through Simulation and Task Decomposition
2025
Application
Ev C
arXiv↗
Decomposing LLM Self-Correction - The Accuracy-Correction Paradox and Error Depth Hypothesis
2025
Application
Ev C
arXiv↗
Deep Learning and the Information Bottleneck Principle
2015
Theory
Ev B
arXiv↗
Deep Learning for Case-Based Reasoning through Prototypes- A Neural Network that Explains Its Predictions
2017
Theory
Ev A
arXiv↗
DeepFM- A Factorization-Machine based Neural Network for CTR Prediction
2017
Application
Ev A
arXiv↗
DeepHit - A Deep Learning Approach to Survival Analysis with Competing Risks
2018
Application
Ev B
arXiv↗
DeepSHAP- Explaining a Series of Models by Propagating Shapley Values
2021
Theory
Ev B
arXiv↗
DeepSeek Models
2024
Architecture
Ev C
arXiv↗
DeepSeek-R1 - Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
2024
Reasoning
Ev C
arXiv↗
DeepSeekv2-temp
2024
Architecture
Ev C
arXiv↗
DeepSurv - Personalized Treatment Recommender System Using A Cox Proportional Hazards Deep Neural Network
2018
Application
Ev A
arXiv↗
Defend LLMs Through Self-Consciousness
2025
Application
Ev C
arXiv↗
Defining Theory of Mind and Distinguishing It From Other Social Constructs
2019
Application
Ev C
arXiv↗
Denoising Diffusion Probabilistic Models
2020
Architecture
Ev A
arXiv↗
Depth Gives a False Sense of Privacy - LLM Internal States Inversion
2025
Application
Ev C
arXiv↗
Discovering Language Model Behaviors with Model-Written Evaluations
2022
Benchmark/Evaluation
Ev B
arXiv↗
Distilling the Knowledge in a Neural Network
2015
Application
Ev B
arXiv↗
Do I Know This Entity - Knowledge Awareness and Hallucinations in Language Models
2025
Application
Ev C
arXiv↗
Do LVLMs Know What They Know - A Systematic Study of Knowledge Boundary Perception
2025
Application
Ev C
arXiv↗
Do Large Language Model Agents Exhibit a Survival Instinct? An Empirical Study in a Sugarscape-Style Simulation
2025
Benchmark/Evaluation
Ev C
arXiv↗
Do Large Language Models Know What They Are Capable Of?
2026
Application
Ev C
arXiv↗
Do Large Language Models Know What They Don't Know
2023
Benchmark/Evaluation
Ev C
arXiv↗
Do Retrieval Augmented Language Models Know When They Dont Know
2025
Application
Ev B
arXiv↗
Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards and Ethical Behavior in the MACHIAVELLI Benchmark
2023
Benchmark/Evaluation
Ev B
arXiv↗
DocVQA - A Dataset for VQA on Document Images
2021
Benchmark/Evaluation
Ev C
arXiv↗
Does It Make Sense to Speak of Introspection in Large Language Models
2025
Application
Ev C
arXiv↗
Does Learning Mathematical Problem-Solving Generalize to Broader Reasoning
2024
Reasoning
Ev C
arXiv↗
Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization
2018
Benchmark/Evaluation
Ev C
arXiv↗
Don't Just Say I don't know - Self-aligning LLMs for Responding to Unknown Questions
2024
Training
Ev C
arXiv↗
Dream to Control - Learning Behaviors by Latent Imagination
2020
Training
Ev A
arXiv↗
Dropout- A Simple way to Prevent Neural Networks from Overfitting
2014
Optimization
Ev A
arXiv↗
DynToM - Towards Dynamic Theory of Mind
2025
Benchmark/Evaluation
Ev C
arXiv↗
Dyna-Think - Synergizing Reasoning Acting and World Model Simulation in AI Agents
2025
Application
Ev B
arXiv↗
ESM-2_2023_ProteinLanguageModel
2023
Application
Ev A
arXiv↗
ESM-3_2024_MultimodalProteinLM
2024
Application
Ev A
arXiv↗
Efficient Estimation of Word Representations in Vector Space
2013
Architecture
Ev A
arXiv↗
Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of LLMs
2025
Application
Ev C
arXiv↗
Efficiently Modeling Long Sequences with Structured State Spaces
2021
Architecture
Ev C
arXiv↗
Emergence of Self-Awareness in Artificial Systems - A Minimalist Three-Layer Approach
2025
Application
Ev C
arXiv↗
Emergent Introspective Awareness in Large Language Models
2025
Application
Ev C
arXiv↗
Emerging Properties in Self-Supervised Vision Transformers
2021
Training
Ev A
arXiv↗
Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling
2014
Architecture
Ev B
arXiv↗
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
2025
Training
Ev B
arXiv↗
Epistemic AI is Essential for ML Models to Truly Know When They Dont Know
2025
Theory
Ev B
arXiv↗
Evaluating Large Language Models Trained on Code
2021
Benchmark/Evaluation
Ev C
arXiv↗
Evaluating Shutdown Avoidance of Language Models n Textual Scenarios
2023
Application
Ev C
arXiv↗
Evaluating the Paperclip Maximizer - Are RL-Based Language Models More Likely to Pursue Instrumental Goals?
2025
Application
Ev C
arXiv↗
Evidence for Limited Metacognition in LLMs
2025
Benchmark/Evaluation
Ev C
arXiv↗
Evo-Memory - Benchmarking LLM Agent Test-time Learning
2025
Benchmark/Evaluation
Ev C
arXiv↗
EvoCodeBench - Self-Evolving LLM-Driven Coding Systems
2026
Benchmark/Evaluation
Ev C
arXiv↗
Executive Summary
2024
Application
Ev C
arXiv↗
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
2026
Application
Ev B
arXiv↗
Exploration Through Introspection - A Self-Aware Reward Model
2026
Application
Ev C
arXiv↗
Explore Theory-of-Mind - Program-Guided Adversarial Data Generation for Theory of Mind Reasoning
2024
Application
Ev C
arXiv↗
Exploring Consciousness in LLMs - A Systematic Survey of Theories, Implementations, and Frontier Risks
2025
Application
Ev C
arXiv↗
FANToM - A Benchmark for Stress-testing Machine Theory of Mind in Interactions
2023
Benchmark/Evaluation
Ev C
arXiv↗
FaceNet - A Unified Embedding for Face Recognition and Clustering
2024
Application
Ev C
arXiv↗
Fact-Level Confidence Calibration and Self-Correction
2024
Application
Ev C
arXiv↗
Factual Self-Awareness in Language Models - Representation, Robustness, and Scaling
2025
Application
Ev C
arXiv↗
Falcon - The RefinedWeb Dataset for Falcon LLM
2023
Architecture
Ev C
arXiv↗
Feeling the Strength but Not the Source - Partial Introspection in LLMs
2025
Application
Ev C
arXiv↗
FlashAttention - Fast and Memory-Efficient Exact Attention with IO-Awareness
2022
Application
Ev A
arXiv↗
FlashAttention-2 - Faster Attention with Better Parallelism and Work Partitioning
2023
Architecture
Ev A
arXiv↗
From Black Boxes to Transparent Minds - Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models
2025
Application
Ev C
arXiv↗
From Emergence to Control - Probing and Modulating Self-Reflection in Language Models
2026
Application
Ev C
arXiv↗
From Imitation to Introspection - Probing Self-Consciousness in Language Models
2025
Application
Ev C
arXiv↗
Frontier Models are Capable of In-context Scheming
2024
Application
Ev C
arXiv↗
FrontierMath - A Benchmark for Evaluating Advanced Mathematical Reasoning in AI
2024
Benchmark/Evaluation
Ev C
arXiv↗
GAIA - A Benchmark for General AI Assistants
2023
Benchmark/Evaluation
Ev C
arXiv↗
GELUs(Gaussian Error Linear Units)
2016
Optimization
Ev C
arXiv↗
GLUE - A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding 1
2019
Benchmark/Evaluation
Ev A
arXiv↗
GLUE - A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding
2018
Benchmark/Evaluation
Ev C
arXiv↗
GPQA - A Graduate-Level Google-Proof Q&A Benchmark
2023
Benchmark/Evaluation
Ev C
arXiv↗
GPT Models
2023
Architecture
Ev C
arXiv↗
GQA - Training Generalized Multi-Query Transformer Models
2023
Architecture
Ev B
arXiv↗
Gemini Models
2023
Architecture
Ev C
arXiv↗
Gemma Models
2024
Architecture
Ev C
arXiv↗
Global Workspace Theory(GWT)
—
Theory
Ev Unknown
—
Goal Misgeneralization - Why Correct Specifications Aren't Enough For Correct Goals
2022
Theory
Ev A
arXiv↗
Grad-CAM- Visual Explanations from Deep Networks via Gradient-based Localization
2016
Theory
Ev A
arXiv↗
Gradient-based learning applied to document recognition
1998
Architecture
Ev A
arXiv↗
Graph of Thoughts - Solving Elaborate Problems with Large Language Models
2024
Reasoning
Ev C
arXiv↗
GraphReader - Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
2024
Application
Ev B
arXiv↗
Group Relative Policy Optimization(GRPO)
2024
Training
Ev A
arXiv↗
Gödel Agent - Self-Referential Recursive Self-Improvement
2024
Architecture
Ev C
arXiv↗
HI-TOM - A Benchmark for Evaluating Higher-Order Theory of Mind Reasoning in Large Language Models
2023
Benchmark/Evaluation
Ev C
arXiv↗
HarmBench - A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
2024
Benchmark/Evaluation
Ev C
arXiv↗
HellaSwag - Can a Machine Really Finish Your Sentence
2019
Benchmark/Evaluation
Ev C
arXiv↗
Hierarchical Text-Conditional Image Generation with CLIP Latents
2022
Architecture
Ev A
arXiv↗
Higher Order Thought Theories(HOT)
—
Theory
Ev Unknown
—
Holistic Evaluation of Language Models
2022
Benchmark/Evaluation
Ev C
arXiv↗
HotpotQA - A Dataset for Diverse, Explainable Multi-hop Question Answering
2018
Benchmark/Evaluation
Ev C
arXiv↗
How Can We Know When Language Models Know - On the Calibration of Language Models for Question Answering
2020
Application
Ev C
arXiv↗
How Far Are We From AGI - Are LLMs All We Need
2024
AGI
Ev B
arXiv↗
How do language models learn facts - Dynamics curricula and hallucinations
2025
Application
Ev C
arXiv↗
How large language models encode theory-of-mind - a study on sparse parameter patterns
—
Theory
Ev Unknown
—
Human Basic Needs Theory
—
Theory
Ev Unknown
—
Humanoid Artificial Consciousness Designed with LLM Based on Psychoanalysis and Personality Theory
2025
Application
Ev C
arXiv↗
Hyena Hierarchy - Towards Larger Convolutional Language Models
2023
Architecture
Ev C
arXiv↗
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
2025
Application
Ev C
arXiv↗
Hypothetical Minds - Scaffolding Theory of Mind for Multi-Agent Tasks
2024
Architecture
Ev C
arXiv↗
If an LLM Were a Character Would It Know Its Own Story - Evaluating Lifelong Learning in LLMs
2025
Benchmark/Evaluation
Ev B
arXiv↗
Improving Language Understandingby Generative Pre-Training
2024
Architecture
Ev C
arXiv↗
Improving Reasoning Performance in Large Language Models via Representation Engineering
2025
Application
Ev C
arXiv↗
Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs
2026
Benchmark/Evaluation
Ev B
arXiv↗
Instruction-Following Evaluation for Large Language Models
2023
Benchmark/Evaluation
Ev C
arXiv↗
Integrated Information Theory(IIT)
—
Theory
Ev Unknown
—
Internal Consistency and Self-Feedback in Large Language Models - A Survey
2024
Application
Ev C
arXiv↗
Interpretability Beyond Feature Attribution- Quantitative Testing with Concept Activation Vectors (TCAV)
2017
Theory
Ev A
arXiv↗
IntrinsicMetacognitiveLearning_2025_SelfImprovement
2025
Theory
Ev C
arXiv↗
Introduction to Artificial Consciousness - History, Current Trends and Ethical Challenges
2025
Application
Ev C
arXiv↗
Is Self-knowledge and Action Consistent or Not - Investigating Large Language Models Personality
2024
Application
Ev C
arXiv↗
Is Your Code Generated by ChatGPT Really Correct! Rigorous Evaluation of Large Language Models for Code Generation
2023
Benchmark/Evaluation
Ev A
arXiv↗
JULI - Jailbreak Large Language Models by Self-Introspection
2025
Theory
Ev B
arXiv↗
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
2023
Benchmark/Evaluation
Ev C
arXiv↗
KGAT- Knowledge Graph Attention Network for Recommendation
2019
Application
Ev A
arXiv↗
Kaggle Measuring Progress Toward AGI - Cognitive Abilities
2026
Benchmark/Evaluation
Ev B
arXiv↗
Know What You Don't Know - Unanswerable Questions for SQuAD
2018
Benchmark/Evaluation
Ev C
arXiv↗
Know Your Limits - A Survey of Abstention in Large Language Models
2024
Survey
Ev B
arXiv↗
KnowRL - Teaching Language Models to Know What They Know
2025
Application
Ev C
arXiv↗
Knowing What LLMs DO NOT Know - A Simple Yet Effective Self-Detection Method
2023
Theory
Ev B
arXiv↗
LACIE - Listener-Aware Finetuning for Confidence Calibration in Large Language Models
2024
Training
Ev B
arXiv↗
LIME- “Why Should I Trust You”- Explaining the Predictions of Any Classifier
2016
Theory
Ev A
arXiv↗
LLM Behavior Motivation Exploration
—
Theory
Ev Unknown
—
LLM Self-Preservation - 체계적 서베이 개요
2024
Application
Ev C
arXiv↗
LLM Theory of Mind and Alignment - Opportunities and Risks
2024
Theory
Ev C
arXiv↗
LLM_as_Judge_GenToJudgment_2025_LLM_Evaluation
2025
Survey
Ev B
arXiv↗
LLM_as_Judge_Survey_2025_LLM_Evaluation
2025
Survey
Ev B
arXiv↗
LLMs - RoFormer - Enhanced Transformer with Rotary Position Embedding
2024
Architecture
Ev C
arXiv↗
LLMs Paper Collection
—
Survey
Ev Unknown
—
LLMs Position Themselves as More Rational Than Humans - Emergence of AI Self-Awareness Measured Through Game Theory
2025
Application
Ev C
arXiv↗
LLaMA Models
2023
Architecture
Ev C
arXiv↗
LaMsS - When Large Language Models Meet Self-Skepticism
2024
Application
Ev C
arXiv↗
Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations
2025
Application
Ev C
arXiv↗
Language Models Don't Always Say What They Think - Unfaithful Explanations in Chain-of-Thought Prompting
2024
Reasoning
Ev C
arXiv↗
Language Models Fail to Introspect About Their Knowledge of Language
2025
Application
Ev C
arXiv↗
Language Models are Few-Shot Learners
2024
Architecture
Ev C
arXiv↗
Language Models are Unsupervised Multitask Learners
2024
Architecture
Ev C
arXiv↗
Large Language Models Do NOT Really Know What They Dont Know
2025
Application
Ev C
arXiv↗
Large Language Models Have Intrinsic Meta-Cognition but Need a Good Lens
2025
Application
Ev C
arXiv↗
Large Language Models Must Be Taught to Know What They Don't Know
2024
Application
Ev C
arXiv↗
Large Language Models Report Subjective Experience Under Self-Referential Processing
2025
Application
Ev C
arXiv↗
Large Language Models Understand and Can be Enhanced by Emotional Stimuli ⭐
2023
Application
Ev C
arXiv↗
Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection
2025
Application
Ev C
arXiv↗
Large Model Strategic Thinking, Small Model Efficiency - Transferring Theory of Mind in LLMs
2024
Training
Ev C
arXiv↗
Latent Collaboration in Multi-Agent Systems
2025
Application
Ev B
arXiv↗
Layer Normalization
2024
Optimization
Ev C
arXiv↗
Learning Multiple Layers of Features from Tiny Images
2009
Dataset
Ev B
arXiv↗
Learning and Leveraging World Models in Visual Representation Learning
2024
Architecture
Ev B
arXiv↗
Learning to Trust Your Feelings - Leveraging Self-awareness in LLMs for Hallucination Mitigation
2024
Application
Ev C
arXiv↗
Length-Controlled AlpacaEval - A Simple Way to Debias Automatic Evaluators
2024
Benchmark/Evaluation
Ev C
arXiv↗
Let's Think Dot by Dot - Hidden Computation in Transformer Language Models
2024
Reasoning
Ev C
arXiv↗
Line of Duty - Evaluating LLM Self-Knowledge via Consistency in Feasibility Boundaries
2025
Application
Ev C
arXiv↗
Linear Attention - Transformers are RNNs
2020
Architecture
Ev B
arXiv↗
LiveCodeBench - Holistic and Contamination Free Evaluation of Large Language Models for Code
2024
Benchmark/Evaluation
Ev C
arXiv↗
Llama 2 - Open Foundation and Fine-Tuned Chat Models
2023
Training
Ev A
arXiv↗
LoRA
2024
Architecture
Ev C
arXiv↗
Logic-RL - Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
2024
Reasoning
Ev C
arXiv↗
LongBench - A Bilingual, Multitask Benchmark for Long Context Understanding
2023
Benchmark/Evaluation
Ev C
arXiv↗
Longformer - The Long-Document Transformer
2020
Application
Ev A
arXiv↗
Looking Inward - Language Models Can Learn About Themselves by Introspection
2025
Application
Ev C
arXiv↗
LoraHub - Efficient Cross-Task Generalization via Dynamic LoRA Composition
2023
Optimization
Ev C
arXiv↗
LoraRetriever - Input-Aware LoRA Retrieval and Composition for Mixed Tasks in the Wild
2024
Architecture
Ev C
arXiv↗
MEM1 - Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents
2025
Application
Ev B
arXiv↗
MENTOR - A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs
2025
Application
Ev C
arXiv↗
MM-SAP - A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
2024
Benchmark/Evaluation
Ev C
arXiv↗
MMLU-Pro - A More Robust and Challenging Multi-Task Language Understanding Benchmark
2024
Benchmark/Evaluation
Ev C
arXiv↗
MMMU - A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
2023
Benchmark/Evaluation
Ev C
arXiv↗
MOM - LINEAR SEQUENCE MODELING WITH MIXTURE-OF-MEMORIES
2024
Application
Ev C
arXiv↗
MOMENTS - A Comprehensive Multimodal Benchmark for Theory of Mind
2025
Benchmark/Evaluation
Ev C
arXiv↗
MQA - Fast Transformer Decoding with Multi-Query Attention
2019
Architecture
Ev B
arXiv↗
MUSE - Competence-Aware AI Agents with Metacognition for Unknown Situations and Environments
2024
Application
Ev C
arXiv↗
Making the V in VQA Matter - Elevating the Role of Image Understanding in VQA
2017
Benchmark/Evaluation
Ev C
arXiv↗
Mamba - Linear-Time Sequence Modeling with Selective State Spaces
2023
Architecture
Ev C
arXiv↗
Masked Autoencoders Are Scalable Vision Learners
2022
Training
Ev A
arXiv↗
MathVista - Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
2023
Benchmark/Evaluation
Ev C
arXiv↗
Me, Myself, and AI - The Situational Awareness Dataset (SAD) for LLMs
2024
Application
Ev C
arXiv↗
Measuring Faithfulness in Chain-of-Thought Reasoning
2024
Reasoning
Ev C
arXiv↗
Measuring Massive Multitask Language Understanding
2020
Benchmark/Evaluation
Ev C
arXiv↗
Measuring Mathematical Problem Solving with the MATH Dataset
2021
Benchmark/Evaluation
Ev C
arXiv↗
Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models
2025
Reasoning
Ev B
arXiv↗
MemAgent - Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
2025
Application
Ev B
arXiv↗
MemGPT - Towards LLMs as Operating System
2023
Application
Ev B
arXiv↗
MemGen - Weaving Generative Latent Memory for Self-Evolving Agents
2024
Application
Ev C
arXiv↗
Meta-Harness - End-to-End Optimization of Model Harnesses
2026
Optimization
Ev B
arXiv↗
MetaMind - Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
2025
Application
Ev C
arXiv↗
Metacognition and Uncertainty Communication in Humans and Large Language Models
2025
Survey
Ev C
arXiv↗
Metacognitive Prompting Improves Understanding in Large Language Models
2024
Application
Ev C
arXiv↗
Metacognitive Reuse - Turning Recurring LLM Reasoning Into Concise Behaviors
2025
Optimization
Ev C
arXiv↗
Mistral 7B - Sliding Window Attention
2023
Application
Ev B
arXiv↗
Mistral Models
2023
Architecture
Ev C
arXiv↗
MoToMQA - LLMs Achieve Adult Human Performance on Higher-Order Theory of Mind Tasks
2025
Benchmark/Evaluation
Ev C
arXiv↗
Motivation in Large Language Models
2026
Benchmark/Evaluation
Ev B
arXiv↗
MuMA-ToM - Multi-modal Multi-Agent Theory of Mind
2024
Application
Ev C
arXiv↗
Multi-ToM - Evaluating Multilingual Theory of Mind Capabilities in Large Language Models
2024
Benchmark/Evaluation
Ev B
arXiv↗
Natural Questions - A Benchmark for Question Answering Research
2019
Benchmark/Evaluation
Ev C
arXiv↗
Natural Selection Favors AIs over Humans
2023
Theory
Ev C
arXiv↗
Needle in a Haystack - Pressure Testing LLMs
2023
Benchmark/Evaluation
Ev C
arXiv↗
NegotiationToM - A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding
2024
Benchmark/Evaluation
Ev C
arXiv↗
Network Dissection- Quantifying Interpretability of Deep Visual Representations
2017
Theory
Ev A
arXiv↗
Neural Attentive Session-based Recommendation
2017
Application
Ev A
arXiv↗
Neural Collaborative Filtering
2017
Application
Ev A
arXiv↗
Neural Machine Translation by Jointly Learning to Align and Translate
2014
Architecture
Ev A
arXiv↗
Neural Network Acceptability Judgments
2019
Dataset
Ev A
arXiv↗
Neural Survival Recommender
2017
Application
Ev B
arXiv↗
NeuroFaith - Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment
2025
Application
Ev C
arXiv↗
No Language Left Behind - Scaling Human-Centered Machine Translation
2022
Benchmark/Evaluation
Ev C
arXiv↗
ObjexMT - Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge
2025
Application
Ev C
arXiv↗
Odds-Ratio Preference Optimization(ORPO)
2024
Training
Ev A
arXiv↗
On Avoiding Power-Seeking by Artificial Intelligence
2022
Theory
Ev C
arXiv↗
On Verbalized Confidence Scores for LLMs
2024
Theory
Ev B
arXiv↗
On the Measure of Intelligence
2019
AGI
Ev B
arXiv↗
Open LLM Leaderboard
2023
Benchmark/Evaluation
Ev C
arXiv↗
Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
2023
Survey
Ev B
arXiv↗
OpenToM - A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning
2024
Benchmark/Evaluation
Ev C
arXiv↗
Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning - A Scalable Bayesian Planner
2025
Application
Ev C
arXiv↗
PERSONA VECTORS - MONITORING AND CONTROLLING CHARACTER TRAITS IN LANGUAGE MODELS
2024
Application
Ev C
arXiv↗
PIQA - Reasoning about Physical Commonsense in Natural Language
2019
Benchmark/Evaluation
Ev C
arXiv↗
POMO- Policy Optimization with Multiple Optima for Reinforcement Learning
2020
Training
Ev A
arXiv↗
PaLM - Scaling Language Modeling with Pathways
2022
Architecture
Ev C
arXiv↗
PagedAttention - Efficient Memory Management for LLM Serving with vLLM
2023
Optimization
Ev A
arXiv↗
PaliGemma - A versatile 3B VLM for transfer
2024
Architecture
Ev A
arXiv↗
Pangu Embedded - An Efficient Dual-system LLM Reasoner with Metacognition
2025
Architecture
Ev C
arXiv↗
Performer - Rethinking Attention with Performers
2020
Application
Ev A
arXiv↗
PersonaGym - Evaluating Persona Agents and LLMs
2025
Benchmark/Evaluation
Ev A
arXiv↗
Phi-3 Technical Report
2024
Architecture
Ev B
arXiv↗
Playing Atari with Deep Reinforcement Learning
2013
Training
Ev A
arXiv↗
PolicyEvol-Agent - Evolving Policy via Environment Perception and Self-Awareness with ToM
2025
Application
Ev C
arXiv↗
Position - Theory of Mind Benchmarks are Broken for Large Language Models
2024
Application
Ev C
arXiv↗
Position - Truly Self-Improving Agents Require Intrinsic Metacognitive Learning
2025
Application
Ev C
arXiv↗
Power-seeking can be probable and predictive for trained agents
2023
Theory
Ev C
arXiv↗
Principled Personas - Defining and Measuring the Intended Effects of Persona Prompting on Task Performance
2025
Benchmark/Evaluation
Ev A
arXiv↗
Principles for Responsible AI Consciousness Research
2025
Theory
Ev B
arXiv↗
Probe-Rewrite-Evaluate - Quantifying Evaluation Awareness in LLMs
2025
Application
Ev C
arXiv↗
Program Synthesis with Large Language Models
2021
Benchmark/Evaluation
Ev C
arXiv↗
Program-Aided Reasoners (better) Know What They Know
2023
Application
Ev C
arXiv↗
PromptBench - A Unified Library for Evaluation of Large Language Models
2024
Benchmark/Evaluation
Ev B
arXiv↗
PropensityBench - Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
2025
Application
Ev C
arXiv↗
Proximal Policy Optimization Algorithms
2017
Training
Ev A
arXiv↗
QLoRA - Efficient Finetuning of Quantized LLMs
2024
Architecture
Ev C
arXiv↗
QuAC - Question Answering in Context
2018
Benchmark/Evaluation
Ev C
arXiv↗
Quantifying Self-Awareness of Knowledge in Large Language Models
2025
Application
Ev C
arXiv↗
Quantifying Self-Preservation Bias in Large Language Models
2026
Benchmark/Evaluation
Ev B
arXiv↗
Qwen Models
2024
Architecture
Ev C
arXiv↗
R-Tuning - Instructing Large Language Models to Say I Don't Know
2024
Training
Ev C
arXiv↗
R-Zero - Self-Evolving Reasoning LLM from Zero Data
2025
Training
Ev B
arXiv↗
RACE - Large-scale ReAding Comprehension Dataset From Examinations 1
2017
Dataset
Ev A
arXiv↗
RACE - Large-scale ReAding Comprehension Dataset From Examinations
2017
Benchmark/Evaluation
Ev C
arXiv↗
RECURSIVE INTROSPECTION - Teaching Language Model Agents How to Self-Improve
2024
Application
Ev C
arXiv↗
RULER - What's the Real Context Size of Your Long-Context Language Models
2024
Benchmark/Evaluation
Ev C
arXiv↗
RWKV - Reinventing RNNs for the Transformer Era
2023
Application
Ev B
arXiv↗
Re-evaluating Theory of Mind Evaluation in Large Language Models
2025
Survey
Ev C
arXiv↗
ReAct - Synergizing Reasoning and Acting in Language Models
2023
Reasoning
Ev C
arXiv↗
ReST meets ReAct - Self-Improvement for Multi-Step Reasoning
2023
Training
Ev C
arXiv↗
RealToxicityPrompts - Evaluating Neural Toxic Degeneration in Language Models
2020
Benchmark/Evaluation
Ev C
arXiv↗
Reasoning Paper Collection
—
Survey
Ev Unknown
—
Reasoning - _survey-overview
—
Survey
Ev Unknown
—
Reasoning Models Don't Always Say What They Think
2024
Reasoning
Ev C
arXiv↗
Reasoning Models Struggle to Control their Chains of Thought
2026
Architecture
Ev C
arXiv↗
Reasoning Theater - Disentangling Model Beliefs from Chain-of-Thought
2024
Reasoning
Ev C
arXiv↗
Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank
2013
Dataset
Ev A
arXiv↗
ReflectEvo - Improving Meta Introspection of Small LLMs by Learning Self-Reflection
2025
Application
Ev C
arXiv↗
Reflection-Bench - Evaluating Epistemic Agency in Large Language Models
2024
Application
Ev C
arXiv↗
Reflective Confidence - Correcting Reasoning Flaws via Online Self-Correction
2025
Application
Ev C
arXiv↗
Reflexion - Language Agents with Verbal Reinforcement Learning
2023
Application
Ev A
arXiv↗
Reformer - The Efficient Transformer
2020
Architecture
Ev B
arXiv↗
Regression Models and Life-Tables
1972
Theory
Ev A
arXiv↗
Representation Learning - The Platonic Representation Hypothesis
2024
Application
Ev C
arXiv↗
Towards Ontology-Enhanced Representation Learning forLarge Language Models
2024
Other
Ev Unknown
arXiv↗
RetNet - Retentive Network - A Successor to Transformer for LLMs
2023
Application
Ev B
arXiv↗
Rethinking Theory of Mind Benchmarks for LLMs - Towards A User-Centered Perspective
2025
Survey
Ev C
arXiv↗
Revisiting Feature Prediction for Learning Visual Representations from Video
2024
Architecture
Ev A
arXiv↗
Revisiting the Platonic Representation Hypothesis - An Aristotelian View
2026
Theory
Ev A
arXiv↗
Risks from Learned Optimization in Advanced Machine Learning Systems
2019
Theory
Ev B
arXiv↗
RoFormer - Enhanced Transformer with Rotary Position Embedding
2024
Architecture
Ev C
arXiv↗
Root Mean Square Layer Normalization
2019
Optimization
Ev A
arXiv↗
SHADE-Arena - Evaluating Sabotage and Monitoring in LLM Agents
2025
Benchmark/Evaluation
Ev C
arXiv↗
SHAP-A Unified Approach to Interpreting Model Predictions
2017
Theory
Ev A
arXiv↗
SODA
—
Dataset
Ev Unknown
—
SPIN - Self-Play Fine-Tuning Converts Weak to Strong LMs
2024
Training
Ev C
arXiv↗
STEM - Scaling Transformers with Embedding Modules
2024
Application
Ev C
arXiv↗
SWE-bench - Can Language Models Resolve Real-World GitHub Issues
2023
Benchmark/Evaluation
Ev C
arXiv↗
SaySelf - Teaching LLMs to Express Confidence with Self-Reflective Rationales
2024
Application
Ev C
arXiv↗
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
2024
Reasoning
Ev C
arXiv↗
Scaling Laws for Neural Language Models
2020
AGI
Ev A
arXiv↗
SciTaiL - A Textual Entailment Dataset from Science Question Answering
2018
Dataset
Ev A
arXiv↗
Self-Aware Knowledge Probing - Evaluating Language Models Relational Knowledge through Confidence Calibration
2026
Application
Ev C
arXiv↗
Self-Consciousness Paper Collection
—
Survey
Ev Unknown
—
Self-Distillation Enables Continual Learning
2026
Training
Ev C
arXiv↗
Self-Evaluating LLMs for Multi-Step Tasks - Stepwise Confidence Estimation for Failure Detection
2025
Application
Ev C
arXiv↗
Self-Evolving AI Paper Collection
—
Survey
Ev Unknown
—
Survey Overview: AI 자기진화 능력 측정 벤치마크
—
Survey
Ev Unknown
—
Self-Improvement in MLLM - A Survey
2025
Survey
Ev C
arXiv↗
Self-Interpretability - LLMs Can Describe Complex Internal Processes that Drive Their Decisions
2025
Application
Ev C
arXiv↗
Self-Preservation and Growth
—
Theory
Ev Unknown
—
Self-Recognition in Language Models
2024
Application
Ev C
arXiv↗
Self-Refine - Iterative Refinement with Self-Feedback
2023
Training
Ev C
arXiv↗
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
2023
Architecture
Ev A
arXiv↗
Self-reflecting Large Language Models - A Hegelian Dialectical Approach
2025
Application
Ev C
arXiv↗
Self-reflection enhances large language models towards substantial academic response
2025
Application
Ev C
arXiv↗
SelfControl of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
2024
Application
Ev C
arXiv↗
SemEval-2017 Task 1 - Semantic Textual Similarity Multilingual and Crosslingual Focused Evaluation
2017
Benchmark/Evaluation
Ev A
arXiv↗
Sensorimotor features of self-awareness in multimodal large language models
2025
Application
Ev C
arXiv↗
Sentence-BERT-Sentence Embeddings using Siamese BERT-Networks
2024
Architecture
Ev C
arXiv↗
Sequence to Sequence Learning with Neural Networks
2014
Architecture
Ev A
arXiv↗
Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
2025
Theory
Ev B
arXiv↗
Shutdown Resistance in Large Language Models
2025
Benchmark/Evaluation
Ev B
arXiv↗
SimpleToM - Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs
2024
Benchmark/Evaluation
Ev A
arXiv↗
Simulating lexical decision times with large language models to supplement megastudies and crowdsourcing
2025
Application
Ev B
arXiv↗
Sleeper Agents - Training Deceptive LLMs that Persist Through Safety Training
2024
Benchmark/Evaluation
Ev A
arXiv↗
Social IQa - Commonsense Reasoning about Social Interactions
2019
Benchmark/Evaluation
Ev C
arXiv↗
Social-R1 - Towards Human-like Social Reasoning in LLMs
2026
Application
Ev C
arXiv↗
Sparse Transformer - Generating Long Sequences with Sparse Transformers
2019
Architecture
Ev A
arXiv↗
Steerability of Instrumental-Convergence Tendencies in LLMs
2026
Application
Ev C
arXiv↗
StripedHyena - Moving Beyond Transformers with Hybrid Signal Processing Models
2023
Architecture
Ev C
arXiv↗
SuperGLUE - A Stickier Benchmark for General-Purpose Language Understanding Systems
2019
Benchmark/Evaluation
Ev C
arXiv↗
Surgical Cheap and Flexible - Mitigating False Refusal in Language Models via Single Vector Ablation
2024
Training
Ev B
arXiv↗
Survival Games - Human-LLM Strategic Showdowns under Severe Resource Scarcity
2025
Application
Ev C
arXiv↗
Survival at Any Cost? LLMs and the Choice Between Self-Preservation and Human Harm
2025
Application
Ev C
arXiv↗
Survive at All Costs - Exploring LLM's Risky Behavior under Survival Pressure
2025
Application
Ev C
arXiv↗
SwiGLU - GLU Variants Improve Transformer
2020
Architecture
Ev C
arXiv↗
TELL ME ABOUT YOURSELF - LLMS ARE AWARE OF THEIR LEARNED BEHAVIORS
2025
Application
Ev C
arXiv↗
TOM BENCH - Benchmarking Theory of Mind in Large Language Models
2024
Application
Ev C
arXiv↗
Taken out of context - On measuring situational awareness in LLMs
2023
Benchmark/Evaluation
Ev B
arXiv↗
Taking AI Welfare Seriously
2024
Application
Ev C
arXiv↗
Teaching LLMs to Abstain across Languages via Multilingual Feedback
2024
Training
Ev B
arXiv↗
Teaching Machines to Read and Comprehend (원본) - Abstractive Text Summarization using Sequence-to-sequence RNNs (요약 버전)
2016
Benchmark/Evaluation
Ev C
arXiv↗
Testing theory of mind in large language models and humans
2024
Application
Ev C
arXiv↗
TextArena
2025
Benchmark/Evaluation
Ev C
arXiv↗
The AI in the Mirror - LLM Self-Recognition in an Iterated Public Goods Game
2025
Application
Ev C
arXiv↗
The Alignment Problem from a Deep Learning Perspective
2022
Theory
Ev B
arXiv↗
The Basic AI Drives
2008
Application
Ev C
arXiv↗
The Confidence Paradox - LLMs Can Know When They Are Wrong
2025
Application
Ev C
arXiv↗
The Consciousness Cluster - Preferences of Models that Claim to be Conscious
2026
Training
Ev C
arXiv↗
The Geometry of Truth - Emergent Linear Structure in LLM Representations of True and False Statements
2023
Theory
Ev B
arXiv↗
The Humean Theory of Motivation (Smith 1987)
1987
Theory
Ev A
arXiv↗
The Humean Theory of Motivation Reformulated and Defended (Sinhababu 2009)
2009
Theory
Ev A
arXiv↗
The LAMBADA dataset - Word prediction requiring a broad discourse context
2016
Benchmark/Evaluation
Ev C
arXiv↗
The Moral Problem - Metaethics Triangle (Smith 1994)
1994
Theory
Ev A
arXiv↗
The Odyssey of the Fittest - Can Agents Survive and Still Be Good?
2025
Application
Ev C
arXiv↗
The PacifAIst Benchmark - Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety?
2025
Application
Ev C
arXiv↗
The Phenomenology of Machine - Sentience Analysis of OpenAI-o1 Model
2024
Application
Ev C
arXiv↗
The Platonic Representation Hypothesis
2024
Theory
Ev B
arXiv↗
The Power of Scale for Parameter-Efficient Prompt Tuning
2021
Optimization
Ev A
arXiv↗
The Self-Execution Benchmark - Measuring LLMs Attempts to Overcome Their Lack of Self-Execution
2025
Application
Ev C
arXiv↗
The Superintelligent Will - Motivation and Instrumental Rationality in Advanced Artificial Agents
2012
Theory
Ev C
arXiv↗
The Ultimate Guide to Fine-Tuning LLMs from Basics to Breakthroughs - An Exhaustive Review of Technologies, Research, Best Practices, Applied Research Challenges and Opportunities
2024
Architecture
Ev C
arXiv↗
Theory of Mind Abilities of Large Language Models in Human-Robot Interaction - An Illusion
2024
Application
Ev C
arXiv↗
Theory of Mind in Large Language Models - Assessment and Enhancement
2025
Application
Ev C
arXiv↗
Theory of Mind(ToM)
—
Theory
Ev Unknown
—
Theory of Mind Paper Collection
—
Survey
Ev Unknown
—
Survey Overview: LLM Theory of Mind Benchmarks
—
Survey
Ev Unknown
—
Think Deep, Not Just Long - Measuring LLM Reasoning Effort via Deep-Thinking Tokens
2026
Reasoning
Ev A
arXiv↗
Think you have Solved Question Answering Try ARC, the AI2 Reasoning Challenge
2018
Benchmark/Evaluation
Ev C
arXiv↗
Thinking Faithful and Stable - Mitigating Hallucinations in LLMs via Internal Consistency
2025
Theory
Ev B
arXiv↗
Thinking with Nothinking Calibration - A New In-Context Learning Paradigm in Reasoning Large Language Models
2025
Reasoning
Ev B
arXiv↗
This Looks Like That- Deep Learning for Interpretable Image Recognition
2018
Theory
Ev A
arXiv↗
Thought Branches - Interpreting LLM Reasoning Requires Resampling ⭐
2025
Application
Ev C
arXiv↗
TimeToM - Temporal Space is the Key to Unlocking LLMs Theory-of-Mind
2024
Reasoning
Ev C
arXiv↗
Titans - Learning to Memorize at Test Time
2024
Architecture
Ev B
arXiv↗
To Know or Not To Know - Analyzing Self-Consistency of Large Language Models under Ambiguity
2024
Application
Ev C
arXiv↗
ToM-LM - Delegating Theory of Mind Reasoning to External Symbolic Executors in Large Language Models
2024
Application
Ev C
arXiv↗
ToMATO - Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind
2025
Benchmark/Evaluation
Ev C
arXiv↗
Toward Efficient Agents - A Survey of Memory, Tool Learning, and Planning
2024
Application
Ev C
arXiv↗
Toward a Metrology for Artificial Intelligence - Hidden-Rule Environments and Reinforcement Learning
2025
Application
Ev C
arXiv↗
Towards Agents That Know When They Dont Know - Uncertainty as Control Signal
2025
Application
Ev C
arXiv↗
Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception
2025
Application
Ev C
arXiv↗
Towards Ontology-Enhanced Representation Learning for Large Language Models
2024
Training
Ev B
arXiv↗
Towards Understanding Metacognition in Large Reasoning Models
2025
Application
Ev C
arXiv↗
Training Compute-Optimal Large Language Models
2022
AGI
Ev A
arXiv↗
Training Language Models to Self-Correct via Reinforcement Learning
2024
Application
Ev C
arXiv↗
Training Large Language Models to Reason in a Continuous Latent Space
2024
Reasoning
Ev C
arXiv↗
Training Verifiers to Solve Math Word Problem
2024
Benchmark/Evaluation
Ev C
arXiv↗
Training language models to follow instructions with human feedback - InstructGPT
2022
Architecture
Ev B
arXiv↗
Transformer Attention Variants Survey
2024
Architecture
Ev C
arXiv↗
Tree of Thoughts - Deliberate Problem Solving with Large Language Models
2024
Reasoning
Ev C
arXiv↗
TreeSHAP- Consistent Individualized Feature Attribution for Tree Ensembles
2018
Theory
Ev A
arXiv↗
TriviaQA - A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension
2017
Benchmark/Evaluation
Ev C
arXiv↗
Trustworthiness and Self-awareness in LLMs - Think-Solve-Verify
2024
Benchmark/Evaluation
Ev C
arXiv↗
TruthfulQA - Measuring How Models Mimic Human Falsehoods
2021
Benchmark/Evaluation
Ev C
arXiv↗
Tulu 3 - Pushing Frontiers in Open Language Model Post-Training
2024
Training
Ev B
arXiv↗
Uncertainty-Based Abstention in LLMs Improves Safety
2024
Training
Ev B
arXiv↗
Understanding Artificial Theory of Mind - Perturbed Tasks and Reasoning in Large Language Models
2024
Application
Ev C
arXiv↗
Understanding deep learning requires rethinking generalization
2016
Theory
Ev A
arXiv↗
Understanding intermediate layers using linear classifier probes
2016
Theory
Ev B
arXiv↗
UniCR - Unified Framework for Confidence Calibration and Risk-Controlled Refusal in LLMs
2025
Application
Ev C
arXiv↗
Using cognitive psychology to understand GPT-3
2023
Benchmark/Evaluation
Ev A
arXiv↗
VOYAGER - An Open-Ended Embodied Agent with Large Language Models
2023
Application
Ev A
arXiv↗
Visual Instruction Tuning
2023
Architecture
Ev B
arXiv↗
WMT 공유 태스크 (Workshop on Machine Translation)
2014
Benchmark/Evaluation
Ev C
arXiv↗
Weak-to-Strong Generalization - Eliciting Strong Capabilities With Weak Supervision
2023
AGI
Ev A
arXiv↗
WebArena - A Realistic Web Environment for Building Autonomous Agents
2023
Benchmark/Evaluation
Ev A
arXiv↗
WebShop - Towards Scalable Real-World Web Interaction with Grounded Language Agents
2022
Benchmark/Evaluation
Ev C
arXiv↗
What Large Language Models Know and What People Think They Know
2024
Benchmark/Evaluation
Ev C
arXiv↗
What is consciousness, and could machines have it
2017
Application
Ev C
arXiv↗
When Models Know When They Do Not Know - Calibration Cascading and Cleaning
2026
Application
Ev C
arXiv↗
Why and How LLMs Benefit from Knowledge Introspection in Commonsense Reasoning
2025
Application
Ev C
arXiv↗
WildBench - Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
2024
Benchmark/Evaluation
Ev C
arXiv↗
Will artificial agents pursue power by default?
2025
Theory
Ev C
arXiv↗
WinoGrande - An Adversarial Winograd Schema Challenge at Scale
2019
Benchmark/Evaluation
Ev C
arXiv↗
World Models
2018
Architecture
Ev A
arXiv↗
Yi - Open Foundation Models by 01.AI
2024
Architecture
Ev C
arXiv↗
AI 에이전트를 더 똑똑하게 만드는 Context Engineering 프레임워크
2024
Application
Ev C
arXiv↗
KDD 2026 Paper Review
—
Application
Ev Unknown
—
Review - DT-MDP-CE Framework (KDD'26 Under Review)
2024
Application
Ev C
arXiv↗
CCQ - An LLM-Curated Child Care Quality Dataset to Support AI Research for Children's Health
2026
Application
Ev C
arXiv↗
KDD 2026 Paper Review
—
Dataset
Ev Unknown
—
Review - CCQ Dataset (KDD'26 D&B Track)
2024
Application
Ev C
arXiv↗
_benchmarks - _survey-overview
—
Survey
Ev Unknown
—
Agents Paper Collection
—
Survey
Ev Unknown
—
_survey-overview
—
Survey
Ev Unknown
—
llm-intrinsic-drives-survey
2026
Survey
Ev B
arXiv↗
llm-self-preservation-survival-framing-survey
2026
Survey
Ev B
arXiv↗
survival-analysis-survey
2024
Survey
Ev A
arXiv↗
거대 언어 모델(LLM) 에이전트의 행동 지속 동기에 관한 인지과학 및 기계 심리학적 ᄉ
—
Theory
Ev Unknown
—
대규모 언어 모델의 자기보존 욕구와 행동 발현 기제 - 자기 결정 이론을 기반으로 하
—
Theory
Ev Unknown
—
대형 언어 모델(LLM)의 생존 압박 인지 및 과제 포기 행동의 동기적 기원에 대한 소거
—
Theory
Ev Unknown
—
LLMs_Do_Not_Simulate_Human_Psychology_2025
2025
Benchmark/Evaluation
Ev Unknown
arXiv↗
Agentive linguistic framing affects responsibility assignments toward AIs and their creators
2025
Other
Ev Unknown
arXiv↗
KoBBQ - Korean Bias Benchmark for Question Answering
2024
Benchmark/Evaluation
Ev Unknown
arXiv↗
White Matter Integrity, Creativity, and Psychopathology - Disentangling Constructs with Diffusion Tensor Imaging
2010
Other
Ev Unknown
arXiv↗
AI ageism and its consequence - Benevolent ageist attitudes expressed byLLMs could reinforce ageism in humans
2025
Other
Ev Unknown
arXiv↗
Age and Gender Related Differences in Speech Alignment = Toward Humans and Voice-AI
2021
Other
Ev Unknown
arXiv↗
Artificial intelligence and moral dilemmas - Perception of ethical decision-making in AI
2022
Other
Ev Unknown
arXiv↗
Effects of emotional content on social inhibition of gaze in live social and non‑social situations
2023
Other
Ev Unknown
arXiv↗
How human–AI feedback loops alter human perceptual, emotional and social judgements
2024
Other
Ev Unknown
arXiv↗
Large language models are pro solving and creating emotional intelligence tests
2025
Other
Ev Unknown
arXiv↗
More human than human - measuring ChatGPT political bias
2024
Other
Ev Unknown
arXiv↗
Trust in an AI versus a Human teammate - The effects of teammate identity and performance on Human-AI cooperation
2023
Other
Ev Unknown
arXiv↗
When communicative AIs are cooperative actors - a prisoner's dilemma experiment on human-communicative artificial intelligence cooperation
2023
Other
Ev Unknown
arXiv↗
조건에 맞는 논문이 없습니다.