Entities · Products
LLMs
35 articles tagged with this entity.
-
How Much is Left? LLMs Linearly Encode Their Remaining Output Length
-
Reddit is using LLMs to solve a problem LLMs largely created
-
RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation
-
AGI Maze as a Benchmark Framework for World-Modeling Agents
-
Post-Training Pruning for Diffusion Transformers
-
BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams
-
Can LLMs Hire Fairly? Racial Bias in Resume Screening
-
When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries
-
Diversity is the Strength of the AI Crowd
-
When Does Personality Composition Matter for Multi-Agent LLM Teams?
-
ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP
-
Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries
-
ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving
-
A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models
-
Source-Grounded Data Generation for Text-to-JSON Learning
-
TW-LegalBench: Measuring Taiwanese Legal Understanding
-
Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports
-
SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data
-
Evaluative Judgement in Teaching AI-based Translation: A Class-room Case Study of AI-Mediated Translation and Post-Editing
-
Generative causal testing to bridge data-driven models and scientific theories in language neuroscience
-
Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms
-
Automated jailbreak attack targeting multiple defense strategies
-
NeST: Neuron Selective Tuning for LLM Safety
-
M\"OVE: A Holistic LLM Benchmark for the German Public Sector
-
CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts
-
DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking
-
What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks
-
TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs
-
Advancing Mathematics Research with AI-Driven Formal Proof Search
-
Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models
-
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
-
MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights
-
Mind the Gap: Bridging Behavioral Silos with LLMs in Multi-Vertical Recommendations
-
HKJudge: A Legal Discourse-Annotated Corpus for Interpreting What Courts Find, How They Reason, and What They Rule
-
RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs