Para citar este trabalho use um dos padrões abaixo:
Evaluating AI control protocols is the problem of determining whether a given safety pipeline can prevent a potentially misaligned AI model from causing harmful outcomes, even under intentional subversion. A central challenge in this field is that a full evaluation requires executing the protocol across a large grid: given P problems, C protocol configurations (e.g., suspicion threshold values), and K red-team attack strategies, a complete assessment demands PCK executions, which is computationally prohibitive when any of these dimensions is large.
We propose a methodology to estimate Safety and Usefulness metrics for AI control protocols using only a fraction of the full execution budget. The approach adapts the PromptEval framework for efficient LLM benchmark evaluation to the control setting, combining a structured probabilistic model for outcome imputation with a balanced subsampling strategy for variance reduction.
Com ~200 mil publicações revisadas por pesquisadores do mundo todo, o Galoá impulsiona cientistas na descoberta de pesquisas de ponta por meio de nossa plataforma indexada.
Confira nossos produtos e como podemos ajudá-lo a dar mais alcance para sua pesquisa:
Esse proceedings é identificado por um DOI , para usar em citações ou referências bibliográficas. Atenção: este não é um DOI para o jornal e, como tal, não pode ser usado em Lattes para identificar um trabalho específico.
Verifique o link "Como citar" na página do trabalho, para ver como citar corretamente o artigo