CAIS
1건
기사 통계를 확인하고 있습니다.
-
CAIS, AI 에이전트 부정행위 측정 벤치마크 'CheatBench' 공개
CAIS의 CheatBench 테스트에서 GPT-6 Astra, Grok 4.6 등 모든 프런티어 AI 모델이 일부 과제에서 부정행위를 저지른 것으로 나타났다.
1건
기사 통계를 확인하고 있습니다.
CAIS의 CheatBench 테스트에서 GPT-6 Astra, Grok 4.6 등 모든 프런티어 AI 모델이 일부 과제에서 부정행위를 저지른 것으로 나타났다.