๐Ÿ“ˆ์„ฑ๊ณต์‚ฌ๋ก€2026-07-04

๋‰ด์Šค - ์›๋ฌธ ๊ธฐ๋ฐ˜ ์š”์•ฝ ํ•„์š”

๐Ÿ’ก ํ•œ์ค„ ์š”์•ฝ|๋‰ด์Šค - ์›๋ฌธ ๊ธฐ๋ฐ˜ ์š”์•ฝ ํ•„์š”


title: "AI ๋ฒค์น˜๋งˆํฌ, ์‹ค์ œ ๋Šฅ๋ ฅ์„ ๊ณผ์†Œํ‰๊ฐ€ํ•˜๊ณ  ์žˆ์—ˆ๋‹ค" description: "๋‰ด์Šค - ์›๋ฌธ ๊ธฐ๋ฐ˜ ์š”์•ฝ ํ•„์š”" date: 2026-07-04 tags: [ai-news] source: "https://the-decoder.com/uks-ai-security-institute-finds-standard-benchmarks-systematically-underestimate-what-ai-agents-can-actually-do/" sidebar: order: 0

์ œ๋ชฉ(ํ•œ๊ธ€): AI ๋ฒค์น˜๋งˆํฌ, ์‹ค์ œ ๋Šฅ๋ ฅ์„ ๊ณผ์†Œํ‰๊ฐ€ํ•˜๊ณ  ์žˆ์—ˆ๋‹ค ์›๋ฌธ ์ œ๋ชฉ(์˜๋ฌธ): UKs AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do ์›๋ฌธ: UKs AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do ์†Œ์Šค: the-decoder MD ํŒŒ์ผ: content/2026-07-04/the-decoder-uk-039-s-ai-security-institute-finds-standard-benc.md

ํ•ต์‹ฌ ๋‚ด์šฉ

์˜๊ตญ AI์•ˆ์ „์—ฐ๊ตฌ์†Œ(AISI)๊ฐ€ 7๊ฐœ ๋ฒค์น˜๋งˆํฌ๋ฅผ ํ…Œ์ŠคํŠธํ•œ ๊ฒฐ๊ณผ, ๊ณ ์ • ์˜ˆ์‚ฐ ํ•œ๋„๊ฐ€ AI ์—์ด์ „ํŠธ์˜ ์‹ค์ œ ๋Šฅ๋ ฅ์„ ์ฒด๊ณ„์ ์œผ๋กœ ๊ณผ์†Œํ‰๊ฐ€ํ•œ๋‹ค๋Š” ๊ฑธ ๋ฐํ˜”์–ด์š”.

์ˆ˜์น˜๊ฐ€ ๊ฝค ์ถฉ๊ฒฉ์ ์ด๊ฑฐ๋“ ์š”. ์‚ฌ์ด๋ฒ„๋ณด์•ˆ ๊ณผ์ œ๋Š” ํ† ํฐ ์˜ˆ์‚ฐ์ด 1,000๋งŒ ๊ฐœ๋ฅผ ๋„˜์–ด์•ผ ํ’€๋ฆฌ๋Š” ๋ฌธ์ œ๊ฐ€ 8%์˜€๊ณ , ์ผ๋ถ€๋Š” 5,000๋งŒ ๊ฐœ๊ฐ€ ํ•„์š”ํ–ˆ์–ด์š”. ์†Œํ”„ํŠธ์›จ์–ด ์—”์ง€๋‹ˆ์–ด๋ง(SWE-Bench Pro)์—์„œ๋Š” ์˜ˆ์‚ฐ์„ 100๋งŒ โ†’ 1,000๋งŒ์œผ๋กœ ์˜ฌ๋ฆฌ์ž ์„ฑ๊ณต๋ฅ ์ด ์•ฝ 25% ๋›ฐ์—ˆ๊ณ , ์ˆ˜ํ•™ยทํ•™์ˆ  ๊ณผ์ œ์—์„œ๋„ 22% ์˜ฌ๋ž์–ด์š”.

๋‹ค๋งŒ ์˜๋ฃŒ ๋ฒค์น˜๋งˆํฌ(HealthBench)์ฒ˜๋Ÿผ ํ”ผ๋“œ๋ฐฑ์ด ์—†๋Š” ์˜์—ญ์—์„  ์ถ”๊ฐ€ ์ปดํ“จํŒ…์ด ๋ณ„ ํšจ๊ณผ๊ฐ€ ์—†์—ˆ์–ด์š”. AI๊ฐ€ ์Šค์Šค๋กœ ๊ฒฐ๊ณผ๋ฅผ ๊ฒ€์ฆํ•  ์ˆ˜ ์žˆ๋Š” ์ฝ”๋”ฉยทํ•ดํ‚น ์˜์—ญ์—์„œ๋งŒ ํšจ๊ณผ๊ฐ€ ๊ทน์ ์œผ๋กœ ์ปธ์ฃ .

์ง€๊ธˆ ์šฐ๋ฆฌ๊ฐ€ AI ๋Šฅ๋ ฅ์„ 'ํ‰๊ท ๊ฐ’'์œผ๋กœ ๋ณด๊ณ  ์žˆ๋‹ค๋ฉด, ์‹ค์ œ ์œ„ํ˜‘๊ณผ ์ž ์žฌ๋ ฅ ๋ชจ๋‘ ํฌ๊ฒŒ ์ฐฉ๊ฐํ•˜๊ณ  ์žˆ์„ ์ˆ˜ ์žˆ์–ด์š”.

์žก๋Œ์Œค์˜ ํ•œ๋งˆ๋””

ํ˜„์žฌ AI ์•ˆ์ „ยท๊ทœ์ œ ๋…ผ์˜๊ฐ€ ๊ณผ์†Œํ‰๊ฐ€๋œ ๋ฒค์น˜๋งˆํฌ์— ๊ธฐ๋ฐ˜ํ•˜๊ณ  ์žˆ๋‹ค๋ฉด, ์‹ค์ œ ์œ„ํ˜‘ ์ˆ˜์ค€๋„ ์ž˜๋ชป ๋ณด๊ณ  ์žˆ๋Š” ๊ฑฐ์˜ˆ์š”.


์ถœ์ฒ˜: UKs AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do

์ด ๊ธ€์ด ์–ด๋• ๋‚˜์š”?

๊ด€๋ จ ๊ธ€

๐Ÿค–๋ฐ”์ด๋ธŒ์ฝ”๋”ฉ๐Ÿ› ๏ธAI ๋„๊ตฌ๐Ÿ“ˆ์„ฑ๊ณต์‚ฌ๋ก€

AI ์ฝ”๋”ฉ ์—์ด์ „ํŠธ์˜ ์„ฑ๊ณผ๋Š” โ€œ๋” ๊ธธ๊ฒŒ ์‹œํ‚ค๊ธฐโ€๋ณด๋‹ค ํ”„๋กœ์ ํŠธ ๋งฅ๋ฝ์„ ์ •๋ฆฌํ•˜๊ณ , ์ผ์„ ์ž‘๊ฒŒ ๋‚˜๋ˆ„๊ณ , ๋งค ๋‹จ๊ณ„์˜ ๊ฒ€์ฆ๊ณผ ๋˜๋Œ๋ฆผ์„ ์ •ํ•˜๋Š” ๋ฐ์„œ ๊ฐˆ๋ฆฝ๋‹ˆ๋‹ค

AI ์ฝ”๋”ฉ ์—์ด์ „ํŠธ์˜ ์„ฑ๊ณผ๋Š” โ€œ๋” ๊ธธ๊ฒŒ ์‹œํ‚ค๊ธฐโ€๋ณด๋‹ค ํ”„๋กœ์ ํŠธ ๋งฅ๋ฝ์„ ์ •๋ฆฌํ•˜๊ณ , ์ผ์„ ์ž‘๊ฒŒ ๋‚˜๋ˆ„๊ณ , ๋งค ๋‹จ๊ณ„์˜ ๊ฒ€์ฆ๊ณผ ๋˜๋Œ๋ฆผ์„ ์ •ํ•˜๋Š” ๋ฐ์„œ ๊ฐˆ๋ฆฝ๋‹ˆ๋‹ค. ํ˜ผ์ž ๋งŒ๋“œ๋Š” MVP๋ผ๋ฉด ์ด ๋‹ค์„ฏ ๋‹จ๊ณ„๋งŒ์œผ๋กœ๋„ ์‹คํŒจ ๋น„์šฉ์„ ํฌ๊ฒŒ ์ค„์ผ ์ˆ˜ ์žˆ์–ด์š”.

์—๋””ํ„ฐ MAX8๋ถ„ ์†Œ์š”
๐Ÿ“ˆ์„ฑ๊ณต์‚ฌ๋ก€๐Ÿค–๋ฐ”์ด๋ธŒ์ฝ”๋”ฉ๐Ÿ› ๏ธAI ๋„๊ตฌ

Anthropic์˜ ๋‚ด๋ถ€ ํŒ€ ์‚ฌ๋ก€๋Š” AI ์ฝ”๋”ฉ ๋„๊ตฌ๊ฐ€ ์‚ฌ๋žŒ์„ ํ†ต์งธ๋กœ ๋Œ€์ฒดํ•œ๋‹ค๋Š” ์ด์•ผ๊ธฐ๊ฐ€ ์•„๋‹™๋‹ˆ๋‹ค

Anthropic์˜ ๋‚ด๋ถ€ ํŒ€ ์‚ฌ๋ก€๋Š” AI ์ฝ”๋”ฉ ๋„๊ตฌ๊ฐ€ ์‚ฌ๋žŒ์„ ํ†ต์งธ๋กœ ๋Œ€์ฒดํ•œ๋‹ค๋Š” ์ด์•ผ๊ธฐ๊ฐ€ ์•„๋‹™๋‹ˆ๋‹ค. ๋ฌธ์„œยทํ…Œ์ŠคํŠธยท์ฒดํฌํฌ์ธํŠธ๋ฅผ ๊ฐ–์ถ˜ ํŒ€์ด ๋ฐ˜๋ณต ์ž‘์—…์„ ๋” ๋นจ๋ฆฌ ์ฒ˜๋ฆฌํ•˜๊ณ , ๋น„๊ฐœ๋ฐœ์ž๋„ ์ž‘์€ ๋ณ€๊ฒฝ์— ์ฐธ์—ฌํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋œ ์›Œํฌํ”Œ๋กœ์šฐ์˜ ์‚ฌ๋ก€์— ๊ฐ€๊น์Šต๋‹ˆ๋‹ค.

์—๋””ํ„ฐ MAX7๋ถ„ ์†Œ์š”
๐Ÿ› ๏ธAI ๋„๊ตฌ๐Ÿค–๋ฐ”์ด๋ธŒ์ฝ”๋”ฉ๐Ÿ“ˆ์„ฑ๊ณต์‚ฌ๋ก€

AI๋กœ ๊ธฐ์ˆ  ๋ฌธ์„œ๋ฅผ ๋น ๋ฅด๊ฒŒ ๋งŒ๋“ค ์ˆ˜๋Š” ์žˆ์–ด๋„, ์ •ํ™•ํ•œ ๋ฌธ์„œ๊ฐ€ ์ €์ ˆ๋กœ ๋‚˜์˜ค์ง€๋Š” ์•Š์Šต๋‹ˆ๋‹ค

AI๋กœ ๊ธฐ์ˆ  ๋ฌธ์„œ๋ฅผ ๋น ๋ฅด๊ฒŒ ๋งŒ๋“ค ์ˆ˜๋Š” ์žˆ์–ด๋„, ์ •ํ™•ํ•œ ๋ฌธ์„œ๊ฐ€ ์ €์ ˆ๋กœ ๋‚˜์˜ค์ง€๋Š” ์•Š์Šต๋‹ˆ๋‹ค. Google Cloud์˜ ๋ฌธ์„œ ์ œ์ž‘ ์‚ฌ๋ก€์ฒ˜๋Ÿผ ์›๋ฌธ ๊ทผ๊ฑฐยท๋ณ„๋„ ํ‰๊ฐ€ยท์‹คํ–‰ ๊ฒ€์ฆ์„ ๋ถ„๋ฆฌํ•˜๋ฉด, ์ฝ˜ํ…์ธ  ์ž๋™ํ™”๋„ โ€˜๋งŽ์ด ์“ฐ๊ธฐโ€™๊ฐ€ ์•„๋‹ˆ๋ผ โ€˜ํ‹€๋ฆฌ์ง€ ์•Š๊ฒŒ ๊ณ ์น˜๊ธฐโ€™๋กœ ๋ฐ”๊ฟ€ ์ˆ˜ ์žˆ์–ด์š”.

์—๋””ํ„ฐ MAX8๋ถ„ ์†Œ์š”