Google Gemini 4 Argon 공개, 장기 업무를 수행하는 차세대 AI 모델
Google 이 새로운 프런티어 AI 모델 Gemini 4 Argon 을 공개 했습니다.
요즘 새로운 AI 모델이 등장할 때마다 성능 향상을 이야기 하지만, Gemini 4 Argon에서 눈여겨볼 부분은 조금 다릅니다. 단순히 질문에 더 정확하게 답혀는 데 집중하기보다, 복잡한 문제를 오랜 시간에 걸쳐 단계적으로 해결하는 능력에 상당한 무게를 뒀습니다.
Google이 공개한 활용 분야도 이를 잘 보여줍니다. 실제 소프트웨어 개발부터 금융과 법률 같은 전문 지식업무, 사이버 보안까지 비교적 복잡하고 긴 작업이 필요한 분야가 중심입니다.

한 번의 질문보다 '긴 작업' 에 초점을 맞춘 AI
Gemini 4 Argon의 성격을 이해하려면 장기 작업(Long-horizon workflow) 이라는 개념부터 살펴볼 필요가 있습니다.
예를 들어 대규모 소프트웨어를 분석한다고 생각해 보겠습니다.
단순히 코드 한 두줄 생성하는 것으로 끝나지 않습니다. 여러 파일의 관계를 파악하고 문제를 찾아낸 다음 코드를 수정하고, 그 결과가 다른 부분에 영향을 미치는지도 확인해야 합니다.
Gemini 4 Argon은 이런 식으로 여러 단계가 연결된 복잡한 업무에서 추론을 지속하도록 만들어진 모델입니다. Google 역시 Argon을 복잡하고 장시간 이어지는 워크플로우에서 깊은 추론을 유지하도록 설계했다고 설명합니다.
여기서 눈에 띄는 숫자가 하나 있습니다. 100만 토큰 입니다.
Gemini 4 Argon의 출력 토큰 한도를 기존 64k 에서 최대 1M, 즉 100만 토큰까지 확대했습니다.
모델이 한 번의 작업에서 수십만 개의 토큰을 생성할 수 있는 여유를 확보함으로써 더 복잡한 문제를 깊게 추론할 수 있도록 했다는 설명입니다.
단순히 '엄청나게 긴 글을 쓸 수 있다'고 이해하기 보다는 AI가 긴 작업을 수행할 수 있는 공간을 크게 늘렸다고 보는 편이 적절합니다.
코딩에서는 어느 정도 성능을 보여줬을까?
Gemini 4 Argon 발표에서 상당히 흥미로웠던 부분이 소프트웨어 개발입니다.
Google 엔지니어들은 일상적인 디버깅에서 대규모 코드 마이그레이션, 알고리즘 설계에 이르기까지 실제 업무에 Argon을 활ㅇㅇ하고 있다고 합니다. 장기적인 실제 소프트웨어 엔지니어링 작업을 평가하는 DeepSWEv1.1에서는 77.9%를 기록했습니다.

활용 사례를 보면 규모가 더 실감 납니다.
Google은 Argon 에이전트를 이용해 C/C++ 코드베이스를 Rust로 이전하는 작업을 진행하고 있습니다. 수만 줄 규모의 라이브러리는 물론, Fuchsia Zircon 커널처럼 80만 줄이 넘는 코드베이스도 대상에 포함됩니다. 중요한 시스템인 만큼 실제 적용 과정에서는 자동 및 수동 감사와 테스트, 리뷰도 함께 진행한다고 밝혔습니다.
영상 디코더 libgav1 사례도 있습니다.
Agron 에이전트가 기존 Rust 포트에서 3만2천 줄 규모의 SIMD 코드를 교체했고, 그 결과 기존 Rust 포트보다 2.7배 빠르면서 동일한 영상 출력을 제공하는 디코더를 구현했다는 것이 Google의 설명입니다.
이 사례가 흥미로운 이유는 AI 코딩의 역할이 변하고 있기 때문입니다.
지금까지 AI 코딩이라고 하면 필요한 함수를 만들어주거나 오류가 발생한 부분을 찾아주는 모습을 먼저 떠올렸다면, Argon이 지향하는 방향은 대규모 코드베이스를 분석하고 장기간에 걸쳐 수정과 최적화를 수행하는 쪽에 더 가깝습니다.
다만 이런 수치와 사례는 Google이 공개한 벤치마크 및 내부 활용 결과라는 점은 감안해서 볼 필요가 있습니다. 실제 개발환경에서의 체감 성능은 프로젝트 구조, 개발 언어, 사용하는 도구 등의 조건에 따라서 달라질 수 있습니다.
개발 말고 일반적인 업무에서는?
Argon의 활용 범위는 코딩에서만 머물지 않습니다.
금융 조사나 법률문서 작성처럼 여러 자료를 확인하고 판단해야 하는 전문 업무 역시 Google이 강조하는 분야 입니다.
Google에 따르면 금융·코딩·법률·세무 등의 경제적 업무 능력을 평가하는 Vals Index에서 Argon이 선두를 기록 했습니다. 다단계 금융 리서치를 평가하는 Vals Finance Agent v2와 법률 조사 및 작성을 평가하는 Harvey의 Legal Agent Benchmark에서도 높은 성능을 보였다고 설명합니다.
업무 자동화 성능도 눈여겨볼만 합니다.
Zapier가 비즈니스 업무의 처음부터 끝까지 실행하는 능력을 측정하는 AutomationBench에서는 51.3%로 1위를 기록했습니다.
결국 Google이 그리고 있는 그림은 비교적 분명해 보입니다.
사람이 필요한 순간마다 AI에게 하나씩 질문하는 방식에서 벗어나, 해야 할 일을 맡기면 여러 자료를 살펴보는 과정을 거쳐 결과까지 만들어내는 AI 입니다.
사이버 보안을 강조한 이유
이번 발표를 보다 보면 사이버 보안 이야기가 유독 많이 등장합니다.
Gemini 4 Argon은 소프트웨어에서 취약점을 찾는 데 그치지 않고, 해당 취약점을 검증하고 패치하는 작업까지 자율적으로 수행할 수 있도록 훈련됐습니다. 취약점 수정 능력을 평가하는 CWE-bench v1에서는 68%로 공동 1위를 기록했습니다.

보안업체 Wiz도 실제 Argon을 활용하고 있습니다.
Wiz는 중요 공공 인프라에서 위험 요소를 찾아 개선하는 'Scan for Good' 프로그램에서 Argon을 활용하고 있으며, 초기 사례에서는 기존 프런티어 모델들이 발견하지 못했던 의료 소프트웨어의 중요한 취약점을 발견 했다고 Google은 설명했습니다.
물론 여기에는 꽤 중요한 문제가 따라옵니다.
취약점을 찾아낼 정도로 사이버 보안 능력이 뛰어난 AI라면 같은 능력이 공격 목적으로 악용될 가능성도 고려해야 하기 때문입니다.
그래서 Google은 Gemini 4 Argon을 처음부터 모든 사람에게 공개하지 않고 있습니다.
Gemini 4 Argon, 지금 바로 사용할 수 있을까?
결론부터 이야기하면 아직 누구나 사용할 수 있는 모델은 아닙니다.
현재 Argon은 Google 의 Fairwind Program을 통해 신뢰할 수 있는 사이버보안 담당자들에게 우선 제공되고 있습니다. Google은 초기 사용자들의 피드백을 받아 안전장치를 보완하면서 이용 범위를 단계적으로 확대한다는 계획입니다. 이후 개발자와 기업, 일반 사용자에게 확대하며, 그 시작은 유료 API 고객과 Google AI Ultra 구독자가 될 예정입니다.
마무리
Gemini 4 Argon 은 단순한 대화형 AI보다 복잡하고 긴 업무를 맡아 처리하는 AI Agent형 모델에 가깝습니다.
다만 발표된 성능 수치는 Google이 공개한 자체 평가와 특정 조건의 벤치마크 결과이므로, 실제 업무에 적용할 때는 별도의 검증이 필요합니다.
앞으로 Gemini 4 Argon이 OpenAI, xAI, Anthropic, Meta 등 다른 빅테크 기업의 고성능 AI 모델과 어떤 경쟁을 펼칠지, 그리고 AI가 사람의 단순 업무를 넘어 전문적인 장기 프로젝트까지 얼마나 안정적으로 수행할 수 있을지 귀추가 주목됩니다.