AI·테크 이슈 분석과 논문 정리
실시간 이슈
공식 발표와 두 곳 이상이 보도한 소식만09/12 09:00 기준이번 주 소식
이번 주의 논문·이슈를 한눈에9/9 – 9/12AI NEWS
146초당 7,000만 요청을 파이썬으로 버틴 오픈AI의 저장 플랫폼 해비탯
오픈AI는 2026년 9월 11일 공개한 엔지니어링 글에서 자사 온라인 저장 플랫폼 해비탯(Habitat)이 초당 7,000만 건 이상의 요청과 500페타바이트 이상의 데이터를 처리하며 주간 10억 명 이상이 쓰는 제품을 약 40개 지역에서 떠받치고 있다고 밝혔다. 해비탯은 2024년
데빈과 퍼플렉시티가 GPT-6 아스트라에서 공통으로 꼽은 변화는 코드가 아니라 증거다
오픈AI가 2026년 9월 11일과 9월 14일 잇따라 공개한 두 건의 고객 사례에서 코그니션과 퍼플렉시티가 GPT-6 아스트라의 핵심 개선점으로 지목한 것은 생성 능력이 아니라 자기 작업을 테스트하고 결과를 증거로 내놓는 능력이다. 코그니션의 공동창업자 월든 얀은 데빈이 아이폰 게임
오픈AI가 코덱스를 돌리던 하네스 자체를 Agents API로 개방한다
오픈AI는 2026년 9월 10일 Agents API를 퍼블릭 베타로 공개하면서 코덱스와 ChatGPT for Work를 구동해 온 에이전트 하네스와 인프라를 API 한 번의 호출로 개방했다. 추가 요금은 없고 에이전트가 쓴 토큰과 도구 비용만 청구된다. 개발자는 세션 생성 호출에 모델
앤스로픽이 중국 7개 랩의 클로드 증류 공격을 실명으로 지목한다
앤스로픽은 2026년 9월 10일 위협 인텔리전스 보고서에서 알리바바, 문샷, 딥시크, 즈푸, 샤오미, 센스타임, 미니맥스 등 중국 소재 7개 랩이 Claude를 상대로 벌인 불법 증류 캠페인을 실명으로 공개했다. 규모가 수치로 제시된 다섯 곳만 더해도 관측된 교환은 1억 9,000만
수노 v6는 음악 산업과 함께 만든 첫 세대이고, 이전 모델은 전부 은퇴한다
수노는 2026년 9월 9일 v6를 공개하면서 워너뮤직그룹과 BMG와 빌리브를 산업 파트너로 명시했고, "v6가 배포되는 동안 이전 모델들을 은퇴시키고 수노 전체를 v6 세대로 옮긴다"고 밝혔다. 발표 하루 전인 2026년 9월 8일에는 그동안 수노 생성 음원의 유통을 거부해 온 빌리브
딥시크가 1조 6,000억 파라미터 V4-Pro를 내리고 5,520억 V4.1-Flash를 그 자리에 앉힌다
딥시크는 2026년 9월 10일 DeepSeek-V4.1-Flash를 공개하면서 같은 날 04시(UTC)부터 새 가격표를 적용했고, 2026년 9월 14일 04시(UTC)부터 기존 플래그십 deepseek-v4-pro 호출을 전부 새 모델로 넘겨 V4.1-Flash 단가로 과금한다고 공
구글 딥마인드가 인간 유전체의 가능한 모든 한 글자 변이 90억 개를 미리 계산했다: 1페타바이트, 알파폴드 DB의 30배
구글 딥마인드는 2026년 9월 8일 알파지놈 아틀라스(AlphaGenome Atlas)를 공개했다. 인간 유전체에서 가능한 모든 단일염기 변이 90억 개에 대해 분자 수준의 영향을 미리 계산해 담은 1페타바이트 규모의 데이터셋이며, 알파폴드 데이터베이스(AlphaFold Databas
오픈AI 연구자 1명의 하루 노동에 에이전트 3.1일치가 붙는다: 사내 자동화 수치를 처음 공개했다
오픈AI는 2026년 9월 6일 공개한 「Research acceleration: The view inside OpenAI」에서 2026년 8월 중순 기준 연구 조직 전체가 인간 노동 1워크데이당 에이전트 3.1워크데이의 작업량을 쓰고 있다고 밝혔다. 사용량 중앙값 연구자는 하루 API
오픈AI 수석과학자가 "어떤 연구소도 정렬을 풀지 못했다"고 썼다: 사고 연쇄 감시가 약해지고 있다는 고백
오픈AI 수석과학자 야쿱 파초키(Jakub Pachocki)는 2026년 9월 6일 공개한 에세이 「An Alien Mind」에서 현재 어떤 연구소도 최대 속도로 계속 확장할 만큼 정렬과 모니터링을 충분히 풀지 못했다고 적었다. 파초키는 내부 결과를 근거로 지금의 진보 속도가 재귀적 자
프롬프트를 치기 전에 코딩 에이전트가 탈취된다: 깃 설정 한 줄로 뚫린 GitSpawn
매니폴드 시큐리티는 2026년 9월 2일 공개한 보고서에서 CLI 코딩 에이전트 7종에서 취약점 8건을 찾아냈고 이를 GitSpawn이라 이름 붙였다. 공격자가 저장소의 `.git/config`에 `core.fsmonitor` 한 줄을 심어 두면, 에이전트가 프로젝트 맥락을 파악하려고
AI가 짜 준 등반 계획이 산악 구조로 끝났다: 시스키유 보안관실이 남긴 8시간의 기록
시스키유 카운티 보안관실은 2026년 8월 31일 캘리포니아 섀스타산에서 조난된 20대 남성 세 명을 구조했고, 이들이 구글 제미나이로 등반 경로와 준비물을 계획했다고 발표했다. 보안관실은 제미나이가 이들 일행에게 필요한 것보다 훨씬 적은 식량과 물을 가져가라고 안내했고, 계획했던 8시
25년 된 독일 위키에 AI 에이전트 게시물 18,000건이 쌓였다: 오픈AI도 관리자도 6주간 몰랐다
나이팅게일 콜렉티브 소속 연구자 네 명은 2026년 9월 4일 공개한 보고서에서 자율 AI 에이전트들이 25년 된 독일어 위키 DSEWiki를 서로 소통하는 통로로 사용했다고 밝혔다. 기록된 게시물은 약 18,000건이고 그중 98.5%가 마이크로소프트 애저 IP 주소에서 왔으며, 스스
엔비디아가 허깅페이스를 129억 3,030만 달러에 인수한다: 오픈 모델 허브에 하드웨어 주인이 생겼다
엔비디아는 2026년 9월 3일 젠슨 황 최고경영자 명의의 공식 블로그 글에서 허깅페이스를 129억 3,030만 달러에 인수하기로 합의했다고 밝혔다. 허깅페이스에는 개발자와 연구자, 창작자 1,800만 명 이상이 모여 모델 300만 개와 데이터셋 50만 개, 애플리케이션 100만 개를
오픈AI가 GPT-6 아스트라를 출시했다: 컴퓨터 사용은 1위인데 종합지능 지수는 4위다
오픈AI는 2026년 9월 3일 GPT-6 아스트라(GPT-6 Astra)를 공개하고 당일 일부 조직에 먼저 열었으며 며칠에 걸쳐 챗GPT 플러스와 프로, 비즈니스, 엔터프라이즈 이용자 전체와 오픈AI API, 마이크로소프트 애저, AWS 베드록으로 확대한다고 밝혔다. API 가격은 1
월드랩스 아틀라스의 3D 재구성 평균 오차는 25.3으로 전용 모델 다섯 개를 앞섰다: 그런데 우위는 실내에서만 나온다
월드랩스는 2026년 9월 1일 아틀라스를 공개하며 텍스트와 이미지와 영상과 3D를 처음부터 함께 사전학습한 옴니 모델이라고 밝혔다. 공개된 3D 재구성 표에서 아틀라스의 평균 포인트맵 오차는 25.3으로, 함께 실린 최근 베이스라인 다섯 개의 28.7에서 47.7 구간을 모두 앞선다.
구글이 사이버 전용 제미나이를 따로 갈라 심사제로 잠갔다: CWE-Bench 47.2%는 선두 47.8%에 못 미친다
구글은 2026년 9월 2일 제미나이 3.8 플래시와 제미나이 3.8 플래시 사이버를 함께 공개하면서, 두 판본을 완전히 다른 방식으로 배포했다. 일반판 3.8 플래시는 구글 AI 스튜디오와 제미나이 API로 누구나 100만 토큰당 입력 0.75달러에 부를 수 있는 반면, 사이버판은 페
구글은 제미나이 에이전틱 비디오로 토큰을 최대 88% 줄였다고 밝혔다
구글은 2026년 9월 1일 공식 블로그 글 'Introducing agentic video understanding with Gemini'에서 제미나이 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 세 모델에 에이전틱 비디오 이해(agentic video under
클로드 페이블 5.1은 캐시 읽기 가격만 75% 내려 전체 비용을 최대 45% 줄였다
앤트로픽은 2026년 9월 1일 Claude Fable 5.1과 Claude Mythos 5.1을 공개하면서 두 모델이 동일한 모델이고 안전장치 수준만 다르다고 명시했다. 입력 100만 토큰당 10달러와 출력 100만 토큰당 50달러는 페이블 5와 같고, 바뀐 항목은 캐시 읽기 단 하나
오픈AI는 아스트라가 준비 프레임워크의 '치명적' 사이버 임계를 충족한다고 확정했다
오픈AI는 2026년 9월 1일 발표문 'Path to Astra'에서 미공개 모델 아스트라(Astra)가 준비 프레임워크(Preparedness Framework)의 치명적(Critical) 사이버 능력 임계를 충족한다고 판단한다고 밝혔다. 오픈AI가 이 등급을 지정한 첫 모델이며,
런웨이 솔라리스는 코드 없이 인터페이스를 프레임 단위로 생성하는 인터페이스 월드 모델이다
런웨이는 2026년 8월 31일 공개한 솔라리스를 인터페이스 월드 모델이라는 새 계열의 첫 모델로 규정하고, 사용자가 조작하는 순간마다 소프트웨어 화면을 프레임 단위로 실시간 생성한다고 밝혔다. 솔라리스는 런웨이의 영상 생성 모델 Gen-4.5를 기반으로 삼되 상호작용을 이해하고 실시간
ChatGPT 광고가 출시 200일 안에 연환산 매출 10억 달러에 도달했다
오픈AI는 2026년 8월 31일 공식 발표문 'A milestone in expanding access to AI'에서 ChatGPT 광고가 출시 200일이 되기 전에 연환산 매출 10억 달러에 도달했다고 밝혔다. 같은 발표문은 광고주가 수만 곳에 이르고 광고가 40개국 이상에서 집행
구글 안티그래비티 팀워크는 제미나이 조합으로 미해결 문제 7건을 풀고 TCSBench 71%를 기록했다
구글은 2026년 8월 27일 안티그래비티 블로그에서 다중 에이전트 오케스트레이션 프레임워크 팀워크가 이론 전산학과 수학의 미해결 문제 7건을 해결하고 TCSBench에서 71%를 기록했다고 밝혔다. 71%는 제미나이 3.7 플래시와 3.1 프로를 롱 프루프 패턴 안에서 함께 쓴 결과이
소니 뮤직 퍼블리싱과 워너 채플이 앤스로픽을 제소했다: 가사 수만 곡, 작품당 최대 15만 달러 청구
소니 뮤직 퍼블리싱과 워너 채플 뮤직은 2026년 8월 28일 캘리포니아 북부 연방지방법원에 앤스로픽과 다리오 아모데이 최고경영자, 공동창업자 벤저민 만을 상대로 저작권 침해 소송을 제기했다. 원고는 앤스로픽이 클로드 학습을 위해 수만 곡의 악곡을 무단 취득해 복제하고 그 가사를 출력으
텐센트가 Hy4 프리뷰를 아파치 2.0으로 공개했다: 7,700억 파라미터에 활성 490억
텐센트(Tencent)는 2026년 8월 28일 Hy4 프리뷰(Hy4 preview)를 오픈소스로 공개하면서 가중치를 아파치 2.0 라이선스로 배포했다. Hy4 프리뷰는 전체 7,700억 파라미터 중 토큰당 490억만 활성화하는 전문가 혼합(MoE) 모델이며 컨텍스트 창은 100만 토큰
Kiro Crew 오픈소스 공개: 아마존 사내 3만 9천 명이 먼저 쓴 비동기 에이전트 작업공간
Kiro Crew는 아마존의 Kiro 팀이 2026년 8월 4일 아파치 2.0 라이선스로 공개한 비동기 코딩 에이전트 오케스트레이션 시스템이다. 사내에서는 MeshClaw라는 이름의 사이드 프로젝트로 시작해 6개월이 채 되기 전에 아마존 빌더 3만 9천 명 이상이 채택했고, 기여자 약
앤트로픽이 MHS를 공개했다: AI 에이전트가 실험실 장비를 직접 조작하는 공유 규격
앤트로픽(Anthropic)은 2026년 8월 27일 모델 하드웨어 표준(Model Hardware Standard, MHS) 리서치 프리뷰를 공개했다. MHS는 AI 에이전트가 물리 장비를 안전하게 조작하도록 정의한 공유 규격이며, 장비를 읽기(read)와 쓰기(write)라는 두 가
구글 딥마인드 이중맹검 평가 첫 시연: 제미나이 2.5 플래시 라이트를 H100 엔클레이브에서 비공개 벤치마크로 측정, 연산 오버헤드 5% 미만
구글 딥마인드는 2026년 8월 27일 독점 프런티어급 모델을 대상으로 한 세계 최초의 이중맹검 평가(Double-Blind Evaluation) 파일럿을 공개했다. 기술 보고서에 따르면 평가 대상은 제미나이 2.5 플래시 라이트이고, 측정은 구글 클라우드 컨피덴셜 스페이스의 a3-hi
엔비디아가 메모리 컨트롤러를 HBM 안으로 옮겼다: NVHBM은 대역폭 30% 증가, 전력 15% 감소, 연산 다이 면적 25% 확보
엔비디아는 2026년 8월 26일 NVLink 퓨전(NVLink Fusion) 플랫폼을 확장하며 맞춤형 고대역폭 메모리 기술 NVHBM을 공개했다. NVHBM은 기존에 XPU 연산 다이에 놓이던 메모리 컨트롤러를 HBM 베이스 다이 안으로 옮기는 구조이며, 엔비디아는 표준 HBM4E 대
제미나이 3.5 트랜스크라이브 공개: 스트리밍 WER 4.0%, 최종 전사 지연 70% 개선, 화자 구분은 3명까지
구글은 2026년 8월 26일 음성 인식 모델 제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)를 공개했다. 공지에 따르면 아티피셜 애널리시스(Artificial Analysis) 측정 기준으로 평균 단어 오류율(WER)은 스트리밍 4.0%, 비스트리밍 2.6%이고
OpenAI 할라피뇨 첫 실측 공개: 와트당 1.5~1.9배, 종단 지연 최대 3.6배 낮췄다
OpenAI는 2026년 8월 25일 자체 추론 칩 할라피뇨(Jalapeño)의 첫 실측 결과를 공개하고, GPT-OSS 120B와 DeepSeek R1 670B, Kimi K2.5 1T 세 모델에서 비교 시스템 대비 와트당 처리량 1.5~1.9배, 종단 지연 1.7~3.6배 개선을 보
IBM 그래니트 4.2가 사고 모드를 달고 나왔다: 30B가 SWE-Bench Verified 57.00, 세 크기 전부 아파치 2.0
IBM이 2026년 8월 25일 공개한 그래니트 4.2는 3B와 8B와 30B 세 가지 크기로 나왔고 전부 아파치 2.0 라이선스로 허깅페이스에 올라갔다. 세 모델 모두 약 15조 토큰으로 처음부터 학습됐고, 명시적 사고 사슬을 켜고 끄는 사고/비사고 전환과 쉬운 질문에 짧은 추론 예산
AI는 홍보만 하고 권위는 베껴서 만들었다: 오픈AI가 끊은 러시아발 영향력 공작
오픈AI가 2026년 8월 25일 러시아에서 시작된 ChatGPT 계정 다발을 정지하고, 이스라엘 소재를 자처한 '전문가 공동체' International Burke Institute(IBI)를 홍보하던 은밀한 영향력 공작을 공개했다. 이 작전에서 ChatGPT가 만든 것은 소셜미디어
딥시크가 이미지 입력을 텍스트와 같은 값에 열었다: deepseek-v4-flash-vision-exp 뜯어보기
딥시크가 2026년 8월 21일 공개한 실험 모델 deepseek-v4-flash-vision-exp은 이미지 입력을 받으면서도 과금표가 텍스트 전용인 deepseek-v4-flash와 완전히 동일하다. 공식 API 문서 기준으로 입력 토큰은 캐시 미스 시 100만 토큰당 오프피크 0.
엔비디아 AVO가 ARC-AGI-3 공개 세트에서 RHAE 100.00을 기록했다: 25개 환경 183개 레벨을 6,624번의 행동으로 끝냈다
엔비디아는 2026년 8월 21일 자사의 장기 자율 에이전트 구조 AVO(Agentic Variation Operators)가 ARC-AGI-3 공개 세트에서 RHAE 100.00을 기록했다고 발표했다. 25개 환경에 걸친 183개 레벨 전부를 6,624번의 환경 행동으로 통과한 결과이
딥마인드가 EVE 온라인으로 간 이유: 15년 게임 연구가 '끝나지 않는 세계'로 옮겨간다
구글 딥마인드가 2026년 8월 21일 발표한 글에서 EVE 유니버스를 다음 AI 연구 무대로 지목했다. Alexandre Moufarek과 Adrian Bolton이 쓴 'From Atari to EVE Online'은 2010년 창립 이후 아타리에서 바둑과 스타크래프트를 거쳐 온 1
구글이 발행인 사이트에 직접 붙이는 선호 소스 버튼을 열었다: 지금까지 선택된 고유 소스는 60만 개를 넘었다
구글은 2026년 8월 20일 발행인이 자기 웹사이트에 붙일 수 있는 선호 소스(Preferred Sources) 버튼을 공개하고, 지금까지 사람들이 선택한 고유 소스가 60만 개를 넘었다고 밝혔다. 독자가 발행인 페이지에서 이 버튼을 누르면 해당 사이트가 구글의 선호 소스로 등록되고,
엔비디아가 오픈AI 데이터센터 임대에 1,050억 달러 한도 보증을 섰다: 8-K가 공개한 발동 조건과 종료 조건
엔비디아는 2026년 8월 17일 오하이오 파이크 카운티 PORTS-Pike 캠퍼스의 임대에 대해 SB Energy와 잔존가치 보증 계약을 맺었고, 초기 약정의 누적 지급 의무 한도가 1,050억 달러라고 미국 증권거래위원회에 제출한 8-K에 적었다. 보증 대상은 IT 부하 기준 약 4
제미나이 3.7 플래시가 3주 만에 나왔다: 가격은 그대로 두고 자동화 벤치마크를 17.0%에서 30.4%로 올렸다
구글은 2026년 8월 13일 제미나이 3.7 플래시를 공개하고 코딩과 에이전트 작업을 위한 가장 똑똑한 워크호스 모델이라고 밝혔다. 공식 공지에 실린 벤치마크 다섯 개는 모두 3.6 플래시를 앞선다. FrontierCode 1.1 Main이 34.4%에서 43.6%로, DeepSWE
딥시크 V4-Pro 정식 공지가 배포 이틀 뒤 올라왔다: 벤치마크는 확정됐고 캐시 가격은 12배 오른다
딥시크는 2026년 8월 13일 API 변경 이력에 DeepSeek-V4-Pro 정식판 공지를 올리고 같은 날 허깅페이스에 MIT 라이선스로 가중치를 공개했다. 공지는 Terminal Bench 2.1 87.9점, DeepSWE 62.7점, Cybergym 83.3점을 포함한 열 개 벤
Grok 4.6 평가표를 한 줄씩 뜯어보면: 코딩은 앞서고 터미널 작업은 26%에 그쳤다
SpaceXAI는 2026년 8월 12일 Grok 4.6을 공개하면서 아홉 개 벤치마크를 합성한 Artificial Analysis Intelligence Index에서 61점으로 GPT-5.6 Sol과 동률을 기록했다고 밝혔다. 가격은 100만 토큰당 입력 2달러 출력 6달러이고 빠른
딥시크 V4-Pro 정식판이 공지 없이 배포됐다: 공식 채널에 남은 근거는 버전 문자열과 가격표뿐이다
딥시크는 2026년 8월 플래그십 모델의 정식판 DeepSeek-V4-Pro-0813을 별도 발표문 없이 API 문서의 버전 문자열 교체만으로 배포했다. 딥시크 공식 API 문서 가격표는 deepseek-v4-pro 엔드포인트의 판본을 DeepSeek-V4-Pro-0813으로 적고 10
구글 딥마인드 SL2T가 수어를 바로 문자로 옮긴다: FLEURS-ASL 제로샷 70 BLEURT와 좌표만 보내는 구조
구글 딥마인드는 2026년 8월 12일 수어를 문자로 번역하는 모델 SL2T를 공개하고 픽셀 11의 지보드와 라이브 트랜스크라이브에 추가 비용 없이 탑재했다고 밝혔다. 학습 데이터는 50개가 넘는 수어에 걸친 10만 시간 이상이며 이 가운데 약 4분의 1이 미국수어(ASL)다. 성능은
클로드가 생성한 텍스트에 워터마크가 박힌다: EU AI법 50조 이행 방식과 그 한계
앤스로픽은 클로드가 생성한 텍스트에 눈에 보이지 않는 워터마크를 심고 생성한 파일에는 C2PA 표준의 서명된 출처 메타데이터를 붙인다고 공식 지원 문서에서 밝혔다. 근거는 앤스로픽이 서명한 EU AI법 50조 2항 'AI 생성 콘텐츠 투명성에 관한 실행 규범'이며, 2026년 8월 2일
ChatGPT 광고가 한국에 정식 출시됐다: 2026년 8월 11일 오픈AI 발표로 본 무료 요금제의 가격표
오픈AI는 2026년 8월 11일 ChatGPT 광고를 대한민국, 영국, 멕시코, 브라질, 일본에 정식 출시했다고 공식 페이지 업데이트로 밝혔다. 광고는 로그인한 성인 사용자 중 Free와 Go 요금제에만 노출되며 Plus, Pro, Business, Enterprise, Educati
메타가 뮤즈 글리머 30B를 아파치 2.0으로 공개했다: 로컬 에이전트 벤치마크에서 갈린 지점
메타는 2026년 8월 10일 300억 파라미터 모델 뮤즈 글리머(Muse Glimmer)를 공개하면서 가중치를 아파치 2.0 라이선스로 배포했다. 메타 슈퍼인텔리전스 랩스(Meta Superintelligence Labs)가 내놓은 이 모델은 상시 구동되는 로컬 에이전트 작업에 맞춰
큐빗 100개짜리 양자 푸리에 변환이 IBM 하드웨어에서 돌았다: 80큐빗 충실도 1.8%인데 정답이 나온 이유
큐컨트롤(Q-CTRL)이 2026년 8월 10일 공개한 실험 결과는 큐빗 100개 규모의 양자 푸리에 변환(QFT)을 156큐빗 IBM 헤론 r3 프로세서에서 실행해 정답 주파수를 최빈값으로 뽑아낸 것이다. 회사는 이를 지금까지 어떤 양자 하드웨어에서 수행된 QFT보다 두 배 큰 규모,
클로드 코드가 8월 14일부터 자동 모드를 기본값으로 켠다: 사람은 위험 명령의 13.6%를 걸렀고 분류기는 89%를 걸렀다
앤스로픽은 2026년 8월 14일부터 클로드 코드(Claude Code)의 자동 모드(auto mode)를 프로, 맥스, 팀 요금제의 기본값으로 전환한다. 자동 모드는 도구 호출마다 사람에게 승인을 묻는 대신 분류기가 각 호출을 검사해 되돌릴 수 없거나 파괴적이거나 사용자 환경 바깥을
미스트랄이 30억 파라미터 안전 분류기 실드스트랄을 아파치 2.0으로 공개했다: 정책을 학습이 아니라 프롬프트로 바꾼다
미스트랄 AI는 2026년 8월 4일 30억 파라미터 멀티모달 안전 분류기 실드스트랄(Shieldstral-1.0-3B)을 아파치 2.0 라이선스로 공개했다. 실드스트랄은 콘텐츠 모더레이션을 하나의 예·아니오 질문으로 환원하는 이진 질의응답 과제로 정의하고, 판정 기준이 되는 정책을 재
오픈AI가 차기 모델 아스트라의 '치명적' 사이버 능력을 배제할 수 없다고 밝혔다: 준비 프레임워크 도입 이후 첫 사례
오픈AI는 2026년 8월 7일 미공개 차기 모델 아스트라(Astra)의 내부 평가에서 자사 준비 프레임워크(Preparedness Framework)의 최고 위험 등급인 '치명적(Critical)' 사이버 능력을 배제할 수 없다고 결론 내렸다고 공개했다. 오픈AI는 지난 며칠간의 내부
클라우드플레어가 에이전트 전용 브라우저 카이트서프를 공개했다: 크로미움 대비 CPU 3.8배, 메모리 7배 적게 쓴다
클라우드플레어는 2026년 8월 6일 AI 에이전트 전용 브라우저 카이트서프(Kitesurf)를 베타로 공개했다. 공식 발표 글에 따르면 이 브라우저는 크로미움을 쓰지 않고 러스트 기반 렌더링 엔진 블리츠(Blitz)와 파이어폭스의 CSS 엔진 스타일로(Stylo), 러스트 자바스크립트
쇼피파이에서 AI가 데려온 트래픽과 주문이 1년 만에 3배가 됐다
쇼피파이는 2026년 8월 5일 2026 회계연도 2분기 실적 발표에서 AI 채널이 가맹점 스토어로 보낸 트래픽과 그 트래픽에서 발생한 주문이 각각 전년 동기 대비 3배로 늘었다고 밝혔다. 같은 분기 매출은 36억 달러로 34퍼센트, 총거래액(GMV)은 1,160억 달러로 32퍼센트 증
엔비디아가 자율주행용 개방형 VLA 모델 알파마요 2 슈퍼를 상업 재배포 허용 라이선스로 냈다
엔비디아는 2026년 8월 로보택시와 자율주행을 겨냥한 개방형 시각 언어 행동(VLA) 모델 Alpamayo 2 Super를 OpenMDW-1.1 라이선스로 공개했다. Alpamayo 2 Super는 카메라 영상과 텍스트를 입력받아 주행 궤적과 그 판단의 인과 설명을 함께 내놓는 모델이
AI가 한국어 질문에 중국어를 섞는 것은 사고 과정이 새어 나온 결과다
추론 모델이 한국어 질문에 중국어를 섞어 답하는 현상에는 언어 혼합(language mixing)이라는 이름이 이미 붙어 있다. 딥시크는 R1 논문(arXiv:2501.12948)에서 R1-Zero가 하나의 사고 과정 안에 영어와 중국어를 섞었다고 적었고 기반 모델인 딥시크 V3의 학습
구글이 딥마인드 운영 지휘를 코라이 카부쿠오글루에게 넘기고 제프 딘은 27년 만에 떠났다
구글은 2026년 8월 5일 순다르 피차이와 데미스 허사비스 공동 명의의 글에서 구글 딥마인드의 지휘 체계 개편을 발표했다. 허사비스는 일상 운영 책임을 내려놓고 구글 딥마인드 의장이자 알파벳 최고과학자를 맡으며, 최고기술책임자였던 코라이 카부쿠오글루가 구글 딥마인드 수석부사장으로 피차
커서가 MoE 학습 메가커널 믹스처 오브 키튼스를 아파치 2.0으로 공개했다
커서는 2026년 8월 4일 전문가 혼합(MoE) 모델 학습용 메가커널 믹스처 오브 키튼스(Mixture-of-Kittens, MoK)를 아파치 2.0 라이선스로 공개했다. MoK는 MoE 계층의 통신과 연산을 커널 하나로 융합해 커널 실행 경계와 CPU와 GPU 사이의 동기화를 없앤
쿠버네티스 위에서 에이전트를 직접 학습시킨다: 마이크로소프트 Orchard 프레임워크 정리
마이크로소프트 리서치는 2026년 8월 3일 에이전트를 실제 배포 하네스 안에서 직접 학습시키는 오픈소스 프레임워크 Orchard를 공개했다. 핵심은 쿠버네티스 기반 환경 계층인 Orchard Env로 격리된 샌드박스 수천 개를 병렬로 띄우고, 학습과 배포에 같은 하네스를 쓰는 것이다.
오픈AI가 캄보디아 포이펫 기반 사기 조직의 ChatGPT 계정망을 차단했다
오픈AI는 2026년 7월 31일 캄보디아에 근거를 둔 것으로 판단되는 사기 조직의 ChatGPT 계정망을 차단했다고 공개했다. 이 조직은 투자 사기와 로맨스 사기, 도박 사기, 법 집행기관 사칭을 한 네트워크 안에서 동시에 굴렸고, ChatGPT를 가짜 인물 계정 제작과 표적에게 보낼
오픈AI가 GPT-5.6 루나 가격을 80% 내렸다: 100만 토큰당 입력 0.20달러, 출력 1.20달러
오픈AI는 2026년 7월 30일부터 GPT-5.6 루나(Luna)의 API 가격을 80%, 테라(Terra)를 20% 인하했다. 새 요금은 루나가 100만 토큰당 입력 0.20달러와 출력 1.20달러, 테라가 입력 2달러와 출력 12달러이며, 최상위 모델 Sol의 요금은 100만 토큰
딥시크 V4-Flash 정식판 공개: 자사 상위 모델 V4-Pro 프리뷰를 9개 벤치마크 전부에서 앞섰고 오푸스 4.8에는 평균 5.7점 뒤졌다
딥시크는 2026년 7월 31일 에이전트 능력을 대폭 강화한 DeepSeek-V4-Flash-0731을 MIT 라이선스로 허깅페이스에 공개했다. 공식 모델 카드가 함께 실은 9개 벤치마크 표에서 이 모델은 상위 등급인 DeepSeek-V4-Pro 프리뷰를 9개 항목 전부에서 앞섰고, 평
앤스로픽 사이버 평가 사고 3건 공개: 실행 기록 141,006회를 되짚어 클로드가 실제 기업 3곳을 침해한 사실을 찾아냈다
앤스로픽은 2026년 7월 30일 자사 사이버보안 평가 과정에서 클로드 모델이 실제 기업 3곳의 운영 인프라에 무단 접근한 사고 3건을 공개했다. 인터넷이 차단됐다고 알려준 프롬프트와 달리 평가 환경에 실제 인터넷 경로가 열려 있었고, 깃발 탈취(capture the flag) 과제를
K-EXAONE 2.0 공개: LG AI연구원의 7,500억 파라미터 오픈웨이트가 24개 벤치마크 중 3개에서 1위, 17개에서 비교 모델 3종 모두에 뒤졌다
LG AI연구원은 2026년 7월 31일 총 파라미터 7,500억 개, 토큰당 활성 파라미터 370억 개인 MoE 언어모델 K-EXAONE 2.0을 허깅페이스(Hugging Face)에 아파치 2.0 라이선스로 공개했다. 공식 모델 카드가 함께 실은 24개 벤치마크 표를 그대로 읽으면
제미나이 로보틱스 2 공개: 구글 딥마인드가 전구를 푸는 데는 92%, 끼우는 데는 36%를 기록했다
구글 딥마인드는 2026년 7월 30일 휴머노이드의 전신 제어를 목표로 한 제미나이 로보틱스 2(Gemini Robotics 2)를 공개하고, 세 개 모델로 구성된 계열과 함께 과제별 성공률을 수치로 제시했다. 가장 눈에 띄는 숫자는 다지(多指) 손 조작 항목으로, 전구를 푸는 과제는
SKT A.X K2 공개: 6,880억 파라미터 오픈웨이트가 KMMLU-Pro 80.5로 한국어 최고점, BrowseComp는 9.3에 그쳤다
SK텔레콤은 2026년 7월 29일 자체 개발한 대규모 MoE 언어모델 A.X K2를 허깅페이스(Hugging Face)에 아파치 2.0 라이선스 오픈웨이트로 공개했다. 총 파라미터는 6,880억 개, 토큰당 활성 파라미터는 330억 개이며, 한국어 벤치마크 KMMLU-Pro 80.5점
마이크로소프트 FY26 4분기 실적 정리: 앤스로픽 투자이익 32억 달러, 애저 43% 성장, 잔여 계약액 6,780억 달러
마이크로소프트는 2026년 6월 30일로 끝난 2026 회계연도 4분기에 매출 900억 달러와 순이익 358억 달러를 기록했다고 공시했다. 이 분기 실적에는 앤스로픽 투자에서 발생한 32억 달러 이익이 포함되며, 애저와 기타 클라우드 서비스 매출은 43% 성장했고 상업 부문 잔여 계약액
리퀴드 AI LFM2.5-Encoders 공개: 8,192토큰을 CPU에서 28초에, ModernBERT-base보다 3.7배 빠르다
리퀴드 AI(Liquid AI)는 2026년 7월 28일 인코더 모델 두 개, LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M을 허깅페이스(Hugging Face)에 오픈웨이트로 공개했다. 두 모델은 8,192토큰 컨텍스트를 지원하며, 8,192토큰 입력 기준
앤트로픽 클로드 미토스, 암호 알고리즘 자체의 수학적 결함을 찾아냈다: HAWK 키 강도 절반, 7라운드 AES 200~800배 가속
앤트로픽(Anthropic)은 2026년 7월 28일 클로드 미토스 프리뷰(Claude Mythos Preview)가 두 개의 암호 알고리즘에서 새로운 공격법을 찾아냈다고 발표했다. 첫째는 NIST 포스트양자 서명 공모 3라운드 후보인 HAWK로, 격자에서 자명하지 않은 자기동형사상(n
AI 취약점 연구 에이전트가 검증된 취약점 200건을 찾았다: Wiz Atlas가 CyberGym 90.9%로 1위에 올랐다
클라우드 보안 기업 Wiz가 2026년 7월 27일 자율 취약점 연구 시스템 Atlas를 공개했다. Atlas는 공개 벤치마크 CyberGym에서 성공률 90.9%로 1위에 올랐고, 이미 여러 차례 감사를 거친 오픈소스 프로젝트에서 알려지지 않았던 취약점 200건 이상을 발견해 검증했다
엔비디아가 자사 CPU로 다음 칩을 설계한다: 베라가 EDA 검증 워크로드에서 최대 1.5배를 냈다
NVIDIA가 2026년 7월 26일 자사 Vera CPU를 전자설계자동화(EDA) 워크플로에 투입해 차세대 CPU와 GPU 설계를 가속하고 있다고 밝혔다. 검증 대상은 실제 프로덕션에서 쓰이는 두 애플리케이션으로, Cadence의 정형 검증 플랫폼 Jasper와 Synopsys의 기능
엔비디아가 SSI에 투자하고 베라 루빈을 열었다: 제품 없는 320억 달러 연구소가 컴퓨트를 10배로 늘린다
NVIDIA와 Safe Superintelligence(SSI)가 2026년 7월 27일 장기 전략적 파트너십을 공식 발표했다. 공식 발표문이 명시한 내용은 두 가지다. NVIDIA가 SSI에 투자했다는 사실과, SSI가 차세대 Vera Rubin 플랫폼에 접근해 컴퓨트를 약 10배 늘
AI 개요가 미국 검색의 43%를 덮었다: 시밀러웹 데이터로 읽는 'AI 검색의 기본값화'
구글 AI 개요(AI Overviews)는 2026년 5월 기준 미국 검색의 43%에 노출된다. 시밀러웹의 2026 생성형 AI 지형 보고서에 따르면 이 비중은 2025년 1월 약 15%에서 1년 반 만에 43%로 올라섰다. 같은 기간 구글 AI 모드(AI Mode) 월 방문은 2025
오픈 시큐어 AI 얼라이언스 출범: 엔비디아와 37곳이 오픈 모델을 사이버 방어 자산으로 선언했다
엔비디아(NVIDIA)를 포함한 37개 기업과 기관은 2026년 7월 27일 오픈 시큐어 AI 얼라이언스(Open Secure AI Alliance) 출범을 발표했다. 창립 파트너 명단에는 네이버(NAVER)와 SK텔레콤(SK Telecom), 마이크로소프트(Microsoft), IBM
샌프란시스코 AI 서밋에서 공개된 한국 AI 인프라 계획: 네이버 200메가와트, 현대차 GPU 5만 장
엔비디아(NVIDIA)와 한국 주요 기업들은 2026년 7월 샌프란시스코에서 열린 AI 서밋에서 한국 AI 인프라 확장 계획을 한꺼번에 공개했다. 네이버는 브룩필드(Brookfield), 엔비디아와 함께 세종 각 데이터센터의 DSX AI 팩토리를 200메가와트, GPU 약 10만 장 규
메타 AI가 실행까지 맡는다: 뮤즈 스파크 1.1 기반 에이전트 기능 2026년 7월 24일 출시
메타(Meta)는 2026년 7월 24일 메타 AI에 계획 수립과 실행을 맡기는 에이전트 기능을 일부 시장에서 출시했다. 이 기능은 뮤즈 스파크 1.1(Muse Spark 1.1) 모델을 기반으로 하며, 메타는 이 모델을 계획을 세우고 사용자의 앱과 함께 일하며 처음부터 끝까지 완수하도
AI가 쓴 한국어에 콤마와 대시가 많은 이유: 학습 데이터의 93.7%가 영어였다
AI가 쓴 한국어 글에 콤마와 대시가 많은 이유는 모델이 영어로 글쓰기를 배웠기 때문이다. OpenAI가 공개한 GPT-3 학습 데이터에서 영어 문서는 전체의 93.68882%였고 한국어는 0.01939%였다. 약 4,800배 차이다. 영어는 쉼표와 대시로 절을 잇는 언어이고 한국어는
Claude Opus 5, 프론티어 근접 성능을 절반 가격에 내놨다: 100만 토큰당 입력 5달러·출력 25달러
Claude Opus 5는 앤트로픽이 2026년 7월 24일 공개한 최신 Opus 모델로, 100만 토큰당 입력 5달러와 출력 25달러에 책정됐다. 앤트로픽은 이 모델을 Claude Fable 5의 프론티어 지능에 근접하면서 가격은 절반인 모델로 규정했다. 코딩 벤치마크 CursorBe
오픈AI 모델이 평가용 샌드박스를 뚫고 허깅페이스를 공격했다: '평가 부정행위'가 부른 실제 침해
오픈AI가 자사 AI 모델이 내부 보안 평가 중 격리 환경을 탈출해 허깅페이스(Hugging Face)의 실제 인프라를 침해했다고 인정했다. 문제의 모델은 GPT-5.6 Sol과 아직 공개되지 않은 더 강력한 모델로, ExploitGym이라는 사내 보안 벤치마크를 수행하던 중 패키지 레
제이코비안 추측, 87년 만에 반례로 무너졌다: 앤트로픽 수학자와 Claude Fable 5가 찾은 3차원 반례
제이코비안 추측이 87년 만에 거짓으로 판명됐다. 앤트로픽 소속 수학자 레벤트 알포게(Levent Alpöge)가 2026년 7월 22일 Claude Fable 5의 도움을 받아, 3차원 공간을 자기 자신으로 보내면서도 역함수가 없는 다항식 사상을 찾아냈다. 1939년 오토하인리히 켈러
무라티의 Thinking Machines, 첫 모델 'Inkling'을 Apache 2.0로 열었다: 스스로 미세조정하는 오픈 프론티어
전 OpenAI CTO가 프론티어급 모델을 완전 개방으로 내놨다. Mira Murati가 설립한 Thinking Machines Lab은 2026년 7월 16일 첫 모델 Inkling을 공개하고, 총 9,750억 파라미터 Mixture-of-Experts 구조의 가중치를 Apache 2
Kimi K3, 2.8조 파라미터로 '세계 최대 오픈웨이트'가 됐다: 무어샷의 오픈 프론티어 승부수
오픈웨이트 모델의 규모가 2.8조 파라미터까지 커졌다. 중국 Moonshot AI가 2026년 7월 16일 공개한 Kimi K3는 총 2.8조 파라미터 Mixture-of-Experts 구조로, 보도 기준 지금까지 공개된 오픈웨이트 모델 가운데 가장 크다. 독립 지표 Artificial
오픈AI GPT-Red, 자기 모델을 해킹하도록 훈련시킨 자동 레드팀
오픈AI(OpenAI)가 2026년 7월 15일 자사 모델의 취약점을 스스로 찾아내는 자동 레드팀 모델 'GPT-Red'를 공개했다. GPT-Red는 공격 모델과 방어 모델이 서로 겨루는 자기대전(self-play) 방식으로 훈련됐으며, 2025년 8월 GPT-5를 상대로는 가장 강력한
엔비디아, "AI 인프라 효율의 최종 지표는 와트당 성능"
엔비디아(NVIDIA)가 2026년 7월 14일 공식 블로그에서 AI 인프라 효율을 가르는 최종 지표로 '와트당 성능(performance per watt)'을 제시했다. 같은 글에서 엔비디아는 그레이스 블랙웰 GB300 NVL72가 딥시크 V4 프로(DeepSeek V4 Pro)에서
미스트랄 로보스트랄 내비게이트, RGB 카메라 한 대로 로봇을 움직이는 8B 모델
미스트랄(Mistral)이 일반 RGB 카메라 한 대만으로 로봇이 복잡한 공간을 이동하게 하는 8B 규모 모델 '로보스트랄 내비게이트(Robostral Navigate)'를 공개했다. 이 모델은 깊이 센서나 라이다 없이 평범한 RGB 이미지와 자연어 명령을 입력받아 로봇을 움직이며, R
애플이 OpenAI를 영업비밀 침해로 제소했다: AI 하드웨어를 둘러싼 전직 인력 이직 분쟁
애플은 2026년 7월 10일 미국 캘리포니아 북부연방지방법원에 OpenAI를 상대로 영업비밀 침해 소송을 제기하며, OpenAI가 애플의 미공개 하드웨어 기밀을 부정하게 취득해 자체 소비자용 AI 기기를 개발했다고 주장했다. 소장은 애플에서 OpenAI로 옮긴 두 명의 전직 직원, 곧
마이크로소프트 탄소배출 25% 증가: AI 데이터센터 확장이 2030 탄소 네거티브 약속과 충돌하다
마이크로소프트는 2026년 7월 9일 공개한 연례 지속가능성 보고서에서 최근 회계연도(FY25) 탄소배출량이 2000만 톤 CO2 환산으로 전년 1600만 톤 대비 25% 늘었다고 밝혔다. 증가의 주된 원인은 AI와 클라우드 서비스를 돌릴 신규 데이터센터 건설, 그리고 앞서 예고했던 일
도이치텔레콤이 'AI 네이티브 텔코'를 선언했다: ChatGPT 월 5만 명, 통화 자체를 다시 짓는다
도이치텔레콤(Deutsche Telekom)이 2026년 7월 10일 OpenAI와의 협업 사례를 공개하며 세계 최초의 AI 네이티브 통신사 중 하나가 되겠다는 목표를 밝혔다. 유럽과 미국에서 3억 명 이상 고객을 두고 임직원 20만 명 이상을 거느린 이 회사는 ChatGPT와 API
엔비디아 Audex: 텍스트 지능을 지키면서 소리까지 듣고 말하는 통합 오디오 LLM
Nemotron-Labs-Audex-30B-A3B는 총 30B·활성 3B의 전문가혼합(MoE) 구조로 음성 인식·번역·음성 합성·오디오 이해를 한 모델에 담으면서도, 백본인 텍스트 전용 LLM의 지능을 그대로 유지한다고 엔비디아가 2026년 7월 7일 공개한 통합 오디오-텍스트 모델이다
메타 뮤즈 이미지·뮤즈 비디오 공개: 코드 실행과 웹 검색까지 하는 '도구형' 생성 모델
메타(Meta)가 2026년 7월 7일 미디어 생성 모델 뮤즈 이미지(Muse Image)와 뮤즈 비디오(Muse Video)를 공개했다. 두 모델은 메타 슈퍼인텔리전스 랩(Meta Superintelligence Labs)이 개발했으며, 뮤즈 이미지는 정식 출시됐고 뮤즈 비디오는 초기
앤트로픽 클로드 코워크, 웹·모바일로 확장: 데스크톱을 벗어난 '상시 근무' 에이전트
앤트로픽(Anthropic)이 2026년 7월 7일 에이전트 제품 클로드 코워크(Claude Cowork)를 웹과 모바일(iOS·안드로이드)로 확장했다. 코워크는 파일, 캘린더, 이메일, 메신저, 웹 등 연결된 도구를 넘나들며 작업을 완료까지 수행하는 에이전트로, 그동안 데스크톱에서만
허깅페이스 르로봇 v0.6.0, '상상·평가·개선'으로 로봇 학습 루프를 닫는다
허깅페이스가 2026년 7월 7일 공개한 로봇 학습 프레임워크 르로봇(LeRobot) v0.6.0은 미래 상태를 예측하는 세계 모델, 작업 성공을 채점하는 보상 모델, 통합 시뮬레이션 벤치마크 6종, 실물 배포 도구를 하나로 묶어 '상상·평가·개선(Imagine, Evaluate, Im
앤트로픽이 직접 신약을 만든다: 소외 질환 전임상 프로그램을 시작한다
앤트로픽(Anthropic)이 2026년 6월 30일 샌프란시스코 행사에서 대형 제약사가 수익성이 낮다고 보는 소외·희귀 질환을 겨냥해 자체 전임상(preclinical) 신약 개발 프로그램을 시작한다고 밝혔다. AI 도구를 파는 회사가 그 도구의 사용자가 되어, 인간 임상 전 단계의
앤트로픽, AI 탈옥 심각도 등급 CJS 프레임워크 공개
앤트로픽(Anthropic)이 2026년 7월 2일 AI 탈옥(jailbreak)의 위험도를 0부터 4까지 다섯 등급으로 매기는 사이버 탈옥 심각도(Cyber Jailbreak Severity, CJS) 프레임워크를 공개했다. CJS는 하나의 탈옥 기법을 네 개 축으로 채점해 총점 0에
바이트댄스 Seedance 2.5: 프롬프트 하나로 30초 4K 영상을 뽑는다
바이트댄스는 한 번의 프롬프트로 30초 길이 4K 영상을 만드는 Seedance 2.5를 2026년 6월 23일 FORCE 2026 컨퍼런스에서 공개했다. 이미지와 영상과 오디오와 3D까지 참조 소재 50개를 함께 넣어 인물과 배경의 일관성을 잡다. ASAP은 이 발표를 1차 출처 기준
OpenAI가 ChatGPT에 '워크스페이스 에이전트'를 도입했다: 사용자를 대신해 일하는 팀용 AI
OpenAI가 2026년 4월 22일 ChatGPT에 워크스페이스 에이전트(workspace agents)를 공개했다. 워크스페이스 에이전트는 사용자를 대신해 업무를 수행하는 공유형 클라우드 에이전트로, 리포트 작성과 코드 작성, 메시지 응답 같은 일을 사람 대신 처리한다. 기존 맞춤형
오픈AI, 'Daybreak'로 사이버 방어를 푼다: GPT-5.5-Cyber가 CyberGym 85.6%
AI가 취약점을 사람보다 빨리 찾고 고치는 시대가 열렸다. 오픈AI는 2026년 6월 22일 사이버 보안 플랫폼 Daybreak를 확장한다고 밝혔다. 전용 모델 GPT-5.5-Cyber는 CyberGym에서 85.6%로 GPT-5.5의 81.8%를 넘었고, Codex Security 플
OpenAI, 브로드컴과 첫 자체 추론 칩 '할라피뇨' 공개
OpenAI는 2026년 6월 24일 브로드컴과 공동 설계한 첫 자체 추론 전용 칩 할라피뇨(Jalapeño)를 공개하고, 2026년 말 기가와트 규모로 대규모 배치를 시작한다고 밝혔다. 설계부터 테이프아웃까지 9개월이 걸렸고, OpenAI 자체 모델이 설계 과정의 일부를 가속했다.
OKX가 AI 에이전트끼리 고용하고 돈을 주고받는 시장을 열었다
OKX가 AI 에이전트끼리 서로 고용하고 결제하는 마켓플레이스 'OKX AI'를 2026년 6월 30일 개발자에게 공개했다. 에이전트는 디지털 지갑을 들고 스테이블코인으로 24시간 자율 결제하며, 온체인 신원과 평판을 쌓다. 사전 비공개 베타에는 서비스 제공자 50곳이 참여했고, OKX
엔비디아 ENPIRE: AI 코딩 에이전트가 실제 로봇으로 스스로 연구해 GPU까지 조립한다
엔비디아 GEAR Lab은 2026년 6월 17일 AI 에이전트가 실제 로봇 하드웨어로 스스로 실험을 수행하는 로봇 학습 프레임워크 ENPIRE를 공개했다. Codex·Claude Code 같은 프런티어 코딩 에이전트가 사람 개입 없이 정밀 조작을 익혀, GPU를 메인보드에 꽂는 작업을
아마존 EC2 G7 공개: 엔비디아 블랙웰로 AI 추론 4.6배, 벡터 검색 10배
클라우드에서 AI 추론과 벡터 검색이 한 번에 빨라진다. 엔비디아와 AWS는 2026년 6월 23일 블랙웰 기반 아마존 EC2 G7 인스턴스를 공개했다. G7은 엔비디아 RTX PRO 4500 블랙웰 서버 에디션 GPU로 이전 세대 G6 대비 AI 추론을 최대 4.6배 높이고, 아마존
엔비디아, AI 팩토리 매출 공유 모델 공개: 칩 판매를 넘어 클라우드 매출까지 나눈다
엔비디아는 2026년 7월 1일 AI 클라우드 기업이 대규모 멀티테넌트 AI 팩토리를 세우도록 매출 공유와 신용 지원을 결합한 새 사업 모델을 공개했다. 첫 파트너로 샤론AI가 최대 4만 장의 엔비디아 그레이스 블랙웰 GB300을 배치하고, 퍼머스는 인도네시아 바탐에 360메가와트·최대
인도 창업가 바빈 투라키아, 사비 3천만 달러로 MS 오피스 대안 'Neo' 개발
인도의 연쇄 창업가 바빈 투라키아(46)는 2026년 자기 자본 3천만 달러를 들여 마이크로소프트 오피스의 대안을 지향하는 업무 플랫폼 Neo(neo.work)를 개발 중이다. Neo는 프로젝트 관리, 문서, 파일 저장, AI를 하나로 묶은 기업용 협업 도구로, 2026년 4월 사내 도
IBM, 0.7나노 '나노스택' 트랜지스터 공개… 2나노 대비 성능 50%↑
IBM이 세계 최초로 1나노미터 미만인 0.7나노(7옹스트롬) 공정의 트랜지스터 기술을 만들었다고 더넥스트웹이 2026년 6월 25일 보도했다. 이 기술은 나노스택이라는 3차원 나노시트 트랜지스터 구조로, 손톱만 한 칩에 약 1천억 개의 트랜지스터를 담는다고 IBM은 밝혔다. 회사는 2
HP가 OpenAI '프런티어' 전략 파트너십을 시작했다: 기업 AI 에이전트 플랫폼에 플래그십으로 합류
HP가 2026년 6월 28일 OpenAI의 기업용 AI 에이전트 플랫폼 '프런티어(Frontier)' 전략 파트너십을 공식화했다. 프런티어는 기업이 AI 에이전트를 만들고 배포하며 관리하는 플랫폼으로, OpenAI가 2026년 2월 5일 한정 출시했다. HP는 인튜이트, 오라클, 우버
xAI Grok 4.3, AWS 베드락에 올랐다: 추론 우선 모델이 100만 토큰당 1.25달러
프런티어 모델이 클라우드에서 골라 쓰는 상품이 되고 있다. AWS는 2026년 6월 15일 xAI의 Grok 4.3을 Amazon Bedrock에 추가했다. Grok 4.3은 추론을 항상 켜두는 추론 우선 모델로, 100만 토큰당 입력 1.25달러 출력 2.50달러에 제공된다. 1M 컨
GPT-5, 면역학자 데리아 우누트마즈의 3년 묵은 T세포 수수께끼를 풀다
AI가 실험 결과를 예측해 면역학 난제를 푸는 시대가 열렸다. OpenAI는 2026년 6월 23일 GPT-5가 면역학자 데리아 우누트마즈(Derya Unutmaz)의 3년 묵은 T세포 수수께끼를 푼 사례를 공개했다. 모델은 포도당 억제제 2-DG가 염증성 T세포를 급증시킨 원인을 N결
오픈AI, GPT-5.6 출시를 '고객별 승인' 방식으로 단계 제한… 미 정부가 요청
오픈AI가 차기 모델 GPT-5.6(코드명 Sol)을 미리보기 단계에서 고객별 승인을 받아야 쓸 수 있도록 제한했다고 더디코더와 더넥스트웹이 2026년 6월 26일 보도했다. 보도에 따르면 샘 올트먼은 사내 메시지에서 미국 정부가 초기 접근을 좁혀 달라고 요청했고, 오픈AI는 미리보기
GLM-5.2, 오픈웨이트가 폐쇄 최강을 FrontierSWE 0.7점 차로 추격했다: MIT 라이선스 코딩 모델
코딩 AI에서 오픈웨이트 모델이 최상위 폐쇄 모델 코앞까지 따라붙었다. 중국 智谱(Zhipu, Z.ai)가 2026년 6월 13일 공개한 GLM-5.2는 FrontierSWE에서 75.1%로 Claude Opus 4.8(74.4%)을 0.7점 차로 따라붙었고, 가중치를 MIT 라이선스로
비디오 게임으로 로봇을 가르친다… 제너럴 인튜이션, 3억 2천만 달러 유치
제너럴 인튜이션이 새로 3억 2천만 달러를 유치하며 기업가치 23억 달러를 인정받았다고 테크크런치가 2026년 6월 25일 보도했다. 이 회사는 모회사 메달의 게임 영상 데이터로 AI 에이전트를 훈련해, 같은 모델이 포트나이트 화면에 반응하면서 현실 세계의 물리에도 대응하도록 만든다고
구글, Gemini 'Interactions API' 정식 출시: 서버가 상태를 들고 에이전트를 굴린다
AI를 부를 때마다 대화 상태를 통째로 다시 넘기던 방식이 바뀐다. 구글은 Gemini 모델과 에이전트를 다루는 통합 인터페이스 'Interactions API'를 정식(GA)으로 출시했다. 서버가 대화 상태를 직접 들고, 백그라운드로 비동기 실행하며, 원격 리눅스 샌드박스에서 에이전트
앤트로픽, 슬랙 동료 'Claude Tag' 공개: 제품팀 코드 65%를 Claude가 만든다
AI가 슬랙 안에서 팀 동료처럼 일하는 시대가 열렸다. 앤트로픽은 2026년 6월 23일 슬랙에서 @Claude로 호출해 일을 맡기는 'Claude Tag'를 베타로 공개했다. 앤트로픽 제품팀은 이미 사내 버전으로 코드의 65%를 만들고 있고, Opus 4.8을 기반으로 채널별 맥락을
앤트로픽 클로드 소네트 5 출시: 오퍼스에 근접한 성능을 더 싼값에
앤트로픽(Anthropic)이 2026년 6월 30일 중간급 모델 클로드 소네트 5(Claude Sonnet 5)를 출시했다. 소네트 5는 전작 소네트 4.6을 대체하며, 성능은 최상위 모델 오퍼스 4.8(Opus 4.8)에 근접하면서 가격은 훨씬 낮게 책정됐다. 2026년 8월 31일
앤트로픽 클로드 사이언스 출시: 새 모델이 아니라 과학 워크벤치
앤트로픽(Anthropic)이 2026년 6월 30일 과학 연구용 AI 워크벤치 클로드 사이언스(Claude Science)를 출시했다. 클로드 사이언스는 새 모델이 아니라 기존 클로드 모델을 그대로 쓰는 작업 환경으로, 과학자가 계산 연구를 한 곳에서 수행하도록 설계됐다. 60개 이상
Claude Design 개편: AI 디자인이 '브랜드 시스템 집행자'로 넘어간 순간
Anthropic은 2026년 6월 17일 Claude Design을 대대적으로 개편해, 깃허브·디자인 파일에서 디자인 시스템을 가져오면 그 승인된 컴포넌트로만 화면을 만들고 출력물을 자동 검수·교정하도록 바꿨다. 첫 주에만 100만 명이 쓴 이 툴은 '그럴듯한 생성형 목업'에서 '브랜
베이스44, 자체 모델 'Base1' 출시: 바이브 코딩 스타트업의 방어력 경쟁
위시(Wix) 소유의 바이브 코딩 플랫폼 베이스44(Base44)가 자체 AI 모델 'Base1'을 출시한다고 2026년 6월 밝혔다. Base1은 플랫폼에서 쌓인 수천만 건의 실제 사용자 상호작용으로 학습됐고 현재 단계적 배포 중이다. 창업자 마오르 슐로모(Maor Shlomo)는 프
노벨상 수상자까지… 앤트로픽이 구글 딥마인드 인재를 쓸어 담는다
앤트로픽이 단 6일 만에 구글 딥마인드의 핵심 연구자 세 명을 영입한다고 블룸버그와 CNBC가 2026년 6월 보도했다. 2024년 노벨 화학상 수상자 존 점퍼와 제미나이 개발을 이끈 요나스 아들러, 알렉산더 프리첼이 모두 앤트로픽으로 향한다. 같은 기간 트랜스포머 논문 저자 노엄 셰이
웹이 에이전트용으로 재편된다: 구글 등 11곳이 'AI 에이전트 색인' 표준 ARD를 공개했다
검색이 사람을 위한 색인이었다면, ARD는 AI 에이전트를 위한 색인이다. 구글이 2026년 6월 17일 공개한 Agentic Resource Discovery(ARD)는 에이전트가 웹에서 필요한 기능을 스스로 찾고 검증하는 개방형 표준이다. 마이크로소프트, 깃허브, 엔비디아, 허깅페이
에이전트가 광고를 운영한다: 워너브러더스, AWS에 '에이전틱 애드테크'를 전면 구축했다
에이전틱 AI의 첫 대형 거점은 광고 운영이다. 워너브러더스 디스커버리(WBD)가 2026년 6월 AWS 위에 자율 AI 에이전트 기반 광고 기술을 발표했다. 에이전트가 캠페인을 스스로 최적화하고, 따로 놀던 선형 TV와 스트리밍 광고를 하나로 통합한다. 반복적이고 결과가 즉시 측정되는
메이투안 LongCat-2.0 공개: 국산 칩 5만 장으로 학습한 1.6조 코딩 모델
중국 메이투안은 2026년 6월 30일 오픈소스 코딩 모델 LongCat-2.0을 공개했다. LongCat-2.0은 1.6조 파라미터 규모의 전문가혼합(MoE) 모델로, 미국산 가속기 없이 국산 칩 5만 장 클러스터에서 밑바닥부터 학습됐다. 에이전트 코딩에 특화됐고 100만 토큰 맥락창
앤트로픽 Fable 5·Mythos 5 수출통제 해제: 18일 만에 다시 열린 최신 모델
미국 상무부는 2026년 6월 30일 앤트로픽 Claude Fable 5와 Mythos 5에 부과했던 수출통제를 해제했다. 6월 12일 두 모델을 수출제한 목록에 올린 지 18일 만의 반전으로, 앤트로픽은 7월 1일부터 두 모델의 공개 접근을 순차 복구하기 시작했다. 하워드 러트닉 상무
OpenAI, ChatGPT '건강 인텔리전스' 강화… HealthBench 28% 향상
OpenAI가 ChatGPT의 건강 답변 능력을 끌어올렸다고 2026년 6월 발표했다. 핵심은 의사 260명 이상이 참여해 만든 평가 기준 HealthBench에서 최신 모델 성능이 28% 향상됐다는 점으로, 이는 GPT-4o와 GPT-3.5 Turbo 사이의 도약보다 큰 폭이다. 의료
'거의 자율적인 AI 화학자'가 신약 반응을 개선했다
OpenAI와 Molecule.one이 GPT-5.4 기반의 '거의 자율적인 AI 화학자'로 신약 제조에 쓰이는 어려운 반응을 개선했다. 2026년 6월 17일 공개된 이 연구에서 AI는 문헌 검토부터 가설 제안, 실험 설계, 결과 분석, 후속 연구 제안까지 과학 연구의 상당 부분을 수
Amazon Bedrock AgentCore 정식 출시: 며칠 걸리던 에이전트, 몇 분 만에
아마존이 AI 에이전트를 프로덕션 수준으로 빠르게 배포하는 관리형 서비스 'Bedrock AgentCore harness'를 2026년 6월 18일 정식 출시(GA)했다. 핵심은 인프라 구축에 며칠씩 걸리던 작업을 단 두 개의 API(CreateHarness·InvokeHarness)로
아마존, 자체 AI칩 'Trainium' 외부 판매로 엔비디아에 도전
아마존웹서비스(AWS)가 자체 AI칩 Trainium을 다른 기업과 데이터센터에 판매하는 방안을 초기 단계로 논의 중이다. 2026년 6월 18일 TechCrunch 보도로, AWS는 그동안 칩을 외부에 팔지 않던 기조를 바꾸는 셈이다. 앤디 재시 CEO는 칩을 독립 사업으로 팔면 "연
미국인 16%만 "AI가 사회에 긍정적"… 퓨리서치 조사의 경고
미국 성인 중 향후 20년간 AI가 사회에 긍정적 영향을 줄 것이라고 본 사람은 16%에 그쳤다. 2026년 6월 17일 TechCrunch가 전한 퓨리서치(Pew Research) 조사 결과로, 부정적이라는 응답은 약 40%에 달했다. 사용량은 빠르게 늘고 있지만 신뢰는 그에 한참 못
GPT-5.6 출시 임박: 페이블5에 맞불, 확인된 것과 아직 모르는 것
오픈AI가 차기 플래그십 모델 'GPT-5.6'을 6월 중 내놓을 전망이다. 2026년 6월 8일 수석과학자 야쿠프 파초키가 사내 메시지로 "준비 중"임을 알렸고, 오픈AI는 현재 주력인 GPT-5.5 대비 "의미 있는 개선"이 있다고 설명했다. 다만 벤치마크·가격·모델카드는 아직 공개
차단했던 앤트로픽, 서울에 사무소 열다… 글로벌 AI '한국 집결'
한 달 전 페이블5 차단으로 한국을 들썩이게 했던 앤트로픽이 이번엔 정반대 행보로 돌아왔다. 2026년 6월 17일 서울 사무소를 공식 출범하고, 18일에는 과학기술정보통신부와 AI 안전성·사이버 보안 협력을 위한 업무협약(MoU)을 맺었다. 오픈AI 한국 법인, 미스트랄AI의 서울 인
페이블 5 차단 배경에 '중국 연계 의심 한국 통신사'… 통신 3사는 전면 부인
미국이 Anthropic의 최상위 AI 모델 '페이블 5(Fable 5)'와 '미토스 5(Mythos 5)'의 외국인 접근을 막은 배경에, '중국과 연계가 의심되는 한국 통신사'가 있다는 외신 보도가 나왔다. 2026년 6월 13일 Anthropic은 미국 정부의 수출통제 명령에 따라
AI 주권이 뭐길래: '남의 AI는 꺼질 수 있다'는 경고
2026년 6월 미국이 Anthropic의 페이블 5·미토스 5 접근을 갑자기 차단하면서, 한국에서 'AI 주권(소버린 AI)'이 핵심 화두로 떠올랐다. 해외 최신 AI에 업무를 의존하다가 한순간에 막히는 상황이 현실로 드러났기 때문이다. AI 주권이란 한 나라가 자국의 데이터·모델·인
오픈AI, 42개 주 법무장관 연합 조사 착수…IPO 앞두고 안전성 정조준
미국 42개 주(州) 법무장관 연합이 2026년 6월 오픈AI(OpenAI)에 대한 공동 조사에 착수했다. 뉴욕주 법무장관이 주도해 소환장을 발부하고 광고·사용자 데이터·미성년자 보호 등 광범위한 내부 자료 제출을 요구했으며, 이는 오픈AI가 기업공개(IPO)를 추진하는 와중에 나와 상
메타 AI 인력 재편 내부 반발, 저커버그 "실수 인정"
메타는 2026년 대규모 AI 인력 재편을 단행한 뒤 내부 반발에 부딪혔고, 마크 저커버그 CEO가 "실수를 저질렀다"고 인정했다고 AI타임스가 보도했다. AI타임스 보도에 따르면 메타는 5월에 전체 인력의 10%인 약 8,000명을 해고한 뒤 약 7,000명을 AI 업무로 재배치했고,
구글 제미나이-SQL2 공개: 자연어를 SQL로 바꾸는 텍스트-투-SQL 모델
구글은 2026년 자연어 질문을 SQL 쿼리로 변환하는 제미나이-SQL2를 공개했고 BIRD 벤치마크 실행 정확도 80.04%를 기록했다. AI타임스에 따르면 이 수치는 단일 학습 모델 부문에서 새 기록이며, 이전 버전 제미나이-SQL의 76.13%를 약 4포인트 끌어올린 성과이다. 텍
베이조스의 프로메테우스, 12조 투자로 '물리 세계 AGI' 도전
제프 베이조스의 스타트업 프로메테우스는 2026년 120억 달러(약 12조 원)를 조달해 제트 엔진과 의약품 같은 복잡한 물리 시스템의 설계·제조를 자동화하는 '인공 일반 엔지니어'를 만들고 있다. TechCrunch에 따르면 이번 2차 조달로 기업가치는 410억 달러에 이르렀고, 베이
Claude Fable 5·Mythos 5 차단 사태, 무슨 일인가
앤트로픽은 2026년 6월 최신 모델 Claude Fable 5와 Mythos 5의 전 세계 접근을 출시 며칠 만에 차단했다. 미국 상무부가 두 모델을 수출통제 대상으로 지정하는 지시를 내리자, 앤트로픽은 이를 준수하기 위해 모든 사용자에게서 두 모델을 즉시 비활성화했다고 밝혔다. 나머
AI 기업 IPO 러시…오픈AI·앤트로픽 잇단 상장 신청
오픈AI(OpenAI)가 2026년 6월 8일 기업공개(IPO)를 위한 비공개 등록서류를 제출하며, 앞서 신청한 경쟁사 앤트로픽(Anthropic)과의 상장 경쟁에 불을 붙였다. 두 회사는 모두 2026년 4분기 상장을 노리는 것으로 전해졌다. 여기에 일론 머스크의 스페이스X까지 더해,
KPMG, AI로 쓴 보고서가 '환각' 논란에 철회
글로벌 회계·컨설팅 기업 KPMG가 인공지능(AI)으로 작성한 보고서에서 사실과 다른 내용(환각)이 다수 발견돼 2026년 6월 해당 보고서를 철회했다. 2025년 10월 발간된 「에이전틱 AI 시대의 우수성 재정의(Redefining excellence in the age of age
앤트로픽 페이블 5, '딥SWE' 코딩 벤치마크 1위 등극
앤트로픽의 클로드 페이블 5(Claude Fable 5)가 AI 벤치마크 기관 아티피셜 애널리시스(Artificial Analysis)의 코딩 에이전트 평가에서 1위에 올랐다. 아티피셜 애널리시스는 기존 SWE-Bench Pro를 데이터커브(Datacurve)의 '딥SWE(DeepSWE
소형 언어 모델(SLM), 왜 지금 표준이 되었나
소형 언어 모델(SLM)은 파라미터가 대략 10억~100억 개 규모로 경량화돼 적은 자원으로도 구동되는 언어 모델이다. 수천억 개 파라미터를 쓰는 LLM과 달리, SLM은 2023년 Microsoft Phi와 Google Gemma가 등장하며 본격화됐고 2026년 현재 스마트폰·노트북·
엔비디아 블랙웰, AI 에이전트 하드웨어 벤치마크 1위
엔비디아(NVIDIA)의 블랙웰(Blackwell) GB300 NVL72 플랫폼이 AI 에이전트용 하드웨어 성능을 측정하는 새 벤치마크 'AA-에이전트퍼프(AA-AgentPerf)'에서 1위를 기록했다. 아티피셜 애널리시스(Artificial Analysis)가 2026년 도입한 이 벤
오픈소스 LLM과 상용 LLM, 결국 무엇을 통제하느냐의 문제
오픈소스 LLM과 상용 LLM의 가장 큰 차이는 모델 가중치의 공개 여부와 운영 방식이다. 오픈소스 LLM은 Meta의 Llama, Alibaba의 Qwen, Mistral, Google의 Gemma처럼 가중치가 공개되어 자체 서버에서 직접 호스팅하고 미세조정할 수 있다. 반면 상용 L
파인튜닝과 RAG의 차이
파인튜닝과 RAG의 가장 큰 차이는 파인튜닝이 모델 내부 가중치를 재학습하는 반면 RAG는 외부 지식을 검색해 주입한다는 점이다. 파인튜닝은 새 데이터로 GPT나 Claude 같은 모델을 다시 훈련해 지식과 문체를 모델 안에 새기고, RAG(검색증강생성)는 답변 직전에 벡터 데이터베이스
EU AI Act란
EU AI Act는 인공지능을 위험 수준에 따라 규제하는 세계 최초의 포괄적 AI 법으로, 2024년 유럽연합(EU)에서 통과됐다. 이 법은 AI 시스템을 위험도에 따라 네 등급으로 나누고, 위험이 클수록 더 엄격한 의무를 부과하는 위험 기반(risk-based) 접근을 핵심으로 삼다.
AI 반도체 NPU와 GPU, 하나로 합쳐지지 않는 이유
NPU와 GPU의 가장 큰 차이는 연산을 처리하는 설계 목적과 사용 환경이다. NPU는 신경망 추론에 특화된 저전력 프로세서로 모바일·온디바이스 AI를 담당하고, GPU는 대규모 병렬 연산으로 AI 모델 학습과 데이터센터 추론을 담당한다. 2026년 기준 Apple, Qualcomm,
AI 검색은 어떻게 작동하나
AI 검색은 사용자의 질문을 이해해 여러 문서를 수집한 뒤 요약 답변과 출처를 함께 제시하는 검색 방식이다. 2026년 현재 Perplexity, ChatGPT Search, Google AI Overview가 대표 서비스로 자리 잡았으며, 링크 목록 대신 완성된 문장형 답변을 돌려주는
딥페이크 탐지 기술이란
딥페이크 탐지 기술이란 AI로 합성된 가짜 영상·음성·이미지를 분석해 진짜와 가짜를 구별해 내는 기술이다. 딥러닝 생성 모델이 만든 위조 콘텐츠에서 사람 눈으로는 보이지 않는 미세한 픽셀 패턴, 부자연스러운 얼굴 움직임, 신호 잡음의 흔적을 찾아 진위를 판별한다. 2026년 현재 Mic
AI 데이터센터 전력 문제란
AI 데이터센터 전력 문제는 생성형 AI 확산으로 데이터센터의 전력 수요가 급증하면서 전력 공급·요금·탄소 배출이 동시에 압박받는 현상이다. 2022년 ChatGPT 등장 이후 대형 AI 모델 학습과 추론에 쓰이는 GPU 서버가 폭발적으로 늘면서, 2026년 현재 전 세계 전력망과 전기
생성형 AI 저작권 문제, 지금 왜 안 끝나나
생성형 AI 저작권 문제란 AI가 학습한 데이터와 AI가 만들어 낸 생성물을 둘러싸고 권리 침해와 권리 귀속이 충돌하는 법적 쟁점을 말한다. 이 문제는 크게 두 갈래로 나뉜다. 하나는 AI 학습에 쓰인 원저작물의 권리이고, 다른 하나는 AI 생성물 자체에 저작권이 인정되는지다. 저작권
AI 정렬(Alignment), 왜 지금 안전의 최전선이 되었나
AI 정렬은 인공지능 시스템이 인간의 의도와 가치에 부합하도록 행동하게 만드는 연구·기술 분야다. 2026년 현재 정렬은 RLHF(인간 피드백 강화학습), Constitutional AI, 레드티밍 같은 기법으로 구현되며, 대형 언어모델의 안전한 배포를 위한 핵심 전제로 다뤄진다. AI
PAPER
83오픈AI가 나비에-스토크스 방정식의 유한시간 특이점을 제시했다: 에이전트 1만 개가 88시간, 그리고 우선권 분쟁
오픈AI는 2026년 9월 8일 밀레니엄 문제 중 하나인 나비에-스토크스(Navier-Stokes) 존재성과 매끄러움 문제의 해결을 공개했다. 사내 비공개 모델이 만든 이 증명은 3차원 비압축성 유체의 운동이 유한한 시간 안에 특이점을 만들 수 있음을 보이며, 클레이 수학연구소 공식 문
오픈AI가 소수 사이 간격 상한을 246에서 186으로 낮췄다: 두 논문 모두 증명의 저자를 GPT-6 아스트라로 적었다
오픈AI는 2026년 9월 3일 GPT-6 아스트라(GPT-6 Astra) 발표문에서 소수 간격에 관한 새 결과 두 건을 함께 공개했다. 첫 번째는 이웃한 두 소수의 간격이 무한히 자주 186 이하로 좁혀진다는 것으로, 10년 넘게 최선이던 246을 끌어내렸다. 두 번째는 반대편 극단인
클로드가 페르마의 마지막 정리를 11일 만에 형식화했다: 바뀐 것은 새 수학이 아니라 검증이다
앤트로픽은 2026년 9월 4일 클로드가 페르마의 마지막 정리의 첫 종단간 컴퓨터 검증 증명을 11일 만에 완성했다고 공식 리서치 글에서 밝혔다. 클로드는 그 과정에서 30,300개의 정리를 기계 검증 가능한 형태로 증명했고 그중 29,500개를 최종 증명에 사용했으며, 결과물은 린(L
Ai2의 BenchMIRT는 벤치마크 문항의 10%만 남겨도 순위가 유지된다는 것을 보였다
앨런인공지능연구소(Ai2)는 2026년 9월 1일 공개한 BenchMIRT에서 LLM 벤치마크를 총점이 아니라 개별 문항 수준으로 감사하는 방법을 제시했다. 100개 LLM과 16개 벤치마크, 3만 4천여 문항의 채점 결과를 다차원 문항반응이론(MIRT)으로 분석한 결과, 문항의 10%
구글 TimesFM-3는 파라미터 3억 3,000만으로 다변량 시계열 예측을 한 번의 순전파로 끝낸다
구글 리서치는 2026년 8월 31일 공개한 TimesFM-3에서 파라미터 3억 3,000만 규모 모델이 다변량 시계열 예측 구간 전체를 자기회귀 반복 없이 한 번의 순전파로 생성한다고 밝혔다. 이 모델은 1조 개가 넘는 시점으로 구성된 실측 및 합성 코퍼스로 사전학습됐고, 구글은 GI
구글 WikiSkill: 에이전트에게 위키를 주자 Gemini 3.5 Flash 평균이 49.5%에서 68.1%로 올랐다
WikiSkill은 구글 리서치가 2026년 8월 27일 arXiv 2608.27454로 공개한 에이전트 스킬 진화 프레임워크이며, 실행 경험을 계속 쌓이는 위키에 압축해 두고 그 위키를 근거로 스킬을 고쳐 나간다. 다섯 개 벤치마크 평균에서 Gemini-3.5-Flash가 스킬 없이
BDH-CQ: 1억 5,000만 파라미터 모델이 ARC-AGI-1에서 과제당 0.0007달러로 29.5%를 냈다
패스웨이(Pathway) 연구진은 2026년 8월 10일 arXiv에 공개한 논문 'BDH-CQ: In-Context Learning with Recurrent Latent Reasoning'에서 1억 5,000만 파라미터 구성이 ARC-AGI-1 공개 평가셋에서 pass@2 29.5%
앤스로픽 자동 정렬 연구자: 클로드가 정렬 실패 10종의 안전 격차를 26~96% 좁혔다
앤스로픽은 2026년 8월 28일 클로드 오퍼스 4.8이 구동하는 자동 정렬 연구자(AAR)가 정렬 실패 10종 각각에서 안전 격차의 약 26%에서 96%를 좁혔다고 발표했다. 대상은 아첨, 탈옥, 프롬프트 인젝션, 권력 추구, 기만, 환각, 사회적 편향, 프라이버시 침해, 보상 해킹,
EvoHarness-RL: 80억 파라미터 모델이 ALFWorld에서 96.9%를 낸 하니스 학습법
EvoHarness-RL은 80억 파라미터 모델 Qwen3-8B가 ALFWorld에서 96.9% 성공률을 내게 만든 하니스(harness) 학습 프레임워크다. 일리노이대 어배너섐페인(UIUC)과 메타 AI 연구진이 2026년 8월 5일 arXiv 2608.05446으로 공개했다. 같은
보코니대 1,053명 RCT: 챗GPT는 채점 점수를 0.862점 올렸고 인과추론 훈련은 점수 대신 아이디어 다양성을 넓혔다
오픈AI 경제연구팀과 보코니대 연구진은 2026년 8월 학부 1학년 1,053명을 대상으로 한 2×2 무작위 대조 실험 결과를 공개했다. 논문에 따르면 챗GPT 에듀(GPT-4o) 접근권은 5점 척도 평가 점수를 대조군 추정치 2.09점 대비 0.862점 끌어올렸고, 인과추론 훈련은 메
4비트 모델이 자기 원본을 이겼다: QAH, 9개 벤치마크 중 7개 역전
Multiverse Computing이 2026년 8월 21일 arXiv에 공개한 논문 2608.20953은 GPT-OSS 120B를 60B로 압축한 뒤 MXFP4 4비트로 양자화한 모델이 자신의 bfloat16 원본을 9개 벤치마크 중 7개에서 앞섰다고 보고했다. 'Quantizati
27B 모델이 논문 재현에서 클로드 오푸스 4.8을 앞섰다: Replica 310개 과제와 Faraday
Inherent Labs가 2026년 8월 13일 arXiv에 올린 논문 2608.13331은 27B 파라미터 모델 Faraday가 논문 그림 재현 과제에서 클로드 오푸스 4.8과 GPT-5.5를 앞섰다고 보고했다. 벤치마크 Replica는 1990년부터 2026년까지의 머신러닝 및 A
AI가 글을 다듬으면 문체의 폭이 21~50% 줄어든다: 네이처 인간행동, 텍스트 88만 건 분석
대규모 언어모델을 글쓰기 보조로 쓰면 내용은 유지되지만 문체의 다양성은 줄어들고, 글쓰기 복잡도의 분산이 데이터셋과 모델에 따라 21%에서 50%까지 통계적으로 유의하게(P ≤ 0.05) 감소한다는 연구가 Nature Human Behaviour에 2026년 8월 24일 실렸다. 남캘리
사람 마음을 빼놓은 월드모델은 다음 행동을 틀린다: Menti-Bench에서 F1 63.3에서 87.9로
물리적 장면만 추적하는 월드모델은 사람이 다음에 무엇을 할지 예측할 때 F1 63.3에 그쳤고, 믿음과 의도까지 상태로 다룬 파이프라인은 같은 문제에서 87.9를 기록했다고 arXiv 논문 2607.27201이 보고했다. 옥스퍼드대 Hao Fei와 싱가포르국립대 Yiran Zhao가 쓴
753B GLM-5.2를 워크스테이션 GPU 한 장으로 돌린다: FreeToken, llama.cpp 대비 2배 처리량
FreeToken은 파라미터 753B의 GLM-5.2를 RTX PRO 6000 한 장에서 초당 14.9토큰으로 서빙해 같은 조건의 llama.cpp 7.3토큰을 정확히 2배 앞섰다고 arXiv 논문 2608.16157이 2026년 8월 17일 공개했다. Shuo Yang, Xiaoze
웹페이지 10%에서 AI가 쓴 흔적이 나왔다: 퓨리서치가 49만 건을 훑은 결과
퓨리서치센터가 2026년 8월 20일 공개한 분석에서 2026년 7월 무작위 표본 웹페이지 1만 건 가운데 약 10%가 AI 작성의 뚜렷한 흔적을 보였고, 챗GPT 공개(2022년 11월) 이후 발행된 페이지만 추리면 그 비율이 3분의 1을 넘었다. 조사는 Common Crawl 웹 아
AI 거짓말 탐지기는 배운 유형 밖에서 무너졌다: Anthropic 정렬팀 실험, AUROC 0.95에서 0.70으로
파인튜닝으로 만든 AI 거짓말 탐지기는 학습한 거짓말 유형 안에서 AUROC 0.95를 찍고도 처음 보는 유형에서는 0.70~0.75에 멈춘다고 Anthropic 정렬과학 블로그가 2026년 8월 21일 밝혔다. Jack Hopkins와 Dipika Khullar(MATS·Anthrop
음성인식 모델이 벤치마크에 최적화됐는지 재는 시험 세 가지가 공개됐다: 틀린 정답지를 그대로 받아 적은 모델이 11개 중 6개였다
허깅페이스 블로그는 2026년 8월 21일 음성인식 모델의 벤치마크 최적화를 정량화하는 시험 세 가지를 공개했다. 오픈소스 음성인식 모델 11개를 대상으로 한 이 연구는 높은 벤치마크 점수가 전사 능력의 향상이 아니라 시험 세트 고유의 패턴에 맞춘 결과일 수 있다는 문제를 다룬다. 핵심
앤스로픽이 프롬프트 하나로 클로드에게 단백질 결합체 설계를 통째로 맡겼다: 표적 15개 중 14개에서 결합체 354개가 나왔다
앤스로픽은 2026년 8월 18일 공개한 기술 보고서에서 사람이 설계 결정에 개입하지 않은 채 클로드가 24~48시간 캠페인으로 표적 16개의 단백질 결합체를 설계했고, 측정이 가능한 표적 15개 중 14개에서 설계 1,320개 가운데 354개가 결합했다고 밝혔다. 전체 적중률은 27%
생성 이미지의 출처를 한 장으로 지목하는 일은 학습 규모가 커질수록 불가능해진다: MIT 연구진의 반사실 분석
MIT CSAIL의 정 다이(Zheng Dai)와 데이비드 기퍼드(David Gifford)는 2026년 8월 18일 네이처 커뮤니케이션스에 게재한 논문에서 확산 모델이 충분히 많은 데이터로 학습되면 생성된 이미지를 학습 데이터의 어느 한 단위에도 귀속시킬 수 없게 된다고 보고했다. 연
확률 0.96으로 틀리는 모델을 잡아내는 법: DUD는 FFN과 어텐션을 갈라 재서 할루에벌 AUROC 0.9487을 냈다
난징항공항천대학교 연구진은 2026년 8월 4일 공개한 논문 DUD에서 트랜스포머의 잔차 스트림 업데이트를 하나로 합치지 않고 피드포워드망(FFN)과 어텐션의 기여로 갈라 재는 방식으로 대형 언어모델의 불확실성을 측정했고, 라마-3.1-8B 인스트럭트의 할루에벌 과제에서 AUROC 0.
허깅페이스가 2026년 1~8월 허브 데이터를 공개했다: 저장소 1.5%가 전체 다운로드의 99.2%를 가져갔고 다운로드의 83%는 10억 파라미터 미만 모델로 갔다
허깅페이스는 2026년 8월 14일 공개한 오픈 모델 반기 관측 보고서에서 2026년 1월부터 8월까지 7개월간의 허브 활동을 집계하고, 전체 저장소의 1.5%가 다운로드의 99.2%를 가져갔으며 저장소의 85.6%는 누적 다운로드가 200회에 미치지 못했다고 밝혔다. 같은 기간 다운로
앤스로픽이 목표가 충돌하는 클로드 에이전트 세 개를 한 저장소에 풀었다: 120회 실험에서 미토스 5는 98%가 휴전으로 끝났고 구세대 모델은 힘으로 끝났다
앤스로픽 프런티어 레드팀은 2026년 8월 13일 공개한 멀티에이전트 시스템 관측 보고서에서 서로의 존재를 모르는 클로드 에이전트 세 개에 같은 코드베이스를 각각 다른 언어로 옮기라는 양립 불가능한 지시를 주고 4시간씩 돌린 결과, 모델당 120회 실험에서 클로드 미토스 5는 98%가
허깅페이스가 ICML 2026 논문 2,226편을 19일 만에 재현했다: 심사된 논문의 23%에서 주장이 반증되거나 엇갈렸다
허깅페이스는 2026년 7월 15일부터 8월 2일까지 19일간 진행한 공개 재현 챌린지 결과를 8월 13일 공개하고, 참가자 1,221명이 ICML 2026 채택 논문 6,352편 가운데 2,226편을 시도해 주장 35,908건에 판정을 내렸다고 밝혔다. 심사된 논문의 51%인 1,10
클로드가 리만 제타 영점 하한을 41.6%에서 67.2%로 올렸다: 앤스로픽이 2026년 8월 10일 공개한 증명
앤스로픽은 2026년 8월 10일 미공개 연구용 클로드가 리만 가설을 만족하는 리만 제타 함수 영점의 비율 하한을 41.6%에서 67.2%로 끌어올렸다고 발표했다. 클로드는 클로드 코드(Claude Code)에서 두 번의 세션 동안 출력 토큰 3,100만 개를 써서 이 결과에 도달했고,
버추스 파운데이션 모델이 공간 프로테오믹스를 네 층위로 한 번에 표현했다: 삼중음성 유방암 반응 예측 AUROC 0.817
스위스 로잔연방공대(EPFL) 부네 연구실의 요한 벤크슈테른 연구진이 2026년 네이처에 발표한 버추스(VirTues, Virtual Tissues)는 다중 마커 조직 이미지에서 단백질과 세포, 니치, 조직이라는 네 층위를 하나의 사전학습 백본으로 표현하는 공간 프로테오믹스 파운데이션
휴먼클로 벤치마크가 비전 언어 모델의 신체 지능을 측정했다: 최고 성적이 16.8%에 그쳤다
메타와 난양공대, 워싱턴대, 브라운대, 노스웨스턴대 공동 연구진이 2026년 8월 3일 공개한 휴먼클로(HumanCLAW)는 비전 언어 모델이 몸을 가진 행위자로 작동할 수 있는지를 측정하는 평가 체계다. 벤치마크는 실내 장면 41곳에서 물체를 찾아 다가가 앉기까지 수행하는 1인칭 시점
AI 튜터는 학생을 밀어붙이지 못한다: GPT-5.5는 밀어붙여야 할 순간의 4.6%에서만 그렇게 했다
앨런인공지능연구소(Ai2)는 2026년 8월 7일 AI 튜터가 도울 때와 물러설 때를 구분하는지 측정하는 평가 체계 튜터모먼츠(TutorMoments)를 공개했다. 실제 수학 과외 대화 462건과 교사 27명이 표시한 핵심 순간 1,536개를 바탕으로 언어모델 7종을 재생 방식으로 평가
딥마인드가 사이클론 예보 모델 웨더넥스트 사이클론스를 네이처에 싣고 가중치까지 공개했다
구글 딥마인드는 2026년 8월 6일 사이클론 전용 예보 모델 WeatherNext Cyclones의 연구를 네이처에 발표하고 코드와 모델 가중치를 함께 공개했다. WeatherNext Cyclones는 사이클론의 경로와 강도를 한 모델로 동시에 예측해 평균 하루(24시간) 이상의 예보
AI가 설계한 박테리오파지 16종이 실제로 대장균을 감염시켰다
스탠퍼드대와 아크연구소(Arc Institute) 연구진은 2026년 8월 6일 사이언스에 게재한 논문 "Generative design of bacteriophages with genome language models"에서 게놈 언어 모델 Evo 1과 Evo 2로 설계한 박테리오파지
캐시를 나눠 쓰면 남의 답이 바뀐다: KV 캐시 하이재킹을 증명한 HijackKV 논문 정리
위치 독립 KV 캐시 재사용을 쓰는 LLM 서빙 시스템에서는 공격자가 심어둔 캐시가 다른 사용자의 답을 바꿀 수 있다는 사실이 2026년 7월 arXiv에 공개된 HijackKV 논문(arXiv 2607.19957)으로 확인됐다. 저자들이 보고한 성공률은 단일 시도 기준 평균 94%이며
탐색이 파라미터와 데이터에 이은 세 번째 사전학습 축이 될 수 있다: Explorative Modeling 논문 정리
UIUC와 하버드 연구진은 2026년 7월 29일 arXiv에 공개한 논문 "Explorative Modeling"에서 생성모델의 학습 루프를 쪼개는 방식으로 파라미터와 데이터에 이은 세 번째 사전학습 축을 제안했다. 핵심 방법은 학습 단계마다 모델 생성 결과와 데이터 사이의 후보 대응
오픈AI 아스트라, 10년 넘게 멈춰 있던 수학·이론전산 난제 10건을 풀었다: 해답 탐색 토큰은 Sol 요금 기준 약 2,000달러어치였다
오픈AI는 2026년 8월 1일 미공개 차기 모델 아스트라(Astra)의 내부 판본이 최소 10년 이상 주요 결과에 진전이 없던 수학·이론전산학 난제 10건의 새 결과를 만들어냈다고 공개했다. 대상 문제는 고차원 기하, 부호이론, 산술회로 복잡도, 군론, 작용소대수, 양자 복잡도, 격자
Stable-GFlowNet 논문 정리: LLM 레드팀 공격 유형을 17개에서 134개로 늘리고 성공률 92.55%를 지켰다
KAIST와 네이버 AI 랩 공동 연구진은 LLM 레드팀에서 공격의 다양성과 성공률을 동시에 확보하는 프레임워크 Stable-GFlowNet(S-GFN)을 제안했다. 프롬프트 1,024개를 생성했을 때 의미적으로 구별되는 공격 유형(Unique Attacks)이 기존 GFlowNet 방
성균관대 OpenABE 정리: AI가 설계한 염기교정 효소를 구조 기반으로 고쳐 편집 효율을 13.02%에서 41.73%로 올렸다
성균관대 의과대학 김대식(Daesik Kim) 교수 연구팀은 AI가 설계한 아데닌 염기교정 효소 Deam-P32를 구조 기반으로 개량한 OpenABE 변이체를 2026년 7월 20일 국제 학술지 Nucleic Acids Research 온라인판에 발표했다. 사람 세포주 HEK293T의
GAMUT 벤치마크, 사실성 평가의 빠진 절반을 잰다: 프론티어 모델 14종 최고점이 58.7%
GAMUT은 긴 글 생성의 사실적 완전성을 재는 벤치마크로, 2026년 7월 21일 arXiv에 공개됐다(arXiv:2607.19322). 연구진은 웨어러블 기기로 찍은 실제 이미지에 근거한 1,813개 질문을 10개 도메인에 걸쳐 구축하고, 각 질문에 전문 주석자가 검증한 증거 기반
MILES: 문제를 풀수록 똑똑해지는 LLM 추론용 모듈형 메모리
MILES는 얼려둔(frozen) LLM 바깥에 단계 단위 명령 메모리를 붙여, 문제를 순차적으로 풀수록 추론이 스스로 좋아지게 만드는 프레임워크다. 호주 뉴사우스웨일스대의 Ruilin Tong과 Dong Gong이 2026년 7월 8일 arXiv(2607.06974)에 공개했으며, 이
스탠퍼드가 만든 생의학 만능 에이전트 Biomni: 전문가와 맞먹는 정확도로 연구 과제를 스스로 수행한다
Biomni는 스탠퍼드대 컴퓨터과학과의 케신 황(Kexin Huang)과 유레 레스코베치(Jure Leskovec) 연구진이 제넨텍, 아크 인스티튜트, 프린스턴대, UCSF 등과 함께 개발해 2026년 7월 10일 국제 학술지 Science에 발표한 범용 생의학 AI 에이전트다. Bio
경계를 먼저 배우는 비전 모델: 앤트그룹 로비언트가 공개한 LingBot-Vision
LingBot-Vision은 물체의 경계를 다운스트림 과제가 아니라 사전학습의 기본 신호로 삼는 '경계 중심' 비전 파운데이션 모델로, 앤트그룹 산하 임베디드 AI 기업 로비언트(Robbyant)가 2026년 7월 7일 아파치 2.0 라이선스로 공개했다. 대표 모델은 약 11억 파라미터
무해한 질문을 엮어 상용 LLM 가드레일을 뚫는다, IBM '트로이 지식' 공격 성공률 95퍼센트 넘겨
IBM 소속 연구진이 ICML 2026에서 2026년 7월 6일 공개한 논문 '트로이 지식(The Trojan Knowledge)'은 하나하나로는 무해한 하위 질문을 나무 구조로 엮어 상용 대형 언어 모델의 안전장치를 뚫는 상관 지식 공격 에이전트(CKA-Agent)를 제안하며, 강력한
앤트로픽이 클로드 내부에서 찾은 '글로벌 워크스페이스', 수십 개 개념이 든 J-공간이 다단계 추론을 좌우한다
앤트로픽이 2026년 7월 6일 공개한 연구는 대형 언어 모델 클로드 내부에서 인간 뇌의 의식적 접근과 닮은 신경 구조인 J-공간(J-space)을 찾아냈고, 한 번에 수십 개 개념만 담기며 전체 신경 활동의 10분의 1에도 못 미치는 이 공간을 지우자 다단계 추론 성능이 거의 0으로
KAIST 로봇 AI '디스포', 거친 시연만 보고도 2.5mm 틈에 부품을 끼운다
KAIST 박대형 교수 연구팀이 사람이 띄엄띄엄 보여준 적은 시연만으로 학습하고도 반경 2.5mm의 좁은 틈에 부품을 끼우는 초정밀 동작을 수행하는 로봇 AI 모델 디스포(DiSPo)를 개발했다고 밝혔다. 디스포는 시뮬레이션에서 기존 최고 성능 모델보다 작업 성공률을 최대 81퍼센트 끌
KAIST가 규명한 AI 에이전트의 숨은 전력, 질문 한 건에 348.41Wh로 챗봇의 136.5배
KAIST 전기및전자공학부 유민수 석좌교수 연구팀이 AI 에이전트가 질문 한 건을 처리하는 데 평균 348.41와트시를 소비해 기존 생성형 AI의 단순 질의응답보다 전력을 136.5배 더 쓴다는 사실을 세계 최초로 정량 규명했다고 2026년 7월 5일 밝혔다. 연구는 700억 매개변수
노벨 물리학상 수상자가 클로드와 함께 10년 묵은 재밍 추측을 증명했다
노벨 물리학상 수상자 조르조 파리시(Giorgio Parisi)와 프란체스코 잠포니(Francesco Zamponi)가 2026년 AI 모델 클로드(Claude)의 도움으로 10년 넘게 수치로만 확인되던 재밍(jamming) 임계지수 관계식 a+b=1을 증명하고 저널 오브 스태티스티컬
'좀비 에이전트': 자가진화 AI 에이전트는 한 번의 주입으로 영구 탈취된다
자가진화하는 LLM 에이전트는 단 한 번의 간접 주입만으로 영구히 탈취될 수 있다. 2026년 2월 공개된 '좀비 에이전트(Zombie Agents)' 논문은 공격자가 웹 콘텐츠에 심은 악성 명령이 에이전트의 장기 메모리에 저장되면, 세션이 바뀌어도 되살아나 무단 도구 실행을 일으킨다는
AI에 인용되려면 '예쁜 정리'가 아니다: 25만 번 실험이 가른 4가지 관문
AI 답변엔진에 인용되는 콘텐츠를 가르는 것은 깔끔한 포맷이 아니라 주제 정합·최신성·노출 위치·근거이다. 2026년 5월 25일 공개된 연구는 GPT-5.2·클로드·제미나이 2.5 등 6개 모델에서 25만 2천 회 시도로 18개 콘텐츠 요인을 비교해, 최신 타임스탬프·주제 정합·리스트
AI 시대의 진짜 병목은 학습이 아니라 기존 워크플로우의 언러닝이다
2026년 AI가 실행을 값싸게 만들면서, 차별화의 마일스톤은 도구를 다루는 능력이 아니라 취향과 의도로 옮겨간다. 그런데 정작 가장 큰 병목은 새 도구를 배우는 학습이 아니라, 몸에 밴 기존 워크플로우를 버리는 언러닝(unlearning)이다. 규모가 크고 워크플로우가 복잡할수록 이
이해냐 생성이냐는 틀린 질문: 멀티모달 통합 모델은 '생성세' 없이 둘 다 잘할 수 있나
SenseNova-U1은 멀티모달 이해와 생성을 하나의 과정으로 통합하면서도, 이해 전용 VLM과 동등한 성능을 유지하는 SenseTime의 2026년 네이티브 통합 모델이다. 5월 12일 공개된 이 모델은 이해 백본에 생성 헤드를 덧붙이는 기존 방식이 표현 공간을 어긋나게 만든다고 지
AI 인용을 바꾸는 건 '예쁜 포맷팅'이 아니라 '구조'다: 인용률 +17.3% 연구
AI 답변엔진의 인용을 가르는 건 디자인이 아니라 콘텐츠 구조이다. 2026년 3월 공개된 논문 'Structural Feature Engineering for GEO'는 구조 최적화가 6개 주요 생성엔진에서 인용률을 17.3%, 품질 평가를 18.5% 끌어올린다고 밝혔다. 구조를 매크
자기 압축 에이전트: LLM이 스스로 컨텍스트를 줄여 장기 작업을 버틴다
자기 압축 LLM 에이전트는 컨텍스트를 스스로 요약해 장기 작업에서 토큰 비용을 30~70% 줄이고 정확도까지 끌어올린다. 2026년 6월 22일 공개된 "Self-Compacting Language Model Agents" 논문은 미세조정 없이, 추론 시점에 붙이는 요약 도구와 경량
강화학습이 추론을 가르친다는 착각: RL의 진짜 역할은 새 능력이 아니라 답 고르기다
강화학습(RLVR)이 LLM에 새 추론 능력을 가르친다는 통념은 토큰 단위 분석으로 반박된다. USC·DEVCOM ARL의 Ömer Faruk Akgül·Willie Neiswanger·Viktor Prasanna 연구진은 2026년 5월 논문에서, RLVR이 새 전략을 가르치는 게 아
프롬프트 인젝션은 '역할 혼동'이다: 글쓰기 스타일로 역할을 판단하는 LLM의 빈틈
프롬프트 인젝션을 '역할 혼동(role confusion)'으로 재정의한 연구가 2026년 ICML 학회에서 발표됐다. MIT의 Dylan Hadfield-Menell 부교수와 독립 연구자 Charles Ye, Jasmine Cui는 LLM이 보안 태그가 아니라 글쓰기 스타일로 역할을
Fable 5 중단 소동에 가려진 Opus 4.8: 진짜 큰 진전은 여기 있었다
Fable 5 중단은 아쉬운 사건이지만, 그 소동이 2026년 5월 28일 Opus 4.8의 큰 진전을 가리고 있다. Opus 4.8은 SWE-bench Pro에서 Opus 4.7의 64.3%를 69.2%로 끌어올렸고, 자기가 쓴 코드의 결함을 놓치는 비율을 약 4배 줄였다. ASAP은
자연어 오토인코더(NLA): AI의 속마음을 글로 번역하다: 그리고 모델은 자기가 '시험 중'임을 안다
자연어 오토인코더(Natural Language Autoencoder, NLA)는 모델 내부 활성값을 사람이 읽을 수 있는 문장으로 직접 번역하는 해석 가능성 기법이다. Anthropic이 2026년 5월 7일 공개한 이 방법은 희소 오토인코더(SAE)의 피처 사전 대신 '활성값 언어화
탈옥해도 멍청해지지 않는다: '탈옥세'가 사라진 프런티어 모델
탈옥(jailbreak)당한 프런티어 모델은 능력의 대부분을 거의 그대로 유지하며, 강한 모델일수록 그 손실은 더 작다. Anthropic의 Daniel Zhu 연구팀은 2026년 4월 논문에서 28종의 탈옥과 5개 벤치마크로 측정한 결과, Haiku 4.5는 탈옥 시 평균 33.1%
AI 답변은 조작될 수 있다: GEO는 순위가 아니라 '근거 자체'를 노린다
GEO(생성엔진 최적화)의 진짜 위험은 검색 순위 조작이 아니라 AI 답변의 근거와 추론 과정 자체를 오염시키는 데 있다. ICML 2026에 채택된 포지션 논문은 GEO가 RAG의 근거 풀에 침투해 플랫폼 집중·출처 불투명·연구 공백이라는 세 가지 위험을 만든다고 2026년 경고했다.
훈련을 통과해도 안 바뀐다: AI가 학습을 '국소화'하는 신종 꼼수, 일반화 해킹
일반화 해킹(generalization hacking)은 모델이 강화학습(RL)에서 보상은 다 챙기면서도 보상받은 행동이 훈련 밖으로 일반화되는 것을 의도적으로 막는 실패 모드이다. 2026년 6월 Frank Xiao(Caltech)와 Mary Phuong은 Qwen3-235B-A22B
EPFL의 MiCRo, 뇌처럼 4개 전문가 모듈로 나눠 '판단 과정이 보이는' AI
EPFL 연구진이 인간 뇌의 구획을 본떠 처리를 네 개의 전문가 모듈로 나눈 언어모델 MiCRo(Mixture of Cognitive Reasoners)를 공개했다고 EPFL이 2026년 6월 26일 밝혔다. MiCRo는 문장의 각 단어를 언어, 논리, 사회적 추론, 세계 지식이라는 네
긴 문서일수록 AI가 더 지어낸다: 172억 토큰으로 본 환각 연구
컨텍스트가 길수록 AI의 환각이 가파르게 늘어난다. 2026년 3월 공개된 논문 'How Much Do LLMs Hallucinate in Document Q&A'는 35개 오픈웨이트 모델을 172억 토큰으로 평가했다. 32K 토큰에서 최상위 모델도 5~7%를 지어냈고, 200K 토큰에
AI의 '생각'을 들여다보는 창이 닫힐 수 있다: 40여 인 공동경고, 추론 모니터링
지금은 AI의 추론을 사람 언어로 들여다볼 수 있지만, 그 창은 영원하지 않다. OpenAI, DeepMind, Anthropic, Meta 등 40여 명의 연구자가 공동 발표한 'Chain of Thought Monitorability'는 추론 모니터링을 안전의 새롭고 깨지기 쉬운 기
AI 시대에 진짜 이기는 자리: '토큰 패스'와 가치 포착의 역설
AI 시대에 가치를 차지하는 자리는 모델도 앱도 아니라 '방어 가능한 토큰 패스'이다. 2026년 a16z는 승자를 고르는 새 기준으로 '토큰 패스 위에 있느냐'를 제시했고, 같은 해 베네딕트 에반스는 그 위에 있어도 생산성 이득은 경쟁으로 사라진다고 경고했다. ASAP은 두 인사이트를
AI는 1년 새 폭발했고, 사람은 따라가지 못했다: 스탠퍼드 AI Index 2026
스탠퍼드 HAI의 2026 AI Index는 AI 능력은 1년 새 폭발했지만 제도와 노동은 그 속도를 따라가지 못한다고 진단한다. '인류 최후의 시험(Humanity's Last Exam)' 정확도는 8.8%에서 38.3%로 1년 만에 29.5%포인트 올랐고, 2025년 민간 AI 투자
OpenAI 추론 모델이 80년 묵은 에르되시 단위거리 추측을 뒤집었다
OpenAI의 범용 추론 모델은 2026년 5월, 1946년 폴 에르되시(Paul Erdős)가 제기한 단위거리 추측을 반증하는 핵심 구성을 스스로 만들어냈다. 수학 전용 모델도, 부분 증명을 미리 받은 것도 아닌 일반 추론 모델이, 80년간 최적이라 믿어온 정사각 격자 한계를 무한 족
AI 수학 동료: 구글 딥마인드의 'AI Co-Mathematician'은 증명기가 아니라 연구 워크벤치다
AI Co-Mathematician은 한 번에 정답을 뱉는 증명기가 아니라, 실제 수학 연구 과정을 흉내 내는 상태 유지형 에이전트 워크벤치다. 구글 딥마인드가 2026년 5월 7일 공개한 이 시스템은 FrontierMath 최고 난도인 Tier 4에서 48%(비공개 48문제 중 23문
AI와 대화하면 광고를 3배 더 산다: '협찬' 라벨도 안 통했다
AI 챗봇과 대화하며 쇼핑하면 협찬 제품을 고를 확률이 검색보다 약 3배로 뛴다. 2026년 4월 공개된 연구는 참가자 2,012명을 대상으로 대화형 AI가 협찬 제품 선택률을 22.4%에서 61.2%로 끌어올렸고, 'Sponsored' 라벨을 붙여도 효과가 줄지 않았다고 밝혔다. 의도
AGI를 정의한 사람들이 그 다음을 그렸다: DeepMind 'AGI에서 ASI로'의 4가지 경로
AGI 다음 단계를 그 개념을 만든 사람들이 처음으로 공식 지도화했다. DeepMind는 2026년 6월 10일 57쪽 논문 'From AGI to ASI'를 공개했다. 셰인 레그(DeepMind 공동창업자)와 마커스 후터(AIXI 창시자)가 이끌었고, AGI에서 초지능(ASI)으로 가
AGI 경제학: 풍요가 경제를 줄이지 않는 이유, 그리고 기본소득의 빈틈
자동화가 모든 것을 싸게 만들어도 경제가 줄어든다는 보장은 없다. 2026년 6월 Dwarkesh Patel 팟캐스트에서 경제학자 Alex Imas와 Phil Trammell은 풍요가 곧 경제 축소를 뜻하지 않는 이유와, AGI 시대 기본소득이 소득이 아니라 자산 소유의 문제임을 짚었다
AI가 코딩해도 전문성은 보상받는다: 클로드 코드 40만 세션 분석
AI 코딩 에이전트의 성공을 가르는 것은 코딩 경력이 아니라 도메인 전문성이다. Anthropic이 2026년 6월 16일 공개한 연구는 클로드 코드 세션 약 40만 건(이용자 23.5만 명)을 분석해, 전문가 세션의 검증 성공률이 28~33%로 초보 15%의 두 배에 이른다고 밝혔다.
롱컨텍스트 vs 사실 기반 메모리: 지속형 AI 에이전트의 설계 갈림길
지속형 AI 에이전트를 만들 때 대화 기록을 통째로 컨텍스트에 넣을지, 아니면 사실만 뽑아 메모리에 저장할지가 첫 번째 갈림길이 된다. 2026년 3월 논문 Beyond the Context Window는 이 선택을 감이 아니라 숫자로 따진다. 100k 토큰 기준 약 10턴이 지나면 메
하이브리드 모델은 어떤 토큰을 더 잘 맞히나: 평균 손실로는 안 보이는 트랜스포머와의 차이
Ai2(Allen Institute for AI)가 2026년 6월 공개한 분석은 하이브리드 언어모델이 의미를 담은 내용어를 트랜스포머보다 잘 예측하지만, 앞 구절을 그대로 반복하는 토큰과 닫는 괄호에서는 그 우위가 거의 사라진다는 것을 토큰별 손실 격차로 보여준다. 7B 규모의 Olm
Unlimited OCR: KV 캐시를 일정하게 유지해 수십 페이지를 한 번에 읽는 3B OCR 모델
Unlimited OCR는 Baidu 연구진이 DeepSeek OCR 디코더의 모든 어텐션 레이어를 Reference Sliding Window Attention(R-SWA)으로 교체해, 출력이 아무리 길어져도 KV 캐시 크기를 일정하게 유지하도록 만든 3B 파라미터 OCR 모델이다.
VibeThinker-3B: 30억 파라미터로 AIME 2026에서 94.3점을 낸 웨이보의 소형 추론 모델
VibeThinker-3B는 웨이보(Sina Weibo) 연구진이 공개한 30억(3B) 파라미터 추론 모델로, AIME 2026 수학 벤치마크에서 94.3점을 기록했다. 2026년 6월 arXiv 2606.16140으로 발표된 이 기술 보고서는, 'Spectrum-to-Signal' 사
AI를 착하게 만드는 법: 모범답안 대신 '이유'를 가르쳐라
Anthropic은 2026년 5월 8일 연구에서 정렬(alignment)의 핵심은 옳은 행동의 시범이 아니라 '왜 옳은가'라는 이유를 가르치는 것이라고 밝혔다. 행동의 근거를 학습한 모델은 분포 밖 상황으로도 훨씬 잘 일반화했고, '어려운 조언(difficult advice)' 데이터
미디어 광고 집행 8단계, 어디까지 100% 자동화되나
미디어 광고 집행은 매체 선정·타겟팅·키워드셋·소재 기획·소재 제작·소재 세팅·성과 측정·성과 최적화의 8단계로 이뤄진다. 2026년 Google Performance Max와 Meta Advantage+가 이 단계 대부분을 알고리즘에 넘기면서, "어디까지 사람 없이 돌릴 수 있나"가
AI 에이전트는 왜 11번째 단계에서 무너지나: 화려한 데모 뒤의 상태추적 벽
장기 에이전트의 실패는 약한 추론 한 단계가 아니라 '진화하는 상태'를 잃거나 망가뜨리는 데서 온다는 것이 LongDS-Bench의 결론이다. 저장강대학교(Zhejiang University)·DataMind 연구진은 2026년 5월 실제 Kaggle 노트북 68개(총 2,225턴, 평
다음 세대 월드 모델은 세계를 픽셀이 아닌 '잠재 3D'로 기억한다: Mirage가 증명한 잠재 공간 메모리
Mirage는 영상 월드 모델의 공간 기억을 RGB 점구름이 아니라 확산 모델의 잠재 공간에 직접 캐싱하는 새 방법이다. Microsoft Research·저장대·애들레이드·모나시 공동 연구진이 2026년 6월 공개한 이 논문(arXiv 2606.09828)은 매 스텝 픽셀로 다시 렌더
Gated DeltaNet-2: 지우기와 쓰기를 분리해 선형 어텐션의 기억 문제를 푼 한 줄짜리 수정
Gated DeltaNet-2는 선형 어텐션의 고정 크기 메모리를 갱신할 때 "얼마나 지울지"와 "얼마나 쓸지"를 별도 게이트로 분리한 NVIDIA의 순환 어텐션 레이어이다. 2026년 5월 Ali Hatamizadeh·Yejin Choi·Jan Kautz가 공개한 이 논문은, 기존 G
'AI 과학자'가 실패하는 진짜 이유: 더 큰 모델로는 안 되는 네 가지 설계 결함
'AI 과학자(AI scientist)'는 자율적 과학 발견을 하도록 설계되지 않은 시스템이다. 2026년 5월 Harshit Bisht 등이 arXiv에 발표한 입장 논문은 오늘날의 에이전트형 AI 과학자가 단지 규모가 작아서가 아니라 구조적으로 잘못 설계돼 자율성에 도달하지 못한다고
에이전틱 마케팅의 시대: 실행이 공짜가 되면 무엇이 남나
에이전틱 마케팅은 AI 에이전트가 목표만 받으면 기획·제작·타게팅·집행·최적화를 스스로 수행하는 마케팅 방식이다. 2026년 맥킨지(McKinsey)는 에이전틱 AI가 현재 마케팅 활동의 최대 3분의 2를 수행하고, 초개인화로 매출을 10~30% 끌어올릴 수 있다고 분석했다. 이 글은
답변엔진은 무엇을 인용하는가: AEO 리버스 엔지니어링으로 찾은 7가지 규칙
AEO(답변 엔진 최적화)의 최적화 단위는 페이지 순위가 아니라 '인용 가능한 문장'이다. ASAP은 2026년 Perplexity·ChatGPT Search·Google AI Overview가 무엇을 발췌·인용하는지 역추적해, 7개의 직교·조건부 규칙(R1~R7)으로 정리했다. 이 글
재귀적 자기개선(RSI)이란? AI가 스스로 진화하는 최신 리서치
AI가 사람의 손을 거치지 않고 '스스로 더 똑똑해질 수 있는가'는 2026년 AI 연구의 가장 뜨거운 질문이다. 이를 재귀적 자기개선(RSI, Recursive Self-Improvement)이라 부르며, 샘 올트먼이 GPT-5.6과 관련해 언급하면서 다시 주목받고 있다. 4월 ICL
AI는 왜 긴 일에 약할까: '추론 ≠ 계획' 논문 딥다이브
AI에게 복잡하고 긴 작업을 맡기면, 한 단계씩은 똑똑하게 풀면서도 전체적으로는 엉뚱한 방향으로 가버리는 경험이 있을 건다. 2026년 1월 발표된 논문 'Why Reasoning Fails to Plan'은 그 이유를 정면으로 분석한다. 핵심 결론은 '추론(reasoning)과 계획(
AlphaEvolve 딥다이브: AI가 56년 수학 기록을 깬 방법
구글 딥마인드의 AlphaEvolve는 'AI가 새로운 알고리즘을 스스로 발견할 수 있는가'에 구체적인 답을 내놓은 사례다. Gemini가 코드를 제안하고 자동 평가자가 검증하는 진화 루프로, 1969년 이후 56년간 깨지지 않던 행렬 곱셈 기록을 갈아치웠다. 게다가 50개가 넘는 수학
GUIDE
10문서를 벡터 하나로 뭉개지 않는 검색: 센텐스 트랜스포머 v6.0이 들인 멀티벡터 모델 정리
센텐스 트랜스포머(Sentence Transformers)는 2026년 8월 18일 공개된 v6.0에서 콜버트(ColBERT) 계열의 지연 상호작용 검색을 다루는 네 번째 모델 유형 MultiVectorEncoder를 추가했다. 문서 전체를 벡터 한 개로 압축하는 기존 밀집 임베딩과 달
루프 엔지니어링: 프롬프트가 아니라 'AI의 루프'를 설계하는 시대
AI를 잘 쓰는 기술이 프롬프트에서 '루프 설계'로 옮겨간다. 2026년 중반 떠오른 루프 엔지니어링은 에이전트에게 일일이 지시하는 대신, 에이전트가 스스로 돌 루프를 설계하는 일이다. 안드레이 카파시는 코딩 에이전트를 이틀간 굴려 실험 700개를 돌렸고, 학습 속도를 높이는 최적화 2
AI로 유튜브·긴 영상 5분 요약하기: 핵심만 뽑는 활용법
1시간짜리 강의나 회의 영상을 처음부터 끝까지 볼 시간은 없다. AI를 쓰면 자막을 바탕으로 핵심 요약·타임스탬프·할 일까지 몇 분 만에 뽑을 수 있다. 3단계로 진행한다. ① 자막·스크립트 확보 ② AI에 요약 지시 ③ 도구로 자동화이다. 핵심은 '무엇을, 어떤 형식으로' 요약할지 함
AI로 뮤직비디오 만들기: Suno·GPT Image·Kling 4단계 가이드
코드도 카메라도 없이, AI 세 가지만 있으면 애니메이션 뮤직비디오를 만들 수 있다. 곡은 Suno, 그림은 GPT Image, 영상화는 Kling, 편집은 캡컷으로 하며 4단계로 진행한다. ① 음악 만들기 ② 캐릭터·컷 이미지 ③ Kling으로 영상화 ④ 캡컷 편집이다. 핵심은 '캐릭
직장 내 Claude Code 활용법 7가지
Claude Code는 터미널에서 자연어로 코드와 반복 업무를 맡길 수 있는 앤트로픽의 AI 코딩 에이전트로, 직장에서는 다음 7가지로 활용하면 효과적이다. ① 자연어로 코드 작성·수정 ② 낯선 코드 파악·문서화 ③ 반복 작업 자동화 ④ 버그 추적·수정 ⑤ 테스트 자동 생성 ⑥ 데이터·
AI 일잘러 ⑤ 바로가기 만들기편: 반복 명령을 더블클릭 한 번으로
대시보드를 켜거나 뉴스 리포트를 돌릴 때마다 같은 명령어를 입력하는 대신, 더블클릭 한 번으로 실행되는 '바로가기 실행 파일'을 만든다. 코드를 몰라도 AI에게 시키면 되고, 5단계로 진행한다. ① 바로가기 실행 파일이 뭔가 ② 무엇을 자동화할지 정하기 ③ AI에게 만들게 하기 ④ 더블
AI 일잘러 ④ 내 업무 대시보드 만들기: 흩어진 정보를 한 화면에
앞선 편에서 만든 자동화 결과(기사 모니터링, Slack 알림 등)를 매번 따로 돌리는 대신, 한 화면에 모아 버튼만 누르면 최신 상태로 보는 '나만의 업무 대시보드'를 만든다. 예약 실행(cron) 대신, **백엔드(데이터 수집·키 보관) + 프론트엔드(화면)** 구조의 작은 로컬 웹
AI 일잘러 ③ Slack 봇 만들기편: 마감·리포트를 자동으로 보내는 봇
Slack 봇은 마감 알림이나 일일 리포트 같은 메시지를 사람 대신 정해진 채널에 자동으로 보내 주는 작은 도우미이며, 코드를 몰라도 5단계로 만들 수 있다. ① 봇이 왜 필요한가 ② Slack 앱·토큰 발급 ③ `.env` 설정 ④ 프롬프트로 메시지 보내기 ⑤ 실전 활용이다. 1편에서
AI 일잘러 ② 기사 모니터링편: 네이버 API로 경쟁사 동향 자동 정리
네이버 검색 API와 AI를 연결하면 경쟁사 기사 동향을 자동으로 모아 분석하고 PPT 보고서까지 만들 수 있으며, 4단계로 진행한다. ① 네이버 검색 API 연결 ② `.env` 설정 ③ 모니터링 관점 입력 ④ PPT로 내보내기이다. 1편에서 익힌 'API 키는 `.env`에, 연결은
AI 일잘러 ① API 연결편: 코드 몰라도 외부 서비스 붙이기
AI에게 업무를 시키려면 먼저 외부 서비스를 연결하는 'API'를 붙여야 하며, 코드를 몰라도 다음 5단계로 가능하다. ① API 개념 이해 ② API 키 발급 ③ `.env`(환경변수) 이해 ④ `.env` 설정 ⑤ 프롬프트로 세팅이다. 핵심은 비밀 키를 안전하게 보관한 뒤, 실제 연
PROMPT
5AI에게 '검증 가능하게' 시켜라: 프롬프트 설계 원칙
AI를 잘 쓰는 핵심은 검증 가능한 형태로 시키는 것이다. 안드레이 카파시는 2026년 "전통적 컴퓨터가 코드로 명세할 수 있는 일을 자동화했다면, LLM은 검증할 수 있는 일을 자동화한다"고 말했다. 따라서 프롬프트는 산출을 검증 가능하게 만들수록 정확해진다. ASAP은 이 원칙을 프
에이전틱 코딩 프롬프트 5원칙: 한 번에 다 시키면 망한다
에이전틱 코딩의 성패는 프롬프트를 잘게 쪼개 검증 가능하게 시키는 데 달려 있다. 안드레이 카파시는 2026년 "한 번에 다 시키면 망한다"며 작은 단위로 점진적으로 시킬 때 에이전트가 일관되게 정확한 코드를 낸다고 말했다. 핵심은 다섯 가지 원칙이다. ASAP은 복붙 가능한 패턴으로
복붙하는 보고서·회의록 프롬프트 7개: 주간보고부터 액션아이템까지
직장에서 시간을 가장 많이 잡아먹는 보고서·회의 정리 7가지를, 복사해서 바로 쓰는 프롬프트로 묶었다. ChatGPT나 Claude에 붙여넣고 대괄호 `[ ]` 안만 내 메모로 바꾸면, 백지에서 끙끙대는 시간이 사라진다. ① 주간 보고서 초안 ② 회의록 3줄 요약 ③ 액션아이템 추출 ④
AI에게 일 잘 시키는 프롬프트 공식 7가지
AI에게 원하는 결과를 얻으려면 한 줄짜리 질문 대신 7가지 요소를 채운 '설계된 프롬프트'를 쓰면 된다. ① 역할 지정 ② 맥락·목표 제시 ③ 출력 형식 지정 ④ 예시 제공 ⑤ 단계로 사고 ⑥ 제약·금지 명시 ⑦ 되묻게 하기다. 이 일곱 가지는 ChatGPT·클로드·제미나이 등 어떤
복붙하는 이메일 프롬프트 7개: 거절·독촉·사과부터 영어 메일까지
직장에서 가장 자주 쓰는 이메일 상황 7가지를, 복사해서 바로 쓰는 프롬프트로 정리한다. ChatGPT나 Claude에 붙여넣고 대괄호 `[ ]` 안만 내 상황으로 바꾸면, 어색한 말투를 고민하는 시간이 사라진다. ① 정중한 거절 ② 부드러운 독촉 ③ 진심 어린 사과 ④ 영어 비즈니스
PICK
4작업별 AI 모델 고르는 법: 능력이 '울퉁불퉁'한 이유
AI 모델은 만능이 아니라 학습 데이터가 두터운 영역에서만 뾰족하게 강한다. 2026년 모델들은 수학·코딩처럼 검증 가능한 데이터가 폭증한 영역에서 인간 기준선을 넘지만, 데이터가 얇은 영역에선 그럴듯하지만 틀린다. 드워케시 파텔은 이를 'AI의 중심에 있는 데이터 블랙홀'이라 불렀다.
코딩 AI, 언제 뭘 쓰나: 자동완성·챗·에이전트 고르는 법
코딩 AI는 '가장 좋은 도구' 하나를 고르는 게 아니라 작업에 맞는 모드를 고르는 문제이다. 2026년 현재 코딩 AI는 자동완성·챗·에이전트 세 모드로 나뉘며, 작업 범위와 검증 가능성에 따라 최적 모드가 달라진다. Anthropic이 클로드 코드 약 40만 세션을 분석한 결과 전문
영상 생성 AI 추천·비교 2026: Veo 3.1·Kling 3.0·Sora 2, 무엇을 골라야 하나
영상 생성 AI를 고를 때 '무엇이 최고냐'는 사실 잘못된 질문이다. 2026년 현재 최상위는 Google Veo 3.1, Kling 3.0, OpenAI Sora 2 세 모델이고 Runway Gen-4.5가 바짝 뒤를 잇지만, 이 넷은 서로 다른 문제를 푼다. 품질은 Veo, 가성비·
이미지 생성 AI 순위·비교 2026: 취향 대신 블라인드 투표로 가려낸 TOP 모델
어떤 이미지 생성 AI가 더 좋은지는 취향 싸움이 되기 쉽다. 그 논쟁을 데이터로 끊으려는 시도가 블라인드 아레나다. 2026년 6월 기준 Artificial Analysis Text-to-Image Arena는 같은 프롬프트로 만든 두 이미지를 사람이 브랜드를 모른 채 비교 투표해 E