← 5분 AI 뉴스

오늘의 AI 브리핑 ·

Opus 5.5, GPT-6 앞질렀다

5분 브리핑

약 3분 · 10개 흐름

핵심만 먼저 읽고, 궁금한 소식은 본문으로 이어 보세요.

전체 분석 15분으로 바로 가기 ↓
  1. Claude Opus 5.5가 나왔다 — 터미널 작업 정답률이 66.4%로 GPT-6 Astra(57.9%)를 앞섰다

    Anthropic이 Claude Opus 5.5를 공개했습니다. 공식 성능표에서 Terminal-Bench 4.0 66.4%를 받았는데, 명령어 창에서 작업을 끝까지 해내게 시키는 시험입니다.

  2. GPT-6 Sol과 Luna가 ChatGPT Work·Codex에 풀렸다 — 값을 절반으로 내렸다

    OpenAI가 GPT-6 계열에서 싸고 빠른 모델 두 종을 열었습니다. Sol은 복잡한 코딩과 여러 단계를 스스로 밟는 작업용이고, Luna는 요약이나 짧은 답변처럼 양이 많고 목적이 분명한 작업용입니다.

  3. Grok Bot이 Tesla 차량 안으로 들어갔다 — 메일·일정·주문을 목소리로 시킨다

    Tesla가 차 안 Grok에 Connectors(내가 쓰던 계정을 Grok에 연결하는 통로)를 열었습니다. 받은편지함 정리, 일정 정리, 이미 가진 파일·대화·할 일을 놓고 이야기하기를 운전대에서 손을 떼지 않고 시킬 수 있습니다.

  4. Pentagon 조사: 이란 미나브 학교 오폭에 AI 표적 시스템 과의존이 있었다

    Bloomberg 보도에 따르면, Pentagon(미국 국방부)의 내부 조사 보고서는 2026년 2월 개전 첫날 이란 남부 미나브의 초등학교가 Tomahawk 미사일에 맞아 무너진 사건의 원인으로 낡은 정보와 AI 표적 시스템 과의존을 함께 지목했습니다.

  5. Alibaba가 Apsara 콘퍼런스에서 Qwen4 제품군을 예고했다 — 다음 세대는 5~10조 파라미터를 목표로 한다

    Alibaba가 9월 22일 항저우에서 연 Apsara 콘퍼런스에서 Qwen4-Max·Qwen4-Flash·Qwen4-Plus·Qwen4-27B 네 이름을 처음 꺼냈습니다. 다만 Qwen4는 아직 훈련 중이고 출시일·가격·내려받을 가중치는 없습니다.

  6. Unreal Agent가 오픈소스로 공개됐다 — 회사 측정 기준 Codex보다 39% 싼 비용

    Unreal Labs가 AI 코딩 에이전트를 감싸는 '하네스'(모델에게 도구·순서·검증을 물려 주는 겉옷)를 통째로 오픈소스로 열었습니다. 같은 모델을 써도 이 겉옷이 값을 정합니다.

  7. GPT-6 Astra가 2005년부터 안 풀리던 Enigma 전문 한 통을 풀었다

    1941년 7월 10일 독일군이 보낸 Enigma(2차 대전 독일군 암호기) 전문 MVUEH는 2005년 공개 이후 21년간 아무도 풀지 못했습니다. Carter Leffer가 GPT-6 Astra에게 미해독 전문 목록만 건네자, 모델이 스스로 표적을 고르고 해독 도구를 직접 코딩해 82글자를 풀었습니다.

  8. Deel이 사내 자동화 도구 Akai를 외부에 열었다 — 90일간 채용 없이 연간반복매출이 1억 4천만 달러 넘게 늘었다고 회사는 밝혔다

    인사·급여 대행 회사 Deel이 재무·인사·지급·규제 대응의 반복 업무를 줄이려고 사내에서 만든 도구 Akai를 현지 시각 9월 21일 제품으로 내놨습니다. 회사는 Akai로 90일 동안 사람을 새로 뽑지 않고 연간반복매출이 1억 4천만 달러 이상 늘었다고 밝혔습니다.

  9. Xiaomi MiMo-V2.6-Pro가 외부 순위표에서 오픈웨이트 1위에 올랐다

    모델을 독립적으로 재는 Artificial Analysis가 MiMo-V2.6-Pro를 종합 지능 지수 46점으로 집계해, 가중치를 내려받아 쓸 수 있는 모델(오픈웨이트) 중 1위로 올렸습니다. 어제 Grok 4.7이 받은 46과 같은 표입니다.

  10. 🆕 그 밖의 신기능·신제품

    StepFun이 새 주력 모델 Step 5 Preview를 내놨습니다. 외부 평가기관 Artificial Analysis의 종합 지능 점수는 44점으로 Kimi K3(max)와 같은데, 한 작업을 푸는 데 드는 비용은 약 2.8배 낮습니다.

주요 키워드 TOP 5: Claude Opus 5.5 · GPT-6 Sol·Luna · Tesla 속 Grok Bot · Qwen4 · 에이전트 비용 | 메인 이벤트: Opus 5.5·GPT-6 Sol·Unreal Agent가 같은 날 점수가 아니라 값을 움직였습니다.

66.4%
Claude Opus 5.5 터미널 작업 정답률
GPT-6 Astra 57.9% · Fable 5.1 55.8%
절반
GPT-6 Sol·Luna API 값 인하폭
Sol 입력 100만 토큰당 2달러·출력 10달러
39%
Unreal Agent 비용 절감(회사 측정)
같은 57.9%를 $2,350 → $1,428
21년
아무도 못 풀던 Enigma 전문
GPT-6 Astra가 82글자를 해독

Anthropic·OpenAI·Unreal Labs의 발표가 하루 안에 겹쳤는데, 셋이 공통으로 건드린 것은 순위표가 아니라 값이었습니다. Anthropic은 Claude Opus 5.5를 내놓으며 입력·출력 값을 함께 내렸고, OpenAI는 GPT-6 Sol과 Luna의 API 값을 절반으로 내렸으며, Unreal Labs는 모델을 그대로 둔 채 모델을 감싸는 도구만 바꿔 같은 점수를 더 싸게 냈다고 밝혔습니다. 같은 작업을 매일 반복해 돌리는 쪽이라면 오늘부터 확인할 곳은 순위표 맨 윗줄이 아니라 작업 한 건당 청구서입니다.

Opus 5.5 공식 성능표
그림 1. Opus 5.5 공식 성능표. 9개 항목 중 7개를 Opus 5.5가 가져갔지만, 업무 자동화와 과학 연구 두 줄은 GPT-6 Astra가 더 높습니다.
09-22 05:08
Deel이 사내에서 쓰던 자동화 도구 Akai를 제품으로 공개
09-22 11:00
Xiaomi MiMo-V2.6-Pro가 외부 순위표에서 오픈웨이트 1위로 집계
09-22 13:00
Alibaba가 Apsara 콘퍼런스에서 Qwen4 제품군 네 이름을 예고
09-22 15:07
Grok 4.7이 GDPval-AA에서 GPT-6 Astra를 앞섰다는 측정 공개
09-23 01:11
Tesla가 차 안 Grok에 Connectors를 열어 메일·일정을 연결
09-23 01:28
Anthropic이 Claude Opus 5.5 공개, 값도 함께 인하
09-23 01:30
Unreal Labs가 코딩 에이전트 하네스를 오픈소스로 공개
09-23 03:16
OpenAI가 GPT-6 Sol·Luna를 ChatGPT Work와 Codex에 배포

1. Claude Opus 5.5가 나왔다 — 터미널 작업 정답률이 66.4%로 GPT-6 Astra(57.9%)를 앞섰다

Opus 5.5가 코드로 그린 겨울 풍경
그림 2. Opus 5.5가 코드로 그린 겨울 풍경. 이미지 생성 모델을 쓰지 않고 표준 라이브러리만으로 짠 약 7,500줄짜리 파이썬 코드가 픽셀을 하나씩 찍어 만든 그림입니다.
Vals RSI Index 순위표
그림 3. Vals RSI Index 순위표. 19개 모델 중 Opus 5.5가 37.13%로 1위입니다. 2위는 Fable 5.1이고, GPT-6 Astra는 29.03%로 4위입니다.

성능표에서 올라간 자리는 한곳에 몰려 있습니다. 사람이 한 번 시키면 모델이 여러 단계를 알아서 밟아 끝내는 작업, 이른바 에이전트 쪽입니다. 과학 연구 과제를 스스로 풀게 한 항목은 Opus 5의 29.0%에서 58.7%로 두 배가 됐습니다. 다만 그 항목과 업무 자동화 항목은 여전히 GPT-6 Astra가 앞서서, 모든 줄을 가져가지는 못했습니다. 바깥에서 잰 값도 같은 날 두 곳에서 나왔습니다. 코딩 도구 Cursor는 자사 시험에서 Opus 5.5가 57.8%로 1위였고 작업 하나당 비용이 Opus 5보다 40% 낮았다고 적었습니다. 모델 평가 업체 Vals AI는 긴 호흡의 작업을 재는 RSI Index에서 19개 모델 중 1위를 줬습니다.

그 밖에: Anthropic은 글 쓰는 방식도 손봐 중요한 내용을 앞에 놓고 사용자가 정해 준 글쓰기 규칙을 따르게 했다고 밝혔는데, 개발자 Theo는 그보다 긴 줄표가 사라진 것을 먼저 알아봤습니다. 프로그래밍 언어를 만드는 Victor Taelin은 자기 작업 전부에서 Fable 5.1보다 확실히 나았다면서도, Anthropic이 자기 분야 자료로 학습하고 있어 남들보다 차이를 크게 느낄 수 있다고 덧붙였습니다.

시사점: 이미 Claude를 쓰고 있다면 따로 갈아탈 일은 없습니다. 값이 내려가고 5시간 한도가 늘었으니, 한도에 걸릴까 봐 미뤄 두었던 긴 작업을 다시 꺼내 볼 만한 때입니다.

#ClaudeOpus55 #Anthropic #AI코딩

출처 6🔥 @DanDr1s🔥 @jkeatn🔥 @ValsAI🔥 @theo🔥 @theo🔥 @VictorTaelin


2. GPT-6 Sol과 Luna가 ChatGPT Work·Codex에 풀렸다 — 값을 절반으로 내렸다

Codex 체인지로그
그림 4. Codex 체인지로그. 9월 22일자 변경 기록 카드로, 두 모델이 들어가는 곳을 Codex와 ChatGPT Work로만 적었습니다. 카드 아래에는 커뮤니티가 운영하는 계정이라고 표시돼 있습니다.
점수와 작업당 비용
그림 5. 점수와 작업당 비용. DeepSWE 성적을 그린 그래프입니다. 가로축이 작업 한 건당 비용, 세로축이 점수이고, GPT-6 줄(실선)이 이전 세대(점선)보다 왼쪽에 놓여 있습니다.

이번 발표에서 크게 달라진 쪽은 점수가 아니라 값입니다. 실제 오픈소스 버그를 고치게 시키는 시험인 DeepSWE에서 GPT-6 Sol은 가장 오래 생각하게 한 설정 기준 68.8%로, 경쟁 모델인 Claude Fable 5의 최고 기록 69.9%에 근소하게 못 미칩니다. 대신 Luna가 같은 시험에서 작업 한 건당 0.22달러로 66.6%를 냈습니다. 비슷한 점수대를 내던 기존 모델은 건당 몇 달러가 들었으니, 값을 기준으로 보면 자리가 크게 바뀐 셈입니다. 회사 설명으로는 매번 똑같이 들어가는 앞부분을 다시 계산하지 않고 재사용하는 방식도 개선돼, 재사용분 입력에는 90% 할인이 붙습니다.

인하 폭 50%는 GPT-5.6 세대에 걸려 있던 프로모션 가격과 비교한 값입니다. 회사가 내건 대표 비교는 컴퓨터를 직접 다루게 시키는 시험에서 Sol이 Claude Opus 5보다 높은 점수를 작업당 9% 비용으로 냈다는 것인데, 아직 외부에서 같은 조건으로 재현한 결과는 나오지 않았습니다.

그 밖에: Plus·Pro·Business 계정에는 사용 한도를 다시 채워 주는 '뱅크드 리셋'도 함께 들어갔습니다. 한도에 막혀 있던 사용자는 오늘 바로 체감합니다. 해커뉴스 토론에는 654점·댓글 372건이 붙었습니다.

시사점: 성능 경쟁이 값 경쟁으로 넘어가는 구간입니다. 같은 작업을 매일 많이 돌리는 쪽이라면 최고 점수 모델을 붙잡기보다, 싼 모델을 최대 설정으로 돌리는 조합을 먼저 재 보는 편이 낫습니다.

#GPT6 #가격인하 #Codex

출처 6🔥 @ChatGPT🔥 @CodexReleases🔥 @reach_vb🔥 @kimmonismus🔥 @angelbrodin💬 @reach_vb


3. Grok Bot이 Tesla 차량 안으로 들어갔다 — 메일·일정·주문을 목소리로 시킨다

Tesla 화면에서 Grok을 부르는 장면
그림 6. Tesla 화면에서 Grok을 부르는 장면. Cybertruck 차량 화면 아래에 "Hey Grok" 자막이 떠 있습니다. 기존 주행 정보와 미디어 조작판은 그대로고, 호출만 음성으로 얹힌 형태입니다.

Tesla가 내놓은 것은 새 모델이 아니라 모델이 놓인 자리입니다. 그동안 차 안 AI는 길 안내나 음악처럼 차가 원래 하던 일을 말로 시키는 정도였는데, 이번에는 내 메일함과 일정표가 차에 직접 연결됩니다. 개인 비서 역할을 하는 AI가 앱이 아니라 기기 안에 상주하는 형태로 시판 차량에 들어간 셈입니다. 다만 어떤 메일·일정 서비스를 붙일 수 있는지, 배포 일정과 필요한 소프트웨어 버전이 무엇인지는 Tesla가 아직 밝히지 않았습니다.

Grok 4.7과 GPT-6 Astra의 점수 비교
그림 7. Grok 4.7과 GPT-6 Astra의 점수 비교. 같은 측정 실행에서 Grok 4.7이 두 시험 모두 앞섰고, 위쪽 GDPval-AA가 1,695 대 1,542입니다. 양쪽 다 최고 성능 설정으로 잰 값입니다.

그 밖에: Artificial Analysis는 전문가가 실제로 만드는 산출물을 사람이 채점하는 시험 GDPval-AA에서 Grok 4.7이 1,695점으로 GPT-6 Astra(1,542점)를 앞섰다고 냈습니다. Grok 4.7 Fast는 Grok Build와 Cursor에서 쓸 수 있게 됐고, Grok Build도 1.0.41로 올라갔습니다.

시사점: 차는 사람이 매일 한참 갇혀 있으면서 손은 비는 드문 공간입니다. 그 자리에 내 계정이 연결된 비서가 들어앉았다는 것은, 에이전트 경쟁의 승부처가 점수표에서 어디에 미리 들어가 있느냐로 옮겨가고 있다는 신호입니다.

#Grok #Tesla #AI에이전트

출처 6🔥 @Tesla🔥 @SawyerMerritt🔥 @Polymarket🚀 @XFreeze🔥 @XFreeze🔥 @cb_doge


4. Pentagon 조사: 이란 미나브 학교 오폭에 AI 표적 시스템 과의존이 있었다

Maven Smart System은 Palantir의 소프트웨어를 쓰는 국방부의 표적 선정 시스템으로, 정찰 자료를 모아 공격 후보 목록을 만들어 줍니다. 미나브 건물은 다른 후보들과 함께 이 시스템에 들어갔고 개전 첫날 표적으로 추천돼 나왔습니다. 몇 시간 걸리던 표적 목록 작업이 몇 분으로 줄었고, 개전 24시간 동안 1,000곳 넘게 타격했습니다. 보고서는 일부 인원이 Maven이 낡은 기록이나 서로 어긋나는 정보를 알아서 표시해 줄 것으로 기대했다고 적으면서, 왜 그렇게 기대했는지는 분명하지 않다고 덧붙였습니다.

그 밖에: Palantir은 입력 데이터나 정보의 결함을 찾아낼 책임이 자사에 없으며 소프트웨어 잘못이라는 증거도 없다고 밝혔고, 유엔 조사단은 앞서 이 공격을 민간인을 향한 무차별 공격으로 규정했습니다. 해커뉴스에서 가장 많이 추천받은 댓글은 AI가 희생양이라며, 백악관이 표적 1,000개를 요구했고 검증 팀은 해체돼 상의조차 받지 못했으니 목록을 뽑은 도구가 AI든 단순 데이터베이스 조회든 결과는 같았으리라고 반박했습니다.

시사점: AI가 이 사슬에서 한 일은 판단이 아니라 속도였고, 목록이 몇 분 만에 나오는 동안 그 목록을 의심하던 사람들은 사라졌습니다. 업무에 AI를 넣을 때 따져야 할 것은 도구의 정확도만이 아니라, 그 도구가 빨라진 만큼 어떤 확인 절차가 조용히 없어졌는가입니다.

#AI안전 #군사AI #자동화

출처 2🔥 Bloomberg 조사 보도💬 해커뉴스 토론


5. Alibaba가 Apsara 콘퍼런스에서 Qwen4 제품군을 예고했다 — 다음 세대는 5~10조 파라미터를 목표로 한다

Qwen4 규모 계획을 정리한 보도 화면
그림 8. Qwen4 규모 계획을 정리한 보도 화면. 훈련 중인 Qwen4와 5~10조를 목표로 하는 Qwen4.5·Qwen5를 문단으로 나눠 구분하고, 2.4조 대비 2~4배라는 계산까지 한 화면에 적어 놓았습니다.

발표 직후 온라인에서는 "Qwen4가 10조"라는 식으로 숫자가 옮겨 붙었는데, 그 규모가 걸린 쪽은 Qwen4가 아니라 그 뒤 세대입니다. @ChrisGPT는 이 혼동을 짚으며 오늘 나온 것은 이름과 계획뿐이라고 정리했습니다. 그래서 오늘 확인할 수 있는 사실은 하나로 줄어듭니다. 중국 최대 클라우드 사업자가 앞으로 만들 모델의 크기를 숫자로 먼저 말해 두었다는 것입니다. 개발자 쪽 관심은 네 이름 가운데 가장 작은 27B에 쏠렸습니다. 유료 구독을 해지해도 될 만큼 쓸 만한 모델을 가중치째 달라는 요청이 공개 계정에서 이어졌습니다.

그 밖에: Alibaba는 같은 자리에서 한 클러스터에 최대 50만 장을 묶는 Zhenwu V900 칩과 2032년까지 전 세계 데이터센터 용량 20GW 초과 목표를 함께 내놨다고 밝혔습니다. 모델이 스스로 약점을 찾아 개선하고 있다는 설명도 나왔지만 이는 발표자 주장입니다.

시사점: 오늘 받을 수 있는 것은 없습니다. 지켜볼 지점은 오픈웨이트로 예고된 Qwen4-27B의 공개 시점으로, 개인 PC에서 돌리는 모델의 기준선이 여기서 다시 그어집니다.

#Qwen4 #Alibaba #오픈웨이트

출처 6🔥 @AiBattle_🔥 @ChrisGPT🔥 @choblin29🔥 @mark_k🔁 @Parul_Gautam7🔥 @superalesha


6. Unreal Agent가 오픈소스로 공개됐다 — 회사 측정 기준 Codex보다 39% 싼 비용

코딩 에이전트 품질-비용 지도
그림 9. 코딩 에이전트 품질-비용 지도. 가로축이 작업당 비용, 세로축이 코딩 점수인데 Unreal Agent 별표는 Codex·GPT-6 Astra와 같은 높이에 절반쯤 왼쪽, Claude Code·Fable 5.1은 오른쪽 끝에 찍혀 있습니다.

값이 내려간 이유는 도구를 쓰는 방식에 있습니다. 보통 에이전트는 명령 하나를 내리면 끝날 때까지 기다렸다가 다음 생각을 하는데, Unreal Agent는 그 일을 '진행 중'으로 적어 두고 다른 작업을 이어 가다가 결과가 도착하면 받아 씁니다. 기다리고 확인하는 데 쓰이던 토큰이 줄어드는 만큼 청구서도 줄어듭니다.

그 밖에: 회사는 코드 질의응답·버그 수정 등 다른 시험에서도 Codex 대비 최대 40% 싸다고 밝혔습니다. 위 Terminal-Bench 수치를 포함해 전부 회사 자체 측정이고, 외부 기관의 독립 검증은 아직 없습니다.

시사점: 에이전트 비용을 낮추는 손잡이가 모델 가격 말고 하나 더 생겼습니다. 다만 위 수치는 회사가 직접 잰 것이라, 모델을 그대로 두고 겉옷만 바꿔도 청구서가 달라진다는 이야기는 외부 검증 전까지는 참고 정도로 보는 게 안전합니다.

#오픈소스 #코딩에이전트 #비용효율

출처 2🔖 @unreallabsai🔥 @ChShersh


7. GPT-6 Astra가 2005년부터 안 풀리던 Enigma 전문 한 통을 풀었다

검증한 사람은 Enigma 연구자 Frode Weierud입니다. 그가 운영하는 Crypto Cellar Research에 미해독 전문 목록이 공개돼 있는데, Leffer의 지시는 "이 중 풀 수 있는 게 있는지 보라"가 전부였습니다. 모델은 목록을 훑어 172번 MVUEH를 가장 유망한 표적으로 골랐고, 같은 날 보낸 173번 전문과 내용이 이어질 것이라 판단해 거기 반복해서 나오는 지명 'ROSENOW'를 실마리로 잡았습니다. 그다음 Python과 C++로 Enigma 시뮬레이터와 Bombe(2차 대전 때 실제로 쓰인 해독 기계)를 짜서 돌렸습니다. 답은 맞았습니다. 회전자 배열이 그날의 다른 전문(512)과 아예 다른 253이었고, 풀린 평문은 173번과 거의 같았습니다.

이 전문이 얼마나 완강했는지는 2017년 기록이 말해 줍니다. 그해 6월 Alex Shovkoplyas가 같은 날짜의 173번을 풀어 그날 쓰인 것과 다른 설정을 하나 찾아냈는데, 그 설정으로도 MVUEH는 열리지 않았습니다. 172번만 따로 회전자 배열까지 다른 설정으로 보내졌기 때문입니다. 두 전문의 내용이 거의 같은데 길이가 12글자 차이 나는 이유도 이번에 밝혀졌습니다. 보내는 쪽이 독일어 'Bitte'를 'Btte'로 잘못 쳐 넣었고, 173번에는 발신자 서명 'Waschbusch'가 한 번 더 들어 있었습니다.

그 밖에: 모델은 독일 연방기록보관소(Bundesarchiv)에 있는 관련 문서 번호까지 찾아냈습니다. Weierud는 자신이 몇 주를 들여 조사한 자료라고 적었습니다. 해커뉴스에서 456점·댓글 332개를 받았습니다.

시사점: 사람이 건넨 건 미해결 문제 목록 한 장이었고, 표적 선정부터 도구 제작과 검증까지를 모델이 이틀 만에 해냈습니다. '모델이 도구를 만들어 쓴다'는 말이 무슨 뜻인지 설명 없이 보여 준 사례입니다.

#Enigma #암호해독 #GPT6Astra

출처 2🔥 Crypto Cellar Research🔥 Hacker News


8. Deel이 사내 자동화 도구 Akai를 외부에 열었다 — 90일간 채용 없이 연간반복매출이 1억 4천만 달러 넘게 늘었다고 회사는 밝혔다

Akai 출시 영상
그림 10. Akai 출시 영상. 조명과 붐마이크를 세운 촬영장에서 찍은 출시 영상의 첫 화면입니다. 수치를 보여 주는 자료 화면은 없습니다.

쓰는 방법은 한 번 시연하는 것으로 끝납니다. 담당자가 평소 하던 일을 화면 녹화로 보여 주면 Akai가 화면과 설명하는 말, 그리고 그 클릭 뒤에서 오가는 서버 요청까지 함께 기록합니다. 그다음 사람이 규칙과 승인 절차를 정해 두면 에이전트가 같은 일을 스스로 반복합니다. 제품 소개에 따르면 정식 연결 통로가 있으면 그쪽을 먼저 쓰고, 없으면 연결기를 직접 만들며, 화면을 조작하는 방식은 마지막에 씁니다.

그 밖에: 소개 페이지는 지금까지 누적 100만 시간을 아꼈고 매달 25만 건을 자동으로 처리한다고 적고 있습니다. 밖에서는 화면을 흉내 내는 대신 브라우저가 주고받는 요청을 읽는 접근은 처음 본다는 반응도 나왔습니다. 다만 이 숫자는 전부 Deel 자체 집계이고, 바깥에서 검증한 자료는 없습니다.

시사점: 에이전트가 회사 손익을 얼마나 바꿨는지 숫자로 말한 사례는 아직 드뭅니다. 다만 파는 쪽이 내놓은 수치이니, 도입을 볼 때는 매출 총액보다 우리 팀이 매달 반복하는 일에 이 방식이 맞는지를 먼저 확인하는 편이 낫습니다.

#에이전트 #업무자동화 #Deel

출처 3💬 @Bouazizalex🔥 @EXM7777🔥 @wizaj


9. Xiaomi MiMo-V2.6-Pro가 외부 순위표에서 오픈웨이트 1위에 올랐다

Design Arena의 Text-to-HTML 순위표
그림 11. Design Arena의 Text-to-HTML 순위표. 막대 위 숫자가 Elo입니다. MiMo-V2.6-Pro 1338 바로 오른쪽이 Claude Opus 5 1333이고, 맨 왼쪽 1위는 Kimi K3 1382입니다.
Hugging Face에 올라온 MiMo-V2.6-Pro-RL
그림 12. Hugging Face에 올라온 MiMo-V2.6-Pro-RL. 태그에 Text Generation·video-understanding이 적혀 있고, Files 탭에서 가중치를 바로 내려받습니다.

순위를 매긴 곳은 바깥이지만, 숫자를 전한 주체는 갈립니다. Artificial Analysis는 지수를 46으로 적었고, Xiaomi 공식 계정은 같은 순위를 46.32로 소개했습니다. Design Arena는 시험 점수가 아니라 사람이 두 결과물을 놓고 고른 결과인데, 그 표에서도 유료 최상위 모델들 사이에 자리를 잡았습니다.

그 밖에: 개발자 Daanish Khazi는 이 성적이 강화학습 과제 약 4만 5천 개와 중국 기준 260만 달러어치 계산 자원으로 나왔다고 정리했습니다.

시사점: 무료로 내려받는 모델과 돈을 내고 쓰는 최상위 모델의 거리가 순위표에서 몇 점 차이로 좁아졌습니다. 다만 Design Arena는 화면 만들기 한 부문이고 지수도 기관마다 다르니, 한 표의 순위를 전반적인 실력으로 옮겨 읽지는 마세요.

#오픈웨이트 #벤치마크 #Xiaomi

출처 4🔥 @XiaomiTech_💬 @DesignArena🔥 @itsPaulAi🔥 @bertgodel


10. 🆕 그 밖의 신기능·신제품

StepFun의 44점은 Artificial Analysis가 잰 외부 측정값입니다. 다만 에이전트 평가(모델이 도구를 써서 일을 스스로 끝내는지 보는 시험)에서는 같은 급 모델들에 뒤처진다고 적었습니다. Snorkel AI는 AI 학습용 데이터를 만들어 파는 회사로, 소프트웨어 판매에서 데이터 납품으로 방향을 바꾼 뒤 연환산 매출 3억 7,500만 달러를 넘겼다고 밝혔습니다.

그 밖에: Alibaba Cloud가 DHH가 발표한 Omacom Foundation에 창립 후원사로 300만 달러를 넣고, 새로 발표된 Qwen Book에 리눅스 환경 Omarchy를 올리기로 했습니다. NVIDIA는 AI 데이터센터용 전력·냉각 장비 인증 제도 'DSX Ready'를 열고 Tesla Megapack을 배터리 저장장치 첫 통과 목록에 넣었습니다.

시사점: 같은 점수를 더 싸게 내는 모델과, 큰 모델을 작은 기기에 밀어 넣는 압축이 나란히 나왔습니다. 모델을 고를 때 점수만이 아니라 한 작업에 드는 비용을 함께 보게 됩니다.

#StepFun #모델압축 #AI데이터

출처 5🔥 @ArtificialAnlys💬 @Tim_Dettmers💬 @ajratner🔥 @dhh🔥 @SawyerMerritt


오늘의 감정·온도

전환성장주의과열
차분 ←
전환 — 경쟁의 기준이 순위표 맨 윗줄에서 작업 한 건당 비용으로 옮겨간 하루였습니다.
성장 — 내려받아 쓰는 모델이 유료 최상위 모델과 몇 점 차이까지 붙었습니다.
주의 — 오늘 인용한 비용 절감 수치의 상당수가 발표한 회사가 스스로 잰 값입니다.
과열 — Claude Opus 5.5·Grok 4.7·MiMo-V2.6-Pro의 순위표 성적이 하루에 몰리며 "누가 1등이냐" 논쟁이 다시 커졌습니다.

오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지

1. 회사 클라우드 계정이 있다면 새 계약 없이 Opus 5.5를 고를 수 있다

Claude Opus 5.5는 Anthropic 앱·API 말고 Amazon Web Services·Google Cloud·Microsoft Azure에서도 바로 쓸 수 있습니다. 회사 계정이 그중 하나에 이미 있다면 모델 목록에서 바꾸기만 하면 됩니다.

2. '뱅크드 리셋'은 급한 날을 위해 아껴 둔다

한도가 풀리는 기회를 한 번 모아 뒀다가 원하는 때 쓰는 기능이 Claude와 ChatGPT 양쪽에 같은 날 들어왔습니다. 평소에 쓰지 말고 마감이 걸린 날 꺼내는 쪽이 이득입니다.

3. 같은 문서를 반복해 묻는다면 캐시 읽기 값부터 본다

한 번 넣은 자료를 다시 넣을 때 매겨지는 값이 Opus 5.5에서 100만 토큰당 $0.50에서 $0.20으로 내려갔습니다. 긴 자료를 앞에 붙여 두고 질문만 바꿔 가며 묻는 방식이 이전보다 훨씬 싸졌습니다.

4. 최고 점수 모델 대신 '싼 모델 최대 설정'을 먼저 재 본다

GPT-6 Luna는 DeepSWE 시험에서 작업 한 건당 0.22달러로 66.6%를 냈습니다. 비슷한 점수대를 내던 모델이 건당 몇 달러였으니, 같은 작업을 많이 돌리는 쪽은 이 조합부터 비교해 볼 만합니다.

5. 순위표 하나로 모델을 고르지 않는다 — (@kunchenguid)

Grok 4.7을 하루 종일 써 본 개발자는 공개 벤치마크 하나만 인용한 혹평도, 3D 게임을 만들게 시킨 비교도 실제 업무와는 무관하다고 적었습니다. 자기 업무와 닮은 과제 서너 개를 직접 돌려 보는 것이 여전히 가장 빠른 판단법입니다.

6. 내려받아 쓸 모델이 필요하면 MiMo-V2.6-Pro를 먼저 본다

가중치가 MIT 라이선스로 Hugging Face에 올라와 있어 회사 업무에도 쓸 수 있습니다. 모델 페이지의 Files 탭에서 파일을 바로 받을 수 있습니다.


📦 확인 방식

이 리포트의 수치는 각 회사의 공식 발표 글과 Artificial Analysis·Vals AI·Design Arena 같은 외부 측정 기관이 공개한 표에서 가져왔습니다. Unreal Agent의 39%와 Deel의 매출·인력 수치는 발표한 회사가 스스로 잰 값으로, 외부 독립 검증 전입니다.

🏷 라벨 가이드 — 🔥 화제 · 🔖 저장 많음 · 🔁 확산형 · 💬 토론형 · 🚀 작은 계정에서 퍼진 글

전체 아카이브 보기 (지난 호 전체) →