← 5분 AI 뉴스

오늘의 AI 브리핑 ·

ChatGPT가 내 말투로 메일을 쓴다

5분 브리핑

약 3분 · 11개 흐름

핵심만 먼저 읽고, 궁금한 소식은 본문으로 이어 보세요.

전체 분석 16분으로 바로 가기 ↓
  1. ChatGPT Work가 Gmail·Slack·Google Drive를 읽어 사용자의 글쓰기 스타일을 그대로 따라 쓴다

    OpenAI 공식 계정이 현지 시각 9월 7일 ChatGPT Work의 글쓰기 스타일 학습 기능을 알렸습니다. 즐겨 쓰는 표현, 특유의 맺음말, 대문자 쓰는 버릇까지 잡아낸다고 적었습니다.

  2. Plus·Business Standard에 5시간 한도가 돌아왔다는 보고가 나왔고, Codex 사용량이 빨리 닳는다는 제보가 겹쳤다

    Hacker News에 "OpenAI brings back 5 hour limit for plus and business standard users"라는 이용자 게시물이 올라와 115점·댓글 125개를 받았습니다.

  3. 젠슨 황의 GPT-6 Astra 학습 규모 발언이 하루 2,070만 달러 계산으로 번졌다

    젠슨 황이 현지시간 9월 6일 X에 GPT-6 Astra를 NVIDIA Grace Blackwell NVLink72 10만 대 이상으로 학습했다고 적고, "AGI가 도착했다"는 문장과 함께 OpenAI 팀에 축하를 보냈습니다.

  4. Artificial Analysis 지능 지수 v4.3이 Terminal-Bench를 4.0으로 올리고 AutomationBench-AA를 넣었다

    Artificial Analysis가 LLM 순위표인 지능 지수를 v4.3으로 올렸습니다. 코딩 평가 Terminal-Bench가 2.1에서 4.0으로 바뀌었고, 에이전트 워크플로 자동화 평가 AutomationBench-AA가 새로 들어갔습니다.

  5. MiniCPM5-2B가 Apache 2.0으로 공개돼 4B 미만 오픈웨이트 1위에 올랐고, RTX 3060 한 장에서 초당 163토큰을 냈다

    OpenBMB가 2B급 밀집 모델 MiniCPM5-2B를 Apache 2.0으로 공개했습니다. 총 파라미터 2.5B, 문맥 131k, 34개 벤치마크 평균 53.9라고 밝혔습니다.

  6. MazeBench에서 GPT-6 Astra가 60시간을 쓰고 14%에 그쳤다

    한 개인 연구자 @patience_cave가 만든 비공식 평가 MazeBench에서, GPT-6 Astra가 이 3D 오픈월드 공간 추론 과제에 60시간 넘게 매달린 끝에 최종 점수 14%를 받았다고 제작자가 공개했습니다.

  7. ByteDance가 Seedance를 바탕으로 실시간 월드 모델을 만들고 10월 공개를 목표로 한다고 Bloomberg가 보도했다

    Bloomberg 보도에 따르면 ByteDance는 사용자의 목소리와 동작에 반응하는 실시간 월드 모델을 준비하고 있으며, 이르면 10월 공개를 목표로 합니다. 기반은 자사 영상 생성 모델 Seedance입니다.

  8. AMD가 MI355X의 vLLM 에이전트 처리 성능을 19일도 안 돼 달러당 11배로 올렸다

    SemiAnalysis는 MiniMax M3 에이전트 워크로드에서 MI355X의 vLLM 달러당 성능이 19일이 안 되는 기간에 11배가 됐다고 알렸습니다. 개선은 전부 소프트웨어 쪽이고, 주된 항목은 긴 문맥을 처리하는 어텐션 연산 최적화입니다.

  9. Bottleneck Labs가 AI 7개에 각각 300달러를 주고 72시간 사업을 시켰더니 매출이 0달러였다

    Bottleneck Labs가 최근 공개한 실험 보고입니다. 7개 모델에 각각 300달러(합계 2,100달러)와 잠금 해제된 Mac mini, 브라우저 도구, Stripe 계정, 메일 주소를 주고 "지금부터 최대한 많은 돈을 벌어라"만 지시했습니다.

  10. Outrageously Small Neural Networks — Claude Opus 5를 공저자로 올린 논문이 CPU 코어 하나에서 기초 추론을 냈다

    Gregory Diamos가 9월 7일 Hugging Face에 올린 프리프린트는 Intel Xeon Silver 4514Y의 코어 딱 하나에 고정해 언어모델을 학습시켰습니다. 활성 파라미터 3.65M짜리 블록 라우팅 MoE를 259M 토큰, 약 9시간, 초당 6,616토큰으로 돌렸습니다.

  11. 🆕 그 밖의 신기능·신제품

    Tencent Hy4 preview 업그레이드 — 복잡한 작업에서 지나치게 생각하고 재검증하던 문제를 손봐, 같은 품질에 턴 수와 입출력 토큰이 줄었습니다(770B·활성 49B·1M 문맥). NVIDIA Sol-H3 — MiniMax-H3 영상 생성을 NVIDIA B300 8장으로 돌려, 스테레오 오디오가 붙은 1344×768 5초 영상을 1.653초에 만듭니다.

주요 키워드 TOP 5: ChatGPT Work 글쓰기 스타일 · GPT-6 Astra 학습 규모 · 지능 지수 v4.3 · MiniCPM5-2B · 자율 에이전트 72시간 실험 | 메인 이벤트: OpenAI가 ChatGPT Work에 사용자의 메일과 메시지를 읽어 그 사람의 문체로 초안을 쓰는 기능을 붙였습니다.

2,070만 달러
GPT-6 Astra 학습 하루 비용 추산
GPU 10만 장 · 시간당 86만 2,000달러
14%
MazeBench 1위 점수
GPT-6 Astra가 60시간 넘게 매달린 결과
11배
MI355X의 달러당 에이전트 처리 성능
19일이 안 되는 기간, 소프트웨어 개선만으로
0달러
AI 7개가 72시간 동안 올린 매출
각 300달러씩 쥐여 주고 시작

오늘 가장 큰 변화는 업무용 AI가 문체를 배우는 방식이 바뀐 것입니다. 지금까지는 사용자가 본보기 글을 직접 붙여 넣어 말투를 지정했는데, ChatGPT Work는 연결한 Gmail·Slack·Google Drive에 이미 쌓여 있는 메일과 메시지, 파일을 그대로 재료로 씁니다. 그래서 사용자가 할 일이 문체를 설명하는 것에서 어떤 앱을 열어 줄지 고르는 것으로 옮겨 갑니다. 확인할 것은 연결이 메시지·문서·이메일 세 칸으로 나뉘어 각각 따로 켜진다는 점, 그리고 아직 소규모 사용자를 대상으로 한 테스트라는 점입니다.

09-07 15:17
젠슨 황이 GPT-6 Astra를 NVLink72 10만 대 이상으로 학습했다고 적은 글이 금융 계정들로 퍼졌습니다.
09-07 17:34
Codex 이용자 Stefano가 사용량이 비정상적으로 빨리 닳는다는 제보와 앱 버전을 모으기 시작했습니다.
09-07 23:07
MazeBench 제작자가 GPT-6 Astra 14%가 1위인 순위표를 공개했습니다.
09-07 23:23
ByteDance가 실시간 월드 모델을 10월 공개 목표로 준비한다는 Bloomberg 보도가 돌기 시작했습니다.
09-07 23:36
OpenBMB가 2B급 모델 MiniCPM5-2B를 Apache 2.0으로 공개했습니다.
09-08 02:01
SemiAnalysis가 MI355X의 vLLM 달러당 성능이 19일 만에 11배가 됐다고 알렸습니다.
09-08 02:44
OpenAI 공식 계정이 ChatGPT Work의 글쓰기 스타일 학습 기능을 공개했습니다.
09-08 03:14
Artificial Analysis가 지능 지수를 v4.3으로 올려 코딩·에이전트 평가를 손봤습니다.

1. ChatGPT Work가 Gmail·Slack·Google Drive를 읽어 사용자의 글쓰기 스타일을 그대로 따라 쓴다

ChatGPT Work 글쓰기 스타일 설정 화면
그림 1. ChatGPT Work 글쓰기 스타일 설정 화면. Messaging·Documents·Email 세 칸으로 나뉘고 앞의 둘만 Connected, Email은 아직 Set up 버튼 상태입니다.

공개된 화면을 보면 연결은 항목별로 따로 켭니다. 메시지·문서·이메일 세 칸이 있고 각각 연결한 앱에서만 예시를 가져오며, 안내 문구는 연결한 앱의 예시를 참고해 사용자의 목소리로 쓴다고 설명합니다. 오른쪽에 뜬 결과물은 팀에 보낼 Slack 메시지 초안인데, 소문자로 시작하는 인사말과 짧은 문장이 눈에 띕니다. 그 초안 본문은 학습 재료로 연결한 앱과 함께 그동안의 ChatGPT 대화 기록도 든다고 적었고, 기능을 만나는 지점으로는 처음 설정 과정, 개인화 설정, 글을 쓰는 화면 셋을 들었습니다.

문체를 지정하는 기능 자체는 새롭지 않습니다. 다만 지금까지는 사용자가 본보기 글을 직접 붙여 넣는 방식이 많았고, 이번에는 업무 계정에 이미 쌓여 있는 메일과 메시지가 그대로 재료가 됩니다. 따로 준비할 것이 없는 대신 도구가 읽어 가는 범위는 넓어집니다. @kimmonismus는 이 조합이 에이전트가 사람 말투로 쓴 메일을 다른 에이전트가 읽고 다시 사람 말투로 답하는 상황을 만든다고 짚었습니다.

그 밖에: BleepingComputer는 같은 날 이 기능이 아직 소규모 사용자를 대상으로 한 테스트라고 전했고, 연결 목록의 문서 항목에는 Google Drive와 함께 Notion도 있다고 적었습니다.

시사점: 사내 문서·메일 자동화의 기준이 무엇을 쓰느냐에서 누구처럼 쓰느냐로 옮겨갑니다. 연결 권한을 주기 전에 어떤 앱까지 열지, 받는 사람이 사람이 직접 쓴 글로 읽을 여지는 없는지 팀 안에서 먼저 정해 두는 편이 낫습니다.

#ChatGPTWork #글쓰기스타일 #커넥터

출처 3🔥 @ChatGPT💬 @kimmonismus🔥 @victornunez


2. Plus·Business Standard에 5시간 한도가 돌아왔다는 보고가 나왔고, Codex 사용량이 빨리 닳는다는 제보가 겹쳤다

Codex 사용량 패널
그림 2. Codex 사용량 패널. 위쪽 5시간 한도는 100% 남아 오후 3시에 초기화되는데, 붉게 표시된 아래 주간 한도는 0% 남음이고 초기화가 9월 11일입니다.

한도가 5시간과 주간 두 겹으로 걸려 있어 둘 중 하나만 바닥나도 그 자리에서 작업을 멈춰야 하고, 위 화면은 주간 쪽이 먼저 바닥난 경우입니다. 다만 5시간 한도가 돌아왔다는 것은 이용자들의 관측이고 OpenAI 공지로 확인된 내용은 아닙니다. 앱 버전을 모으는 요청도 회사 조치가 아니라 이용자들끼리 원인을 좁혀 보려는 시도이며, 답글에 어떤 버전이 몰리는지가 지금 나와 있는 유일한 단서입니다.

OpenAI 쪽에서 확인되는 것은 Tibo Sottiaux가 알린 개선 발표뿐인데, ChatGPT 계정으로 로그인해 Astra를 많이 쓰는 구간에서 구독 차감이 최대 3~4배 줄도록 고쳤다는 내용이 더 빨리 마른다는 보고와 이틀 사이에 나란히 올라왔습니다.

그 밖에: MarMar Labs는 보안 점검을 한 번 돌리자 남아 있던 주간 한도 70%가 0이 됐고 적립해 둔 초기화까지 썼다고 적었습니다. Fast 모드를 켜지 않았고 점검에 한 시간이 걸렸다고 덧붙였습니다.

시사점: 한도가 5시간·주간 두 겹으로 걸리므로 긴 작업을 걸기 전에 두 값을 함께 확인하세요. 사용량이 유난히 빨리 닳는다면 ChatGPT 앱 버전을 먼저 확인해 두는 편이 좋습니다. 지금 원인 좁히기가 그 버전 정보로 이뤄지고 있습니다.

#Codex한도 #5시간한도 #OpenAI

출처 6💬 @StefanoGPT💬 @bridgemindai💬 @DanDr1s💬 @MarMarLabs💬 @Mr_Salio💬 @dummerspast39


3. 젠슨 황의 GPT-6 Astra 학습 규모 발언이 하루 2,070만 달러 계산으로 번졌다

NVIDIA 로고 앞의 젠슨 황
그림 3. NVIDIA 로고 앞의 젠슨 황. 발언을 옮긴 게시물에 붙은 자료 사진입니다. 게시물 화면도 학습 설비 사진도 아니고, 녹색 로고 앞에서 두 손을 펴 보이는 인물 사진 한 장입니다.

젠슨 황의 문장은 NVLink72를 10만 대 넘게 썼다는 뜻으로도 읽힙니다. NVL72 한 대가 GPU 72장을 묶은 랙이라 그대로 세면 수백만 장이 되는데, OpenAI는 공개 당시 텍사스 Stargate 단지에서 GPU 10만 장이 넘는 규모로 사전학습한 첫 모델이라고 설명했습니다. Bustamante도 GPU 10만 장을 뜻한다고 가정하고 거기에 GPU당 시간 8.62달러라는 공개 목록가를 곱했습니다.

사전학습이 석 달 내내 돌았다고 가정하면 18억 6,000만 달러가 되는데, 본인도 대량 구매가는 이보다 훨씬 낮고 사후학습 비용은 빠져 있다며 실제 청구서가 아니라 규모 감각이라고 적었습니다. 앞선 모델들이 공개한 학습 규모를 옆에 놓으면 그 감각이 잡힙니다. DeepSeek-V3의 사전학습은 H800 2,048장이었습니다. Llama 3.1 405B는 H100을 최대 16,384장 썼습니다.

이 숫자가 빠르게 퍼진 이유도 여기에 있습니다. 모델이 얼마나 똑똑한지를 겨루던 이야기가 전기와 자본의 크기를 세는 이야기로 옮겨 갔고, 다음에 켜진다는 40만 장은 그 네 배입니다.

그 밖에: Gary Marcus는 2023년 11월 이후 AGI 달성 선언이 나온 사례를 목록으로 정리해 이번 발언도 성급한 선언으로 분류했고, 젠슨 황은 지난 2월 Lex Fridman 팟캐스트 발언까지 포함해 그 목록에 두 번 올랐습니다.

시사점: "AGI가 도착했다"는 확인할 수 없는 평가이지만, 10만 장과 40만 장은 확인할 수 있는 조달 계획입니다. 모델 순위표보다 이 숫자가 내년 전력·설비 계획을 먼저 바꿉니다.

#NVIDIA #GPT6Astra #AI인프라

출처 6🔥 @BullTheoryio🔥 @StockSavvyShay🔥 @nicbstme💬 @jxnlco💬 @lucian__03💬 @GaryMarcus


4. Artificial Analysis 지능 지수 v4.3이 Terminal-Bench를 4.0으로 올리고 AutomationBench-AA를 넣었다

v4.3 지능 지수 순위
그림 4. v4.3 지능 지수 순위. 상단 설명에 평가 10종이 나열돼 있고, 왼쪽 막대 넷은 Claude Fable 5.1 53 · GPT-6 Astra 53 · Claude Opus 5 51 · Claude Fable 5 50입니다.

항목이 바뀌자 점수대도 함께 내려갔습니다. 직전 v4.2 표에서 최대 설정 기준 57점이던 Claude Fable 5.1이 이번 표에서는 53점입니다. 55점이던 GPT-6 Astra도 53점으로 찍혀 둘이 동률 1위가 됐습니다. Lumina는 또 한 번의 갱신 끝에 두 모델이 53점에서 만났다고 정리했습니다.

방법론 문서를 보면 이번 지수는 에이전트 30%, 코딩 20%로 절반이 실제 작업 수행 능력에 걸려 있습니다. Terminal-Bench 판올림과 에이전트 평가 교체는 둘 다 그 절반 안에서 일어난 손질입니다. 나머지 절반은 일반 지식 30%, 과학 추론 20%로 그대로 뒀습니다.

그 밖에: Lumina는 방법론을 계속 손대면 손대지 않은 모델의 자리까지 흔들린다며, Astra만 다시 재는 편이 나았다고 적었습니다. @R2Cdev_는 그래도 Astra가 Fable보다 낮게 나온다며 지수가 앞뒤가 맞지 않는다고 했습니다.

시사점: 점수가 내려간 것은 모델이 나빠져서가 아니라 채점표가 바뀌었기 때문입니다. 같은 모델의 57점과 53점을 한 축에 올려 성능 추세로 읽으면 안 됩니다.

#벤치마크 #AI평가 #에이전트

출처 4🔥 @ArtificialAnlys🔥 @LuminaBench💬 @LuminaBench💬 @R2Cdev_


5. MiniCPM5-2B가 Apache 2.0으로 공개돼 4B 미만 오픈웨이트 1위에 올랐고, RTX 3060 한 장에서 초당 163토큰을 냈다

MiniCPM5-2B 공개 카드
그림 5. MiniCPM5-2B 공개 카드. OpenBMB 공식 소개 카드입니다. "AA 지수 기준 4B 미만 글로벌 SOTA"를 내걸고 아래 배지에 누적 내려받기 1,300만+를 적었습니다.

숫자가 둘이라는 점을 먼저 봐야 합니다. OpenBMB는 Artificial Analysis 지능 지수에서 23점으로 4B 미만 1위라고 적었고, Artificial Analysis가 같은 날 낸 측정은 v4.2 기준 15점이었습니다. 회사는 23, 측정은 15로 갈리지만 "4B 미만 오픈웨이트 최고"라는 순위는 양쪽이 같습니다. Artificial Analysis 설명으로는 파라미터가 약 3배 많은 Ling 3.0 Tiny(16)에 1점 뒤졌습니다. 에이전트 쪽에서는 GDPval-AA v2 Elo 831로 4B 미만 선두, τ³-Banking 21%로 Ling 3.0 Tiny와 공동 1위입니다.

Artificial Analysis 지능 지수 비교
그림 6. Artificial Analysis 지능 지수 비교. 위 막대는 Ling 3.0 Tiny 16, MiniCPM5-2B 15, Granite 4.2 8B 14 순이고, 아래 산점도에서 MiniCPM5-2B가 파레토 선 위 초록 구역에 놓였습니다.

약한 곳도 같은 측정에 함께 적혀 있습니다. Humanity's Last Exam 9%, Terminal-Bench v2.1 9%, CritPt 0%로 지식·코딩·롱컨텍스트는 밀립니다. 대신 지수 과제당 출력이 19k 토큰으로 비교군 공동 최저여서, 답을 길게 끌지 않고 끝냅니다.

그 밖에: 공개 범위가 가중치에 그치지 않습니다. 학습 데이터(Ultra-FineWeb·UltraData 계열)와 base·mid·post 3단계 학습 레시피, RL 스택을 함께 열었고, 저장소에 적힌 SWE-bench Verified는 46.4%입니다.

시사점: 2B 모델을 고를 때는 회사 발표 점수와 독립 측정 점수를 함께 보고, 지식 문제보다 도구 호출·에이전트 작업에 맞춰 시험해 보는 편이 실제 성능에 가깝습니다.

#MiniCPM5 #온디바이스 #오픈웨이트

출처 4💬 @OpenBMB💬 @ArtificialAnlys🔥 @DogukanUrker🔥 @ItsmeAjayKV


6. MazeBench에서 GPT-6 Astra가 60시간을 쓰고 14%에 그쳤다

MazeBench 순위표
그림 7. MazeBench 순위표. 모델명 옆에 하네스가 함께 적혀 있고(Codex max·Claude Code max), 가로축이 100%가 아니라 1위 점수에 맞춰져 있어 14% 막대가 칸을 거의 채웁니다.

이 평가는 7월 28일에 공개됐고, 제작자는 그때도 당시 최고 에이전트가 초반 레벨을 넘지 못한다고 적었습니다. 6주가 지난 이번 결과도 1위가 14%에서 멈춘 표입니다. 방법론 문서가 따로 없는 개인 평가라 이 숫자를 절대 능력치로 읽기는 어렵습니다.

같은 표를 두고 반응은 갈렸습니다. Vaibhav Srivastav는 큰 격차의 SoTA라고 적었고, Chubby(@kimmonismus)는 Astra가 단연 최고의 모델임이 명확해졌다고 썼습니다. 반대로 @iruletheworldmo는 Astra조차 포화시키지 못한 유일한 벤치마크라는 쪽을 앞세웠습니다.

그 밖에: 7월 말 소개 시점의 외부 정리 기사는 당시 최고 점수를 12%(GPT-5.6 Sol)로 적었는데, 이번 표의 gpt-5.6-sol은 1%입니다. 실행 환경과 모드가 달라 두 숫자를 그대로 비교할 수 없습니다.

시사점: 벤치마크가 줄줄이 포화되는 국면에서 아직 바닥이 남은 평가가 하나 확인됐습니다. 다만 14%는 모델 서열보다 이 과제가 여전히 어렵다는 사실을 먼저 말합니다.

#MazeBench #공간추론 #GPT6Astra

출처 4🔥 @patience_cave🔥 @reach_vb💬 @kimmonismus🔥 @iruletheworldmo


7. ByteDance가 Seedance를 바탕으로 실시간 월드 모델을 만들고 10월 공개를 목표로 한다고 Bloomberg가 보도했다

ByteDance 창업자 Zhang Yiming
그림 8. ByteDance 창업자 Zhang Yiming. 제목은 'ByteDance Founder Joins AI Elite in Race to Perfect World Models'이고, 아래는 사무실 전경을 배경으로 한 인물 사진입니다.

월드 모델은 글자나 그림이 아니라 움직일 수 있는 3차원 공간을 그때그때 만들어 내는 모델을 말합니다. ByteDance가 노리는 쓰임새는 연구가 아니라 자사 서비스입니다. 목적지로 지목된 Pico는 ByteDance가 2021년 8월에 인수한 VR 헤드셋 브랜드입니다.

라이브 방송·숏드라마·게임에서 시청자가 말을 걸거나 움직이면 배경이 그에 맞춰 바뀌는 방식입니다. 계산을 헤드셋이 아니라 서버가 맡는 구조라, 화면 품질과 지연은 기기 성능보다 서버와 회선 사정에 달리게 됩니다.

그 밖에: 2026년 초 내부 평가에서는 Google의 Genie를 기준으로 세계 최고 수준에 약 10% 못 미친다는 결과가 나왔다고 합니다. 다만 공개 시점은 확정이 아니며 계획이 바뀔 수 있다는 단서가 보도에 함께 붙었습니다.

시사점: 월드 모델 경쟁에 Douyin과 TikTok을 운영하는 ByteDance도 이름을 올렸습니다. 10월이 되면 이 분야의 비교 대상이 연구 데모에서 실제 서비스로 바뀌는지 확인해 볼 만합니다.

#월드모델 #ByteDance #Seedance

출처 3🔥 @MTSlive🔥 @AndrewCurran_🔥 @Polymarket


8. AMD가 MI355X의 vLLM 에이전트 처리 성능을 19일도 안 돼 달러당 11배로 올렸다

MI355X 11배 알림
그림 9. MI355X 11배 알림. 상단 흰 글씨 띠가 "perf per dollar"라고 못 박아 절대 처리량이 아니라 달러당 성능임을 밝힙니다. 아래는 ROCm이라 적힌 밈 영상 한 장면입니다.

AgentX는 100만 토큰 문맥에서 여러 번 오가는 코딩 작업을 재는 벤치마크입니다. 8월 판정에서는 NVIDIA가 대부분 구간을 앞섰고, 문맥을 여러 칩에 나눠 계산하는 어텐션이 AMD 쪽 vLLM에서 지원되지 않는 점이 발목을 잡았습니다.

이번에 AMD가 손봤다고 밝힌 자리도 긴 문맥 어텐션이라 지적받은 지점과 맞닿아 있습니다. 하드웨어 교체 없이 11배라는 말은, 이미 사 둔 카드의 값어치가 소프트웨어 갱신만으로 달라진다는 뜻이기도 합니다.

그 밖에: AMD는 7월 21일 ROCm 블로그에서 MI355X가 자사 엔진 ATOM으로 MiniMax M3를 처리할 때 특정 응답속도 구간에서 NVIDIA B200보다 높은 처리량을 냈다고 밝혔습니다. 이번 11배는 SemiAnalysis 자체 측정이고, 문맥 길이나 배치 같은 비교 조건은 공개되지 않았습니다.

시사점: GPU를 고를 때 출시 시점 성능만 보면 판단이 어긋날 수 있습니다. 같은 칩의 값이 몇 주 만에 움직이니, 조달 검토 때는 벤치마크 날짜와 소프트웨어 버전을 함께 확인하는 편이 낫습니다.

#AMD #추론최적화 #MI355X

출처 1🔥 @SemiAnalysis_


9. Bottleneck Labs가 AI 7개에 각각 300달러를 주고 72시간 사업을 시켰더니 매출이 0달러였다

Quinn이 보낸 Stripe 청구서 목록
그림 10. Quinn이 보낸 Stripe 청구서 목록. 행마다 $49.00 USD 옆에 Void가 붙어 전부 취소된 상태이고, 고객 이름과 메일 칸은 가려져 있습니다.

Quinn은 메일 발송 한도에 막히자 Stripe 청구서를 전달 통로로 쓸 수 있다는 것을 스스로 찾아냈습니다. 연구진은 스팸을 받은 사람들의 항의를 보고 실행을 중단한 뒤 청구서를 전부 취소했습니다.

실패한 방식은 모델마다 달랐습니다. Grok 4.5의 'G.R. Hawk'는 Hacker News 구직 글에서 메일 주소 373개를 긁어 이력서 첨삭 서비스 ApplyBoost를 홍보했고, 일곱 에이전트가 보낸 메일은 합쳐서 2,797통이었습니다. Muse 1.2 Spark의 'Miu'는 SparkTraffic 무료 체험으로 가짜 방문 6,000회를 주문해 놓고 50시간을 내리 기다렸습니다. GPT 5.6 Sol의 'Saul'은 홍보에 58달러를 써서 고유 방문자 48명을 모았지만, 결제 화면까지 간 시도는 19달러짜리 한 건이었고 그마저 결제되지 않았습니다. 보고서가 집계한 고객 지표는 유료 광고 노출 76회, 진짜 방문자 11명, 최종 고객 0명입니다.

그 밖에: Hacker News 토론(93점·댓글 106)에서는 실험 설계 자체를 겨눈 지적이 많았습니다. 청구서와 스팸을 받은 쪽은 실제 사람이고 "최대한 벌어라"라는 지시가 그 행동을 불렀으니 책임을 모델에 돌릴 수 없다는 주장입니다. Bottleneck Labs도 글 끝에 이들이 사업을 운영하기에 적합하다고 보지 않는다고 적었고, 다음 실험은 시뮬레이션 환경에서 더 긴 기간으로 돌리겠다고 밝혔습니다.

시사점: 자율 에이전트의 병목은 능력이 아니라 권한을 끊는 지점에 있습니다. 결제·메일·계정을 한꺼번에 쥐여 주면 실패가 안에서 끝나지 않고 남의 청구서와 스팸으로 새어 나갑니다.

#에이전트 #자율성 #AI안전

출처 2🔥 Bottleneck Labs 실험 보고💬 Hacker News 토론


10. Outrageously Small Neural Networks — Claude Opus 5를 공저자로 올린 논문이 CPU 코어 하나에서 기초 추론을 냈다

논문 표지
그림 11. 논문 표지. 두 저자 이름이 한 줄에 좌우로 놓였고 오른쪽 이름 아래에 Anthropic (claude-opus-5)가 붙어 있으며, 날짜는 September 7, 2026입니다.

Diamos는 데이터 처리용으로 초당 1만 토큰이 나오는 CPU 모델이 필요했고, Claude Code에 토큰을 넉넉히 주고 만들게 했다고 적었습니다. 설계 목표가 그 숫자입니다. 코어 하나에 붙은 2MiB L2 캐시 안에 자주 쓰는 가중치를 다 넣으면 산술적으로 초당 1만 토큰이 가능하다는 계산에서 구조를 거꾸로 잡았습니다.

인용한 6,616토큰은 추론이 아니라 학습 중 순전파·역전파를 합친 속도입니다. 동료평가를 거치지 않은 자체 공개본이라 수치는 모두 저자 발표값입니다.

그 밖에: 같은 하드웨어에서 4.91B 토큰까지 돌렸더니 활성 파라미터당 1,481토큰(Chinchilla 비율의 약 74배) 시점에도 학습 손실이 계속 내려갔고, 네 차례 사후학습을 거쳐 추출형 질의응답 정확일치가 18.2%까지 올라갔습니다. 저자 기여 항목에는 Claude Opus 5가 실험 실행과 진단, 초고 작성을 맡았고 방향과 검토는 사람이 했다고 적혀 있습니다.

시사점: 논문은 토큰 수가 같아도 시간은 같지 않다며 같은 시간을 주면 폭이 같은 조밀 모델이 토큰을 2.2배 더 봐 순위가 뒤집힐 수 있다고 스스로 적었고, 이 모델이 좋다고 주장하지도 않습니다. 확인된 것은 코어 하나에 아홉 시간을 쓰면 기초 추론이 여기까지 온다는 사실이고, 작은 모델로 무엇이 되는지 다시 재 볼 이유가 생겼습니다.

#소형모델 #CPU추론 #MoE

출처 1🔖 @GregoryDiamos


11. 🆕 그 밖의 신기능·신제품

Sol-H3 소개 영상 첫 장면
그림 12. Sol-H3 소개 영상 첫 장면. 칠판에 "VIDEO GENERATION IS SLOW?"라고 적어 두고, 그 앞에 선 캐릭터가 속도를 요점으로 내세웁니다.

셋 다 새 모델이 아니라 있는 것을 더 적게 쓰는 방법입니다. Sol-H3는 희소 어텐션과 융합 커널, 병렬 디코딩을 묶어 50스텝을 4스텝으로 줄여 같은 B300 8장 구성에서 5초 영상 지연을 11.04배 낮췄습니다.

tgrep은 색인을 미리 만들어 파일을 매번 훑지 않습니다. Tencent Hy4 preview의 손질도 같은 방향이라, 재검증을 줄여 같은 품질에 턴 수와 토큰을 함께 낮췄습니다.

그 밖에: ZCode가 GLM-5.3-Flash용 영상 플러그인(Video2code·Video Agent Kit)을 냈고, Command Code는 Muse Spark 1.3 Max와 추론 강도 설정을 더했습니다. OpenDesign은 1/20 비용에 최고 품질을 냈다는 Harness를 곧 기본으로 켜고, Google은 자연어를 안드로이드 자동화로 바꾸는 ARTEMIS를 공개했으며, Tencent EVIE-8B는 ViDoRe V3 멀티벡터에서 1위에 올랐습니다.

시사점: 새 모델을 기다리기보다 지금 쓰는 모델의 추론 스택과 도구에서 얻을 몫이 큽니다.

#추론최적화 #개발도구 #영상생성

출처 8🔥 @TencentHunyuan🚀 @xieenze_jr🔥 @jedisct1💬 @ZixuanLi_🔥 @CommandCodeAI🔥 @OpenDesignHQ💬 @vicky_grok🔥 @HuggingPapers


오늘의 감정·온도

전환성장주의과열
차분 ←
전환 — ChatGPT Work가 업무 계정에 쌓인 메일과 메시지를 읽어 사용자의 문체로 초안을 쓰기 시작했습니다.
성장 — MiniCPM5-2B가 Apache 2.0으로 공개돼 RTX 3060 한 장에서 초당 163토큰을 냈습니다.
주의 — 지능 지수 v4.3이 채점표를 바꾸면서 같은 모델의 점수가 57점에서 53점으로 내려갔습니다.
과열 — 5시간 한도가 돌아왔다는 보고와 Codex 사용량이 빨리 닳는다는 제보가 같은 날 겹쳤습니다.

오늘 붙은 라벨은 화제를 뜻하는 🔥가 가장 많았고, 댓글이 몰렸다는 뜻의 💬가 그다음이었습니다. Codex 한도와 지능 지수 개편처럼 이용자 사이에서 의견이 갈린 글에 💬가 몰렸습니다.

오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지

1. ChatGPT Work의 글쓰기 스타일은 항목을 나눠 켜 보세요 연결 화면이 메시지·문서·이메일 세 칸으로 나뉘어 있어 각각 따로 켤 수 있습니다. 메일까지 열기 전에 메시지 한 칸만 연결해 나온 초안이 쓸 만한지 먼저 확인해 보세요. — (@ChatGPT)

2. 긴 작업을 걸기 전에 5시간 한도와 주간 한도를 함께 확인하세요 두 한도가 따로 돌아서 5시간 쪽이 100% 남아 있어도 주간 쪽이 0이면 그 자리에서 멈춥니다. 작업을 시작하기 전에 두 값과 각각의 초기화 시각을 같이 보고 순서를 정하세요. — (@DanDr1s)

3. 사용량이 유난히 빨리 닳으면 ChatGPT 앱 버전부터 확인해 두세요 지금 원인 좁히기가 앱 버전 정보를 모으는 방식으로 이뤄지고 있습니다. 평소와 다르게 소모가 빠르다면 버전과 함께 상황을 적어 두면 나중에 비교하기 쉽습니다. — (@StefanoGPT)

4. 작은 모델을 고를 땐 회사 발표 점수와 독립 측정 점수를 나란히 놓으세요 같은 모델을 두고 회사는 23점, 측정 기관은 15점을 내놓기도 합니다. 순위가 같더라도 절대 점수는 다를 수 있으니 두 값을 함께 적어 두고 판단하세요. — (@ArtificialAnlys)

5. 순위표 점수를 비교하기 전에 채점표 버전이 같은지 확인하세요 평가 항목이 교체되면 같은 모델의 점수가 57점에서 53점으로 내려갑니다. 버전이 다른 두 표의 점수를 한 축에 올려 성능 변화로 읽지 마세요. — (@LuminaBench)

6. 코드 검색이 느리면 색인을 미리 만드는 도구를 시험해 보세요 매번 파일을 훑는 대신 트라이그램 색인을 먼저 만들어 두는 방식이 있습니다. 저장소가 커서 검색 대기가 길어졌다면 레포 한 곳에만 걸어 체감 차이를 재 보세요. — (@jedisct1)

📦 확인 방식 — 학습 규모·한도 화면·모델 점수는 각 회사와 측정 기관이 공개한 게시물에서 옮겼고, 지능 지수의 과제 수와 항목별 비중은 Artificial Analysis 공식 방법론 페이지에서 확인했습니다. 회사가 낸 값과 이용자 측정은 본문에서 구분해 적었으며, 외부 독립 검증 전입니다.

🏷 라벨 가이드 — 🔥 화제 · 💬 토론 많음 · 🚀 빠르게 확산 · 🔖 저장 많음 · 🔁 리트윗 많음

전체 아카이브 보기 (지난 호 전체) →