오늘의 AI 브리핑 ·
와트와 대역폭이 먼저 나온 날
5분 브리핑
약 2분 · 6개 흐름핵심만 먼저 읽고, 궁금한 소식은 본문으로 이어 보세요.
전체 분석 8분으로 바로 가기 ↓- 오픈AI가 Jalapeño의 첫 실측치를 숫자로 열었다
세미애널리시스의 InferenceX 벤치마크에서 GPT-OSS 120B·DeepSeek R1 670B·Kimi K2.5 1T 세 모델로 측정했습니다. 최고 효율 지점 기준 와트당 처리량이 1.5~1.9배, 엔드투엔드 지연은 1.7~3.6배 짧았습니다.
- 애플이 M6·M5 Ultra로 로컬 추론의 대역폭을 넓혔다
Mac mini에 들어가는 M6는 12코어 CPU·12코어 GPU에 16코어 뉴럴 엔진 두 개, 메모리 대역폭 170GB/s입니다. Mac Studio의 M5 Ultra는 최대 36코어 CPU·80코어 GPU에 대역폭 1.2TB/s로, M3 울트라보다 50% 넓습니다.
- 쇼피파이 CEO의 한마디가 에이전트 설정 파일 표준을 끄집어냈다
토비 뤼트케는 Claude Code가 AGENTS.md와 .agents/skills를 읽기 전까지 사내 사용 금지를 검토 중이라고 적었습니다. 팀원마다 다른 도구를 쓰는데 한쪽만 CLAUDE.md를 고집하면 지침이 갈라지는 문제를 이유로 들었습니다.
- 알리바바가 Qwen4 구조를 미리 여는 Qwen3.8-Flash-Next를 예고했다
ModelScope에 공개 카운트다운이 올라왔고, 예고된 시점은 하루 안입니다. 125B MoE인데 토큰 하나에 실제로 켜지는 파라미터는 6B입니다.
- 스탠퍼드 개정판이 22~25세 고용 격차를 19%로 다시 계산했다
AI 노출이 높은 직군의 22~25세 고용이 덜 노출된 또래보다 19% 낮다는 수치가 8월 개정판에 담겼습니다. 같은 연구의 지난해 판에서는 13%였으니, 격차가 좁혀지지 않고 벌어진 셈입니다.
- 🆕 그 밖의 신기능·신제품
오픈AI가 ChatGPT 비즈니스 프리미엄 좌석을 열었습니다 — 월 100달러에 표준 좌석의 5배 사용량, 5시간 제한 없음입니다. ChatGPT 예약 작업이 시간표뿐 아니라 슬랙·지메일·깃허브에 변화가 생길 때도 돌게 됐고, 무료 사용자도 3개까지 만듭니다.
주요 키워드 TOP 5: Jalapeño · M6·M5 Ultra · AGENTS.md · Qwen3.8-Flash-Next · 신입 고용 | 메인 이벤트: 오픈AI가 자체 추론 칩 Jalapeño의 첫 실측치를 공개하며, 엔비디아 랙과의 전력당 성능 차이를 처음으로 숫자로 내놨습니다.
목요일에 나온 발표들은 서로 다른 회사에서 왔지만 같은 곳을 겨눴습니다. 오픈AI는 추론 한 번에 드는 전력을, 애플은 모델이 메모리에서 가중치를 끌어오는 속도를, 알리바바는 125B 모델을 6B만 켜서 돌리는 방식을 각각 내놨습니다. 토큰당 비용이 경쟁의 본체가 된 해에, 모델 이름보다 와트와 대역폭이 먼저 발표되는 날이 늘고 있습니다.

1. 오픈AI가 Jalapeño의 첫 실측치를 숫자로 열었다
- 세미애널리시스의 InferenceX 벤치마크에서 GPT-OSS 120B·DeepSeek R1 670B·Kimi K2.5 1T 세 모델로 측정했습니다.
- 최고 효율 지점 기준 와트당 처리량이 1.5~1.9배, 엔드투엔드 지연은 1.7~3.6배 짧았습니다.
- 패키지 TDP는 700W인데 실제 소비는 550W 아래에 머물렀고, 비교 대상 GB200은 1,200W입니다.

지난 발표가 칩의 존재를 알리는 자리였다면 이번은 계량기를 들고 나온 자리입니다. 눈여겨볼 지점은 평균값이 아니라 곡선의 모양입니다. 최고 효율에서는 1.9배 차이지만, 사용자 한 명에게 초당 400토큰 이상을 밀어 넣는 구간으로 가면 비교 대상의 처리량이 먼저 무너집니다. 에이전트가 사람 대신 화면을 읽고 도구를 부르는 작업은 정확히 그 고속 구간에 몰려 있습니다.
그레그 브로크먼은 결과를 두고 팀을 치하했지만, 반론도 같은 날 나왔습니다. 투자자 개빈 베이커는 TPU·트레이니엄 밖 첫 쓸 만한 ASIC이라는 평가를 붙이면서도, GPU에 SRAM 가속기를 분리 결합한 구성과 붙으면 밀릴 가능성이 크다고 적었습니다. 벤치마크가 공개된 조합에서만 성립하는 우위인지, 배치가 시작되는 올해 말에 확인될 부분입니다.
그 밖에: 엔비디아는 하루 앞서 에이전트 전용 CPU 베라를 대규모 배치에 넣는다고 알렸고, 세미애널리시스 뉴스레터는 이번 결과를 「OpenAI Jalapeño: Better than Nvidia Blackwell」이라는 제목으로 다뤄 해커뉴스 상위에 올랐습니다.
시사점: 추론 단가를 직접 만지는 쪽이 모델 가격표를 다시 씁니다. API 예산을 짜고 있다면 연말 배치 이후의 가격 고시를 전제로 계약 기간을 짧게 끊어 두는 편이 안전합니다.
#Jalapeño#추론칩#전력효율
출처 6🔥 @OpenAI🔥 @kimmonismus🔥 @gdb🔥 @GavinSBaker🔥 @nvidia💬 @thsottiaux
2. 애플이 M6·M5 Ultra로 로컬 추론의 대역폭을 넓혔다
- Mac mini에 들어가는 M6는 12코어 CPU·12코어 GPU에 16코어 뉴럴 엔진 두 개, 메모리 대역폭 170GB/s입니다.
- Mac Studio의 M5 Ultra는 최대 36코어 CPU·80코어 GPU에 대역폭 1.2TB/s로, M3 울트라보다 50% 넓습니다.
- 주문은 8월 25일 시작됐고 배송은 9월 22일부터입니다.

로컬 추론에서 병목은 연산이 아니라 가중치를 읽어 오는 속도입니다. 토큰 하나를 뱉을 때마다 활성 파라미터를 전부 훑어야 하므로, 초당 토큰 수는 대역폭을 파라미터 크기로 나눈 값에 붙어 다닙니다. 대역폭 50% 증가가 코어 수 증가보다 먼저 언급되는 이유가 여기 있습니다.

EXO를 만드는 알렉스 치마는 M5 Ultra 네 대를 묶으면 Kimi K3나 GLM 5.3을 API보다 빠르게, 초당 100토큰 넘게 돌릴 수 있을 것으로 봤습니다. 양자화한 70B급을 한 대에 얹는 구성은 이미 계산이 서고, 여기서 갈리는 건 성능이 아니라 회수 기간입니다. 구독료와 한도 대신 감가상각을 택할지의 문제로 옮겨간 셈입니다.
그 밖에: Perplexity는 엔비디아 DGX 스파크에서 오케스트레이터와 서브에이전트, 하네스까지 전부 로컬에서 도는 포터블 컴퓨터를 같은 날 내놨습니다.
시사점: 로컬 장비를 검토한다면 코어 수 표가 아니라 메모리 대역폭과 용량부터 보세요. 쓰려는 모델의 활성 파라미터 크기로 대역폭을 나누면 기대 속도의 상한이 대략 나옵니다.
#애플실리콘#로컬추론#메모리대역폭
출처 5🔥 @mweinbach🔥 @IntCyberDigest🔥 @alexocheema🔥 @kimmonismus🔥 @perplexity_ai
3. 쇼피파이 CEO의 한마디가 에이전트 설정 파일 표준을 끄집어냈다
- 토비 뤼트케는 Claude Code가 AGENTS.md와 .agents/skills를 읽기 전까지 사내 사용 금지를 검토 중이라고 적었습니다.
- 팀원마다 다른 도구를 쓰는데 한쪽만 CLAUDE.md를 고집하면 지침이 갈라지는 문제를 이유로 들었습니다.
- 앤스로픽 쪽에서 곧바로 답이 왔습니다 — AGENTS.MD 사용과 시스템 프롬프트 수정을 여는 작업이 진행 중입니다.

앤스로픽의 답변에는 기술적 이유가 붙었습니다. 모델 계열은 서로 갈아 끼울 수 있는 부품이 아니고 시스템 프롬프트가 성능을 크게 흔들기 때문에, Claude Code는 모델마다 다른 시스템 프롬프트를 들고 있다는 설명입니다. 같은 담당자가 쓴 「The new rules of context engineering for Claude 5 models」가 그 배경을 정리한 글입니다. 설정 파일은 취향이 아니라 성능 변수라는 주장인데, 그 대가로 팀에는 파일이 두 개 생깁니다.
같은 날 Claude는 채팅과 Cowork의 메모리를 하나로 합쳤습니다. 채팅에서 다듬어 둔 프로젝트 맥락을 Cowork가 그대로 이어받고, 저장된 내용은 사용자가 열어 고치거나 지울 수 있습니다. 건강·종교·정치 같은 민감 항목은 기본으로 저장하지 않고 토글로만 켜집니다. 설정 파일 논쟁이 "무엇을 읽힐까"라면, 메모리 통합은 무엇을 기억하게 둘까를 같은 주에 꺼낸 셈입니다.
그 밖에: 「How we Build Agent Environments & Tasks」와 「Agreement is a bug. I forced 11 Claude Code agents to disagree.」가 같은 날 개발자 타임라인에 올랐고, "스킬은 결국 마크다운 파일 안의 프롬프트"라는 한 줄은 좋아요 8,700개를 모았습니다.

시사점: 팀에 도구가 둘 이상이면 지침 파일을 지금 한 곳으로 모아 두세요. 한쪽을 정본으로 두고 다른 쪽은 링크로 거는 편이, 나중에 두 파일이 서로 다른 말을 하는 것보다 쌉니다.
#AGENTSmd#Claude메모리#컨텍스트엔지니어링
출처 7🔥 @tobi🔥 @trq212🔥 @claudeai🔥 @weswinder🔥 @EinsiaAI🔥 @hwchase17💬 @nykdotdev
4. 알리바바가 Qwen4 구조를 미리 여는 Qwen3.8-Flash-Next를 예고했다
- ModelScope에 공개 카운트다운이 올라왔고, 예고된 시점은 하루 안입니다.
- 125B MoE인데 토큰 하나에 실제로 켜지는 파라미터는 6B입니다.
- 다음 세대 Qwen4 계열이 쓸 구조를 앞당겨 공개하는 성격이라 해커뉴스에서도 상위에 올랐습니다.

같은 계열의 27B 모델은 Code Arena WebDev에서 전체 9위에 들었습니다. 그 크기대에서 10위 안에 든 유일한 모델이고, 훨씬 큰 Qwen3.8-Max와는 여섯 계단 차이입니다. 활성 6B로 125B를 돌린다는 설계는 로컬 배포에서 특히 무게가 다릅니다. 앞 토픽의 대역폭 이야기와 곧장 맞물리기 때문입니다. 여기에 51B 규모의 N그램 임베딩이 따로 붙는다는 사양도 도는데, 출처가 잠깐 떴다 지워진 ModelScope 초기 페이지라 공개 전까지는 확정으로 볼 수 없습니다.
Unsloth는 27B를 24GB VRAM에서 파인튜닝할 수 있는 노트북을 함께 열었습니다. 훈련 속도는 1.5배, VRAM은 절반이라고 밝혔습니다. 가중치 공개와 튜닝 도구가 같은 주에 붙어 나오는 흐름은 지난 몇 달 사이 중국 쪽 공개 모델에서 반복되고 있고, 이번에는 아키텍처 미리보기까지 그 묶음에 들어갔습니다.
그 밖에: DeepSeek Flash Vision도 같은 날 화제였습니다 — Kimi K3보다 10배 싸고 GLM 5.3을 앞선다는 주장이 붙었는데, 아직 독립 측정으로 확인된 수치는 아닙니다.
시사점: 오픈웨이트를 검토 중이라면 파라미터 총량이 아니라 활성 파라미터를 기준으로 장비를 계산하세요. 총량은 메모리 용량을, 활성량은 속도를 결정합니다.
#Qwen38#오픈웨이트#MoE
출처 7🔥 @Alibaba_Qwen💬 @KyleHessling1💬 @jtdavies🔥 @ClementDelangue🔥 @jun_song🔥 @UnslothAI🔥 @bindureddy
5. 스탠퍼드 개정판이 22~25세 고용 격차를 19%로 다시 계산했다
- AI 노출이 높은 직군의 22~25세 고용이 덜 노출된 또래보다 19% 낮다는 수치가 8월 개정판에 담겼습니다.
- 같은 연구의 지난해 판에서는 13%였으니, 격차가 좁혀지지 않고 벌어진 셈입니다.
- 회계·감사처럼 업무가 규격화된 직군에서 신입 채용 감소가 특히 가팔랐습니다.

「Canaries in the Coal Mine?」이라는 제목이 붙은 이 논문은 지난해 판을 새 데이터로 다시 돌린 개정판입니다. 눈에 띄는 건 연령 분해입니다. 같은 직군 안에서도 나이가 있는 인력의 고용은 거의 흔들리지 않았고, 격차는 사회 초년 구간에 몰렸습니다. 일이 사라진 게 아니라 일을 배우는 자리가 먼저 깎였다는 해석이 나오는 이유입니다.
이 논의에 다시 소환된 그림이 위 도표입니다. 지난 3월 앤스로픽이 낸 노동시장 보고서의 것으로, 이론상 AI가 처리할 수 있는 업무 비중과 실제 사용 데이터에서 관찰된 비중을 겹쳐 놓았습니다. 컴퓨터·수학 직군은 이론값이 94%대인데 관찰값은 30%대에 머뭅니다. 다만 이 그림에도 반론이 붙었습니다 — 파란 면이 정말 "이론상 가능"이라면 원 전체를 덮어야 하니 라벨이 잘못됐다는 지적이 같은 날 올라왔습니다.
그 밖에: 앤스로픽은 보안팀 파업 가능성을 이유로 샌프란시스코 직원들에게 재택근무를 권고했다는 보도가 나와 해커뉴스에서 따로 논의됐습니다.
시사점: 신입을 뽑는 쪽이라면 "AI가 대신할 수 있는 일"과 "사람이 그 일을 하며 배우던 것"을 분리해 적어 보세요. 뒤쪽을 대체할 장치가 없으면 3년 뒤 중간 관리 인력이 비어 있습니다.
#고용지표#스탠퍼드#노동시장
출처 3🔖 @AndrewCurran_🔥 @AndrewCurran_💬 @nikolaj2030
6. 🆕 그 밖의 신기능·신제품
- 오픈AI가 ChatGPT 비즈니스 프리미엄 좌석을 열었습니다 — 월 100달러에 표준 좌석의 5배 사용량, 5시간 제한 없음입니다.
- ChatGPT 예약 작업이 시간표뿐 아니라 슬랙·지메일·깃허브에 변화가 생길 때도 돌게 됐고, 무료 사용자도 3개까지 만듭니다.
- 오픈AI 개발자팀이 크로미움·클라우드플레어·쇼피파이·버셀·넷리파이와 함께 상금 3만 5천 달러 규모의 WebMCP 해커톤을 열었습니다.

가격표가 촘촘해지는 방향이 눈에 띕니다. 개인 프로 요금제와 팀 단위 계약 사이에 100달러짜리 칸이 새로 생겼고, 여기에는 워크스페이스·슬랙·깃허브 연결과 SAML·SSO 같은 관리 기능이 함께 붙습니다. 같은 주에 플러스 사용자의 5시간 제한이 되살아난 것과 묶어 보면, 한도를 조정해 수요를 위쪽 요금제로 미는 설계가 분명해집니다.
도구 쪽에서도 작은 갱신이 이어졌습니다. Cursor는 Grok 4.6 수요 증가를 이유로 포함 사용량을 다시 올렸고, OpenCode는 5시간당 169회를 열었습니다. Higgsfield는 Blender 안에서 장면을 프롬프트로 짜고 카메라 움직임을 붙이는 통합을 내놨으며, Ghostty는 1.4 나이틀리에서 Kitty 클립보드 프로토콜을 온전히 구현해 터미널이 이미지 같은 비텍스트 데이터를 주고받게 했습니다.
그 밖에: Ghostty 쪽 발표에서 이 프로토콜을 지원하는 가장 큰 프로그램으로 Claude Code가 언급됐습니다.
시사점: 팀 요금제를 다시 볼 시점입니다. 좌석당 한도와 관리 기능이 이번 주에 한꺼번에 바뀌었으니, 지금 쓰는 조합의 실사용량을 뽑아 두고 비교하세요.
#ChatGPT비즈니스#예약작업#WebMCP
출처 7🔥 @OpenAI🔥 @ChatGPT🔥 @OpenAIDevs🔥 @leerob🔥 @opencode🔥 @higgsfield🔥 @mitchellh
📊 오늘의 감정·온도
💼 오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지
1. 대화 중간에 모델을 갈아타지 마세요 — 모델을 바꾸면 앞서 쌓아 둔 프롬프트 캐시가 통째로 무효가 되어 입력 토큰 값을 처음부터 다시 냅니다. 비교가 필요하면 같은 질문을 새 대화로 따로 던지세요. — (@Teknium)
2. 지침 파일은 한 곳을 정본으로 두세요 — 팀에 도구가 둘 이상이면 AGENTS.md와 CLAUDE.md가 서로 다른 말을 하기 시작합니다. 한쪽만 실제 내용으로 두고 나머지는 그 파일을 가리키게 하면 갱신을 한 번만 하면 됩니다. — (@tobi)
3. 에이전트가 토큰을 세 배 쓰면 모델이 아니라 하네스를 보세요 — 도구가 돌려준 5만 토큰짜리 JSON이 대화에 계속 남아 있으면 이후 모든 호출에 그 값이 따라붙습니다. 도구 결과는 요약해서 넣고 원본은 파일로 빼 두는 편이 쌉니다. — (@_avichawla)
4. 로컬 장비는 대역폭으로 고르세요 — 초당 몇 토큰이 나올지는 코어 수가 아니라 메모리 대역폭을 모델의 활성 파라미터 크기로 나눈 값에 가깝습니다. 사양표에서 GB/s 숫자를 먼저 확인하세요. — (@alexocheema)
5. 예약 작업을 시간이 아니라 사건에 거세요 — 매일 아침 9시 대신 "지메일에 특정 메일이 오면", "깃허브에 이슈가 열리면"으로 걸면 빈 실행이 사라집니다. 무료 계정도 세 개까지 만들 수 있습니다. — (@ChatGPT)
6. 프런트엔드는 프롬프트보다 참고 자료로 잡으세요 — "고급스럽게" 같은 형용사는 결과를 거의 못 바꿉니다. 마음에 드는 화면의 구성 요소를 모아 두고 그 조각을 붙여 쓰는 방식이 훨씬 빨리 수렴합니다. — (@EXM7777)
📦 확인 방식 — 성능 수치는 오픈AI가 공개한 Jalapeño 결과 발표와 세미애널리시스 InferenceX 벤치마크, 하드웨어 사양은 애플 뉴스룸, 고용 수치는 스탠퍼드 「Canaries in the Coal Mine?」 8월 개정판에서 가져왔습니다. 그 밖의 내용은 발표 계정의 원문을 따랐으며, 외부 독립 검증 전입니다.
🏷 라벨 가이드 — 🔥 화제 · 💬 토론 많음 · 🔖 저장 많음