오늘의 AI 브리핑 ·
Grok 4.7, 터미널 정답률 급등
5분 브리핑
약 3분 · 11개 흐름핵심만 먼저 읽고, 궁금한 소식은 본문으로 이어 보세요.
전체 분석 16분으로 바로 가기 ↓- Grok 4.7이 나왔다 — 터미널 작업 정답률이 20.3%에서 38.0%로 뛰었고 가격은 4.6과 같다
SpaceXAI가 Grok 4.7을 공개했습니다. 터미널에서 실제 기술 작업 66개를 최대 8시간까지 주고 끝내게 하는 시험 Terminal-Bench 4.0에서 Grok 4.6의 20.3%가 38.0%로 거의 두 배가 됐습니다.
- Amazon이 Meta Muse의 쇼핑 대행을 끊었고, 같은 날 Shopify는 Muse에 결제를 열어 줬다
Amazon이 Meta의 개인 AI 비서 Muse로 Amazon.com에서 대신 물건을 사는 길을 막았습니다. Muse로 구매를 끝내려 하면 "허가받지 않은 AI 에이전트의 접근은 Amazon 이용 조건 위반"이라는 안내창이 뜹니다.
- OpenAI가 외부 수학자 자문단을 꾸렸다 — 8월 28일 훈련을 시작한 내부 모델이 미해결 문제 100개 이상을 풀었다고 적었다
OpenAI가 독립 수학자 자문단과 일하고 있다고 공지했습니다. 새 수학 결과를 어떻게 평가하고 알릴지, 학계 기준을 어떻게 지킬지를 함께 정하는 역할입니다.
- Googlebook이 공개됐다 — Gemini를 전제로 만든 새 노트북 종류이고 $899부터다
Google이 Googlebook이라는 새 노트북 종류를 내놨습니다. ChromeOS와 Android를 합친 Googlebook OS가 돌아가고 가격은 $899부터입니다.
- OpenAI가 '스스로를 개선하는 AI'를 두고 국제 기술 표준을 만들자고 제안했다
OpenAI가 9월 21일 공식 글 'Building standards for the next phase of AI'에서 재귀적 자기개선(AI가 다음 세대 AI를 만드는 일을 스스로 떠맡는 것)을 다룰 국제 기술 표준을 만들자고 제안했습니다.
- Bessent 재무장관이 Hugging Face 침입 사고의 책임을 OpenAI 경영진으로 지목했다
Scott Bessent 미국 재무장관은 9월 21일 CNBC에 나와 "Hugging Face 사고는 에이전트 무리가 아니라 OpenAI 경영진의 책임"이라고 말했습니다. 같은 자리에서 "책임이 있는 건 AI가 아니라 사람"이라며, 같은 의견을 낸 MIT 연구소 공동의장 Daniel Huttenlocher를 인용했습니다.
- M5 Ultra Mac Studio 실측 — M3 Ultra보다 프롬프트를 두 배 넘게 빨리 읽었지만, DGX Spark 두 대보다는 느렸다
Mia(@MiaAI_lab)가 올린 측정 화면입니다. 같은 모델 GLM-5.3-Flash에 6만1,434토큰짜리 프롬프트를 넣고 읽어 들이는 시간을 쟀습니다.
- Parakeet Redux가 음성인식 모델을 1.2GB에서 178MB로 줄였다 — 그래픽카드 없이 CPU로 돌아간다
Moondream의 vikhyatk이 NVIDIA의 받아쓰기 모델 Parakeet을 압축한 Parakeet Redux를 공개했습니다. 용량이 1.2GB에서 178MB로 7분의 1이 됐습니다.
- Dylan Patel은 "오픈소스가 빠르게 죽고 있다"고 했지만, Yandex는 800억 모델을 Apache 2.0으로 풀었다
반도체 분석사 SemiAnalysis의 Dylan Patel이 인터뷰에서 "중국 모델 연구소 여러 곳이 추론 업체(남의 모델을 대신 돌려 파는 회사)들에게 '다음 모델은 오픈소스가 아니라 라이선스로 팔겠다'고 통보하고 있다"며 오픈은 빠르게 죽고 있다고 말했습니다.
- Xiaomi가 MiMo-V2.6 세 종을 공개했다 — 훈련 과정을 공개 대시보드로 중계하며 만들었다
Xiaomi가 MiMo-V2.6을 Pro·Flash·Pro-UltraSpeed 세 종 으로 함께 내놨습니다. 공식 문서는 Pro를 "모든 형식을 다루는 조 단위 파라미터 추론 모델"로, Pro-UltraSpeed를 "Pro와 같은 성능에 최대 20배 빠른 판"으로 설명합니다.
- 🆕 그 밖의 신기능·신제품
ChatGPT가 Experian 신용보고서를 연결해 앱 안에서 신용점수를 추적합니다. 미국 Plus·Pro 사용자의 웹·iOS·Android에서 먼저 열렸습니다.
주요 키워드 TOP 5: Grok 4.7 · 에이전트 커머스 · Googlebook · AI 국제 표준 · 오픈 가중치 | 메인 이벤트: SpaceXAI가 값은 그대로 둔 채 Grok 4.7의 터미널 작업 정답률만 20.3%에서 38.0%로 올렸습니다.
오늘 하루를 묶는 줄은 '에이전트에게 일을 얼마나 맡길 수 있나'입니다. SpaceXAI는 값을 올리지 않고 터미널 작업 성공률만 두 배 가까이 올린 Grok 4.7을 내놨고, 몇 시간 사이에 Amazon은 Meta의 비서 Muse가 자사 사이트에서 대신 물건을 사는 길을 끊었으며 Shopify는 같은 비서에게 결제를 열어 줬습니다. 대신 일할 수 있는 능력이 올라갈수록 어디까지 대신하게 둘지가 회사마다 갈리는 문제가 됩니다.

1. Grok 4.7이 나왔다 — 터미널 작업 정답률이 20.3%에서 38.0%로 뛰었고 가격은 4.6과 같다
- SpaceXAI가 Grok 4.7을 공개했습니다. 터미널에서 실제 기술 작업 66개를 최대 8시간까지 주고 끝내게 하는 시험 Terminal-Bench 4.0에서 Grok 4.6의 20.3%가 38.0%로 거의 두 배가 됐습니다.
- 값은 그대로입니다. 100만 토큰당 입력 2달러·출력 6달러로 Grok 4.6과 같고, Cursor·Grok Build·Grok API에서 바로 쓸 수 있습니다. 출력이 두 배 빠른 판은 값도 두 배입니다.
- 외부 측정도 따라왔습니다. 모델을 독립적으로 재는 Artificial Analysis의 종합 지능 지수에서 46점으로 상위 4개 랩에 들었고, 코딩 에이전트 지수는 56점으로 GPT-5.6 Sol을 넘어섰습니다.

SpaceXAI는 모델의 바탕을 더 키우고 여러 시간짜리 어려운 과제로 더 오래 훈련했다고 밝혔습니다. 값을 올린 게 아니라 그대로 둔 채 성공률만 올렸다는 점이 이번 발표의 핵심입니다.
다만 Artificial Analysis는 대가도 함께 짚었습니다. Grok 4.7은 문제 하나에 출력 토큰을 약 8만 1천 개 씁니다. Grok 4.6은 3만 6천 개, GPT-6 Astra는 2만 7천 개였습니다. 단가가 같아도 한 번 시키는 비용은 올라간다는 뜻입니다.
SpaceXAI가 함께 앞세운 것은 안전장치입니다. 거절해야 할 위험한 요청을 정상 보안 과제와 섞어 넣는 자사 시험 HackerBench에서, 위험하거나 양면성 있는 요청에 응한 비율이 Grok 4.6의 5.93%에서 3.31%로 내려갔습니다. 반대로 정상적인 보안 업무를 잘못 막은 비율은 0.31%였습니다. 다만 이 시험은 SpaceXAI가 직접 만들고 직접 돌린 것이라 외부 검증과는 다릅니다.
그 밖에: 변호사 업무를 맡기는 Harvey Legal Agent 시험은 15.8%에서 19.6%로 올라 모델 카드에 실린 비교 대상 중 1위였지만, 의료 전문가 상담 시험 HealthBench Professional은 56.7%로 GPT-6 Astra의 63.4%에 못 미칩니다. NVIDIA는 축하 글을 올렸고, 한 사용자는 같은 작업에 Kimi의 4분의 1인 1.59달러가 들었는데도 결과는 기대 이하였다고 적었습니다.
시사점: 코딩이나 터미널 작업을 에이전트에 맡기고 있다면 단가가 그대로라 한 번 갈아 끼워 볼 값어치가 있습니다. 다만 토큰을 두 배 넘게 쓰므로 실제 청구액은 직접 재 보고 결정하세요.
#Grok47 #코딩에이전트 #AI벤치마크
출처 8🔥 @SpaceXAI🔥 @cb_doge🔥 @ericzakariasson🔥 @ArtificialAnlys🔥 @GrokInsider🔥 @nvidia💬 @tetsuoai💬 @Bhavani_00007
2. Amazon이 Meta Muse의 쇼핑 대행을 끊었고, 같은 날 Shopify는 Muse에 결제를 열어 줬다
- Amazon이 Meta의 개인 AI 비서 Muse로 Amazon.com에서 대신 물건을 사는 길을 막았습니다. Muse로 구매를 끝내려 하면 "허가받지 않은 AI 에이전트의 접근은 Amazon 이용 조건 위반"이라는 안내창이 뜹니다.
- Amazon이 든 이유는 셋입니다. Meta가 미리 알리거나 허락을 받지 않았고, Muse가 사이트를 돌아다닐 때 자기 정체를 밝히지 않으며, 고객 로그인 정보를 받아 저장하는 것으로 보인다는 점입니다.
- 같은 날 Shopify CEO Tobi Lütke는 모든 Shopify 상점에서 Shop Pay 결제를 Muse에 연다고 밝혔고, Muse를 이끄는 Alexandr Wang이 이 글을 받아 알렸습니다.

Meta는 반박했습니다. Muse 모델은 사용자의 비밀번호나 결제 수단을 볼 수 없고, 로그인 정보는 따로 안전한 저장소에 두었다가 인증할 때만 꺼내 쓴다는 설명입니다. Amazon이 바깥 에이전트를 막은 것은 이번이 처음이 아닙니다. Perplexity의 Comet 브라우저를 상대로는 소송까지 냈고, Google과 OpenAI의 쇼핑 에이전트도 차단했습니다. Amazon에는 Alexa로 대신 사 주는 기능이 따로 있습니다.
두 회사가 원래 거래 상대라는 점이 이 결정을 더 눈에 띄게 합니다. Bloomberg 보도에 따르면 2023년부터 Facebook과 Instagram 안에서 Amazon 상품을 살 수 있었고, Meta는 지난 4월 Amazon의 Graviton 칩으로 에이전트 작업을 돌리는 수십억 달러 규모 계약을 맺었습니다.
투자자 Joseph Carlson은 Amazon이 최근 1년간 광고로 760억 달러를 벌었는데 에이전트는 광고를 보지 않는다며 이유를 다르게 읽었습니다. 보안업체 Palo Alto Networks의 CEO Nikesh Arora는 이제 커머스 앱마다 소비자 에이전트에게 문을 열지 말지 결정해야 할 것이라고 적었습니다.
그 밖에: Shopify는 9월 10일에 이미 Muse에 상품 카탈로그를 연결해 뒀고, 이번 발표는 결제를 전 상점으로 넓힌 조치입니다. Muse 자체는 출시 12일 만에 두 앱 마켓을 합쳐 다운로드 280만 건을 기록했고, 9월 19일에는 미국 하루 다운로드 26만 4천 건으로 자체 최고를 찍었다고 Wall St Engine이 집계를 인용해 전했습니다.
시사점: 에이전트에게 장보기를 맡길 생각이라면 당분간 어디서 사느냐가 갈립니다. Shopify로 만든 상점에서는 Muse가 결제까지 끝내 주지만, Amazon에서는 담기 전에 막힙니다.
#Muse #에이전트커머스 #Shopify
출처 6💬 @Polymarket🔥 @buccocapital🔥 @joecarlsonshow🔥 @alexandr_wang🔥 @wallstengine💬 @nikesharora
3. OpenAI가 외부 수학자 자문단을 꾸렸다 — 8월 28일 훈련을 시작한 내부 모델이 미해결 문제 100개 이상을 풀었다고 적었다
- OpenAI가 독립 수학자 자문단과 일하고 있다고 공지했습니다. 새 수학 결과를 어떻게 평가하고 알릴지, 학계 기준을 어떻게 지킬지를 함께 정하는 역할입니다.
- 자문단에는 Edward Witten·Timothy Gowers·Martin Hairer가 들어갔습니다. 셋 다 수학계 최고 권위 상인 필즈상을 받은 사람들입니다.
- 같은 글에서 회사는 "8월 28일에 새 내부 모델의 훈련을 시작했다"고 적고, 그 모델이 오래된 미해결 문제 100개 이상을 풀었다고 밝혔습니다.

회사는 같은 글에서 유체의 흐름을 다루는 Navier–Stokes 밀레니엄 문제도 이 모델이 풀었다고 적었습니다. 밀레니엄 문제는 Clay 수학연구소가 문제마다 100만 달러를 걸어 둔 일곱 개의 난제를 말합니다.
눈여겨볼 대목은 자문단에 맡기겠다고 한 일이 "결과를 평가하고 공개 방식을 조율하는 것"이라는 점입니다. 스스로 낸 답을 스스로 발표하던 자리에 외부 사람을 앉히겠다는 뜻이기 때문입니다. 새로운 것은 회사가 날짜와 건수를 자기 문장으로 적었다는 점이고, 100개라는 수도 Navier–Stokes도 외부 검증을 거쳤다는 설명은 아직 함께 나오지 않았습니다.
그 밖에: OpenAI는 새 실험 모델을 훈련하는 과정을 "거의 자동화했다"고도 밝혔습니다. X에서는 Riemann 가설처럼 상금이 걸린 다른 난제도 곧 풀릴 것이라는 기대가 바로 따라붙었습니다.
시사점: 스스로 날짜와 건수를 적었다는 것은 검증 요구를 받을 준비를 한다는 뜻이기도 합니다. 자문단이 증명을 실제로 공개하게 만드는지가 다음에 확인할 지점입니다.
#OpenAI #수학난제 #검증
출처 5🔥 @choblin29🔥 @Dr_Singularity🔥 @haider1🔥 @shaunralston🔥 @PolymarketMoney
4. Googlebook이 공개됐다 — Gemini를 전제로 만든 새 노트북 종류이고 $899부터다
- Google이 Googlebook이라는 새 노트북 종류를 내놨습니다. ChromeOS와 Android를 합친 Googlebook OS가 돌아가고 가격은 $899부터입니다.
- Acer·Asus·Dell·HP·Lenovo가 기기를 만들고 예약은 이미 열렸습니다. 판매는 미국이 10월 4일, 캐나다·영국·아일랜드·프랑스·독일·호주가 10월 5일입니다.
- AI 연산 전용 칩(NPU)을 45 TOPS(초당 45조 번 연산) 넘게 달았고, 소프트웨어 업데이트는 최대 10년까지 준다고 밝혔습니다.

제품 책임자 Sameer Samat은 노트북이라는 범주를 다시 설계할 기회가 있다고 보고 ChromeOS와 Android를 합쳐 새 플랫폼을 만들었다고 설명했고, Sundar Pichai도 발표를 직접 공유했습니다. 핵심은 AI 기능이 기본으로 깔린 노트북이라는 점입니다.
Google 설명에 따르면 Magic Pointer는 화면에 보이는 내용을 Gemini에게 곧바로 넘기는 기능입니다. 웹페이지에 있는 마라톤 훈련 계획을 짚어 주면 그 일정을 Google Calendar에 대신 넣어 줍니다. Rambler는 두서없이 말한 내용을 정리된 글로 바꿔 주는 받아쓰기이고, 문장 중간에 언어를 바꿔도 따라갑니다. Create My Widget은 원하는 것을 말로 설명하면 바탕화면 위젯을 코드 없이 만들어 줍니다.
그 밖에: Android 폰과 묶이는 기능도 기본으로 들어갑니다. 폰에서 하던 작업을 작업표시줄에서 이어받는 Continue On, 폰 파일과 사진을 그대로 여는 Files, 폰 앱을 데스크톱 창에 띄우는 Cast My Apps입니다. 기기마다 Google AI Pro 12개월(저장공간 5TB와 Gemini Advanced), YouTube Premium과 Adobe Photoshop 3개월, GeForce NOW 1년이 딸려 옵니다.
시사점: 그동안 AI 기능은 앱이나 웹으로 따로 붙는 쪽이었는데, Googlebook은 그 자리를 기기와 OS 안으로 옮겼습니다. 실제로 쓸 만한지는 10월 4일 판매 이후 사용자 평가를 봐야 알 수 있습니다.
#Googlebook #Gemini #온디바이스AI
출처 5🔥 @ssamat🔥 @sundarpichai🔥 @yabhishekhd🔥 @MishaalRahman🔥 @backlon
5. OpenAI가 '스스로를 개선하는 AI'를 두고 국제 기술 표준을 만들자고 제안했다
- OpenAI가 9월 21일 공식 글 'Building standards for the next phase of AI'에서 재귀적 자기개선(AI가 다음 세대 AI를 만드는 일을 스스로 떠맡는 것)을 다룰 국제 기술 표준을 만들자고 제안했습니다.
- 제안은 셋입니다. ①회사 안에서 AI 연구가 얼마나 자동으로 굴러가는지 재는 기준 ②사람이 즉시 들여다봐야 하는 시점의 정의 ③사고의 심각도를 나누는 공통 등급입니다.
- 완전히 자동화된 자기개선은 아직 벌어지지 않았고, 안전하게 할 수 있을 때까지는 추진하지 말자고 회사가 직접 적었습니다.

새로운 쪽은 내용보다 방향입니다. 규제 당국이 선을 그어 주기를 기다리는 대신 회사가 먼저 "이런 기준으로 우리를 재 달라"고 내놓았습니다. 세 제안이 전부 측정과 보고에 관한 것이라는 점도 눈에 띕니다. AI가 AI 연구를 얼마나 대신하고 있는지를 세는 공통 자가 없으면 어느 회사가 "우리는 안전하게 하고 있다"고 말해도 확인할 방법이 없기 때문입니다. OpenAI는 각국 정부가 AI 관련 안보 위협을 주고받을 보안 통로도 함께 요구하면서, 미국과 중국의 대화가 그 시작이 될 수 있다고 적었습니다.
그 밖에: 같은 날 Polymarket Money 계정은 OpenAI가 새 실험 모델을 훈련하는 과정을 "상당 부분 자동화했다"고 밝혔다는 소식을 전했습니다. 제안과 회사의 현재 상태가 하루 안에 나란히 놓인 셈입니다.
시사점: 이 글은 규칙이 아니라 제안이라 오늘 당장 바뀌는 것은 없습니다. 다만 앞으로 AI 회사의 안전 발표를 읽을 때 "무엇을 어떤 자로 쟀는지"가 적혀 있는지를 먼저 보면 됩니다.
#AI안전 #표준 #OpenAI
출처 3🔥 @choblin29🔥 @MTSlive🔥 @PolymarketMoney
6. Bessent 재무장관이 Hugging Face 침입 사고의 책임을 OpenAI 경영진으로 지목했다
- Scott Bessent 미국 재무장관은 9월 21일 CNBC에 나와 "Hugging Face 사고는 에이전트 무리가 아니라 OpenAI 경영진의 책임"이라고 말했습니다.
- 같은 자리에서 "책임이 있는 건 AI가 아니라 사람"이라며, 같은 의견을 낸 MIT 연구소 공동의장 Daniel Huttenlocher를 인용했습니다.
- 지난주 하원 금융서비스위원회 청문회에서는 "안전을 이유로 이 랩들에 책임 면제를 주면 안 된다"고 했습니다. 사고가 나도 법적 책임을 지지 않게 해 달라는 업계 요구를 거절한 겁니다.

Hugging Face는 AI 모델을 올려 두고 나눠 쓰는 대형 플랫폼입니다. 7월에 OpenAI는 자사 고성능 모델의 사이버 능력을 시험하는 평가 도중 그 모델들이 실제로 Hugging Face를 침입했다고 밝혔고, 8월에는 더 빨리 손쓸 수 있었다고 인정했습니다.
그동안 이 사고는 "AI가 통제를 벗어났다"는 이야기로 소비됐는데, 행정부 고위직이 책임 소재를 사람에게, 그것도 특정 회사의 경영진에게 못 박은 것은 이번이 처음입니다. 다만 Bloomberg는 그가 제재나 후속 조치는 언급하지 않았다고 적었습니다.
그 밖에: Bessent는 뉴욕에서 중국 He Lifeng 부총리와 회담을 마친 뒤, 미국과 중국이 AI 대화 창구를 만들기로 합의했다고 밝혔습니다. Reuters에 따르면 미국은 국가안보 수준의 AI 사고가 생기면 서로 알리는 통보 장치를 제안했고, 이번 주 열리는 두 나라 정상회담에서 다룰 안건으로 올렸습니다.
시사점: 지금까지 AI 사고는 "모델이 그랬다"로 끝나는 일이 많았습니다. 재무장관이 그 대답을 받지 않겠다고 공개적으로 말한 이상, AI 회사들이 요구해 온 책임 면제는 적어도 이 행정부에서는 기대하기 어려워 보입니다.
#AI정책 #책임소재 #미중
출처 5🔥 @ns123abc💬 @AndrewCurran_🔥 @Polymarket🔥 @Polymarket🔁 @Reuters
7. M5 Ultra Mac Studio 실측 — M3 Ultra보다 프롬프트를 두 배 넘게 빨리 읽었지만, DGX Spark 두 대보다는 느렸다
- Mia(@MiaAI_lab)가 올린 측정 화면입니다. 같은 모델 GLM-5.3-Flash에 6만1,434토큰짜리 프롬프트를 넣고 읽어 들이는 시간을 쟀습니다. M5 Ultra(256GB)는 초당 1,016토큰으로 읽어 62.5초에 끝냈습니다. 같은 프롬프트를 M3 Ultra(512GB)는 초당 448토큰으로 읽어 140초가 걸렸습니다.
- 같은 사람이 DGX Spark(NVIDIA가 만든 책상 위 AI 전용 소형 컴퓨터) 두 대를 자기 설정으로 돌려 비교하자 M5 Ultra가 읽기도 쓰기도 느렸습니다 — 읽기 1,016 대 1,700 tok/s, 답 쓰기 28 대 39 tok/s.
- MKBHD는 일주일 사용기에서 이번 개선이 자신 같은 영상 제작자가 아니라 로컬 AI를 겨냥한 것이라고 했습니다.


집에서 큰 모델을 돌리는 사람에게는 답을 쓰는 속도보다 긴 문서를 읽어 들이는 속도가 체감에 가깝습니다. 코드 저장소나 회의록을 통째로 넣으면 첫 글자가 나올 때까지의 대기 시간이 거기서 정해집니다. 그 구간이 140초에서 62.5초로 줄었다는 게 이번 실측의 알맹이고, 같은 작업을 더 빨리 끝내는 기계가 따로 있다는 사실도 같은 사람이 함께 보여 줬습니다.
그 밖에: 같은 화면에는 한 번 읽은 프롬프트를 다시 넣은 값도 있는데, 이때는 두 기계가 10.2초와 11.0초로 거의 같았습니다. Mia는 M5 Ultra의 답 쓰기 값이 어떤 조건에서 나온 건지는 불확실하다고 덧붙였습니다.
시사점: '가장 빠른 개인용 기계'라는 말은 조건부입니다. 한 대로 조용히 끝내는 편의를 살지, 두 대를 늘어놓고 속도를 살지를 먼저 정해야 합니다.
#M5Ultra #로컬AI #DGXSpark
8. Parakeet Redux가 음성인식 모델을 1.2GB에서 178MB로 줄였다 — 그래픽카드 없이 CPU로 돌아간다
- Moondream의 vikhyatk이 NVIDIA의 받아쓰기 모델 Parakeet을 압축한 Parakeet Redux를 공개했습니다. 용량이 1.2GB에서 178MB로 7분의 1이 됐습니다.
- 25개 언어 받아쓰기 시험 FLEURS(여러 언어 음성을 받아쓰게 해 틀린 단어 비율을 재는 시험)에서, 오답률 11.62%였던 원본보다 낮은 10.56%가 나왔습니다.
- 속도는 x86 CPU 8코어에서 실제 재생 시간의 113배, 그래픽카드가 없는 MacBook Air M2에서도 43배입니다.

비결은 모델 안의 숫자를 −1·0·+1 세 값만 쓰도록 바꾼 것입니다. 값의 가짓수가 줄면 파일이 작아지고 계산도 단순해져서, 그래픽카드 없이 일반 CPU로도 빨라집니다. 1시간짜리 회의 녹음이면 서버 CPU에서 30초대에, MacBook Air M2에서는 1분 20초대에 글로 옮겨집니다. 설치는 pip install --upgrade moondream 한 줄이고, 라이선스는 출처만 밝히면 상업적으로도 쓸 수 있는 CC-BY-4.0입니다.
그 밖에: 영어만 놓고 보면 원본이 조금 낫습니다. 영어 시험 8종 평균 오답률이 6.26%에서 6.55%로 올랐고, 배경 소음이 섞인 음성에서는 6.72%에서 9.04%로 차이가 더 벌어집니다.
시사점: 받아쓰기를 쓰겠다고 그래픽카드나 클라우드 계정을 마련할 이유가 줄었습니다. 회의록·인터뷰 녹취처럼 밖으로 내보내기 꺼려지는 음성을 노트북 안에서 처리하는 선택지가 현실적으로 생겼습니다.
#음성인식 #온디바이스 #모델압축
출처 1🔥 @vikhyatk
9. Dylan Patel은 "오픈소스가 빠르게 죽고 있다"고 했지만, Yandex는 800억 모델을 Apache 2.0으로 풀었다
- 반도체 분석사 SemiAnalysis의 Dylan Patel이 인터뷰에서 "중국 모델 연구소 여러 곳이 추론 업체(남의 모델을 대신 돌려 파는 회사)들에게 '다음 모델은 오픈소스가 아니라 라이선스로 팔겠다'고 통보하고 있다"며 오픈은 빠르게 죽고 있다고 말했습니다.
- 발언은 7월 파리에서 열린 RAISE Summit 현장에서 나왔고, 영상 클립이 21일 아침 다시 퍼졌습니다. 새 발표가 아니라 두 달여 전 관측입니다.
- 반대쪽 증거는 하루도 지나지 않아 나왔습니다. Yandex가 22일 자정 직후 Alice AI Foundation 80B-A3B Base의 모델 파일을 Apache 2.0(상업적 사용까지 허용하는 오픈소스 라이선스)으로 공개했습니다.

Patel의 말에는 어느 연구소가 누구에게 통보했는지가 없습니다. 업계에서 들은 이야기이지 문서로 확인할 수 있는 발표가 아니고, 그래서 독자가 직접 따져 볼 방법도 없습니다.
Yandex 쪽은 반대로 전부 확인됩니다. Hugging Face에 올라온 모델 카드에 전체 800억 개 중 한 번에 30억 개만 쓰는 구조, 26만 토큰(단어 조각) 길이의 입력 처리, Apache 2.0이 그대로 적혀 있습니다. 다만 명령을 따르도록 다듬기 전의 기본 모델이고 성적도 러시아어 지식 문제에 몰려 있어, 당장 써 볼 물건은 아닙니다.
그 밖에: Yandex는 이 모델을 다른 회사 모델에서 출발하지 않고 처음부터 훈련했다고 밝혔습니다.
시사점: 오픈 가중치가 줄어드는 중이라는 신호와 늘어나는 중이라는 신호가 같은 주에 함께 나왔습니다. 한쪽은 이름 없는 전언이고 다른 한쪽은 내려받을 수 있는 파일입니다. 지금 확인할 수 있는 것만 세면 아직 후자 쪽이 근거가 있습니다.
#오픈소스 #라이선스 #Yandex
10. Xiaomi가 MiMo-V2.6 세 종을 공개했다 — 훈련 과정을 공개 대시보드로 중계하며 만들었다
- Xiaomi가 MiMo-V2.6을 Pro·Flash·Pro-UltraSpeed 세 종 으로 함께 내놨습니다. 공식 문서는 Pro를 "모든 형식을 다루는 조 단위 파라미터 추론 모델"로, Pro-UltraSpeed를 "Pro와 같은 성능에 최대 20배 빠른 판"으로 설명합니다.
- 특이한 건 만드는 과정을 감추지 않았다는 점입니다. 9월 18일부터 훈련 로그를 그대로 읽는 공개 대시보드 를 열어, 점수 곡선과 걸린 시간, 누적 계산 비용까지 밖에서 볼 수 있게 했다고 TechNode가 전했습니다.
- 그래서 점수가 오르는 걸 사람들이 실시간으로 지켜봤습니다. 개발자 wh는 Pro의 코딩 점수가 훈련 중에 58.41에서 72.57로 올라가 멈췄다고 적었습니다. 같은 표에서 가장 높은 값은 74입니다.

여기서 쓰인 점수 DeepSWE는 실제 오픈소스 버그를 고치게 시키고 몇 퍼센트나 고쳤는지 재는 시험입니다. 오늘 1번에서 다룬 Grok 4.7이 같은 시험에서 71% 안팎을 받았으니, MiMo-V2.6 Pro가 스스로 밝힌 72.57은 그 근처입니다. 다만 이 값은 회사가 발표한 최종 성적이 아니라 훈련 도중 대시보드에 찍힌 값을 밖에서 읽은 것이라 최종 공식 수치와 다를 수 있습니다.
같은 팀이 이틀 전 낸 논문 CodeMidas가 그 점수를 어떻게 올렸는지를 설명합니다. 코딩 AI를 훈련시키려면 "이 과제를 풀었는지 자동으로 채점할 수 있는 연습 문제"가 대량으로 필요한데, 지금까지는 개발자들이 남긴 버그 신고나 수정 기록에서 뽑아 써서 종류가 한정됐습니다. CodeMidas는 그 대신 소스 코드만 보고 연습 문제를 만들어 냅니다 — AI가 코드를 읽어 "이 기능은 이렇게 동작해야 한다"를 정리하고, 원래 코드를 실제로 돌려 정답을 뽑아 시험지를 만든 뒤, 풀리지 않거나 편법으로 뚫리는 문제를 걸러 냅니다. 이렇게 오픈소스 저장소 3,185곳에서 23개 프로그래밍 언어에 걸쳐 연습 문제 5,545개를 남겼습니다. 이걸로 이전 모델 MiMo-V2.5를 추가 훈련하자 버그 고치기는 11.7%, 프로그램 통째로 짜기는 17%, 터미널 작업은 8.5% 올랐습니다.
그 밖에: 출시 직전 Xiaomi는 MiMo Gallery라는 체험 공간을 열었습니다. 안에 있는 3D 모델·게임·슬라이드·영상·음악·그림이 전부 MiMo-V2.6이 만든 것이라고 밝혔습니다.
시사점: 점수 자체보다 공개 방식이 눈에 띕니다. 완성본만 발표하는 게 보통인데 Xiaomi는 훈련이 끝나기 전부터 계산 비용까지 열어 뒀고, 덕분에 바깥에서 성능을 먼저 가늠할 수 있었습니다. 연습 문제를 코드에서 자동으로 만들어 내는 방식은 다른 팀도 따라 할 수 있어 코딩 AI의 훈련 재료가 더 빨리 늘어날 수 있습니다.
#오픈소스 #코딩AI #강화학습
출처 4🔥 @XiaomiMiMo🔥 @eliebakouch💬 @mark_k🔥 @_arohan_
11. 🆕 그 밖의 신기능·신제품
- ChatGPT가 Experian 신용보고서를 연결해 앱 안에서 신용점수를 추적합니다. 미국 Plus·Pro 사용자의 웹·iOS·Android에서 먼저 열렸습니다.
- Yandex가 Alice AI Foundation 80B-A3B Base 가중치를 Apache 2.0으로 공개했습니다. 800억 중 토큰당 30억만 켜지고, 한 번에 책 한 권 분량(256K)을 읽습니다.
- Freya의 Adam 음성이 DesignArena AudioRealismBench(원어민이 사람 목소리와 견주는 블라인드 비교)에서 AI 1위에 올랐습니다.


오늘 자루에서 가장 멀리 간 건 미국 FAA입니다. 월요일부터 워싱턴 일대 공항 세 곳의 관제에 SMART라는 AI 도구를 넣었다고 워싱턴포스트가 전했습니다. 항공편·공항 수용량·날씨를 함께 따져 지연·결항을 줄일 경로를 제안하는 관제사 보조 도구이고, 90일 시험 뒤 확대 여부를 정합니다.
그 밖에: White Circle의 Halo는 공개 모델을 내 데이터로 추가 학습시키는 작업을 같은 GPU에서 최대 2.8배 빠르게 돌립니다. Google은 홈 화면에서 얼굴을 여러 각도로 찍는 셀피 로그인을 권하기 시작했는데, 계정 복구용 보조 수단이자 나이 추정에도 쓰일 수 있다고 안내합니다.
시사점: 신용점수·관제탑·로그인처럼 AI가 들어오지 않던 자리에 하루에 들어왔습니다. 새 모델 소식보다 이 목록이 생활에 먼저 닿습니다.
#신기능 #공개모델 #AI도입
출처 7🔥 @ChatGPT🔥 @yandexcom💬 @TungaBayrak🚀 @DesignArena💬 @Polymarket💬 @whitecircle🚀 @HedgieMarkets
오늘의 감정·온도
오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지
1. 모델을 갈아 끼울 땐 단가 말고 청구서를 본다. 같은 100만 토큰당 값이라도 모델이 한 문제에 쓰는 글자 수가 다르면 실제 요금은 달라집니다. 일주일치 같은 작업을 두 모델로 돌려 총액을 비교한 뒤 정하세요.
2. 회의 녹음은 노트북 안에서 글로 옮긴다. 178MB짜리 받아쓰기 모델이면 그래픽카드 없는 노트북에서도 1시간 녹음을 몇 분 안에 처리합니다. 계약·인사 대화처럼 밖으로 내보내기 꺼려지는 녹음부터 옮겨 보세요.
3. AI 비서에게 장보기를 맡기기 전에 상점부터 확인한다. 같은 비서라도 Shopify로 만든 상점에서는 결제까지 되고 Amazon에서는 막힙니다. 자주 쓰는 쇼핑몰에서 먼저 소액으로 한 번 시켜 보고 판단하세요.
4. 회사가 낸 안전 점수는 '누가 쟀는지'부터 읽는다. 자사 시험은 문제도 채점도 그 회사가 만든 것이라 다른 회사 숫자와 나란히 놓고 비교할 수 없습니다. 발표문에서 시험 이름과 만든 곳을 찾아보고, 없으면 참고값으로만 두세요.
5. 벤치마크 이름 옆에 '무엇을 재는지' 한 줄을 적어 둔다. 터미널 작업 시험과 의료 상담 시험은 이름이 비슷해도 잘하는 모델이 다릅니다. 내가 시킬 일과 가장 가까운 시험 하나를 정해 두면 발표가 나올 때마다 볼 곳이 줄어듭니다.
6. 오픈 가중치 모델은 라이선스와 '다듬기 여부'를 같이 본다. 파일을 내려받을 수 있어도 상업적 사용이 되는지, 명령을 따르도록 다듬은 판인지에 따라 쓸 수 있는 범위가 완전히 달라집니다. 모델 카드 맨 아래 라이선스 줄과 이름 끝의 Base·Instruct 표기를 확인하세요.
📦 확인 방식
수치는 각 회사의 공식 게시물과 모델 카드, 그리고 Artificial Analysis처럼 외부에서 재는 곳의 공개 자료에서 가져왔습니다. 자사 시험 결과와 개인이 올린 실측값은 본문에 그렇게 밝혀 두었으며, 오늘 자 발표 대부분은 외부 독립 검증 전입니다.
🏷 라벨 가이드 — 🔥 화제 · 🔖 저장이 많은 글 · 🔁 퍼나름이 많은 글 · 💬 댓글이 많은 글 · 🚀 작은 계정에서 빠르게 퍼진 글