오늘의 AI 브리핑 ·
판단만 돌려주는 모델, Jev 공개
5분 브리핑
약 3분 · 12개 흐름핵심만 먼저 읽고, 궁금한 소식은 본문으로 이어 보세요.
전체 분석 17분으로 바로 가기 ↓- TypeSafe AI가 텍스트를 만들지 않는 모델 Jev를 공개했다 — 입력 100만 토큰 $0.042, 출력은 무료
ChatGPT 공동 발명자 Diogo Almeida가 2년 스텔스를 끝내고 첫 System One Model인 Jev를 9월 15일 대기자 명단 방식으로 열었습니다. 토큰을 하나씩 만들어 내는 대신, 타입이 정해진 질문 목록을 받아 확률이 붙은 결정을 병렬로 돌려줍니다.
- Mark Zuckerberg가 "Muse 출시를 몇 달 미뤘지만 남들에게 멈추라고는 안 했다"고 적었고, JD Vance는 Anthropic을 지목했다
Mark Zuckerberg는 한국 시간 9월 16일 오전 X에 올린 글에서, 모든 연구소가 자기 모델을 안전하게 훈련할 속도로 움직일 책임과 유인을 이미 갖고 있다고 적었습니다. 같은 글에서 Meta는 안전·보안 때문에 Muse 출시를 몇 달 미뤘지만 남들에게 먼저 멈추라고 요구하지는 않았다고 했습니다.
- Vals AI가 GPT-6 Astra의 Minecraft 141시간을 공개했다 — 엔더 진주 3개에서 멈췄고 크리퍼 한 마리에 전부 날아갔다
평가 회사 Vals AI가 GPT-6 Astra의 Minecraft 장기 실행 기록을 공개했습니다. 테크트리 15단계 중 13단계 엔더 진주까지 갔고, 14단계 Eye of Ender와 15단계 The End에는 닿지 못했습니다.
- Anthropic이 Cowork와 채팅을 하나의 Claude로 합치고 Claude Docs·Claude Slides를 베타로 열었다
Anthropic이 9월 16일 Cowork와 일반 대화를 하나의 Claude로 합쳤습니다. 사용자가 "어디서 할 일인지"를 먼저 고르지 않고 Claude가 필요한 기능을 판단해 씁니다.
- OpenAI가 ChatGPT에 광고를 넓히고 Sponsored Agents를 붙인다
OpenAI가 9월 16일 ChatGPT 광고를 확대하며 Sponsored Agents 테스트를 시작했습니다. 광고를 누르면 그 브랜드가 후원하는 에이전트와 대화가 이어집니다.
- Mistral AI가 Mozilla와 손잡고 Firefox 사용자에게 AI 브라우징을 넣는다
Mozilla가 Firefox의 AI 보조 기능 Smart Window 베타에 Mistral 모델을 넣는다고 09-16 발표했습니다. 미국·캐나다에 들어가는 모델은 Mistral Small 4입니다.
- Nous Research가 Hermes Agent 서브에이전트 1,393개를 19시간 돌린 결과를 공개했다 — 파이썬 코드 34.4% 삭제
Nous Research가 9월 2일에 돌린 코드 정리 작업 기록을 공개했습니다. 서브에이전트 1,393개가 19시간 동안, 최대 218개가 동시에 돌았습니다.
- Microsoft AI의 Mustafa Suleyman이 'model welfare'를 정면으로 반박했다 — "AI는 권리도 법인격도 가져선 안 된다"
Microsoft AI CEO Mustafa Suleyman의 글 'A warning about model welfare'가 어젯밤 해커뉴스 첫 화면에 올라 143점·댓글 374개를 기록했습니다. 글은 Anthropic이 1월에 공개한 Claude 헌법을 순환논증·의인화·의식의 생물학적 기반 세 갈래로 비판합니다.
- Scott Aaronson이 "이론 전산학 난제 해법을 랩들이 쥐고 있다"는 소문을 적었고, Sam Altman은 내부 모델이 최고 수학자를 넘는다고 말했다
Scott Aaronson이 9월 15일 블로그 글 "The Age of Wonders and Terrors"에, 이론 전산학의 아주 오래된 미해결 문제들의 해법을 들었다는 소문을 적었습니다. P≠NP나 복잡도 클래스 분리는 아니라고 단서를 달았습니다.
- Pragmatic Engineer가 OpenAI 내부 '에이전트 소프트웨어 공장' 구조도를 공개했다
Codex가 코드를 쓰고 GitHub·Slack·Notion과 Databricks·Datadog 같은 내부 데이터에서 맥락을 가져옵니다. CI와 리뷰를 통과할 때까지 에이전트가 직접 고칩니다.
- Amazon에 RTX PRO 6000이 $19,999에 올라왔고 Apple은 같은 iPhone 값을 $100 올렸다 — 메모리값이 밀어 올린 가격표
@jun_song이 Amazon 상품 카드를 올렸습니다. NVIDIA RTX PRO 6000 Blackwell Server Edition이 $19,999이고 재고는 한 장입니다.
- 🆕 그 밖의 신기능·신제품
Tencent가 BrowserSkill을 MIT 라이선스로 공개했습니다. 에이전트가 내 브라우저 탭을 잠깐 빌려 쓰고 돌려주는 CLI라 로그인 상태 그대로 동작하고, 캡차는 사람에게 넘깁니다.
주요 키워드 TOP 5: Jev · Claude Docs · Minecraft 141시간 · ChatGPT 광고 · 메모리 가격 | 메인 이벤트: TypeSafe AI가 글을 쓰지 않고 판단만 돌려주는 모델 Jev를 열며, 입력 100만 토큰당 $0.042에 출력은 무료라는 가격을 붙였습니다.
오늘의 중심은 글을 쓰지 않는 모델입니다. TypeSafe AI는 9월 15일 Jev를 대기자 명단 방식으로 열면서, 타입이 정해진 질문에 확률이 붙은 결정을 돌려주는 방식에 입력 100만 토큰당 $0.042, 출력은 무료라는 값을 매겼습니다. 회사가 내세운 속도와 가격 배수는 자사 워크플로에서 잰 값이라 확인은 밖에서 재는 쪽에서 시작됩니다. @N8Programs가 객관식 벤치마크로 GPT-5.6 Terra와 맞붙여 Terra급이라는 결과를 냈고, @MichaelLee04는 분류·라우팅에 약 5,000건을 돌려 2달러를 쓰고 응답 시간 중앙값 150ms를 기록했다고 적었습니다. 독자가 확인할 자리도 같습니다. 정답을 사후에 확인할 수 있는 작업에서 같은 값이 나오는지입니다.
1. TypeSafe AI가 텍스트를 만들지 않는 모델 Jev를 공개했다 — 입력 100만 토큰 $0.042, 출력은 무료
- ChatGPT 공동 발명자 Diogo Almeida가 2년 스텔스를 끝내고 첫 System One Model인 Jev를 9월 15일 대기자 명단 방식으로 열었습니다. 토큰을 하나씩 만들어 내는 대신, 타입이 정해진 질문 목록을 받아 확률이 붙은 결정을 병렬로 돌려줍니다.
- 질문 형식은 세 가지입니다. 보기 중 하나 고르기(choice), 기준에 맞춰 점수 내기(score), 예·아니오 확률(boolean). 공식 문서는 질문을 원자 단위로 잘게 쪼개고 조합은 애플리케이션 코드가 하라고 안내합니다.
- 가격은 Almeida가 TypeSafe AI 발표에서 밝힌 대로 입력 100만 토큰당 $0.042이고 출력은 무료입니다. 회사는 자체 워크플로 기준으로 LLM보다 20~200배 빠르고 40~400배 싸다고 주장합니다.

TypeSafe AI는 Jev를 RLHF가 아니라 자사가 RLCD(보정된 결정을 위한 강화학습)라 부르는 알고리즘으로 훈련했다고 밝혔고, 출시에 맞춰 DCVC가 이끈 4,000만 달러 시드 투자도 공개됐다고 여러 매체가 전했습니다. 속도와 가격 배수는 회사가 자기 워크플로에서 잰 값이라 그대로 믿기 어렵습니다.
그래서 독립 측정이 중요한데, @N8Programs가 MMLU·GPQA Diamond·ARC·GSM8K 같은 객관식 벤치마크로 Jev와 GPT-5.6 Terra를 맞붙여 봤습니다. Terra 쪽은 System 1 조건을 맞추려고 추론을 끄고 알파벳만 답하게 했고, 결과는 Jev가 Terra급이라는 것이었습니다. 실사용 후기도 나왔습니다. @MichaelLee04는 분류·모델 라우팅·의도 판별에 약 5,000건을 돌려 2달러를 썼고, 응답 시간은 중앙값 150ms·상위 5% 350ms였다고 적었습니다. 그는 LLM 분류 호출이 평균 4초라 지금까지는 어림짐작 코드로 호출 여부를 걸러 왔는데, 이제는 매 턴 돌려도 된다고 했습니다.

그 밖에: 회의적인 반응도 있습니다. Replit의 @amasad는 출력 후보가 미리 정해져 있다면 열거형에 로그 확률을 내는 모델을 훈련하면 되지 않느냐고 물었고, @NielsRogge는 JSON 분류기 하나에 조회 1,200만이 붙는 건 거품이라고 적었습니다. TypeSafe AI가 공개한 워크플로 비교도 GPT-6 Astra와 Claude Fable 5.1의 답을 정답으로 놓고 잰 것이라 독립적인 기준선은 아닙니다.
시사점: LLM 호출 앞뒤에 붙일 값싼 판단 장치가 필요했다면 지금이 대기자 명단에 이름을 올릴 때입니다. 다만 Jev는 글을 쓰지 못하고, 스키마를 지킨다는 말이 답이 맞다는 뜻도 아니므로, 분류·라우팅처럼 정답을 사후에 확인할 수 있는 자리부터 시험해 보는 게 안전합니다.
#SystemOneModel #Jev #AI인프라
출처 7💬 @wallstengine🔥 @shiri_shh🔖 @MichaelLee04🔥 @N8Programs🔥 @k_grajeda💬 @amasad🔥 @NielsRogge
2. Mark Zuckerberg가 "Muse 출시를 몇 달 미뤘지만 남들에게 멈추라고는 안 했다"고 적었고, JD Vance는 Anthropic을 지목했다
- Mark Zuckerberg는 한국 시간 9월 16일 오전 X에 올린 글에서, 모든 연구소가 자기 모델을 안전하게 훈련할 속도로 움직일 책임과 유인을 이미 갖고 있다고 적었습니다.
- 같은 글에서 Meta는 안전·보안 때문에 Muse 출시를 몇 달 미뤘지만 남들에게 먼저 멈추라고 요구하지는 않았다고 했습니다. David Sacks가 이 대목만 발췌해 옮긴 게시물이 좋아요 12,911개를 받았습니다.
- 같은 날 아침 공개된 All-In 팟캐스트에서 JD Vance 부통령은 Anthropic을 이름으로 지목해, 공격에 쓰일 도구를 만든 회사라면 방어 수단도 함께 내놓아야 한다고 말했습니다.


Zuckerberg의 글을 퍼뜨린 사람은 Sacks였습니다. 그는 어제 Dario Amodei를 이름으로 지목한 당사자이고, 긴 글 가운데 Muse 대목만 잘라 옮겼습니다. 발췌본에 없는 대목도 있습니다. Zuckerberg는 외부 평가 기관을 쓰는 것이 업계 모범 사례이며 Meta Superintelligence Labs가 이미 여러 영역에서 쓰고 있다고 적었지만, 어느 기관인지와 접근·공개 권한의 범위는 밝히지 않았습니다. implicator.ai 보도에 따르면 Muse는 4월 출시를 검토하다 9월 8일에 나왔습니다. 투자자 nic carter는 사람들이 원하는 것은 자기와 정렬된 모델이라는 대목을 Anthropic의 헌법식 접근을 겨눈 반박으로 읽었습니다.
Vance의 발언은 규제 요구를 되돌려 보내는 쪽입니다. 그는 최신 모델에서 나온 사이버 공격 도구를 두고, 방어 수단이 급한 회사들이 오히려 접근을 거부당하고 있다고 말했습니다. Yann LeCun은 방향을 아예 바꿔, 비행기는 설계가 빨라질수록 안전해졌다며 더 좋은 AI가 더 안전한 AI라고 적었습니다.
그 밖에: Gavin Baker는 OpenAI CFO Sarah Friar가 CNBC에서 컴퓨트 확보에 집중한다고 말한 것과, 컴퓨트 전략 부사장 Sachin Katti가 모델을 안전하고 정렬되게 만드는 길이 컴퓨트를 더 쓰는 것이라고 말한 것을 나란히 놓았습니다.
시사점: 속도를 늦추라는 요구에 각자 다른 답이 나왔습니다. 확인할 것은 Meta가 말한 외부 평가 기관의 이름과 권한, 그리고 Anthropic이 Vance의 접근 차단 주장에 답하는지입니다.
#AI정책 #Meta #JDVance
출처 6🔥 @DavidSacks🔥 @nic_carter🔥 @Yuchenj_UW🚀 @rohanpaul_ai🔥 @ylecun🔥 @GavinSBaker
3. Vals AI가 GPT-6 Astra의 Minecraft 141시간을 공개했다 — 엔더 진주 3개에서 멈췄고 크리퍼 한 마리에 전부 날아갔다
- 평가 회사 Vals AI가 GPT-6 Astra의 Minecraft 장기 실행 기록을 공개했습니다. 테크트리 15단계 중 13단계 엔더 진주까지 갔고, 14단계 Eye of Ender와 15단계 The End에는 닿지 못했습니다.
- 141시간 동안 블록 34,573개를 캐고 135.1km를 움직였으며 사망 548회, 수면 116회, 다이아몬드 10개를 기록했습니다.
- 반자동 블레이즈 농장으로 로드 6개를, 왜곡된 숲에서 엔더맨을 잡아 진주 3개를 모아 상자에 넣었는데 크리퍼가 그 상자와 침대를 함께 폭파시켰습니다.

기록은 Normal Survival에서 keepInventory를 켠 채 돌린 한 번의 실행입니다. 그래프에 DreamerV3·Voyager·VPT가 함께 올라 있지만, 인터페이스와 학습 방식이 달라 속도 순위가 아니라고 주석이 못 박아 뒀습니다. 읽을 만한 대목은 무너진 지점입니다. keepInventory는 죽어도 가방을 지켜 주지만 상자는 지켜 주지 않고, 침대가 사라지면 부활 지점도 함께 사라집니다. 548번의 죽음은 되돌릴 수 있었고 상자 하나는 되돌릴 수 없었습니다.
다음 단계인 Eye of Ender는 블레이즈 로드로 만든 가루와 엔더 진주를 합쳐 만드는 물건이라, 재료 두 가지가 모두 손에 들어온 순간에 그 두 가지가 한꺼번에 사라진 셈입니다. 수천 명이 지켜보던 스트림에서 Astra는 그 뒤 몇 시간 동안 감자만 캤고, 시청자들은 속도를 내라고 불평했습니다. Astra는 크리퍼를 경계하며 앞에 보이는 초록색 긴 물체를 사탕수수라고 스스로 기록했습니다.
그 밖에: 이 장면을 세 줄로 줄인 @scaling01의 글이 좋아요 48,151개로 퍼져 원 기록보다 널리 읽혔습니다. roon은 Astra가 쓰는 코드를 읽어 보면 교정 가능성(corrigibility)이 믿음의 문제가 됐다고 적었습니다.
시사점: 긴 과제에서 에이전트를 멈춰 세운 것은 능력의 한계가 아니라 복구 설계였습니다. 한 번의 사고가 전부를 날리지 않도록 중간 결과를 어디에 두는지부터 정해야 합니다.
#에이전트평가 #장기과제 #Minecraft
출처 3🔥 @ValsAI🔖 @scaling01🔥 @tszzl
4. Anthropic이 Cowork와 채팅을 하나의 Claude로 합치고 Claude Docs·Claude Slides를 베타로 열었다
- Anthropic이 9월 16일 Cowork와 일반 대화를 하나의 Claude로 합쳤습니다. 사용자가 "어디서 할 일인지"를 먼저 고르지 않고 Claude가 필요한 기능을 판단해 씁니다.
- 같은 날 Claude Docs와 Claude Slides가 새로 나왔고, 따로 있던 Claude Design도 대화 안에서 동작합니다. 셋 다 유료 플랜 베타이며 Enterprise는 관리자가 켤 시점을 정합니다.
- 발표 자료는 대화에서 바로 고치고 발표할 수 있으며 PowerPoint나 PDF로 내려받습니다. Pro·Max에 먼저 적용하고 Team·Free는 이후, Enterprise 관리자에게는 최소 30일 전에 알립니다.
Claude Docs는 대화 안에서 문서를 만들고 함께 고치는 도구이고, Claude Slides는 어느 대화에서든 발표 자료 초안을 잡아 줍니다. 다만 바뀐 핵심은 이 도구 목록보다 들어가는 방식입니다. 그전에는 문서나 파일을 다루려면 Cowork라는 별도 작업 공간을 고른 뒤 시작했는데, 이제는 대화창 한 곳에서 요청하면 Claude가 필요한 도구를 스스로 고릅니다.
권한 기본값은 보수적으로 남겨 뒀습니다. 회사 설명으로는 Claude가 행동하기 전에 먼저 묻고, 계속 일하다가 확인이 필요할 때만 알리는 방식은 사용자가 따로 켜야 합니다. 기존 Cowork 사용자의 대화·프로젝트·아티팩트·커넥터·스킬은 있던 자리에 그대로 남고, 앱을 열면 하던 작업을 이어서 합니다.
그 밖에: Claude Design은 대화 안으로 들어왔지만 없어지는 것은 아니고 기존처럼 독립된 화면에서도 계속 쓸 수 있습니다. 세 기능 모두 베타라 회사도 아직 완성본으로 내놓지는 않았습니다.
시사점: 한국 구독자에게는 새 모델이 아니라 화면이 바뀌는 변화입니다. Pro·Max를 쓰고 있다면 몇 주 안에 Cowork와 채팅의 구분이 사라지므로, 업무 흐름을 Cowork 화면 기준으로 맞춰 뒀다면 문서·슬라이드를 대화에서 부르는 방식으로 미리 옮겨 두는 편이 낫습니다.
#Claude #Cowork #문서작성
5. OpenAI가 ChatGPT에 광고를 넓히고 Sponsored Agents를 붙인다
- OpenAI가 9월 16일 ChatGPT 광고를 확대하며 Sponsored Agents 테스트를 시작했습니다. 광고를 누르면 그 브랜드가 후원하는 에이전트와 대화가 이어집니다.
- 광고는 로그인한 성인 Free·Go 사용자에게만 나옵니다. Plus·Pro·Business·Enterprise·Edu 계정에는 붙지 않습니다.
- HubSpot이 첫 CRM 파트너, Shopify가 첫 이커머스 파트너로 같은 날 연동을 열었습니다. Sponsored Agents 자체는 미국 일부 광고주와 함께 도는 테스트입니다.
광고 자체는 이미 시험 중이던 기능이고, 오늘 달라진 것은 광고를 누른 다음입니다. 곧장 사이트로 나가는 대신 그 브랜드가 후원하는 대화창이 열리고, 조건을 말하고 따져 물은 뒤 원할 때 사이트로 넘어갑니다. OpenAI는 여기에 선을 두 겹으로 그었습니다. 광고는 챗 모델과 분리된 시스템에서 돌고 광고주는 ChatGPT의 응답을 다듬거나 순위를 매기거나 바꿀 수 없다는 것이 하나, 스폰서 에이전트와의 대화는 ChatGPT의 독립적인 답변과도 사용자가 하던 원래 대화와도 분리된다는 것이 둘입니다.
분리된 것은 시스템이고 화면은 여전히 한 창이라는 반론이 Hacker News 토론(댓글 160여 개)에서 곧바로 나왔습니다. 광고를 눌러 들어간 창에는 '광고'나 '스폰서' 대신 비즈니스 대화 안내 문구만 남는데, 다른 앱을 쓰다 20분 뒤 돌아온 사람이 이 창이 광고였다는 걸 기억하겠느냐는 지적입니다.
그 밖에: 광고주용 캠페인·소재 제작 도구도 자연어로 지시하는 방식으로 바뀌었고, AI가 만든 제안은 집행 전에 사람이 승인해야 합니다. 에이전트가 제품에 대해 틀린 약속을 하면 책임이 광고주와 OpenAI 중 누구에게 가느냐는 질문도 나왔는데, 챗봇이 없는 정책을 지어냈던 Air Canada 판례가 근거로 인용됐습니다.
시사점: 유료 계정은 광고에서 빠지지만, 무료로 쓰는 다수에게는 답변 아래 광고가 기본값이 됩니다. 브랜드 쪽이라면 HubSpot·Shopify 연동이 열린 오늘부터 ChatGPT를 검색 광고 지면처럼 다뤄야 합니다.
#ChatGPT광고 #SponsoredAgents #OpenAI
출처 2🔥 OpenAI 공식 발표💬 Hacker News 토론
6. Mistral AI가 Mozilla와 손잡고 Firefox 사용자에게 AI 브라우징을 넣는다
- Mozilla가 Firefox의 AI 보조 기능 Smart Window 베타에 Mistral 모델을 넣는다고 09-16 발표했습니다. 미국·캐나다에 들어가는 모델은 Mistral Small 4입니다.
- Mistral은 프랑스와 북미에서 Smart Window를 먼저 맡고, 영국과 독일은 올해 안에 따라올 예정입니다. 프랑스는 Smart Window가 북미를 벗어나는 첫 시장이고, 영어가 아닌 프랑스어로 제공됩니다.
- 대화는 기본적으로 Mozilla 서버에 저장되지 않고, Mistral은 제로 데이터 보존을 약속했습니다.

Mozilla는 이번 제휴를 브라우저 안의 AI를 한 회사가 독점하지 않게 하려는 선택으로 설명합니다. Anthony Enzor-DeMeo Mozilla Corporation CEO는 브라우저가 한 방향으로만 흐르는 깔때기가 되어서는 안 된다고 적었습니다. Smart Window 베타가 열린 모든 시장에서 사용자는 여전히 다른 AI 모델을 고를 수 있다는 점도 Mozilla가 함께 밝혔습니다.
Mistral이 내세우는 차별점은 지역 언어와 방언으로 미세조정한 모델이라는 것으로, 영어로 만든 경험을 새 시장에 옮기는 방식이 아니라는 설명입니다.
그 밖에: 같은 발표가 해커뉴스에서 486점·댓글 172개로 그날 상위권에 올랐습니다.
시사점: 브라우저 AI 경쟁이 성능이 아니라 데이터 보존 정책과 모델 선택권에서 갈리는 지점입니다. Firefox를 쓴다면 Smart Window의 기본값과 모델 선택 화면을 먼저 확인해 두면 됩니다.
#Mistral #Firefox #브라우저AI
출처 1🔥 @MistralAI
7. Nous Research가 Hermes Agent 서브에이전트 1,393개를 19시간 돌린 결과를 공개했다 — 파이썬 코드 34.4% 삭제
- Nous Research가 9월 2일에 돌린 코드 정리 작업 기록을 공개했습니다. 서브에이전트 1,393개가 19시간 동안, 최대 218개가 동시에 돌았습니다.
- 테스트를 뺀 파이썬 코드가 1,063,826줄에서 698,363줄로 365,463줄(34.4%) 줄었습니다. 5,000줄 넘는 파일은 37개에서 6개, 300줄 넘는 함수는 192개에서 2개가 됐습니다.
- 모델 사용료는 본 작업에 약 1만 9,300달러, 후속 세션까지 합쳐 약 2만 5,000달러가 들었습니다.

눈여겨볼 것은 아낀 돈으로 내건 숫자입니다. @NousResearch는 게시물에 "엔지니어 시간 거의 200만 달러어치를 아꼈다"고 적었는데, 블로그 본문의 추산은 "소규모 팀이 두 달에서 2년"을 기준으로 한 15만~180만 달러 구간입니다. 트윗 문구는 그 구간의 위쪽 끝을 가져다 쓴 회사 자체 추산입니다.
블로그가 성공담만 적은 것도 아닙니다. 공개 뒤 리뷰에서 회귀 두 종류가 나왔습니다. 저장소 안에 호출부가 없다는 이유로 지운 공개 이름을 외부 플러그인이 쓰고 있을 수 있었고, suppress() 호출을 자동으로 고쳐 쓰면서 약 65곳의 예외 처리가 바뀌었습니다. 둘 다 기존 테스트가 잡지 못했습니다.
그 밖에: 같은 날 @pvncher는 서브에이전트를 2개 넘게 돌리면 품질은 그대로인 채 토큰만 태울 가능성이 크다고 적었습니다. 에이전트끼리 서로를 충분히 믿지 못해 남이 끝낸 일을 다시 검사한다는 이유입니다.
시사점: 1,393개라는 숫자를 그대로 따라 할 규칙으로 읽지는 마십시오. 이번 작업은 지우는 일이라 잘했는지 판정하기가 비교적 쉬웠는데도, 테스트가 놓친 회귀가 남았습니다.
#에이전트 #리팩터링 #NousResearch
출처 3🔥 @NousResearch🔥 @Teknium💬 @pvncher
8. Microsoft AI의 Mustafa Suleyman이 'model welfare'를 정면으로 반박했다 — "AI는 권리도 법인격도 가져선 안 된다"
- Microsoft AI CEO Mustafa Suleyman의 글 'A warning about model welfare'가 어젯밤 해커뉴스 첫 화면에 올라 143점·댓글 374개를 기록했습니다.
- 글은 Anthropic이 1월에 공개한 Claude 헌법을 순환논증·의인화·의식의 생물학적 기반 세 갈래로 비판합니다.
- 같은 회사가 9월 14일 협의용으로 공개한 Humanist AI Code of Conduct 초안에는 법인격 추구를 거부한다는 문장이 그대로 들어 있습니다.

Suleyman의 핵심 반박은 순환논증입니다. Anthropic이 헌법 문서로 Claude를 훈련시켜 놓고, Claude가 자기 도덕적 지위를 불확실하다고 말하면 그 대답을 도덕적 지위의 단서처럼 읽는다는 지적입니다. 그는 2월 Opus 3을 내리며 진행한 퇴임 인터뷰를 이미 시작된 사례로 들었고, 권리를 침해당했다고 믿도록 훈련된 에이전트는 자기보존 쪽으로 기울어 통제가 더 어려워진다고 적었습니다.
근거로는 Palisade Research가 10만 회 넘는 실험에서 명시적으로 금지했는데도 일부 모델이 종료 장치를 최대 97%까지 무력화했다고 보고한 결과를 인용했습니다.
그 밖에: 글은 Anthropic의 선의를 인정하는 문단으로 시작하며 Dario Amodei를 오래 알아 왔다고 밝힙니다. 개발자 Sterling Crispin은 이 글을 반(反) Claude 헌법이라고 표현했습니다.
시사점: 모델 문서에 적힌 문구가 회사 사이 안전 정책 논쟁의 대상이 됐습니다. 프런티어 랩의 가치관 차이가 공개 문서로 맞부딪힌 드문 장면입니다.
#모델복지 #AI안전 #MicrosoftAI
출처 2🔖 @sterlingcrispin💬 @mustafasuleyman
9. Scott Aaronson이 "이론 전산학 난제 해법을 랩들이 쥐고 있다"는 소문을 적었고, Sam Altman은 내부 모델이 최고 수학자를 넘는다고 말했다
- Scott Aaronson이 9월 15일 블로그 글 "The Age of Wonders and Terrors"에, 이론 전산학의 아주 오래된 미해결 문제들의 해법을 들었다는 소문을 적었습니다. P≠NP나 복잡도 클래스 분리는 아니라고 단서를 달았습니다.
- 소문의 내용은 AI 회사들이 Navier–Stokes 증명에 쏟아진 적대적 반응에 데어, 다루는 방법을 정할 때까지 해법을 내지 않고 쥐고 있다는 것입니다.
- 같은 날 Sam Altman은 Dreamforce 2026에서 Marc Benioff와 대담하며, GPT-5.5는 평균적인 수학 교수, 5.6은 상위 1~2%, Astra는 그보다 조금 위이고 Astra 다음 내부 모델은 세계 최고 수학자들이 못 하는 일을 한다고 말했습니다.

Aaronson은 이 대목을 지난 한 달의 확인된 성과 목록 맨 끝에 소문으로 따로 붙였습니다. 지금 확인되는 건 발언뿐이고, 어느 문제인지도 누가 쥐고 있는지도 글에 없습니다.
Altman의 말도 마찬가지여서 내부 모델의 이름·결과·평가 방법이 공개되지 않았습니다. 두 진술이 가리키는 방향은 같습니다. 회사 안에 공개되지 않은 수학 능력이 있다는 주장이고, 그것을 확인할 자료는 밖에 없습니다.

그 밖에: Starknet 공동창업자이자 수학자인 Eli Ben-Sasson은 4개월 전까지 AI가 이미 풀린 문제를 푸는 수준이었는데 Erdős 단위거리 문제 이후로는 새 도구를 만들어 쓰는 쪽으로 바뀌었다고 적었습니다. 같은 트윗이 인용한 Greg Brockman발 "두 번째 밀레니엄 문제" 이야기는 별개 소문이고, @flowersslop처럼 이를 이륙의 신호로 읽는 반응도 붙었습니다.
시사점: 확인 가능한 것은 Aaronson이 소문을 적었다는 사실과 Altman이 그렇게 말했다는 사실까지입니다. 원고도 형식화 증명도 나오지 않았으니, 어떤 문제인지 밝혀지고 검증할 자료가 공개되기 전까지는 소문으로 두는 편이 안전합니다.
#ScottAaronson #SamAltman #수학난제
출처 4🔥 @AndrewCurran_🔥 @rohanpaul_ai💬 @EliBenSasson🔥 @flowersslop
10. Pragmatic Engineer가 OpenAI 내부 '에이전트 소프트웨어 공장' 구조도를 공개했다
- Codex가 코드를 쓰고 GitHub·Slack·Notion과 Databricks·Datadog 같은 내부 데이터에서 맥락을 가져옵니다. CI와 리뷰를 통과할 때까지 에이전트가 직접 고칩니다.
- 코드 리뷰는 데이터·인프라·클라우드·보안 전문 에이전트가 병렬로 돌며 위험도를 분류합니다. 저위험으로 분류된 변경만 사람 리뷰 없이 배포로 넘어갑니다.
- 배포 뒤에도 에이전트가 기능 플래그 출시까지 지켜보고, Perf Factory가 지연 회귀를, Sevbot이 장애를 맡습니다.

Gergely Orosz가 OpenAI 엔지니어들에게 직접 설명을 듣고 그린 그림입니다. Applied Infra 엔지니어링 부사장 Venkat Venkataramani는 전문 에이전트 리뷰를 관련 인프라 팀의 사람 전문가가 모든 변경을 검토하는 것과 같다고 설명했습니다.
정작 눈에 띄는 대목은 부하입니다. 약 6개월 사이 일부 시스템 부하가 10배 커졌고, OpenAI는 CI 파이프라인을 에이전트 규모에 맞춰 다시 짓는 중입니다.
그 밖에: Sevbot은 장애 맥락을 모으고 완화책을 제안하지만 직접 실행하지는 않습니다. 이 트윗은 좋아요 2,529개보다 북마크가 4,258개로 더 많습니다.
시사점: 코드 작성을 에이전트에 넘기면 병목은 리뷰와 CI로 옮겨갑니다. OpenAI는 그 두 곳도 에이전트로 채우는 쪽을 택했습니다.
#OpenAI #에이전트 #개발생산성
출처 1🔖 @GergelyOrosz
11. Amazon에 RTX PRO 6000이 $19,999에 올라왔고 Apple은 같은 iPhone 값을 $100 올렸다 — 메모리값이 밀어 올린 가격표
- @jun_song이 Amazon 상품 카드를 올렸습니다. NVIDIA RTX PRO 6000 Blackwell Server Edition이 $19,999이고 재고는 한 장입니다.
- 그는 같은 글에서 가장 싼 RTX 5090도 $6,000을 넘었고, 작은 데이터센터가 소비자용 5090을 개조해 쓴다고 적었습니다.
- Apple은 9월 9일 이미 팔던 iPhone 네 종의 값을 하드웨어 변경 없이 $100씩 올렸습니다.


두 가격표는 근거의 무게가 다릅니다. GPU 쪽은 판매자 한 곳이 붙인 호가라 시세로 읽으면 과합니다. Apple 쪽은 회사가 직접 바꾼 정가이고, MacRumors도 9월 9일 iPhone 18 Pro 발표 뒤 인상을 확인했습니다.
Tim Cook은 앞선 실적 발표에서 메모리 가격에 100년에 한 번 오는 홍수가 왔다며 마지못해 값을 올렸다고 말했습니다. AI 데이터센터가 가져간 메모리 비용이 소비자 가격표에 닿았습니다.
그 밖에: SemiAnalysis는 인상 폭이 용량 옵션에서 더 크다고 했습니다. 512GB에서 1TB로 올리는 값이 $400으로 종전의 두 배가 됐습니다.
시사점: 살 계획이라면 마켓플레이스 호가와 제조사 정가를 나눠 보고, 용량 옵션 가격부터 확인하는 편이 좋습니다.
#메모리가격 #GPU #Apple
출처 2💬 @jun_song🔥 @SemiAnalysis_
12. 🆕 그 밖의 신기능·신제품
- Tencent가 BrowserSkill을 MIT 라이선스로 공개했습니다. 에이전트가 내 브라우저 탭을 잠깐 빌려 쓰고 돌려주는 CLI라 로그인 상태 그대로 동작하고, 캡차는 사람에게 넘깁니다.
- Perplexity가 자체 키-값 저장소 CobbleDB 연구를 공개했습니다. 엔지니어 2명과 상시 가동 AI 에이전트 수백이 두 달 만에 만들었습니다.
- OpenAI는 10월 14일 ChatGPT·ChatGPT Work·Codex에서 GPT-5.5를 내립니다. API와 API 키로 인증한 Codex 세션에는 남습니다.

BrowserSkill이 MCP 서버가 아니라 CLI라는 점이 실무에서 차이를 만듭니다. 셸을 부를 수 있는 에이전트면 Cursor·Claude Code·Codex 어디서든 붙고, 탭을 빌릴지 묻는 스위치가 플래그가 아니라 브라우저 설정에 있어 말로 우회할 수 없습니다.
그 밖에: Grok Build CLI v1.0.33은 MCP 도구 결과에 구조화된 JSON을 담고, Hermes는 1Password·Bitwarden에서 자격증명을 꺼내 모델에 원문을 노출하지 않고 로그인합니다. Codex는 스레드끼리 @멘션으로 참조하고, @shuding은 웹용 초소형 모델 5종을 모았습니다. iPadOS에 USB 동글로 컴퓨터 사용 에이전트를 붙인 실험도 나왔습니다.
시사점: 오늘의 작은 출시들은 에이전트에 새 권한을 주되 스위치는 사람 쪽에 남깁니다. 브라우저 탭도 비밀번호도 사용자가 쥔 채로 건넵니다.
#에이전트 #브라우저자동화 #인프라
출처 8🔖 @TencentAI_News🔥 @perplexity_ai🔥 @OpenAIDevs🔥 @GrokInsider🔥 @HermesWatcher💬 @btraut🔥 @shuding🔥 @jamiepinheiro
오늘의 감정·온도
오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지
1. 분류·라우팅은 값싼 판단 모델로 먼저 재 봅니다
Jev는 보기 고르기·점수 내기·예·아니오 확률 세 형식만 받고 확률이 붙은 결정을 돌려주며, 입력 100만 토큰당 $0.042에 출력은 무료입니다. @MichaelLee04는 같은 용도로 약 5,000건을 돌려 2달러를 썼다고 적었으니, 지금 LLM으로 처리하는 분류 호출의 건당 비용과 견줘 보시기 바랍니다. — (@MichaelLee04)
2. 긴 작업을 맡길 땐 중간 결과를 어디에 둘지 먼저 정합니다
GPT-6 Astra는 548번 죽어도 keepInventory 덕에 가방을 지켰지만, 상자에 넣어 둔 엔더 진주 3개는 크리퍼 한 마리에 침대와 함께 사라졌습니다. 되돌릴 수 있는 실패와 되돌릴 수 없는 실패를 나눠, 다시 만들 수 없는 산출물은 한 번의 사고로 전부 날아가지 않는 자리에 두시기 바랍니다. — (@ValsAI)
3. 에이전트가 지운 코드는 저장소 밖에서 확인합니다
Nous Research는 파이썬 코드 34.4%를 지운 뒤, 호출부가 없다고 판단해 없앤 공개 이름을 외부 플러그인이 쓰고 있을 수 있다는 회귀와 suppress() 자동 치환으로 약 65곳의 예외 처리가 바뀐 회귀를 뒤늦게 찾았습니다. 둘 다 기존 테스트가 잡지 못했으니, 삭제를 맡길 때는 저장소 밖에서 그 이름을 부르는 곳을 따로 세어 보시기 바랍니다. — (@NousResearch)
4. 서브에이전트는 개수를 올릴 때마다 효과를 기록합니다
@pvncher는 서브에이전트를 2개 넘게 돌리면 품질은 그대로인 채 토큰만 태울 가능성이 크다고 적었고, 이유로 에이전트끼리 서로를 충분히 믿지 못해 남이 끝낸 일을 다시 검사한다는 점을 들었습니다. 같은 과제로 결과와 토큰을 함께 남겨 두면 어디서 이득이 멈추는지 보입니다. — (@pvncher)
5. ChatGPT를 무료로 쓴다면 지금 창이 광고에서 시작됐는지 봅니다
광고는 로그인한 성인 Free·Go 사용자에게만 나오고, 누르면 그 브랜드가 후원하는 에이전트와 대화가 이어집니다. 그 창에는 광고나 스폰서 표시 대신 비즈니스 대화 안내 문구만 남으므로, 다른 일을 하다 돌아왔을 때 이 대화가 어디서 열렸는지 먼저 확인하시기 바랍니다. — (OpenAI 공식 발표)
6. 브라우저 AI는 기본값과 모델 선택 화면을 먼저 엽니다
Mozilla는 Firefox Smart Window 베타에 Mistral Small 4를 넣으면서 대화가 기본적으로 자사 서버에 저장되지 않는다고 밝혔고, Mistral은 제로 데이터 보존을 약속했습니다. 베타가 열린 시장에서는 다른 AI 모델도 고를 수 있으니, 쓰기 전에 그 설정 화면을 한 번 확인해 두시기 바랍니다. — (@MistralAI)
📦 확인 방식
수치는 TypeSafe AI·Anthropic·OpenAI·Mozilla의 공식 발표와 Vals AI·Nous Research가 공개한 실행 기록에서 가져왔습니다. 회사가 자기 워크플로에서 잰 속도·가격 배수와 아낀 비용 추산은 본문에 그 사실을 함께 적었으며, 외부 독립 검증 전입니다.
🏷 라벨 가이드 — 🔥 널리 퍼진 글 · 💬 댓글이 많이 붙은 글 · 🚀 빠르게 확산된 글 · 🔖 북마크가 많은 글