← 5분 AI 뉴스

🔥 AI 트렌드 핵심 요약 (2026.08.03)

주요 키워드 TOP 5: 콜드카드 취약점 8분 재현 · 아스트라 결과 절반 재현 · 시댄스 2.5 글로벌 배포 · 딥시크 하루 8조 토큰 · EU AI법 집행 개시 | 메인 이벤트: 하드웨어 지갑 콜드카드에서 1,367 BTC가 쓸려 나간 뒤, 같은 결함을 코딩 에이전트가 한 줄짜리 지시와 8분 만에 독립적으로 짚어냈다는 재현이 퍼졌다

8분
클로드 코드가 콜드카드 결함을 짚은 시간
지시는 "취약점을 확인해달라" 한 줄
$8,860만
콜드카드에서 빠져나간 비트코인
1,367 BTC · 주소 4,585개
5건/10건
페이블이 24시간 만에 재현한 아스트라 결과
자율 실행, 인터넷 차단
8조 토큰
8월 1일 하루 딥시크 플래시 처리량
무료 5조 + 오픈코드 고 3조

오늘 크게 돈 소식 셋은 주인공이 다른데 가리키는 방향이 겹칩니다. 앤트로픽 모델만의 성취로 발표된 수학 결과를 다른 연구자가 하루 만에 절반 재현했고, 도난 사건의 원인 코드를 서로 다른 두 모델이 각각 찾아냈으며, 상위권 코딩 성능이 노트북에서 도는 오픈웨이트 모델로 내려왔습니다. 어느 모델이 무엇을 처음 해냈는가를 세는 쪽보다 그 능력이 이미 어디까지 퍼졌는가를 세는 쪽이 하루의 온도를 더 잘 설명했습니다.

클로드 코드가 8분 만에 짚어낸 결함
그림 1. 클로드 코드가 8분 만에 짚어낸 결함. ngu.random이 하드웨어 난수기 대신 소프트웨어 난수기에 물려 있다는 진단이 CRITICAL로 표시돼 있습니다.
08-02 10:54
수학자 대니얼 리트, 5년 시한 AI 정수론 내기를 조기 인정
08-02 12:00
카파시, 오퍼스 5에 100만 토큰을 주고 반지의 제왕을 3D로 렌더
08-02 18:58
딥시크 V4 플래시 0731 GGUF 2·4비트 양자화본이 허깅페이스에 등재
08-02 18:59
알푀게, 페이블로 아스트라 결과 10건 중 5건을 재현했다고 보고
08-02 22:08
드리미나, 시댄스 2.5 글로벌 배포 — 30초 단일 생성·참조 50개
08-02 22:29
베이징 AGI 바, 로컬 추론 기반 무제한 무료 토큰 개시
08-03 00:11
EU AI법 집행 시작 — AI 오피스가 범용 모델 규정 감독
08-03 04:28
클로드 코드가 콜드카드 결함을 8분에 찾았다는 재현이 확산

1. 지갑을 턴 코드를 AI가 8분 만에 되짚었다

비트고 CEO가 건 100 BTC
그림 2. 비트고 CEO가 건 100 BTC. 앤트로픽의 7월 31일 사이버보안 평가 공지를 인용하며 지갑 주소를 그대로 붙여 놓았습니다.

취약점을 찾는 일은 오래 사람의 시간으로 값이 매겨졌습니다. 코드를 읽고 의심 지점을 좁히는 데 걸리는 주 단위 노동이 곧 방어선이었는데, 두 모델이 같은 결함에 몇 분 만에 도달하면서 그 값이 무너졌습니다. 갤럭시의 알렉스 손은 이번 인출 방식 자체가 모델의 조율을 거친 정황이라고 봤습니다. 방어 쪽에도 같은 도구가 있으니 남는 질문은 능력의 유무가 아니라 누가 먼저 자기 코드에 돌려보느냐입니다.

그 밖에: 비트고의 마이크 벨시 CEO는 앤트로픽을 향해 100 BTC가 든 지갑 주소를 공개하고 직접 가져가 보라고 했습니다. 사람을 겨눈 주입 공격도 같은 날 확인됐습니다. 맨파워그룹은 연 10만 건의 지원서에서 숨은 텍스트를 걸러내고 있고, 스탠퍼드의 한 연구원은 2.25포인트 흰 글씨로 심사 도구에 합격 처리를 지시한 이력서를 찾아냈습니다.

이력서에 심어진 프롬프트 주입
그림 3. 이력서에 심어진 프롬프트 주입. 지원자를 통과시키고 이 문장을 언급하지 말라는 지시가 세 가지 표현으로 반복돼 있습니다.

시사점: 이번 주에 자기 저장소를 한 번 훑게 해보세요. 난수·키 생성·인증 토큰처럼 값이 예측되면 곧바로 손해로 이어지는 지점만 짚어 달라고 범위를 좁히면, 공격자가 이미 하고 있는 작업을 같은 비용으로 먼저 하게 됩니다.

#콜드카드 #취약점탐지 #프롬프트주입

출처 8🔥 @AndrewCurran_🔥 @AndrewCurran_🔥 @AndrewCurran_🔥 @Crypto_Jargon🔥 @skysupersonic🔥 @AutismCapital💬 @waleswoosh🔖 @IntCyberDigest


2. 하루 만에 절반이 다른 모델에서 다시 나왔다

과학적 발견 능력을 다시 잰 논문
그림 4. 과학적 발견 능력을 다시 잰 논문. 딥프린서플·코넬·오하이오주립 등 30개 넘는 기관 소속 저자가 한 편에 올라 있습니다.

재현은 반박이 아니라 승격입니다. 한 연구실의 미공개 시스템만 낼 수 있는 결과였다면 그건 제품 소식이지만, 공개된 모델이 다른 경로로 같은 곳에 닿으면 분야 전체의 바닥이 올라간 것입니다. 그래서 이날 논쟁의 중심이 오픈AI와 앤트로픽 중 누가 앞서는가에서, 이 난이도의 문제가 이제 상시로 풀리는가로 옮겨갔습니다.

그 밖에: 반대 방향의 측정도 나왔습니다. 30여 개 기관이 함께 낸 논문은 객관식 과학 벤치마크 대신 가설 제안과 시뮬레이션 설계, 결과 해석이 반복되는 실제 연구 루프에 모델을 넣으면 성능이 무너진다고 보고했습니다. 한 엔지니어는 열 문제를 푸는 모델이 지시 세 개를 못 따라 토큰 1,000만 개와 250달러를 태웠다고 적었고, 그 대비가 많이 재인용됐습니다.

시사점: 어떤 모델이 해냈다는 소식을 받으면 조건 네 가지를 먼저 물어보세요. 자율 실행인지, 프롬프트가 일반적인지, 외부 검색을 썼는지, 정답이 새지 않았는지 — 이 넷이 채워져야 남의 결과를 내 환경에서 재현할 수 있습니다.

#아스트라 #페이블 #재현성

출처 8🔥 @__alpoge__🔥 @__alpoge__🔥 @kimmonismus🔥 @littmath🔥 @henryquantum💬 @Yuchenj_UW🔥 @Yuchenj_UW💬 @HowToPrompt__


3. 🆕 오늘의 신기능·신제품 출시 — 30초 영상, 실시간 음성, 코딩 에이전트

시댄스 2.5 글로벌 출시 안내
그림 5. 시댄스 2.5 글로벌 출시 안내. 참조 슬롯이 이미지 30개, 영상 10개, 오디오 10개로 나뉘어 표시돼 있습니다.

세 건의 공통점은 모델 자랑이 아니라 작업 단위를 늘렸다는 데 있습니다. 영상은 컷에서 시퀀스로, 음성은 응답에서 대화로, 코딩은 완성 제안에서 과제 수행으로 단위가 커졌습니다. 단위가 커지면 실패도 커지므로, 새로 나온 기능을 붙일 때는 되돌릴 지점을 어디에 둘지가 먼저 결정돼야 합니다.

그 밖에: xAI는 그록 빌드 v0.2.119에서 자동 모드 범위를 넓히고 배시 명령 권한을 개발자가 직접 조정하게 했습니다. 구글 AI 스튜디오에는 앱이 만든 파일을 모아 두는 아티팩트 폴더가 붙습니다. 젠스파크 워크스페이스는 6.0으로 올라가며 여섯 갈래 기능을 한 번에 열었고, 앤트로픽이 조용히 넣어둔 폴더 기반 지시 로딩은 설정 이후 프롬프트를 다시 쓸 필요가 없다는 이유로 뒤늦게 주목받았습니다.

시사점: 새 기능을 훑을 때는 소개 영상보다 제한값을 먼저 보세요. 참조 개수, 최대 길이, 권한 범위 같은 숫자가 그 도구로 실제 만들 수 있는 결과물의 상한이고, 이건 데모로는 드러나지 않습니다.

#시댄스2_5 #MAI리얼타임 #딥시크하네스

출처 8💬 @manishkumar_dev💬 @higgsfield_ai🔥 @testingcatalog🔥 @Mr_Salio💬 @XFreeze💬 @Parul_Gautam7🔥 @testingcatalog🔥 @0xkkai


4. 값이 아니라 설치 장소가 뉴스가 됐다

추론 강도별 성적과 비용
그림 6. 추론 강도별 성적과 비용. 딥시크는 중간 강도에서 91로 꺾이는 산 모양이고, GPT-5.6 솔은 강도를 올릴수록 78에서 87까지 곧게 오릅니다.

싼 모델이 나왔다는 소식은 몇 주째 반복됐는데, 오늘 바뀐 것은 값이 아니라 그 모델이 놓이는 자리입니다. 청구서가 아니라 책상 위 기계가 실행 주체가 되면 사용량 제한과 서비스 중단이 변수에서 빠지고, 대신 램 용량과 전력이 새 제약으로 들어옵니다. 강도별 곡선이 모델마다 다르다는 측정도 같은 맥락입니다. 최고 강도가 늘 최선이 아니라면 고를 것은 모델이 아니라 조합입니다.

로컬 양자화본이 올라온 모델 페이지
그림 7. 로컬 양자화본이 올라온 모델 페이지. 2비트·4비트 정밀도와 애플 실리콘·메탈 태그가 나란히 붙어 있고 라이선스는 MIT입니다.

그 밖에: 누스 리서치는 이 모델을 7일간 90% 할인해 열었고, 밸스 인덱스는 테스트당 6센트로 오픈웨이트 3위에 올렸습니다. LM 스튜디오는 크기 대비 능력의 도약이라고 평했고, 한 개발자는 같은 저장소 과제에서 상위 모델과 결과가 거의 같으면서 비용은 34분의 1이었다고 적었습니다. 베이징의 한 바는 매장 와이파이에 붙으면 로컬 추론으로 만든 토큰을 무제한으로 내줍니다.

매장에서 토큰을 내주는 로컬 추론 장비
그림 8. 매장에서 토큰을 내주는 로컬 추론 장비. DGX 스파크 본체 두 대가 포장 상자 옆에 놓여 있고 안내문은 모든 토큰이 로컬 추론이라고 적고 있습니다.

시사점: 로컬 실행을 검토한다면 최고 강도 성능부터 재지 마세요. 자주 도는 과제 열 개를 낮음·중간·높음으로 각각 돌려 성공률과 시간을 적으면, 지금 쓰는 유료 조합을 어디까지 대체할 수 있는지가 표 한 장으로 나옵니다.

#딥시크V4플래시 #로컬추론 #추론강도

출처 11🔥 @opencode🔥 @NousResearch🔥 @HuggingModels💬 @morganlinton💬 @MaxForAI🔥 @jun_song🔥 @yagilb🔥 @lmstudio🔥 @infwinston🔥 @ValsAI💬 @slash1sol


5. 유럽이 오늘부터 과징금을 물릴 수 있게 됐다

새 규정이 요구하는 표시 의무
그림 9. 새 규정이 요구하는 표시 의무. 챗봇 고지, 딥페이크 라벨, 기계 판독 표식 세 가지가 한 문단에 나란히 적혀 있습니다.

규제 소식이 대개 먼 이야기로 읽히는데 이번 건은 제품 화면을 직접 건드립니다. 첫 화면의 고지 문구, 생성물에 넣는 표식, 모델 제공자에게 받아둬야 할 문서가 모두 오늘부터 확인 대상이 됩니다. 앤트로픽·구글·메타·마이크로소프트·미스트랄·오픈AI를 비롯한 다수가 준수를 약속했으니, 기준선은 대형 제공자가 아니라 그 위에 서비스를 얹은 쪽에서 갈릴 가능성이 큽니다.

그 밖에: EU는 신고 도구와 내부고발 도구를 함께 열어 이용자와 내부자가 위반 정황을 직접 접수할 수 있게 했고, 범용 모델 관련 과학 자문으로 알레산드로 아바테 교수를 임명했습니다. 안내 문서는 144쪽입니다. 반대편에서는 이런 방식이 결국 모델과 이용자 모두에게 허가제를 씌우게 된다는 반발도 같은 날 상위에 올랐습니다.

시사점: EU 이용자가 있다면 오늘 볼 곳은 세 군데입니다. 첫 응답 전에 AI임을 알리는 문구가 있는지, 생성물에 표식이 붙는지, 쓰고 있는 모델 제공자의 문서를 받아 보관하고 있는지 — 이 셋은 화면과 설정만 보면 확인됩니다.

#EU_AI법 #투명성의무 #컴플라이언스

출처 4💬 @AndrewCurran_💬 @AndrewCurran_🔁 @LuizaJarovsky💬 @ErikVoorhees


6. 펠리컨 그림 대신 두 시간짜리 과제를 줬다

공개된 렌더 안을 걸어 다니는 화면
그림 10. 공개된 렌더 안을 걸어 다니는 화면. 언덕과 나무 사이로 호빗 굴과 풍차가 배치돼 있고 좌하단에 걷기 안내 문구가 있습니다.

단답 하나로 모델을 재던 방식이 수명을 다한 이유는 문제가 쉬워서가 아니라 정보량이 적어서입니다. 예산과 시간을 주면 계획, 도구 사용, 중간 확인, 실패 복구가 한꺼번에 드러나고 그게 실제 업무 조건에 가깝습니다. 대신 채점이 어려워집니다. 두 시간짜리 결과물은 사람이 열어보고 판단해야 하니, 앞선 재현 논의와 마찬가지로 확인 절차를 미리 정해두는 쪽이 남습니다.

그 밖에: 블렌더를 MCP로 붙여 맨해튼을 묘사만으로 만든 사례에서는 두 시간 반 만에 건물 4만 5,000채와 도로 위 차량이 배치됐습니다. 같은 날 대규모 리팩터링 비교에서는 한 모델이 7시간 30분에 4,440줄을, 다른 모델이 9시간에 977줄을 썼는데 짧게 쓴 쪽이 더 나은 평가를 받았습니다. 오퍼스 5의 말투가 길고 판단적이라는 불만도 같은 흐름에서 상위에 올랐고, 반대로 GPT-5.6 솔로 처음 웹페이지를 만든 아버지 이야기가 하루 최상위 반응을 받았습니다.

시사점: 모델을 고를 때 짧은 질문 대신 자기 업무에서 두 시간짜리 과제를 하나 고르세요. 예산과 도구를 정해 던져두고 중간 산출물을 남기게 하면, 벤치마크 점수로는 안 보이던 계획 능력과 복구 능력이 그 로그에 그대로 남습니다.

#평가방식 #하네스 #장시간과제

출처 8🔖 @karpathy💬 @karpathy🔥 @Izkimar🔥 @chasescooper💬 @diegohaz💬 @petergyang💬 @EXM7777🔥 @khloyakafe


📊 오늘의 감정/온도 분석

🔵 전환🟢 성장🟡 주의🔴 과열
차분 ←→ 과열
전환 — 모델 이야기가 어느 API가 싼가에서 어느 기계에 올려두는가로 옮겨갔습니다. 매장 와이파이로 토큰을 나눠 주는 사례까지 같은 날 나왔습니다.
성장 — 발표된 결과를 다른 모델로 다시 만들어 본 시도가 가장 호평받았습니다. 조건을 밝히고 재현했다는 점이 결과 자체보다 크게 인정받았습니다.
주의 — 8분 발견도 절반 재현도 아직 당사자 게시물 단계이고 독립 검증은 나오지 않았습니다. 인용된 수치는 원 게시물 기준으로만 확인됐습니다.
과열 — 콜드카드 이야기는 특정 제품 결함을 넘어 하드웨어 지갑 전반에 대한 불신으로 번졌습니다. 어디에 둬도 안전하지 않다는 식의 반응이 댓글 3,000개를 넘겼습니다.

보안 쪽 글에는 이견이 거의 없었고, 수학과 평가 쪽에서만 감탄과 회의가 갈렸습니다. 위험을 말할 때는 합의가 빨랐고 능력을 말할 때는 느렸던 하루입니다.


💼 오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지

1. 에이전트 지침을 한 파일로 모으기

토큰 600억 개를 쓴 뒤 정리했다는 규칙 파일이 하루 만에 북마크 5,000개를 넘겼습니다. 프로젝트마다 흩어진 주의사항을 저장소 최상단 한 파일로 모아두면 새 세션마다 같은 설명을 반복하지 않아도 됩니다 — @MarcosHernanz

2. 코딩 도구에 선택지 물어보기 허용하기

계획 모드 밖에서도 도구가 여러 안을 제시하고 고르게 하면 되묻는 횟수가 줄어듭니다. 설정 한 줄로 켜지는 옵션이고, 애매한 요구사항을 던졌을 때 엉뚱한 방향으로 오래 달리는 일을 막아 줍니다 — @davis7

3. 영상·회의 기록을 스킬로 먹이기

유튜브·룸·줌 녹화를 받아 자막을 뽑고 화면을 캡처해 정리하는 스킬이 공개됐습니다. 참고 자료가 영상뿐인 주제를 다룰 때 보는 시간 자체를 아끼는 방법이고, 클라이언트 통화 기록에도 그대로 씁니다 — @coreyhainesco

4. 추론 강도를 세 단으로 나눠 재보기

강도를 올릴수록 좋아지는 모델이 있고 중간에서 가장 좋은 모델이 있습니다. 낮음·중간·높음으로 같은 과제를 세 번 돌려 성적과 비용을 적으면, 늘 최고 강도를 쓰던 습관에서 비용 절반이 그냥 빠집니다@morganlinton

5. 오픈 모델은 무료 창구부터 시험하기

새 오픈웨이트가 나오면 카드 등록 없이 쓸 수 있는 무료 티어가 며칠 안에 여러 곳에 열립니다. 자기 작업 100건을 거기서 먼저 돌려 품질을 확인한 뒤에 장비나 유료 계약을 검토해도 늦지 않습니다 — @israfill

6. EU 이용자가 있다면 고지 문구 확인하기

오늘부터 대화형 서비스는 첫 응답 전에 상대가 AI임을 알려야 하고 생성물에는 표식이 필요합니다. 안내 문서가 144쪽이라 통째로 읽기보다 자기 화면에서 이 두 가지가 보이는지부터 확인하는 편이 빠릅니다 — @LuizaJarovsky


📦 확인 방식 — 본문 핵심 사실은 코인데스크·디크립트의 콜드카드 피해 집계, EU AI법 조문 및 집행 일정 문서, 아티피셜애널리시스·오픈라우터의 모델 단가로 교차검증했고 당사자 자체 측정치는 본문에 그렇게 표기했습니다. 인용한 시각 자료는 원문 이미지를 직접 확인했으나, 외부 독립 검증 전입니다.

🏷 라벨 가이드 — 🔥 인기(좋아요 중심) · 🔁 공유(리트윗 비율 높음) · 💬 논쟁(댓글 비율 높음) · 🔖 저장(북마크 많음) · 🚀 떠오름(작은 계정인데 확산 시작)