🔥 AI 트렌드 핵심 요약 (2026.08.03)
주요 키워드 TOP 5: 콜드카드 취약점 8분 재현 · 아스트라 결과 절반 재현 · 시댄스 2.5 글로벌 배포 · 딥시크 하루 8조 토큰 · EU AI법 집행 개시 | 메인 이벤트: 하드웨어 지갑 콜드카드에서 1,367 BTC가 쓸려 나간 뒤, 같은 결함을 코딩 에이전트가 한 줄짜리 지시와 8분 만에 독립적으로 짚어냈다는 재현이 퍼졌다
오늘 크게 돈 소식 셋은 주인공이 다른데 가리키는 방향이 겹칩니다. 앤트로픽 모델만의 성취로 발표된 수학 결과를 다른 연구자가 하루 만에 절반 재현했고, 도난 사건의 원인 코드를 서로 다른 두 모델이 각각 찾아냈으며, 상위권 코딩 성능이 노트북에서 도는 오픈웨이트 모델로 내려왔습니다. 어느 모델이 무엇을 처음 해냈는가를 세는 쪽보다 그 능력이 이미 어디까지 퍼졌는가를 세는 쪽이 하루의 온도를 더 잘 설명했습니다.
1. 지갑을 턴 코드를 AI가 8분 만에 되짚었다
- 하드웨어 지갑 콜드카드에서 1,367 BTC(약 8,860만 달러)가 주소 4,585개에서 쓸려 나갔습니다. 원인은 2021년 3월 펌웨어가 시드 생성에 하드웨어 난수기 대신 소프트웨어 난수기를 물린 것입니다
- r/비트코인에 올라온 재현에서 클로드 코드는 "취약점을 확인해달라"는 지시 한 줄을 받고 8분 생각한 끝에 두 갈래 난수 경로 중 끊긴 쪽을 지목했습니다
- 인터넷을 끊고 사건 이전 데이터로 학습한 GLM-5.2도 같은 결론에 닿았습니다. 논의는 특정 모델의 재주냐가 아니라 누구나 할 수 있느냐로 옮겨갔습니다
취약점을 찾는 일은 오래 사람의 시간으로 값이 매겨졌습니다. 코드를 읽고 의심 지점을 좁히는 데 걸리는 주 단위 노동이 곧 방어선이었는데, 두 모델이 같은 결함에 몇 분 만에 도달하면서 그 값이 무너졌습니다. 갤럭시의 알렉스 손은 이번 인출 방식 자체가 모델의 조율을 거친 정황이라고 봤습니다. 방어 쪽에도 같은 도구가 있으니 남는 질문은 능력의 유무가 아니라 누가 먼저 자기 코드에 돌려보느냐입니다.
그 밖에: 비트고의 마이크 벨시 CEO는 앤트로픽을 향해 100 BTC가 든 지갑 주소를 공개하고 직접 가져가 보라고 했습니다. 사람을 겨눈 주입 공격도 같은 날 확인됐습니다. 맨파워그룹은 연 10만 건의 지원서에서 숨은 텍스트를 걸러내고 있고, 스탠퍼드의 한 연구원은 2.25포인트 흰 글씨로 심사 도구에 합격 처리를 지시한 이력서를 찾아냈습니다.
시사점: 이번 주에 자기 저장소를 한 번 훑게 해보세요. 난수·키 생성·인증 토큰처럼 값이 예측되면 곧바로 손해로 이어지는 지점만 짚어 달라고 범위를 좁히면, 공격자가 이미 하고 있는 작업을 같은 비용으로 먼저 하게 됩니다.
#콜드카드#취약점탐지#프롬프트주입
출처 8🔥 @AndrewCurran_🔥 @AndrewCurran_🔥 @AndrewCurran_🔥 @Crypto_Jargon🔥 @skysupersonic🔥 @AutismCapital💬 @waleswoosh🔖 @IntCyberDigest
2. 하루 만에 절반이 다른 모델에서 다시 나왔다
- 하버드의 정수론 연구자 레벤트 알푀게가 아스트라 결과 10건 중 5건을 클로드 페이블로 재현했다고 24시간 만에 보고했습니다. 자율 실행, 일반 프롬프트, 인터넷 차단, 원 해법 유입 차단이 조건이었습니다
- 다섯 건 중 논증까지 사실상 같았던 것은 한 건뿐이고 나머지 넷은 독립 증명일 수 있습니다. 미공개 모델만의 성취라는 프레임이 하루 만에 헐거워졌습니다
- 수학자 대니얼 리트는 5년 안에 AI가 애널스급 정수론 논문을 낸다는 내기를 시한 전에 인정했습니다. 아직 그런 논문은 없지만 필요한 능력에 대한 자기 판단이 틀렸다는 이유입니다
재현은 반박이 아니라 승격입니다. 한 연구실의 미공개 시스템만 낼 수 있는 결과였다면 그건 제품 소식이지만, 공개된 모델이 다른 경로로 같은 곳에 닿으면 분야 전체의 바닥이 올라간 것입니다. 그래서 이날 논쟁의 중심이 오픈AI와 앤트로픽 중 누가 앞서는가에서, 이 난이도의 문제가 이제 상시로 풀리는가로 옮겨갔습니다.
그 밖에: 반대 방향의 측정도 나왔습니다. 30여 개 기관이 함께 낸 논문은 객관식 과학 벤치마크 대신 가설 제안과 시뮬레이션 설계, 결과 해석이 반복되는 실제 연구 루프에 모델을 넣으면 성능이 무너진다고 보고했습니다. 한 엔지니어는 열 문제를 푸는 모델이 지시 세 개를 못 따라 토큰 1,000만 개와 250달러를 태웠다고 적었고, 그 대비가 많이 재인용됐습니다.
시사점: 어떤 모델이 해냈다는 소식을 받으면 조건 네 가지를 먼저 물어보세요. 자율 실행인지, 프롬프트가 일반적인지, 외부 검색을 썼는지, 정답이 새지 않았는지 — 이 넷이 채워져야 남의 결과를 내 환경에서 재현할 수 있습니다.
#아스트라#페이블#재현성
출처 8🔥 @__alpoge__🔥 @__alpoge__🔥 @kimmonismus🔥 @littmath🔥 @henryquantum💬 @Yuchenj_UW🔥 @Yuchenj_UW💬 @HowToPrompt__
3. 🆕 오늘의 신기능·신제품 출시 — 30초 영상, 실시간 음성, 코딩 에이전트
- 바이트댄스가 6월에 공개한 시댄스 2.5가 드리미나로 글로벌 배포됐습니다. 한 번에 30초 단일 생성, 이미지·영상·음성을 합쳐 최대 50개까지 물리는 옴니 레퍼런스, 구간 편집, 10개 이상 언어가 묶여 있습니다
- 마이크로소프트의 양방향 음성 모델 MAI-리얼타임이 사전 공개 단계에서 포착됐습니다. 대화 중 웹 검색을 비롯한 도구를 직접 호출하고, 이전 음성 모델보다 말맛이 자연스럽다는 평입니다
- 딥시크가 코딩 에이전트 딥시크 하네스의 베타 테스터를 모집하기 시작했습니다. 오픈소스 기여 이력과 깃허브 아이디, 대표 프로젝트를 받고 선정되면 비밀유지 서약을 씁니다
세 건의 공통점은 모델 자랑이 아니라 작업 단위를 늘렸다는 데 있습니다. 영상은 컷에서 시퀀스로, 음성은 응답에서 대화로, 코딩은 완성 제안에서 과제 수행으로 단위가 커졌습니다. 단위가 커지면 실패도 커지므로, 새로 나온 기능을 붙일 때는 되돌릴 지점을 어디에 둘지가 먼저 결정돼야 합니다.
그 밖에: xAI는 그록 빌드 v0.2.119에서 자동 모드 범위를 넓히고 배시 명령 권한을 개발자가 직접 조정하게 했습니다. 구글 AI 스튜디오에는 앱이 만든 파일을 모아 두는 아티팩트 폴더가 붙습니다. 젠스파크 워크스페이스는 6.0으로 올라가며 여섯 갈래 기능을 한 번에 열었고, 앤트로픽이 조용히 넣어둔 폴더 기반 지시 로딩은 설정 이후 프롬프트를 다시 쓸 필요가 없다는 이유로 뒤늦게 주목받았습니다.
시사점: 새 기능을 훑을 때는 소개 영상보다 제한값을 먼저 보세요. 참조 개수, 최대 길이, 권한 범위 같은 숫자가 그 도구로 실제 만들 수 있는 결과물의 상한이고, 이건 데모로는 드러나지 않습니다.
#시댄스2_5#MAI리얼타임#딥시크하네스
출처 8💬 @manishkumar_dev💬 @higgsfield_ai🔥 @testingcatalog🔥 @Mr_Salio💬 @XFreeze💬 @Parul_Gautam7🔥 @testingcatalog🔥 @0xkkai
4. 값이 아니라 설치 장소가 뉴스가 됐다
- 오픈코드는 8월 1일 하루에 딥시크 플래시가 8조 토큰을 처리했다고 밝혔습니다. 무료 사용분 5조에 유료 제품 오픈코드 고 3조가 더해진 수치입니다
- 2비트·4비트로 줄인 GGUF 변환본이 허깅페이스에 올라오면서 128GB 맥이나 DGX 스파크 한 대에서 도는 구성이 공유되기 시작했습니다. 애플 실리콘·메탈 태그가 함께 붙어 있습니다
- 벌컨벤치의 8월 1일 측정에서는 이 모델을 중간 추론 강도로 돌린 조합이 pass@1 91%를 $2.04에 냈습니다. 같은 점수를 낸 그록 4.5 중간 강도는 $6.67이 들었습니다
싼 모델이 나왔다는 소식은 몇 주째 반복됐는데, 오늘 바뀐 것은 값이 아니라 그 모델이 놓이는 자리입니다. 청구서가 아니라 책상 위 기계가 실행 주체가 되면 사용량 제한과 서비스 중단이 변수에서 빠지고, 대신 램 용량과 전력이 새 제약으로 들어옵니다. 강도별 곡선이 모델마다 다르다는 측정도 같은 맥락입니다. 최고 강도가 늘 최선이 아니라면 고를 것은 모델이 아니라 조합입니다.
그 밖에: 누스 리서치는 이 모델을 7일간 90% 할인해 열었고, 밸스 인덱스는 테스트당 6센트로 오픈웨이트 3위에 올렸습니다. LM 스튜디오는 크기 대비 능력의 도약이라고 평했고, 한 개발자는 같은 저장소 과제에서 상위 모델과 결과가 거의 같으면서 비용은 34분의 1이었다고 적었습니다. 베이징의 한 바는 매장 와이파이에 붙으면 로컬 추론으로 만든 토큰을 무제한으로 내줍니다.
시사점: 로컬 실행을 검토한다면 최고 강도 성능부터 재지 마세요. 자주 도는 과제 열 개를 낮음·중간·높음으로 각각 돌려 성공률과 시간을 적으면, 지금 쓰는 유료 조합을 어디까지 대체할 수 있는지가 표 한 장으로 나옵니다.
#딥시크V4플래시#로컬추론#추론강도
출처 11🔥 @opencode🔥 @NousResearch🔥 @HuggingModels💬 @morganlinton💬 @MaxForAI🔥 @jun_song🔥 @yagilb🔥 @lmstudio🔥 @infwinston🔥 @ValsAI💬 @slash1sol
5. 유럽이 오늘부터 과징금을 물릴 수 있게 됐다
- 8월 2일부로 EU AI법의 집행 권한이 살아났습니다. 범용 모델 제공자는 전 세계 연매출 3%나 1,500만 유로 중 큰 쪽까지 과징금을 물 수 있습니다. 의무 자체는 2025년 8월부터 있었고 1년 유예가 끝난 것입니다
- 투명성 의무도 같은 날 시작했습니다. 대화형 시스템은 첫 접촉 시점에 자신이 AI임을 밝혀야 하고, AI로 만들거나 고친 이미지·영상·음성에는 라벨과 기계 판독용 표식이 붙어야 합니다
- 감독은 셋으로 나뉩니다. AI 오피스가 범용 모델과 그 위에 얹힌 시스템을, 27개 회원국 당국이 나머지 시스템을, 유럽데이터보호감독관이 EU 기관 사용분을 맡습니다
규제 소식이 대개 먼 이야기로 읽히는데 이번 건은 제품 화면을 직접 건드립니다. 첫 화면의 고지 문구, 생성물에 넣는 표식, 모델 제공자에게 받아둬야 할 문서가 모두 오늘부터 확인 대상이 됩니다. 앤트로픽·구글·메타·마이크로소프트·미스트랄·오픈AI를 비롯한 다수가 준수를 약속했으니, 기준선은 대형 제공자가 아니라 그 위에 서비스를 얹은 쪽에서 갈릴 가능성이 큽니다.
그 밖에: EU는 신고 도구와 내부고발 도구를 함께 열어 이용자와 내부자가 위반 정황을 직접 접수할 수 있게 했고, 범용 모델 관련 과학 자문으로 알레산드로 아바테 교수를 임명했습니다. 안내 문서는 144쪽입니다. 반대편에서는 이런 방식이 결국 모델과 이용자 모두에게 허가제를 씌우게 된다는 반발도 같은 날 상위에 올랐습니다.
시사점: EU 이용자가 있다면 오늘 볼 곳은 세 군데입니다. 첫 응답 전에 AI임을 알리는 문구가 있는지, 생성물에 표식이 붙는지, 쓰고 있는 모델 제공자의 문서를 받아 보관하고 있는지 — 이 셋은 화면과 설정만 보면 확인됩니다.
#EU_AI법#투명성의무#컴플라이언스
출처 4💬 @AndrewCurran_💬 @AndrewCurran_🔁 @LuizaJarovsky💬 @ErikVoorhees
6. 펠리컨 그림 대신 두 시간짜리 과제를 줬다
- 카파시는 오퍼스 5에 반지의 제왕 첫 문단과 100만 토큰(약 10달러) 예산을 주고 자바스크립트 렌더 세 개를 요구했습니다. 모델은 두 시간 동안 5,500줄을 써서 이야기를 절차적으로 그려냈습니다
- 그가 짚은 약점은 결과물이 아니라 감사입니다. 모델은 영상을 제대로 보지 못해 자기 작업을 확인하려면 지점마다 스크린샷을 찍어야 했고, 그 과정에서 어설픈 부분이 남았습니다
- 소스가 공개되자 같은 모델·같은 예산에 하네스만 바꾼 비교가 하루 만에 붙었습니다. 브라우저에서 직접 걸어 다닐 수 있는 형태입니다
단답 하나로 모델을 재던 방식이 수명을 다한 이유는 문제가 쉬워서가 아니라 정보량이 적어서입니다. 예산과 시간을 주면 계획, 도구 사용, 중간 확인, 실패 복구가 한꺼번에 드러나고 그게 실제 업무 조건에 가깝습니다. 대신 채점이 어려워집니다. 두 시간짜리 결과물은 사람이 열어보고 판단해야 하니, 앞선 재현 논의와 마찬가지로 확인 절차를 미리 정해두는 쪽이 남습니다.
그 밖에: 블렌더를 MCP로 붙여 맨해튼을 묘사만으로 만든 사례에서는 두 시간 반 만에 건물 4만 5,000채와 도로 위 차량이 배치됐습니다. 같은 날 대규모 리팩터링 비교에서는 한 모델이 7시간 30분에 4,440줄을, 다른 모델이 9시간에 977줄을 썼는데 짧게 쓴 쪽이 더 나은 평가를 받았습니다. 오퍼스 5의 말투가 길고 판단적이라는 불만도 같은 흐름에서 상위에 올랐고, 반대로 GPT-5.6 솔로 처음 웹페이지를 만든 아버지 이야기가 하루 최상위 반응을 받았습니다.
시사점: 모델을 고를 때 짧은 질문 대신 자기 업무에서 두 시간짜리 과제를 하나 고르세요. 예산과 도구를 정해 던져두고 중간 산출물을 남기게 하면, 벤치마크 점수로는 안 보이던 계획 능력과 복구 능력이 그 로그에 그대로 남습니다.
#평가방식#하네스#장시간과제
출처 8🔖 @karpathy💬 @karpathy🔥 @Izkimar🔥 @chasescooper💬 @diegohaz💬 @petergyang💬 @EXM7777🔥 @khloyakafe
📊 오늘의 감정/온도 분석
보안 쪽 글에는 이견이 거의 없었고, 수학과 평가 쪽에서만 감탄과 회의가 갈렸습니다. 위험을 말할 때는 합의가 빨랐고 능력을 말할 때는 느렸던 하루입니다.
💼 오늘의 실무 팁 — 쉽게 풀어 쓴 사용법 6가지
1. 에이전트 지침을 한 파일로 모으기
토큰 600억 개를 쓴 뒤 정리했다는 규칙 파일이 하루 만에 북마크 5,000개를 넘겼습니다. 프로젝트마다 흩어진 주의사항을 저장소 최상단 한 파일로 모아두면 새 세션마다 같은 설명을 반복하지 않아도 됩니다 — @MarcosHernanz
2. 코딩 도구에 선택지 물어보기 허용하기
계획 모드 밖에서도 도구가 여러 안을 제시하고 고르게 하면 되묻는 횟수가 줄어듭니다. 설정 한 줄로 켜지는 옵션이고, 애매한 요구사항을 던졌을 때 엉뚱한 방향으로 오래 달리는 일을 막아 줍니다 — @davis7
3. 영상·회의 기록을 스킬로 먹이기
유튜브·룸·줌 녹화를 받아 자막을 뽑고 화면을 캡처해 정리하는 스킬이 공개됐습니다. 참고 자료가 영상뿐인 주제를 다룰 때 보는 시간 자체를 아끼는 방법이고, 클라이언트 통화 기록에도 그대로 씁니다 — @coreyhainesco
4. 추론 강도를 세 단으로 나눠 재보기
강도를 올릴수록 좋아지는 모델이 있고 중간에서 가장 좋은 모델이 있습니다. 낮음·중간·높음으로 같은 과제를 세 번 돌려 성적과 비용을 적으면, 늘 최고 강도를 쓰던 습관에서 비용 절반이 그냥 빠집니다 — @morganlinton
5. 오픈 모델은 무료 창구부터 시험하기
새 오픈웨이트가 나오면 카드 등록 없이 쓸 수 있는 무료 티어가 며칠 안에 여러 곳에 열립니다. 자기 작업 100건을 거기서 먼저 돌려 품질을 확인한 뒤에 장비나 유료 계약을 검토해도 늦지 않습니다 — @israfill
6. EU 이용자가 있다면 고지 문구 확인하기
오늘부터 대화형 서비스는 첫 응답 전에 상대가 AI임을 알려야 하고 생성물에는 표식이 필요합니다. 안내 문서가 144쪽이라 통째로 읽기보다 자기 화면에서 이 두 가지가 보이는지부터 확인하는 편이 빠릅니다 — @LuizaJarovsky
📦 확인 방식 — 본문 핵심 사실은 코인데스크·디크립트의 콜드카드 피해 집계, EU AI법 조문 및 집행 일정 문서, 아티피셜애널리시스·오픈라우터의 모델 단가로 교차검증했고 당사자 자체 측정치는 본문에 그렇게 표기했습니다. 인용한 시각 자료는 원문 이미지를 직접 확인했으나, 외부 독립 검증 전입니다.
🏷 라벨 가이드 — 🔥 인기(좋아요 중심) · 🔁 공유(리트윗 비율 높음) · 💬 논쟁(댓글 비율 높음) · 🔖 저장(북마크 많음) · 🚀 떠오름(작은 계정인데 확산 시작)