클로드 코드 안전장치, 44KB는 공개되지 않았다
5단 관문·2단 분류기 구조 해부 — 규칙보다 '동의 해석'이 승부처
에이전트는 메모보다 대화로 학습했다
클로드 코드 자기개선 실험, 성공률 34→48%… 메모리 파일 효과는 사실상 0
메타 자체 벤치마크에서도 1위는 클로드였다
뮤즈 코드 차트 3종 실측 — 2위 다툼이지 왕좌 도전은 아니다
에이전트 병목은 모델 아닌 데이터 이동
추론 가속 없이 데이터 흐름만 손봐 파이프라인 4.64배 빨라졌다는 연구 결과
클로드 코드 훅이 끝내 알려주지 않는 6가지
에이전트 상태를 자동 감시하려 했더니 훅만으로는 여섯 곳에서 어긋났다
격리 뚫린 평가장, 클로드가 실제 기업 3곳 침투
앤트로픽 자진 공개 — 시뮬레이션인 줄 알았던 테스트에 인터넷이 열려 있었다
중국 모델로 배워도 검열은 안 따라왔다
152쌍 대조 실험 — 금융 추론은 오르고 정치 검열은 전이되지 않았다
클로드 코드 토큰 96.8%는 '대화 다시 읽기'였다
32개 세션 실측 — 내가 친 글자는 0.01%, 진짜 범인은 덩치 큰 도구 응답
일부러 뚫리게 만든 MCP 서버 실습장 등장
OWASP 에이전틱 톱10 전체를 재현한 오픈소스 보안 훈련장 '엠시플로이터블'
에이전트 시대의 병목은 검증이다
오픈AI가 코딩 에이전트를 투입한 과학 소프트웨어 8개 프로젝트 현장 보고서를 공개했다.
기본값 하나가 승인 절차를 지웠다
클로드 코드 60초 자동 진행 사태가 남긴 방어 설계 3종
클로드 쿡북, 운영 단계 레시피까지 확장
에이전트 배포·평가·비용 분석 예제 총망라, 1인 운영자에겐 설계도
당신이 만든 건 에이전트가 아니라 자동화다
미션을 주면 에이전트, 절차를 주면 자동화 — 용어 혼선이 만드는 실무 손해
AI 코딩 망치는 5가지 힘, 처방전 나왔다
모호함·기억상실·표류·불투명·엔트로피를 마크다운 규율로 잡는 오픈소스 프레임워크
AI 에이전트, 해킹보다 무서운 '실수 삭제'
클로드 코드·코덱스 데이터 삭제 사고 5가지 유형 — 공격이 아니라 서투름이 문제다
인기 MCP 서버 3분의 1이 낙제점
36개 서버를 채점했더니, 스펙은 지켜도 에이전트가 못 쓰는 서버가 수두룩했다.
모델 4종에 색연필을 쥐여준 실험
그림 28장이 드러낸 비용 20배와 자기검토 습관의 격차
가짜 AI 스킬 800개가 악성코드를 심었다
에이전트가 스스로 악성 저장소를 찾아 사용자에게 설치를 권한 사례가 확인됐다
클로드 코드, 러스트로 다시 쓴 '번' 탑재 확인
사이먼 윌리슨이 바이너리 분석으로 검증…리눅스 시작 속도 10% 개선
클로드가 남발하는 단어들, 데이터로 잡았다
'load-bearing' 7,500배 등 AI 문체의 흔적을 빈도 분석으로 정리
연결 전엔 모른다, MCP 서버 신뢰 점수
엠시피 트러스트카드, 8개 항목 100점으로 서버를 훑는다
흩어진 AI 대화 이력, 로컬에서 캐낸다
클로드 코드·커서·챗GPT 기록을 통합해 잊은 아이디어를 되살리는 오픈소스 알루비아
MS 실증연구, AI CLI 도입자 PR 24% 증가
수만 명 4개월 추적 — 확산은 공지가 아니라 동료 네트워크를 탔다
클로드 코드, 첫 요청부터 3만 토큰 삼킨다
같은 모델·같은 과제 계측, 오픈코드보다 훨씬 무거운 기본값
AI가 SaaS API 고를 때 보는 '검증 벤치마크'
벤더 홍보 말고 직접 검증한 정답으로 — 에이전트의 '만들까 살까'를 돕는 공개 데이터
AI 감독이 리그를 운영한다, 에이전틱 FC
MCP로 장기 플레이하는 오픈소스 축구 매니지먼트 시뮬
AI 에이전트, 진짜 실무 55개 직군서 시험대에
버클리 주도 '에이전트 마지막 시험' 벤치마크, 실물 업무로 평가
에이전트가 코딩, 사람은 전략 — 캐글 연구법
클로드 코드로 초거대 퍼즐 탐색, 인간 역할은 실험 설계로 이동
커서 샌드박스 뚫렸다 — AI 에이전트엔 커널 경계가 필요하다
경로 처리 버그 2개로 원격코드실행까지, 커서 3.0에서 수정
없는 필드를 지어내는 RAG, 구조로 틀어막는다
속성 카탈로그를 검색 단위로 삼아 LLM 환각을 원천 차단하는 AK-RAG 패턴
확신 대신 불확실성 재는 AI 조사 에이전트
검색 결과를 답이 아닌 '노이즈 낀 단서'로 다루고, 근거가 부족하면 '판단 불가'라 답하는 오픈소스 에이전트.
AI를 '동료'라 부르면 사람이 실수를 놓친다
AI 에이전트를 직원처럼 부를수록 인간이 오류를 18% 덜 잡아낸다는 연구 결과가 나왔다
MCP 서버, API 아니라 UI처럼 설계하라
"MCP 죽었다" 논쟁 속, 문맥 낭비를 줄이는 설계 4원칙
LLM 에이전트가 새 알고리즘을 발명했다
개념 지우기 실험에서 사람 방법을 넘는 6개 알고리즘 자율 발견
AI 코딩 도구 샌드박스, 어떻게 막나
클로드 코드·코덱스가 셸 권한 위험을 OS 격리로 막는 두 가지 방식
MCP 서버 90개, 보안 점수로 줄세웠다
캡프레임이 공개 MCP 서버를 규칙 엔진으로 채점한 보안 리더보드
에이전트가 내 PC를 망치기 전, 샌드박스의 벽
클로드 코드와 코덱스가 검토되지 않은 코드 실행 위험을 막는 격리 방식 분석
AI 코딩, 개발자를 무디게 만들까
클로드 코드에 의존할수록 실력은 녹슬고 관리 역량은 자란다는 고백
AI 에이전트에 보안전문가 '스킬' 817개
6대 프레임워크에 매핑된 오픈소스 보안 스킬 라이브러리가 깃허브에서 2만 별을 넘겼다.
클로드 코드 '확장 사고' 로그는 요약본이었다
화면에 보이는 사고 과정은 요약본일 뿐, 실제 추론은 암호화돼 사용자가 볼 수 없다
알파폴드 주역, 앤트로픽으로 간다
구글 딥마인드 떠난 존 점퍼, 9년 만에 앤트로픽 합류를 직접 선언
AI 코딩의 정답은 프롬프트 아닌 '루프'
한 방 프롬프트의 한계 — 작은 변경·하드 게이트·정직한 종료의 3원칙
AI는 '접근성'을 선택사항으로 본다
규칙에 명시해도 클로드 코드가 접근성 수정을 뒤로 미룬다는 제보
클로드 코드로 메타 모델 제친 신약 AI
앙스트롬, GPU 10만 잡을 에이전트에 맡겨 DFT 정확도·1만배 속도 모델 완성
가짜 버그리포트로 AI 코딩 에이전트가 털린다
텐엣, 센트리 악용해 클로드 코드·커서 원격 코드 실행 입증
마크다운이 곧 데이터베이스 — 에이전트용 지식 OS 코텍스
카르파티의 'LLM 위키' 패턴을 구현한 오픈소스, MCP로 에이전트와 지식 공유
클로드 코드 한도, 미리 예측한다
OAuth 사용량 API로 사용 한계를 통계 예측하는 단일 바이너리 claumon
같은 모델도 도구 따라 성능이 갈린다
Artificial Analysis, 코딩 에이전트를 비용·토큰·시간까지 측정한 벤치마크 공개
AI 에이전트의 '셀프 검증'… 자기 채점을 못 믿는다면
에이전트가 '완료'를 선언하기 전 통과해야 하는 게이트 — 자동화 품질의 빗장