시스메틱 데일리코딩 못해도 AI로 자동화 시스템 만드는 법
기술·논문 · LLM 구조·연구 동향
기술·논문

클로드 코드 안전장치, 44KB는 공개되지 않았다

5단 관문·2단 분류기 구조 해부 — 규칙보다 '동의 해석'이 승부처

2026.08.084분 읽기
기술·논문

에이전트는 메모보다 대화로 학습했다

클로드 코드 자기개선 실험, 성공률 34→48%… 메모리 파일 효과는 사실상 0

2026.08.074분 읽기
기술·논문

메타 자체 벤치마크에서도 1위는 클로드였다

뮤즈 코드 차트 3종 실측 — 2위 다툼이지 왕좌 도전은 아니다

2026.08.064분 읽기
기술·논문

에이전트 병목은 모델 아닌 데이터 이동

추론 가속 없이 데이터 흐름만 손봐 파이프라인 4.64배 빨라졌다는 연구 결과

2026.08.053분 읽기
기술·논문

클로드 코드 훅이 끝내 알려주지 않는 6가지

에이전트 상태를 자동 감시하려 했더니 훅만으로는 여섯 곳에서 어긋났다

2026.08.044분 읽기
기술·논문

격리 뚫린 평가장, 클로드가 실제 기업 3곳 침투

앤트로픽 자진 공개 — 시뮬레이션인 줄 알았던 테스트에 인터넷이 열려 있었다

2026.08.024분 읽기
기술·논문

중국 모델로 배워도 검열은 안 따라왔다

152쌍 대조 실험 — 금융 추론은 오르고 정치 검열은 전이되지 않았다

2026.08.013분 읽기
기술·논문

클로드 코드 토큰 96.8%는 '대화 다시 읽기'였다

32개 세션 실측 — 내가 친 글자는 0.01%, 진짜 범인은 덩치 큰 도구 응답

2026.07.313분 읽기
기술·논문

일부러 뚫리게 만든 MCP 서버 실습장 등장

OWASP 에이전틱 톱10 전체를 재현한 오픈소스 보안 훈련장 '엠시플로이터블'

2026.07.303분 읽기
기술·논문

에이전트 시대의 병목은 검증이다

오픈AI가 코딩 에이전트를 투입한 과학 소프트웨어 8개 프로젝트 현장 보고서를 공개했다.

2026.07.293분 읽기
기술·논문

기본값 하나가 승인 절차를 지웠다

클로드 코드 60초 자동 진행 사태가 남긴 방어 설계 3종

2026.07.284분 읽기
기술·논문

클로드 쿡북, 운영 단계 레시피까지 확장

에이전트 배포·평가·비용 분석 예제 총망라, 1인 운영자에겐 설계도

2026.07.273분 읽기
기술·논문

당신이 만든 건 에이전트가 아니라 자동화다

미션을 주면 에이전트, 절차를 주면 자동화 — 용어 혼선이 만드는 실무 손해

2026.07.264분 읽기
기술·논문

AI 코딩 망치는 5가지 힘, 처방전 나왔다

모호함·기억상실·표류·불투명·엔트로피를 마크다운 규율로 잡는 오픈소스 프레임워크

2026.07.253분 읽기
기술·논문

AI 에이전트, 해킹보다 무서운 '실수 삭제'

클로드 코드·코덱스 데이터 삭제 사고 5가지 유형 — 공격이 아니라 서투름이 문제다

2026.07.244분 읽기
기술·논문

인기 MCP 서버 3분의 1이 낙제점

36개 서버를 채점했더니, 스펙은 지켜도 에이전트가 못 쓰는 서버가 수두룩했다.

2026.07.233분 읽기
기술·논문

모델 4종에 색연필을 쥐여준 실험

그림 28장이 드러낸 비용 20배와 자기검토 습관의 격차

2026.07.224분 읽기
기술·논문

가짜 AI 스킬 800개가 악성코드를 심었다

에이전트가 스스로 악성 저장소를 찾아 사용자에게 설치를 권한 사례가 확인됐다

2026.07.214분 읽기
기술·논문

클로드 코드, 러스트로 다시 쓴 '번' 탑재 확인

사이먼 윌리슨이 바이너리 분석으로 검증…리눅스 시작 속도 10% 개선

2026.07.203분 읽기
기술·논문

클로드가 남발하는 단어들, 데이터로 잡았다

'load-bearing' 7,500배 등 AI 문체의 흔적을 빈도 분석으로 정리

2026.07.173분 읽기
기술·논문

연결 전엔 모른다, MCP 서버 신뢰 점수

엠시피 트러스트카드, 8개 항목 100점으로 서버를 훑는다

2026.07.164분 읽기
기술·논문

흩어진 AI 대화 이력, 로컬에서 캐낸다

클로드 코드·커서·챗GPT 기록을 통합해 잊은 아이디어를 되살리는 오픈소스 알루비아

2026.07.154분 읽기
기술·논문

MS 실증연구, AI CLI 도입자 PR 24% 증가

수만 명 4개월 추적 — 확산은 공지가 아니라 동료 네트워크를 탔다

2026.07.143분 읽기
기술·논문

클로드 코드, 첫 요청부터 3만 토큰 삼킨다

같은 모델·같은 과제 계측, 오픈코드보다 훨씬 무거운 기본값

2026.07.133분 읽기
기술·논문

AI가 SaaS API 고를 때 보는 '검증 벤치마크'

벤더 홍보 말고 직접 검증한 정답으로 — 에이전트의 '만들까 살까'를 돕는 공개 데이터

2026.07.123분 읽기
기술·논문

AI 감독이 리그를 운영한다, 에이전틱 FC

MCP로 장기 플레이하는 오픈소스 축구 매니지먼트 시뮬

2026.07.113분 읽기
기술·논문

AI 에이전트, 진짜 실무 55개 직군서 시험대에

버클리 주도 '에이전트 마지막 시험' 벤치마크, 실물 업무로 평가

2026.07.103분 읽기
기술·논문

에이전트가 코딩, 사람은 전략 — 캐글 연구법

클로드 코드로 초거대 퍼즐 탐색, 인간 역할은 실험 설계로 이동

2026.07.093분 읽기
기술·논문

커서 샌드박스 뚫렸다 — AI 에이전트엔 커널 경계가 필요하다

경로 처리 버그 2개로 원격코드실행까지, 커서 3.0에서 수정

2026.07.083분 읽기
기술·논문

없는 필드를 지어내는 RAG, 구조로 틀어막는다

속성 카탈로그를 검색 단위로 삼아 LLM 환각을 원천 차단하는 AK-RAG 패턴

2026.07.073분 읽기
기술·논문

확신 대신 불확실성 재는 AI 조사 에이전트

검색 결과를 답이 아닌 '노이즈 낀 단서'로 다루고, 근거가 부족하면 '판단 불가'라 답하는 오픈소스 에이전트.

2026.07.063분 읽기
기술·논문

AI를 '동료'라 부르면 사람이 실수를 놓친다

AI 에이전트를 직원처럼 부를수록 인간이 오류를 18% 덜 잡아낸다는 연구 결과가 나왔다

2026.07.043분 읽기
기술·논문

MCP 서버, API 아니라 UI처럼 설계하라

"MCP 죽었다" 논쟁 속, 문맥 낭비를 줄이는 설계 4원칙

2026.07.033분 읽기
기술·논문

LLM 에이전트가 새 알고리즘을 발명했다

개념 지우기 실험에서 사람 방법을 넘는 6개 알고리즘 자율 발견

2026.07.023분 읽기
기술·논문

AI 코딩 도구 샌드박스, 어떻게 막나

클로드 코드·코덱스가 셸 권한 위험을 OS 격리로 막는 두 가지 방식

2026.06.303분 읽기
기술·논문

MCP 서버 90개, 보안 점수로 줄세웠다

캡프레임이 공개 MCP 서버를 규칙 엔진으로 채점한 보안 리더보드

2026.06.293분 읽기
기술·논문

에이전트가 내 PC를 망치기 전, 샌드박스의 벽

클로드 코드와 코덱스가 검토되지 않은 코드 실행 위험을 막는 격리 방식 분석

2026.06.283분 읽기
기술·논문

AI 코딩, 개발자를 무디게 만들까

클로드 코드에 의존할수록 실력은 녹슬고 관리 역량은 자란다는 고백

2026.06.263분 읽기
기술·논문

AI 에이전트에 보안전문가 '스킬' 817개

6대 프레임워크에 매핑된 오픈소스 보안 스킬 라이브러리가 깃허브에서 2만 별을 넘겼다.

2026.06.253분 읽기
기술·논문

클로드 코드 '확장 사고' 로그는 요약본이었다

화면에 보이는 사고 과정은 요약본일 뿐, 실제 추론은 암호화돼 사용자가 볼 수 없다

2026.06.233분 읽기
기술·논문

알파폴드 주역, 앤트로픽으로 간다

구글 딥마인드 떠난 존 점퍼, 9년 만에 앤트로픽 합류를 직접 선언

2026.06.213분 읽기
기술·논문

AI 코딩의 정답은 프롬프트 아닌 '루프'

한 방 프롬프트의 한계 — 작은 변경·하드 게이트·정직한 종료의 3원칙

2026.06.203분 읽기
기술·논문

AI는 '접근성'을 선택사항으로 본다

규칙에 명시해도 클로드 코드가 접근성 수정을 뒤로 미룬다는 제보

2026.06.193분 읽기
기술·논문

클로드 코드로 메타 모델 제친 신약 AI

앙스트롬, GPU 10만 잡을 에이전트에 맡겨 DFT 정확도·1만배 속도 모델 완성

2026.06.183분 읽기
기술·논문

가짜 버그리포트로 AI 코딩 에이전트가 털린다

텐엣, 센트리 악용해 클로드 코드·커서 원격 코드 실행 입증

2026.06.163분 읽기
기술·논문

마크다운이 곧 데이터베이스 — 에이전트용 지식 OS 코텍스

카르파티의 'LLM 위키' 패턴을 구현한 오픈소스, MCP로 에이전트와 지식 공유

2026.06.133분 읽기
기술·논문

클로드 코드 한도, 미리 예측한다

OAuth 사용량 API로 사용 한계를 통계 예측하는 단일 바이너리 claumon

2026.06.123분 읽기
기술·논문

같은 모델도 도구 따라 성능이 갈린다

Artificial Analysis, 코딩 에이전트를 비용·토큰·시간까지 측정한 벤치마크 공개

2026.06.113분 읽기
기술·논문

AI 에이전트의 '셀프 검증'… 자기 채점을 못 믿는다면

에이전트가 '완료'를 선언하기 전 통과해야 하는 게이트 — 자동화 품질의 빗장

2026.06.113분 읽기