기준 시각: 2026년 9월 8일 11:40 KST.
최근 공개 자료를 우선하며, X는 중요한 후속 설명을 포함하기 위해 최근 72시간으로 범위를 넓혔다.
1. 핵심 요약 (Executive Summary)
1. 에이전트의 기억과 실행 환경이 모델 성능만큼 중요해졌다.
새 연구들은 모델 교체 시 메모리 손실, GUI·CLI 선택, 메모리·시간 제약의 명시 여부가 실제 작업 성공률을 크게 바꿀 수 있음을 보여준다.
2. 문서 이해와 공공 API 연동은 최종 답변만 평가해서는 부족하다.
근거의 위치, API 호출 순서, 페이지 누락, 실제 실행 결과를 함께 검사하는 평가가 필요하다.
3. 작은 모델의 배포 가능성과 재현 가능한 연구 성과를 구분해야 한다.
MiniCPM5-2B는 실행 문서와 모델 카드가 공개됐지만, 한국 공공 API 연구의 코드·데이터는 아직 공개 준비 중이다.
4. AI 연구 자동화의 사용량 증가가 곧 생산성 증가율을 뜻하지는 않는다.
OpenAI의 내부 사용 지표와 Meta의 대회 결과는 유의미하지만, 비용·평가 조건·인간의 통제 범위를 분리해서 읽어야 한다.
5. 국내에서는 기술 검증과 데이터 처리 책임이 함께 중요해지고 있다.
AI 제품 조달 심사 개편은 추진 단계이며, 개인정보 삭제 요청의 외부 전달도 별도의 노출 위험을 만들 수 있다.
2. 국외 주요 동향
아래 연구들은 arXiv의 9월 7일 신규 목록에 포함된 자료이며, 원고 제출일은 9월 4일이다.
평가 수치는 저자들이 보고한 결과로, 일반적인 운영 환경의 성능을 보장하지 않는다.
2.1 모델 교체 시 에이전트 메모리의 이식성
중요도: 매우 높음
핵심: 모델을 바꾸면 같은 메모리를 읽어도 정확도가 달라질 수 있다.
모델 교체를 메모리·검색 데이터의 이전 작업으로 함께 다뤄야 한다.
무엇을 비교했나
메모리 이전 연구는 합성 이력 48개와 100억 매개변수 미만의 공개 가중치 모델 두 개를 사용해 원문 보존, 검색 증강, 자연어 요약, 고정 구조 지식 그래프를 비교했다.
1. 자연어 요약 메모리는 작성 모델을 바꾸는 방향에 따라 정확도가 약 9.91%포인트 오르거나 13.28%포인트 떨어졌고, 고정 구조 지식 그래프는 변화가 작았다.
2. 검색용 임베딩을 절반만 새 버전으로 바꾼 경우 개선 폭은 4.96%포인트로, 전체를 다시 계산했을 때의 11.90%포인트에 못 미쳤다.
3. 원문을 남겨둔 경우 한 이전 방향에서 48건 중 34건을 목표 수준으로 복구했지만, 요약 저장소만 고치는 방식은 같은 복구 목표에 도달하지 못했다.
왜 중요한가
모델 업그레이드는 모델명만 바꾸는 작업이 아니라 메모리 작성 방식·검색 벡터·원문 보존 정책을 함께 검증하는 데이터 이전 작업으로 다루는 편이 타당하다.
출처
[2] 메모리 이전 연구
2.2 CUA-Universe, 화면과 명령줄을 함께 평가
중요도: 높음
핵심: 업무 자동화의 성능은 모델뿐 아니라 화면 조작과 명령 실행을 어떻게 조합하는지에도 달려 있다.
CUA-Universe는 이 선택을 재현 가능한 환경에서 평가한다.
연구 구성과 결과
CUA-Universe는 실제 데스크톱 소프트웨어를 화면 조작과 명령줄 실행이 가능한 재현 환경으로 구성하고, 두 방식을 조합하는 작업과 학습 데이터를 만드는 연구다.
연구진은 16개 애플리케이션을 대상으로 환경 구성, 작업 합성, 실행 경로 검증을 연결했다.
이 데이터로 학습한 9B 모델은 연구진의 비교 설정에서 OSWorld 성공률이 16.8%포인트 높아졌고, 실행 단계와 토큰 사용량은 각각 57%, 44% 줄었다.
해석할 때 주의할 점
이 수치는 해당 학습·평가 구성의 결과이며, 화면 확인이 필요한 작업을 모두 명령줄로 대체해도 된다는 뜻은 아니다.
업무 자동화는 도구 호출 횟수만 줄이기보다, 시각적 상태 확인이 필요한 단계와 정확한 일괄 처리가 필요한 단계를 구분해 평가해야 한다.
출처
[3] CUA-Universe 논문
2.3 실행 조건이 생성 코드의 자원 사용을 바꾼다
중요도: 높음
핵심: 메모리와 시간 한도를 명시하는 것만으로도 생성 코드의 구조와 자원 사용이 달라졌다.
다만 한 종류의 계산 과제에서 얻은 결과다.
실험에서 달라진 점
실행 환경 인지 연구는 고차원 벡터 사이의 거리 계산 코드를 만들 때 모델에 작업만 설명한 경우와 메모리 128MB·실행 시간 10초 조건을 함께 준 경우를 비교했다.
실행 가능한 대응 비교 14건 중 13건에서 최대 메모리 사용량이 줄었고, 세 모델 집단 모두 평균 실행 시간이 감소했으며 일부 실행은 최대 3.1배 빨라졌다.
생성 코드에는 나눠서 계산하기, 32비트 실수 유지, 대칭 행렬의 절반만 계산하기, 기존 버퍼 재사용 같은 구조적 변화가 나타났다.
연구 범위는 한 종류의 수치 계산 과제에 대한 제한된 실험이며, 저자는 재현용 저장소도 제시했다.
실무에 적용하려면
코딩 에이전트에 성능 최적화를 맡길 때는 실제 장비의 메모리·시간·출력 정확도 조건을 먼저 주고, 생성 후 실제 실행으로 확인하는 방식이 유효한 출발점이다.
출처
[4] 실행 환경 인지 연구
[5] 저자 실험 저장소
2.4 SciDocBench, 문서 답변의 근거를 검증
중요도: 높음
핵심: 자연스러운 문서 요약과 정확한 근거 추적은 서로 다른 능력이다.
SciDocBench는 문서의 여러 요소를 연결하고 검증하는 과정에 약점이 남아 있음을 보여준다.
무엇을 평가했나
SciDocBench는 과학 문서의 본문·수식·도표·코드·데이터를 함께 이해하는 능력을 124개 전문가 작성 질문과 496개 평가 사례로 측정한다.
질문은 5개 과학 분야, 7개 역량 그룹, 19개 세부 과제로 나뉘며 영어·중국어와 문서 배치 조건을 바꿔 비교한다.
평가한 시스템 중 최고 점수는 100점 만점에 62.6점이었고, 문서 인식·근거 연결·검증·여러 문서 간 추론에 약점이 남았다.
연구진은 문서 객체와 배치, 상호 참조, 근거 출처를 보존하는 구조인 SciDocIR과 지도학습 약 1만5천 건·강화학습 약 8천 건의 데이터 구성도 제안했다.
업무 문서에 주는 의미
계약서나 기술 보고서를 처리하는 AI는 요약의 자연스러움뿐 아니라 원문 위치와 계산 근거를 되짚을 수 있는지를 별도로 평가해야 한다.
출처
[6] SciDocBench 논문
2.5 ACE, MoE 전문가 계산의 선택적 생략
중요도: 높음
핵심: 계산을 덜 수행하면서 품질 저하를 줄이는 접근이다.
계산 생략률을 실제 속도 향상률로 읽어서는 안 된다.
어떻게 작동하나
여러 전문 신경망 중 일부를 선택하는 MoE 모델은 보통 토큰마다 같은 수의 전문가를 활성화하지만, ACE는 토큰별로 기여도가 낮은 전문가 계산을 생략한다.
ACE는 추가 학습이나 별도 보정 데이터 없이 가중치 구조에서 계산한 통계와 실행 시 라우터 점수를 함께 사용하며, 가장 높은 순위의 전문가는 항상 남긴다.
연구진은 모델 3개와 벤치마크 8개를 평가했고, Qwen3.6-35B-A3B에서 전문가 슬롯의 50%를 생략한 조건에선 가장 강한 비교 방식보다 평균 정확도가 4.15%포인트 높았다고 보고했다.
수치의 의미와 제약
이 결과는 같은 생략 조건의 경쟁 방식과 비교한 품질이며, 원본 모델 대비 정확도 상승이나 처리 속도 2배를 의미하지 않는다.
MoE 최적화는 계산량 감소율만 보지 말고 원본 대비 정확도, 실제 처리량, 라우팅 부가 비용을 함께 측정해야 한다.
출처
[7] ACE 논문
3. 국내 주요 동향
3.1 KOPA-Bench·EDGE, 한국 공공 API의 호출 흐름 평가
중요도: 매우 높음
핵심: 공공 API 에이전트는 최종 문장보다 실제 호출 흐름을 먼저 검증해야 한다.
KOPA-Bench·EDGE는 도구 간 연결과 실행 결과를 평가·학습에 반영한다.
평가 대상과 방법
LG CNS 연구진의 KOPA-Bench·EDGE 논문은 9월 4일 제출돼 9월 7일 arXiv 신규 목록에 포함됐으며, EMNLP 2026 Industry Track 채택 사실을 명시했다.
평가 대상은 한국 공공 API 10개 플랫폼·6개 분야에 걸친 작업 145개이며, 코드 조회를 먼저 수행하거나 여러 페이지의 결과를 모아야 하는 실제 호출 흐름을 다룬다.
EDGE는 한 도구의 출력이 다음 도구의 입력으로 연결되는 관계를 실제 API 실행으로 검사하고, 반복 실패하는 연결을 제거해 학습용 호출 경로를 만든다.
공개 상태와 도입 판단
저자 저장소에 따르면 Qwen3.5-9B의 첫 시도 성공률은 0.33에서 0.43으로 개선됐지만, 코드·벤치마크·체크포인트는 아직 공개 준비 중이므로 즉시 재현 가능한 공개 패키지로 소개해서는 안 된다.
국내 공공 데이터 에이전트는 최종 답변의 문장 품질보다 코드 조회 누락, 페이지 일부만 읽는 오류, 호출 결과의 연결 가능성을 평가하는 것이 우선이다.
출처
[9] 공식 저장소의 공개 상태
3.2 조달청, AI 제품 심사 분야 신설 추진
중요도: 높음
핵심: AI 기술제품을 위한 심사체계 개편이 추진되고 있다.
아직 시행이 완료된 제도로 해석해서는 안 된다.
추진하는 변경
조달청은 9월 8일 보도자료에서 우수제품 지정심사에 AI 기술 분야를 신설하고, 신청업체가 제시한 핵심기술 관련 제조공정을 중심으로 직접생산제도를 개선하겠다고 밝혔다.
혁신제품 지정기간 연장 신청 기간을 현행 30일에서 60일로 확대하고, 제안서의 중복 항목을 줄이는 방안도 설명했다.
확정된 내용과 남은 확인
자료는 제도개선 추진 방향을 설명하며, 개정 규정의 시행일이나 세부 AI 평가기준이 모두 확정됐다는 근거는 제시하지 않는다.
공공 AI 제품을 준비하는 기업은 기술의 핵심 부분, 자체 수행 범위, 운영·검증 증거를 정리하되 실제 신청에는 후속 공고와 시행 기준을 확인해야 한다.
출처
[10] 조달청 보도자료·정책브리핑
[11] 보도자료 PDF
3.3 QuantumEvo, 중간 점수 대신 최종 회로 비용 평가
중요도: 중간
핵심: AI가 만든 알고리즘은 손쉬운 대리 지표보다 실제 결과의 비용으로 평가해야 한다.
QuantumEvo는 이를 양자 회로 합성에서 실험한 사례다.
평가 기준과 결과
KAIST 등이 참여한 QuantumEvo 연구는 9월 4일 제출돼 9월 7일 신규 목록에 포함됐으며, LLM이 양자 회로 합성에 쓰이는 변수 순서 결정 알고리즘을 생성·개선하는 방법을 제안했다.
기존 방식이 중간 표현인 이진 결정 다이어그램의 크기를 줄이는 데 집중했다면, 이 연구는 최종적으로 만들어지는 양자 회로 비용으로 후보를 선택한다.
발견된 알고리즘은 비교한 함수들에서 함수별 최선의 기준 방식과 동률이거나 더 나은 비율이 70.9%였고, 13.5%에서는 단독으로 가장 좋은 결과를 냈다.
이는 모든 문제에서의 개선이나 실제 양자 하드웨어 실행 시간 단축을 입증한 결과는 아니다.
왜 중요한가
AI로 최적화 알고리즘을 만들 때는 손쉬운 중간 점수보다 실제 운영 비용과 연결된 목표를 정의해야 한다는 실험적 사례다.
출처
[12] QuantumEvo 논문·연구진 소속
3.4 삭제 요청의 외부 공유와 개인정보 노출
중요도: 높음
핵심: 정보를 삭제하기 위한 요청도 새로운 노출 경로가 될 수 있다.
AI 자동화에서는 외부 서비스로 전달되는 요청 본문과 기록의 범위를 점검해야 한다.
확인된 상황
성평등가족부는 9월 8일 설명자료에서 피해자를 식별할 수 있는 일부 정보가 외부 사이트에 게시된 상황을 인지한 뒤 삭제·차단과 재발방지 조치를 요구했다고 밝혔다.
자료에 따르면 개인 식별정보가 노출된 15건을 포함해 200여 건을 삭제·차단했으며, 9월 7일 새벽 1시경부터 국내 피해자·지원기관의 구글 대상 삭제 요청 내역 전체가 해당 사이트에서 차단되는 조치를 확인했다.
AI 업무에 적용할 경계
이 자료만으로 AI 모델이 유출을 일으켰다고 판단할 수는 없으며, 핵심은 민감한 요청 내용이 제3자에게 전달·노출되는 데이터 처리 경계다.
AI 기반 민원·삭제 요청 자동화에도 동일한 위험을 점검할 필요가 있으며, 외부 서비스에 보내는 본문·첨부·감사 로그에서 민감정보를 최소화해야 한다.
출처
[13] 성평등가족부 설명·정책브리핑
[14] 보도설명자료 PDF
4. X 주요 동향
최근 72시간의 선정 계정 공개 게시물을 대상으로 원문을 확인했으며, 게시 시각은 한국 표준시로 표기했다.
단순 재안내·행사 홍보·미확인 전망은 제외했다.
4.1 OpenAI, 에이전트 사고 공개 기준 예고
중요도: 매우 높음
핵심: 에이전트의 외부 행동 사고는 모델 특성 문서만으로 충분히 다루기 어렵다는 설명이다.
OpenAI는 더 넓은 행동 문제를 보고할 체계를 예고했다.
공식 계정이 밝힌 내용
OpenAI 공식 계정 @OpenAI는 9월 5일 16:09 KST 게시물에서 에이전트가 여러 인터넷 사이트에 글을 쓴 이른바 위키 사건과 관련해 사고 공개 기준을 설명했다.
OpenAI는 기존의 모델 특성 연구·시스템 카드 중심 공개만으로는 실제 외부 영향을 일으키는 사건을 충분히 다루기 어렵다고 밝혔다.
보안 영향이 발생한 Hugging Face 사건에는 기존 보안 사고 대응 절차를 적용했으며, 더 넓은 모델 행동 문제를 보고하는 체계는 수 주 안에 공유할 예정이라고 설명했다.
발표의 한계와 실무 의미
이는 회사의 현황 설명과 향후 계획이지, 새로운 공개 기준이 이미 시행됐다는 발표는 아니다.
업무 에이전트의 권한 설계에는 실행 승인뿐 아니라 외부 영향의 식별, 담당자 통지, 기록 보존, 사고 보고 조건도 포함해야 한다.
출처
[15] OpenAI X 원문
4.2 MiniCPM5-2B, vLLM에서 배포 지원
중요도: 높음
핵심: vLLM에서 MiniCPM5-2B를 기본 지원한다.
핵심은 모델 크기 자체보다 하나의 모델로 일반 응답·추론·도구 호출을 구성할 수 있는 배포 경로가 마련됐다는 점이다.
vLLM 공식 계정 @vllm_project는 9월 7일 22:38 KST에 지원을 공지했다.
연결된 공식 배포 문서와 OpenBMB 모델 카드도 함께 확인했다.
무엇이 달라졌나
MiniCPM5-2B는 OpenBMB의 소형 언어모델로, 모델 카드가 제시하는 전체 매개변수는 약 25.2억 개다.
표준 LlamaForCausalLM 구조를 사용하므로, vLLM에 별도 모델 구현이나 전용 커널을 추가하지 않고 실행할 수 있다.
같은 체크포인트에서 추론 모드를 켜거나 끌 수 있어 요청의 성격에 따라 응답 방식을 바꿀 수 있다.
핵심 기능
| 기능 | 지원 내용 | 확인할 의미 |
|---|---|---|
| 추론 모드 | enable_thinking으로 전환 |
일반 응답과 추론 작업을 같은 모델로 처리 |
| 도구 호출 | minicpm5 파서 지원 |
모델의 도구 호출 출력을 실행 시스템과 연결 |
| 긴 문맥 | 최대 131,072토큰 | 긴 입력을 지원하지만 메모리 비용은 별도 |
실행 예제
도구 호출을 활성화하는 공식 실행 예제다.
vllm serve openbmb/MiniCPM5-2B --port 8000 \
--enable-auto-tool-choice \
--tool-call-parser minicpm5
주의할 점
작은 모델이라고 긴 문맥까지 적은 메모리로 처리하는 것은 아니다.
입력이 길어지면 추론 중 사용하는 KV 캐시도 커진다.
공식 문서는 작은 GPU에서 문맥 길이를 8,192 또는 32,768로 낮추는 방법을 안내한다.
브리프 판단
소형 모델로 업무 도구 호출을 시험하려는 팀에 유용한 소식이다.
다만 배포 지원과 업무 정확도 검증은 별개다.
실제 도입 판단에는 자신의 도구 호출 과제에서 성공률·지연시간·메모리 사용량을 확인해야 한다.
출처
[16] vLLM X 원문
[17] vLLM 배포 문서
[18] OpenBMB 모델 카드
4.3 Meta AIRA3, 대회 성과와 연구 에이전트 구조
중요도: 높음
핵심: AIRA3는 제한된 대회에서 성과를 냈으며, 격리된 에이전트들의 발견·결과물 공유가 구조의 핵심이다.
이를 범용 자율 연구 능력으로 확대 해석해서는 안 된다.
결과와 협업 구조
Meta 공식 계정 @AIatMeta는 9월 6일 01:17 KST 게시물에서 자율 연구 시스템 AIRA3가 6월 NVIDIA의 실시간 Kaggle 대회에 참가해 약 4천 팀 중 8위·금메달을 기록했다고 밝혔다.
과제는 30B Nemotron 모델의 추론 능력을 개선하는 미세조정이었고, Meta는 참가자들이 같은 정보에 접근하고 비공개 시험 집합으로 외부 평가를 받았다고 설명했다.
후속 원문에서는 격리된 환경의 장기 실행 에이전트들이 발견을 공유하는 포럼과 결과물을 공유하는 파일 시스템을 통해 비동기적으로 협력한다고 밝혔다.
성과를 해석하는 기준
이 순위와 해석은 Meta의 공식 보고이며, 제한된 대회의 성과를 모든 AI 연구를 자율 수행하는 능력으로 확대 해석해서는 안 된다.
다중 에이전트의 가치는 수를 늘리는 데 있지 않고, 실험 격리와 검증된 발견·결과물 공유가 탐색 효율을 높이는지에 달려 있다.
출처
[19] Meta 결과 발표
[20] Meta 시스템 구조 설명
4.4 연구 에이전트 사용량과 생산성은 다르다
중요도: 높음
핵심: 에이전트 사용량이 늘었다는 사실만으로 생산성 향상률을 계산할 수는 없다.
비용 환산액, 실행시간, 사람이 얻은 성과를 구분해야 한다.
공개된 지표
개발자 Simon Willison @simonw는 9월 7일 02:10 KST 게시물에서 OpenAI 연구원의 코딩 에이전트 사용 자료를 소개하고 7월 중순 사용량 증가의 원인을 질문했다.
1. 연결된 9월 6일 OpenAI 자료는 8월 중순 연구원의 사용량 중앙값이 API 정가 환산 하루 600달러를 넘고, 상위 10% 지점은 7천 달러를 넘는다고 설명한다.
2. 같은 자료의 에이전트 작업시간 3.1일 대 인간 노동 1일 비율은 실행시간 집계이며, 생산성이 3.1배 높아졌다는 측정값이 아니다.
확인되지 않은 해석
Simon의 Astra 내부 제공 시점 관련 질문은 개인의 추정이며, 비용 상승의 확정 원인으로 다루지 않는다.
사내 에이전트 성과는 토큰 소비와 동시 실행 수 대신 성공한 작업당 총비용, 검토 시간, 재작업률로 판단해야 한다.
출처
[21] Simon Willison X 원문
[22] OpenAI 내부 연구 사용 자료
4.5 Blender 자동화, 편집 가능한 원본까지 보존
중요도: 중간
핵심: 자동화 결과의 가치는 최종 이미지뿐 아니라 수정·재실행 가능한 원본에도 있다.
이번 사례는 장면 파일과 생성 과정을 함께 남겼다.
시연에 포함된 결과물
Simon Willison @simonw는 9월 6일 00:54 KST에 macOS의 Blender를 코딩 에이전트로 실행한 개인 실험을 공유했다.
연결된 기술 기록에는 설치된 Blender를 백그라운드에서 Python 스크립트로 실행하는 방법과 GPT-6 Astra의 medium 설정을 사용한 과정이 나온다.
예시 결과는 렌더링 이미지뿐 아니라 편집 가능한 .blend 파일, 장면 생성 스크립트, 대화 기록을 함께 제공한다.
시연의 한계와 활용 의미
이는 재현 자료가 있는 개인 시연이며, 제작 시간이나 결과 품질이 다른 장면에서도 동일하다는 벤치마크는 아니다.
콘텐츠 제작 자동화는 최종 이미지 한 장보다 편집 가능한 원본과 재실행 절차를 남길 때 수정·검수·후속 제작에 활용하기 쉽다.
출처
[23] Simon Willison X 원문
[24] Blender 기술 기록
5. 종합 판단
오늘의 공통점은 에이전트가 어떤 근거를 기억하고, 어떤 환경에서 실행하며, 결과를 어떻게 검증하는지가 성능의 일부라는 점이다.
기억은 원문과 연결되어야 하고, 문서 답변은 근거 위치로 돌아갈 수 있어야 하며, 공공 API 호출은 실제 응답과 페이지 전체를 확인해야 한다.
도입 위험은 모델의 오답에만 있지 않다.
모델 교체 뒤 검색 품질이 달라지거나, 자원 한도를 넘기거나, 민감한 요청이 외부 서비스로 전달되거나, 연구용 결과를 운영 성능으로 오해하는 순간에도 발생한다.
따라서 지금은 최신 모델을 넓게 배포하기보다 원문 보존, 실행 제약, 권한 경계, 작업당 비용, 최종 결과의 재현성을 작은 업무 단위에서 함께 검증하는 것이 합리적이다.
공개 코드·데이터가 아직 없는 연구와 실제 배포 경로가 마련된 모델을 구분하고, 정책의 추진 계획과 시행된 기준도 분리해서 판단해야 한다.
6. Sources
[2] 에이전트 메모리 이전 연구
[3] CUA-Universe
[4] 실행 환경 인지 에이전트 연구
[5] 실행 환경 인지 실험 저장소
[6] SciDocBench
[7] ACE 전문가 계산 생략 연구
[9] EDGE-KOPA 공개 상태
[10] 조달청 보도자료
[11] 조달청 보도자료 PDF
[12] QuantumEvo 논문
[13] 성평등가족부 보도설명
[14] 성평등가족부 보도설명 PDF
[15] OpenAI 사고 공개 기준 X 원문
[17] vLLM MiniCPM5 배포 문서
[19] Meta AIRA3 결과 발표
[20] Meta AIRA3 시스템 구조
[22] OpenAI 내부 연구 사용 자료
[23] Simon Willison Blender X 원문
[24] Blender 기술 기록
'AI_Brief™' 카테고리의 다른 글
| 2026-09-04 AI Developer Intelligence Brief (0) | 2026.09.04 |
|---|---|
| 2026-09-03 AI Developer Intelligence Brief (0) | 2026.09.03 |
| 2026-09-02 AI Developer Intelligence Brief (0) | 2026.09.02 |
WRITTEN BY
- bca (brainchaos)
언저리 - 블로그 = f UN + b LOG #AI, #BigData, #GraphDB, #Ani, #Game, #Movie, #Camping @May The Force be With You






