IT 뉴스
키워드 IT 결과입니다.
-
새 소식
goshot - 코드 스크린샷 생성기
주문 메시지를 읽는 LLM 파이프라인을 검증하려고 테스트 29개를 만들었는데, 그 중 정상 케이스는 4개뿐입니다. 나머지는 전부 함정입니다. 제일 많은 그룹은 "주문이 아닌 것" 6개. 상품명과 숫자가 다 있는 단순 문의를 주문으로 잡으면 안 시킨 물건이 출고됩니다 문제만 어렵게 내지 않고 대조할 상품 데이터에도 함정을 심었습니다. 폭만 다른 투명테이프 2종, 같은 숫자로 시작하는 상품 5종, 제각각인 박스 입수. 깨끗한 데이터로 시험보면 전부 통과하고 실전에서 무너집니다 가장 놓치기 쉬운 건 "학습이 쌓인 뒤"의 동작입니다. 테이프=48mm로 학습된 상태에서 "테이프 60 2박스"가 오면 명시 규격이 학습을 이겨야 합니다. 카탈로그 기능이 사고 기능이 되는 지점입니다 테스트 케이스 29개와 함정 심은 상품 목록은 전부 공개해 두었습니다. https://github.com/ramses203/llm-test-harness
ESSLLM사고ITGo -
새 소식
kubara - 모범 사례 기반으로 Kubernetes 플랫폼을 부트스트랩하는 CLI
GitOps-first 워크플로우 로 Kubernetes 플랫폼을 부트스트랩하고 운영하는 Opionated CLI 플랫폼 스캐폴딩/환경 구성/프로덕션 기본값을 Go 기반 단일 바이너리 CLI로 통합하여 처리 멀티 클러스터/멀티 테넌트 환경을 대상으로 설계했고, Terraform과 Helm 기반 컴포넌트로 확장 가능 부트스트랩 기반과 기본 플랫폼 스택을 OCI 카탈로그 에서 해석하며, 클러스터별 카탈로그 설정과 커스텀 카탈로그 구성 지원 주요 명령어 init - kubara 디렉터리 초기화 generate - 설정된 카탈로그 템플릿에서 Helm/Terraform 아티팩트 생성 bootstrap - 클러스터에 CRD와 Argo CD 부트스트랩 schema - 설정 구조의 JSON 스키마 생성 agents - AI 코딩 어시스턴트용 온보딩 파일(AGENTS.md) 스캐폴딩 catalog - 플랫폼 카탈로그 관리 cluster - kubara 클러스터 설정 관리 매 실행 시 GitHub의 새 릴리스를 확인하며, KUBARA_UPDATE_CHECK=0 으로 비활성화 가능 이중 라이선스(소스 코드 Apache 2.0 / 문서 CC BY 4.0)
KubernetesCLIAI구조IT -
새 소식
Retrieval as Reasoning - LLM Wiki가 RAG보다 나은 이유에 대한 실증 벤치마크
문서를 청크 단위로 잘라 벡터로 검색하는 RAG 방식이 아닌, 서로 링크된 마크다운 위키로 만들고 에이전트가 네비게이션하는 LLM Wiki 방식이 나은 이유에 대해 실증한 논문입니다. 논문이 풀어본 문제 청크 검색은 문서를 잘게 잘라 비슷한 조각 몇 개만 꺼내 붙임. 여러 문서를 이어야 답이 나오는 멀티홉 질문에서 약함 조각으로 자르는 순간 조각들 사이의 관계가 사라짐 . 이것이 근본적인 한계 논문은 검색을 '조각 꺼내기'가 아니라 '추론' 으로 접근. 위키를 미리 구성해 두고, 읽고 → 링크 따라가고 → 모자라면 다시 검색하며 여러 번 되짚어 답을 맞춰 감 핵심 요약 컴파일 : 원문서를 양방향 링크가 걸린 위키 페이지로 변환 (검색하는 단위가 청크가 아니라 링크된 페이지) 세 가지 도구 : 검색(search)·읽기(read)·링크 따라가기(link)를 표준 도구로 정의 Error Book : 위키의 구조·의미 오류를 계속 스스로 고침 자가 진화 : 쓸수록 위키 자체가 나아짐 벤치마크 결과 멀티홉 QA 세 종류에서 기준 모델들보다 2.0~8.1 F1 앞섬 별도 벤치마크 AuthTrace에서도 정확도 1위. 특히 여러 문서를 엮는 질문에서 강함 가장 주목할 대목 — Ablation (F1 손실, HotpotQA / MuSiQue / 2Wiki) 순회를 뺐을 때 : −11.7 / −13.8 / −12.2 (가장 치명적) 위키 구조를 뺐을 때 : −6.1 / −7.0 / −6.7 Error Book을 뺐을 때 : −3.8 / −4.0 / −3.4 순서로 보면 순회 > 구조 > 교정. 순회가 구조보다 두 배쯤 중요함 관련 오픈소스 프로젝트 출발은 Karpathy가 제시한 'LLM Wiki' 개념을 구현하되 마크다운 위키 형태로 지식을 축적하고 관리하는 지식 팩토리를 Claude Code 기반으로 운영 중 : https://news.hada.io/topic?id=31691 본 논문을 구현한 것은 아님 . 논문은 나중에 알게 됨 논문에 비춰보니 위키 '구조'엔 오랜 시간 공들였는데, 정작 ablation이 제일 중요하다는 '순회'(에이전트가 쓰기 전에 뭘 얼마나 읽느냐)는 지침 딱 한 줄 이었음 추가한 것 — 읽기 사다리(GROUND Ladder) 에이전트가 위키 페이지를 쓰기 전에 얼마나 읽을지를 다섯 단계로 나눔: ① 페이지가 적어둔 의존성 → ② 인덱스 → ③ 빌드가 미리 계산해둔 링크 → ④ 콘텐츠 검색 → ⑤ 위키 전체 위 단계로 올라가는 건 순서대로가 아님. '지금 근거가 모자란다'는 신호가 있을 때만 그 신호가 가리키는 칸으로 바로 감 논문은 순회를 '답 만들 때' 썼지만, 오픈소스 프로젝트에서는 '읽어 들일 때' 지키는 규칙으로 가져옴 자세한 설명: https://github.com/alfadur7/llm-wiki-newsroom/… 아직 부족한 점 읽기 사다리는 이제 막 구현하였고 효과를 아직 측정하기 전 . 읽기 단계를 올라가다 멈추는 기준도 잠정 수치고 두세 번 돌려 데이터가 쌓이면 기준을 다듬을 예정 링크 논문 (arXiv:2605.25480): https://arxiv.org/abs/2605.25480 오픈소스 레포: https://github.com/alfadur7/llm-wiki-newsroom 규칙 원문(SoT): https://github.com/alfadur7/llm-wiki-newsroom/…
에이전트LLM구조IT가지 -
새 소식
MCP 서버를 배포해도 툴 설명은 갱신되지 않는다
MCP 서버가 클라이언트에 넘기는 건 크게 셋이다. 툴 설명(tools/list), 서버 지침(initialize의 instructions), 툴 호출 결과(tools/call). 이 중 배포하는 순간 반영되는 건 세 번째뿐이다. 앞의 둘은 연결 시점에 한 번 건네지고 그 뒤로는 클라이언트가 들고 있다. 두 필드의 처지도 다르다. 툴 목록은 notifications/tools/list_changed로 갱신을 알릴 수 있지만 스펙 문구가 MUST가 아니라 SHOULD다. 반면 instructions는 initialize 응답에만 실리고, 라이프사이클 스펙 어디에도 "instructions가 바뀌었다"는 알림이 정의되어 있지 않다. 재연결 외에 갱신 경로가 없다. 서버리스라면 그 알림조차 실질적으로 못 보낸다. 알림을 보내려면 해당 세션으로 열린 스트림이 필요한데, 배포하면 인스턴스가 통째로 교체되어 기존 세션을 들고 있던 쪽이 사라진다. 결과적으로 3주 전에 커넥터를 붙인 사용자의 세션은 3주 전 툴 설명을 읽으면서 오늘 배포된 코드를 호출한다. 에러가 나지 않고, 타입도 안 깨지고, 응답 코드는 200이다. 모델이 조용히 조금 다른 판단을 내릴 뿐이다. 실제 사고 사례. 가계부 항목 분류 정의를 고쳐 배포했는데, 배포 전에 연결된 세션이 살아 있었다. 그 세션의 모델은 옛 정의를 들고 있었고 사용자 데이터는 이미 새 정의로 정리되어 있어서, 모델이 "분류가 잘못됐다"고 판단하고 되돌리려 했다. 버그가 아니다. 양쪽이 서로 다른 시점의 계약을 성실하게 지킨 것이다. 대응은 계약을 산문에서 코드로 옮기는 것이었다. 지켜져야만 하는 규칙은 툴 설명에 문장으로 쓰지 않고 응답 경로에서 거절로 강제한다. 거절 로직은 코드라 배포하면 즉시 반영되고, 오래전에 연결한 사용자에게도 곧바로 적용된다. 흔한 클라이언트 버전 스큐와 결정적으로 다른 점은, 낡은 코드는 시그니처가 안 맞으면 터지지만 낡은 지시문은 절대 안 터진다는 것이다.
가계부사고ISIT리스 -
IT
IT뉴스 주간 AI 주요 소식 - 2026-08-02
1. 신박한 데이터 전송 방식 소개 (00:02:04) 네트워크 없는 데이터 전송 : 와이파이, 블루투스, 인터넷 연결 없이 두 기기 간 파일 전송이 가능한 기술입니다. (00:02:08) QR 코드 스트림 방식 : 한 화면에서 QR 코드를 빠르게 깜빡여 스트림 형태로 송출하면, 상대방 기기가 카메라인식만으로 데이터를 수신합니다. (00:02:48) 전송 성능 : 전송 속도는 약 129kbps로, 2MB 이미지 파일을 단 몇 초 만에 전송할 수 있습니다. (00:03:38) [QR 코드를 연속으로 깜빡여 영상 데이터를 수신하는 화면] - (00:02:48) ※ kbps : 초당 1,000비트의 데이터를 전송할 수 있는 속도 단위. 2. OpenAI, 10년 이상 미해결된 난제 10가지 해결 (00:04:45) 미해결 난제 해결 : 수학 및 이론 컴퓨터 과학 분야에서 최소 10년 이상 진전이 없던 10가지 미해결 난제를 해결하고 결과를 공유했습니다. (00:05:06) 신뢰성 검증 : 환각 현상(할루시네이션)이 아니며, '린(Lean) 인증서'를 통해 공식적으로 검증 가능한 방식으로 증명했습니다. (00:07:08) 차세대 모델 '아스트라(Astra)' : 이번 성과는 차세대 주요 모델인 '아스트라'의 내부 버전을 통해 달성되었습니다. (00:08:50) [OpenAI가 공개한 수학 난제 증명 페이퍼 화면] - (00:07:52) ※ 할루시네이션 : AI가 사실이 아닌 정보를 마치 진실인 것처럼 잘못 생성해 내는 현상. 3. OpenAI GPT-5.6 가격 인하 및 성능 향상 (00:11:48) API 가격 인하 : 가장 가벼운 루나(Luna) 모델 가격을 80% 인하, 테라(Terra) 모델 가격을 20% 인하했습니다. (00:12:00) 하네스 조정을 통한 성능 향상 : 모델 자체를 바꾸지 않고 추론 유지 및 압축을 적용한 하네스(Harness) 설정만 조정하여 ARC-AGI-3 벤치마크 점수를 13.3%에서 38.3%로 3배 이상 올렸습니다. (00:13:47) [하네스 설정 변경에 따른 벤치마크 점수 상승 그래프 화면] - (00:12:35) ※ 하네스 : AI 모델이 외부와 통신하고 명령을 수행하도록 보조하는 환경 및 프레임워크. ※ 벤치마크 : 컴퓨터나 AI의 성능을 시험하고 비교 평가하기 위한 기준 측정 프로그램. 4. 딥시크(DeepSeek) v4 플래시 정식 출시 (00:16:47) 정식 공개 및 라이선스 : 오픈 웨이트(Open Weights) 및 MIT 라이선스로 정식 출시되어 자유롭게 다운로드 및 이용이 가능합니다. (00:17:24) 성능 및 가격 : 기존 프로 모델과 클로드 오퍼스 4.8에 견주는 성능을 내며, 구글 재미나이 3.6 플래시와 동등한 벤치마크 점수를 기록했습니다. API 가격은 페이블 5 대비 105배 저렴합니다. (00:18:07) 경량화 모델 지원 : 언슬로스(Unsloth)에서 4비트, 3비트 등의 양자화 모델을 제공하여 개인 하드웨어나 맥 스튜디오 등에서도 구동할 수 있습니다. (00:22:20) [Artificial Analysis 리더보드 점수 및 비용 비교 차트 화면] - (00:19:07) ※ 양자화 : AI 모델의 연산 데이터 정밀도를 낮추어 메모리 사용량을 줄이고 속도를 높이는 기술. 5. 앤트로픽(Anthropic) 팀의 프롬프트 작성 조언 (00:24:50) 시스템 프롬프트 80% 삭제 : 모델의 지능이 높아짐에 따라 클로드 코드 개발팀은 시스템 프롬프트의 80% 이상을 줄였습니다. (00:26:15) 컨텍스트 엔지니어링 패러다임 변화 : 이전처럼 상세한 규칙과 예시를 일일이 주지 않고, 최소한의 구조만 설계한 후 모델의 자율적 판단에 맡기는 것이 더 우수한 성능을 냅니다. (00:28:07) ※ 프롬프트 : AI 모델에게 특정 작업을 수행하도록 지시하는 명령어나 입력 문구. 6. 시댄스(SeaDance) 2.5 비디오 생성 AI 출시 (00:32:48) 주요 기능 : 단일 생성 시 30초 분량의 영상을 생성할 수 있으며, 롱비디오 모드로 최대 3분까지 일관성을 유지합니다. (00:33:12) 3D 툴 플러그인 지원 : 블렌더(Blender) 및 마야(Maya)용 공식 플러그인을 제공하여 3D 움직임을 영상으로 변환할 수 있습니다. (00:33:42) 생성 품질 및 가격 : 사실적인 조명, 카메라 연출, 한국어 음성 대사 생성이 뛰어나지만 생성 비용(30초당 약 1만 원 이상)이 다소 비쌉니다. (00:35:20) [시댄스 2.5로 생성한 AI 인플루언서 브이로그 영상 화면] - (00:41:09) 7. 기타 AI 모델 소식 (00:46:05) 미니맥스(MiniMax) h3 : 비디오 편집 리더보드 1위를 기록한 오픈 웨이트 영상 생성 모델로, RTX 3060급 그래픽카드에서도 실행 가능하도록 경량화되었습니다. (00:46:12) 그록(Grok) 이미진 비디오 1.5 : 1080p 해상도 및 최대 15초 생성을 지원하며 동작이 더욱 자연스러워졌습니다. (00:51:38) 그록 보이스 띵크페스트 2.0 : 0.7초의 빠르게 응답하는 실시간 음성 추론 모델입니다. (00:53:55) 크리스퍼 위스퍼(Crisper Whisper) 2.0 : 오픈 웨이트 음성인식(ASR) 모델로, 자막 전사 정확도 및 속도가 크게 향상되었습니다. (00:56:14) 구글 재미나이 로보틱스 2 : 전구 돌려 빼기, 쓰레기 봉투 묶기 등 섬세한 작업을 수행하는 로봇 제어 AI 모델을 공개했습니다. (01:00:19) ※ ASR : 사람의 음성을 컴퓨터가 분석하여 텍스트로 자동 변환하는 기술.
AIIT유튜브youtube -
아직 공개된 뉴스가 없습니다.
새 기사가 준비되는 대로 이곳에 표시됩니다.