728x90

0.개요
최근 약 3~4달정도의 기간동안 인턴활동을 진행중인데, 직접 코딩을 하는 업무가 아니다보니까 LLM을 직접 코딩에 활용하지않아서 최근 트랜드에 대해 별로 관심이 없었다. 그래서 오랜만에 한번 AI에 대해 최신 트랜드를 조금 알아볼려고 작성한다.
1.LLM 계열(폐쇄형)
1-1. Gemini
Gemini는 2023년도쯤인가에는 ChatGPT와 함께 코딩에서 자주 사용했었는데, 지금와서는 코딩분야에서는 Claude와 ChatGPT에서 밀린지 오래지난거같다.

다양한 서비스
장점은 확실히 많이 있다. 첫번째로는 대학생이면 gemini를 무료로 Pro (지금은 Plus)로 사용할수있었다는점이다.
같이 사용할수있는 NotebookLM도 좋은 성능을 보여주고 있다.

그리고 나같은 경우에는 이메일,스토리지 모두 Google 서비스를 이용하고있는데, gemini를 결제하면 스토리지 공간을 포함해서 많은 구글 서비스에서 득을 볼수있기때문에 나는 일상용으로 사용하기위해 7500원 Plus 요금을 쓰고있다.

저렴한 API
Gemini의 Flash계열 API들은 특히 저렴하고, 일정량까지는 무료로 계속 사용할수있기때문에 나도 사이드프로젝트에 LLM계열을 추가할때 Gemini API를 많이 활용했는데 지금은 3.8flash 까지 API로 쉽게 접할수있는것으로 보인다.

gemini 4.0
제미나이 4.0을 이번에 발표했는데, 솔직하게 말하면 gemini 3발표때 호들갑을 떤것치고는 성능이 극적으로 향상되었다고 체감이 되지않아서 이번에도 기대는 하고있지않기만, 나오는것을 봐봐야겠다.

1-2. ChatGPT
사실 ChatGPT는 뒤쳐지는줄알았는데 어느순간 성능이 확올라서 다시 최상위권에서 경쟁중인것같다.

Codex
클로드 코드가 나온뒤 나온 AI 코딩 에이전트 Codex인데 GPT 성능이 상당히 많이 올라와서 코딩계 1등이라 여겨지던 Claude와 비슷비슷하다. 실제로 내주변에서는 Codex 절반, ClaudeCode 절반으로 사용하고있는거같다. 경쟁이 치열해서 누가 더 좋은지는 계속해서 바뀌고있기때문에 필요한쪽을 결재하면 될거같다.

GPT-6 Astra(아스트라)
요즘 또 화제인게 GPT6 아스트라이다.
사용자의 PC를 직접조작하는게 예전에는 확실히 부자연스러웠는데, 이 아스트라 모델을 사용하는걸보면 확실히 잘한다.3D 모델링 하고시각화도 그렇고 유튜브에는 아스트라로 마인크래프트를 플레이하게 하는 영상들까지 있다.
물론 아직 최상위모델로 정말 많이 많이 비싸기 때문에 내가 직접 사용하기에는 좀 먼것같다.

1-3.Claude
클로드는 예전에 개발자들 사이에서만 코딩잘하는 AI로 유명했었는데, Claude Code가 나온 이후부터는 일반인들도 자동화작업을 수행하며 정말 많은 LLM 시장 파이를 먹고있는 LLM이다.

클로드코드
더이상 말이 필요없는 AI 코딩 에이전트이다.
이 도구가 나오고부터 직접 코드를 짜는일이 너무나 적어졌다. 물론 사용자의 리펙토링이나 원하는 방향이 있다면 틀을 제시해야겠지만, 그것도 갈수록 줄어들정도로 편리한도구다.

Claude Opus 5.5
2026년 9월 22일에 출시한 Claude 최신 모델인 claude Opus 5.5이다.
나는 Claude Opus 4.5까지 사용해봤는데, 확실히 괴물급이라고 느껴질만한 성능이였다.(토큰은 둘째치고)
4.5를 사용한게 1년이 안지났는데 계속하여 새로운 모델들이 나와서 어디까지 갈지 두려워지는 Claude와 GPT다.

2.LLM(로컬)
LLAMA계열이 여전히 쓰이지만, 개인 PC로 원하는만큼의 성능을 얻기는 아직 부족하니까 PASS...
(gemini flash쓰는게 500배는 더 경제적일듯함)
3. AI 영상 계열(폐쇄형모델)
이쪽 계열은 내가 현재 발전속도가 정말정말 빠르다고 느끼고 있는 분야중 하나이다.
3-1. OpenAI Sora 2
2025년 9월 30일에 OpenAI가 출시했던 서비스이다.
사용자가 무료로 사이트에서 텍스트 몇줄 입력하는거만으로 수분밖에 안걸리는 시간으로 당시로써는 고퀄리티의 영상을 뽑을수있었다. 나도 이시기에 여러 프롬프트를 시도하며 놀았던 기억이있다.

물리 법칙이 특히 뛰어났고, 상황에 맞는 소리를 잘 생성하여 이때당시 숏폼 플랫폼에는 많은 패러디 및 웃긴영상들이 만들어졌었다.
2026년 9월 24일부로 일반서비스뿐만 아니라 Sora 2 API까지 자원이나 여러 문제로 종료하긴하였지만 당시의 Kling 3.0이나 Veo 3.0보다 더 뛰어난 성능을 보여줬었다.
개인적으로는 Sora2를 접고 현재의 GPT의 개선에 더 힘을 쓴거같아서 좋은거같다.

3-2.Google Veo
Google Flow에서 사용가능하며 현실적인 물리 효과와 내장된 오디오가 특징이다.
성능적인 면에서는 주로 웹 3d디자인 애니메이션같은 곳에 사용해본경험밖에 없지만 깔끔하고 일관적인 영상을 잘 뽑아냈었다.

3-3. Seedance 2.5
요즘 가장 화제인 영상 모델이다. 최대 50개의 이미지·스타일 참조를 한꺼번에 투입할수있기때문에 다양한 사용자들이 자신이 원하는 비디오로 세밀하게 장면들을 조정할수있다. 최근 해당모델을 활용한 비교적 기존 AI영상보다 긴 재밌고 창의적인 영상들이 많이 떠돌고있는거같다.

4.AI 영상 계열(로컬 모델계열)
4-1.Wan2.2
로컬 AI 영상은 Wan 모델이 가장 유명할거같다.
생성물의 경우에는 폐쇄형에 비하면 비교적 부족한 부분이 있지만, 나쁘지않은편이다.
단점으로는 리소스가 많이 필요해서 내 4060ti로는 저해상도 짧은 영상조차 오랜시간이 걸리는편이다. (결과물 자체는 만족스러웠다.)

5. AI 이미지(폐쇄형모델)
5-1. Gemini Nano Banana
나올 당시 엄청 화제가 되었던 모델이다. 이전 모델들과 비교했을때 비교적 글씨도 잘뽑히고 다양한 그림을 뽑을수있게되었다.
다만 지금 와서는 GPT image 2.0(덕테이프)에게는 좀 성능이 밀리긴한다. 그래도 빠르고 저렴해서 사용할만하다.

5-2. duct tape(GPT image 2.0)
사실상 현재 가장많은 사용자들이 범용적으로 사용하고있는 AI 이미지 모델이다.
세부적인 디테일, 작은글씨, 포스터형식등 매우 범용적이고 넓은 고퀄리티 이미지 생성이 가능하기 때문에, 해당 모델이 GPT에 적용된 이후 많은 포스터, 일러스트들이 해당 GPT2.0이미지로 대체 되고있다...
현재는 일러스트계열의 경우 별다른 프롬프팅으로 제거하지않는 이상 "지글거림"이 조금 심한 경향이 있어서 관련해서 불쾌감이 느껴지긴한다.

6. AI 이미지(로컬 모델계열)
6-1. Stable Diffusion 계열
로컬 AI 이미지 생성에서 가장 큰 비율을 차지하고있는 Stable Diffusion 계열 모델이다.
노이즈에서 생성하는 방식으로 컴퓨터의 리소스를 크게 차지하지않아서 다양하게 용도에 따라 CheckPoint로 분화되어 공유되고있다.
예전에 비해 요즘 Stable Diffusin모델들은 고점수(사람들이 좋아하는 점수) 이미지들이 많이 학습되었는지, 프롬프트를 장황하게 적지않아도 일반적으로 사람들이 보기에 예쁘고 다이나믹한 이미지들이 잘 나온다.

728x90
'AI' 카테고리의 다른 글
| [강화학습] 정책(Policy),가치 함수 (0) | 2025.01.24 |
|---|---|
| [강화학습] openai gym 기본 구조 (1) | 2025.01.24 |
| [강화학습] 강화학습(Reinforcement Learning, RL) (0) | 2025.01.24 |