commit	fd9bd632f346085920d523dd307a3e4c11cc0a05	e08e473cf292ba73789769b993bb35bcdfc31689	2026-06-01T14:15:35+08:00	wangbomeng	llama-bench: fix device-info
M	tools/llama-bench/llama-bench.cpp

commit	e08e473cf292ba73789769b993bb35bcdfc31689	f86112d6758298241ab2fa84ad4f0f7b1ace35c6	2026-06-01T11:47:01+08:00	wangbomeng	llama-bench:add device-info
M	tools/llama-bench/CMakeLists.txt
M	tools/llama-bench/llama-bench.cpp

commit	f86112d6758298241ab2fa84ad4f0f7b1ace35c6	d1bc743c10080fed1253686ce01749b42611ded4	2026-05-29T16:40:38+08:00	wangbomeng	add dump_pos,fix pos_tensor of pre_by_embeds
M	src/llama-calrt.cpp
M	src/llama-context.cpp
M	tools/server/server.cpp

commit	d1bc743c10080fed1253686ce01749b42611ded4	2f201160b1960fd7be18b70d5770599d7082dd2f	2026-05-28T14:23:06+08:00	wangbomeng	set u_batch = max_seq_len
M	include/llama.h
M	src/llama-calrt.cpp
M	src/llama-context.cpp
M	src/llama-context.h
M	tools/server/server.cpp

commit	2f201160b1960fd7be18b70d5770599d7082dd2f	f131bf1908b8c5dd1f49d7ae7f616506fc471666	2026-05-27T09:58:31+08:00	wangbomeng	delete useless code
M	src/llama-calrt.cpp

commit	f131bf1908b8c5dd1f49d7ae7f616506fc471666	33d96dae28e17208ef61a71dba40cda3c04f135a	2026-05-27T09:38:51+08:00	wangbomeng	fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
M	src/llama-calrt.cpp
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/server/server.cpp

commit	ebce9e1a548c2329aa97f53b8b2ad50d968088dc	e850ff4de25ad1221abc9bf3bb30df252ccd9c36	2026-05-27T09:38:00+08:00	Yunzhe Jia	Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
M	tools/server/server.cpp

commit	e850ff4de25ad1221abc9bf3bb30df252ccd9c36	9985688f7fa96f755882f96a2cd8a18114fdc42d	2026-05-26T10:59:45+08:00	Yunzhe Jia	Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
M	tools/server/CMakeLists.txt

commit	9985688f7fa96f755882f96a2cd8a18114fdc42d	38ca6895815671a87ceec86b4aa4eb976580ce76	2026-05-25T09:05:49+08:00	Yunzhe Jia	Refactor CalrtEngineConfig initialization by removing redundant parameters
M	tools/server/server.cpp

commit	33d96dae28e17208ef61a71dba40cda3c04f135a	37f068d87cc2d0a0b40ce978031fc9932fc89077	2026-05-22T14:33:45+08:00	wangbomeng	add llama-build.sh
M	include/llama.h
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	1921024604db640f09ade83c8a437ebf15bde360	d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4	2026-05-21T14:08:14+08:00	Bomeng Wang	WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
commit	5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4	d028722a12c5a463cc97207787cfd03d7a2590b0	2026-05-21T14:08:14+08:00	Bomeng Wang	index on dev: d028722a replace cparam.n_ubatch with n_ubatch()
commit	37f068d87cc2d0a0b40ce978031fc9932fc89077	13508e5e18bbb1202ae60c2ee5ecbdda1cca817b	2026-05-21T14:07:00+08:00	wangbomeng	release
M	tools/server/server.cpp

commit	13508e5e18bbb1202ae60c2ee5ecbdda1cca817b	b6b7919468126d5ba30a10941825154789e9082f	2026-05-21T11:43:59+08:00	wangbomeng	reduce cmake log
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	b6b7919468126d5ba30a10941825154789e9082f	46847c24fc5c52dd57bb4fb17fc4d684149bb4fa	2026-05-20T16:40:33+08:00	wangbomeng	reduce cmake log
M	src/llama-calrt.cpp
M	src/llama-context.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/mtmd/clip.cpp
M	tools/server/server.cpp

commit	38ca6895815671a87ceec86b4aa4eb976580ce76	ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45	2026-05-20T16:37:13+08:00	Yunzhe Jia	Add support for cal-llm profile dumping to JSONL file
M	common/arg.cpp
M	common/common.h
M	tools/server/README.md
M	tools/server/bench/README.md
M	tools/server/bench/bench.py
M	tools/server/server.cpp

commit	46847c24fc5c52dd57bb4fb17fc4d684149bb4fa	d028722a12c5a463cc97207787cfd03d7a2590b0	2026-05-20T16:02:12+08:00	wangbomeng	Simplify CMakeLists.txt
M	src/CMakeLists.txt

commit	d028722a12c5a463cc97207787cfd03d7a2590b0	63442fde8dc285817f725bd6c5fae80f478a3813	2026-05-20T14:41:05+08:00	wangbomeng	replace cparam.n_ubatch with n_ubatch()
M	src/llama-calrt.cpp

commit	63442fde8dc285817f725bd6c5fae80f478a3813	fc3f4a9fab88e98eff8eeca8cbc6617333edba2c	2026-05-20T11:47:42+08:00	wangbomeng	fix ubatch and cmakelist
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45	2716130010c58f1cdd9d94f0e2f8e047bc92dc66	2026-05-20T09:22:40+08:00	Yunzhe Jia	Add cal-llm backend profiling support with command-line option
M	common/arg.cpp
M	common/common.h
M	tools/server/README.md
M	tools/server/bench/README.md
M	tools/server/bench/bench.py
M	tools/server/server.cpp

commit	fc3f4a9fab88e98eff8eeca8cbc6617333edba2c	c931ef3163940227c9b6291e04216245cce21429	2026-05-19T16:54:16+08:00	wangbomeng	add dump and rt case generation
M	include/llama.h
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	c931ef3163940227c9b6291e04216245cce21429	a43741244a646d3f8fa3ff01bb9b7d059223d0a5	2026-05-18T17:34:37+08:00	wangbomeng	calrt: fix prefill_by_ids.fix create_buf
M	examples/passkey/passkey.cpp
M	src/llama-calrt.cpp
M	src/llama-calrt.h

commit	2716130010c58f1cdd9d94f0e2f8e047bc92dc66	b35bda124ccd4ed581dd6088d3ffa4931c2809b6	2026-05-18T08:40:54+08:00	Yunzhe Jia	fix n_ctx_slot error by adding runtime capacity loading for cal-llm
M	tools/server/server.cpp

commit	a43741244a646d3f8fa3ff01bb9b7d059223d0a5	b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39	2026-05-15T14:39:53+08:00	wangbomeng	run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
M	examples/passkey/passkey.cpp
M	src/llama-calrt.cpp
M	src/llama-context.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/mtmd/clip.cpp
M	tools/server/tests/unit/test_basic.py
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/utils.py

commit	b35bda124ccd4ed581dd6088d3ffa4931c2809b6	81a2cbd4cef5d28334ff513d6b69e593d9d1cb49	2026-05-15T09:19:31+08:00	Yunzhe Jia	Implement vocab-only model initialization and enhance cal-llm backend error handling
M	tools/server/server.cpp

commit	81a2cbd4cef5d28334ff513d6b69e593d9d1cb49	3b14ed556c15529fe1f94b649f49db7156dfaf67	2026-05-14T16:06:37+08:00	Yunzhe Jia	Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
M	tools/server/CMakeLists.txt

commit	3b14ed556c15529fe1f94b649f49db7156dfaf67	dde8b8228081769c8d8f1e0751d47fa7875f8423	2026-05-14T14:34:25+08:00	Yunzhe Jia	- Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
M	CMakeLists.txt
M	common/common.cpp
M	common/common.h
M	include/llama-cpp.h
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-sampling.cpp
M	src/llama.cpp
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd-helper.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/server/CMakeLists.txt
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39	7800c772d44a7415640ec1669a691232939927cf	2026-05-13T15:24:24+08:00	wangbomeng	try passkey and embedding
D	calculet0_6145_run.txt
D	calculet0_6728_run.txt
D	calculet0_7810_run.txt

commit	7800c772d44a7415640ec1669a691232939927cf	dde8b8228081769c8d8f1e0751d47fa7875f8423	2026-05-13T15:23:54+08:00	wangbomeng	try passkey and embedding
A	calculet0_6145_run.txt
A	calculet0_6728_run.txt
A	calculet0_7810_run.txt
M	examples/embedding/embedding.cpp
M	examples/passkey/passkey.cpp

commit	dde8b8228081769c8d8f1e0751d47fa7875f8423	fabcc7dac4b34d83fe430980bb364b81087c7ee9	2026-05-12T10:46:08+08:00	wangbomeng	clip:add minicpm patch;
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd.cpp

commit	fabcc7dac4b34d83fe430980bb364b81087c7ee9	1e9787962f20a7e82c71589ac1dd0585454e4bfe	2026-04-30T16:17:17+08:00	wangbomeng	calrt: fix encode dump
M	src/llama-calrt.cpp

commit	1e9787962f20a7e82c71589ac1dd0585454e4bfe	f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc	2026-04-30T16:06:23+08:00	wangbomeng	Merge remote-tracking branch 'origin/dev-ben' into dev
commit	f584311c716dd078c4b737eebbfda97fe12b7274	a339954cc2a145a80c5ea349e7896211916cbed9	2026-04-30T16:05:15+08:00	wangbomeng	calrt: fix encode dump
M	src/llama-calrt.cpp
M	tools/main/main.cpp

commit	1bec0db5a675ddc60fb793be2a746e8f3c8855dc	465df20c3e1f3f58d0f5531c796e0941a49c32b0	2026-04-30T16:02:59+08:00	wangbomeng	bench: support 2 calbins
M	tools/llama-bench/llama-bench.cpp

commit	465df20c3e1f3f58d0f5531c796e0941a49c32b0	a339954cc2a145a80c5ea349e7896211916cbed9	2026-04-30T09:08:12+08:00	wangbomeng	support one calbin
M	tools/llama-bench/llama-bench.cpp

commit	a339954cc2a145a80c5ea349e7896211916cbed9	8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932	2026-04-29T14:57:55+08:00	wangbomeng	Merge branch 'dev' into dev-cli
commit	8e76fc330ad624d1768b412d7894e272dbe696f4	431ad6f1c787f1b47e9e7be14b2e1a7d8565485c	2026-04-29T14:56:59+08:00	wangbomeng	finish dev of llama-cli
M	tools/main/main.cpp

commit	eeeef3f6d6a5aad9296323ca15d9d929745b8932	431ad6f1c787f1b47e9e7be14b2e1a7d8565485c	2026-04-28T16:16:19+08:00	wangbomeng	add unknown time info: prefill and decode
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	431ad6f1c787f1b47e9e7be14b2e1a7d8565485c	efa1876bb8b2a449a55054a8c3745892f2c0f262	2026-04-27T16:52:15+08:00	wangbomeng	update calrt_infer
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	efa1876bb8b2a449a55054a8c3745892f2c0f262	4a2a3181f1cea170105c771e6ba69d851b82b937	2026-04-27T11:35:58+08:00	wangbomeng	update version print
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	4a2a3181f1cea170105c771e6ba69d851b82b937	e3ea5541259f35871c3e995331770aaca297e9ec	2026-04-26T10:56:02+08:00	wangbomeng	add calrt-version
D	llama_server.sh

commit	e3ea5541259f35871c3e995331770aaca297e9ec	0b8e43943846a1cd05c26c9186b9ef778ebae6e2	2026-04-26T10:55:48+08:00	wangbomeng	add calrt-version
A	llama_server.sh
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	0b8e43943846a1cd05c26c9186b9ef778ebae6e2	5eb46fffbd2e260c540fb112314ad67bbb8f56b6	2026-04-26T08:43:43+08:00	wangbomeng	to debug
M	common/common.cpp
M	src/llama-calrt.cpp

commit	5eb46fffbd2e260c540fb112314ad67bbb8f56b6	005112c51e00d998b457337ca3dad53fc46e2d0b	2026-04-24T16:24:51+08:00	wangbomeng	clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
D	patch1.cpp
D	patch2.cpp
D	patch3.cpp

commit	005112c51e00d998b457337ca3dad53fc46e2d0b	509670642e8090a1713f5d73590b549be827aaef	2026-04-24T16:24:31+08:00	wangbomeng	clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
A	patch1.cpp
A	patch2.cpp
A	patch3.cpp
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h

commit	509670642e8090a1713f5d73590b549be827aaef	5d219bfcef239c1e3ddd1baecc0514a9462ff6a8	2026-04-24T09:40:34+08:00	wangbomeng	rm debug code
M	tools/server/server.cpp

commit	5d219bfcef239c1e3ddd1baecc0514a9462ff6a8	6787a53ab9b4897c5a7b51a4062d7b90e6697d35	2026-04-24T09:31:32+08:00	wangbomeng	calrt: recover base = batch_index * dict_len
M	src/llama-calrt.cpp

commit	6787a53ab9b4897c5a7b51a4062d7b90e6697d35	e1a76abf66178ea85656479a5e19aea7785c09f4	2026-04-24T09:22:02+08:00	wangbomeng	calrt:input of multimodel from fp32 to bf16
M	src/llama-calrt.cpp
M	tools/mtmd/clip.cpp
M	tools/server/server.cpp

commit	e1a76abf66178ea85656479a5e19aea7785c09f4	99dd308adb8488fa869bb669e3335e646a938eff	2026-04-22T16:29:22+08:00	wangbomeng	calrt:add CalcoreRT version print
M	src/llama-calrt.cpp

commit	99dd308adb8488fa869bb669e3335e646a938eff	06c7852e99e34c71e24e3ef6001cb54c72970e4d	2026-04-21T15:50:01+08:00	wangbomeng	server: fix max_seq_len
D	calculet0_141241_run.txt
D	calculet0_141410_run.txt
M	tools/server/server.cpp

commit	06c7852e99e34c71e24e3ef6001cb54c72970e4d	96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece	2026-04-21T15:06:01+08:00	wangbomeng	Merge branch 'dev-ot' into dev
commit	ed62eb33447f993d578e156a3c7e38c91b420ece	015e988a271573a7c11e2a4b45084e1219d69d50	2026-04-21T15:05:22+08:00	wangbomeng	try server-test:not success
M	tools/server/tests/unit/test_basic.py
M	tools/server/tests/unit/test_completion.py
M	tools/server/tests/utils.py

commit	015e988a271573a7c11e2a4b45084e1219d69d50	99962021f2dd1994dbbf90d5712f0ca2633f20f8	2026-04-17T16:56:08+08:00	wangbomeng	little change
M	src/llama-calrt.cpp

commit	96b4e267e562f44e76ec6c965ee0fa361f0439bf	99962021f2dd1994dbbf90d5712f0ca2633f20f8	2026-04-17T15:33:01+08:00	wangbomeng	merge dev-ot
A	calculet0_141241_run.txt
A	calculet0_141410_run.txt

commit	99962021f2dd1994dbbf90d5712f0ca2633f20f8	9af6682ef101c6d006c743c703cf150ac25f466f	2026-04-17T14:48:33+08:00	wangbomeng	calrt: add onetoken slice and untile_prefill
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	9af6682ef101c6d006c743c703cf150ac25f466f	e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d	2026-04-16T10:09:44+08:00	wangbomeng	args: add -ca
M	common/arg.cpp

commit	e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d	a206460e610aef995e36e50b33e8bd41fe477541	2026-04-15T10:01:09+08:00	wangbomeng	calrt: add copy_data_to_ibuf for vision model
M	common/arg.cpp
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/mtmd/mtmd.cpp

commit	795179beb5bba728e0ccf0a7e80a5ec5ef36e92a	6d55eae7e76b768acfcec045b8e84cded8ae3b55	2026-04-14T16:03:22+08:00	Yunzhe Jia	add ci yaml
A	.gitlab-ci.yml

commit	a206460e610aef995e36e50b33e8bd41fe477541	d8b2aaa00049978cebac15041f960d75b552f97b	2026-04-14T10:23:43+08:00	wangbomeng	calrt: support mixture of prefill_by_ids and prefill_by_embeds
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/mtmd/mtmd.cpp

commit	d8b2aaa00049978cebac15041f960d75b552f97b	b6f29ec8140028619efaa50aa6e73146cecf631d	2026-04-13T11:23:44+08:00	wangbomeng	server: fix context-shift
D	calculet0_353163_run.txt
D	calculet0_353335_run.txt
D	calculet0_354076_run.txt
D	calculet0_354399_run.txt
D	calculet0_354593_run.txt

commit	b6f29ec8140028619efaa50aa6e73146cecf631d	6d55eae7e76b768acfcec045b8e84cded8ae3b55	2026-04-13T11:23:31+08:00	wangbomeng	server: fix context-shift
A	calculet0_353163_run.txt
A	calculet0_353335_run.txt
A	calculet0_354076_run.txt
A	calculet0_354399_run.txt
A	calculet0_354593_run.txt
M	tools/server/server.cpp

commit	6d55eae7e76b768acfcec045b8e84cded8ae3b55	af8055f5f033a730e7e1fe80185b18b7e9473966	2026-04-10T14:58:56+08:00	wangbomeng	add annotations
D	llama_content_logs.csv
D	llama_perf_logs.csv
D	log.1
D	test_case_short.json

commit	af8055f5f033a730e7e1fe80185b18b7e9473966	6f54682df62b8ec6bb4154b99c47b5becda3291f	2026-04-10T14:58:19+08:00	wangbomeng	add annotations
A	llama_content_logs.csv
A	llama_perf_logs.csv
A	log.1
M	src/llama-calrt.cpp
M	src/llama-calrt.h
A	test_case_short.json
M	tools/server/server.cpp

commit	6f54682df62b8ec6bb4154b99c47b5becda3291f	42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33	2026-04-10T09:07:20+08:00	Yunzhe Jia	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	42a181674565411efa5c8b318bc77d6fd084df8a	bd3a57a11aa008e0b5dc2a30f82fcd3a02587208	2026-04-10T09:06:55+08:00	Yunzhe Jia	fix prompt_cache issue
M	tools/server/server.cpp

commit	a2d5bf362d6c9a546f9deadf4f8975605a915d33	bd3a57a11aa008e0b5dc2a30f82fcd3a02587208	2026-04-09T21:01:46+08:00	Bomeng Wang	server: comment fixed time
M	tools/server/server.cpp

commit	bd3a57a11aa008e0b5dc2a30f82fcd3a02587208	fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37	2026-04-09T19:42:57+08:00	Yunzhe Jia	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	fcfcdf80b01664a08fb12df879a05df3cc0eba70	0cd44929b442860dc0e5f88976108be82350f9dc	2026-04-09T19:41:52+08:00	Yunzhe Jia	tmp fix one run >4K problem
M	tools/server/server.cpp

commit	74d437ab1456831573def7ca385a74d0ca460c37	5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc	2026-04-09T17:44:26+08:00	wangbomeng	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	5813c943005d1ede551e67ee98e35aefd210ff22	1f0d5bb0453f93ffa51faf68237c89251c2e0c40	2026-04-09T17:38:57+08:00	wangbomeng	add --device-info
D	calculet0_103149_run.txt
D	calculet0_103264_run.txt
D	calculet0_103409_run.txt
D	calculet0_103634_run.txt
D	calculet0_17323_run.txt

commit	1f0d5bb0453f93ffa51faf68237c89251c2e0c40	b8153b6b8f244b223c9f4c2940ae1f212634519e	2026-04-09T17:38:37+08:00	wangbomeng	add --device-info
A	calculet0_103149_run.txt
A	calculet0_103264_run.txt
A	calculet0_103409_run.txt
A	calculet0_103634_run.txt
M	common/arg.cpp
M	common/common.h
M	tools/server/server.cpp

commit	0cd44929b442860dc0e5f88976108be82350f9dc	b8153b6b8f244b223c9f4c2940ae1f212634519e	2026-04-09T15:08:50+08:00	Bomeng Wang	rm calculet0.txt
D	calculet0_17323_run.txt

commit	b8153b6b8f244b223c9f4c2940ae1f212634519e	82842cfc3fa3d5c004c4540aeff8a81f38509bee	2026-04-09T15:07:02+08:00	wangbomeng	server: fix limit tokens to max_seq_len
M	tools/server/server.cpp

commit	82842cfc3fa3d5c004c4540aeff8a81f38509bee	622a22991089c6debd5f4b57738f3df3a0bda8b5	2026-04-09T15:06:26+08:00	wangbomeng	server: fix limit tokens to max_seq_len
A	calculet0_17323_run.txt
M	tools/server/server.cpp

commit	622a22991089c6debd5f4b57738f3df3a0bda8b5	5f47a738ba56a37d0ff281a16212f41979568e35	2026-04-09T10:36:31+08:00	wangbomeng	server: comment circle print
M	tools/server/server.cpp

commit	5f47a738ba56a37d0ff281a16212f41979568e35	ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07	2026-04-09T09:48:20+08:00	Yunzhe Jia	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	ecf01a17651cd7b1e8b85fd6075e83831463ee23	99d2078e89305035d87d966cee7987c7d50b3925	2026-04-09T09:47:55+08:00	Yunzhe Jia	fix n_parallel problem
M	tools/server/server.cpp

commit	207ca38c751f7e6c251833eb11e89a2a0bb0fd07	99d2078e89305035d87d966cee7987c7d50b3925	2026-04-08T19:14:37+08:00	wangbomeng	delet extra printf
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	99d2078e89305035d87d966cee7987c7d50b3925	9626239f5a9e568c9975d67dd6745fef90279a87	2026-04-08T19:01:16+08:00	Yunzhe Jia	fix buffer resize problem
M	src/llama-calrt.cpp

commit	9626239f5a9e568c9975d67dd6745fef90279a87	da724f3e2a8af2c2537e3edcff41e9415ac66fef	2026-04-08T17:47:04+08:00	wangbomeng	calrt: fix MapBuf
M	src/llama-calrt.cpp
M	src/llama-calrt.h

commit	da724f3e2a8af2c2537e3edcff41e9415ac66fef	18814f9bf1a423ebe8f32d6043c9cbc5b21b0218	2026-04-08T16:58:32+08:00	Bomeng Wang	calrt: add MapBuf
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	18814f9bf1a423ebe8f32d6043c9cbc5b21b0218	bbee06d6d851e3f84f75b578047967d7e0e4a8dc	2026-04-08T13:55:52+08:00	wangbomeng	server : reset inference time
M	tools/server/server.cpp

commit	bbee06d6d851e3f84f75b578047967d7e0e4a8dc	e126c21ed7b793b648d63533ea7ee30885f5a82a	2026-04-08T11:29:36+08:00	wangbomeng	calrt: add test time print
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	39edc6ec2e9560ccb20a2b8e547f58102bb268c1	2006831fd6ea8a8e16518b81bcee29fb674676ea	2026-04-01T14:06:50+08:00	Bomeng Wang	add t_incopy t_outcopy
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	2006831fd6ea8a8e16518b81bcee29fb674676ea	41e6636ea1fb3884e41fb2023f92b0e7262ef09b	2026-04-01T10:42:27+08:00	wangbomeng	v0.1.0
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	e126c21ed7b793b648d63533ea7ee30885f5a82a	5603e050af07173589f3b8850121263d86da01fd	2026-04-01T10:07:12+08:00	wangbomeng	sever: fix commit id
M	tools/server/server.cpp

commit	5603e050af07173589f3b8850121263d86da01fd	1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e	2026-04-01T05:57:55+08:00	wangbomeng	calrt: add t_incopy and t_outcopy
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e	893e52bda0fee99bbda1521ea733a760bc4201f1	2026-04-01T10:14:22+08:00	wangbomeng	calrt: fix slice and add infer/copy time
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	tools/server/server.cpp

commit	893e52bda0fee99bbda1521ea733a760bc4201f1	398ecf71f5f574037ce33f84dd1576fa164909ad	2026-03-30T11:35:40+08:00	Bomeng Wang	delete unnecessary commit id
M	tools/server/server.cpp

commit	398ecf71f5f574037ce33f84dd1576fa164909ad	6d5e83902bdd3142a8ff0d3db19f02a8619e95a0	2026-03-27T02:01:23+08:00	wangbomeng	rm llama-server_old.cpp
D	server_old.cpp

commit	6d5e83902bdd3142a8ff0d3db19f02a8619e95a0	e4eaab700333490e80ebefc8d023f6c1adfcc312	2026-03-27T00:57:11+08:00	wangbomeng	server: printf calrt commit ID
A	server_old.cpp
M	tools/server/server.cpp

commit	e4eaab700333490e80ebefc8d023f6c1adfcc312	aeacc23a883400db0ebffb50e23355ada054da66	2026-03-25T09:03:55+08:00	wangbomeng	calrt: prefil to prefill
M	src/llama-calrt.cpp

commit	aeacc23a883400db0ebffb50e23355ada054da66	cbaa7492663630132adeddccd9fec5e44ffa3336	2026-03-25T08:49:22+08:00	wangbomeng	calrt: add slice only on decode
M	src/llama-calrt.cpp

commit	cbaa7492663630132adeddccd9fec5e44ffa3336	3c08ebf0e442cd730ddffd959ec676f9caf31c82	2026-03-25T03:21:02+08:00	wangbomeng	reduce warning
M	common/common.cpp
M	include/llama.h
M	src/llama-calrt.cpp
M	tools/mtmd/mtmd-helper.cpp
M	tools/server/server.cpp

commit	3c08ebf0e442cd730ddffd959ec676f9caf31c82	613bc2b9a9d7af92efbe42d876ffcdb244f7a00e	2026-03-24T02:43:03+08:00	wangbomeng	calrt: comment LOG_ERROR in untile_decode_cpy
M	src/llama-calrt.cpp

commit	613bc2b9a9d7af92efbe42d876ffcdb244f7a00e	4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa	2026-03-24T02:30:12+08:00	wangbomeng	calrt: fix max_seq_len judgment
M	tools/server/server.cpp

commit	4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa	16cbf81a731f5839a2f6b0eb9d8539826353748b	2026-03-24T01:59:03+08:00	wangbomeng	calrt: fix ubatch.embd cpy
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	16cbf81a731f5839a2f6b0eb9d8539826353748b	8b4e17d990c23025148c4abadefe1010a0dd0734	2026-03-23T09:38:21+08:00	wangbomeng	calrt: fix model_name of untile_cpy
M	src/llama-calrt.cpp

commit	8b4e17d990c23025148c4abadefe1010a0dd0734	6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b	2026-03-23T14:50:27+08:00	wangbomeng	merge origin dev
commit	6dacdd2cf9574214ca272a86674e7bd7ba21c4f0	3e6ad64467771224f072e5bad90e270951ba4cdf	2026-03-23T14:42:28+08:00	wangbomeng	calrt: add multimodal
M	src/llama-calrt.cpp

commit	3e6ad64467771224f072e5bad90e270951ba4cdf	b37b7d9756feb3dac2db526eeab38b572a095d47	2026-03-23T14:36:41+08:00	wangbomeng	calrt: add multimodal
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	41e6636ea1fb3884e41fb2023f92b0e7262ef09b	d0a1b2c758440720d42fa108b3444f54593daa73	2026-03-12T16:36:07+08:00	Bomeng Wang	server: correct the max_seq_len judgment
M	tools/server/server.cpp

commit	d0a1b2c758440720d42fa108b3444f54593daa73	b37b7d9756feb3dac2db526eeab38b572a095d47	2026-03-12T16:10:28+08:00	Bomeng Wang	calrt: comment out dump
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	b37b7d9756feb3dac2db526eeab38b572a095d47	07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0	2026-03-10T16:32:31+08:00	Yunzhe Jia	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	07817cefc14fa359dcecad0630defd3610f8f5c8	b2c45d8ddefb7ec09435231c8ec5b736fabf9c91	2026-03-10T16:32:07+08:00	Yunzhe Jia	fix kv issue
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	7ddafbdcb9426ae3af016925b8b596f11e8742d0	059009eeaf20a569abfbac5eb37dad3bb9376428	2026-03-10T07:13:04+08:00	wangbomeng	calrt: commented out cal_ctx->encode(batch)
M	src/llama-calrt.cpp

commit	059009eeaf20a569abfbac5eb37dad3bb9376428	1b073661d1311b5300173993b9f31ee7241d8606	2026-03-10T07:04:22+08:00	wangbomeng	calrt: add multimodel
M	common/common.cpp
M	include/llama.h
M	src/llama-calrt.cpp

commit	1b073661d1311b5300173993b9f31ee7241d8606	6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91	2026-03-10T06:58:35+08:00	wangbomeng	Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev
commit	6295273c5866b9249bacdedbfc3a31877e6e6a85	c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7	2026-03-10T06:54:41+08:00	wangbomeng	arg: update hf_repo url to https://download.calculet.tech:9443
M	common/arg.cpp
M	common/common.cpp
M	src/llama-calrt.cpp

commit	b2c45d8ddefb7ec09435231c8ec5b736fabf9c91	c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7	2026-03-09T15:03:26+08:00	Bomeng Wang	clart: past_kv_len = n_tokens
M	src/llama-calrt.cpp

commit	c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7	f8fba66b657c51a1df1efc7267bfea9f6140cebf	2026-03-09T03:26:47+08:00	wangbomeng	CMakeLists: STATIC to SHARED
M	src/CMakeLists.txt

commit	f8fba66b657c51a1df1efc7267bfea9f6140cebf	db4a61d2234c2f457b42ecc3f7219a1e1a35508a	2026-03-06T15:06:36+08:00	Yunzhe Jia	fix calrt_install include path
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	src/llama-kv-cache-calrt-adapter.h

commit	db4a61d2234c2f457b42ecc3f7219a1e1a35508a	e672e02ca1a582f9e3a9d011d9e1b4fea4942a25	2026-03-06T06:59:58+08:00	Yunzhe Jia	adapt to host-rt install structure
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	src/llama-kv-cache-calrt-adapter.h

commit	e672e02ca1a582f9e3a9d011d9e1b4fea4942a25	27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a	2026-03-06T11:47:09+08:00	Yunzhe Jia	Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
commit	27b82f64252779ad160a3fa76bd378c39421de36	0bd95719fed2f0247c8d0199dd897d24157dfae6	2026-03-06T11:42:45+08:00	Yunzhe Jia	adapt to calrt_objs target
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	7a3a9a0e76bb5f530beafcfe52e87e388e93117a	583c387efaf7bc030574e554088de79d09a27fbd	2026-03-05T07:24:59+08:00	wangbomeng	calrt_infer: fix past_kv_len
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	583c387efaf7bc030574e554088de79d09a27fbd	0edc14a60a2d5596f71d728c655e3523da924d89	2026-02-27T02:24:56+08:00	wangbomeng	caserver: lim generated tokens to n_ctx_per_seq
M	tools/server/server.cpp

commit	0edc14a60a2d5596f71d728c655e3523da924d89	aa0a17d719326a63e0d6fea60aa0ced44e7abc33	2026-02-27T01:57:39+08:00	wangbomeng	caserver: limit generated tokens to n_ctx_per_seq
M	include/llama.h
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	aa0a17d719326a63e0d6fea60aa0ced44e7abc33	fa332e773da681f3e77d6ffe83a87edb557f758b	2026-02-27T01:40:11+08:00	wangbomeng	calrt: add bf16_to_fp32
M	src/llama-calrt.cpp

commit	fa332e773da681f3e77d6ffe83a87edb557f758b	aa54a7c637f2c92d924a5f35386975b1c27de898	2026-02-27T01:31:42+08:00	wangbomeng	Add bf16_to_fp32
D	calculet0_12456_run.txt
D	calculet0_7518_run.txt

commit	aa54a7c637f2c92d924a5f35386975b1c27de898	84f2c0b5f334a7ab77347c6779b6027a951d0ff0	2026-02-27T01:30:36+08:00	wangbomeng	Add bf16_to_fp32
A	calculet0_12456_run.txt
A	calculet0_7518_run.txt
M	src/llama-calrt.cpp

commit	84f2c0b5f334a7ab77347c6779b6027a951d0ff0	0bd95719fed2f0247c8d0199dd897d24157dfae6	2026-02-09T01:46:36+08:00	wangbomeng	add bf16_to_fp32 in untile_decode/prefill_cpy
M	src/llama-calrt.cpp

commit	0bd95719fed2f0247c8d0199dd897d24157dfae6	365eb0b719e30b0f9e348d854f11c9c3f954a96e	2026-02-07T10:25:06+08:00	Yunzhe Jia	fix get_model_by_name
M	src/llama-calrt.cpp

commit	365eb0b719e30b0f9e348d854f11c9c3f954a96e	886cd1fb3b217efcf51c46209fcb694022346797	2026-02-07T09:05:17+08:00	Yunzhe Jia	comment out pos buffer file
M	src/llama-calrt.cpp

commit	886cd1fb3b217efcf51c46209fcb694022346797	9328f21378275f2354a19c3af907332b216ab492	2026-02-06T17:36:54+08:00	Yunzhe Jia	fix compile problem
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	9328f21378275f2354a19c3af907332b216ab492	49fea70a20f550bfdb59d0ffe041b54919c22447	2026-01-28T15:32:36+08:00	Yunzhe Jia	add prefill-only mode
M	common/arg.cpp
M	common/common.h
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	49fea70a20f550bfdb59d0ffe041b54919c22447	74a118df31b6a4acc8876b2a2db90d2395cc6ec3	2026-01-28T09:11:16+08:00	Yunzhe Jia	adapt to new calbin test_case
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	74a118df31b6a4acc8876b2a2db90d2395cc6ec3	98e8f9acfe87cd93646482cb2d942b8a132f0852	2026-01-13T14:32:47+08:00	Yunzhe Jia	sync with calrt update
M	src/llama-calrt.cpp
M	src/llama-calrt.h

commit	98e8f9acfe87cd93646482cb2d942b8a132f0852	8c8152a04036bb0d4756a4e08e54f514dae4e64d	2025-12-10T00:20:57+08:00	Yunzhe Jia	add timestamp
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	8c8152a04036bb0d4756a4e08e54f514dae4e64d	5d2387931528fbe04aa8d66de935147efb65ca4d	2025-12-09T14:40:04+08:00	Yunzhe Jia	adapt to calrt csr
M	src/llama-calrt.cpp

commit	5d2387931528fbe04aa8d66de935147efb65ca4d	e6285a748657add8d974b78ca920c5b41753ee12	2025-12-08T16:40:34+08:00	Yunzhe Jia	add timestamp for one decode process
M	src/llama-calrt.cpp
M	tools/server/server.cpp

commit	e6285a748657add8d974b78ca920c5b41753ee12	6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb	2025-11-27T16:58:35+08:00	Yunzhe Jia	adapt to calrt
M	src/llama-calrt.cpp

commit	6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb	240d9bb75241c91896afe125f2fc74698a7395f3	2025-11-25T17:06:14+08:00	Yunzhe Jia	add kv_tensor for pld test
M	src/llama-calrt.cpp

commit	240d9bb75241c91896afe125f2fc74698a7395f3	7eeb241aad429a68fb8cfa3ba85d000fb2348cd2	2025-11-24T12:03:00+08:00	Yunzhe Jia	adapt to calrt modification
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	7eeb241aad429a68fb8cfa3ba85d000fb2348cd2	dfb6250031a25058dbc3757e8a7ec75d90dcb48a	2025-11-21T09:20:01+08:00	Yunzhe Jia	fix byte_size error
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	dfb6250031a25058dbc3757e8a7ec75d90dcb48a	e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e	2025-11-18T10:28:00+08:00	Yunzhe Jia	add elf in CMakelist
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e	6444e227c36df16199c40d8cead2244fe014f377	2025-11-07T11:52:17+08:00	Yunzhe Jia	dump src tensor
M	src/llama-calrt.cpp

commit	6444e227c36df16199c40d8cead2244fe014f377	d81d7b190ff5f21325167936496dfe5ab48b922e	2025-11-07T09:19:11+08:00	Yunzhe Jia	test golden case
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	d81d7b190ff5f21325167936496dfe5ab48b922e	e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13	2025-11-04T14:43:32+08:00	Yunzhe Jia	Merge branch 'master' into dev
commit	e492f5dc8cec17529f53ef2bbdf7b502107f8148	2e05afd22b3d77c7013b11eee88e88b17188f21a	2025-11-04T14:09:59+08:00	Yunzhe Jia	redo untile logic
M	src/llama-calrt.cpp
M	src/llama-calrt.h

commit	1f5accb8d0056e6099cd5b772b1cb787dd590a13	2759ccdb4adc8568add4316780d5e675519b0775	2025-11-04T05:04:59Z	Noah	Fix garbled output with REPACK at high thread counts (#16956)
M	ggml/src/ggml-cpu/repack.cpp

commit	2759ccdb4adc8568add4316780d5e675519b0775	c5023daf607c578d6344c628eb7da18ac3d92d32	2025-11-04T10:53:48+08:00	Aman Gupta	CUDA: avoid mul + bias fusion when doing fusion (#16935)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	c5023daf607c578d6344c628eb7da18ac3d92d32	e7da30b584dc1f2ee0414c4a1298ce64eef97e8d	2025-11-03T11:47:57-08:00	lhez	opencl: support imrope (#16914)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/rope.cl

commit	e7da30b584dc1f2ee0414c4a1298ce64eef97e8d	ed8aa63320393512bdcfe4b05b5ae01ba91888e1	2025-11-03T18:53:26+01:00	Aleksander Grygier	fix: Viewing multiple PDF attachments (#16974)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentPreviewDialog.svelte

commit	ed8aa63320393512bdcfe4b05b5ae01ba91888e1	48bd26501b08a3f0bff1249db47f313641f7bebb	2025-11-03T18:01:59+01:00	Daniel Bevenius	model-conversion : pass config to from_pretrained (#16963)
M	examples/model-conversion/scripts/causal/run-org-model.py

commit	48bd26501b08a3f0bff1249db47f313641f7bebb	622cd010ff4a65bef67edbf2f9bf4707c01f98f7	2025-11-03T15:38:23+02:00	Georgi Gerganov	server : add props.model_alias (#16943)
M	tools/server/public/index.html.gz
M	tools/server/server.cpp
M	tools/server/webui/src/lib/stores/server.svelte.ts

commit	622cd010ff4a65bef67edbf2f9bf4707c01f98f7	070ff4d5356083d60b807bb34d36b31c3653a29e	2025-11-03T14:29:11+01:00	theo77186	ggml: CUDA: add head size 72 for flash-attn (#16962)
M	ggml/src/ggml-cuda/fattn-tile.cu
M	ggml/src/ggml-cuda/fattn-tile.cuh
M	ggml/src/ggml-cuda/fattn.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq72-dv72.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py

commit	070ff4d5356083d60b807bb34d36b31c3653a29e	bf7b0c9725ed0c406c5debaea022ec7258430634	2025-11-03T11:11:18+01:00	Xuan-Son Nguyen	mtmd: add --image-min/max-tokens (#16921)
M	common/arg.cpp
M	common/common.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/server/server.cpp

commit	bf7b0c9725ed0c406c5debaea022ec7258430634	fcfce040e816c542f374ad51461b3561d73c4bc9	2025-11-03T10:25:55+01:00	Xuan-Son Nguyen	mtmd: pad mask for qwen2.5vl (#16954)
M	tools/mtmd/clip.cpp

commit	fcfce040e816c542f374ad51461b3561d73c4bc9	ee3a5a10adf9e83722d1914dddc56a0623ececaf	2025-11-03T14:40:02+08:00	Jinyang He	ggml : LoongArch fixes (#16958)
M	ggml/src/ggml-cpu/arch/loongarch/quants.c
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/simd-mappings.h

commit	ee3a5a10adf9e83722d1914dddc56a0623ececaf	7e994168b1ccc12337ba8de939c4fd466107c1fb	2025-11-03T05:33:56Z	Olivier Chafik	sync: minja (glm 4.6 & minmax m2 templates) (#16949)
M	vendor/minja/chat-template.hpp
M	vendor/minja/minja.hpp

commit	7e994168b1ccc12337ba8de939c4fd466107c1fb	bcfa87622ae46be6345a8e3dfdbdc5ba5414042b	2025-11-03T03:35:33+02:00	shani-f	SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869)
M	ggml/src/ggml-sycl/repeat_back.cpp

commit	bcfa87622ae46be6345a8e3dfdbdc5ba5414042b	a2054e3a8ff0da3978a4acc18c349ff58554d336	2025-11-03T00:41:08+01:00	Sascha Rogmann	feat(webui): improve LaTeX rendering with currency detection (#16508)
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte
A	tools/server/webui/src/lib/constants/latex-protection.ts
A	tools/server/webui/src/lib/utils/latex-protection.test.ts
A	tools/server/webui/src/lib/utils/latex-protection.ts
M	tools/server/webui/src/stories/fixtures/math-formulas.ts
A	tools/server/webui/src/styles/katex-custom.scss
M	tools/server/webui/svelte.config.js
M	tools/server/webui/vite.config.ts

commit	a2054e3a8ff0da3978a4acc18c349ff58554d336	dd5286805004db1f9ac3176a1cbbfe373bdda0f8	2025-11-03T04:40:30+05:30	Shagun Bera	test-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936)
M	tests/test-backend-ops.cpp

commit	dd5286805004db1f9ac3176a1cbbfe373bdda0f8	6b9a52422bac0f50dd8f1f8386744fa3ce9783bf	2025-11-02T23:11:21+01:00	Sigbjørn Skjæret	ci : disable failing riscv cross build (#16952)
M	.github/workflows/build-linux-cross.yml

commit	6b9a52422bac0f50dd8f1f8386744fa3ce9783bf	2f966b8ed87514e74bb96592217226cb6a6974dd	2025-11-02T13:08:04-08:00	Zhiyong Wang	model: add Janus Pro for image understanding (#16906)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	2f966b8ed87514e74bb96592217226cb6a6974dd	cd5e3b57541ecc52421130742f4d89acbcf77cd4	2025-11-02T22:21:48+02:00	Georgi Gerganov	clip : use FA (#16837)
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/server/server.cpp

commit	cd5e3b57541ecc52421130742f4d89acbcf77cd4	87c9efc3b297b8a498716b1db3d061842e6fc85b	2025-11-02T18:14:04+02:00	Georgi Gerganov	server : support unified cache across slots (#16736)
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-cparams.h
M	src/llama-model.cpp
M	tests/test-thread-safety.cpp
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/unit/test_completion.py
M	tools/server/tests/unit/test_infill.py
M	tools/server/tests/utils.py
M	tools/server/utils.hpp

commit	87c9efc3b297b8a498716b1db3d061842e6fc85b	76af40aaaad78c42faecd8016a88362c788b84b0	2025-11-02T08:56:28-06:00	Aldehir Rojas	common : move gpt-oss reasoning processing to init params (#16937)
M	common/chat.cpp

commit	76af40aaaad78c42faecd8016a88362c788b84b0	7db35a7958a943be1693879f42d166f152613979	2025-11-02T10:28:37+01:00	Adrian Lundberg	docs: remove llama_sampler_accept reference in sampling sample usage (#16920)
M	include/llama.h

commit	7db35a7958a943be1693879f42d166f152613979	a864132ba546b6385922226480ee4e392aaa065c	2025-11-02T08:42:57+05:30	mnehete32	CUDA: add FLOOR, CEIL, ROUND, TRUNC unary ops (#16917)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh

commit	a864132ba546b6385922226480ee4e392aaa065c	d38d9f0877a5872daa3c5f06fb9a86376bf15d50	2025-11-02T08:48:46+08:00	Aaron Teo	devops: fix failing s390x docker build (#16918)
M	.devops/s390x.Dockerfile
M	docs/docker.md

commit	d38d9f0877a5872daa3c5f06fb9a86376bf15d50	7fd205a8e8832ead273f62c5fd81d2b8aa910535	2025-11-02T08:48:23+08:00	Aaron Teo	ggml: add s390x cpu-feats (#16774)
M	.github/workflows/release.yml
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-cpu/arch/s390/cpu-feats.cpp

commit	7fd205a8e8832ead273f62c5fd81d2b8aa910535	2f68ce7cfd20e9e7098514bf730e5389b7bba908	2025-11-02T00:15:31+02:00	Georgi Gerganov	scripts : add script to bench models (#16894)
A	scripts/bench-models.sh
M	tools/batched-bench/batched-bench.cpp

commit	2f68ce7cfd20e9e7098514bf730e5389b7bba908	e4a71599e5846110159955dec0008eb4aa24222b	2025-11-01T19:49:51+01:00	Pascal	webui: auto-refresh /props on inference start to resync model metadata (#16784)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/services/chat.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/lib/stores/server.svelte.ts
M	tools/server/webui/src/lib/types/api.d.ts
M	tools/server/webui/src/lib/types/settings.d.ts

commit	e4a71599e5846110159955dec0008eb4aa24222b	dd5e8cab512c7752392b6e51a6f118f348fb3f16	2025-11-01T17:14:54+01:00	Pascal	webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757)
M	tools/server/public/index.html.gz
A	tools/server/webui/src/lib/components/app/misc/CodePreviewDialog.svelte
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte

commit	dd5e8cab512c7752392b6e51a6f118f348fb3f16	cf659bbb8ef9eb048e5153a27cf787fd83c05560	2025-11-01T16:52:17+01:00	Adrien Gallouët	vendor : update cpp-httplib to 0.27.0 (#16846)
M	vendor/cpp-httplib/httplib.h

commit	cf659bbb8ef9eb048e5153a27cf787fd83c05560	d8b860a219c2415faac8cc0e50b48b4aa11e3b64	2025-11-01T15:51:36+01:00	Xuan-Son Nguyen	mtmd: refactor preprocessing + support max/min pixels (#16878)
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	d8b860a219c2415faac8cc0e50b48b4aa11e3b64	1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1	2025-11-01T15:35:57+01:00	Aleksander Grygier	Add a setting to display message generation statistics (#16901)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/constants/settings-config.ts

commit	1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1	961660b8c395afb8903f61ace69396a158ea0cb4	2025-11-01T15:02:57+01:00	Jaromír Hradílek	webui: recognize AsciiDoc files as valid text files (#16850)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/constants/supported-file-types.ts
M	tools/server/webui/src/lib/enums/files.ts

commit	961660b8c395afb8903f61ace69396a158ea0cb4	74fef4129fa58f6277c243777a4894371479dbad	2025-11-01T11:01:42+01:00	Sigbjørn Skjæret	common : allow --system-prompt-file for diffusion-cli (#16903)
M	common/arg.cpp

commit	74fef4129fa58f6277c243777a4894371479dbad	5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3	2025-11-01T08:55:25+01:00	Sigbjørn Skjæret	codeowners : update after refactor (#16905)
M	CODEOWNERS

commit	5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3	2e76e013600cb0d51ccf158571ca1d0502952a07	2025-11-01T00:52:14-05:00	Jeff Bolz	vulkan: Fix multi_add invalid descriptor usage (#16899)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/multi_add.comp

commit	2e76e013600cb0d51ccf158571ca1d0502952a07	d3dc9dd898be805c23a408cc36daed5b3bf29221	2025-11-01T00:45:28-05:00	Jeff Bolz	vulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_nc.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_p021.comp

commit	d3dc9dd898be805c23a408cc36daed5b3bf29221	bea04522ff1a0d8559ccfd353aa018dcfbb608cc	2025-11-01T06:13:26+01:00	Oliver Simons	CUDA: Remove unneded bias/gate dims in fused mmvq (#16858)
M	ggml/src/ggml-cuda/mmvq.cu

commit	bea04522ff1a0d8559ccfd353aa018dcfbb608cc	0de0a01576772032008a689afc4d7c80685074c4	2025-10-31T23:40:23+01:00	Piotr Wilkin (ilintar)	refactor : llama-model.cpp (#16252)
M	src/CMakeLists.txt
M	src/llama-model.cpp
A	src/models/apertus.cpp
A	src/models/arcee.cpp
A	src/models/arctic.cpp
A	src/models/arwkv7.cpp
A	src/models/baichuan.cpp
A	src/models/bailingmoe.cpp
A	src/models/bailingmoe2.cpp
A	src/models/bert.cpp
A	src/models/bitnet.cpp
A	src/models/bloom.cpp
A	src/models/chameleon.cpp
A	src/models/chatglm.cpp
A	src/models/codeshell.cpp
A	src/models/cogvlm.cpp
A	src/models/cohere2-iswa.cpp
A	src/models/command-r.cpp
A	src/models/dbrx.cpp
A	src/models/deci.cpp
A	src/models/deepseek.cpp
A	src/models/deepseek2.cpp
A	src/models/dots1.cpp
A	src/models/dream.cpp
A	src/models/ernie4-5-moe.cpp
A	src/models/ernie4-5.cpp
A	src/models/exaone.cpp
A	src/models/exaone4.cpp
A	src/models/falcon-h1.cpp
A	src/models/falcon.cpp
A	src/models/gemma-embedding.cpp
A	src/models/gemma.cpp
A	src/models/gemma2-iswa.cpp
A	src/models/gemma3-iswa.cpp
A	src/models/gemma3n-iswa.cpp
A	src/models/glm4-moe.cpp
A	src/models/glm4.cpp
A	src/models/gpt2.cpp
A	src/models/gptneox.cpp
A	src/models/granite-hybrid.cpp
A	src/models/granite.cpp
A	src/models/graph-context-mamba.cpp
A	src/models/grok.cpp
A	src/models/grovemoe.cpp
A	src/models/hunyuan-dense.cpp
A	src/models/hunyuan-moe.cpp
A	src/models/internlm2.cpp
A	src/models/jais.cpp
A	src/models/jamba.cpp
A	src/models/lfm2.cpp
A	src/models/llada-moe.cpp
A	src/models/llada.cpp
A	src/models/llama-iswa.cpp
A	src/models/llama.cpp
A	src/models/mamba.cpp
A	src/models/minicpm3.cpp
A	src/models/minimax-m2.cpp
A	src/models/models.h
A	src/models/mpt.cpp
A	src/models/nemotron-h.cpp
A	src/models/nemotron.cpp
A	src/models/neo-bert.cpp
A	src/models/olmo.cpp
A	src/models/olmo2.cpp
A	src/models/olmoe.cpp
A	src/models/openai-moe-iswa.cpp
A	src/models/openelm.cpp
A	src/models/orion.cpp
A	src/models/phi2.cpp
A	src/models/phi3.cpp
A	src/models/plamo.cpp
A	src/models/plamo2.cpp
A	src/models/plm.cpp
A	src/models/qwen.cpp
A	src/models/qwen2.cpp
A	src/models/qwen2moe.cpp
A	src/models/qwen2vl.cpp
A	src/models/qwen3.cpp
A	src/models/qwen3moe.cpp
A	src/models/qwen3vl-moe.cpp
A	src/models/qwen3vl.cpp
A	src/models/refact.cpp
A	src/models/rwkv6-base.cpp
A	src/models/rwkv6.cpp
A	src/models/rwkv6qwen2.cpp
A	src/models/rwkv7-base.cpp
A	src/models/rwkv7.cpp
A	src/models/seed-oss.cpp
A	src/models/smallthinker.cpp
A	src/models/smollm3.cpp
A	src/models/stablelm.cpp
A	src/models/starcoder.cpp
A	src/models/starcoder2.cpp
A	src/models/t5-dec.cpp
A	src/models/t5-enc.cpp
A	src/models/wavtokenizer-dec.cpp
A	src/models/xverse.cpp

commit	0de0a01576772032008a689afc4d7c80685074c4	e58d585604bbbbbc24f8149effe444621b5191c6	2025-10-31T21:20:47+01:00	Piotr Wilkin (ilintar)	model : Minimax M2 (#16831)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	e58d585604bbbbbc24f8149effe444621b5191c6	31c511a968348281e11d590446bb815048a1e912	2025-10-31T21:20:07+01:00	Giuseppe Scrivano	model : add Granite Hybrid nano types (#16896)
M	src/llama-model.cpp

commit	31c511a968348281e11d590446bb815048a1e912	6d39015a744b47bb7643ea73f412e6d64677f305	2025-10-31T15:57:19+01:00	Johannes Gäßler	CUDA: Volta tensor core support for MMF (#16843)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmf.cuh

commit	6d39015a744b47bb7643ea73f412e6d64677f305	4146d6a1a6228711a487a1e3e9ddd120f8d027d7	2025-10-31T16:25:50+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	4146d6a1a6228711a487a1e3e9ddd120f8d027d7	8da3c0e200a586f768ada6f38745acb01380174c	2025-10-31T20:05:07+08:00	Aman Gupta	CUDA: add expert reduce kernel (#16857)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/moe-expert-reduce.cu
A	ggml/src/ggml-cuda/moe-expert-reduce.cuh
M	tests/test-backend-ops.cpp

commit	8da3c0e200a586f768ada6f38745acb01380174c	c22473b580807929fd9e3a3344a48e8cfbe6c88f	2025-10-31T13:50:33+02:00	Georgi Gerganov	batch : fix consistency checks for the input positions (#16890)
M	src/llama-batch.cpp

commit	c22473b580807929fd9e3a3344a48e8cfbe6c88f	0f715b4e759acceccb9f437cfd2a988fff85514a	2025-10-31T10:54:19+02:00	Georgi Gerganov	server : don't print user inputs to console (#16871)
M	tools/server/server.cpp

commit	0f715b4e759acceccb9f437cfd2a988fff85514a	d2d931f173b8a736b08999436e9259aafddec718	2025-10-31T09:51:26+01:00	Daniel Bevenius	server : fix typos in server.cpp comments [no ci] (#16883)
M	tools/server/server.cpp

commit	d2d931f173b8a736b08999436e9259aafddec718	2976b0374d36609b0429dd6ce48807e2ad39a7c2	2025-10-31T02:34:47-05:00	Jeff Bolz	vulkan: disable spirv-opt for rope shaders (#16872)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	2976b0374d36609b0429dd6ce48807e2ad39a7c2	d2a2673dd1c86a01ab010e18b13b8bb959968c48	2025-10-31T16:18:59+09:00	Masato Nakasaka	vulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	d2a2673dd1c86a01ab010e18b13b8bb959968c48	13002a08960e51a76c4d696165b5d7638d2f2b99	2025-10-31T08:14:49+01:00	Ruben Ortlam	vulkan: fix shmem overrun in mmq id shader (#16873)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_shmem_types.glsl
M	tests/test-backend-ops.cpp

commit	2e05afd22b3d77c7013b11eee88e88b17188f21a	c20c0a5c0c44179f5267a262546624854b1203d1	2025-10-31T14:06:06+08:00	Yunzhe Jia	add pcie support
M	src/CMakeLists.txt
M	src/llama-calrt.cpp

commit	13002a08960e51a76c4d696165b5d7638d2f2b99	6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55	2025-10-31T12:46:31+08:00	l3utterfly	ggml-hexagon: respect input size when getting/setting tensor data (#16836)
M	ggml/src/ggml-hexagon/ggml-hexagon.cpp

commit	6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55	9984cbb61d12491d604484fb38b678fa15064061	2025-10-31T00:34:27+01:00	Sigbjørn Skjæret	ci : enable free-disk-space on cuda docker build (#16877)
M	.github/workflows/docker.yml

commit	9984cbb61d12491d604484fb38b678fa15064061	ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f	2025-10-30T16:00:20-07:00	lhez	opencl: fix boundary handling for mul_mm (#16875)
M	ggml/src/ggml-opencl/kernels/mul_mm_f16_f32_l4_lm.cl
M	ggml/src/ggml-opencl/kernels/mul_mm_f32_f32_l4_lm.cl
M	ggml/src/ggml-opencl/kernels/mul_mm_q8_0_f32_l4_lm.cl

commit	ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f	16724b5b6836a2d4b8936a5824d2ff27c52b4517	2025-10-30T23:15:03+01:00	RodriMora	convert : update transformers requirements (#16866)
M	requirements/requirements-convert_legacy_llama.txt

commit	16724b5b6836a2d4b8936a5824d2ff27c52b4517	b52edd25586fabb70f0c21b274473b307cf14499	2025-10-30T14:22:23-04:00	chansikpark	server : bump request URI max length to 32768 (#16862)
M	tools/server/utils.hpp

commit	b52edd25586fabb70f0c21b274473b307cf14499	517b7170e1a4d733583c4b07c5b7a49acc05911c	2025-10-30T18:42:57+02:00	Georgi Gerganov	server : remove n_past (#16818)
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	517b7170e1a4d733583c4b07c5b7a49acc05911c	835e918d8428f5119927d7150bf5a26176dedda0	2025-10-30T09:06:13-07:00	Max Krasnyansky	cpu: introduce chunking for repack matmuls and enable matmul-id chunking on ARM64 (#16833)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/repack.cpp

commit	835e918d8428f5119927d7150bf5a26176dedda0	d261223d24e97f2df50220e4a5b7f0adb69bba81	2025-10-30T21:17:31+05:30	Shagun Bera	common: fix typo in cli help text (#16864)
M	common/arg.cpp

commit	d261223d24e97f2df50220e4a5b7f0adb69bba81	dcca0d3ab840ebe9b2ccd4719033d408eeb758d7	2025-10-30T23:19:14+08:00	JJJYmmm	model: add support for qwen3vl series (#16780)
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_multi.comp
M	ggml/src/ggml-webgpu/wgsl-shaders/rope.tmpl.wgsl
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache.cpp
M	src/llama-model.cpp
M	tests/test-backend-ops.cpp
M	tests/test-rope.cpp
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/tests.sh

commit	dcca0d3ab840ebe9b2ccd4719033d408eeb758d7	bacddc049a00786df44e682262f6e298742bfbc3	2025-10-30T05:26:05-07:00	Max Krasnyansky	cpu: introduce chunking for flash attention (#16829)
M	ggml/src/ggml-cpu/ops.cpp

commit	bacddc049a00786df44e682262f6e298742bfbc3	229bf686287d18f82c44e89888cc662145ecfdb4	2025-10-30T07:18:50-04:00	Tianyue-Zhao	model: Add support for CogVLM model (#15002)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	229bf686287d18f82c44e89888cc662145ecfdb4	d7395115baf395b75a73a17b0b796e746e468da9	2025-10-30T08:56:28+01:00	Sigbjørn Skjæret	cuda : fix argsort with 64k+ rows (#16849)
M	ggml/src/ggml-cuda/argsort.cu
M	tests/test-backend-ops.cpp

commit	d7395115baf395b75a73a17b0b796e746e468da9	052df28b0e3ca0398e5928c61c7de40254317894	2025-10-30T14:30:58+08:00	Jan Boon	llama : use std::abs instead of abs (#16853)
M	src/llama-graph.cpp
M	src/llama-quant.cpp

commit	052df28b0e3ca0398e5928c61c7de40254317894	8b11deea4663f29d3e042ce1056ba643264cd5f1	2025-10-30T01:27:41-05:00	Jeff Bolz	vulkan: Handle argsort with a large number of rows (#16851)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/argsort.comp

commit	8b11deea4663f29d3e042ce1056ba643264cd5f1	b9ce94017729465895402cbcfffb51fa926c15e3	2025-10-30T04:34:15+01:00	Oliver Simons	Hide latency of bias and gate-loading (#16847)
M	ggml/src/ggml-cuda/mmvq.cu

commit	b9ce94017729465895402cbcfffb51fa926c15e3	3464bdac37027c5e9661621fc75ffcef3c19c6ef	2025-10-29T15:13:10-05:00	Jeff Bolz	vulkan: Fuse rope+set_rows (#16769)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_neox.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	3464bdac37027c5e9661621fc75ffcef3c19c6ef	e3af5563bd049141e036b50f843196db33d23e97	2025-10-29T20:11:39+01:00	Xuan-Son Nguyen	llama: fix ASAN error with M-RoPE (#16848)
M	src/llama-batch.cpp

commit	e3af5563bd049141e036b50f843196db33d23e97	10fcc41290e233788f5a4215314156e8e023eb92	2025-10-29T18:09:18+01:00	Xuan-Son Nguyen	llama: store mrope data in KV cell (#16825)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cells.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h

commit	10fcc41290e233788f5a4215314156e8e023eb92	bcf5bda6f5df559565d11d7c8e8295c1159a85ec	2025-10-29T08:44:29-05:00	Jeff Bolz	vulkan: Update topk_moe fusion to handle gpt's late softmax (#16656)
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/topk_moe.comp

commit	bcf5bda6f5df559565d11d7c8e8295c1159a85ec	3eb2be1ca5f37480aeb16102970d9e65f43347fe	2025-10-29T14:39:03+01:00	Ruben Ortlam	Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_mxfp4.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.glsl
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_id_funcs.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.glsl
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_shmem_types.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/types.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	3eb2be1ca5f37480aeb16102970d9e65f43347fe	e41bcce8f0b53032a1fed275cd253e931c041cf6	2025-10-29T06:29:12-07:00	Max Krasnyansky	Hexagon Op queue & dispatch optimizations (#16820)
M	CODEOWNERS
M	ggml/src/ggml-hexagon/ggml-hexagon.cpp
M	ggml/src/ggml-hexagon/htp/main.c
M	scripts/snapdragon/adb/run-bench.sh
M	scripts/snapdragon/adb/run-cli.sh

commit	e41bcce8f0b53032a1fed275cd253e931c041cf6	144a4ce824b6bd0e48d62009d10cae1daf5308db	2025-10-29T21:11:53+08:00	Aman Gupta	CUDA: use fastdiv in set-rows (#16834)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/set-rows.cu

commit	144a4ce824b6bd0e48d62009d10cae1daf5308db	f549b0007dbdd683215820f7229ce180a12b191d	2025-10-29T14:09:50+01:00	Sigbjørn Skjæret	vendor : sync minja (#16500)
M	vendor/minja/minja.hpp

commit	f549b0007dbdd683215820f7229ce180a12b191d	9a3ea685b937c0f0cbfda2e50004ea54bf187512	2025-10-29T03:53:04-05:00	Jeff Bolz	vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	9a3ea685b937c0f0cbfda2e50004ea54bf187512	338074c383c81366320d176d83b94b0a567ee0c2	2025-10-29T15:55:06+08:00	Aman Gupta	CUDA: Fix bug in topk-moe for gpt-oss (#16821)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	338074c383c81366320d176d83b94b0a567ee0c2	851553ea6b24cb39fd5fd188b437d777cb411de8	2025-10-29T08:14:39+02:00	YaelLogic	sycl: add RMS_NORM_BACK operation support (#16808)
M	docs/ops.md
M	docs/ops/SYCL.csv
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/norm.hpp

commit	851553ea6b24cb39fd5fd188b437d777cb411de8	85a7d8677bf2200981e52f744a21d5267964ffcf	2025-10-28T21:10:28+02:00	YaelGitAccount	cuda: add SET operation support (#16804)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/set.cu
A	ggml/src/ggml-cuda/set.cuh

commit	85a7d8677bf2200981e52f744a21d5267964ffcf	a8ca18b4b815a2abdbecb958ee5f4c542d69aac7	2025-10-28T20:19:44+02:00	Georgi Gerganov	memory : remove KV cache size padding (#16812)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tools/server/server.cpp
M	tools/server/tests/unit/test_ctx_shift.py

commit	a8ca18b4b815a2abdbecb958ee5f4c542d69aac7	8284efc35c909217ee1b9a06903245d808ac2283	2025-10-28T19:41:43+02:00	Georgi Gerganov	llama-bench : clarify benchmarked parts of the computation (#16823)
M	tools/llama-bench/README.md

commit	8284efc35c909217ee1b9a06903245d808ac2283	1c1409e13169d0ced4b1b4d39fb5b268b7525091	2025-10-28T23:16:20+08:00	l3utterfly	initialise buffer.device in ggml_hexagon_session (#16816)
M	ggml/src/ggml-hexagon/ggml-hexagon.cpp

commit	1c1409e13169d0ced4b1b4d39fb5b268b7525091	7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e	2025-10-28T03:51:41-07:00	Sam Malayek	embedding: add raw option for --embd-output-format (#16541)
M	common/arg.cpp
M	examples/embedding/README.md
M	examples/embedding/embedding.cpp

commit	7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e	280d97be9660e7a5feaa28a6e7a299bc73dd83fc	2025-10-28T11:23:54+01:00	Johannes Gäßler	llama: consistent ctx <-> buf order for KV cache (#16746)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-model.cpp

commit	280d97be9660e7a5feaa28a6e7a299bc73dd83fc	3479efd112b3910d2d008ad08fe4cb4895605903	2025-10-28T03:37:52-05:00	Aldehir Rojas	grammar : support array references in json schema (#16792)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	tests/test-json-schema-to-grammar.cpp
M	tools/server/public_legacy/json-schema-to-grammar.mjs

commit	3479efd112b3910d2d008ad08fe4cb4895605903	463bbf20bfbe0da10ac58984d4d62bed5a49362a	2025-10-28T10:54:53+08:00	Chenguang Li	CANN: Improve device ID handling and aclnnArange checks (#16752)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	463bbf20bfbe0da10ac58984d4d62bed5a49362a	ad8d36beffd791db10c94eb9e964afb891e3ca55	2025-10-28T10:31:21+08:00	Aman Gupta	CUDA: add unused vars to mmvf and mmvq (#16807)
M	ggml/src/ggml-cuda/mmvf.cu
M	ggml/src/ggml-cuda/mmvq.cu

commit	ad8d36beffd791db10c94eb9e964afb891e3ca55	c053e18a66dd95dc340aa61317877c2a41d4e3cf	2025-10-28T03:50:33+02:00	tamarPal	sycl: add SSM_CONV operation support (#16800)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/ssm_conv.cpp
A	ggml/src/ggml-sycl/ssm_conv.hpp

commit	c053e18a66dd95dc340aa61317877c2a41d4e3cf	e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3	2025-10-27T18:54:01-04:00	Yuri Khrustalev	chat: Add LFM2 tool handling (#16763)
M	common/chat.cpp
M	common/chat.h
A	models/templates/llama-cpp-lfm2.jinja
M	tests/test-chat.cpp

commit	e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3	5a4ff43e7dd049e35942bc3d12361dab2f155544	2025-10-27T23:12:16+01:00	Xuan-Son Nguyen	mtmd : fix idefics3 preprocessing (#16806)
M	tools/mtmd/clip.cpp
M	tools/mtmd/tests.sh

commit	5a4ff43e7dd049e35942bc3d12361dab2f155544	10640e31aab0819f31c1e1f2d008b019ee737232	2025-10-27T13:51:28-07:00	Diego Devesa	llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
M	src/llama-context.cpp

commit	10640e31aab0819f31c1e1f2d008b019ee737232	80d28f104c0c3e61c11d6af073642b246a9fc19c	2025-10-27T21:50:22+01:00	Acly	ggml : fix interpolate with align-corners and ne=1 (#16700)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/upscale.cu
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp
M	tests/test-backend-ops.cpp

commit	80d28f104c0c3e61c11d6af073642b246a9fc19c	c55d53acec864f64afa1ba92972203dce1bf88f5	2025-10-27T21:39:49+01:00	Johannes Gäßler	HIP: fix AMDGPU_TARGETS, update documentation (#16803)
M	docs/build.md
M	ggml/src/ggml-hip/CMakeLists.txt

commit	c55d53acec864f64afa1ba92972203dce1bf88f5	945501f5ea4b8ca56b181ecb035e9ee3fb31f432	2025-10-27T16:02:58+01:00	Xuan-Son Nguyen	model : add LightOnOCR-1B model (#16764)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/tests.sh

commit	945501f5ea4b8ca56b181ecb035e9ee3fb31f432	75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa	2025-10-27T09:17:31+01:00	Johannes Gäßler	llama: fix leaked buffers for mmap + split files (#16765)
M	src/llama-model.cpp

commit	75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa	2b9bd9bf4e759c05db629ec1c391dc8aeaa71887	2025-10-27T09:25:10+08:00	Aman Gupta	test-backend-ops: print failed tests at the end (#16785)
M	tests/test-backend-ops.cpp

commit	2b9bd9bf4e759c05db629ec1c391dc8aeaa71887	59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f	2025-10-27T03:20:24+02:00	tamarPal	sycl: add ROLL operation support (#16665)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/roll.cpp
A	ggml/src/ggml-sycl/roll.hpp

commit	59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f	75d33b9302f84a5b89f82205d2bcd8def5a64e0a	2025-10-27T03:19:50+02:00	shani-f	sycl: add REPEAT_BACK operation support (#16734)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/repeat_back.cpp
A	ggml/src/ggml-sycl/repeat_back.hpp

commit	75d33b9302f84a5b89f82205d2bcd8def5a64e0a	3470a5c891dcc94363e492a3760af92b6b07241c	2025-10-27T09:06:16+08:00	Aman Gupta	CUDA: support for weight clamp in top-k norm (#16702)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/topk-moe.cu
M	ggml/src/ggml-cuda/topk-moe.cuh
M	tests/test-backend-ops.cpp

commit	3470a5c891dcc94363e492a3760af92b6b07241c	bd562fe4f7bd55625511d5f9d639c4fb1db1d440	2025-10-26T23:19:03+01:00	Acly	ggml-alloc : make gallocr prefer chunks that allow memory reuse (#16788)
M	ggml/src/ggml-alloc.c

commit	bd562fe4f7bd55625511d5f9d639c4fb1db1d440	bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b	2025-10-26T21:31:41+01:00	Sigbjørn Skjæret	cuda : use fast copy when src and dst are of different type and contiguous (#16789)
M	ggml/src/ggml-cuda/cpy.cu

commit	bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b	73a48c9790d320476b3e5ef75bda09f2f8269e6e	2025-10-27T02:13:31+08:00	leejet	ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	73a48c9790d320476b3e5ef75bda09f2f8269e6e	f696428ce8e4d16c17acbffeaa7feac3b0fb9061	2025-10-26T17:21:23+01:00	Sigbjørn Skjæret	convert : enable expert group selection for all models with it (#16691)
M	convert_hf_to_gguf.py
M	src/llama-model.cpp

commit	f696428ce8e4d16c17acbffeaa7feac3b0fb9061	7cce4f8158f0c4c88d8dadd4c23d33938127b897	2025-10-26T17:20:32+01:00	Sigbjørn Skjæret	graph : add clamping to ffn_moe_weights_sum to avoid div-by-zero (#16655)
M	src/llama-graph.cpp

commit	7cce4f8158f0c4c88d8dadd4c23d33938127b897	8d8862829cd770fc9c0c7a726ed162de824ff5ea	2025-10-26T16:08:52+01:00	Sigbjørn Skjæret	model : set res->t_embd in SmallThinker models (#16782)
M	src/llama-model.cpp

commit	8d8862829cd770fc9c0c7a726ed162de824ff5ea	f77c13b91f4d25754b6a0b857f98a6bc922a0aa7	2025-10-26T14:01:20+02:00	amirai21	docs : add Jamba to Text-only models list (#16778)
M	README.md

commit	f77c13b91f4d25754b6a0b857f98a6bc922a0aa7	3cfa9c3f125763305b4226bc032f1954f08990dc	2025-10-26T19:28:04+08:00	Aman Gupta	CUDA: General GEMV fusion (#16715)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmvf.cu
M	ggml/src/ggml-cuda/mmvf.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/mmvq.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	src/llama-graph.cpp
M	tests/test-backend-ops.cpp

commit	3cfa9c3f125763305b4226bc032f1954f08990dc	5d195f17bc60eacc15cfb929f9403cf29ccdf419	2025-10-26T06:37:38+02:00	Gilad S.	vulkan: deduplicate Microsoft Direct3D12 devices (#16689)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	5d195f17bc60eacc15cfb929f9403cf29ccdf419	226f295f4dd92ad714533adc5497afed5fa88bb8	2025-10-25T20:41:36+02:00	Galunid	convert : handle mmproj filename/path properly (#16760)
M	convert_hf_to_gguf.py

commit	226f295f4dd92ad714533adc5497afed5fa88bb8	f90b4a8efe4466215c51155a5c22c1ae6207da23	2025-10-25T19:26:27+09:00	Shunta Saito	model : set res->t_embd in PLaMo2 models (#16766)
M	src/llama-model.cpp

commit	f90b4a8efe4466215c51155a5c22c1ae6207da23	8423d019318b446640bb620e4ce80066d8530f05	2025-10-25T10:59:54+02:00	Giuseppe Scrivano	vulkan: delete dead code (#16732)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	8423d019318b446640bb620e4ce80066d8530f05	5cca2542ac3f3f86831d32bce744d08fc2b353b0	2025-10-25T00:04:12-05:00	Jeff Bolz	vulkan: Optimize SSM_SCAN (#16645)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/ssm_scan.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	5cca2542ac3f3f86831d32bce744d08fc2b353b0	55945d2ef51b93821d4b6f4a9b994393344a90db	2025-10-24T20:52:00-04:00	compilade	convert : avoid dequantizing mxfp4 for GPT-OSS (#16756)
M	convert_hf_to_gguf.py

commit	55945d2ef51b93821d4b6f4a9b994393344a90db	0bcb40b48c6fc6f17ba9672625e526ab2574344b	2025-10-25T03:39:37+08:00	leejet	ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742)
M	ggml/src/ggml-cuda/binbcast.cu
M	tests/test-backend-ops.cpp

commit	0bcb40b48c6fc6f17ba9672625e526ab2574344b	69e9ff010309a1155d704cf9320bdb3aaf4160ca	2025-10-24T20:46:19+08:00	Aman Gupta	CUDA: use CUB for arbitary size argsort (#16754)
M	ggml/src/ggml-cuda/argsort.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	69e9ff010309a1155d704cf9320bdb3aaf4160ca	5a91109a5d7dab5d7adc40bedb397ede99a705b1	2025-10-24T14:10:29+02:00	Florian Badie	webui: support q URL parameter (#16728)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/routes/+page.svelte

commit	5a91109a5d7dab5d7adc40bedb397ede99a705b1	f8f071faddf32ea09f4234edb6e809b380a9ee26	2025-10-24T12:02:02+02:00	Daniel Bevenius	model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
M	examples/model-conversion/scripts/causal/run-org-model.py

commit	f8f071faddf32ea09f4234edb6e809b380a9ee26	0bf47a1dbba4d36f2aff4e8c34b06210ba34e688	2025-10-23T16:31:41-04:00	compilade	convert : handle pre-quantized models (#14810)
M	convert_hf_to_gguf.py

commit	0bf47a1dbba4d36f2aff4e8c34b06210ba34e688	dd62dcfab97e420949519fd0eac9fca7bf97e635	2025-10-23T21:30:17+02:00	Johannes Gäßler	server: add memory breakdown print (#16740)
M	tools/server/server.cpp

commit	dd62dcfab97e420949519fd0eac9fca7bf97e635	d0660f237a5c31771a3d6d1030ebe3e0c409ba92	2025-10-23T15:54:46+02:00	Julien Denize	convert : Make mistral-common dependency optional (#16738)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/vocab.py
M	requirements/requirements-convert_hf_to_gguf.txt

commit	d0660f237a5c31771a3d6d1030ebe3e0c409ba92	fe6a9882acf5c02f96624ed8f80144100d7006cb	2025-10-23T15:00:49+02:00	Xuan-Son Nguyen	mtmd-cli : allow using --jinja (#16718)
M	common/arg.cpp
M	tools/mtmd/mtmd-cli.cpp

commit	fe6a9882acf5c02f96624ed8f80144100d7006cb	061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a	2025-10-23T17:07:31+05:30	Prajwal B Mehendarkar	Manually link -lbsd to resolve flock symbol on AIX (#16610)
M	tools/imatrix/CMakeLists.txt
M	tools/run/CMakeLists.txt

commit	061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a	8cf6b42d467d05fa7d9776d2bcc69974ecce6900	2025-10-23T19:14:06+08:00	Aman Gupta	ggml-cuda: use passed ops instead of hardcoded ops (#16712)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	8cf6b42d467d05fa7d9776d2bcc69974ecce6900	9de9672adb0f4ca4e39483ac3ffed52b3f70a55d	2025-10-23T11:32:24+02:00	matteo	server : send partial stop string when <EOG> is reached (#15007)
M	tools/server/server.cpp

commit	9de9672adb0f4ca4e39483ac3ffed52b3f70a55d	63d2fc46e17a06be5b4b5823a5ada088317f1f0a	2025-10-22T20:05:15-05:00	Matthew Michel	sycl: use async memory allocation to fix crashes during graph recording (#16644)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	63d2fc46e17a06be5b4b5823a5ada088317f1f0a	a2e0088d9242bd9e57f8b852b05a6e47843b5a45	2025-10-22T13:47:09-07:00	Max Krasnyansky	Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
M	.github/workflows/build.yml
M	CODEOWNERS
M	README.md
A	docs/backend/hexagon/CMakeUserPresets.json
A	docs/backend/hexagon/README.md
A	docs/backend/hexagon/developer.md
M	ggml/CMakeLists.txt
A	ggml/include/ggml-hexagon.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
A	ggml/src/ggml-hexagon/CMakeLists.txt
A	ggml/src/ggml-hexagon/ggml-hexagon.cpp
A	ggml/src/ggml-hexagon/htp-utils.c
A	ggml/src/ggml-hexagon/htp-utils.h
A	ggml/src/ggml-hexagon/htp/CMakeLists.txt
A	ggml/src/ggml-hexagon/htp/act-ops.c
A	ggml/src/ggml-hexagon/htp/binary-ops.c
A	ggml/src/ggml-hexagon/htp/cmake-toolchain.cmake
A	ggml/src/ggml-hexagon/htp/htp-ctx.h
A	ggml/src/ggml-hexagon/htp/htp-dma.c
A	ggml/src/ggml-hexagon/htp/htp-dma.h
A	ggml/src/ggml-hexagon/htp/htp-msg.h
A	ggml/src/ggml-hexagon/htp/htp-ops.h
A	ggml/src/ggml-hexagon/htp/htp_iface.idl
A	ggml/src/ggml-hexagon/htp/hvx-exp.c
A	ggml/src/ggml-hexagon/htp/hvx-inverse.c
A	ggml/src/ggml-hexagon/htp/hvx-sigmoid.c
A	ggml/src/ggml-hexagon/htp/hvx-utils.c
A	ggml/src/ggml-hexagon/htp/hvx-utils.h
A	ggml/src/ggml-hexagon/htp/main.c
A	ggml/src/ggml-hexagon/htp/matmul-ops.c
A	ggml/src/ggml-hexagon/htp/ops-utils.h
A	ggml/src/ggml-hexagon/htp/rope-ops.c
A	ggml/src/ggml-hexagon/htp/softmax-ops.c
A	ggml/src/ggml-hexagon/htp/unary-ops.c
A	ggml/src/ggml-hexagon/htp/worker-pool.c
A	ggml/src/ggml-hexagon/htp/worker-pool.h
A	scripts/snapdragon/adb/llama-cli.farf
A	scripts/snapdragon/adb/run-bench.sh
A	scripts/snapdragon/adb/run-cli.sh
A	scripts/snapdragon/adb/run-tool.sh
A	scripts/snapdragon/qdc/readme.md
A	scripts/snapdragon/qdc/requirements.txt
A	scripts/snapdragon/qdc/tests/test_bench.py
M	src/llama-model.cpp

commit	a2e0088d9242bd9e57f8b852b05a6e47843b5a45	9b9201f65a22c02cee8e300f58f480a588591227	2025-10-22T11:20:55-07:00	Diego Devesa	Revert "ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_v…" (#16723)
M	ggml/src/ggml-cpu/vec.h

commit	9b9201f65a22c02cee8e300f58f480a588591227	19a5a3edfd306516cc419679d69d6435943b6816	2025-10-22T16:58:23+02:00	Pascal	webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormActions.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormModelSelector.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/components/app/index.ts
M	tools/server/webui/src/lib/components/ui/select/select-trigger.svelte
M	tools/server/webui/src/lib/constants/localstorage-keys.ts
M	tools/server/webui/src/lib/constants/settings-config.ts
M	tools/server/webui/src/lib/services/chat.ts
A	tools/server/webui/src/lib/services/models.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
A	tools/server/webui/src/lib/stores/models.svelte.ts
A	tools/server/webui/src/lib/stores/persisted.svelte.ts
M	tools/server/webui/src/lib/stores/settings.svelte.ts
M	tools/server/webui/src/lib/types/api.d.ts
A	tools/server/webui/src/lib/types/models.d.ts
M	tools/server/webui/src/lib/types/settings.d.ts
A	tools/server/webui/src/lib/utils/model-names.test.ts
A	tools/server/webui/src/lib/utils/model-names.ts
A	tools/server/webui/src/lib/utils/portal-to-body.ts
M	tools/server/webui/src/routes/+layout.svelte

commit	19a5a3edfd306516cc419679d69d6435943b6816	d8eaa26e4d9228df3aa46a930db60c8eaab67c1b	2025-10-22T05:14:14-05:00	sirus20x6	ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_vec_set_f32 for faster fills (#16522)
M	ggml/src/ggml-cpu/vec.h

commit	d8eaa26e4d9228df3aa46a930db60c8eaab67c1b	9285325ce0174631c3cd6121d56084adc4ef2d8f	2025-10-22T12:01:22+02:00	Acly	tests : fix test-thread-safety when compiling with multiple backends (#16699)
M	tests/test-thread-safety.cpp

commit	9285325ce0174631c3cd6121d56084adc4ef2d8f	03792ad93609fc67e41041c6347d9aa14e5e0d74	2025-10-22T12:33:08+08:00	Aman Gupta	CUDA: fix bug in topk-moe softmax (#16711)
M	ggml/src/ggml-cuda/topk-moe.cu

commit	03792ad93609fc67e41041c6347d9aa14e5e0d74	51d1a8c997bd2629ef211a30208058ea87a30982	2025-10-21T22:40:38+08:00	Aman Gupta	CUDA: topk-moe: add optional parameter for gpt-oss (#16649)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/topk-moe.cu
M	ggml/src/ggml-cuda/topk-moe.cuh
M	tests/test-backend-ops.cpp

commit	51d1a8c997bd2629ef211a30208058ea87a30982	4926419c4d74a1cf724e7163d937eb72f36e7b26	2025-10-21T15:27:53+02:00	Johannes Gäßler	CUDA: better error for FA kernel with 0 occupancy (#16643)
M	ggml/src/ggml-cuda/fattn-common.cuh

commit	4926419c4d74a1cf724e7163d937eb72f36e7b26	6ea37f57391d27736c35cd3c20c1f990b7952b74	2025-10-21T16:43:14+08:00	Aman Gupta	ggml: add ggml_can_fuse_subgraph (#16662)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c

commit	6ea37f57391d27736c35cd3c20c1f990b7952b74	fb349848f387f355450c3187556e71e6d32c145f	2025-10-20T22:26:17-07:00	lhez	opencl: fix warnings and clean up profiling (#16688)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	fb349848f387f355450c3187556e71e6d32c145f	6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2	2025-10-20T22:16:08-05:00	Jeff Bolz	vulkan: Handle FA with all -inf mask values (#16447)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp

commit	6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2	84bf3c677857279037adf67cdcfd89eaa4ca9281	2025-10-21T01:21:12+03:00	YehuditE	sycl : add PAD_REFLECT_D1 operator support (#16145)
M	docs/ops.md
M	docs/ops/SYCL.csv
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/pad_reflect_1d.cpp
A	ggml/src/ggml-sycl/pad_reflect_1d.hpp

commit	84bf3c677857279037adf67cdcfd89eaa4ca9281	c9c1972e2c2cc6a771fcc145bfa138700179f961	2025-10-20T21:38:20+02:00	Sigbjørn Skjæret	model : add BailingMoeV2 support (#16063)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-graph.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	c9c1972e2c2cc6a771fcc145bfa138700179f961	b617cfd2896edd592a36ebbc041817eb030a1005	2025-10-20T19:49:02+02:00	Aleksander Grygier	Handle legacy 'context' attachments (#16687)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/app.d.ts
M	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentsList.svelte
M	tools/server/webui/src/lib/services/chat.ts
M	tools/server/webui/src/lib/types/database.d.ts

commit	b617cfd2896edd592a36ebbc041817eb030a1005	79068501fac9a74cca7129a8e5a8281b410a853e	2025-10-20T05:53:50-07:00	Diego Devesa	ggml-alloc : fix leak when reusing a tensor with a larger size (#16679)
M	ggml/src/ggml-alloc.c

commit	79068501fac9a74cca7129a8e5a8281b410a853e	0e4a0cf2fae667d3efcf52f2f52398779d986b1d	2025-10-20T14:21:12+02:00	Aleksander Grygier	Prevent premature submission on IME input (#16673)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatForm.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessage.svelte
A	tools/server/webui/src/lib/utils/is-ime-composing.ts

commit	0e4a0cf2fae667d3efcf52f2f52398779d986b1d	13f2cfad4170c096c51a02c24a6a158cb47f1480	2025-10-20T13:29:14+02:00	Aleksander Grygier	Import/Export UX improvements (#16619)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ConversationSelectionDialog.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ImportExportTab.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarActions.svelte
M	tools/server/webui/src/lib/components/app/index.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
A	tools/server/webui/src/lib/utils/conversation-utils.ts

commit	13f2cfad4170c096c51a02c24a6a158cb47f1480	06332e28672356b964d6dfc2ba4657e20581cd43	2025-10-20T12:41:13+02:00	Aleksander Grygier	Enable per-conversation loading states to allow having parallel conversations (#16327)
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/playwright.config.ts
M	tools/server/webui/src/lib/components/app/chat/ChatProcessingInfo.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreen.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarConversationItem.svelte
M	tools/server/webui/src/lib/services/chat.ts
M	tools/server/webui/src/lib/services/slots.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/routes/chat/[id]/+page.svelte
M	tools/server/webui/svelte.config.js
M	tools/server/webui/vite.config.ts

commit	06332e28672356b964d6dfc2ba4657e20581cd43	72d53e6c4decee8b339e49aed8cc0e234b9639dc	2025-10-20T16:27:09+08:00	takuya kodama	llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
M	src/llama-batch.h

commit	72d53e6c4decee8b339e49aed8cc0e234b9639dc	2330de7b847ca84eac766df372c604c26db72747	2025-10-20T10:20:04+02:00	Ron Evans	readme: update bindings (#16651)
M	README.md

commit	2330de7b847ca84eac766df372c604c26db72747	7062dd8460685d6700ed7621e50a22c6f3400ca3	2025-10-20T11:08:32+03:00	safranowith	SYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613)
M	docs/ops.md
M	docs/ops/SYCL.csv
M	docs/ops/Vulkan.csv
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	tests/test-backend-ops.cpp

commit	7062dd8460685d6700ed7621e50a22c6f3400ca3	0398752dd450dfabdd1b9e289f6364c2600f6ab5	2025-10-20T15:44:21+08:00	takuya kodama	llama-context: only warn on pooling_type when user specified (#16674)
M	src/llama-context.cpp

commit	c20c0a5c0c44179f5267a262546624854b1203d1	62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c	2025-10-20T14:41:08+08:00	Yunzhe Jia	kv: turn on common-prefix mtmd: fix output size bug
M	src/CMakeLists.txt
M	src/llama-kv-cache-calrt-adapter.cpp
M	tools/mtmd/mtmd.cpp

commit	0398752dd450dfabdd1b9e289f6364c2600f6ab5	4f73d0a95120687e2c527739f771330a5271259a	2025-10-19T23:54:31+02:00	Giuseppe Scrivano	model : add Granite Hybrid types (#16635)
M	src/llama-model.cpp
M	src/llama-model.h

commit	4f73d0a95120687e2c527739f771330a5271259a	cec5edbcaec69bbf6d5851cabce4ac148be41701	2025-10-20T05:06:39+08:00	Aaron Teo	ci : fix binaries release failure for s390x (binaries may not work yet) (#16664)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	cec5edbcaec69bbf6d5851cabce4ac148be41701	fcb235b46618921cbd826acd49b553b5302233aa	2025-10-19T14:03:25+02:00	Sigbjørn Skjæret	ci : avoid manual updates of docs/ops.md (#16663)
M	.github/workflows/update-ops-docs.yml

commit	fcb235b46618921cbd826acd49b553b5302233aa	55754bebd5d570960cde9c0ba991a0b2991f6b1e	2025-10-19T18:37:47+08:00	Aaron Teo	ci: include s390x release binaries (#16648)
M	.github/workflows/release.yml

commit	55754bebd5d570960cde9c0ba991a0b2991f6b1e	ee09828cb057460b369576410601a3a09279e23c	2025-10-19T15:37:12+08:00	Aman Gupta	CODEOWNERS: update for ggml-cuda/mmf (#16660)
M	CODEOWNERS

commit	ee09828cb057460b369576410601a3a09279e23c	e56abd2098dd2e2b0804691b93c13b48ae421627	2025-10-18T14:47:32+02:00	Johannes Gäßler	HIP: fix GPU_TARGETS (#16642)
M	ci/run.sh
M	ggml/src/ggml-hip/CMakeLists.txt

commit	e56abd2098dd2e2b0804691b93c13b48ae421627	38355c6c8e43204e11a22daa7483082c0ff01e71	2025-10-18T05:22:57-05:00	Jeff Bolz	vulkan: Implement topk_moe fused shader, ported from CUDA (#16641)
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/topk_moe.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	38355c6c8e43204e11a22daa7483082c0ff01e71	81387858f1fbcc1acedbd308486e1016618ca8f8	2025-10-18T17:52:53+08:00	Aman Gupta	CUDA: use registers instead of smem in topk-moe (#16647)
M	ggml/src/ggml-cuda/topk-moe.cu

commit	81387858f1fbcc1acedbd308486e1016618ca8f8	66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c	2025-10-17T17:55:32-07:00	Shawn Gu	opencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/cvt.cl
A	ggml/src/ggml-opencl/kernels/gemm_moe_mxfp4_f32.cl
A	ggml/src/ggml-opencl/kernels/gemv_moe_mxfp4_f32.cl

commit	66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c	41386cf365d894134ee0813d15e2f5d76f6a4d8e	2025-10-17T17:41:09+02:00	Johannes Gäßler	llama-model: fix insonsistent ctxs <-> bufs order (#16581)
M	src/llama-model.cpp

commit	41386cf365d894134ee0813d15e2f5d76f6a4d8e	3d4e86bbeb15f487d6da6174ba6191b7c212cc25	2025-10-17T18:02:52+03:00	Radoslav Gerganov	rpc : report actual free memory (#16616)
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	tools/rpc/rpc-server.cpp

commit	3d4e86bbeb15f487d6da6174ba6191b7c212cc25	342c728d031d50673feded797520a44127d73379	2025-10-17T14:23:47+02:00	Giuseppe Scrivano	vulkan: Add State Space Model (SSM) Operations Support (#16463)
M	docs/ops.md
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/ssm_conv.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/ssm_scan.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	342c728d031d50673feded797520a44127d73379	ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5	2025-10-17T18:01:23+08:00	muggle-stack	ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629)
M	ggml/src/ggml-cpu/spacemit/ime.cpp

commit	ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5	b19491599d4d42c606601d75e95c1d1de3291f8e	2025-10-17T10:35:03+02:00	Pascal	webui: reorganize settings layout (#16607)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte

commit	b19491599d4d42c606601d75e95c1d1de3291f8e	9ad4f1931ee0f3b41d9355245ef744786aaae0aa	2025-10-17T02:31:04-05:00	Jeff Bolz	vulkan: fix debug build (add_rms_len/data not found) (#16624)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9ad4f1931ee0f3b41d9355245ef744786aaae0aa	79967ec596c0dacfd2251b085a57e79df292b1cc	2025-10-17T02:33:58-04:00	Ilia Ilmer	metal : add `CONV_TRANSPOSE_2D` (#16542)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	79967ec596c0dacfd2251b085a57e79df292b1cc	ceff6bb253dd306f5404d7ccb3f11fadafe71b52	2025-10-17T06:59:31+01:00	Olivier Chafik	grammar : use int64_t to avoid int overflows in int schema to grammar conversion logic (#16626)
M	common/json-schema-to-grammar.cpp
M	tests/test-grammar-integration.cpp

commit	ceff6bb253dd306f5404d7ccb3f11fadafe71b52	1bb4f43380944e94c9a86e305789ba103f5e62bd	2025-10-17T05:36:40+03:00	GittyBurstein	SYCL SET operator optimized for F32 tensors (#16350)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/presets.hpp
A	ggml/src/ggml-sycl/set.cpp
A	ggml/src/ggml-sycl/set.hpp

commit	1bb4f43380944e94c9a86e305789ba103f5e62bd	683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf	2025-10-16T19:00:31+02:00	Xuan-Son Nguyen	mtmd : support home-cooked Mistral Small Omni (#14928)
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf	b22572e97dc51757d3ebe917a5a283385010ec68	2025-10-16T16:28:41+02:00	Pascal	fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte

commit	b22572e97dc51757d3ebe917a5a283385010ec68	7a50cf388a530127cbbdd2a507ef81a451c9d819	2025-10-16T16:26:21+03:00	GittyBurstein	sycl : add ARANGE operator (#16362)
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/presets.hpp

commit	62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c	76a63a2998286c1649de2496bccb7d8a46549895	2025-10-16T17:34:39+08:00	Yunzhe Jia	kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
M	src/llama-kv-cache-calrt-adapter.cpp

commit	7a50cf388a530127cbbdd2a507ef81a451c9d819	6f5d924637a15abedb111cbbffd7da5f31c81855	2025-10-16T16:41:11+08:00	Chenguang Li	CANN: format code using .clang-format (#15863)
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/acl_tensor.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	76a63a2998286c1649de2496bccb7d8a46549895	b67217078aa748b06e1b2269d88dd18c0aca2c26	2025-10-16T16:31:15+08:00	Yunzhe Jia	kv: fix common-prefix bug by implementing llama_memory_seq_rm
M	src/llama-calrt.cpp
M	src/llama-kv-cache-calrt-adapter.cpp
M	tools/server/server.cpp

commit	6f5d924637a15abedb111cbbffd7da5f31c81855	adc9b60f190c1016a09f439862fa1cbb302262ac	2025-10-16T01:11:33-04:00	takasurazeem	common : Update the docs on -t --threads (#16236)
M	common/arg.cpp

commit	adc9b60f190c1016a09f439862fa1cbb302262ac	ee50ee1eadff58777ae746827b04de7ba0befc55	2025-10-16T13:10:32+08:00	takuya kodama	ggml-cpu: replace putenv with setenv for const-correctness (#16573)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	ee50ee1eadff58777ae746827b04de7ba0befc55	7adc79c03234de9a20661fd6dbf2d02c32ca7acb	2025-10-16T07:21:28+03:00	yael-works	SYCL: Add GGML_OP_MEAN operator support (#16009)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	7adc79c03234de9a20661fd6dbf2d02c32ca7acb	466c1911ab736f0b7366127edee99f8ee5687417	2025-10-15T22:43:08+02:00	Aleksei Nikiforov	gguf-py : add support for endian conversion of BF16 data (#16594)
M	gguf-py/gguf/scripts/gguf_convert_endian.py

commit	466c1911ab736f0b7366127edee99f8ee5687417	0cb7a0683b0529172472d74d21f05470a607f297	2025-10-15T22:24:51+03:00	safranowith	cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083)
M	docs/ops.md
M	docs/ops/CPU.csv
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/unary-ops.cpp
M	ggml/src/ggml-cpu/unary-ops.h
M	ggml/src/ggml.c

commit	0cb7a0683b0529172472d74d21f05470a607f297	d93f8439b08c4f35e13a41a7366901fdbe770fc8	2025-10-15T10:51:04-07:00	lhez	opencl: add q8_0 mm support (#16469)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/mul_mm_f16_f32_l4_lm.cl
M	ggml/src/ggml-opencl/kernels/mul_mm_f32_f32_l4_lm.cl
A	ggml/src/ggml-opencl/kernels/mul_mm_q8_0_f32_l4_lm.cl
M	tests/test-backend-ops.cpp

commit	d93f8439b08c4f35e13a41a7366901fdbe770fc8	f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb	2025-10-15T10:48:28-07:00	lhez	opencl: fix FA for f32 (#16584)
M	ggml/src/ggml-opencl/kernels/flash_attn_f32.cl

commit	f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb	f4ce81c45e7bd910e36bf44c253fc5255c49b1e4	2025-10-15T16:22:20+02:00	Aleksander Grygier	Add server-driven parameter defaults and syncing (#16515)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFields.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFooter.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ParameterSourceIndicator.svelte
M	tools/server/webui/src/lib/components/app/index.ts
A	tools/server/webui/src/lib/constants/precision.ts
A	tools/server/webui/src/lib/services/parameter-sync.spec.ts
A	tools/server/webui/src/lib/services/parameter-sync.ts
M	tools/server/webui/src/lib/stores/server.svelte.ts
M	tools/server/webui/src/lib/stores/settings.svelte.ts
A	tools/server/webui/src/lib/utils/config-helpers.ts
A	tools/server/webui/src/lib/utils/precision.ts
M	tools/server/webui/src/routes/+layout.svelte

commit	f4ce81c45e7bd910e36bf44c253fc5255c49b1e4	17304cbcc1dd24de7741cbe57925d58e90a98ac1	2025-10-15T23:05:56+09:00	Sam/Samuel	metal: optimise `GGML_OP_SUM` (#16559)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	17304cbcc1dd24de7741cbe57925d58e90a98ac1	3e3cb19f6449f9168a128eaeae01f8f41b049acc	2025-10-15T16:53:12+03:00	Georgi Gerganov	server : fix img token logs (#16595)
M	tools/server/server.cpp

commit	3e3cb19f6449f9168a128eaeae01f8f41b049acc	5acd455460f457942d8dd02e3dd9b1eebfce99fe	2025-10-15T14:48:08+02:00	Xuan-Son Nguyen	llama-quant: add support for mmproj (#16592)
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-quant.cpp
M	src/llama.cpp

commit	5acd455460f457942d8dd02e3dd9b1eebfce99fe	554fd578a5ed78a10f371f5850c6a69aa83df15a	2025-10-15T13:54:15+02:00	Julius Tischbein	CUDA: Changing the CUDA scheduling strategy to spin (#16585)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	554fd578a5ed78a10f371f5850c6a69aa83df15a	fa882fd2b1bcb663de23af06fdc391489d05b007	2025-10-15T12:51:27+03:00	Georgi Gerganov	server : fix mtmd checkpoints (#16591)
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	fa882fd2b1bcb663de23af06fdc391489d05b007	ffa059034c1e41f3e58363ef3c46d2fcf854bc4d	2025-10-14T20:33:05+03:00	Georgi Gerganov	metal : avoid using Metal's gpuAddress property (#16576)
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	ffa059034c1e41f3e58363ef3c46d2fcf854bc4d	120bf7046d85a893f064c12abe58bfeebd735f84	2025-10-14T19:18:05+02:00	SavicStefan	vulkan: Add ACC_TYPE_VEC2 implementation (#16203)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp

commit	120bf7046d85a893f064c12abe58bfeebd735f84	4258e0cfe72c72ad2787be1e9f93253e89219455	2025-10-14T22:48:08+08:00	Aman Gupta	CUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	4258e0cfe72c72ad2787be1e9f93253e89219455	7ea15bb64c81e3813eb0babf9a57e1bc5697f569	2025-10-14T08:53:37-05:00	Jeff Bolz	vulkan: Support FA with K/V in F32 (#16543)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	7ea15bb64c81e3813eb0babf9a57e1bc5697f569	9c7185dd28416cf67f5e3b268381f311b5e3da56	2025-10-14T07:51:36-05:00	Jeff Bolz	vulkan: Improve build time for MSVC (#16545)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	9c7185dd28416cf67f5e3b268381f311b5e3da56	1ee9d0b415cdf5240418c110a18b419f4002b154	2025-10-14T14:22:47+02:00	Johannes Gäßler	CUDA: enable FA for FP32 KV cache (#16546)
M	ggml/src/ggml-cuda/fattn-vec.cuh
M	ggml/src/ggml-cuda/fattn.cu

commit	1ee9d0b415cdf5240418c110a18b419f4002b154	48e2fa9fb7c2de1e53808fdb65ec33f916020fc4	2025-10-14T19:16:21+08:00	Aman Gupta	CUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557)
M	ggml/src/ggml-cuda/mmvf.cu

commit	48e2fa9fb7c2de1e53808fdb65ec33f916020fc4	5b6913c47b6bc71a6f927805a45387d5657d8b89	2025-10-14T19:15:15+08:00	Aman Gupta	CUDA: add fp kernel for larger batch size MoE (#16512)
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmf.cuh
A	ggml/src/ggml-cuda/mmid.cu
A	ggml/src/ggml-cuda/mmid.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	tests/test-backend-ops.cpp

commit	5b6913c47b6bc71a6f927805a45387d5657d8b89	bc07349a7f87ba6eb31ed4b0ea9d9a7352185213	2025-10-14T09:53:49Z	Anav Prasad	cuda : remove legacy copy-op pointer indirection code (#16485)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/cpy.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	bc07349a7f87ba6eb31ed4b0ea9d9a7352185213	e60f241eacec42d3bd7c9edd37d236ebf35132a8	2025-10-14T08:48:50+03:00	Georgi Gerganov	server : dynamic token limit for prompt cache (#16560)
M	tools/server/server.cpp

commit	e60f241eacec42d3bd7c9edd37d236ebf35132a8	e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458	2025-10-13T23:07:57+03:00	Georgi Gerganov	metal : FA support F32 K and V and head size = 32 (#16531)
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	src/llama-graph.cpp
M	tests/test-backend-ops.cpp

commit	e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458	5016b7286240d29f8f640039989b84ea3a854344	2025-10-13T22:42:37+03:00	Georgi Gerganov	graph : support cacheless embeddings with FA and iSWA (#16528)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp
M	src/llama.cpp

commit	5016b7286240d29f8f640039989b84ea3a854344	7049736b2dd9011bf819e298b844ebbc4b5afdc9	2025-10-13T11:50:37-07:00	lhez	opencl: fix build targeting CL 2 (#16554)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	7049736b2dd9011bf819e298b844ebbc4b5afdc9	01d2bdc2bc61b676706830305b286b08b9885a41	2025-10-13T16:29:45+02:00	Johannes Gäßler	CUDA: fix numerical issues in tile FA kernel (#16540)
M	ggml/src/ggml-cuda/fattn-tile.cuh

commit	01d2bdc2bc61b676706830305b286b08b9885a41	56fc38b9655fbe1869d8bd6cfb269418196cea69	2025-10-13T20:48:47+08:00	Jie Fu (傅杰)	ggml : fix build broken with -march=armv9-a on MacOS (#16520)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	56fc38b9655fbe1869d8bd6cfb269418196cea69	1fb9504eb744969a990bfe4cfcf1d3d7a479541c	2025-10-13T17:01:24+08:00	Chenguang Li	CANN: fix CPU memory leak in CANN backend (#16549)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	1fb9504eb744969a990bfe4cfcf1d3d7a479541c	3f750f8d760ab5a61491e6a9409072dfeee4b4d7	2025-10-13T10:55:32+02:00	Pascal	fix: add remark plugin to render raw HTML as literal text (#16505)
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte
A	tools/server/webui/src/lib/constants/literal-html.ts
A	tools/server/webui/src/lib/markdown/literal-html.ts

commit	b67217078aa748b06e1b2269d88dd18c0aca2c26	98c8269abefdfa8fde47dfb2769ceebc8b704e86	2025-10-13T11:48:14+08:00	Yunzhe Jia	add different path for unified and seperate compilation
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	tools/mtmd/mtmd.h

commit	3f750f8d760ab5a61491e6a9409072dfeee4b4d7	c515fc577166042234241c6bd0da9b08dcbe2bb9	2025-10-13T16:25:02+08:00	Sam/Samuel	metal: add support for opt_step_sgd (#16539)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.metal

commit	c515fc577166042234241c6bd0da9b08dcbe2bb9	f9bc66c3ebcfddb5f09e4b21253623caeb8e414a	2025-10-13T11:22:27+03:00	Georgi Gerganov	ggml : fix scalar path for computing norm (#16558)
M	ggml/src/ggml-cpu/vec.cpp

commit	f9bc66c3ebcfddb5f09e4b21253623caeb8e414a	a31cf36ad946a13b3a646bf0dadf2a481e89f944	2025-10-13T08:52:22+08:00	hipudding	CANN: Update several operators to support FP16 data format (#16251)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	a31cf36ad946a13b3a646bf0dadf2a481e89f944	81d54bbfd599811b354c39f04550888168be7780	2025-10-13T02:43:14+08:00	Sam/Samuel	metal : add opt_step_adamw and op_sum (#16529)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.metal

commit	81d54bbfd599811b354c39f04550888168be7780	c7be9febcbafa9af7d1b9443f86475c59c9c5f87	2025-10-12T18:06:41+02:00	Pascal	webui: remove client-side context pre-check and rely on backend for limits (#16506)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreen.svelte
A	tools/server/webui/src/lib/components/app/dialogs/ChatErrorDialog.svelte
D	tools/server/webui/src/lib/components/app/dialogs/MaximumContextAlertDialog.svelte
M	tools/server/webui/src/lib/components/app/index.ts
M	tools/server/webui/src/lib/services/chat.ts
D	tools/server/webui/src/lib/services/context.ts
M	tools/server/webui/src/lib/services/index.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/lib/stores/server.svelte.ts
M	tools/server/webui/src/routes/+layout.svelte

commit	c7be9febcbafa9af7d1b9443f86475c59c9c5f87	8415f61e23d04427cd0d912fbb9d33b85f849456	2025-10-12T21:53:35+08:00	Neo Zhang Jianyu	[SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521)
M	docs/ops.md
M	docs/ops/SYCL.csv
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/binbcast.hpp
M	ggml/src/ggml-sycl/common.hpp
A	ggml/src/ggml-sycl/count-equal.cpp
A	ggml/src/ggml-sycl/count-equal.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/pad.cpp
A	ggml/src/ggml-sycl/pad.hpp

commit	8415f61e23d04427cd0d912fbb9d33b85f849456	2c301e91abb92d03c1a682b4b540ba835562a74b	2025-10-12T15:48:03+02:00	Mathieu Baudier	ci : add Vulkan on Ubuntu with default packages build (#16532)
M	.github/workflows/build.yml

commit	2c301e91abb92d03c1a682b4b540ba835562a74b	4b2dae383df708e2afc49c4859a81cd074f5ac10	2025-10-12T08:18:47-05:00	Aldehir Rojas	common : handle unicode during partial json parsing (#16526)
M	common/chat-parser.cpp
M	common/json-partial.cpp
M	tests/test-chat-parser.cpp
M	tests/test-json-partial.cpp

commit	4b2dae383df708e2afc49c4859a81cd074f5ac10	41aac5c69b5fb281bc1f486afb053f78101bb39e	2025-10-12T09:29:13+03:00	Georgi Gerganov	common : update presets (#16504)
M	common/arg.cpp
M	common/common.h

commit	41aac5c69b5fb281bc1f486afb053f78101bb39e	a2fba89a426ff8005d303c73f0436e7e67368b70	2025-10-12T00:25:37-05:00	sirus20x6	ggml : Fix FP16 ELU positive branch (#16519)
M	ggml/src/ggml-cpu/vec.h

commit	a2fba89a426ff8005d303c73f0436e7e67368b70	20cc625edc2264aae2779e71bef1593e6a4e8c43	2025-10-12T07:19:06+02:00	Daniel Bevenius	hparams : add check for layer index in is_recurrent (#16511)
M	src/llama-hparams.cpp

commit	20cc625edc2264aae2779e71bef1593e6a4e8c43	11f0af5504252e453d57406a935480c909e3ff37	2025-10-12T00:15:00-05:00	sirus20x6	ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518)
M	ggml/src/ggml-cpu/vec.h

commit	11f0af5504252e453d57406a935480c909e3ff37	a3cb04744fb5c591985f53b749fef5407d07a145	2025-10-11T20:54:32+02:00	Johannes Gäßler	CUDA: faster tile FA, add oob checks, more HSs (#16492)
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile.cu
M	ggml/src/ggml-cuda/fattn-tile.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq112-dv112.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq128-dv128.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq256-dv256.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq40-dv40.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq576-dv512.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq64-dv64.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq80-dv80.cu
A	ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq96-dv96.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-musa/CMakeLists.txt

commit	a3cb04744fb5c591985f53b749fef5407d07a145	4a8fbe0a5eb75f339782ebcf29c17848122184d3	2025-10-11T16:54:10+03:00	Georgi Gerganov	metal : fix mul-mm condition + fix mul-mv permuted kernels (#16494)
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal
M	src/llama-model.cpp

commit	4a8fbe0a5eb75f339782ebcf29c17848122184d3	31d0ff1869aa2ea31f4e96d5877d0343e9a2171b	2025-10-11T15:50:49+02:00	Pascal	feat: render user content as markdown option (#16358)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageUser.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/constants/settings-config.ts

commit	31d0ff1869aa2ea31f4e96d5877d0343e9a2171b	97870e64975b26c5e06a3540a8dc0ff601351e86	2025-10-11T21:39:04+08:00	Yann Follet	server / ranking : add sorting and management of top_n (#16403)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_rerank.py
M	tools/server/utils.hpp

commit	97870e64975b26c5e06a3540a8dc0ff601351e86	477a66b03501cf3bd067f8968b77ca4d053ff1bd	2025-10-11T04:02:26-07:00	Diego Devesa	cuda : avoid initializing unused devices (#16510)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	477a66b03501cf3bd067f8968b77ca4d053ff1bd	e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e	2025-10-11T11:33:41+03:00	amirai21	convert : correctly handle LLaMA tokenizer for Jamba (#16470)
M	convert_hf_to_gguf.py

commit	e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e	81086cd6a3ca1252f0dc0f938171648399179c53	2025-10-10T22:15:05+03:00	Georgi Gerganov	server : fix division by zero when reporting stats (#16501)
M	tools/server/server.cpp

commit	81086cd6a3ca1252f0dc0f938171648399179c53	68ee98ae181a5c83a5cc6261daeee69a1f588c15	2025-10-10T17:17:31+03:00	Georgi Gerganov	vocab : mark EOT token for Granite models (#16499)
M	src/llama-sampling.cpp
M	src/llama-vocab.cpp

commit	68ee98ae181a5c83a5cc6261daeee69a1f588c15	cdb6da468cc33323955a523738d2e1675aeb5e9a	2025-10-10T17:11:07+03:00	Radoslav Gerganov	server : return HTTP 400 if prompt exceeds context length (#16486)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/utils.py

commit	cdb6da468cc33323955a523738d2e1675aeb5e9a	6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e	2025-10-10T13:22:27+03:00	Radoslav Gerganov	server : log requests to /v1/completions (#16495)
M	tools/server/server.cpp

commit	6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e	1faa13a1187051af66b0fd9f0d6effe4c77f0b3e	2025-10-10T13:45:46+05:30	Prajwal B Mehendarkar	cmake : Dont define XOPENSOURCE on AIX (#16481)
M	ggml/src/CMakeLists.txt

commit	1faa13a1187051af66b0fd9f0d6effe4c77f0b3e	1deee0f8d494981c32597dca8b5f8696d399b0f2	2025-10-09T22:54:57+02:00	Pascal	webui: updated the chat service to only include max_tokens in the req… (#16489)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/services/chat.ts

commit	1deee0f8d494981c32597dca8b5f8696d399b0f2	d00cbea63c671cd85a57adaa50abf60b3b87d86f	2025-10-09T22:11:15+03:00	duduta	cpu : optimize the ggml NORM operation (#15953)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	d00cbea63c671cd85a57adaa50abf60b3b87d86f	8328fd4bae76fc027f8ca0e9a05acd3788dabe3f	2025-10-09T18:54:51+03:00	Georgi Gerganov	server : host-memory prompt caching (#16391)
M	common/arg.cpp
M	common/chat.h
M	common/common.h
M	src/llama-kv-cache.cpp
M	tools/server/server.cpp
M	tools/server/tests/unit/test_basic.py
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/unit/test_completion.py
M	tools/server/tests/unit/test_ctx_shift.py
M	tools/server/utils.hpp

commit	8328fd4bae76fc027f8ca0e9a05acd3788dabe3f	56b4795842d852152222ca7a2d4304008facf1b9	2025-10-09T17:36:29+02:00	Pascal	No markdown in cot (#16483)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageThinkingBlock.svelte

commit	56b4795842d852152222ca7a2d4304008facf1b9	2c0d875ae6c6043fbbafd2831e160955e9ca6af1	2025-10-09T14:35:22+02:00	Daniel Bevenius	model-conversion : add support for SentenceTransformers (#16387)
M	examples/model-conversion/Makefile
M	examples/model-conversion/README.md
M	examples/model-conversion/logits.cpp
M	examples/model-conversion/requirements.txt
M	examples/model-conversion/scripts/embedding/convert-model.sh
M	examples/model-conversion/scripts/embedding/run-converted-model.sh
M	examples/model-conversion/scripts/embedding/run-original-model.py
M	examples/model-conversion/scripts/utils/semantic_check.py
M	requirements/requirements-all.txt

commit	2c0d875ae6c6043fbbafd2831e160955e9ca6af1	aa4711d369b0d4adb6802b98ad6ea362f838710e	2025-10-09T09:13:18+01:00	sudhiarm	ci: add ARM64 Kleidiai build and test support (#16462)
M	.github/workflows/build.yml
M	ci/run.sh

commit	aa4711d369b0d4adb6802b98ad6ea362f838710e	d80d6d2400b8faa80654c723cb5bdf9fc8f4db06	2025-10-09T15:50:25+08:00	Chenguang Li	CANN: Improve ACL graph matching (#16166)
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	d80d6d2400b8faa80654c723cb5bdf9fc8f4db06	b2602137557b2b28a39e03612717d85ead9a6f5a	2025-10-09T09:29:17+02:00	Charles Xu	kleidiai: kernel interface refactoring (#16460)
M	ggml/src/ggml-cpu/kleidiai/kernels.cpp
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	b2602137557b2b28a39e03612717d85ead9a6f5a	e08db4259521de493b7aeb49dadf29ebd1ee966a	2025-10-09T15:25:11+08:00	Neo Zhang Jianyu	[SYCL] refactor soft_max, add soft_max_back (#16472)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/softmax.hpp

commit	e08db4259521de493b7aeb49dadf29ebd1ee966a	12bbc3fa50b6df03318a4451c9a2210200a0b28d	2025-10-09T08:39:18+02:00	Saba Fallah	model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	12bbc3fa50b6df03318a4451c9a2210200a0b28d	9d0882840e6c3fb62965d03af0e22880ea90e012	2025-10-08T22:18:41+02:00	Pascal	refactor: centralize CoT parsing in backend for streaming mode (#16394)
M	common/arg.cpp
M	common/chat-parser.cpp
M	common/chat.cpp
M	common/common.h
M	tests/test-chat-parser.cpp
M	tools/server/README.md
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessage.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/constants/settings-config.ts
M	tools/server/webui/src/lib/services/chat.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
D	tools/server/webui/src/lib/utils/thinking.ts
M	tools/server/webui/src/stories/ChatMessage.stories.svelte

commit	9d0882840e6c3fb62965d03af0e22880ea90e012	d2ee056e1df0fdf646270fb5621e9f92084b59a7	2025-10-08T20:21:46+02:00	ai-fonsi	Disable CUDA host buffers on integrated GPUs (#16308)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	d2ee056e1df0fdf646270fb5621e9f92084b59a7	b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e	2025-10-08T17:20:18+09:00	issixx	server : fix cancel pending task (#16467)
M	tools/server/server.cpp

commit	b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e	7fdd16b432d247121fe5fe7b21f8805f85266c85	2025-10-08T10:57:53+03:00	Georgi Gerganov	metal : mark FA blocks (#16372)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	7fdd16b432d247121fe5fe7b21f8805f85266c85	74b8fc17f92ada295a648e3c5eb28f46bca7d892	2025-10-08T10:57:29+03:00	Georgi Gerganov	server : improve context checkpoint logic (#16440)
M	src/llama-memory-recurrent.cpp
M	tools/server/server.cpp

commit	74b8fc17f92ada295a648e3c5eb28f46bca7d892	aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e	2025-10-07T13:48:56-07:00	Reese Levine	ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
M	.github/workflows/build.yml
M	CODEOWNERS
M	ggml/CMakeLists.txt
M	ggml/src/ggml-webgpu/CMakeLists.txt
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-webgpu/wgsl-shaders/mul_mat.tmpl.wgsl

commit	aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e	df1b612e29ba97a2e67db339b1e8c7465702b7e8	2025-10-07T20:03:35+02:00	Tarek Dakhran	llama : support LiquidAI LFM2-MoE hybrid model (#16464)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	df1b612e29ba97a2e67db339b1e8c7465702b7e8	4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5	2025-10-07T15:57:14+03:00	Georgi Gerganov	server : add `/v1/health` endpoint (#16461)
M	tools/server/README.md
M	tools/server/server.cpp

commit	4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5	ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2	2025-10-07T11:11:08+02:00	Sascha Rogmann	webui : added download action (#13552) (#16282)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarActions.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarConversationItem.svelte
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/lib/stores/database.ts
M	tools/server/webui/src/lib/types/database.d.ts

commit	ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2	c61ae20d05bd4fdd8551311325a2845336449426	2025-10-07T10:32:32+03:00	Georgi Gerganov	presets : fix pooling param for embedding models (#16455)
M	common/arg.cpp

commit	c61ae20d05bd4fdd8551311325a2845336449426	0123ff38f53d34752f29239a29d0e40a6dc4110f	2025-10-07T09:59:13+03:00	Radoslav Gerganov	rpc : update documentation (#16441)
M	tools/rpc/README.md

commit	0123ff38f53d34752f29239a29d0e40a6dc4110f	0a319bb75ed29d968e2a9b544011b09ccb932915	2025-10-07T08:24:17+03:00	Georgi Gerganov	memory : use sequential equal splits for recurrent modules (#16442)
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-recurrent.cpp

commit	0a319bb75ed29d968e2a9b544011b09ccb932915	1d6092fc72f4d10f4486ac95edfd414bc08b62b8	2025-10-07T08:23:30+03:00	Georgi Gerganov	metal : add support for non-padded FA KV (#16148)
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.cpp
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	1d6092fc72f4d10f4486ac95edfd414bc08b62b8	8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f	2025-10-07T08:22:35+03:00	Georgi Gerganov	tests : add -INF blocks to the KQ mask in the FA tests (#16380)
M	ggml/src/ggml-cpu/ops.cpp
M	tests/test-backend-ops.cpp

commit	8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f	3df2244df40c67dfd6ad548b40ccc507a066af2b	2025-10-07T08:21:40+03:00	Georgi Gerganov	metal : various optimizations + refactoring (#16446)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	3df2244df40c67dfd6ad548b40ccc507a066af2b	c08002a1988348403a5fd59b1fa3de3a10a6f92f	2025-10-06T12:55:53-05:00	Gadflyii	llama : add --no-host to disable host buffers (#16310)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	include/llama.h
M	src/llama-model.cpp
M	tools/llama-bench/llama-bench.cpp

commit	c08002a1988348403a5fd59b1fa3de3a10a6f92f	3a002afafa8e06555f11aed88b02d055d8a166f3	2025-10-06T10:59:40-06:00	Gabe Goodhart	chat : Granite Docling stopping (#16438)
M	src/llama-chat.cpp
M	tests/test-chat-template.cpp
M	tools/mtmd/mtmd.cpp

commit	3a002afafa8e06555f11aed88b02d055d8a166f3	a23b9bdbd3b64ce172f9962249f432d01aea7437	2025-10-06T17:40:21+02:00	Sigbjørn Skjæret	ci : refactor sdk caching to minimize storage (#16414)
A	.github/actions/install-exe/action.yml
A	.github/actions/linux-setup-spacemit/action.yml
A	.github/actions/linux-setup-vulkan/action.yml
A	.github/actions/unarchive-tar/action.yml
A	.github/actions/windows-setup-rocm/action.yml
A	.github/workflows/build-cache.yml
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml
M	CODEOWNERS

commit	a23b9bdbd3b64ce172f9962249f432d01aea7437	04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9	2025-10-06T16:05:27+03:00	Georgi Gerganov	ggml : fix unaligned access in AMX code (#16315)
M	ggml/src/ggml-cpu/amx/amx.cpp

commit	04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9	a80ff183abe4e5a76316257ffa597da41b3b6fa0	2025-10-06T14:56:59+02:00	Daniel Bevenius	ci : remove missing reranker model files (#16444)
M	ci/run.sh

commit	a80ff183abe4e5a76316257ffa597da41b3b6fa0	1d49ca37594fb49db6aa9518ba7c512e5ccd0108	2025-10-06T14:17:12+02:00	Daniel Bevenius	ggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443)
M	ggml/src/ggml-cpu/vec.h

commit	1d49ca37594fb49db6aa9518ba7c512e5ccd0108	c5fef0fcea3b978a2318b1af170209ecec7c37b4	2025-10-06T09:29:56Z	Yuannan	nix : removed metal for nix (#16118)
M	.devops/nix/package.nix

commit	c5fef0fcea3b978a2318b1af170209ecec7c37b4	ca71fb9b368e3db96e028f80c4c9df6b6b370edd	2025-10-06T03:53:31-04:00	Oleksandr Kuvshynov	server: update readme to mention n_past_max metric (#16436)
M	tools/server/README.md

commit	ca71fb9b368e3db96e028f80c4c9df6b6b370edd	35266573b968e1c947b367782fb4b3eddbb4f3c0	2025-10-05T06:57:47-06:00	Gabe Goodhart	model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/tests.sh

commit	35266573b968e1c947b367782fb4b3eddbb4f3c0	86df2c9ae4f2f1ee63d2558a9dc797b98524639b	2025-10-04T20:59:31-07:00	Reese Levine	ggml webgpu: actually add softmax, fix rms_norm offset (#16400)
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm.wgsl
M	ggml/src/ggml-webgpu/wgsl-shaders/soft_max.tmpl.wgsl

commit	86df2c9ae4f2f1ee63d2558a9dc797b98524639b	f39283960b58a92ecc0c72567711318b20e22b55	2025-10-04T20:04:27Z	Eve	vulkan: use a more appropriate amount of threads when generating shaders (#16418)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	f39283960b58a92ecc0c72567711318b20e22b55	898acba6816ad23b6a9491347d30e7570bffadfd	2025-10-04T16:22:45+03:00	Radoslav Gerganov	rpc : check src buffer when copying tensor (#16421)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	898acba6816ad23b6a9491347d30e7570bffadfd	e29acf74fea996014380d59d31aa504ae8964258	2025-10-04T12:49:16+03:00	Radoslav Gerganov	rpc : add support for multiple devices (#16276)
M	common/arg.cpp
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/rpc/rpc-server.cpp

commit	e29acf74fea996014380d59d31aa504ae8964258	128d522c04286e019666bd6ee4d18e3fbf8772e2	2025-10-04T11:42:56+02:00	Acly	vulkan : incremental shader builds (#16341)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/acc.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/add.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/add_id.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/argmax.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/argsort.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/clamp.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/concat.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/contig_copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_dw.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv_transpose_1d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/cos.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/count_equal.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_f32.comp
R099	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.glsl
R099	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.glsl
R091	ggml/src/ggml-vulkan/vulkan-shaders/dequant_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_head.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq1_m.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq1_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_xs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_nl.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_xs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_mxfp4.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_0.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_0.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q6_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q8_0.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/diag_mask_inf.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/div.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/exp.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/test_bfloat16_support.comp	ggml/src/ggml-vulkan/vulkan-shaders/feature-tests/bfloat16.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/test_coopmat_support.comp	ggml/src/ggml-vulkan/vulkan-shaders/feature-tests/coopmat.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/test_coopmat2_support.comp	ggml/src/ggml-vulkan/vulkan-shaders/feature-tests/coopmat2.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/test_integer_dot_support.comp	ggml/src/ggml-vulkan/vulkan-shaders/feature-tests/integer_dot.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/geglu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/geglu_erf.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/geglu_quick.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/gelu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/gelu_erf.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/gelu_quick.comp
R097	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.glsl
R100	ggml/src/ggml-vulkan/vulkan-shaders/generic_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_head.glsl
R100	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
R095	ggml/src/ggml-vulkan/vulkan-shaders/glu_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/glu_head.glsl
R100	ggml/src/ggml-vulkan/vulkan-shaders/glu_main.comp	ggml/src/ggml-vulkan/vulkan-shaders/glu_main.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/group_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/hardsigmoid.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/hardswish.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col_3d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/l2_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/leaky_relu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
R099	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq1_m.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq1_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_xs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq3_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq3_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vecq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
R099	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/multi_add.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/opt_step_adamw.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/opt_step_sgd.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/pad.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/pool2d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/quantize_q8_1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/reglu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/relu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/repeat.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/repeat_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm_partials.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/roll.comp
R097	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_multi.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_neox.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_vision.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/rte.comp	ggml/src/ggml-vulkan/vulkan-shaders/rte.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/scale.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sigmoid.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/silu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/silu_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sin.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sqrt.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/square.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sub.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sum_rows.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/swiglu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/swiglu_oai.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/tanh.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/timestep_embedding.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/types.comp	ggml/src/ggml-vulkan/vulkan-shaders/types.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp
R100	ggml/src/ggml-vulkan/vulkan-shaders/utils.comp	ggml/src/ggml-vulkan/vulkan-shaders/utils.glsl
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	128d522c04286e019666bd6ee4d18e3fbf8772e2	f6dcda390004b627ef30af378d0c01ad2519289e	2025-10-03T20:51:48+02:00	Pascal	chat : support Magistral thinking (#16413)
M	common/chat.cpp
M	common/chat.h
M	tests/test-chat.cpp

commit	f6dcda390004b627ef30af378d0c01ad2519289e	606a73f53175077429484b23dcf799f69a31d0bd	2025-10-03T13:34:51-05:00	ddh0	server : context checkpointing for hybrid and recurrent models (#16382)
M	common/arg.cpp
M	common/common.h
M	include/llama.h
M	src/llama-kv-cache-iswa.cpp
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-recurrent.cpp
M	src/llama-model.cpp
M	tools/server/server.cpp

commit	606a73f53175077429484b23dcf799f69a31d0bd	946f71ed9ade07e319859b5ce656144140e066fb	2025-10-03T19:18:56+03:00	Georgi Gerganov	metal : fix loop bound in ggml_mem_ranges (#16412)
M	ggml/src/ggml-metal/ggml-metal-common.cpp

commit	946f71ed9ade07e319859b5ce656144140e066fb	638d330246954e88dffc22ce01fec15e6894e544	2025-10-03T14:40:25+02:00	Sigbjørn Skjæret	llama : fix shapes for bert/mpt q/k norm (#16409)
M	src/llama-model.cpp

commit	638d330246954e88dffc22ce01fec15e6894e544	84c8e305e8010a1a3d43bdd0a25f737ac67809a4	2025-10-03T13:49:08+02:00	Acly	ggml : fix graph reallocation with multiple chunks (#16396)
M	ggml/src/ggml-alloc.c
M	tests/test-alloc.cpp

commit	84c8e305e8010a1a3d43bdd0a25f737ac67809a4	2aaf0a2a2056d75d0dd53ab8a181473760e6ab22	2025-10-03T12:51:40+02:00	Aleksander Grygier	Fix missing messages on sibling navigation (#16408)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/stores/chat.svelte.ts

commit	2aaf0a2a2056d75d0dd53ab8a181473760e6ab22	0e1f83855609d73beaf05d818640b6cfd39d287b	2025-10-03T05:50:46-05:00	Jeff Bolz	vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	0e1f83855609d73beaf05d818640b6cfd39d287b	ad126479c25cf983a0f994a08ba0911cf49ed62b	2025-10-03T04:52:46-05:00	Jeff Bolz	vulkan: Fix FA coopmat1 invalid array indexing (#16365)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp

commit	ad126479c25cf983a0f994a08ba0911cf49ed62b	77233277c912d495d1069543ca540c21a2f9e5b4	2025-10-03T11:45:16+02:00	Daniel Bevenius	ci : change macos-13 to macos-15-intel (#16401)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	77233277c912d495d1069543ca540c21a2f9e5b4	e308efda8e54e3f07578937a45a5d83624eb7970	2025-10-03T11:30:39+02:00	Aleksander Grygier	Capture model name only after first token (streaming) or completed request (#16405)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/stores/chat.svelte.ts

commit	e308efda8e54e3f07578937a45a5d83624eb7970	136bda78c5679b266362b39c58338fff46fd2592	2025-10-03T03:33:08-05:00	Jeff Bolz	vulkan: in flash attention, bounds check against nem1 (don't rely on GGML_KQ_MASK_PAD) (#16316)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	136bda78c5679b266362b39c58338fff46fd2592	5113efd34ceda709292de26c72716c49e024fb32	2025-10-03T09:11:34+02:00	Aleksander Grygier	webui : Fix messages payload sent to chat completions (#16402)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/stores/chat.svelte.ts

commit	5113efd34ceda709292de26c72716c49e024fb32	d64c8104f090b27b1f99e8da5995ffcfa6b726e2	2025-10-03T08:01:31+02:00	Pascal	fix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356)
M	tools/server/webui/src/routes/+layout.svelte

commit	d64c8104f090b27b1f99e8da5995ffcfa6b726e2	ef07a4090672a3438d7f64f197795d7dc1c18957	2025-10-02T20:10:12+02:00	Sigbjørn Skjæret	test-barrier : do not use more threads than physically available (#16389)
M	tests/test-barrier.cpp

commit	ef07a4090672a3438d7f64f197795d7dc1c18957	34fcc5a4ace8c69476ef2ea3857f39a60334acc4	2025-10-02T11:00:31-07:00	Reese Levine	ggml webgpu: add support for soft_max, optimize rms_norm (#16357)
M	ggml/include/ggml.h
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/soft_max.tmpl.wgsl
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	34fcc5a4ace8c69476ef2ea3857f39a60334acc4	91a2a5655658bb9ab77894716b82fae7ecb4b4d1	2025-10-02T19:43:22+02:00	Piotr Wilkin (ilintar)	model : Apertus model implementation (#15852)
M	common/chat-parser.cpp
M	common/chat-parser.h
M	common/chat.cpp
M	common/chat.h
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/unary-ops.cpp
M	ggml/src/ggml-cpu/unary-ops.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
A	models/templates/Apertus-8B-Instruct.jinja
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.h
M	src/llama-model-loader.cpp
M	src/llama-model.cpp
M	src/llama-model.h
M	tests/test-chat.cpp
M	tools/tts/convert_pt_to_hf.py

commit	91a2a5655658bb9ab77894716b82fae7ecb4b4d1	72ee736c447be4ededb51ab97904b4d33c90c261	2025-10-02T21:29:56+08:00	R0CKSTAR	musa: update compile flags (#16265)
M	ggml/src/ggml-cuda/fattn-vec.cuh
M	ggml/src/ggml-cuda/topk-moe.cu
M	ggml/src/ggml-musa/CMakeLists.txt

commit	72ee736c447be4ededb51ab97904b4d33c90c261	f09aefaa84d7f4d5df3f400f67944b94fef5b795	2025-10-02T13:51:36+02:00	Sigbjørn Skjæret	ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388)
M	.github/workflows/build.yml

commit	f09aefaa84d7f4d5df3f400f67944b94fef5b795	bbd32bc0384fbfcf07369617de58856b1e0e95a3	2025-10-02T08:10:07Z	Eve	ci: update vulkan ci (#16294)
M	.github/workflows/build.yml

commit	bbd32bc0384fbfcf07369617de58856b1e0e95a3	2be72c2b121ee99f33927149265ce6073ade9e59	2025-10-02T10:35:43+03:00	Georgi Gerganov	ci : fix clean-up of old logs (#16381)
M	ci/run.sh

commit	2be72c2b121ee99f33927149265ce6073ade9e59	95ce0985449c52fb9d6849b95563f7cf933ea0e3	2025-10-02T15:16:25+08:00	Neo Zhang Jianyu	SYCL: Update to oneAPI 2025.2 (#16371)
M	.devops/intel.Dockerfile
M	.github/workflows/build.yml
M	.github/workflows/release.yml
M	docs/backend/SYCL.md

commit	95ce0985449c52fb9d6849b95563f7cf933ea0e3	c8dedc9999eccf7821a9fe5b29f10e8d075e2217	2025-10-02T05:52:59+02:00	uvos	HIP: add IMbackK to codeowner (#16375)
M	CODEOWNERS

commit	c8dedc9999eccf7821a9fe5b29f10e8d075e2217	e95fec640f43623911a2cd5bda8b19b1898c530c	2025-10-01T23:32:39+02:00	uvos	CI: reenable cdna in rocm docker builds (#16376)
M	.devops/rocm.Dockerfile

commit	e95fec640f43623911a2cd5bda8b19b1898c530c	ded67b94446ef4f7fd988dbde7a12deef9870c13	2025-10-01T23:09:25+02:00	uvos	HIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-tile.cu
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-hip/CMakeLists.txt

commit	ded67b94446ef4f7fd988dbde7a12deef9870c13	1fe4e38cc20af058ed320bd46cac934991190056	2025-10-02T06:08:15+09:00	Shunta Saito	llama : parameter conversion and loading fixes for PLaMo2 variants (#16075)
M	convert_hf_to_gguf.py
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	1fe4e38cc20af058ed320bd46cac934991190056	4201deae9c2ae4732db8957b6ce0808d02ec597c	2025-10-01T20:18:03+02:00	uvos	ci: Properly install rocwmma for hip builds (#16305)
M	.devops/rocm.Dockerfile
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	4201deae9c2ae4732db8957b6ce0808d02ec597c	764799279f801c696503bacca490b4358587d94c	2025-10-01T19:22:18+02:00	Adrien Gallouët	common: introduce http.h for httplib-based client (#16373)
M	CODEOWNERS
M	common/CMakeLists.txt
M	common/arg.cpp
A	common/http.h
M	tools/run/run.cpp

commit	764799279f801c696503bacca490b4358587d94c	2a9b63383a448ec18c754dfdc6e95cb853940a52	2025-10-01T18:18:10+02:00	Aleksander Grygier	Conversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebar.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarConversationItem.svelte
M	tools/server/webui/src/routes/+layout.svelte

commit	2a9b63383a448ec18c754dfdc6e95cb853940a52	1104ca1a1c926b832274694a2773a17066982ad0	2025-10-01T15:54:42+02:00	Aleksander Grygier	Improve code block color theming (#16325)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/app.css
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte

commit	1104ca1a1c926b832274694a2773a17066982ad0	4f1575921cac9b489fe8f8bbf20aff985e7da45e	2025-10-01T14:09:52+02:00	Sigbjørn Skjæret	ci : use registry cache for docker builds (#16366)
M	.github/workflows/docker.yml

commit	4f1575921cac9b489fe8f8bbf20aff985e7da45e	132d673554e65282e92505f4f77401ab971528bb	2025-10-01T12:08:16+02:00	Aleksander Grygier	Add optional setting for showing "Model used:" information (#16337)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/components/app/misc/ActionButton.svelte
M	tools/server/webui/src/lib/constants/settings-config.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/lib/types/database.d.ts

commit	132d673554e65282e92505f4f77401ab971528bb	aa9538a63aef35f0224b2502f13b19d650a8ce04	2025-10-01T07:56:36Z	Eve	vulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	aa9538a63aef35f0224b2502f13b19d650a8ce04	e74c92e84236b2bab3f3c77bee4ead94928be360	2025-10-01T07:40:26+02:00	Aleksander Grygier	webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363)
M	tools/server/webui/scripts/dev.sh

commit	e74c92e84236b2bab3f3c77bee4ead94928be360	b2ba81dbe07b6dbea9c96b13346c66973dede32c	2025-09-30T16:24:36-04:00	Bartowski	model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
M	src/llama-model.cpp

commit	b2ba81dbe07b6dbea9c96b13346c66973dede32c	bf6f3b3a1965d70e07ca94aab7b01268fe483e96	2025-09-30T21:41:42+02:00	Sigbjørn Skjæret	ci : fix ccache key for ubuntu-cpu-cmake (#16355)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	bf6f3b3a1965d70e07ca94aab7b01268fe483e96	7c156df4148eb524b22f7f363bfd2df00f264e0b	2025-09-30T19:52:41+02:00	Adrien Gallouët	common : disable progress bar without a tty (#16352)
M	common/arg.cpp

commit	7c156df4148eb524b22f7f363bfd2df00f264e0b	16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5	2025-09-30T10:45:45-07:00	lhez	opencl: support pad_ext (#15888)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/pad.cl

commit	16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5	8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed	2025-09-30T19:18:54+02:00	Pascal	Chatapi ignore empty sampling (#16330)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/stores/chat.svelte.ts

commit	8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed	d1c84a662daa91be975863913a59975b11458141	2025-09-30T09:57:51-07:00	Reese Levine	ggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187)
M	ggml/include/ggml.h
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
D	ggml/src/ggml-webgpu/wgsl-shaders/add.tmpl.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/add_in_place.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/bin_op.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/cpy.tmpl.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/cpy.wgsl
M	ggml/src/ggml-webgpu/wgsl-shaders/embed_wgsl.py
M	ggml/src/ggml-webgpu/wgsl-shaders/get_rows.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/glu.tmpl.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/mul.tmpl.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/mul_in_place.tmpl.wgsl
M	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm_in_place.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/rope.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/scale.tmpl.wgsl
M	tests/test-backend-ops.cpp

commit	d1c84a662daa91be975863913a59975b11458141	364a7a6d4a786e98947c8a90430ea581213c0ba9	2025-09-30T09:55:13-07:00	lhez	opencl: support ne3 in get_rows (#15866)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/get_rows.cl

commit	364a7a6d4a786e98947c8a90430ea581213c0ba9	2df5bcf357dba0c49b4df1d684b2ffc9e88b7054	2025-09-30T16:39:44+02:00	Adrien Gallouët	common : remove common_has_curl() (#16351)
M	common/arg.cpp
M	common/arg.h
M	tests/test-arg-parser.cpp

commit	2df5bcf357dba0c49b4df1d684b2ffc9e88b7054	075c01567bb7e93965ae60b7e119182c3e68f3e9	2025-09-30T15:38:01+02:00	Sigbjørn Skjæret	ci : disable ccache for android (#16348)
M	.github/workflows/build.yml

commit	075c01567bb7e93965ae60b7e119182c3e68f3e9	a014310374a16f9204f2bcc1b458fc1eda67e469	2025-09-30T13:42:39+03:00	Georgi Gerganov	ggml : bump version to 0.9.4 (ggml/1363)
M	ggml/CMakeLists.txt
M	scripts/sync-ggml.last

commit	98c8269abefdfa8fde47dfb2769ceebc8b704e86	2790ecc304e384d9075c55d0628d8bf440025dc4	2025-09-30T17:42:57+08:00	Yunzhe Jia	server: adapt to calrt
M	tools/server/CMakeLists.txt
M	tools/server/server.cpp
A	tools/server/server.h
A	tools/server/server_main.cpp
M	tools/server/utils.hpp

commit	2790ecc304e384d9075c55d0628d8bf440025dc4	f528e97d894b4d93934a0711a00253eea980e799	2025-09-30T17:37:58+08:00	Yunzhe Jia	adapt to calrt
M	src/llama-calrt.cpp
M	src/llama-calrt.h

commit	f528e97d894b4d93934a0711a00253eea980e799	dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842	2025-09-11T14:13:35+08:00	Yunzhe Jia	add calrt mtmd support
M	common/arg.cpp
M	common/common.h
M	include/llama.h
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	src/llama-context.cpp
M	src/llama-kv-cache-calrt-adapter.cpp
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd-helper.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h

commit	a014310374a16f9204f2bcc1b458fc1eda67e469	35fb82497ec6c5904b0adb7e1c881a76c1c692db	2025-09-30T08:13:22Z	anavp-nvidia	cuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328)
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	src/llama-model.cpp

commit	35fb82497ec6c5904b0adb7e1c881a76c1c692db	3c62aed89fbe3e15f6f82035e805a0a1add26306	2025-09-30T11:03:23+03:00	Georgi Gerganov	metal : dynamic simdgroups for MV kernels (#16340)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	3c62aed89fbe3e15f6f82035e805a0a1add26306	f1eb1cb1eba042b2d583234e80f65e2e225d8995	2025-09-30T09:36:33+02:00	Adrien Gallouët	common : simplify etag tracking by removing json (#16342)
M	common/arg.cpp

commit	f1eb1cb1eba042b2d583234e80f65e2e225d8995	de41f2b7bffab7582944b213ce12b605f8cf6e0f	2025-09-30T09:07:20+02:00	Charles Xu	kleidiai : fix work size and threads sync for fp16 (#16246)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	de41f2b7bffab7582944b213ce12b605f8cf6e0f	a74a0d69f34f52fa10d4f0a7ce749fb3490d0774	2025-09-29T22:30:16-07:00	lhez	codeowners: add codeowners for opencl backend (#16344)
M	CODEOWNERS

commit	a74a0d69f34f52fa10d4f0a7ce749fb3490d0774	5f7e166cbf7b9ca928c7fad990098ef32358ac75	2025-09-29T19:26:34-05:00	Jeff Bolz	tests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295)
M	tests/test-backend-ops.cpp

commit	5f7e166cbf7b9ca928c7fad990098ef32358ac75	d72f5f7ba260b546190338b0b76f2f152581424f	2025-09-29T18:49:47+02:00	Pascal	Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/utils/thinking.ts
M	tools/server/webui/src/stories/ChatMessage.stories.svelte

commit	d72f5f7ba260b546190338b0b76f2f152581424f	b77e6c18e1a6fac5705ed95f03af5436d67484c1	2025-09-29T17:51:48+03:00	Georgi Gerganov	ci : add AMD runners and workflows (#16249)
A	.github/workflows/build-amd.yml
M	.github/workflows/build.yml
M	ci/run.sh

commit	b77e6c18e1a6fac5705ed95f03af5436d67484c1	2ddd3f2356c313385fafc19a9f0ce678c8fe03ee	2025-09-29T22:50:44+08:00	alex-spacemit	ggml: riscv: add riscv spacemit backend (#15288)
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build-riscv-native.yml
M	CODEOWNERS
A	cmake/riscv64-spacemit-linux-gnu-gcc.cmake
A	docs/build-riscv64-spacemit.md
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu.cpp
A	ggml/src/ggml-cpu/spacemit/ime.cpp
A	ggml/src/ggml-cpu/spacemit/ime.h
A	ggml/src/ggml-cpu/spacemit/ime1_kernels.cpp
A	ggml/src/ggml-cpu/spacemit/ime_kernels.h

commit	2ddd3f2356c313385fafc19a9f0ce678c8fe03ee	4d3d455d3c8719eb8f206de328d1b9ba191efd7c	2025-09-29T16:50:52+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	4d3d455d3c8719eb8f206de328d1b9ba191efd7c	c9b1c06467aca8d30fafcab51292bcb285df5b0d	2025-09-29T16:49:11+03:00	Georgi Gerganov	sync : whisper.cpp (ggml/1359)
M	ggml/src/ggml-blas/CMakeLists.txt

commit	c9b1c06467aca8d30fafcab51292bcb285df5b0d	b6ae75afb49b23db3dfbc2b01e8aabfb047e6880	2025-09-26T17:34:42+02:00	Daniel Bevenius	ggml : remove -dev suffix from release version (ggml/1355)
M	ggml/CMakeLists.txt

commit	b6ae75afb49b23db3dfbc2b01e8aabfb047e6880	b6dff20e2fe352093039e2359370c6bb2b505e0b	2025-09-25T14:39:05+02:00	Daniel Bevenius	ggml : bump version to 0.9.3 (ggml/1353)
M	ggml/CMakeLists.txt

commit	b6dff20e2fe352093039e2359370c6bb2b505e0b	2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d	2025-09-20T16:44:23+03:00	Georgi Gerganov	ggml : prepare for development of 0.9.2-dev
M	ggml/CMakeLists.txt

commit	2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d	02463ab27b1379ff5e3d936ce8b3bfd356872ea6	2025-09-20T16:44:23+03:00	Georgi Gerganov	ggml : bump version to 0.9.1
M	ggml/CMakeLists.txt

commit	02463ab27b1379ff5e3d936ce8b3bfd356872ea6	adc76347d73b3d915e946efa5de8d0ad9f3904c2	2025-09-29T13:17:09+02:00	Rafal Lewczuk	ggml-backend : add root cause in error message if loading backend library fails (#16172)
M	ggml/src/ggml-backend-reg.cpp

commit	adc76347d73b3d915e946efa5de8d0ad9f3904c2	3a2bdcda0b31e51db954551e0cd49424133a84f3	2025-09-29T11:09:00+02:00	Sigbjørn Skjæret	ggml : check cuda and metal argsort limits and add test (#16323)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal-device.m
M	tests/test-backend-ops.cpp

commit	3a2bdcda0b31e51db954551e0cd49424133a84f3	66bb7985c3fcefda7a74aae9f8321f70eb1646c4	2025-09-29T10:37:20+02:00	Aleksander Grygier	Improve Mobile UI for dialogs and action dropdowns (#16222)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/app.css
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFields.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFooter.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebar.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarConversationItem.svelte
M	tools/server/webui/src/lib/components/app/misc/ActionDropdown.svelte
M	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-content.svelte
M	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-footer.svelte
M	tools/server/webui/src/lib/components/ui/dialog/dialog-content.svelte
M	tools/server/webui/src/lib/components/ui/select/select-content.svelte

commit	66bb7985c3fcefda7a74aae9f8321f70eb1646c4	2f61c0f5bf8a620ca4c3872408803ab38cfb9613	2025-09-29T09:08:41+02:00	Pascal	fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFields.svelte

commit	2f61c0f5bf8a620ca4c3872408803ab38cfb9613	3ffd0fae473c954bb3e67526b31262048fb508d4	2025-09-29T12:33:12+05:30	Vinkal	llama-cli: prevent spurious assistant token (#16202)
M	tools/main/main.cpp

commit	3ffd0fae473c954bb3e67526b31262048fb508d4	a4a0aa5ea2a88e4858996199fefd5439f17b481c	2025-09-29T01:30:45-05:00	ddh0	perplexity : show more kl-divergence data (#16321)
M	tools/perplexity/perplexity.cpp

commit	a4a0aa5ea2a88e4858996199fefd5439f17b481c	92cd103f627015a95f2107f1c27dc218c7b8ec64	2025-09-29T08:41:28+03:00	Georgi Gerganov	ggml : fix dependencies for ggml_set_rows (#16318)
M	ggml/src/ggml.c

commit	92cd103f627015a95f2107f1c27dc218c7b8ec64	b887d2f3413ac231e3cb5925260c39902af4a70c	2025-09-28T23:50:37-05:00	Jeff Bolz	vulkan: Fix validation failure in quantized flash attention (#16292)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp

commit	b887d2f3413ac231e3cb5925260c39902af4a70c	bd0af02fc96c2057726f33c0f0daf7bb8f3e462a	2025-09-28T23:15:03+02:00	Sigbjørn Skjæret	ggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307)
M	ggml/src/ggml-cpu/vec.h
M	tests/test-backend-ops.cpp

commit	bd0af02fc96c2057726f33c0f0daf7bb8f3e462a	d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93	2025-09-28T14:13:50-04:00	crat0z	common : fix reasoning before forced tool call via tool_choice = required (#16264)
M	common/chat.cpp

commit	d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93	0124ac989f7e7bf08803788f66dbe4106bdcdd58	2025-09-28T22:38:15+08:00	R0CKSTAR	ci : fix musa docker build (#16306)
M	.devops/musa.Dockerfile

commit	0124ac989f7e7bf08803788f66dbe4106bdcdd58	2811c65286ae954bec87049f75b86dc022006dcc	2025-09-28T19:25:58+08:00	Aaron Teo	devops: switch to using ubuntu-22.04-s390x image (#16302)
M	.github/workflows/docker.yml

commit	2811c65286ae954bec87049f75b86dc022006dcc	d8359f5fde480da030bf75c7711573c7c4d993ba	2025-09-28T12:04:46+01:00	Imad Saddik	Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
M	tools/server/README.md

commit	d8359f5fde480da030bf75c7711573c7c4d993ba	6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f	2025-09-28T01:38:37-05:00	Jeff Bolz	vulkan: 64-bit im2col (#16135)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col_3d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f	3b53634fe35771e2e318227aa81585726bae7234	2025-09-28T09:34:44+03:00	Georgi Gerganov	metal : extend mat-mat multiplication support (#16225)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	3b53634fe35771e2e318227aa81585726bae7234	1384abf8b8d5894d32fada453ccf4d196ffba7de	2025-09-28T09:34:05+03:00	Georgi Gerganov	metal : fuse non-sequential nodes (#16102)
M	ggml/src/ggml-metal/ggml-metal-context.m
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h

commit	1384abf8b8d5894d32fada453ccf4d196ffba7de	e6d65fb02d553bd79cad94e517cdca18b687788d	2025-09-27T20:36:34-05:00	Jeff Bolz	vulkan: handle mat_mul with A matrix > 4GB (#16176)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	tests/test-backend-ops.cpp

commit	e6d65fb02d553bd79cad94e517cdca18b687788d	8656f5de688cddcaea1d6174535eb60ee23ef6a0	2025-09-27T16:43:39-04:00	Jeff Bolz	vulkan: support arbitrary KV dimension in flash attention (#16160)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp

commit	8656f5de688cddcaea1d6174535eb60ee23ef6a0	4807e8f96a61b2adccebd5e57444c94d18de7264	2025-09-27T22:41:03+02:00	Acly	vulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	4807e8f96a61b2adccebd5e57444c94d18de7264	c0bfc57af421f8fd63c946c13b7666aed82560e2	2025-09-27T19:56:40+02:00	Aleksander Grygier	Show message actions by default (#16289)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageActions.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageUser.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFields.svelte

commit	c0bfc57af421f8fd63c946c13b7666aed82560e2	75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a	2025-09-28T00:49:32+08:00	Aman Gupta	CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmf.cuh
M	tests/test-backend-ops.cpp

commit	75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a	0499b29c6f64c705faaf5860dc4600fca23671f4	2025-09-27T18:45:07+02:00	Johannes Gäßler	CUDA: refactor and deduplicate vector FA kernels (#16208)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
D	ggml/src/ggml-cuda/fattn-vec-f16.cuh
D	ggml/src/ggml-cuda/fattn-vec-f32.cuh
A	ggml/src/ggml-cuda/fattn-vec.cuh
M	ggml/src/ggml-cuda/fattn.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs256-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q8_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs256-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-f16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_0.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_1.cu
D	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-f16-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_0-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q4_1-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_0-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q5_1-q8_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-f16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-q4_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-q4_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-q5_0.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-q5_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-vec-instance-q8_0-q8_0.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py

commit	0499b29c6f64c705faaf5860dc4600fca23671f4	234e2ff8ed09716fb553437596779399bee31b11	2025-09-27T19:26:46+03:00	Dmytro Minochkin	vulkan: throw system error instead of SIGABRT during init on older devices (#16156)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	234e2ff8ed09716fb553437596779399bee31b11	3f81b4e91c1d5f098148af117e3f13cf4b077f52	2025-09-27T18:17:08+02:00	Adrien Gallouët	server : remove old LLAMA_SERVER_SSL (#16290)
M	CMakeLists.txt
M	common/CMakeLists.txt
M	tools/server/CMakeLists.txt
M	tools/server/README.md

commit	3f81b4e91c1d5f098148af117e3f13cf4b077f52	ace6a54565444b6377bee8e7ac693238e7766279	2025-09-27T06:36:11-04:00	Jeff Bolz	vulkan: support GET_ROWS for k-quants (#16235)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	ace6a54565444b6377bee8e7ac693238e7766279	72b24d96c6888c609d562779a23787304ae4609c	2025-09-27T11:12:46+02:00	Adrien Gallouët	build : add LLAMA_OPENSSL option (#16287)
M	CMakeLists.txt
M	common/CMakeLists.txt

commit	72b24d96c6888c609d562779a23787304ae4609c	624207e676ab5eb3ce7af631902bb45fb73a8359	2025-09-27T02:58:29+05:30	Vinkal	model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
M	src/llama-model.cpp

commit	624207e676ab5eb3ce7af631902bb45fb73a8359	807e8c6d310952f2f5656afc63dab9d7083dcb5c	2025-09-27T02:03:33+08:00	Aaron Teo	devops: add s390x & ppc64le CI (#15925)
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml
M	common/common.cpp
M	examples/eval-callback/CMakeLists.txt
M	ggml/src/ggml-cpu/arch/s390/quants.c
M	ggml/src/ggml.c
M	src/llama-vocab.cpp
M	src/unicode.h
M	tests/CMakeLists.txt
M	tests/test-tokenizers-repo.sh

commit	807e8c6d310952f2f5656afc63dab9d7083dcb5c	1a189278944d030211f336e103e96b65f976c361	2025-09-26T19:25:29+02:00	Aleksander Grygier	Enhance text file detection logic for file attachments (#16199)
M	tools/server/public/index.html.gz
A	tools/server/webui/src/lib/constants/binary-detection.ts
M	tools/server/webui/src/lib/constants/supported-file-types.ts
M	tools/server/webui/src/lib/enums/files.ts
M	tools/server/webui/src/lib/utils/text-files.ts

commit	1a189278944d030211f336e103e96b65f976c361	e0539eb6aed346d4b25a6ea019044e88771e7690	2025-09-26T18:35:42+02:00	Aleksander Grygier	Allow viewing conversations even when llama server is down (#16255)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreen.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreenWarning.svelte
M	tools/server/webui/src/lib/components/app/index.ts
A	tools/server/webui/src/lib/constants/localstorage-keys.ts
M	tools/server/webui/src/lib/stores/server.svelte.ts
M	tools/server/webui/src/lib/utils/api-key-validation.ts

commit	e0539eb6aed346d4b25a6ea019044e88771e7690	5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a	2025-09-26T11:36:48-04:00	Isaac McFadyen	webui: switch to hash-based routing (alternative of #16079) (#16157)
M	tools/server/server.cpp
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebar.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarActions.svelte
M	tools/server/webui/src/lib/components/app/server/ServerErrorSplash.svelte
M	tools/server/webui/src/lib/services/chat.ts
M	tools/server/webui/src/lib/services/slots.ts
M	tools/server/webui/src/lib/stores/chat.svelte.ts
M	tools/server/webui/src/lib/stores/server.svelte.ts
M	tools/server/webui/src/lib/utils/api-key-validation.ts
M	tools/server/webui/src/routes/+error.svelte
M	tools/server/webui/src/routes/+layout.svelte
D	tools/server/webui/src/routes/+layout.ts
M	tools/server/webui/src/routes/chat/[id]/+page.svelte
M	tools/server/webui/svelte.config.js

commit	5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a	d12a9836597b1ae4440d64d5a6ed727d27ac0702	2025-09-26T15:59:07+02:00	Aleksander Grygier	Always show message actions for mobile UI + improvements for user message sizing (#16076)
M	.gitignore
D	.windsurf/rules/css-architecture.md
D	.windsurf/rules/sveltekit-architecture.md
D	.windsurf/rules/tests.md
D	.windsurf/rules/typescript-architecture.md
M	tools/server/public/index.html.gz
M	tools/server/webui/package.json
A	tools/server/webui/scripts/dev.sh
M	tools/server/webui/scripts/install-git-hooks.sh
M	tools/server/webui/scripts/post-build.sh
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageActions.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageUser.svelte
M	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte

commit	d12a9836597b1ae4440d64d5a6ed727d27ac0702	cc1cfa277b3aae1f6cc9180472072336597a78d4	2025-09-26T16:09:34+03:00	Radoslav Gerganov	codeowners : add rgerganov as owner of RPC [no ci] (#16279)
M	CODEOWNERS

commit	cc1cfa277b3aae1f6cc9180472072336597a78d4	54dbc37053f7d75ea5b0631d5ee88f19391e4314	2025-09-26T15:00:44+02:00	Aleksei Nikiforov	mtmd : fix uninitialized variable in bicubic_resize (#16275)
M	tools/mtmd/clip.cpp

commit	54dbc37053f7d75ea5b0631d5ee88f19391e4314	b995a10760cb93d23d617d76ecb82a5f95b5e0d3	2025-09-26T14:14:28+03:00	Georgi Gerganov	metal : report OOM errors (#16274)
M	ggml/src/ggml-metal/ggml-metal-context.m
M	ggml/src/ggml-metal/ggml-metal-device.m

commit	b995a10760cb93d23d617d76ecb82a5f95b5e0d3	4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a	2025-09-26T13:12:19+02:00	Adrien Gallouët	common : use cpp-httplib as a cURL alternative for downloads (#16185)
M	common/CMakeLists.txt
M	common/arg.cpp
M	ggml/CMakeLists.txt
M	vendor/cpp-httplib/httplib.h

commit	4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a	9b26511857ac09ae69ab485168fe2d3ee5fb1d6e	2025-09-26T12:39:35+02:00	Adrien Gallouët	build : fix build-ios-device (#16257)
M	build-xcframework.sh

commit	9b26511857ac09ae69ab485168fe2d3ee5fb1d6e	00217cd41388328c93e9e9644921c4319bb03bcc	2025-09-26T18:27:25+08:00	Aaron Teo	ggml-cpu: implement MXFP4 SIMD for s390x (#16193)
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/s390/quants.c

commit	00217cd41388328c93e9e9644921c4319bb03bcc	3b337b01a1a85c2f5b49376e8c0bbdb3f521528e	2025-09-26T13:19:23+03:00	Radoslav Gerganov	ci : create git tags for released docker images (#16008)
M	.github/workflows/docker.yml

commit	3b337b01a1a85c2f5b49376e8c0bbdb3f521528e	a86a580a6692edd1da076d5422f944c344b4fe5e	2025-09-26T07:53:36+02:00	Daniel Bevenius	codeowners : add danbev as owner of build-xcframework.sh [no ci] (#16268)
M	CODEOWNERS

commit	a86a580a6692edd1da076d5422f944c344b4fe5e	0f7c69689f4e681948a6005adea9bee9c08ff903	2025-09-26T08:56:38+08:00	R0CKSTAR	musa: upgrade musa sdk to 4.3.0 (#16240)
M	.devops/musa.Dockerfile
M	.github/workflows/build.yml
M	ci/README-MUSA.md
M	docs/docker.md

commit	0f7c69689f4e681948a6005adea9bee9c08ff903	835b2b915c52bcabcd688d025eacff9a07b65f52	2025-09-26T08:56:10+08:00	R0CKSTAR	musa: fix build warnings (#15611)
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/pad_reflect_1d.cu

commit	835b2b915c52bcabcd688d025eacff9a07b65f52	b05a9d650f4da1e70e7e2cbe8fe44e61b39656db	2025-09-25T19:50:28+02:00	Sigbjørn Skjæret	model : add GroveMoE support (#15510)
M	common/common.h
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	b05a9d650f4da1e70e7e2cbe8fe44e61b39656db	27052978e487957b3d39e3bd8fc8ee4aa304bff9	2025-09-25T23:38:10+08:00	Aaron Teo	vendors: update miniaudio version (#16212)
M	vendor/miniaudio/miniaudio.h

commit	27052978e487957b3d39e3bd8fc8ee4aa304bff9	077c94d0caf87fbd3cf3288dbb5c0fd9670294cf	2025-09-25T18:20:34+03:00	rtaluyev	readme : update bindings (#16144)
M	README.md

commit	077c94d0caf87fbd3cf3288dbb5c0fd9670294cf	aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3	2025-09-25T22:35:05+08:00	Aman Gupta	CUDA: add a fused top-K MoE kernel (#16130)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/topk-moe.cu
A	ggml/src/ggml-cuda/topk-moe.cuh
M	src/llama-graph.cpp
M	tests/test-backend-ops.cpp

commit	aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3	d0991da39d3c39b3980c24cdfccb9a4c95a46870	2025-09-25T12:02:36+02:00	Daniel Bevenius	model-conversion : add embedding prompt file support (#15871)
M	examples/model-conversion/Makefile
M	examples/model-conversion/logits.cpp
M	examples/model-conversion/scripts/embedding/compare-embeddings-logits.sh
M	examples/model-conversion/scripts/embedding/run-converted-model.sh
M	examples/model-conversion/scripts/embedding/run-original-model.py
M	examples/model-conversion/scripts/utils/inspect-org-model.py
M	examples/model-conversion/scripts/utils/semantic_check.py

commit	d0991da39d3c39b3980c24cdfccb9a4c95a46870	aa719c2f886c445b78113bf1e5849f1fce4124a7	2025-09-25T11:36:47+02:00	Daniel Bevenius	server : add support for external server for tests (#16243)
M	tools/server/tests/README.md
M	tools/server/tests/utils.py

commit	aa719c2f886c445b78113bf1e5849f1fce4124a7	4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08	2025-09-25T17:22:55+08:00	junchao-zhao	ggml : fix loongarch lsx compilation error (#15864)
M	ggml/src/ggml-cpu/arch/loongarch/quants.c
M	ggml/src/ggml-cpu/simd-mappings.h

commit	4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08	b5bd037832bcb8ed3086dfe26ce9090bea989af1	2025-09-25T11:12:27+02:00	Johannes Gäßler	docs: fix typo [no ci] (#16244)
M	CONTRIBUTING.md

commit	b5bd037832bcb8ed3086dfe26ce9090bea989af1	dfcd53f7ecb9bb897a9d752d09c59d10be47237a	2025-09-25T03:53:09-05:00	Douglas Hanley	llama : add support for qwen3 reranker (#15824)
M	common/common.cpp
M	convert_hf_to_gguf.py
M	examples/embedding/embedding.cpp
M	src/llama-arch.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	dfcd53f7ecb9bb897a9d752d09c59d10be47237a	4ea00794b8c995b6deaf4bac159c1778dc27419a	2025-09-25T11:30:16+03:00	Georgi Gerganov	metal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220)
M	ggml/src/ggml-metal/ggml-metal-common.cpp
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.h
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	4ea00794b8c995b6deaf4bac159c1778dc27419a	02a6a82ae7c7ddd1819ae26b0cc36675879aecee	2025-09-25T11:29:42+03:00	Georgi Gerganov	metal : relax reorder conditions (#16216)
M	ggml/src/ggml-metal/ggml-metal-common.cpp

commit	02a6a82ae7c7ddd1819ae26b0cc36675879aecee	c498fc82fe5b83fc8c6e1627286bdc1f93caddbf	2025-09-25T11:29:08+03:00	Georgi Gerganov	metal : restore im2col perf (#16219)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	c498fc82fe5b83fc8c6e1627286bdc1f93caddbf	e7a5130a20cf45a3358308356c249734ca982143	2025-09-25T10:20:02+03:00	Radoslav Gerganov	rpc : use ggml logging facilities
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	e7a5130a20cf45a3358308356c249734ca982143	bee378e0988b44bbe93b0768208080951b312363	2025-09-25T13:06:30+08:00	Aaron Teo	codeowners: add ownership of zdnn backend [no ci] (#16232)
M	CODEOWNERS

commit	bee378e0988b44bbe93b0768208080951b312363	5fb557653b8756ac2b6c6a102b1e44abcadf552f	2025-09-25T05:06:06Z	Eve	ci: run the x64 and arm ci on the github machines instead (#16183)
M	.github/workflows/build.yml
M	ci/run.sh
M	tests/test-quantize-perf.cpp

commit	5fb557653b8756ac2b6c6a102b1e44abcadf552f	4ae88d07d026e66b41e85afece74e88af54f4e66	2025-09-25T11:36:30+08:00	Aaron Teo	devops: fix s390x docker release failure (#16231)
M	.devops/s390x.Dockerfile

commit	4ae88d07d026e66b41e85afece74e88af54f4e66	e789095502b337690c7616db32d7c679a5bd2533	2025-09-25T00:25:04+08:00	Aaron Teo	codeowners: add ownership of zdnn backend [no ci] (#16229)
M	CODEOWNERS

commit	e789095502b337690c7616db32d7c679a5bd2533	f2a789e33490deb483a2694b066b37e45524bb79	2025-09-24T16:53:48+02:00	Johannes Gäßler	llama: print memory breakdown on exit (#15860)
M	common/sampling.cpp
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache-iswa.cpp
M	src/llama-kv-cache-iswa.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tools/perplexity/perplexity.cpp

commit	f2a789e33490deb483a2694b066b37e45524bb79	3a599719673c850647e3bb911ed6d91109bb91d2	2025-09-24T16:17:49+02:00	Acly	ggml : split graph allocations according to backend max buffer size (#15815)
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-impl.h
M	tests/CMakeLists.txt
A	tests/test-alloc.cpp

commit	3a599719673c850647e3bb911ed6d91109bb91d2	63b54c81a620981be020184ab99e63a8e50e47cb	2025-09-24T13:42:26+02:00	Tarek Dakhran	model : add label for LiquidAI LFM2-2.6B model (#16204)
M	src/llama-model.cpp
M	src/llama-model.h

commit	63b54c81a620981be020184ab99e63a8e50e47cb	152729f8848b692e1ae53c197ccca92ef10a523b	2025-09-24T16:25:26+08:00	Jie Fu (傅杰)	model-conversion : make causal-verify-logits fails with model names containing "." (#16215)
M	examples/model-conversion/scripts/causal/compare-logits.py
M	examples/model-conversion/scripts/utils/check-nmse.py

commit	152729f8848b692e1ae53c197ccca92ef10a523b	c0c59c1157b5aeded285a3b25d2463c866f583d3	2025-09-24T08:53:47+02:00	Uilian Ries	common : add missing chrono header for common.cpp (#16211)
M	common/common.cpp

commit	c0c59c1157b5aeded285a3b25d2463c866f583d3	7735706b939847df2c6c00b44c36f95a20137c61	2025-09-24T08:53:20+02:00	Sigbjørn Skjæret	codeowners : match all requirements files (#16214)
M	CODEOWNERS

commit	7735706b939847df2c6c00b44c36f95a20137c61	4d9ea03d170cf504a40bf3a85788af84cccaee80	2025-09-24T14:46:52+08:00	Jie Fu (傅杰)	model-conversion : run-org-model.py fails to run on mac m1 (#16213)
M	examples/model-conversion/scripts/causal/run-org-model.py

commit	4d9ea03d170cf504a40bf3a85788af84cccaee80	8ba548dae251f8f2e3834ed5226b76b6e4f4a485	2025-09-24T08:10:09+02:00	Daniel Bevenius	codeowners : use slash prefix for root files [no ci] (#16210)
M	CODEOWNERS

commit	8ba548dae251f8f2e3834ed5226b76b6e4f4a485	f505bd83ca7a43c4585ff3d59135e77eae9c793b	2025-09-24T12:19:23+08:00	Jie Fu (傅杰)	model-conversion : fix the make targets in the README.md (#16209)
M	examples/model-conversion/README.md

commit	f505bd83ca7a43c4585ff3d59135e77eae9c793b	0889589dbe8c67dd518c58a57afbb02dde2dccbe	2025-09-23T20:41:40+03:00	Georgi Gerganov	ci : disable AMD workflows + update NVIDIA workflows (#16200)
M	.github/workflows/build.yml

commit	0889589dbe8c67dd518c58a57afbb02dde2dccbe	4e29084ba4104c4ea529fd3163bb6e76f64383df	2025-09-23T13:44:25+03:00	Georgi Gerganov	ci : enable Vulkan workflow on Mac (#16194)
M	.github/workflows/build.yml
M	ci/run.sh

commit	4e29084ba4104c4ea529fd3163bb6e76f64383df	f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c	2025-09-23T01:58:12-07:00	Xiangyan Sun	ggml-cpu: Respect cpumask settings (#16164)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c	264f1b51872c125e23fa0ac1da5e2a1170de9a08	2025-09-23T10:25:20+02:00	Sigbjørn Skjæret	ggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928)
M	ggml/src/ggml-quants.c

commit	264f1b51872c125e23fa0ac1da5e2a1170de9a08	0bc7cc715472fe28822e57f036f0746592ed2c04	2025-09-23T14:53:05+08:00	Aaron Teo	zdnn: refactor codebase + add docs (#16178)
M	README.md
A	docs/backend/zDNN.md
M	ggml/include/ggml-zdnn.h
A	ggml/src/ggml-zdnn/.gitignore
A	ggml/src/ggml-zdnn/common.hpp
D	ggml/src/ggml-zdnn/ggml-zdnn-impl.h
M	ggml/src/ggml-zdnn/ggml-zdnn.cpp
A	ggml/src/ggml-zdnn/mmf.cpp
A	ggml/src/ggml-zdnn/mmf.hpp
A	ggml/src/ggml-zdnn/utils.cpp
A	ggml/src/ggml-zdnn/utils.hpp

commit	0bc7cc715472fe28822e57f036f0746592ed2c04	4b9f4cb0f89a88de4bdf97727d0457b0c648804c	2025-09-23T08:13:22+02:00	Daniel Bevenius	codeowners : add @danbev to model-conversion example [no ci] (#16190)
M	CODEOWNERS

commit	4b9f4cb0f89a88de4bdf97727d0457b0c648804c	85e72271ba1ce78adf34fd8997803c991e617ca6	2025-09-23T13:59:34+08:00	Aaron Teo	devops: add s390x containers (#15915)
A	.devops/s390x.Dockerfile
M	.github/workflows/docker.yml

commit	85e72271ba1ce78adf34fd8997803c991e617ca6	1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4	2025-09-23T05:59:03+02:00	Daniel Bevenius	ggml-cpu : fix typo in gemm comments [no ci] (#16189)
M	ggml/src/ggml-cpu/arch/x86/repack.cpp

commit	1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4	351f3da39c85f59d581fc184f09283da7f099a3b	2025-09-22T12:40:10-06:00	Gabe Goodhart	feat: Add conversion support in GraniteHybrid for non-hybrid (all attn) (#16177)
M	convert_hf_to_gguf.py

commit	351f3da39c85f59d581fc184f09283da7f099a3b	3ecb2f671a2f49d56357f99d135a94e841759178	2025-09-23T01:57:46+08:00	Haiyue Wang	clang-tidy : disable warning about performance enum size (#16127)
M	.clang-tidy

commit	3ecb2f671a2f49d56357f99d135a94e841759178	432cf4304c5379bfbd1f3feed65ec205955b2f4b	2025-09-22T19:13:00+02:00	Sigbjørn Skjæret	ggml : implement set_rows with i32 index (#16159)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/set-rows.cu
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/set_rows.cl
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/set_rows.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	432cf4304c5379bfbd1f3feed65ec205955b2f4b	37a23c17bdc9c99c9c6ad41168e4ced3724b72cd	2025-09-22T18:20:21+03:00	Georgi Gerganov	codeowners : update + cleanup (#16174)
M	CODEOWNERS
M	examples/CMakeLists.txt
D	examples/Miku.sh
D	examples/chat-13B.bat
D	examples/chat-13B.sh
D	examples/chat-persistent.sh
D	examples/chat-vicuna.sh
D	examples/chat.sh
D	examples/gritlm/CMakeLists.txt
D	examples/gritlm/README.md
D	examples/gritlm/gritlm.cpp
D	examples/jeopardy/README.md
D	examples/jeopardy/graph.py
D	examples/jeopardy/jeopardy.sh
D	examples/jeopardy/qasheet.csv
D	examples/jeopardy/questions.txt
D	examples/llm.vim
D	prompts/LLM-questions.txt
D	prompts/alpaca.txt
D	prompts/assistant.txt
D	prompts/chat-with-baichuan.txt
D	prompts/chat-with-bob.txt
D	prompts/chat-with-qwen.txt
D	prompts/chat-with-vicuna-v0.txt
D	prompts/chat-with-vicuna-v1.txt
D	prompts/chat.txt
D	prompts/dan-modified.txt
D	prompts/dan.txt
D	prompts/mnemonics.txt
D	prompts/parallel-questions.txt
D	prompts/reason-act.txt
D	scripts/ci-run.sh
D	scripts/qnt-all.sh
D	scripts/run-all-perf.sh
D	scripts/run-all-ppl.sh

commit	37a23c17bdc9c99c9c6ad41168e4ced3724b72cd	138c87ce8bd558b2cc134ada7316a3dad8eb67ac	2025-09-22T14:13:51+02:00	Adrien Gallouët	common : enable `--offline` mode without curl support (#16137)
M	common/arg.cpp

commit	138c87ce8bd558b2cc134ada7316a3dad8eb67ac	c6db9a10278f40b4b8d3f6931728f2cce2356daa	2025-09-22T10:53:13+02:00	Quentin Bramas	webui : fix handling incomplete chunks (#16107)
M	tools/server/webui/src/lib/services/chat.ts

commit	c6db9a10278f40b4b8d3f6931728f2cce2356daa	d05affbab7d1364fa7ac06c03cd33f03235ae840	2025-09-22T10:49:58+02:00	GideonSerf	embedding : fix typos in README (#16171)
M	examples/embedding/README.md

commit	d05affbab7d1364fa7ac06c03cd33f03235ae840	4f324a556caa5be0be2261604ef4aab0faf36eb8	2025-09-22T16:48:42+08:00	Haiyue Wang	common : remove unused local variables (#16140)
M	common/arg.cpp

commit	4f324a556caa5be0be2261604ef4aab0faf36eb8	a71ae3ba7a857394103f12e30b387c48242c84f2	2025-09-22T11:12:37+03:00	Georgi Gerganov	ggml : extend ggml_can_fuse to work with non-sequential nodes (#16123)
M	ggml/src/ggml-impl.h

commit	a71ae3ba7a857394103f12e30b387c48242c84f2	05a2458121f9cdcc98ea6ffeeab6f23023136266	2025-09-22T11:12:09+03:00	Georgi Gerganov	ggml : add ggml_op_is_empty (#16122)
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal/ggml-metal-common.cpp

commit	05a2458121f9cdcc98ea6ffeeab6f23023136266	96fdca043be8fa733bbd59868a75517f92633376	2025-09-22T15:10:58+07:00	Xuan-Son Nguyen	codeowners : update ownership for @ngxson and @allozuar (#16128)
M	CODEOWNERS

commit	96fdca043be8fa733bbd59868a75517f92633376	b2d980fce063fa3591c59ad50b946c8da66c294f	2025-09-22T17:04:01+09:00	Shin-myoung-serp	Vulkan: add conv_transpose_2d operation (#16022)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	b2d980fce063fa3591c59ad50b946c8da66c294f	5c6106a696af2b00ce01d14ba525979d5a32b199	2025-09-22T09:59:05+02:00	Sigbjørn Skjæret	codeowners : claim responsibility for ci, models, gguf-py and convert (#16124)
M	CODEOWNERS

commit	5c6106a696af2b00ce01d14ba525979d5a32b199	ec65fb52f0cc890e5085a6c5995ab08a156265fb	2025-09-22T10:58:02+03:00	Georgi Gerganov	contrib : update roles (#16113)
M	CONTRIBUTING.md
M	README.md

commit	ec65fb52f0cc890e5085a6c5995ab08a156265fb	1d660d2fae42ea2e1d3569638e722bf7a37b6b19	2025-09-22T10:16:05+03:00	Georgi Gerganov	ci : remove vulkaninfo calls (#16169)
M	.github/workflows/build.yml

commit	1d660d2fae42ea2e1d3569638e722bf7a37b6b19	a20d810d79adfbf82e0eb703af6f27a0e2d1a539	2025-09-22T09:11:39+03:00	Georgi Gerganov	ci : use smaller model (#16168)
M	ci/run.sh
M	tools/gguf-split/tests.sh
M	tools/quantize/tests.sh

commit	a20d810d79adfbf82e0eb703af6f27a0e2d1a539	4d0a7cbc617e384fc355077a304c883b5c7d4fb6	2025-09-22T00:37:17-05:00	Jeff Bolz	vulkan: add RTE variants of exp shader (#16165)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/exp.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	4d0a7cbc617e384fc355077a304c883b5c7d4fb6	9073a73d82a916cea0809de225ef5175c3a86e91	2025-09-22T08:31:40+03:00	Georgi Gerganov	ci : adjust params for less runtime (#16167)
M	.github/workflows/build.yml
M	ci/run.sh
M	tools/main/main.cpp

commit	9073a73d82a916cea0809de225ef5175c3a86e91	51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a	2025-09-22T07:22:43+02:00	Ruben Ortlam	vulkan: vec dot matrix multiplication fix (#16151)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a	c4510dc9374e17dcb8726902ab5216067a92b3d3	2025-09-21T16:42:10-07:00	lhez	opencl: fix concat crash on win arm64 with Adreno (#15944)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	c4510dc9374e17dcb8726902ab5216067a92b3d3	da30ab5f8696cabb2d4620cdc0aa41a298c54fd6	2025-09-21T14:48:44-07:00	lhez	opencl: initial `q8_0` mv support (#15732)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/cvt.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_id_q8_0_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_id_q8_0_f32_flat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q8_0_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q8_0_f32_flat.cl

commit	da30ab5f8696cabb2d4620cdc0aa41a298c54fd6	28baac9c9f491c872e2c37762d3bd90446b005e9	2025-09-21T19:00:27+03:00	Georgi Gerganov	ci : add label for the RISC-V runner (#16150)
M	.github/workflows/build-riscv-native.yml

commit	28baac9c9f491c872e2c37762d3bd90446b005e9	1eeb523c3e0c7ffbd59469f5463dcbdecba3535e	2025-09-21T16:50:45+03:00	Georgi Gerganov	ci : migrate ggml ci to self-hosted runners (#16116)
M	.github/workflows/build.yml
A	ci/README-MUSA.md
M	ci/README.md
M	ci/run.sh

commit	1eeb523c3e0c7ffbd59469f5463dcbdecba3535e	5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858	2025-09-21T08:31:55+02:00	Giuseppe Scrivano	vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858	7f766929ca8e8e01dcceb1c526ee584f7e5e1408	2025-09-21T01:23:37-05:00	Jeff Bolz	vulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	7f766929ca8e8e01dcceb1c526ee584f7e5e1408	405921dcefdd4e90ed948a4bf179007c2fa92b2d	2025-09-20T12:55:47+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	405921dcefdd4e90ed948a4bf179007c2fa92b2d	fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26	2025-09-16T06:16:52+02:00	Daniel Bevenius	ggml : introduce semantic versioning (ggml/1336)
M	ggml/CMakeLists.txt

commit	fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26	803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0	2025-09-10T17:21:11+02:00	Gregor Jasny	CUDA : conditionally add cuda architectures (ggml/1341)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0	459c0c2c1a400f960d7b8e8d94d31a8426f80986	2025-09-20T10:42:56+02:00	Ruben Ortlam	vulkan: use vec dot for matrix matrix multiplications (#16056)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	459c0c2c1a400f960d7b8e8d94d31a8426f80986	be79d9fdd95ab8955527c4aaa67b90e8b9516718	2025-09-20T07:56:30+02:00	Benni	server: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	be79d9fdd95ab8955527c4aaa67b90e8b9516718	f432d8d83e7407073634c5e4fd81a3d23a10827f	2025-09-19T15:15:21-07:00	ssweens	llama-bench: add --devices and --list-devices support (#16039)
M	tools/llama-bench/README.md
M	tools/llama-bench/llama-bench.cpp

commit	f432d8d83e7407073634c5e4fd81a3d23a10827f	4067f07fc5aa5722b87db303b561597004696f6c	2025-09-20T00:57:30+09:00	shun095	chat: Fix streaming parser for granite models (#15682)
M	common/chat.cpp
M	tests/test-chat.cpp

commit	4067f07fc5aa5722b87db303b561597004696f6c	4b8560ab56fdd9819358b47c338bbc8ec357c57e	2025-09-19T09:52:27+02:00	Aleksander Grygier	feat: Improve mobile UI for Settings Dialog (#16084)
M	tools/server/public/index.html.gz
M	tools/server/webui/scripts/install-git-hooks.sh
M	tools/server/webui/src/app.css
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFields.svelte
M	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFooter.svelte
D	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsSection.svelte
M	tools/server/webui/src/lib/components/app/index.ts

commit	4b8560ab56fdd9819358b47c338bbc8ec357c57e	0dd58b6877f3dc106593d6bc68d98305f553c566	2025-09-19T13:02:51+07:00	Xuan-Son Nguyen	chat : fix build on arm64 (#16101)
M	common/chat.cpp

commit	0dd58b6877f3dc106593d6bc68d98305f553c566	69ffd891631befa9e6b485fd646a16dab4f2c007	2025-09-19T11:31:56+07:00	Xuan-Son Nguyen	ggml : refactor forward_dup for cpu backend (#16062)
M	ggml/src/ggml-cpu/common.h
M	ggml/src/ggml-cpu/ops.cpp
M	tests/test-backend-ops.cpp

commit	69ffd891631befa9e6b485fd646a16dab4f2c007	246c0d9c795fb25da8268625d597580155a3672f	2025-09-18T23:07:26+02:00	Adrien Gallouët	ggml-amx : fix ggml_amx_init() on generic Linux (#16049)
M	ggml/src/ggml-cpu/amx/amx.cpp

commit	246c0d9c795fb25da8268625d597580155a3672f	3edd87cd055a45d885fa914d879d36d33ecfc3e1	2025-09-18T23:07:18+02:00	Adrien Gallouët	cmake : fix static linking for OpenMP on Unix-like systems (#16031)
M	ggml/src/CMakeLists.txt

commit	3edd87cd055a45d885fa914d879d36d33ecfc3e1	c0b45097c33e2667a94444f08cc9e36bec0a5e2e	2025-09-18T12:03:34-07:00	Shawn Gu	opencl: optimize mxfp4 kernels (#16037)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/cvt.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_id_mxfp4_f32_flat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_mxfp4_f32_flat.cl

commit	c0b45097c33e2667a94444f08cc9e36bec0a5e2e	38dbdf4c057515ccea9bec0ca2518f86d5e4d28e	2025-09-18T13:46:17-05:00	Jeff Bolz	rename optimize_graph to graph_optimize (#16082)
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas/ggml-blas.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal.cpp
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-zdnn/ggml-zdnn.cpp

commit	38dbdf4c057515ccea9bec0ca2518f86d5e4d28e	368560a1e3b9a3bc83af741b0b2bc9e46fb420d2	2025-09-18T11:26:03-07:00	Bowen Han	CUDA: Optimize PAD_REFLECT_1D (#15957)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/pad_reflect_1d.cu
M	tests/test-backend-ops.cpp

commit	368560a1e3b9a3bc83af741b0b2bc9e46fb420d2	4ca088b036313c2d8e682f4cfeb7c29edd85d0b9	2025-09-18T19:28:32+02:00	Johannes Gäßler	CUDA: fix compilation on CC 6.0 (#16091)
M	ggml/src/ggml-cuda/fattn-tile.cu

commit	4ca088b036313c2d8e682f4cfeb7c29edd85d0b9	703f9e32c4eb3166f8d63007c26e31a1466c21af	2025-09-18T16:22:50+01:00	Eric Curtin	Add resumable downloads for llama-server model loading (#15963)
M	common/arg.cpp

commit	703f9e32c4eb3166f8d63007c26e31a1466c21af	ad6bd9083bc346afd4ecd2fbb83e0306c0141c99	2025-09-18T16:28:41+03:00	Georgi Gerganov	metal : use function constants for mul_mv_ext kernels (#16074)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	ad6bd9083bc346afd4ecd2fbb83e0306c0141c99	2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748	2025-09-18T13:28:22+02:00	Sigbjørn Skjæret	cuda : add missing F32<->I32 entries in ggml_cuda_cpy_fn (#16060)
M	ggml/src/ggml-cuda/cpy.cu

commit	2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748	e58174cecbc45bf79bf653cd2c984395940c6ef4	2025-09-18T13:36:57+03:00	Radoslav Gerganov	server : include usage statistics only when user request them (#16052)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py

commit	e58174cecbc45bf79bf653cd2c984395940c6ef4	b213fce89bee8cb56b587b91e15a4278f8ed0180	2025-09-18T12:47:56+03:00	Georgi Gerganov	llama : bump max seq limit from 64 to 256 (#15916)
M	src/llama-cparams.h

commit	b213fce89bee8cb56b587b91e15a4278f8ed0180	e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4	2025-09-18T12:33:45+03:00	Georgi Gerganov	metal : improve F32, F16 and BF16 mat-vec multiplication (#16057)
M	ggml/src/ggml-metal/ggml-metal-device.cpp
M	ggml/src/ggml-metal/ggml-metal-device.h
M	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal-ops.cpp
M	ggml/src/ggml-metal/ggml-metal.metal

commit	e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4	f2f28380ea68939c0481df3e4216b698824a59df	2025-09-18T15:06:48+08:00	Jhen-Jie Hong	metal : avoid call free for non-owned buffer (#16067)
M	ggml/src/ggml-metal/ggml-metal-device.m

commit	f2f28380ea68939c0481df3e4216b698824a59df	62c3b645c56ad5288aa401901f043b050edac5a2	2025-09-18T10:03:24+03:00	Georgi Gerganov	metal : handle nil cv during pipeline creation (#16065)
M	ggml/src/ggml-metal/ggml-metal-device.m

commit	62c3b645c56ad5288aa401901f043b050edac5a2	d304f459d8619399eb232b1e3689379306f439d3	2025-09-18T09:26:33+08:00	Chenguang Li	CANN: Remove print (#16044)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	d304f459d8619399eb232b1e3689379306f439d3	0320ac5264279d74f8ee91bafa6c90e9ab9bbb91	2025-09-17T13:09:40-07:00	Reese Levine	GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018)
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
A	ggml/src/ggml-webgpu/wgsl-shaders/add.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/add_in_place.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/binary_head.tmpl
A	ggml/src/ggml-webgpu/wgsl-shaders/common_decls.tmpl
M	ggml/src/ggml-webgpu/wgsl-shaders/embed_wgsl.py
A	ggml/src/ggml-webgpu/wgsl-shaders/get_rows.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/mul.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/mul_in_place.tmpl.wgsl
M	ggml/src/ggml-webgpu/wgsl-shaders/mul_mat.tmpl.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/rms_norm_in_place.wgsl
M	ggml/src/ggml-webgpu/wgsl-shaders/set_rows.wgsl
M	tests/test-backend-ops.cpp

commit	0320ac5264279d74f8ee91bafa6c90e9ab9bbb91	a7a98e0fffed794396b3fbad4dcdbbc184963645	2025-09-17T20:38:12+03:00	Georgi Gerganov	metal : refactor + optimize v2 (#15995)
M	ci/run.sh
M	ggml/CMakeLists.txt
M	ggml/include/ggml-metal.h
M	ggml/include/ggml.h
M	ggml/src/ggml-metal/CMakeLists.txt
M	ggml/src/ggml-metal/ggml-metal-common.cpp
M	ggml/src/ggml-metal/ggml-metal-common.h
A	ggml/src/ggml-metal/ggml-metal-context.h
A	ggml/src/ggml-metal/ggml-metal-context.m
A	ggml/src/ggml-metal/ggml-metal-device.cpp
A	ggml/src/ggml-metal/ggml-metal-device.h
A	ggml/src/ggml-metal/ggml-metal-device.m
M	ggml/src/ggml-metal/ggml-metal-impl.h
A	ggml/src/ggml-metal/ggml-metal-ops.cpp
A	ggml/src/ggml-metal/ggml-metal-ops.h
A	ggml/src/ggml-metal/ggml-metal.cpp
D	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	a7a98e0fffed794396b3fbad4dcdbbc184963645	8f8f2274ee3601fecf6e2d57b52f701c81bede21	2025-09-17T19:29:13+02:00	Aleksander Grygier	SvelteKit-based WebUI (#14839)
M	.editorconfig
M	.github/workflows/server.yml
M	.gitignore
A	.windsurf/rules/css-architecture.md
A	.windsurf/rules/sveltekit-architecture.md
A	.windsurf/rules/tests.md
A	.windsurf/rules/typescript-architecture.md
M	tools/server/public/index.html.gz
M	tools/server/server.cpp
M	tools/server/tests/unit/test_basic.py
M	tools/server/webui/.gitignore
A	tools/server/webui/.npmrc
M	tools/server/webui/.prettierignore
A	tools/server/webui/.prettierrc
A	tools/server/webui/.storybook/ModeWatcherDecorator.svelte
A	tools/server/webui/.storybook/TooltipProviderDecorator.svelte
A	tools/server/webui/.storybook/main.ts
A	tools/server/webui/.storybook/preview.ts
A	tools/server/webui/.storybook/vitest.setup.ts
A	tools/server/webui/README.md
A	tools/server/webui/components.json
A	tools/server/webui/e2e/demo.test.ts
M	tools/server/webui/eslint.config.js
D	tools/server/webui/index.html
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
A	tools/server/webui/playwright.config.ts
D	tools/server/webui/postcss.config.js
D	tools/server/webui/public/demo-conversation.json
A	tools/server/webui/scripts/install-git-hooks.sh
A	tools/server/webui/scripts/post-build.sh
D	tools/server/webui/src/App.tsx
D	tools/server/webui/src/Config.ts
A	tools/server/webui/src/app.css
A	tools/server/webui/src/app.d.ts
A	tools/server/webui/src/app.html
D	tools/server/webui/src/components/CanvasPyInterpreter.tsx
D	tools/server/webui/src/components/ChatInputExtraContextItem.tsx
D	tools/server/webui/src/components/ChatMessage.tsx
D	tools/server/webui/src/components/ChatScreen.tsx
D	tools/server/webui/src/components/Header.tsx
D	tools/server/webui/src/components/MarkdownDisplay.tsx
D	tools/server/webui/src/components/ModalProvider.tsx
D	tools/server/webui/src/components/SettingDialog.tsx
D	tools/server/webui/src/components/Sidebar.tsx
D	tools/server/webui/src/components/useChatExtraContext.tsx
D	tools/server/webui/src/components/useChatScroll.tsx
D	tools/server/webui/src/components/useChatTextarea.ts
A	tools/server/webui/src/demo.spec.ts
D	tools/server/webui/src/index.scss
A	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentFilePreview.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentImagePreview.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentPreviewDialog.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatAttachments/ChatAttachmentsList.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatForm.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormActionFileAttachments.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormActionRecord.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormActions.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormFileInputInvisible.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormHelperText.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatForm/ChatFormTextarea.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessage.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageActions.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageAssistant.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageBranchingControls.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageThinkingBlock.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessageUser.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatMessages/ChatMessages.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatProcessingInfo.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreen.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreenDragOverlay.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatScreen/ChatScreenHeader.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsDialog.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsFooter.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSettings/ChatSettingsSection.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebar.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarActions.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarConversationItem.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSidebar/ChatSidebarSearch.svelte
A	tools/server/webui/src/lib/components/app/chat/ChatSidebar/handle-mobile-sidebar-item-click.ts
A	tools/server/webui/src/lib/components/app/dialogs/ConfirmationDialog.svelte
A	tools/server/webui/src/lib/components/app/dialogs/ConversationTitleUpdateDialog.svelte
A	tools/server/webui/src/lib/components/app/dialogs/EmptyFileAlertDialog.svelte
A	tools/server/webui/src/lib/components/app/dialogs/MaximumContextAlertDialog.svelte
A	tools/server/webui/src/lib/components/app/index.ts
A	tools/server/webui/src/lib/components/app/misc/ActionButton.svelte
A	tools/server/webui/src/lib/components/app/misc/ActionDropdown.svelte
A	tools/server/webui/src/lib/components/app/misc/KeyboardShortcutInfo.svelte
A	tools/server/webui/src/lib/components/app/misc/MarkdownContent.svelte
A	tools/server/webui/src/lib/components/app/server/ServerErrorSplash.svelte
A	tools/server/webui/src/lib/components/app/server/ServerInfo.svelte
A	tools/server/webui/src/lib/components/app/server/ServerLoadingSplash.svelte
A	tools/server/webui/src/lib/components/app/server/ServerStatus.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-action.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-cancel.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-content.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-description.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-footer.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-header.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-overlay.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-title.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/alert-dialog-trigger.svelte
A	tools/server/webui/src/lib/components/ui/alert-dialog/index.ts
A	tools/server/webui/src/lib/components/ui/badge/badge.svelte
A	tools/server/webui/src/lib/components/ui/badge/index.ts
A	tools/server/webui/src/lib/components/ui/button/button.svelte
A	tools/server/webui/src/lib/components/ui/button/index.ts
A	tools/server/webui/src/lib/components/ui/card/card-action.svelte
A	tools/server/webui/src/lib/components/ui/card/card-content.svelte
A	tools/server/webui/src/lib/components/ui/card/card-description.svelte
A	tools/server/webui/src/lib/components/ui/card/card-footer.svelte
A	tools/server/webui/src/lib/components/ui/card/card-header.svelte
A	tools/server/webui/src/lib/components/ui/card/card-title.svelte
A	tools/server/webui/src/lib/components/ui/card/card.svelte
A	tools/server/webui/src/lib/components/ui/card/index.ts
A	tools/server/webui/src/lib/components/ui/checkbox/checkbox.svelte
A	tools/server/webui/src/lib/components/ui/checkbox/index.ts
A	tools/server/webui/src/lib/components/ui/collapsible/collapsible-content.svelte
A	tools/server/webui/src/lib/components/ui/collapsible/collapsible-trigger.svelte
A	tools/server/webui/src/lib/components/ui/collapsible/collapsible.svelte
A	tools/server/webui/src/lib/components/ui/collapsible/index.ts
A	tools/server/webui/src/lib/components/ui/dialog/dialog-close.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-content.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-description.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-footer.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-header.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-overlay.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-title.svelte
A	tools/server/webui/src/lib/components/ui/dialog/dialog-trigger.svelte
A	tools/server/webui/src/lib/components/ui/dialog/index.ts
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-checkbox-item.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-content.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-group-heading.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-group.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-item.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-label.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-radio-group.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-radio-item.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-separator.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-shortcut.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-sub-content.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-sub-trigger.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/dropdown-menu-trigger.svelte
A	tools/server/webui/src/lib/components/ui/dropdown-menu/index.ts
A	tools/server/webui/src/lib/components/ui/input/index.ts
A	tools/server/webui/src/lib/components/ui/input/input.svelte
A	tools/server/webui/src/lib/components/ui/label/index.ts
A	tools/server/webui/src/lib/components/ui/label/label.svelte
A	tools/server/webui/src/lib/components/ui/scroll-area/index.ts
A	tools/server/webui/src/lib/components/ui/scroll-area/scroll-area-scrollbar.svelte
A	tools/server/webui/src/lib/components/ui/scroll-area/scroll-area.svelte
A	tools/server/webui/src/lib/components/ui/select/index.ts
A	tools/server/webui/src/lib/components/ui/select/select-content.svelte
A	tools/server/webui/src/lib/components/ui/select/select-group-heading.svelte
A	tools/server/webui/src/lib/components/ui/select/select-group.svelte
A	tools/server/webui/src/lib/components/ui/select/select-item.svelte
A	tools/server/webui/src/lib/components/ui/select/select-label.svelte
A	tools/server/webui/src/lib/components/ui/select/select-scroll-down-button.svelte
A	tools/server/webui/src/lib/components/ui/select/select-scroll-up-button.svelte
A	tools/server/webui/src/lib/components/ui/select/select-separator.svelte
A	tools/server/webui/src/lib/components/ui/select/select-trigger.svelte
A	tools/server/webui/src/lib/components/ui/separator/index.ts
A	tools/server/webui/src/lib/components/ui/separator/separator.svelte
A	tools/server/webui/src/lib/components/ui/sheet/index.ts
A	tools/server/webui/src/lib/components/ui/sheet/sheet-close.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-content.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-description.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-footer.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-header.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-overlay.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-title.svelte
A	tools/server/webui/src/lib/components/ui/sheet/sheet-trigger.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/constants.ts
A	tools/server/webui/src/lib/components/ui/sidebar/context.svelte.ts
A	tools/server/webui/src/lib/components/ui/sidebar/index.ts
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-content.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-footer.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-group-action.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-group-content.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-group-label.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-group.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-header.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-input.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-inset.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-action.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-badge.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-button.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-item.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-skeleton.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-sub-button.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-sub-item.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu-sub.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-menu.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-provider.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-rail.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-separator.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar-trigger.svelte
A	tools/server/webui/src/lib/components/ui/sidebar/sidebar.svelte
A	tools/server/webui/src/lib/components/ui/skeleton/index.ts
A	tools/server/webui/src/lib/components/ui/skeleton/skeleton.svelte
A	tools/server/webui/src/lib/components/ui/textarea/index.ts
A	tools/server/webui/src/lib/components/ui/textarea/textarea.svelte
A	tools/server/webui/src/lib/components/ui/tooltip/index.ts
A	tools/server/webui/src/lib/components/ui/tooltip/tooltip-content.svelte
A	tools/server/webui/src/lib/components/ui/tooltip/tooltip-trigger.svelte
A	tools/server/webui/src/lib/components/ui/utils.ts
A	tools/server/webui/src/lib/constants/auto-scroll.ts
A	tools/server/webui/src/lib/constants/debounce.ts
A	tools/server/webui/src/lib/constants/input-classes.ts
A	tools/server/webui/src/lib/constants/max-bundle-size.ts
A	tools/server/webui/src/lib/constants/processing-info.ts
A	tools/server/webui/src/lib/constants/settings-config.ts
A	tools/server/webui/src/lib/constants/supported-file-types.ts
A	tools/server/webui/src/lib/constants/tooltip-config.ts
A	tools/server/webui/src/lib/constants/viewport.ts
A	tools/server/webui/src/lib/enums/files.ts
A	tools/server/webui/src/lib/hooks/is-mobile.svelte.ts
A	tools/server/webui/src/lib/hooks/use-processing-state.svelte.ts
A	tools/server/webui/src/lib/services/chat.ts
A	tools/server/webui/src/lib/services/context.ts
A	tools/server/webui/src/lib/services/index.ts
A	tools/server/webui/src/lib/services/slots.ts
A	tools/server/webui/src/lib/stores/chat.svelte.ts
A	tools/server/webui/src/lib/stores/database.ts
A	tools/server/webui/src/lib/stores/server.svelte.ts
A	tools/server/webui/src/lib/stores/settings.svelte.ts
A	tools/server/webui/src/lib/types/api.d.ts
A	tools/server/webui/src/lib/types/chat.d.ts
A	tools/server/webui/src/lib/types/database.d.ts
A	tools/server/webui/src/lib/types/settings.d.ts
A	tools/server/webui/src/lib/utils/api-key-validation.ts
A	tools/server/webui/src/lib/utils/audio-recording.ts
A	tools/server/webui/src/lib/utils/autoresize-textarea.ts
A	tools/server/webui/src/lib/utils/branching.ts
A	tools/server/webui/src/lib/utils/convert-files-to-extra.ts
A	tools/server/webui/src/lib/utils/copy.ts
A	tools/server/webui/src/lib/utils/file-preview.ts
A	tools/server/webui/src/lib/utils/file-type.ts
A	tools/server/webui/src/lib/utils/modality-file-validation.ts
A	tools/server/webui/src/lib/utils/pdf-processing.ts
A	tools/server/webui/src/lib/utils/process-uploaded-files.ts
A	tools/server/webui/src/lib/utils/svg-to-png.ts
A	tools/server/webui/src/lib/utils/text-files.ts
A	tools/server/webui/src/lib/utils/thinking.ts
A	tools/server/webui/src/lib/utils/webp-to-png.ts
D	tools/server/webui/src/main.tsx
A	tools/server/webui/src/routes/+error.svelte
A	tools/server/webui/src/routes/+layout.svelte
A	tools/server/webui/src/routes/+layout.ts
A	tools/server/webui/src/routes/+page.svelte
A	tools/server/webui/src/routes/+page.ts
A	tools/server/webui/src/routes/chat/[id]/+page.svelte
A	tools/server/webui/src/routes/chat/[id]/+page.ts
A	tools/server/webui/src/routes/page.svelte.test.ts
A	tools/server/webui/src/stories/ChatForm.stories.svelte
A	tools/server/webui/src/stories/ChatMessage.stories.svelte
A	tools/server/webui/src/stories/ChatSettingsDialog.stories.svelte
A	tools/server/webui/src/stories/ChatSidebar.stories.svelte
A	tools/server/webui/src/stories/Introduction.mdx
A	tools/server/webui/src/stories/MarkdownContent.stories.svelte
A	tools/server/webui/src/stories/fixtures/ai-tutorial.ts
A	tools/server/webui/src/stories/fixtures/api-docs.ts
A	tools/server/webui/src/stories/fixtures/assets/1.jpg
A	tools/server/webui/src/stories/fixtures/assets/beautiful-flowers-lotus.webp
A	tools/server/webui/src/stories/fixtures/assets/example.pdf
A	tools/server/webui/src/stories/fixtures/assets/hf-logo.svg
A	tools/server/webui/src/stories/fixtures/blog-post.ts
A	tools/server/webui/src/stories/fixtures/data-analysis.ts
A	tools/server/webui/src/stories/fixtures/empty.ts
A	tools/server/webui/src/stories/fixtures/math-formulas.ts
A	tools/server/webui/src/stories/fixtures/readme.ts
A	tools/server/webui/src/stories/fixtures/storybook-mocks.ts
D	tools/server/webui/src/utils/app.context.tsx
D	tools/server/webui/src/utils/common.tsx
D	tools/server/webui/src/utils/llama-vscode.ts
D	tools/server/webui/src/utils/misc.ts
D	tools/server/webui/src/utils/storage.ts
D	tools/server/webui/src/utils/types.ts
D	tools/server/webui/src/vite-env.d.ts
A	tools/server/webui/static/favicon.svg
A	tools/server/webui/static/loading.html
A	tools/server/webui/svelte.config.js
D	tools/server/webui/tailwind.config.js
D	tools/server/webui/tsconfig.app.json
M	tools/server/webui/tsconfig.json
D	tools/server/webui/tsconfig.node.json
M	tools/server/webui/vite.config.ts
A	tools/server/webui/vitest-setup-client.ts

commit	8f8f2274ee3601fecf6e2d57b52f701c81bede21	c959b676be29e93f8dbc3bd6056ceba812a9eb72	2025-09-18T00:18:21+07:00	Xuan-Son Nguyen	convert : add Llama4ForCausalLM (#16042)
M	convert_hf_to_gguf.py
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	c959b676be29e93f8dbc3bd6056ceba812a9eb72	cd08fc3ecc0264b4414b68af3874a6c689ed60c1	2025-09-17T15:32:42+02:00	Johannes Gäßler	CUDA: fix FA occupancy, optimize tile kernel (#15982)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	cd08fc3ecc0264b4414b68af3874a6c689ed60c1	cb5bb6cc05119c24e7711ca2956cd0e6d409d396	2025-09-17T01:08:02-07:00	David Ribeiro Alves	common : Fix corrupted memory error on json grammar initialization (#16038)
M	common/json-schema-to-grammar.cpp

commit	cb5bb6cc05119c24e7711ca2956cd0e6d409d396	a91d035b901e8a9edf810f63d130ee49adf27be2	2025-09-17T07:35:37Z	Eve	vulkan: automatically remove unsupported devices (#15976)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	a91d035b901e8a9edf810f63d130ee49adf27be2	745cbcf2fe1eb88f8db615ac622f0b944d924ad6	2025-09-17T09:34:09+02:00	Daniel Bevenius	ci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040)
M	.github/workflows/build.yml

commit	745cbcf2fe1eb88f8db615ac622f0b944d924ad6	1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8	2025-09-17T15:30:55+08:00	Jie Fu (傅杰)	llama-quant : fix the verification of attention layers for encoder-decoder models (#16023)
M	src/llama-quant.cpp

commit	1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8	85286f354813056f6c835046c0acfa3bf6ba9432	2025-09-17T15:29:00+08:00	Jie Fu (傅杰)	examples : support encoder-decoder models in the simple example (#16002)
M	examples/simple/simple.cpp

commit	85286f354813056f6c835046c0acfa3bf6ba9432	d5fabe3682de515fd09d6c981f7a0d1b75614455	2025-09-17T00:01:58-07:00	Shane A	model : add OLMo3 support (#16015)
M	convert_hf_to_gguf.py
M	src/llama-model.cpp

commit	d5fabe3682de515fd09d6c981f7a0d1b75614455	8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68	2025-09-17T14:33:08+08:00	Chenguang Li	CANN: Optimize ggml_cann_set_device (#15935)
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68	77475530b8bbea3bf578632507e1284cdfe2c8c0	2025-09-16T16:17:08+02:00	jacekpoplawski	llama-bench: add --n-cpu-moe support (#15952)
M	common/arg.cpp
M	common/common.h
M	tools/llama-bench/llama-bench.cpp

commit	77475530b8bbea3bf578632507e1284cdfe2c8c0	3913f8730ec6d6245480affc30ae3049107956f4	2025-09-16T15:27:52+02:00	Daniel Bevenius	ci : use macos-latest for arm64 webgpu build (#16029)
M	.github/workflows/build.yml

commit	3913f8730ec6d6245480affc30ae3049107956f4	76888d202ed2b835ae19ea9f9db6baf39e419297	2025-09-16T15:25:57+02:00	Daniel Bevenius	ggml : fix padding in timestep embedding kernels (#15932)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/tsembd.cu
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/kernels/tsembd.cl
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/timestep_embedding.comp
M	ggml/src/ggml.c

commit	76888d202ed2b835ae19ea9f9db6baf39e419297	f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c	2025-09-16T13:41:38+02:00	Daniel Bevenius	ci : upload xcframework artifact from ios-xcode-build job (#16010)
M	.github/workflows/build.yml

commit	f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c	51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442	2025-09-15T23:59:19-07:00	Bowen Han	fix: apply clang-format to CUDA macros (#16017)
M	.clang-format

commit	51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442	07808ebb07e2b1aa19032705e332679ddf967614	2025-09-16T05:57:16+02:00	Daniel Bevenius	ci : update macos-latest* jobs to use macos-latest (#15938)
M	.github/workflows/build.yml

commit	07808ebb07e2b1aa19032705e332679ddf967614	6d758839ff741d4966ca92b7f801b7a8b5b96364	2025-09-15T22:54:44-04:00	Yuri Khrustalev	cmake : Do not install tools on iOS targets (#15903)
M	CMakeLists.txt
M	tools/batched-bench/CMakeLists.txt
M	tools/cvector-generator/CMakeLists.txt
M	tools/export-lora/CMakeLists.txt
M	tools/gguf-split/CMakeLists.txt
M	tools/imatrix/CMakeLists.txt
M	tools/llama-bench/CMakeLists.txt
M	tools/main/CMakeLists.txt
M	tools/mtmd/CMakeLists.txt
M	tools/perplexity/CMakeLists.txt
M	tools/quantize/CMakeLists.txt
M	tools/run/CMakeLists.txt
M	tools/tokenize/CMakeLists.txt
M	tools/tts/CMakeLists.txt

commit	6d758839ff741d4966ca92b7f801b7a8b5b96364	3d4053f77f0f78ee2b791088c02af653ebee42dd	2025-09-16T10:38:28+08:00	Aman Gupta	Add LLaDA-7b-MoE diffusion model (#16003)
M	common/arg.cpp
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	examples/diffusion/diffusion-cli.cpp
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	3d4053f77f0f78ee2b791088c02af653ebee42dd	dc381aa9a6dc45f00673471d34b8bddd30e77570	2025-09-15T16:28:31-06:00	Jake Karnes	CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
M	ggml/src/ggml-cuda/im2col.cu

commit	dc381aa9a6dc45f00673471d34b8bddd30e77570	10d197409bd9537ff302ad09966fe406882fef9d	2025-09-15T14:38:52-07:00	Diego Devesa	docker : enable rocWMMA in ROCm images, add gfx1151 (#15997)
M	.devops/rocm.Dockerfile

commit	10d197409bd9537ff302ad09966fe406882fef9d	b907255f4bd169b0dc7dca9553b4c54af5170865	2025-09-15T14:38:42-07:00	Diego Devesa	releases : switch to rocWMMA develop branch, add gfx1151 (#15992)
M	.github/workflows/release.yml

commit	b907255f4bd169b0dc7dca9553b4c54af5170865	28c39da7c645185ade5436767929d7ec33006033	2025-09-15T19:51:35+03:00	yael-works	SYCL: Add COUNT_EQUAL operator support (#15991)
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/binbcast.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	28c39da7c645185ade5436767929d7ec33006033	106220562aca42b6738b8f51acfce0db1b8a2fb6	2025-09-15T13:08:30+03:00	Nikolay Popov	llama-run: Fix model download on Windows (#15988)
M	tools/run/run.cpp

commit	106220562aca42b6738b8f51acfce0db1b8a2fb6	a68f31edd71cc39141113f05f7133a3e9ece8c61	2025-09-15T17:35:11+08:00	Aman Gupta	CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926)
M	ggml/src/ggml-cuda/mmf.cuh

commit	a68f31edd71cc39141113f05f7133a3e9ece8c61	b8e09f08b9a91c0401bc67d17a17c90756420346	2025-09-15T02:54:57-05:00	ddh0	fix KLD percentile output (#15999)
M	tools/perplexity/perplexity.cpp

commit	b8e09f08b9a91c0401bc67d17a17c90756420346	6c019cb04e86e2dacfe62ce7666c64e9717dde1f	2025-09-14T23:00:59+02:00	Sigbjørn Skjæret	model : add grok-2 support (#15539)
M	common/common.h
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	6c019cb04e86e2dacfe62ce7666c64e9717dde1f	9dcd200d57bc6f05a59a6a8df361d5d183af4124	2025-09-14T21:17:04+02:00	Sigbjørn Skjæret	server : only attempt to enable thinking if using jinja (#15967)
M	tools/server/server.cpp

commit	9dcd200d57bc6f05a59a6a8df361d5d183af4124	0fa154e3502e940df914f03b41475a2b80b985b0	2025-09-14T22:02:32+03:00	Georgi Gerganov	metal : remove memory pools (#15966)
M	ggml/src/ggml-metal/ggml-metal-common.cpp
M	ggml/src/ggml-metal/ggml-metal.m

commit	0fa154e3502e940df914f03b41475a2b80b985b0	261e6a20ffdb79c4875e674b4f6b514bc73cff8f	2025-09-15T04:43:54+10:00	Adam	rocm.Dockerfile: added gfx1200,gfx1201 architectures to support  AMD Radeon RX 9000 series (#15994)
M	.devops/rocm.Dockerfile

commit	261e6a20ffdb79c4875e674b4f6b514bc73cff8f	a0e13dcbe5bae7025660349ef3e4ead060e507f2	2025-09-14T16:56:28+02:00	Ruben Ortlam	Vulkan: Clean up mul_mm shader (#15987)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	a0e13dcbe5bae7025660349ef3e4ead060e507f2	a14bd350141fb42b8bf2dd2342cebc27bfdce399	2025-09-14T22:20:35+08:00	lcy	build: fix the build failures of Windows HIP release job (#15984)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	a14bd350141fb42b8bf2dd2342cebc27bfdce399	918b26f197f55d5d562446dfc876d0e637929d07	2025-09-14T15:33:22+03:00	Georgi Gerganov	metal : fix kernel requirements (#15983)
M	ggml/src/ggml-metal/ggml-metal.m

commit	918b26f197f55d5d562446dfc876d0e637929d07	9ecb88434644c865232bb665d2f6f05049fc6456	2025-09-14T12:28:18+03:00	Radoslav Gerganov	rpc : fix regression when --device is used (#15981)
M	tools/rpc/rpc-server.cpp

commit	9ecb88434644c865232bb665d2f6f05049fc6456	d1c6f11f47bae063a68a6be8e4830c060a11b7bd	2025-09-14T02:21:59-07:00	Diego Devesa	releases : update ROCM, add gfx1200, gfx1201, gfx1151 (#15972)
M	.github/workflows/release.yml

commit	d1c6f11f47bae063a68a6be8e4830c060a11b7bd	6380d6a3e709cb02a8695afdd96b40e674477332	2025-09-14T12:10:07+03:00	Radoslav Gerganov	doc : update documentation for --tensor-split (#15980)
M	tools/main/README.md

commit	6380d6a3e709cb02a8695afdd96b40e674477332	aa0c461efe3603639af1a1defed2438d9c16ca0f	2025-09-14T13:37:03+08:00	Aaron Teo	ggml-zdnn: rm user mapped buffers (#15965)
M	ggml/src/ggml-zdnn/ggml-zdnn.cpp

commit	aa0c461efe3603639af1a1defed2438d9c16ca0f	b9c9c9f789cd57fb0b28b25223305613cd90fa10	2025-09-13T16:29:43+01:00	Jeff Bolz	vulkan: fix failing dequant shaders (#15862)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_xxs.comp

commit	b9c9c9f789cd57fb0b28b25223305613cd90fa10	50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91	2025-09-13T16:23:30+01:00	Jeff Bolz	vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91	55758b00cae1451a0d789c50a5eb8c9bee42b9a0	2025-09-13T07:49:49-07:00	Diego Devesa	llama : allow using iGPUs with --device (#15951)
M	common/arg.cpp
M	tools/mtmd/clip.cpp
M	tools/rpc/rpc-server.cpp

commit	55758b00cae1451a0d789c50a5eb8c9bee42b9a0	f161463a54d9f93d41246286aa4a9569a91d804d	2025-09-13T16:24:22+03:00	Georgi Gerganov	metal : refactor kernel loading (#15964)
M	.github/workflows/build.yml
M	ci/run.sh
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	f161463a54d9f93d41246286aa4a9569a91d804d	84d7b2fca11d1be118ce776f6d72a486c4883b74	2025-09-13T13:54:28+03:00	Georgi Gerganov	metal : allow ops to run concurrently (#15929)
M	ggml/src/ggml-metal/CMakeLists.txt
A	ggml/src/ggml-metal/ggml-metal-common.cpp
A	ggml/src/ggml-metal/ggml-metal-common.h
M	ggml/src/ggml-metal/ggml-metal.m

commit	84d7b2fca11d1be118ce776f6d72a486c4883b74	40be51152d4dc2d47444a4ed378285139859895b	2025-09-13T12:45:04+03:00	Georgi Gerganov	metal : fix memory leaks (#15962)
M	ggml/src/ggml-metal/ggml-metal.m

commit	40be51152d4dc2d47444a4ed378285139859895b	4bf5549269d99bac936a65892da2312cc71b2421	2025-09-13T02:39:52+08:00	Aaron Teo	ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839)
M	docs/build-s390x.md
M	docs/ops.md
M	docs/ops/zDNN.csv
M	ggml/include/ggml-zdnn.h
M	ggml/src/ggml-zdnn/ggml-zdnn-impl.h
M	ggml/src/ggml-zdnn/ggml-zdnn.cpp

commit	4bf5549269d99bac936a65892da2312cc71b2421	f4e664f838cc65d89fa845c48c372e43852112e4	2025-09-12T16:31:50+01:00	Eric Curtin	Add docker protocol support for llama-server model loading (#15790)
M	common/arg.cpp
M	common/common.h

commit	f4e664f838cc65d89fa845c48c372e43852112e4	f088b6a84f6aed0abb619dbb9d375e726fc888a6	2025-09-12T23:16:32+08:00	Haiyue Wang	context : remove redundant explicit casting to the same type (#15948)
M	src/llama-context.cpp

commit	f088b6a84f6aed0abb619dbb9d375e726fc888a6	304ac5693d1e2124f83e0584bc5eea6311d3d3b4	2025-09-12T17:02:55+03:00	Georgi Gerganov	server : adjust prompt similarity thold + add logs (#15913)
M	common/common.h
M	tools/server/server.cpp

commit	304ac5693d1e2124f83e0584bc5eea6311d3d3b4	6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656	2025-09-12T13:24:21+02:00	Ruben Ortlam	Vulkan iGPU device selection overhaul and PCI ID API support (#15947)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656	704d90c987cdf00751567b2088c4e54742aa2d3f	2025-09-12T09:06:20+02:00	Mathieu Baudier	vulkan: Make device memory check more portable (#15939)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	704d90c987cdf00751567b2088c4e54742aa2d3f	360d6533db39e11577afe9b0aece20c6b5ddaf1f	2025-09-12T09:15:12+08:00	Neo Zhang Jianyu	Revert "sycl: add usage of enqueue_functions extension (#14244)"  (#15910)
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/conv.cpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/gla.cpp
M	ggml/src/ggml-sycl/im2col.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/set_rows.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/wkv.cpp

commit	360d6533db39e11577afe9b0aece20c6b5ddaf1f	0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2	2025-09-11T13:47:38-07:00	Diego Devesa	ggml-backend : add GGML_BACKEND_DEVICE_TYPE_IGPU device type (#15797)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	src/llama.cpp
M	tools/llama-bench/llama-bench.cpp

commit	0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2	df082f56309073ecf885eceaa21b86e8a487e61b	2025-09-11T21:19:58+02:00	Johannes Gäßler	CUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-tile.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	df082f56309073ecf885eceaa21b86e8a487e61b	24a6734daf6932ff29ba8c1ff0245c51d76f783e	2025-09-11T12:12:34-05:00	ddh0	nitpick : correct MB to MiB (#15934)
M	src/llama-quant.cpp

commit	24a6734daf6932ff29ba8c1ff0245c51d76f783e	2b3efea9a4d91216850856fbb77075db26f6a6eb	2025-09-11T15:39:12+02:00	Daniel Bevenius	ggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	2b3efea9a4d91216850856fbb77075db26f6a6eb	c0389dba43d50695f9d3f57dd1f1a14cbefc100c	2025-09-11T12:45:40+02:00	Charles Xu	kleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614)
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	c0389dba43d50695f9d3f57dd1f1a14cbefc100c	00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4	2025-09-11T15:59:37+08:00	hipudding	CANN: Disable acl_graph for prefill stage (#15933)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4	4f658855fa8f2e42b7ed9a5b298fa39a2e39b096	2025-09-10T22:04:03+02:00	Oliver Simons	CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872)
M	ggml/src/ggml-cuda/binbcast.cu
M	tests/test-backend-ops.cpp

commit	4f658855fa8f2e42b7ed9a5b298fa39a2e39b096	6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde	2025-09-11T02:51:51+08:00	Jie Fu (傅杰)	llama : support T5 models with unequal number of encoder-decoder layers (#15909)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde	9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c	2025-09-10T19:08:59+02:00	Sigbjørn Skjæret	graph : support non-contiguous Q in build_attn_mha (#15908)
M	src/llama-graph.cpp

commit	9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c	0f0a3c2851134d49955f3c85afbb0b1bb47c3e07	2025-09-10T17:31:40+02:00	Daniel Bevenius	ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
M	ggml/src/ggml-cpu/ops.cpp

commit	0f0a3c2851134d49955f3c85afbb0b1bb47c3e07	33daece86b65607451d0d4378d2d04ba6a20ad55	2025-09-10T17:52:35+03:00	Georgi Gerganov	metal : make the backend async (#15906)
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	33daece86b65607451d0d4378d2d04ba6a20ad55	e7b6d83b524bbc24a1343d862de6dba8e8eddbd6	2025-09-10T15:39:57+02:00	Daniel Bevenius	ci : add caching for ROCm installation in release workflow (#15924)
M	.github/workflows/release.yml

commit	e7b6d83b524bbc24a1343d862de6dba8e8eddbd6	2cfef4d117d67ab1dec002915b48a15d11ee1973	2025-09-10T14:17:09+02:00	Daniel Bevenius	tests : filter out no-ops from coverage report (#15900)
M	tests/test-backend-ops.cpp

commit	2cfef4d117d67ab1dec002915b48a15d11ee1973	09e72a037c77b6823fde9e1e4cf28e815b9c41ab	2025-09-10T12:51:28+01:00	j-k	media : add transparent icon svg and png [no ci] (#15891)
A	media/llama1-icon-transparent.png
A	media/llama1-icon-transparent.svg

commit	09e72a037c77b6823fde9e1e4cf28e815b9c41ab	10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f	2025-09-10T07:28:47-04:00	Jesse	gitignore : Ignore vim swap files in tests (#15901)
M	tests/.gitignore

commit	10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f	28b5f190ef1dbea5edf82dbc8b4407b721fadd13	2025-09-10T18:42:00+08:00	Chenguang Li	CANN: Add ROPE sin/cos cache for reuse (#15912)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	28b5f190ef1dbea5edf82dbc8b4407b721fadd13	86587da03bd78df8f4e7d8b111a0c1d2494d6ed0	2025-09-10T15:29:12+08:00	Chenguang Li	CANN: implement LRU cache for ACL graphs (#15814)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	86587da03bd78df8f4e7d8b111a0c1d2494d6ed0	ff02caf9eed261423289d1531a56536fbf57bfc2	2025-09-10T05:33:58+02:00	Daniel Bevenius	llama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893)
M	src/llama-context.cpp
M	src/llama.cpp

commit	ff02caf9eed261423289d1531a56536fbf57bfc2	ae355f6f7108540297d8b7f7ae71d20fe610a0b7	2025-09-10T05:23:19+02:00	Daniel Bevenius	ci : cache ROCm installation in windows-latest-cmake-hip (#15887)
M	.github/workflows/build.yml

commit	ae355f6f7108540297d8b7f7ae71d20fe610a0b7	4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b	2025-09-09T22:26:03+02:00	Ruben Ortlam	vulkan: throw the oom error instead of no memory type found (#15905)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b	17bc5a815f0bebc1844c99796760cd7df5e9b8d9	2025-09-09T07:41:15-05:00	Jeff Bolz	vulkan: Fix OOB accesses in soft_max_back (#15861)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max_back.comp
M	tests/test-backend-ops.cpp

commit	17bc5a815f0bebc1844c99796760cd7df5e9b8d9	ed54e32558ffe0f2c3b1d31f3227211fae05bd49	2025-09-09T14:04:43+02:00	Johannes Gäßler	HIP: use v_dot2_f32_f16 instruction for FA (#15884)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-tile.cu

commit	ed54e32558ffe0f2c3b1d31f3227211fae05bd49	a972faebed5fdc4a3d2a844d92d476058c02e02d	2025-09-09T15:01:15+03:00	lksj92hs	Workaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	a972faebed5fdc4a3d2a844d92d476058c02e02d	550cf726e133fd0a069d991287fd3a2a3e3e1cbd	2025-09-09T14:38:02+08:00	Aman Gupta	CUDA: Add mul_mat_id support for the mmf kernel (#15767)
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmf.cuh
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_1.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_10.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_11.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_12.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_13.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_14.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_15.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_16.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_2.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_3.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_4.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_5.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_6.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_7.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_8.cu
A	ggml/src/ggml-cuda/template-instances/mmf-instance-ncols_9.cu
M	tests/test-backend-ops.cpp

commit	550cf726e133fd0a069d991287fd3a2a3e3e1cbd	c252ce67c4b99f056eeb18d42a289e28fee03475	2025-09-09T08:11:01+02:00	Johannes Gäßler	CUDA: fix GET_ROWS for large tensors (#15882)
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	c252ce67c4b99f056eeb18d42a289e28fee03475	70cd37dbbebdb7a2f84f08207f18eabb0b291a55	2025-09-09T08:42:10+03:00	Georgi Gerganov	contrib : add notes about merging PRs (#15881)
M	CONTRIBUTING.md

commit	70cd37dbbebdb7a2f84f08207f18eabb0b291a55	acc1b008cfd95e63d5f99a370dbffb98e5a99d2c	2025-09-09T06:06:52+02:00	Daniel Bevenius	requirements : update transformers/torch for Embedding Gemma (#15828)
M	requirements/requirements-convert_hf_to_gguf.txt
M	requirements/requirements-convert_legacy_llama.txt
M	requirements/requirements-tool_bench.txt
M	tests/test-tokenizer-random.py
M	tools/mtmd/legacy-models/minicpmv-convert-image-encoder-to-gguf.py
M	tools/mtmd/requirements.txt
M	tools/server/tests/requirements.txt

commit	acc1b008cfd95e63d5f99a370dbffb98e5a99d2c	7057faf64b514e991e2f70147f82bb13d544b1c0	2025-09-09T06:05:55+02:00	Piotr Wilkin (ilintar)	model-conversion : add extra debugging support for model conversion (#15877)
M	examples/eval-callback/eval-callback.cpp
M	examples/model-conversion/requirements.txt
M	examples/model-conversion/scripts/causal/run-org-model.py

commit	7057faf64b514e991e2f70147f82bb13d544b1c0	fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b	2025-09-08T16:14:32-05:00	Aldehir Rojas	json : support `enum` values within `allOf` (#15830)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	tests/test-json-schema-to-grammar.cpp
M	tools/server/public_legacy/json-schema-to-grammar.mjs

commit	fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b	e68aa10d8f3d26fdad5b912540362d79de5460e3	2025-09-08T19:57:01+01:00	j-k	media : add llama1 icon (#15878)
A	media/llama1-icon.png
A	media/llama1-icon.svg

commit	e68aa10d8f3d26fdad5b912540362d79de5460e3	0a16bf52e6874369cb4fd2bdc4863ef984b688e7	2025-09-08T13:10:07-05:00	Jeff Bolz	vulkan: sort graph to allow more parallel execution (#15850)
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas/ggml-blas.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-zdnn/ggml-zdnn.cpp

commit	0a16bf52e6874369cb4fd2bdc4863ef984b688e7	88021565f08e0b7c4e07ac089a15ec16fae9166c	2025-09-09T01:23:46+08:00	Aman Gupta	CUDA: generate_cu_files.py - add missing mxfp4 (#15880)
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py

commit	88021565f08e0b7c4e07ac089a15ec16fae9166c	56920f56651908d5cce7a310dabf54ac4f6fbb7f	2025-09-08T10:59:48-04:00	Jesse	chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
M	common/chat.cpp
M	common/chat.h
M	models/templates/README.md
A	models/templates/deepseek-ai-DeepSeek-V3.1.jinja
M	tests/test-chat-parser.cpp
M	tests/test-chat.cpp

commit	56920f56651908d5cce7a310dabf54ac4f6fbb7f	b0d52998b962bd2681c34bf52af993af79f178b8	2025-09-08T21:50:05+07:00	Xuan-Son Nguyen	server : bring back timings_per_token (#15879)
M	tools/server/server.cpp

commit	b0d52998b962bd2681c34bf52af993af79f178b8	f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf	2025-09-08T13:56:51+03:00	Georgi Gerganov	cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml.c

commit	f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf	9fcb29f22f5c33c04c7f0daebb24057899d67a1a	2025-09-08T13:34:56+03:00	Georgi Gerganov	metal : refactor + optimize (#15857)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	9fcb29f22f5c33c04c7f0daebb24057899d67a1a	5ef22d281de9c5eaaf616874bc490b89241128cb	2025-09-08T17:33:01+07:00	Xuan-Son Nguyen	ggml: allow casting between f32 and i32 (#15783)
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	5ef22d281de9c5eaaf616874bc490b89241128cb	233d773d02c37982badddf3994e9953a175f34da	2025-09-08T11:55:44+02:00	Sigbjørn Skjæret	CUDA: non-contiguous src0 not supported for PAD (#15869)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	233d773d02c37982badddf3994e9953a175f34da	a885dcff11a7b73f9377812d6151f6b15d307de0	2025-09-08T09:44:34+02:00	Daniel Bevenius	convert : force setting sliding_window from original config (#15867)
M	convert_hf_to_gguf.py

commit	a885dcff11a7b73f9377812d6151f6b15d307de0	663027fd5490438ce9c27ea866a560e1e268d11f	2025-09-08T10:27:07+03:00	Georgi Gerganov	batched-bench : fix llama_synchronize usage during prompt processing (#15835)
M	tools/batched-bench/batched-bench.cpp

commit	663027fd5490438ce9c27ea866a560e1e268d11f	cf0e3ba1500bd23635b444f64ba23cbdb56c92ef	2025-09-08T10:26:36+03:00	Georgi Gerganov	context : fix n_outputs during reserve (#15858)
M	src/llama-context.cpp
M	src/llama-graph.cpp

commit	cf0e3ba1500bd23635b444f64ba23cbdb56c92ef	d413dca00360a7e4cb71441dacecfa32556fcc31	2025-09-08T10:25:33+03:00	Georgi Gerganov	model : avoid ggml_cont_3d for fused QKV weights (#15662)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-model.cpp

commit	d413dca00360a7e4cb71441dacecfa32556fcc31	85ca66a74676e6d5df4433016488e039a4b464ae	2025-09-07T23:23:41-05:00	Jeff Bolz	tests: large sizes for get_rows (#15687)
M	tests/test-backend-ops.cpp

commit	85ca66a74676e6d5df4433016488e039a4b464ae	3976dfbe00f02a62c0deca32c46138e4f0ca81d8	2025-09-08T10:03:29+08:00	Chenguang Li	CANN: Stream sync between devices for acl_graph (#15809)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	3976dfbe00f02a62c0deca32c46138e4f0ca81d8	d36e61c580bf7fc7879c443c542312a42b718e11	2025-09-07T13:50:26-05:00	Jeff Bolz	vulkan: support im2col_3d (#15795)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/im2col_3d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	d36e61c580bf7fc7879c443c542312a42b718e11	c97b5e5854b47b18a248d77edb693c63018a0865	2025-09-08T02:18:28+08:00	Aaron Teo	ggml-cpu: clean up s390x SIMD (#15855)
M	ggml/src/ggml-cpu/arch/s390/quants.c
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	c97b5e5854b47b18a248d77edb693c63018a0865	267e99867f09bec8bcc2e424ad9bcddd6cccf9d0	2025-09-07T12:00:49-05:00	Jeff Bolz	vulkan: Support pad_ext (#15794)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/pad.comp
M	tests/test-backend-ops.cpp

commit	267e99867f09bec8bcc2e424ad9bcddd6cccf9d0	3b15924d71237a43bb5ad71f5b885ee66a821342	2025-09-07T11:53:07-05:00	Jeff Bolz	vulkan: Use larger loads in scalar/coopmat1 matmul (#15729)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	3b15924d71237a43bb5ad71f5b885ee66a821342	79bc429262268ad2ac8a364cfe6c2d6b9c5f008a	2025-09-07T10:19:45+02:00	Daniel Bevenius	ggml WebGPU: remove userdata from request adapter callback (#15527)
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp

commit	79bc429262268ad2ac8a364cfe6c2d6b9c5f008a	c4df49a42d396bdf7344501813e7de53bc9e7bb3	2025-09-07T00:26:28+02:00	Johannes Gäßler	CUDA: faster tile FA (Pascal/AMD), headsize 256 (#15769)
D	ggml/src/ggml-cuda/fattn-tile-f16.cu
D	ggml/src/ggml-cuda/fattn-tile-f16.cuh
D	ggml/src/ggml-cuda/fattn-tile-f32.cu
D	ggml/src/ggml-cuda/fattn-tile-f32.cuh
A	ggml/src/ggml-cuda/fattn-tile.cu
A	ggml/src/ggml-cuda/fattn-tile.cuh
M	ggml/src/ggml-cuda/fattn.cu

commit	c4df49a42d396bdf7344501813e7de53bc9e7bb3	3c3635d2f20424d557b5b0605a2a356214ffe048	2025-09-06T16:08:43+02:00	Charles Xu	kleidiai: generalize compute_forward_kv_cache to compute_forward_fp16 (#15817)
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	3c3635d2f20424d557b5b0605a2a356214ffe048	61bdfd5298a78593be649a1035ee2a120b13c4f0	2025-09-06T19:45:24+07:00	Xuan-Son Nguyen	server : speed up tests (#15836)
M	scripts/tool_bench.py
M	tools/server/tests/unit/test_basic.py
M	tools/server/tests/unit/test_template.py
M	tools/server/tests/unit/test_tool_call.py
M	tools/server/tests/unit/test_vision_api.py
M	tools/server/tests/utils.py

commit	61bdfd5298a78593be649a1035ee2a120b13c4f0	01806e77714ae8a78130d432945b959a0956c56f	2025-09-06T18:35:04+07:00	Xuan-Son Nguyen	server : implement prompt processing progress report in stream mode (#15827)
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py

commit	01806e77714ae8a78130d432945b959a0956c56f	186415d59552bd5c90549cd8e9be3cc287621fd9	2025-09-06T13:28:44+02:00	Johannes Gäßler	ggml-cpu: document use of "free" memory [no ci] (#15834)
M	ggml/src/ggml-cpu/ggml-cpu.cpp

commit	186415d59552bd5c90549cd8e9be3cc287621fd9	fd621880f3fd908424e675a41715a2dc760247a2	2025-09-06T11:27:28+08:00	Aaron Teo	ggml-cpu: drop support for nnpa intrinsics (#15821)
M	docs/build-s390x.md
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/simd-mappings.h

commit	fd621880f3fd908424e675a41715a2dc760247a2	4281c7b315f8a904549fe527039b976e08098d1a	2025-09-05T17:32:39-06:00	Gabe Goodhart	aLoRA Support (#15327)
M	convert_lora_to_gguf.py
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama-adapter.cpp
M	src/llama-adapter.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	4281c7b315f8a904549fe527039b976e08098d1a	5fac79cbc77b6d12c9feb5f34fc63586b35fd561	2025-09-06T01:21:15+02:00	Sigbjørn Skjæret	ci : exempt correct research label (#15825)
M	.github/workflows/close-issue.yml

commit	5fac79cbc77b6d12c9feb5f34fc63586b35fd561	408ff524b40baf4f51a81d42a9828200dd4fcb6b	2025-09-05T14:31:24-06:00	Gabe Goodhart	Thinking model disabled assistant prefill (#15404)
M	common/chat.cpp
M	common/chat.h
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	408ff524b40baf4f51a81d42a9828200dd4fcb6b	5143fa895e7725c5bd2135daf7d8f793d98fa91c	2025-09-05T19:43:59+01:00	Eric Curtin	Implement --log-colors with always/never/auto (#15792)
M	common/arg.cpp
M	common/log.cpp
M	common/log.h

commit	5143fa895e7725c5bd2135daf7d8f793d98fa91c	3a550b5ca4565c9e28f63880d47840feb27d0ff6	2025-09-05T16:07:02+02:00	Johannes Gäßler	CUDA: fastdiv, launch bounds for mmvq + q8_1 quant (#15802)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/quantize.cu

commit	3a550b5ca4565c9e28f63880d47840feb27d0ff6	a81283820a466f2ace06ce4d4bc9512761f9365f	2025-09-05T14:49:21+02:00	Daniel Bevenius	tests : add --list-ops and --show-coverage options (#15745)
M	tests/test-backend-ops.cpp

commit	a81283820a466f2ace06ce4d4bc9512761f9365f	c610b6c11b1ef7d678671dcf15acd7187a7ad8f3	2025-09-05T11:34:28+02:00	Erik Scholz	gguf: gguf_writer refactor (#15691)
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	ggml/src/gguf.cpp

commit	c610b6c11b1ef7d678671dcf15acd7187a7ad8f3	5d6688de08e73acc2532d668380801ed79d704eb	2025-09-05T10:39:22+03:00	Georgi Gerganov	kv-cache : fix SWA checks + disable cacheless iSWA (#15811)
M	src/llama-graph.cpp
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-iswa.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-model.cpp

commit	dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842	87932ec016f0ec81e98a13ce5212851f8c12458a	2025-09-05T14:34:07+08:00	Yunzhe Jia	add calrt API used in server side
M	CMakeLists.txt
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	ggml/src/ggml-calrt/CMakeLists.txt
M	include/llama-cpp.h
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache-calrt-adapter.cpp
M	src/llama-sampling.cpp
M	src/llama.cpp

commit	5d6688de08e73acc2532d668380801ed79d704eb	4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6	2025-09-05T04:36:23+02:00	Daniel Bevenius	model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
M	examples/model-conversion/scripts/embedding/modelcard.template

commit	4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6	b2426e469e2fdb6c44216d56baa4cfff4f39ae00	2025-09-05T01:24:08+02:00	ExtReMLapin	chat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639)
M	common/chat.cpp

commit	b2426e469e2fdb6c44216d56baa4cfff4f39ae00	9e2b1e83c68a38ea0c64f726dd979439bd02189b	2025-09-05T01:22:22+02:00	Piotr Wilkin (ilintar)	chat : nemotron thinking & toolcalling support (#15676)
M	common/chat.cpp
M	common/chat.h
A	models/templates/NVIDIA-Nemotron-Nano-v2.jinja
M	tests/test-chat.cpp

commit	9e2b1e83c68a38ea0c64f726dd979439bd02189b	fb15d649ed14ab447eeab911e0c9d21e35fb243e	2025-09-05T01:05:12+02:00	Piotr Wilkin (ilintar)	scripts : add Jinja tester PySide6 simple app (#15756)
A	scripts/jinja/jinja-tester.py
A	scripts/jinja/requirements.txt

commit	fb15d649ed14ab447eeab911e0c9d21e35fb243e	856ed0947f27b4ec3ad269fceda0402fbab263d3	2025-09-04T18:10:29+02:00	Daniel Bevenius	llama : add support for EmbeddingGemma 300m (#15798)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-iswa.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-model.cpp

commit	856ed0947f27b4ec3ad269fceda0402fbab263d3	d1e2adba65208d6de3d7f6f23b00c562ff5bb777	2025-09-04T09:53:22-06:00	Gabe Goodhart	metal : Add template specialization for mul_mm_id w/ ne20 == 10 (#15799)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	d1e2adba65208d6de3d7f6f23b00c562ff5bb777	c1c354e44c06d259679bb5bb7a8fa9f0b28480e4	2025-09-04T15:40:44+02:00	Daniel Bevenius	llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
M	src/llama-context.cpp

commit	c1c354e44c06d259679bb5bb7a8fa9f0b28480e4	a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c	2025-09-04T20:20:14+08:00	Chenguang Li	CANN: Refactor ND to NZ workspace to be per-device (#15763)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c	badb80cadbc40e047b30c43611aba575fc8d6845	2025-09-04T11:50:23+02:00	Xuan-Son Nguyen	server: add exceed_context_size_error type (#15780)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py

commit	badb80cadbc40e047b30c43611aba575fc8d6845	0a1b3982cd0bd18730d50a693053b88c13fd04a6	2025-09-04T10:49:44+01:00	Eric Curtin	Document the new max GPU layers default in help (#15771)
M	common/arg.cpp

commit	0a1b3982cd0bd18730d50a693053b88c13fd04a6	5421f63ab08ca1e1a093662a5ccd0117e461185f	2025-09-04T16:38:49+08:00	leejet	ggml: add ops for WAN video model (cuda && cpu) (#15669)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/im2col.cu
M	ggml/src/ggml-cuda/im2col.cuh
M	ggml/src/ggml-cuda/pad.cu
M	ggml/src/ggml-cuda/scale.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	5421f63ab08ca1e1a093662a5ccd0117e461185f	820bc9853100708011036e10f40b923968dd9b66	2025-09-04T15:12:30+08:00	hipudding	CANN: Fix precision issue on 310I DUO multi-devices (#15784)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	820bc9853100708011036e10f40b923968dd9b66	239b60e8986bbcb944f57311a02ac994431bf652	2025-09-04T08:30:28+02:00	rmatif	opencl: add hs=40 to FA (#15758)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	239b60e8986bbcb944f57311a02ac994431bf652	dff7551bfdbdd6e57c13e523d7dcca317640e907	2025-09-04T11:03:02+08:00	Chenguang Li	CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	dff7551bfdbdd6e57c13e523d7dcca317640e907	0fce7a1248b74148c1eb0d368b7e18e8bcb96809	2025-09-03T22:55:10+02:00	Ruben Ortlam	vulkan: fix mmv subgroup16 selection (#15775)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	0fce7a1248b74148c1eb0d368b7e18e8bcb96809	8227695d7a3e5b357cb37fad263f00a8ca6db710	2025-09-03T13:33:15-05:00	Jeff Bolz	vulkan: don't use std::string in load_shaders, to improve compile time (#15724)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	8227695d7a3e5b357cb37fad263f00a8ca6db710	0014fb4add3a7d000c14b763538045c6170f57d9	2025-09-03T20:24:50+02:00	Daniel Bevenius	vulkan : update ggml_vk_instance_validation_ext_available (#15666)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	0014fb4add3a7d000c14b763538045c6170f57d9	661ae31c9c68201577e70278285b349a5a662caf	2025-09-04T03:22:55+09:00	Shin-myoung-serp	ggml vulkan: add hardsigmoid and hardswish operations (#15762)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/hardsigmoid.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/hardswish.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	661ae31c9c68201577e70278285b349a5a662caf	407c23786dd0d3a503e9429eead96e611d3950c9	2025-09-03T19:59:16+02:00	Oliver Simons	CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/norm.cu

commit	407c23786dd0d3a503e9429eead96e611d3950c9	cdedb70a998cea7052560fe0b0615a839443564d	2025-09-03T18:28:36+02:00	Daniel Bevenius	model-conversion : fix pyright errors (#15770)
M	examples/model-conversion/scripts/causal/run-casual-gen-embeddings-org.py
M	examples/model-conversion/scripts/utils/inspect-org-model.py

commit	cdedb70a998cea7052560fe0b0615a839443564d	2c8dac72eb6acd4e20c0da251535dfc46d35178b	2025-09-03T18:16:26+03:00	Georgi Gerganov	sampling : optimize dist sampler (#15704)
M	src/llama-sampling.cpp

commit	2c8dac72eb6acd4e20c0da251535dfc46d35178b	40a751ea9a94364da73537b86502a808ebe1fc3a	2025-09-03T13:35:49+02:00	Daniel Bevenius	llama : fix incorrect model type for  Gemma 270M (#15764)
M	src/llama-model.cpp
M	src/llama-model.h

commit	40a751ea9a94364da73537b86502a808ebe1fc3a	5eae9348835037046f33fafd852df7c952c95209	2025-09-03T12:50:47+02:00	Daniel Bevenius	model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765)
M	examples/model-conversion/Makefile
M	examples/model-conversion/scripts/causal/compare-embeddings-logits.sh
M	examples/model-conversion/scripts/causal/convert-model.sh
R100	examples/model-conversion/scripts/causal/run-casual-gen-embeddings-org.sh	examples/model-conversion/scripts/causal/run-casual-gen-embeddings-org.py
M	examples/model-conversion/scripts/causal/run-converted-model-embeddings-logits.sh
M	examples/model-conversion/scripts/causal/run-converted-model.sh
M	examples/model-conversion/scripts/embedding/compare-embeddings-logits.sh
M	examples/model-conversion/scripts/embedding/convert-model.sh
M	examples/model-conversion/scripts/embedding/run-converted-model.sh
M	examples/model-conversion/scripts/utils/create-collection-add-model.sh
M	examples/model-conversion/scripts/utils/curl-embedding-server.sh
M	examples/model-conversion/scripts/utils/inspect-converted-model.sh
M	examples/model-conversion/scripts/utils/perplexity-gen.sh
M	examples/model-conversion/scripts/utils/perplexity-run-simple.sh
M	examples/model-conversion/scripts/utils/perplexity-run.sh
M	examples/model-conversion/scripts/utils/quantize.sh
M	examples/model-conversion/scripts/utils/run-embedding-server.sh

commit	5eae9348835037046f33fafd852df7c952c95209	05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6	2025-09-03T16:46:01+08:00	hipudding	CANN: Add RoPE contiguous check for 310I DUP device (#15735)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6	8c3fdf44ecf08335942f2ba558955f55e88c7991	2025-09-03T16:16:21+08:00	xctan	ggml-cpu : optimize RVV kernels (#15720)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/arch/riscv/quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	8c3fdf44ecf08335942f2ba558955f55e88c7991	f6da8cb86a28f0319b40d9d2a957a26a7d875f8c	2025-09-03T09:48:35+02:00	Daniel Bevenius	model-conversion : add missing curl script [no ci] (#15761)
A	examples/model-conversion/scripts/utils/curl-embedding-server.sh

commit	f6da8cb86a28f0319b40d9d2a957a26a7d875f8c	8a2234ea0c89f212190c176d741b7742f0082582	2025-09-03T14:08:22+08:00	hipudding	CANN: Mask unsupported TRANSPOSE_1D operator (#15733)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	8a2234ea0c89f212190c176d741b7742f0082582	3de008208b9b8a33f49f979097a99b4d59e6e521	2025-09-03T10:43:53+08:00	Chenguang Li	CANN: Fix type float_t to float (#15736)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	3de008208b9b8a33f49f979097a99b4d59e6e521	69db8a52e6dd0db81ec05c581150cc1e43b8ac46	2025-09-03T03:27:30+08:00	SnA1lGo	fix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754)
M	ggml/src/gguf.cpp

commit	69db8a52e6dd0db81ec05c581150cc1e43b8ac46	c466abe1587bde458c806e2134e37750f2edf8fb	2025-09-02T19:40:37+02:00	Oliver Simons	chore: Update `.clang-format` to use `BinPackArguments=true` (#15744)
M	.clang-format

commit	c466abe1587bde458c806e2134e37750f2edf8fb	0a2a3841e8ebc570da343e8cf58a21c1010b41e7	2025-09-02T18:17:26+02:00	Johannes Gäßler	llama: -fa 1/0/-1 aliases for -fa on/off/auto (#15746)
M	common/arg.cpp

commit	0a2a3841e8ebc570da343e8cf58a21c1010b41e7	9961d244f2df6baf40af2f1ddc0927f8d91578c8	2025-09-02T16:02:26+02:00	Ruben Ortlam	vulkan: fix shaders gen when no integer dot is available (#15740)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9961d244f2df6baf40af2f1ddc0927f8d91578c8	25f1045f07cf0daf667d63e35618842e3174a8c7	2025-09-02T17:12:37+08:00	hipudding	CANN: Resolve soft_max precision issue (#15730)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	25f1045f07cf0daf667d63e35618842e3174a8c7	97669e40735d08db65ef094a8faae8e8411a97db	2025-09-02T01:37:01-05:00	Jeff Bolz	vulkan: Fix macro parameter order for f32 matmul shaders (#15716)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	97669e40735d08db65ef094a8faae8e8411a97db	2f853687b3bce15e143a22f678d1715060fd606c	2025-09-02T08:26:53+02:00	rmatif	opencl: add attn sinks support for FA kernels (#15706)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/flash_attn_f16.cl
M	ggml/src/ggml-opencl/kernels/flash_attn_f32.cl
M	ggml/src/ggml-opencl/kernels/flash_attn_f32_f16.cl

commit	2f853687b3bce15e143a22f678d1715060fd606c	ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7	2025-09-02T14:07:48+08:00	Chenguang Li	CANN: Support eager execution mode under ACL graph compilation (#15712)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7	5d804a4938d896f9089687a8b99911cdb43b0b94	2025-09-02T14:05:23+08:00	hipudding	CANN: Support ext_factor in rope (#15710)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	5d804a4938d896f9089687a8b99911cdb43b0b94	d4d8dbe383e8b9600cbe8b42016e3a4529b51219	2025-09-02T01:14:55+02:00	Johannes Gäßler	ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
M	ggml/src/ggml-backend.cpp

commit	d4d8dbe383e8b9600cbe8b42016e3a4529b51219	35a42edac84690990a75726898d975cd08d220c0	2025-09-01T22:17:42+03:00	Gilad S.	vulkan: use memory budget extension to read memory usage (#15545)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	35a42edac84690990a75726898d975cd08d220c0	fec7911f8febb22c27ce1acb12441800da24cc06	2025-09-01T14:01:10-05:00	Jeff Bolz	vulkan: add missing clamps in new mul_mat_id paths (#15702)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	fec7911f8febb22c27ce1acb12441800da24cc06	078ce23ea77988f2fe1a42afb18d58bc084d55fa	2025-09-01T20:58:35+02:00	Ruben Ortlam	vulkan: disable large mmv subgroups on older Nvidia GPUs (#15717)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	078ce23ea77988f2fe1a42afb18d58bc084d55fa	a0c2b207c596d1092a08615de61ab56a7d63515f	2025-09-02T03:13:49+09:00	s-goto-11	ggml: SVE support for exponential functions (#15145)
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	a0c2b207c596d1092a08615de61ab56a7d63515f	4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997	2025-09-01T23:43:16+05:30	Prashant Vithule	ggml: aarch64: Implement SVE F16 kernels for vector functions  (#15115)
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997	02c1813517412f3e00aa6ca7c0273fea64edb492	2025-09-01T23:53:31+08:00	Jie Fu (傅杰)	convert : remove redundant code (#15708)
M	convert_hf_to_gguf.py

commit	02c1813517412f3e00aa6ca7c0273fea64edb492	77dee9de97be75b7143a213bc48893e0c0b29af7	2025-09-01T16:19:07+02:00	Ruben Ortlam	Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vecq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/quantize_q8_1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	77dee9de97be75b7143a213bc48893e0c0b29af7	4795c91c32fec7165a1364763d4d4f0c93abf933	2025-09-01T14:28:49+02:00	Daniel Bevenius	ggml : WebGPU add TRANSPOSE and RESHAPE to supported ops (#15695)
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp

commit	4795c91c32fec7165a1364763d4d4f0c93abf933	b66df9d9c942254d03209186ef24ed7c994a576e	2025-09-01T15:34:59+08:00	Jie Fu (傅杰)	docs : add Hunyuan to models section (#15707)
M	README.md

commit	b66df9d9c942254d03209186ef24ed7c994a576e	b9382c3877c6067feccf182efe9449a2d1cb24c7	2025-09-01T06:55:06+05:30	Akarshan Biswas	CUDA: fix build error from ambiguous __half conversions in conv2d (#15690)
M	ggml/src/ggml-cuda/conv2d.cu

commit	b9382c3877c6067feccf182efe9449a2d1cb24c7	3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4	2025-09-01T08:57:23+08:00	hipudding	CANN: Optimize MUL_MAT_ID (#15658)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4	e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa	2025-09-01T08:57:00+08:00	hipudding	CANN: fix RoPE cache issue on multi-device (#15629)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa	0d161f021aa33ec0e90cce96f5d1a88925557327	2025-08-31T20:41:02+03:00	Georgi Gerganov	sampling : optimize samplers by reusing bucket sort (#15665)
M	common/sampling.cpp
M	common/sampling.h
M	common/speculative.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp
M	tools/server/server.cpp
M	tools/tts/tts.cpp

commit	0d161f021aa33ec0e90cce96f5d1a88925557327	4efd5a83163ff383285b3a4c2106feabf5c69557	2025-08-31T20:11:58+03:00	Georgi Gerganov	server : enable /slots by default and make it secure (#15630)
M	common/arg.cpp
M	common/common.h
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/tests/utils.py

commit	4efd5a83163ff383285b3a4c2106feabf5c69557	274966226f87f301ac132da898280ca3142b60e5	2025-08-31T19:43:30+03:00	Georgi Gerganov	metal : fix checks for available FA kernels (#15700)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	274966226f87f301ac132da898280ca3142b60e5	9777032dccd67bdc7785aeab7497014a8be8dacc	2025-08-31T08:47:05-07:00	Diego Devesa	llama : fix fattn reserve call n_seqs parameter (#15699)
M	src/llama-context.cpp

commit	9777032dccd67bdc7785aeab7497014a8be8dacc	7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7	2025-08-31T06:49:03-07:00	Diego Devesa	llama : separate compute buffer reserve from fattn check (#15696)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend.cpp
M	src/llama-context.cpp
M	src/llama-context.h

commit	7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7	bbbf5ecccb35286521f735239d499eec4279a840	2025-08-31T15:30:20+02:00	Sigbjørn Skjæret	ci : explicitly set fa off or on (#15692)
M	ci/run.sh

commit	bbbf5ecccb35286521f735239d499eec4279a840	c37052ab4d6d1ae73c0e90bc6e560cc6409e1311	2025-08-31T03:13:27-05:00	Jeff Bolz	vulkan: handle large sizes for get_rows (#15686)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp

commit	c37052ab4d6d1ae73c0e90bc6e560cc6409e1311	5c16b9c87d840e4d5d55fa83c732c6b693346f40	2025-08-31T02:06:43-05:00	Jeff Bolz	vulkan: mul_mat_id coopmat2 optimizations (#15546)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	5c16b9c87d840e4d5d55fa83c732c6b693346f40	b97c9edc59d4a1b4069991aa670411190f4f3a3e	2025-08-31T08:46:42+02:00	Daniel Bevenius	vulkan : remove unused portability_enumeration_ext variable (#15679)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	b97c9edc59d4a1b4069991aa670411190f4f3a3e	94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0	2025-08-31T01:30:54-05:00	Jeff Bolz	vulkan: Allow fallback to sysmem memory when vidmem is full (#15649)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0	4d74393bcc956ccd7df68a6a06d1a0575cfa712c	2025-08-31T01:27:57-05:00	Jeff Bolz	vulkan: clamp matmul and FA results to the max finite value (#15652)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	4d74393bcc956ccd7df68a6a06d1a0575cfa712c	dd892555b0681b7f56d38780f6fdfe00a195160f	2025-08-30T18:03:42+02:00	Charles Xu	ggml: update kleidiai to v1.13.0 (#15663)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kernels.cpp
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	dd892555b0681b7f56d38780f6fdfe00a195160f	e81b8e4b7f5ab870836fad26d154a7507b341b36	2025-08-30T08:51:28-07:00	Diego Devesa	Update build.md to remove MSVC arm64 notes (#15684)
M	docs/build.md

commit	e81b8e4b7f5ab870836fad26d154a7507b341b36	38ad381f9f5d4dd368a96d844fb19cf501ed9d22	2025-08-30T16:32:10+02:00	Johannes Gäßler	llama: use FA + max. GPU layers by default (#15434)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/diffusion/diffusion-cli.cpp
M	ggml/src/ggml-backend.cpp
M	include/llama.h
M	scripts/server-bench.py
M	scripts/tool_bench.py
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-impl.h
M	src/llama-model.cpp
M	src/llama.cpp
M	tools/batched-bench/batched-bench.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/server/tests/unit/test_ctx_shift.py
M	tools/server/tests/unit/test_speculative.py
M	tools/server/tests/utils.py

commit	38ad381f9f5d4dd368a96d844fb19cf501ed9d22	696fccf354e9dbdfbce135bc40b44c9dcc64dda9	2025-08-30T16:20:32+02:00	Johannes Gäßler	CUDA: use FP32 arithmetic for conv2d (#15683)
M	ggml/src/ggml-cuda/conv2d.cu

commit	696fccf354e9dbdfbce135bc40b44c9dcc64dda9	ef476916bba4b44f44be0c98babc1cb025968e75	2025-08-30T04:11:22-05:00	Jeff Bolz	vulkan: Skip syncing for prealloc_y when it is reused (#15544)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	ef476916bba4b44f44be0c98babc1cb025968e75	d82f6aa34a216f5df1945cdfe121ba5e6cd80be0	2025-08-30T10:18:35+08:00	Chenguang Li	CANN: FIx compiler warnings (#15661)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	d82f6aa34a216f5df1945cdfe121ba5e6cd80be0	3d16b29c3bb1ec816ac0e782f20d169097063919	2025-08-30T00:12:53+02:00	Sergey Alirzaev	server : removed obsolete doc (#15670)
M	tools/server/README.md

commit	3d16b29c3bb1ec816ac0e782f20d169097063919	792b44f2ed9668cce7f267ff0ae4950ed9b4a5de	2025-08-29T22:04:08+02:00	Johannes Gäßler	scripts: strip "AMD Instinct" from GPU name (#15668)
M	scripts/compare-llama-bench.py

commit	792b44f2ed9668cce7f267ff0ae4950ed9b4a5de	81017865ee444cf49ce0136f2be1e41a0270ff91	2025-08-29T19:25:40+02:00	ExtReMLapin	server : add documentation for `parallel_tool_calls` param (#15647)
M	docs/function-calling.md
M	tools/server/README.md

commit	81017865ee444cf49ce0136f2be1e41a0270ff91	60e5eee31f1af9bb579ac45380e3857d610020b9	2025-08-29T21:30:06+08:00	Aman Gupta	CUDA: fix bug in rms_norm fusion (#15660)
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu

commit	60e5eee31f1af9bb579ac45380e3857d610020b9	009b709d6efd24820ac67765ed339a72dc797814	2025-08-29T14:53:41+02:00	Piotr Wilkin (ilintar)	chat : Seed OSS thinking + tool call support (#15552)
M	common/chat.cpp
M	common/chat.h
A	models/templates/ByteDance-Seed-OSS.jinja
M	tests/test-chat.cpp

commit	009b709d6efd24820ac67765ed339a72dc797814	e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2	2025-08-29T11:35:58+08:00	Aman Gupta	CUDA: fuse adds, fuse add with rms norm (#15631)
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/binbcast.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-cuda/norm.cuh

commit	e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2	a8bca68f727844e7dcf24a956003b3c2039ea563	2025-08-28T18:39:31-06:00	Gabe Goodhart	nvidia nemotron nano v2 (nemotronh) (#15507)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model-loader.cpp
M	src/llama-model.cpp

commit	a8bca68f727844e7dcf24a956003b3c2039ea563	c97dc093912ad014f6d22743ede0d4d7fd82365a	2025-08-28T15:27:36-05:00	Gabe Goodhart	fix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637)
M	examples/eval-callback/eval-callback.cpp

commit	c97dc093912ad014f6d22743ede0d4d7fd82365a	6c442f42ff25564a0cd6b1435d9abc1b0178eac5	2025-08-29T00:03:03+05:30	mnehete32	CUDA: add conv2d (#15635)
A	ggml/src/ggml-cuda/conv2d.cu
A	ggml/src/ggml-cuda/conv2d.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	6c442f42ff25564a0cd6b1435d9abc1b0178eac5	73804145ab6c06888e314046abf08f66a0133679	2025-08-28T22:39:27+08:00	Aaron Teo	ggml-cpu: fix invalid hsum build in debug s390x (#15634)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	73804145ab6c06888e314046abf08f66a0133679	c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a	2025-08-28T10:11:36-04:00	compilade	ggml : fix SSM_SCAN for n_groups > 1 (#15625)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/ssm-scan.cu
M	ggml/src/ggml-metal/ggml-metal.metal

commit	c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a	84ab83cc0b4b7e769451ee48e4c7d1acef91ef25	2025-08-28T17:09:05+03:00	Georgi Gerganov	kv-cache : fix find_slot to not search for continuous slot (#15638)
M	src/llama-kv-cache.cpp

commit	84ab83cc0b4b7e769451ee48e4c7d1acef91ef25	55042b3692cb1467c9ee15c62c4a9fbf180f89e3	2025-08-28T15:49:50+02:00	Sigbjørn Skjæret	model : jina-embeddings-v3 support (#13693)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama-adapter.cpp
M	src/llama-adapter.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp
M	tools/server/server.cpp

commit	55042b3692cb1467c9ee15c62c4a9fbf180f89e3	8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc	2025-08-28T19:23:22+08:00	Aman Gupta	scripts: add sqlite3 check for compare-commits.sh (#15633)
M	scripts/compare-commits.sh

commit	8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc	64387f6e95434b393ac3df285864692b7fd9c4d2	2025-08-28T12:27:02+03:00	Georgi Gerganov	kv-cache : remove LLAMA_SET_ROWS checks (#15505)
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h

commit	64387f6e95434b393ac3df285864692b7fd9c4d2	d35a1e8c41f747548775225973a99507896a8c61	2025-08-28T10:56:41+02:00	Aleksei Nikiforov	gguf-py: byteswapping improvements (#12851)
M	gguf-py/gguf/scripts/gguf_convert_endian.py

commit	d35a1e8c41f747548775225973a99507896a8c61	46d9caa27a0281150e8cf082308c0f9e7576ebe5	2025-08-28T01:48:20-06:00	Joshua Cogliati	cli : change log to warning to explain reason for stopping (#15604)
M	tools/main/main.cpp

commit	46d9caa27a0281150e8cf082308c0f9e7576ebe5	5a0e3ef6f00c658fbae53797f02d5a360ebf8fec	2025-08-28T09:26:48+02:00	Daniel Bevenius	model-conversion : add mmproj conversion target (#15628)
M	examples/model-conversion/Makefile
M	examples/model-conversion/scripts/causal/convert-model.sh

commit	5a0e3ef6f00c658fbae53797f02d5a360ebf8fec	fbef0fad7a7c765939f6c9e322fa05cd52cf0c15	2025-08-27T17:32:36-07:00	matiaslin	cuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	fbef0fad7a7c765939f6c9e322fa05cd52cf0c15	da54f9f1a2db07aaae390024ac466e7867685d94	2025-08-27T20:58:09+02:00	Johannes Gäßler	server: higher timeout for tests (#15621)
M	tools/server/tests/utils.py

commit	da54f9f1a2db07aaae390024ac466e7867685d94	47373271f971aa5a0a6462b286f4a7b5bd4ba644	2025-08-27T15:48:07+03:00	Georgi Gerganov	presets : add qwen3-30B-a3b FIM (#15616)
M	common/arg.cpp

commit	47373271f971aa5a0a6462b286f4a7b5bd4ba644	1bded5a3b3376b2aa3ba2f11ade5910c550f354b	2025-08-27T13:58:54+02:00	uvos	HIP: Enable support for ggml_backend_cuda_register_host_buffer (#15615)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	1bded5a3b3376b2aa3ba2f11ade5910c550f354b	1e7489745a74996fc36e8fd05b73aa16bc184e0c	2025-08-27T13:55:12+03:00	Georgi Gerganov	kv-cache : better estimate of n_kv for multi-sequence batches (#15610)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h

commit	1e7489745a74996fc36e8fd05b73aa16bc184e0c	1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4	2025-08-27T17:21:41+08:00	Chenguang Li	CANN: refactor mask handling and improve performance in FA (#15561)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4	fcca2182a18c786c57d02d1d1927204b133f1fdc	2025-08-27T16:44:22+08:00	xctan	ggml-cpu : add basic RVV support for vector f32 ops (#15057)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	fcca2182a18c786c57d02d1d1927204b133f1fdc	86076f92de1a547ef87c304facca3b4b9fae6c21	2025-08-27T10:28:53+02:00	Daniel Bevenius	common : add -m to bash completion for --model [no ci] (#15591)
M	common/arg.cpp

commit	86076f92de1a547ef87c304facca3b4b9fae6c21	bcbddcd54f0d5c22eab180831fdea6484107112f	2025-08-27T08:36:05+02:00	rmatif	OpenCL: add fused group_norm/norm, mul, add (#15314)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/group_norm.cl
M	ggml/src/ggml-opencl/kernels/norm.cl
M	tests/test-backend-ops.cpp

commit	87932ec016f0ec81e98a13ce5212851f8c12458a	0115cfb7c1dec0753aecb34f3af4338bf9de8eeb	2025-08-27T14:29:18+08:00	Yunzhe Jia	fix merge problem
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	gguf-py/examples/cal_test.gguf
M	gguf-py/examples/writer_cal_test.py
M	src/CMakeLists.txt
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-calrt.cpp
M	src/llama-calrt.h
M	src/llama-context.h
M	src/llama-hparams.h
M	src/llama-kv-cache-calrt-adapter.cpp
M	src/llama-kv-cache-calrt-adapter.h
D	src/llama-kv-cache-unified.cpp
D	src/llama-kv-cache-unified.h
M	src/llama-model.cpp

commit	bcbddcd54f0d5c22eab180831fdea6484107112f	8b696861364360770e9f61a3422d32941a477824	2025-08-26T13:14:38-07:00	Diego Devesa	tests : fix test-opt with GGML_BACKEND_DL (#15599)
M	tests/test-opt.cpp

commit	8b696861364360770e9f61a3422d32941a477824	8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3	2025-08-27T00:27:49+05:30	Akarshan Biswas	SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3	44b1efa41acd4df3f56ee0e46f898135ecd1a054	2025-08-26T20:05:50+02:00	fidoriel	mtmd : fix mtmd ios build (#15579)
M	tools/mtmd/CMakeLists.txt

commit	44b1efa41acd4df3f56ee0e46f898135ecd1a054	a6a58d64785cb458ed9de52f391aa38142d38d64	2025-08-26T15:42:49Z	Eve	tests: add performance test for mul mat id (#15543)
M	tests/test-backend-ops.cpp

commit	a6a58d64785cb458ed9de52f391aa38142d38d64	0373486dbc0dccbdcb3b5fdd65759d88cec06196	2025-08-26T21:05:25+05:30	shalinib-ibm	llamafile: PowerPC Sgemm Optimization (#15558)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	0373486dbc0dccbdcb3b5fdd65759d88cec06196	62cef26ac5b6b7acb635d3dc963813b43952dc2b	2025-08-26T17:45:17+03:00	Georgi Gerganov	graph : fix assert in memory-less build_attn (#15590)
M	src/llama-graph.cpp

commit	62cef26ac5b6b7acb635d3dc963813b43952dc2b	8f5afa94c4f929da71f560db7c9f38ef6a783d95	2025-08-26T16:12:29+02:00	Daniel Bevenius	model-conversion : add qat-q4 quantization targets (#15588)
M	examples/model-conversion/Makefile
M	examples/model-conversion/README.md
M	examples/model-conversion/scripts/utils/quantize.sh

commit	8f5afa94c4f929da71f560db7c9f38ef6a783d95	b3964c1e890ef8c947afb36a5124ce6fcb2136d4	2025-08-26T16:01:20+02:00	Johannes Gäßler	CUDA: return -1 for nonexistent compiled arch (#15587)
M	ggml/src/ggml-cuda/common.cuh

commit	b3964c1e890ef8c947afb36a5124ce6fcb2136d4	79a546220c719e6a70627b243a478ab8d84dc9e1	2025-08-26T14:22:14+03:00	Georgi Gerganov	metal : optimize FA vec for large sequences and BS <= 8 (#15566)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tools/batched-bench/batched-bench.cpp

commit	79a546220c719e6a70627b243a478ab8d84dc9e1	85cc1ae998e4898d9fa992cb9b8620338cee97bf	2025-08-26T12:54:19+02:00	Xuan-Son Nguyen	mtmd : support Kimi VL model (#15458)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/tests.sh

commit	85cc1ae998e4898d9fa992cb9b8620338cee97bf	1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c	2025-08-26T12:47:00+03:00	Georgi Gerganov	context : print graph stats for memory-less contexts (#15586)
M	src/llama-context.cpp

commit	1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c	c4e9239064a564de7b94ee2b401ae907235a8fca	2025-08-26T12:46:15+03:00	Georgi Gerganov	metal : improve `MUL_MAT_ID` (#15541)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	c4e9239064a564de7b94ee2b401ae907235a8fca	39842a7f73012eb42816ca4f26411782bd3da7c5	2025-08-26T16:05:55+08:00	tc-mb	model : support MiniCPM-V 4.5 (#15575)
M	docs/multimodal/minicpmv4.0.md
A	docs/multimodal/minicpmv4.5.md
M	tools/mtmd/clip.cpp
M	tools/mtmd/legacy-models/minicpmv-convert-image-encoder-to-gguf.py
M	tools/mtmd/mtmd.cpp

commit	0115cfb7c1dec0753aecb34f3af4338bf9de8eeb	3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e	2025-08-26T15:19:56+08:00	Yunzhe Jia	Merge branch 'master' into dev
commit	39842a7f73012eb42816ca4f26411782bd3da7c5	0fd90db5858e325358a5fbdaa4e327ee2a79d0d4	2025-08-26T09:08:08+02:00	Sigbjørn Skjæret	gguf-py : remove erroneous FFN_GATE entry (#15583)
M	gguf-py/gguf/tensor_mapping.py

commit	0fd90db5858e325358a5fbdaa4e327ee2a79d0d4	4c37636b3ea96f2574eeb7668b93fcc0e64b05dd	2025-08-26T08:51:43+02:00	Sigbjørn Skjæret	metal : remove contiguous assertion for src0 in IM2COL (#15577)
M	ggml/src/ggml-metal/ggml-metal.m

commit	4c37636b3ea96f2574eeb7668b93fcc0e64b05dd	34bdbbd7c2b70b848718e95bc48010f6aecd2816	2025-08-26T13:15:33+07:00	Yoshi_likes_e4	Add a warning for special devices (#15563)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	34bdbbd7c2b70b848718e95bc48010f6aecd2816	74f52f77f28a5ad6d6075231afcb8d1ad763ca32	2025-08-25T23:42:44-05:00	Jeff Bolz	vulkan: Remove splitting for mul_mat_id (#15568)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	tests/test-backend-ops.cpp

commit	74f52f77f28a5ad6d6075231afcb8d1ad763ca32	f7207b0415986dd7f48447149da7de3a82338276	2025-08-26T05:21:22+08:00	Qeeweew	CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451)
M	ggml/src/ggml-cuda/vecdotq.cuh

commit	f7207b0415986dd7f48447149da7de3a82338276	4d917cd4f64cc37744e76d084659475819fb0728	2025-08-25T14:18:09-07:00	lhez	opencl: fix support ops condition for `rms_norm` (#15560)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	4d917cd4f64cc37744e76d084659475819fb0728	886b97a5d693550c2da470c091d9d27bf38398f8	2025-08-25T17:56:59+02:00	Ruben Ortlam	vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	886b97a5d693550c2da470c091d9d27bf38398f8	111f8d06f0b9169059779a35f655b343242ccbb6	2025-08-25T10:47:16-05:00	Jeff Bolz	tests: Generate unique input values for count_equal (#15487)
M	tests/test-backend-ops.cpp

commit	111f8d06f0b9169059779a35f655b343242ccbb6	5eff6ec9b1220b599a43b594b1110487ab6aca08	2025-08-25T11:27:34-04:00	Ihar Hrachyshka	metal: fix regression when no metal devices are present (#15531)
M	ggml/src/ggml-metal/ggml-metal.m

commit	5eff6ec9b1220b599a43b594b1110487ab6aca08	dfd9b5f6c7586c88588f06a644c131bec071a0a1	2025-08-25T17:23:40+02:00	Johannes Gäßler	CUDA: MoE helper in device code, better tile sizes (#15525)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/vendors/hip.h

commit	dfd9b5f6c7586c88588f06a644c131bec071a0a1	5a6bc6b1a6cb665a944426c2055794950e524bf5	2025-08-25T15:00:43+02:00	Daniel Bevenius	model-conversion : set pooling type to none in logits.cpp (#15564)
M	examples/model-conversion/logits.cpp

commit	5a6bc6b1a6cb665a944426c2055794950e524bf5	6b64f74b55628e4193f4fb00313f07dbd8556528	2025-08-25T14:25:25+02:00	Daniel Bevenius	model-conversion : add model card template for embeddings [no ci] (#15557)
M	examples/model-conversion/Makefile
M	examples/model-conversion/README.md
R100	examples/model-conversion/scripts/readme.md.template	examples/model-conversion/scripts/causal/modelcard.template
A	examples/model-conversion/scripts/embedding/modelcard.template
M	examples/model-conversion/scripts/utils/hf-create-model.py

commit	6b64f74b55628e4193f4fb00313f07dbd8556528	0d5a470223fc90b6b6807921d68011ff06ae7f9e	2025-08-25T13:56:43+03:00	Georgi Gerganov	batched-bench : fix unified KV cache handling + pp timing (#15562)
M	tools/batched-bench/batched-bench.cpp

commit	0d5a470223fc90b6b6807921d68011ff06ae7f9e	b0ba31f525a2ad7fb539660be0c8f088c9869f6a	2025-08-25T17:15:06+08:00	Weizhao Ouyang	convert : update Ernie 4.5 dense architecture name (#15555)
M	convert_hf_to_gguf.py

commit	b0ba31f525a2ad7fb539660be0c8f088c9869f6a	7da9fed0d6f1750a8783436f6f313b87e76e6378	2025-08-25T10:14:48+03:00	Georgi Gerganov	metal : add FA kernels for HS=40 (#15559)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	7da9fed0d6f1750a8783436f6f313b87e76e6378	c247d06f38fc09059c9607a28aa44f5ff6be208d	2025-08-25T14:32:16+08:00	RunningLeon	convert : support interns1-mini (#15412)
M	convert_hf_to_gguf.py

commit	c247d06f38fc09059c9607a28aa44f5ff6be208d	043fb27d3808766d8ea8195bbd12359727264402	2025-08-25T10:32:21+08:00	Chenguang Li	CANN: ROPE cache sin/cos repeat (#15501)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h

commit	043fb27d3808766d8ea8195bbd12359727264402	b730706a49e576fb882dc34d9966345778b3ab0b	2025-08-24T19:36:36+02:00	Ruben Ortlam	vulkan: apply MUL_MAT_ID subgroup optimization to non-coopmat devices (#15524)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	b730706a49e576fb882dc34d9966345778b3ab0b	c9a24fb93208fbbd3da6d903eb75431bfa97e59e	2025-08-24T13:07:07+03:00	Georgi Gerganov	kv-cache : support layer reuse (#15504)
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-iswa.cpp
M	src/llama-kv-cache-iswa.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	src/llama-model.cpp

commit	c9a24fb93208fbbd3da6d903eb75431bfa97e59e	a9c6ffcbfacee092bfaaa400306fceda18199737	2025-08-24T04:24:25-05:00	Jeff Bolz	vulkan: Support FA with any multiple of 8 head sizes (#15537)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	tests/test-backend-ops.cpp

commit	a9c6ffcbfacee092bfaaa400306fceda18199737	e78cf0d4b1bdbbc2479f11d58ce0c8f51f755875	2025-08-24T10:48:53+02:00	Ruben Ortlam	vulkan: enable Conv2D for Apple after MoltenVK fixed the bug (#15526)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	e78cf0d4b1bdbbc2479f11d58ce0c8f51f755875	710dfc465a68f7443b87d9f792cffba00ed739fe	2025-08-24T03:48:21-05:00	Jeff Bolz	vulkan: workaround MoltenVK compile failure in multi_add (#15506)
M	ggml/src/ggml-vulkan/vulkan-shaders/multi_add.comp

commit	710dfc465a68f7443b87d9f792cffba00ed739fe	611f419cff11e4952228162a1c44cb35dff2274a	2025-08-23T21:37:06+02:00	Johannes Gäßler	CUDA: fix half2 -> half conversion for HIP (#15529)
M	ggml/src/ggml-cuda/fattn-tile-f16.cu

commit	611f419cff11e4952228162a1c44cb35dff2274a	b1afcab804e3281867a5471fbd701e32eb32e512	2025-08-23T13:16:17-05:00	Jeff Bolz	vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/add.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/multi_add.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm_partials.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	b1afcab804e3281867a5471fbd701e32eb32e512	9ef536907de1b50c30e0369284898d30472a755a	2025-08-23T15:21:52+02:00	Piotr Wilkin (ilintar)	model : add support for Seed-OSS (#15490)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tests/test-chat-template.cpp

commit	9ef536907de1b50c30e0369284898d30472a755a	21dc4ddaf21b8ed551d717e7606abd2cffbacdbf	2025-08-23T12:58:58+02:00	Johannes Gäßler	scripts: fix compare-llama-bench.py (#15521)
M	scripts/compare-llama-bench.py

commit	21dc4ddaf21b8ed551d717e7606abd2cffbacdbf	289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9	2025-08-23T16:38:30+08:00	LaffeyNyaa	chat : fix debug build assertion in trim function (#15520)
M	src/llama-chat.cpp

commit	289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9	b55f06e1aa67fb10e89f53e31bbccf37eb2678ea	2025-08-23T02:33:36-05:00	Jeff Bolz	vulkan: Rewrite synchronization to allow some overlap between nodes (#15489)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	b55f06e1aa67fb10e89f53e31bbccf37eb2678ea	0a9b43e507a359ca392c037cf341f55137ad0b69	2025-08-23T14:58:57+08:00	R0CKSTAR	vulkan.Dockerfile: install vulkan SDK using tarball (#15282)
M	.devops/vulkan.Dockerfile

commit	0a9b43e507a359ca392c037cf341f55137ad0b69	330c3d2d21b55bca5517db7d2eea2ea8f131df4a	2025-08-23T08:35:21+02:00	Acly	vulkan : support ggml_mean (#15393)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/sum_rows.comp
M	tests/test-backend-ops.cpp

commit	330c3d2d21b55bca5517db7d2eea2ea8f131df4a	e92734d51bcb82cc35f0a6b5a14928f0036b2c90	2025-08-23T01:31:54-05:00	Jeff Bolz	vulkan: optimize mul_mat_id loading row ids into shared memory (#15427)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	e92734d51bcb82cc35f0a6b5a14928f0036b2c90	45363632cbd593537d541e81b600242e0b3d47fc	2025-08-22T23:47:01+02:00	Johannes Gäßler	test-opt: allow slight inprecision (#15503)
M	tests/test-opt.cpp

commit	45363632cbd593537d541e81b600242e0b3d47fc	32732f2459a598606055f0403f0e4ec148d06d68	2025-08-22T11:28:03-07:00	Reese Levine	ggml WebGPU: add support for quantization types (#15440)
M	ggml/src/ggml-webgpu/CMakeLists.txt
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
M	ggml/src/ggml-webgpu/wgsl-shaders/embed_wgsl.py
M	ggml/src/ggml-webgpu/wgsl-shaders/memset.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/mul_mat.tmpl.wgsl
D	ggml/src/ggml-webgpu/wgsl-shaders/mul_mat.wgsl

commit	32732f2459a598606055f0403f0e4ec148d06d68	92f7f0a53cf6484e16a8084ed90807c35a164809	2025-08-22T11:04:08-05:00	Aldehir Rojas	model : gpt-oss add response_format support (#15494)
M	common/chat.cpp

commit	92f7f0a53cf6484e16a8084ed90807c35a164809	b1ab91821f980f8993423c3f2a82a0a0f60c09d2	2025-08-22T15:33:15+02:00	rmatif	ggml: add `conv3d` op (#15182)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	b1ab91821f980f8993423c3f2a82a0a0f60c09d2	9ebebef62fd0adf8685874f154e227ea87b7c6f4	2025-08-22T14:06:29+03:00	Yavor Ivanov	cuda : add Pad Reflect 1D support (#14659)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/pad_reflect_1d.cu
A	ggml/src/ggml-cuda/pad_reflect_1d.cuh

commit	9ebebef62fd0adf8685874f154e227ea87b7c6f4	ad5c975c2d0297124fad210776ef8eed6b90d578	2025-08-22T12:22:13+03:00	Georgi Gerganov	llama : remove KV cache defragmentation logic (#15473)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/llama.vim
M	include/llama.h
M	scripts/compare-llama-bench.py
M	src/llama-context.cpp
M	src/llama-cparams.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-kv-cells.h
M	src/llama-memory.h
M	tools/llama-bench/README.md
M	tools/llama-bench/llama-bench.cpp
M	tools/server/README.md
M	tools/server/bench/bench.py

commit	ad5c975c2d0297124fad210776ef8eed6b90d578	4afb0a746f22abaa545b3ebdb76a400d7da3a713	2025-08-22T16:11:04+08:00	Aaron Teo	ggml-cpu: Support Q5_0 and Q5_1 on s390x (#15486)
M	docs/build-s390x.md
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/s390/quants.c
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	4afb0a746f22abaa545b3ebdb76a400d7da3a713	e288693669cf9d0a71e2f2b8bd57305f06340257	2025-08-22T08:10:14Z	65a	server : Support multimodal completion and embeddings prompts in JSON format (#15108)
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/tests/unit/test_completion.py
M	tools/server/tests/unit/test_vision_api.py
M	tools/server/utils.hpp

commit	e288693669cf9d0a71e2f2b8bd57305f06340257	a0f98dd604d34826eb5ea2560d1e23fe726921df	2025-08-22T09:29:08+02:00	Tarek Dakhran	readme : model : mtdm : lfm2 improvements (#15476)
M	README.md
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-model.cpp
M	tools/mtmd/clip.cpp

commit	a0f98dd604d34826eb5ea2560d1e23fe726921df	54a241f505d515d625767b993bfd573ecee306b9	2025-08-22T14:12:07+08:00	Chenguang Li	CANN: Optimize RMS_NORM using cache (#15419)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h

commit	54a241f505d515d625767b993bfd573ecee306b9	cd36b5e5c7fed2a3ac671dd542d579ca40b48b54	2025-08-21T14:09:32-07:00	Diego Devesa	sched : fix possible use of wrong ids tensor when offloading moe prompt processing (#15488)
M	common/arg.cpp
M	ggml/src/ggml-backend.cpp

commit	cd36b5e5c7fed2a3ac671dd542d579ca40b48b54	3f196be84b1376945737163e35a91e29e3e24d2f	2025-08-21T19:13:45+03:00	Georgi Gerganov	llama : remove deprecated llama_kv_self API (#15472)
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h

commit	3f196be84b1376945737163e35a91e29e3e24d2f	97ae5961a4d9ff9c60f51bac304b97de18e75eaf	2025-08-21T18:44:45+03:00	Georgi Gerganov	graph : remove build_attn_with_sinks overload (#15469)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	97ae5961a4d9ff9c60f51bac304b97de18e75eaf	20c2dac8c6e05f2ad5295ddef1aebaf2d266090e	2025-08-21T17:01:51+02:00	Acly	vulkan : support conv_2d_dw with f16 weights (#15392)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	20c2dac8c6e05f2ad5295ddef1aebaf2d266090e	96452a3fa426de83494fb0268a636aa1bfe557fe	2025-08-22T00:00:16+09:00	Dong Won Kim	vulkan: add exp operation (#15456)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/exp.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	96452a3fa426de83494fb0268a636aa1bfe557fe	9ad5e60dba38a6718366b7ac43e7d8e8abdc36c9	2025-08-21T09:55:00-05:00	Jeff Bolz	vulkan: Reuse conversion results in prealloc_y (#15410)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	tests/test-backend-ops.cpp

commit	9ad5e60dba38a6718366b7ac43e7d8e8abdc36c9	715a6db02ccb16284837885f2c6fab05d8f7a6ee	2025-08-21T22:53:13+08:00	Jie Fu (傅杰)	examples : fix some typos in examples/model-conversion/README.md (#15477)
M	examples/model-conversion/README.md

commit	715a6db02ccb16284837885f2c6fab05d8f7a6ee	ad294df03ff2dccd227c3fee653166f3d78b23a4	2025-08-21T17:00:33+03:00	Georgi Gerganov	kv-cache : drop the "unified" prefix (#15467)
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
R062	src/llama-kv-cache-unified-iswa.cpp	src/llama-kv-cache-iswa.cpp
R068	src/llama-kv-cache-unified-iswa.h	src/llama-kv-cache-iswa.h
R090	src/llama-kv-cache-unified.cpp	src/llama-kv-cache.cpp
R092	src/llama-kv-cache-unified.h	src/llama-kv-cache.h
M	src/llama-kv-cells.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	src/llama-model.cpp

commit	ad294df03ff2dccd227c3fee653166f3d78b23a4	029bb39eb1e7ae0e5df817ce97931abcd5fa52a9	2025-08-21T21:42:34+08:00	Jie Fu (傅杰)	examples : install torch-cpu for model conversion tool/example (#15475)
M	examples/model-conversion/requirements.txt

commit	029bb39eb1e7ae0e5df817ce97931abcd5fa52a9	30649cab657d87ac46692332a76e1b75d5d22e00	2025-08-21T17:52:16+05:00	Ali Tariq	ci : enable RVV1.0 native build (#15386)
M	.github/workflows/build-riscv-native.yml

commit	30649cab657d87ac46692332a76e1b75d5d22e00	2758fa10dab0556e6c3f130e664750fd6773dc7c	2025-08-21T13:42:55+03:00	Georgi Gerganov	ci : continue file download with wget (#15471)
M	ci/run.sh

commit	2758fa10dab0556e6c3f130e664750fd6773dc7c	b108e429043ee5c9fc8fa4957a0a52c3e490d5c9	2025-08-21T12:16:54+02:00	Daniel Bevenius	examples : add model conversion tool/example (#15455)
M	examples/CMakeLists.txt
A	examples/model-conversion/.gitignore
A	examples/model-conversion/CMakeLists.txt
A	examples/model-conversion/Makefile
A	examples/model-conversion/README.md
A	examples/model-conversion/logits.cpp
A	examples/model-conversion/requirements.txt
A	examples/model-conversion/scripts/causal/compare-embeddings-logits.sh
A	examples/model-conversion/scripts/causal/compare-logits.py
A	examples/model-conversion/scripts/causal/convert-model.sh
A	examples/model-conversion/scripts/causal/run-casual-gen-embeddings-org.sh
A	examples/model-conversion/scripts/causal/run-converted-model-embeddings-logits.sh
A	examples/model-conversion/scripts/causal/run-converted-model.sh
A	examples/model-conversion/scripts/causal/run-org-model.py
A	examples/model-conversion/scripts/embedding/compare-embeddings-logits.sh
A	examples/model-conversion/scripts/embedding/convert-model.sh
A	examples/model-conversion/scripts/embedding/run-converted-model.sh
A	examples/model-conversion/scripts/embedding/run-original-model.py
A	examples/model-conversion/scripts/readme.md.template
A	examples/model-conversion/scripts/utils/check-nmse.py
A	examples/model-conversion/scripts/utils/create-collection-add-model.sh
A	examples/model-conversion/scripts/utils/hf-add-model-to-collection.py
A	examples/model-conversion/scripts/utils/hf-create-collection.py
A	examples/model-conversion/scripts/utils/hf-create-model.py
A	examples/model-conversion/scripts/utils/hf-upload-gguf-model.py
A	examples/model-conversion/scripts/utils/inspect-converted-model.sh
A	examples/model-conversion/scripts/utils/inspect-org-model.py
A	examples/model-conversion/scripts/utils/perplexity-gen.sh
A	examples/model-conversion/scripts/utils/perplexity-run-simple.sh
A	examples/model-conversion/scripts/utils/perplexity-run.sh
A	examples/model-conversion/scripts/utils/quantize.sh
A	examples/model-conversion/scripts/utils/run-embedding-server.sh
A	examples/model-conversion/scripts/utils/semantic_check.py

commit	b108e429043ee5c9fc8fa4957a0a52c3e490d5c9	245be739df942861ddc52331b095b40f18e2a3f1	2025-08-21T05:06:46-05:00	Michael Giba	ci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221)
M	tools/mtmd/clip.cpp

commit	245be739df942861ddc52331b095b40f18e2a3f1	b2caf67db1208fd38a0570785c39f7370d906d8a	2025-08-21T11:47:52+02:00	Copilot	ci : add copilot-instructions.md (#15286)
A	.github/copilot-instructions.md
M	.github/workflows/copilot-setup-steps.yml
M	.gitignore

commit	b2caf67db1208fd38a0570785c39f7370d906d8a	2f3dbffb17ef782edfd50e5a130cec6e8a7e47f8	2025-08-21T11:19:50+02:00	Julien Denize	convert : make Mistral community chat templates optional via parameter (#15420)
M	convert_hf_to_gguf.py

commit	2f3dbffb17ef782edfd50e5a130cec6e8a7e47f8	945e1f12a6b586ebf82fa4fd7f347225e58174c5	2025-08-21T16:54:34+08:00	Jie Fu (傅杰)	common : fix incorrect print of non-ascii characters in the logging (#15466)
M	common/common.cpp

commit	945e1f12a6b586ebf82fa4fd7f347225e58174c5	1b0db8f6e08951969e2447c2d18bf638effb8f75	2025-08-21T07:32:26+02:00	Xuan-Son Nguyen	ggml : fix condition of im2col on Metal backend (#15460)
M	ggml/src/ggml-metal/ggml-metal.m

commit	1b0db8f6e08951969e2447c2d18bf638effb8f75	29f538ac630d6544406a0702476e36808a6bd1b3	2025-08-21T07:19:22+02:00	stduhpf	server : fix webui (#15462)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/utils/app.context.tsx

commit	29f538ac630d6544406a0702476e36808a6bd1b3	8ad038c0fdc719ced9fbf921a02cbae9ad79287f	2025-08-21T06:12:28+02:00	Daniel Bevenius	examples : remove references to `make` in examples [no ci] (#15457)
M	examples/batched.swift/README.md
M	examples/passkey/README.md
M	examples/retrieval/README.md
M	examples/sycl/win-build-sycl.bat

commit	8ad038c0fdc719ced9fbf921a02cbae9ad79287f	5682a3745f2b653dcb855d5766d8edc318fb3336	2025-08-21T11:06:05+08:00	R0CKSTAR	musa: add GGML_UNUSED_VARS (#15446)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/conv-transpose-1d.cu
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvf.cu
M	ggml/src/ggml-cuda/mmvq.cu

commit	5682a3745f2b653dcb855d5766d8edc318fb3336	1bc664a26a1d93a48baf2483a7ff95291ca8bcb8	2025-08-20T16:35:28-07:00	Diego Devesa	sched : copy only the used experts when offloading prompt processing (#15346)
M	ggml/src/ggml-backend.cpp

commit	1bc664a26a1d93a48baf2483a7ff95291ca8bcb8	13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97	2025-08-21T07:10:08+09:00	teo	server: fix OpenAI API compatibility for usage statistics in chat streams (#15444)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/utils.py

commit	13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97	7a6e91ad26160dd6dfb33d29ac441617422f28e7	2025-08-20T23:14:14+02:00	Johannes Gäßler	CUDA: refactor FA support/selection code (#15454)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/fattn.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	7a6e91ad26160dd6dfb33d29ac441617422f28e7	fec9519802ae1567048abb126cdd5ea160a22d0f	2025-08-20T16:58:49+02:00	Johannes Gäßler	CUDA: replace GGML_CUDA_F16 with CUDA arch checks (#15433)
M	docs/build.md
M	docs/multimodal/MobileVLM.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/dequantize.cuh
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vecdotq.cuh
M	ggml/src/ggml-musa/CMakeLists.txt

commit	fec9519802ae1567048abb126cdd5ea160a22d0f	657b8a77bd01854f99d37a47318fa24f2e7e298f	2025-08-20T09:33:14-05:00	Jeff Bolz	vulkan: shorten pipeline name strings (#15431)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	657b8a77bd01854f99d37a47318fa24f2e7e298f	ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3	2025-08-20T14:26:01+02:00	Daniel Bevenius	chat: handle gpt-oss return/end token inconsistency (#15421)
M	common/chat.cpp

commit	ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3	1a99c2d948209d9ea5eac8b6dc0a297107244540	2025-08-20T18:33:30+08:00	Jie Fu (傅杰)	common : fix context shift help message (#15448)
M	common/arg.cpp
M	common/common.h

commit	1a99c2d948209d9ea5eac8b6dc0a297107244540	37f10f955f70e0158d50343d0b9a3f92d194daae	2025-08-20T18:32:05+08:00	xiaobing318	cmake : fix target include directories (#15450)
M	tools/server/CMakeLists.txt

commit	37f10f955f70e0158d50343d0b9a3f92d194daae	2f37014073f4c6ddc8f241c927db87337c71aa52	2025-08-20T12:31:16+02:00	Daniel Bevenius	make : remove make in favor of CMake (#15449)
M	Makefile

commit	2f37014073f4c6ddc8f241c927db87337c71aa52	a094f381432d92c4bf92d2d6167284316ba73a62	2025-08-20T13:30:46+03:00	Georgi Gerganov	lookahead : add sample command to readme (#15447)
M	examples/lookahead/README.md

commit	a094f381432d92c4bf92d2d6167284316ba73a62	fb22dd07a639e81c7415e30b146f545f1a2f2caf	2025-08-20T10:17:37+08:00	R0CKSTAR	musa: fix build warnings (#15258)
M	ggml/src/ggml-cuda/add-id.cu
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/mmf.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/reduce_rows.cuh

commit	fb22dd07a639e81c7415e30b146f545f1a2f2caf	9ef6b0b835450ee10cd7be934ad8aef681dc1f43	2025-08-20T02:25:51+08:00	lhez	opencl: mark `argsort` unsupported if cols exceed workgroup limit (#15375)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	9ef6b0b835450ee10cd7be934ad8aef681dc1f43	1e19f5d462b6df490a13103ca555d851f47e5fa5	2025-08-19T19:58:28+03:00	Georgi Gerganov	model : add gpt-oss type strings (#15424)
M	src/llama-model.cpp
M	src/llama-model.h

commit	1e19f5d462b6df490a13103ca555d851f47e5fa5	d2fcd91cf96b46f4485ce46b4e3a32bf0df37715	2025-08-19T18:58:14+02:00	Gian-Carlo Pascutto	common : Add top-nsigma sampler to help globally (#15428)
M	common/arg.cpp

commit	d2fcd91cf96b46f4485ce46b4e3a32bf0df37715	a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49	2025-08-19T16:46:37+03:00	Georgi Gerganov	server : disable context shift by default (#15416)
M	common/arg.cpp
M	common/common.h
M	tools/server/tests/unit/test_basic.py
M	tools/server/tests/unit/test_completion.py
M	tools/server/tests/unit/test_ctx_shift.py
M	tools/server/tests/unit/test_embedding.py
M	tools/server/tests/unit/test_infill.py
M	tools/server/tests/unit/test_lora.py
M	tools/server/tests/unit/test_rerank.py
M	tools/server/tests/unit/test_security.py
M	tools/server/tests/unit/test_slot_save.py
M	tools/server/tests/unit/test_speculative.py
M	tools/server/tests/unit/test_tokenize.py
M	tools/server/tests/unit/test_tool_call.py
M	tools/server/tests/utils.py
M	tools/tts/tts.cpp

commit	a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49	67f09a3a27db443f9870aac87e163dba0d08131e	2025-08-19T21:28:22+08:00	SHUAI YANG	CANN: optimize rope operator (#15335)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h

commit	67f09a3a27db443f9870aac87e163dba0d08131e	6424594c56f4dbd0573455d89a0d89a0ac093d13	2025-08-19T18:33:47+08:00	R0CKSTAR	musa: handle __hgt2_mask, available starting from MUSA SDK rc4.3.0 (#15413)
M	ggml/src/ggml-cuda/common.cuh

commit	6424594c56f4dbd0573455d89a0d89a0ac093d13	e9288e886970884f288533cd597b3798995b4099	2025-08-19T10:54:31+02:00	Marvin Gießing	ggml-cpu: add mxfp4 VSX intrinsics for Power9+ (ppc64le) hardware (#15385)
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/powerpc/quants.c

commit	e9288e886970884f288533cd597b3798995b4099	9d262f4bad0d37838100133537aaf0a83835ed12	2025-08-19T10:29:36+02:00	Xuan-Son Nguyen	chat : clarify the meaning of reasoning_format (#15408)
M	common/chat.cpp
M	common/common.h
M	tests/test-chat.cpp

commit	9d262f4bad0d37838100133537aaf0a83835ed12	f0d3c7405c323784a60f14ddddfbac3f7404d417	2025-08-19T08:45:26+03:00	Georgi Gerganov	server : remove swa_full warning (#15399)
M	src/llama-context.cpp

commit	f0d3c7405c323784a60f14ddddfbac3f7404d417	f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c	2025-08-19T08:45:12+03:00	Georgi Gerganov	batched-bench : use rand tokens (#15398)
M	tools/batched-bench/batched-bench.cpp

commit	f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c	6d7f1117e3e3285d0c5c11b5ebb0439e27920082	2025-08-18T22:53:52+02:00	Xuan-Son Nguyen	mtmd : clean up clip_n_output_tokens (#15391)
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/tests.sh

commit	6d7f1117e3e3285d0c5c11b5ebb0439e27920082	60212f1ead2dce9bf1ac69633a7069258ae604d8	2025-08-18T22:02:50+03:00	Georgi Gerganov	codeowners : remove mmv.*
M	CODEOWNERS

commit	60212f1ead2dce9bf1ac69633a7069258ae604d8	f0c541d315e97b297b3421c52ebde53340ee66b3	2025-08-18T22:02:11+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f0c541d315e97b297b3421c52ebde53340ee66b3	baa9255a45105d2d3b4ec432af13b7a6eda3ff35	2025-08-18T20:35:47+03:00	Georgi Gerganov	scripts : update sync scripts
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	baa9255a45105d2d3b4ec432af13b7a6eda3ff35	3007baf201e7ffcda17dbdb0335997fa50a6595b	2025-08-18T19:30:17+02:00	Sigbjørn Skjæret	llama : merge conts and reshapes and remove unnecessary cont (#15380)
M	src/llama-model.cpp
M	tools/mtmd/clip.cpp

commit	3007baf201e7ffcda17dbdb0335997fa50a6595b	d1d82416006e7ff41780cb0e9b5f28d30a267497	2025-08-18T18:11:44+03:00	Georgi Gerganov	readme : update hot topics (#15397)
M	README.md

commit	d1d82416006e7ff41780cb0e9b5f28d30a267497	618575c5825d7d4f170e686e772178d2aae148ae	2025-08-18T16:51:42+02:00	davidef	server : fix incoming tasks not process in order (#15395)
M	tools/server/server.cpp

commit	618575c5825d7d4f170e686e772178d2aae148ae	f44f7931729022c57319a0124931120a169e0da9	2025-08-18T05:50:48-05:00	Dobri Danchev	Fix broken build: require updated pip to support --break-system-packages (#15357)
M	.devops/cuda.Dockerfile

commit	f44f7931729022c57319a0124931120a169e0da9	ae532eac2c1df1d8edc3d2719145895b966de1bf	2025-08-18T03:23:56-04:00	compilade	ggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379)
M	ggml/src/ggml-quants.c

commit	ae532eac2c1df1d8edc3d2719145895b966de1bf	e5155e698645242d4f019267ecc40ea9bad81b09	2025-08-18T00:56:29-05:00	Jeff Bolz	vulkan: disable spirv-opt for bfloat16 shaders (#15352)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	e5155e698645242d4f019267ecc40ea9bad81b09	21c17b5befc5f6be5992bc87fc1ba99d388561df	2025-08-17T18:28:58-04:00	Oleksandr Kuvshynov	server : export max observed n_past value (#15361)
M	tools/server/server.cpp

commit	21c17b5befc5f6be5992bc87fc1ba99d388561df	19f4decae0ead52debe56095ba8d693b4f14e4df	2025-08-17T11:08:57-05:00	Jeff Bolz	vulkan: Use larger workgroups for mul_mat_vec when M is small (#15355)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	19f4decae0ead52debe56095ba8d693b4f14e4df	4d196981d4db79e0105b939eaa7ecd40385b721c	2025-08-17T23:03:09+09:00	Dong Won Kim	vulkan: support sqrt (#15370)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/sqrt.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	4d196981d4db79e0105b939eaa7ecd40385b721c	b143fbc87af0324aa49e16cd91faf3ba8bb22231	2025-08-17T14:47:42+02:00	Sigbjørn Skjæret	convert : force patch_embd weights to F16 or F32 to avoid broken GGUFs (#15367)
M	convert_hf_to_gguf.py

commit	b143fbc87af0324aa49e16cd91faf3ba8bb22231	de5627910df74298c998e6bb36ee3217375a5719	2025-08-17T13:30:23+02:00	Sigbjørn Skjæret	ci : fix hang in windows-hip build/release (#15365)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	de5627910df74298c998e6bb36ee3217375a5719	65349f26f2299e06477ec8e85e46243046801358	2025-08-17T03:41:45-05:00	Jeff Bolz	vulkan: Optimize argsort (#15354)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/argsort.comp
M	tests/test-backend-ops.cpp

commit	65349f26f2299e06477ec8e85e46243046801358	1fe00296f587dfca0957e006d146f5875b61e43d	2025-08-16T23:33:54+02:00	Tarek Dakhran	model : support vision LiquidAI LFM2-VL family (#15347)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	1fe00296f587dfca0957e006d146f5875b61e43d	de2192794f4e8e04f2e8167ef2424905145e88fc	2025-08-16T11:48:22-05:00	Jeff Bolz	vulkan: fuse adds (#15252)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/multi_add.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/utils.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	de2192794f4e8e04f2e8167ef2424905145e88fc	2e2b22ba6607414a5d619ac6d2f034b5b02214e5	2025-08-16T04:18:31-05:00	Jeff Bolz	vulkan: Support mul_mat_id with f32 accumulators (#15337)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp

commit	2e2b22ba6607414a5d619ac6d2f034b5b02214e5	912ff8c119f01ae029543c7fdf7a84f91a0437a3	2025-08-16T03:58:38-05:00	Jeff Bolz	vulkan: Add missing bounds checking to scalar/coopmat1 mul_mat_id (#15334)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	tests/test-backend-ops.cpp

commit	912ff8c119f01ae029543c7fdf7a84f91a0437a3	5e6229a8409ac786e62cb133d09f1679a9aec13e	2025-08-16T10:05:55+02:00	rmatif	OpenCL: add initial FA support (#14987)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/flash_attn_f16.cl
A	ggml/src/ggml-opencl/kernels/flash_attn_f32.cl
A	ggml/src/ggml-opencl/kernels/flash_attn_f32_f16.cl

commit	5e6229a8409ac786e62cb133d09f1679a9aec13e	e2c1bfff5305c661ac53e9d57cb732ff626a2242	2025-08-15T19:50:52+02:00	Daniel Bevenius	common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
M	common/chat.cpp

commit	e2c1bfff5305c661ac53e9d57cb732ff626a2242	5edf1592fdb9131d01321aeef4241c6a34969e27	2025-08-16T00:52:14+08:00	lhez	opencl: add initial mxfp4 support via mv (#15270)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/mul_mv_id_mxfp4_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_mxfp4_f32.cl
M	ggml/src/ggml-opencl/kernels/transpose.cl

commit	5edf1592fdb9131d01321aeef4241c6a34969e27	db3010bd23980bad5f5d93ec3e6757ec531a413b	2025-08-15T17:16:36+03:00	Georgi Gerganov	vulkan : fix out-of-bounds access in argmax kernel (#15342)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/argmax.comp
M	tests/test-backend-ops.cpp

commit	db3010bd23980bad5f5d93ec3e6757ec531a413b	ff27f80a74bbe5303acd511a6781a1de6d619b3c	2025-08-15T16:28:28+03:00	Georgi Gerganov	vulkan : fix compile warnings on macos (#15340)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	ff27f80a74bbe5303acd511a6781a1de6d619b3c	d3248d9b6557c75d59954c594bb53cf517591e91	2025-08-15T21:11:22+08:00	Aaron Teo	ggml: initial IBM zDNN backend (#14975)
M	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
M	.github/ISSUE_TEMPLATE/011-bug-results.yml
M	.github/labeler.yml
M	CODEOWNERS
M	docs/build-s390x.md
M	docs/ops.md
A	docs/ops/zDNN.csv
M	ggml/CMakeLists.txt
A	ggml/include/ggml-zdnn.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-zdnn/CMakeLists.txt
A	ggml/src/ggml-zdnn/ggml-zdnn-impl.h
A	ggml/src/ggml-zdnn/ggml-zdnn.cpp

commit	d3248d9b6557c75d59954c594bb53cf517591e91	7aeee88cfe9c0434eac722b0f7c21404f48758a5	2025-08-15T14:02:39+02:00	Sigbjørn Skjæret	ci : fix ios-xcode-build (#15324)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	7aeee88cfe9c0434eac722b0f7c21404f48758a5	b07791aa1d4831a08ad54ca19aa206c0c5c0f34a	2025-08-15T03:27:02-07:00	Diego Devesa	ci : move ccache action to ggml-org fork (#15328)
M	.github/workflows/build.yml
M	.github/workflows/copilot-setup-steps.yml
M	.github/workflows/release.yml

commit	b07791aa1d4831a08ad54ca19aa206c0c5c0f34a	4227c9be4268ac844921b90f31595f81236bd317	2025-08-15T11:23:17+02:00	Johannes Gäßler	test-opt: fix backend support check (#15317)
M	tests/test-opt.cpp

commit	4227c9be4268ac844921b90f31595f81236bd317	df36bce667bf14f8e538645547754386f9516326	2025-08-14T23:21:24+02:00	Johannes Gäßler	CUDA: fix negative KV_max values in FA (#15321)
M	ggml/src/ggml-cuda/fattn-common.cuh

commit	df36bce667bf14f8e538645547754386f9516326	f75b8306472811ecc4e4457d5573a09201f02183	2025-08-14T22:10:51+03:00	Georgi Gerganov	eval-callback : stop on first NaN (#15320)
M	examples/eval-callback/eval-callback.cpp

commit	f75b8306472811ecc4e4457d5573a09201f02183	7a0de960452f9a57de7f1d167e57b6f3ee5ac1b6	2025-08-14T10:28:29-07:00	Diego Devesa	chat : include kwargs in template example (#15309)
M	common/chat.cpp
M	common/chat.h
M	tools/main/main.cpp
M	tools/mtmd/mtmd-cli.cpp
M	tools/server/server.cpp

commit	7a0de960452f9a57de7f1d167e57b6f3ee5ac1b6	e4e915912cfd2ee15c5a4a0074813232134892f6	2025-08-14T17:56:26+02:00	Daniel Bevenius	llama : add 18-layer model type for Gemma 3-270m (#15319)
M	src/llama-model.cpp
M	src/llama-model.h

commit	e4e915912cfd2ee15c5a4a0074813232134892f6	5ba36f61033d2819be27e2abb70e9a3bd20c0fde	2025-08-14T17:45:27+02:00	simevo	devops : fix compile bug when the BASE_CUDA_DEV_CONTAINER is based on Ubuntu 24.04 (#15005)
M	.devops/cuda.Dockerfile

commit	5ba36f61033d2819be27e2abb70e9a3bd20c0fde	b204a5a234f4cf0b3f449476da639a5510c6d157	2025-08-14T16:23:56+02:00	uvos	HIP: Cleanup hipification header (#15285)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/cpy-utils.cuh
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/mmvf.cu
M	ggml/src/ggml-cuda/set-rows.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	b204a5a234f4cf0b3f449476da639a5510c6d157	646944cfa8961afd914dd6637739b3cda9a72e11	2025-08-14T09:23:11-05:00	Aldehir Rojas	gpt-oss: implement harmony parsing (#15181)
M	common/chat.cpp
A	models/templates/openai-gpt-oss-120b.jinja
M	src/llama-vocab.cpp
M	tests/test-chat.cpp
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/ChatMessage.tsx
M	tools/server/webui/src/utils/misc.ts

commit	646944cfa8961afd914dd6637739b3cda9a72e11	1a01899b612ae8f99a174ad076207090e08d4d7b	2025-08-14T16:22:58+02:00	Christian Kastner	docker : Enable GGML_CPU_ALL_VARIANTS for ARM (#15267)
M	.devops/cpu.Dockerfile

commit	1a01899b612ae8f99a174ad076207090e08d4d7b	863d341eeb81db104902b14b6f9413daa515e957	2025-08-14T17:16:03+03:00	Georgi Gerganov	readme : update hot topics (#15315)
M	README.md

commit	863d341eeb81db104902b14b6f9413daa515e957	d32e03f4495d3efa1c5126f53b449f1d429c5664	2025-08-14T08:38:10-05:00	Jeff Bolz	vulkan: perf_logger improvements (#15246)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	d32e03f4495d3efa1c5126f53b449f1d429c5664	3973163bff40f7f5161b0f08a0011729e2b0406a	2025-08-14T14:59:50+03:00	Georgi Gerganov	server : add SWA checkpoints (#15293)
M	common/arg.cpp
M	common/common.h
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	tools/server/server.cpp

commit	3973163bff40f7f5161b0f08a0011729e2b0406a	5ade3000bd6040bf6878eafd6c77168552f73c47	2025-08-14T14:19:23+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	5ade3000bd6040bf6878eafd6c77168552f73c47	8b2483730f90d6f23e2b188a54a210498bba937f	2025-08-14T19:17:51+08:00	Jason Ni	ggml: fix ggml_conv_1d_dw bug (ggml/1323)
M	ggml/src/ggml.c

commit	8b2483730f90d6f23e2b188a54a210498bba937f	810b9fc8b99dd55517a3e94c6dee29748d482559	2025-08-14T13:41:03+03:00	Georgi Gerganov	tests : remove unused includes (ggml/0)
M	tests/test-opt.cpp

commit	810b9fc8b99dd55517a3e94c6dee29748d482559	4ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c4	2025-08-14T20:03:30+09:00	kallewoof	perplexity : provide a helpful hint for has_cpl case in split_equal error. (#15304)
M	src/llama-batch.cpp

commit	4ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c4	5cdb27e0917479d2d742cea7beee089574bb09fa	2025-08-14T12:22:07+02:00	Sigbjørn Skjæret	cuda : fix GGML_CUDA_GRAPHS=OFF (#15300)
M	ggml/src/ggml-cuda/mean.cu

commit	5cdb27e0917479d2d742cea7beee089574bb09fa	3ea913f1ce9567289aedd866a569dbab8fb8e419	2025-08-14T03:03:57-07:00	Jonathan Graehl	finetune: SGD optimizer, more CLI args (#13873)
M	CMakeLists.txt
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/training/finetune.cpp
M	ggml/include/ggml-opt.h
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/opt-step-sgd.cu
A	ggml/src/ggml-cuda/opt-step-sgd.cuh
M	ggml/src/ggml-opt.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/opt_step_sgd.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	tests/CMakeLists.txt
M	tests/test-backend-ops.cpp
M	tests/test-opt.cpp

commit	3ea913f1ce9567289aedd866a569dbab8fb8e419	29c8fbe4e05fd23c44950d0958299e25fbeabc5c	2025-08-14T15:16:32+09:00	kallewoof	perplexity: give more information about constraints on failure (#15303)
M	tools/perplexity/perplexity.cpp

commit	29c8fbe4e05fd23c44950d0958299e25fbeabc5c	1adc9812bd33dc85489bf093528d61c22917d54f	2025-08-13T20:44:30+02:00	uvos	HIP: bump requirement to rocm 6.1 (#15296)
M	.github/workflows/build.yml
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-hip/CMakeLists.txt

commit	1adc9812bd33dc85489bf093528d61c22917d54f	b3e16665e14032d1276f9d0263acef8321b6f518	2025-08-13T11:21:31-07:00	Bas Nijholt	fix(nix): remove non-functional llama-cpp cachix cache from flake.nix (#15295)
M	flake.nix

commit	b3e16665e14032d1276f9d0263acef8321b6f518	c24f4e26883a91219af5acfaf1471ca7ef582683	2025-08-13T15:43:00+02:00	Sigbjørn Skjæret	server : enable -td and -tbd parameters (#15172)
M	common/arg.cpp
M	tools/server/server.cpp

commit	c24f4e26883a91219af5acfaf1471ca7ef582683	d8914fc47e8a69b28c670325cb1c8ce33e3a2960	2025-08-13T18:45:15+08:00	Judd	ggml : update `ggml_rope_multi` (#12665)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	d8914fc47e8a69b28c670325cb1c8ce33e3a2960	e885445bc1719d2e289a9b2e11714e0f994e68be	2025-08-13T12:44:40+02:00	Copilot	 common : add --override-tensor-draft, --cpu-moe-draft and --n-cpu-moe-draft parameters (#15191)
M	common/arg.cpp
M	common/common.h
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	tools/server/server.cpp

commit	e885445bc1719d2e289a9b2e11714e0f994e68be	648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0	2025-08-13T05:28:21-05:00	Aldehir Rojas	server : filter out harmony thought messages (#15278)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/utils/misc.ts

commit	648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0	07aa869a91837d95fcb5612c65a188763ac38647	2025-08-13T15:14:44+05:00	Ali Tariq	ci : Added CI with RISC-V RVV1.0 Hardware (#14439)
D	.devops/cloud-v-pipeline
A	.github/workflows/build-riscv-native.yml

commit	07aa869a91837d95fcb5612c65a188763ac38647	00f35d509e5367bf19ccaf4b4adddc38db4811c6	2025-08-13T11:30:45+02:00	Sigbjørn Skjæret	ci : add more python requirements to copilot-setup-steps (#15289)
M	.github/workflows/copilot-setup-steps.yml

commit	00f35d509e5367bf19ccaf4b4adddc38db4811c6	6028bf74351d35a06bd98498624f8c2f029f7d1a	2025-08-13T11:09:39+03:00	Georgi Gerganov	ggml : repack block_iq4_nlx8 (#14904)
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	ggml/src/ggml-cpu/repack.cpp
M	ggml/src/ggml-cpu/repack.h

commit	6028bf74351d35a06bd98498624f8c2f029f7d1a	bc5182272c373267352bc689e5fca276934bea2d	2025-08-13T10:04:46+02:00	Oliver Simons	CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mean.cu
A	ggml/src/ggml-cuda/reduce_rows.cuh
M	ggml/src/ggml-cuda/sum.cu
M	ggml/src/ggml-cuda/sumrows.cu
M	tests/test-backend-ops.cpp

commit	bc5182272c373267352bc689e5fca276934bea2d	e71d48e3265027351e44a8e198f933c98f242c2e	2025-08-13T09:07:13+02:00	Sigbjørn Skjæret	ci : add copilot-setup-steps.yml (#15214)
A	.github/workflows/copilot-setup-steps.yml

commit	e71d48e3265027351e44a8e198f933c98f242c2e	b0493156fa8622694f21f42460a84da3eded0bc0	2025-08-13T14:54:30+09:00	Tak-RS	ggml-rpc: chunk send()/recv() to avoid EINVAL for very large tensors over RPC (macOS & others) (#15188)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	3a617cb18121a85eed17ac5585788810c5d9c1e0	c42293848dd9f03eba9a6c1b85a600b398f06541	2025-08-13T10:58:59+08:00	Yunzhe Jia	add calrt_decode
M	ggml/include/ggml-calrt.h
M	ggml/src/ggml-calrt/CMakeLists.txt
M	ggml/src/ggml-calrt/calrt-common.h
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/ggml-calrt.cpp
M	include/llama.h
M	src/CMakeLists.txt
A	src/llama-calrt.cpp
A	src/llama-calrt.h
M	src/llama-context.h
A	src/llama-kv-cache-calrt-adapter.cpp
A	src/llama-kv-cache-calrt-adapter.h
M	src/llama-model.cpp

commit	b0493156fa8622694f21f42460a84da3eded0bc0	f4586ee5986d6f965becb37876d6f3666478a961	2025-08-12T22:15:12+02:00	uvos	HIP: disable sync warp shuffel operators from clr amd_warp_sync_functions.h (#15273)
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	f4586ee5986d6f965becb37876d6f3666478a961	60a76588106d22ccacd6b1a0d15d8545861d0a0d	2025-08-12T13:58:22+02:00	Romain Biessy	sycl: Fix and disable more configurations of mul_mat (#15151)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	60a76588106d22ccacd6b1a0d15d8545861d0a0d	efe3a90996ca6e67ca90f337fc03ad551082c408	2025-08-12T11:42:41+02:00	rmatif	opencl: allow mixed f16/f32 `add` (#15140)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/add.cl

commit	efe3a90996ca6e67ca90f337fc03ad551082c408	bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de8	2025-08-12T17:21:45+08:00	Aman Gupta	CUDA cmake: add `-lineinfo` for easier debug (#15260)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de8	25ff6f7659f6a5c47d6a73eada5813f0495331f0	2025-08-12T16:12:13+08:00	Chenguang Li	CANN: GGML_OP_CPY optimization (#15070)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	25ff6f7659f6a5c47d6a73eada5813f0495331f0	be48528b068111304e4a0bb82c028558b5705f05	2025-08-12T10:02:51+08:00	R0CKSTAR	musa: fix failures in test-backend-ops for mul_mat_id op (#15236)
M	ggml/src/ggml-cuda/common.cuh

commit	be48528b068111304e4a0bb82c028558b5705f05	cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f	2025-08-11T22:50:31+08:00	hipudding	CANN: Add broadcast for softmax and FA (#15208)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f	fba5c0d680b555cbac563fef57b33bc5c9621e08	2025-08-11T22:12:12+08:00	rainred	mtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750)
M	docs/multimodal/minicpmo2.6.md
M	docs/multimodal/minicpmv2.6.md
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/legacy-models/minicpmv-convert-image-encoder-to-gguf.py
M	tools/mtmd/legacy-models/minicpmv-surgery.py

commit	fba5c0d680b555cbac563fef57b33bc5c9621e08	53d0a1265826f40c5dbc01d06aeab9e14fcbd69b	2025-08-11T15:31:35+02:00	Xuan-Son Nguyen	chat : hotfix gpt-oss jinja raising an exception (#15243)
M	common/chat.cpp

commit	53d0a1265826f40c5dbc01d06aeab9e14fcbd69b	27093afe78912494073eb043fec93a007e49653c	2025-08-11T14:48:41+02:00	Xuan-Son Nguyen	server : allow specifying reasoning_format in HTTP request (#15238)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.h
M	tools/server/README.md
M	tools/server/public/index.html.gz
M	tools/server/server.cpp
M	tools/server/webui/src/utils/app.context.tsx

commit	27093afe78912494073eb043fec93a007e49653c	228f724d9ce6c56e8cec75bfdabab4dd013def7f	2025-08-11T14:27:54+02:00	Zagaj	readme : update infra list (#15234)
M	README.md

commit	228f724d9ce6c56e8cec75bfdabab4dd013def7f	cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a	2025-08-11T13:58:24+03:00	Georgi Gerganov	kv-cache : fix seq_rm with seq_id == -1 (#15226)
M	src/llama-kv-cache-unified.cpp

commit	cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a	50e81bdf5db563ab57a9a722b08f96fa8a76c927	2025-08-11T11:21:19+02:00	Daniel Bevenius	kv-cache : log (debug) all streams in find_slot (#15176)
M	src/llama-kv-cache-unified.cpp

commit	50e81bdf5db563ab57a9a722b08f96fa8a76c927	1ebbaddff2a44b0599df659175d3274bd5bbeb81	2025-08-11T11:15:44+02:00	Sigbjørn Skjæret	convert : fix merge conflicts (#15229)
M	convert_hf_to_gguf.py

commit	1ebbaddff2a44b0599df659175d3274bd5bbeb81	a3a7874272e5a060079658eb5cca4617b7f99062	2025-08-11T10:21:24+02:00	Daniel Bevenius	perplexity : update comments/error msg to use decode [no ci] (#15227)
M	tools/perplexity/perplexity.cpp

commit	a3a7874272e5a060079658eb5cca4617b7f99062	002cb1bb3345967fbe0fa7766c2d94c2da31ef45	2025-08-11T10:07:49+02:00	Julien Denize	convert : improve Mistral models integration (#14737)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	gguf-py/gguf/utility.py

commit	002cb1bb3345967fbe0fa7766c2d94c2da31ef45	79c1160b073b8148a404f3dd2584be1606dccc66	2025-08-11T09:59:26+02:00	Charles Xu	kleidiai: fix unsigned overflow bug (#15150)
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	79c1160b073b8148a404f3dd2584be1606dccc66	34c9d765bf173c551398f1e7fa4595019bc53bab	2025-08-09T13:29:43-05:00	David Zhao	cuda: refactored ssm_scan and use CUB (#13291)
M	ggml/src/ggml-cuda/ssm-scan.cu

commit	34c9d765bf173c551398f1e7fa4595019bc53bab	e54d41befcc1575f4c898c5ff4ef43970cead75f	2025-08-09T20:00:24+08:00	Aman Gupta	CUDA: add attention sinks for tile and wmma (#15178)
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu

commit	e54d41befcc1575f4c898c5ff4ef43970cead75f	4850b52aedceeb70bb4fe49f2d7cd1df6ee98682	2025-08-08T17:48:26-04:00	compilade	gguf-py : add Numpy MXFP4 de/quantization support (#15111)
M	ggml/src/ggml-quants.c
M	gguf-py/gguf/quants.py
M	gguf-py/tests/test_quants.py

commit	4850b52aedceeb70bb4fe49f2d7cd1df6ee98682	cd6983d56d2cce94ecb86bb114ae8379a609073c	2025-08-08T23:04:36+02:00	Johannes Gäßler	server-bench: external OAI servers, sqlite (#15179)
M	scripts/server-bench.py

commit	cd6983d56d2cce94ecb86bb114ae8379a609073c	6c7e9a54406dbba5e53754a8f70a285414717b06	2025-08-08T21:37:22+09:00	AN Long	ggml : fix field name when new ggml_backend (#14944)
M	ggml/src/ggml-blas/ggml-blas.cpp
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	6c7e9a54406dbba5e53754a8f70a285414717b06	1425f587a82bc303469b5c32759a2746ba4e1e20	2025-08-08T10:45:18+01:00	Olivier Chafik	vendor: sync minja (#15161)
M	vendor/minja/chat-template.hpp
M	vendor/minja/minja.hpp

commit	1425f587a82bc303469b5c32759a2746ba4e1e20	aaa3d07ae749b781d6135eaff23c7fa8a4ab404a	2025-08-08T08:19:58+02:00	Johannes Gäßler	CUDA: attention sinks for mma FlashAttention (#15157)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	aaa3d07ae749b781d6135eaff23c7fa8a4ab404a	50aa9389014bba2dd12234132aa6b8ca3601a17f	2025-08-08T13:47:03+09:00	lhez	opencl: support sink in `soft_max` (attn sinks) (#15152)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/softmax_4_f16.cl
M	ggml/src/ggml-opencl/kernels/softmax_4_f32.cl
M	ggml/src/ggml-opencl/kernels/softmax_f16.cl
M	ggml/src/ggml-opencl/kernels/softmax_f32.cl

commit	50aa9389014bba2dd12234132aa6b8ca3601a17f	c4f53563df4575196ea13f5ed669ea8ea659a6be	2025-08-07T23:26:03+02:00	Xuan-Son Nguyen	convert : support non-mxfp4 HF model (#15153)
M	convert_hf_to_gguf.py
M	src/llama-quant.cpp

commit	c4f53563df4575196ea13f5ed669ea8ea659a6be	a0552c8beef74e843bb085c8ef0c63f9ed7a2b27	2025-08-07T15:44:20-05:00	Jeff Bolz	vulkan: support fattn sinks (#15126)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp

commit	a0552c8beef74e843bb085c8ef0c63f9ed7a2b27	99acbc9921b119aa7ed929eb5780a66a8f06e6d9	2025-08-07T15:07:11-05:00	Jeff Bolz	vulkan: Add env var to disable host visible vidmem (#15109)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	99acbc9921b119aa7ed929eb5780a66a8f06e6d9	7ad67ba9fe2b909e271dd31b99c5fce3aba35899	2025-08-08T00:20:40+08:00	RunningLeon	llama : Support intern-s1 (#14875)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py

commit	7ad67ba9fe2b909e271dd31b99c5fce3aba35899	9a96389544a08fd829fccda28142ce2066017fde	2025-08-07T16:44:14+02:00	uvos	HIP: add cmake option to enable compiler output of kernel resource usage metrics (#15103)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-hip/CMakeLists.txt

commit	9a96389544a08fd829fccda28142ce2066017fde	1d72c841888b9450916bdd5a9b3274da380f5b36	2025-08-07T13:45:41+02:00	Christian Kastner	ggml: Skip backend library linking code when GGML_BACKEND_DL=ON (#15094)
M	ggml/cmake/ggml-config.cmake.in

commit	1d72c841888b9450916bdd5a9b3274da380f5b36	20638e4f16fcc21f836c7556e83bbf532bb5a0f0	2025-08-07T10:53:21+02:00	Johannes Gäßler	CUDA: GEMM for FP32/FP16/BF16 and ne11 <= 16 (#15131)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mma.cuh
A	ggml/src/ggml-cuda/mmf.cu
A	ggml/src/ggml-cuda/mmf.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
R086	ggml/src/ggml-cuda/mmv.cu	ggml/src/ggml-cuda/mmvf.cu
R055	ggml/src/ggml-cuda/mmv.cuh	ggml/src/ggml-cuda/mmvf.cuh
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-cuda/vendors/musa.h

commit	20638e4f16fcc21f836c7556e83bbf532bb5a0f0	36d3f00e142696f708ab297b9f8f1c825594712d	2025-08-07T08:50:30+02:00	Johannes Gäßler	scripts: fix crash when --tool is not set (#15133)
M	scripts/compare-llama-bench.py

commit	36d3f00e142696f708ab297b9f8f1c825594712d	5fd160bbd9d70b94b5b11b0001fd7f477005e4a0	2025-08-07T05:31:48+02:00	Daniel Bevenius	requirements : fix PyTorch uint64 compatibility (#15134)
M	requirements/requirements-convert_hf_to_gguf.txt
M	tools/mtmd/requirements.txt

commit	5fd160bbd9d70b94b5b11b0001fd7f477005e4a0	756cfea82608911bbfcbf45164b8fdaddbafaa31	2025-08-06T15:14:40-07:00	Reese Levine	ggml: Add basic SET_ROWS support in WebGPU (#15137)
M	.github/workflows/build.yml
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp
A	ggml/src/ggml-webgpu/wgsl-shaders/set_rows.wgsl

commit	756cfea82608911bbfcbf45164b8fdaddbafaa31	e725a1a982ca870404a9c4935df52466327bbd02	2025-08-06T23:17:51+02:00	rmatif	fix profiling crash (#15072)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	e725a1a982ca870404a9c4935df52466327bbd02	3db4da56a5a00c4b47bbb3b18f85fb4473662adb	2025-08-07T04:12:17+09:00	lhez	opencl: add `swiglu_oai` and  `add_id` (#15121)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/add_id.cl
M	ggml/src/ggml-opencl/kernels/glu.cl

commit	3db4da56a5a00c4b47bbb3b18f85fb4473662adb	476aa3fd5779b32d06cd84338f777da82341195c	2025-08-06T11:27:30-07:00	Sachin Desai	chat : support Granite model reasoning and tool call (#14864)
M	common/chat-parser.cpp
M	common/chat.cpp
M	common/chat.h
M	common/common.h
A	models/templates/ibm-granite-granite-3.3-2B-Instruct.jinja
M	tests/test-chat.cpp

commit	476aa3fd5779b32d06cd84338f777da82341195c	0d8831543cdc368fb248bae6f1b4aa5516684edc	2025-08-06T17:28:48+01:00	Juk Armstrong	Fixed name `-override-tensors` to `-override-tensor` (#15129)
M	tools/llama-bench/llama-bench.cpp

commit	0d8831543cdc368fb248bae6f1b4aa5516684edc	65c797c4fad4d9966695ac4b4a1560be44109267	2025-08-06T05:37:35-07:00	Diego Devesa	ggml : fix fallback to CPU for ununsupported ops (#15118)
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/traits.cpp
M	ggml/src/ggml-cpu/traits.h

commit	65c797c4fad4d9966695ac4b4a1560be44109267	25726898e855ec6dffba227f2233a63c57184036	2025-08-06T13:26:49+02:00	Sigbjørn Skjæret	chat : fix yandex chat template (#15116)
M	src/llama-chat.cpp
M	tests/test-chat-template.cpp

commit	25726898e855ec6dffba227f2233a63c57184036	2241453252147bb7362a286977ee9f9a92130062	2025-08-06T17:48:30+08:00	stevenkuang	chat : fix hunyuan auto-detection (#15114)
M	src/llama-chat.cpp

commit	c42293848dd9f03eba9a6c1b85a600b398f06541	1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5	2025-08-06T15:46:06+08:00	Yunzhe Jia	sync with calrt API
M	ggml/src/ggml-calrt/calrt-common.h
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/ggml-calrt.cpp

commit	1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5	ba67d6c03fed3193987a4ef13050e6e2a4451df4	2025-07-24T15:50:19+08:00	Yunzhe Jia	1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
M	ggml/include/ggml-calrt.h
M	ggml/src/ggml-calrt/CMakeLists.txt
R093	ggml/src/ggml-calrt/common.h	ggml/src/ggml-calrt/calrt-common.h
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/calrt-op.h
M	ggml/src/ggml-calrt/ggml-calrt.cpp
M	gguf-py/examples/cal_test.gguf
M	gguf-py/examples/writer_cal_test.py
M	src/CMakeLists.txt
M	src/llama-batch.cpp
M	src/llama-context.cpp
M	src/llama-context.h
A	src/llama-kv-cache-blocked.cpp
A	src/llama-kv-cache-blocked.h
M	src/llama-model.cpp

commit	2241453252147bb7362a286977ee9f9a92130062	9515c6131aecaccc955fdedcfe16c3e030aaefcb	2025-08-06T14:12:42+08:00	Chenguang Li	CANN: add support for ACL Graph (#15065)
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	9515c6131aecaccc955fdedcfe16c3e030aaefcb	fd1234cb468935ea087d6929b2487926c3afff4b	2025-08-05T16:26:38-07:00	Reese Levine	ggml: WebGPU disable SET_ROWS for now (#15078)
M	.github/workflows/build.yml
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp

commit	fd1234cb468935ea087d6929b2487926c3afff4b	f324a3b715d5c1081c110ce459f8a8486fb1ee89	2025-08-05T22:10:36+03:00	Georgi Gerganov	llama : add gpt-oss (#15091)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.h
M	common/common.h
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/arm/quants.c
M	ggml/src/ggml-cpu/arch/x86/quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-cpu/quants.c
M	ggml/src/ggml-cpu/quants.h
M	ggml/src/ggml-cpu/vec.h
A	ggml/src/ggml-cuda/add-id.cu
A	ggml/src/ggml-cuda/add-id.cuh
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/im2col.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/softmax.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-mxfp4.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-cuda/vecdotq.cuh
M	ggml/src/ggml-cuda/vendors/cuda.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/add_id.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_mxfp4.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/glu_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/swiglu_oai.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-model-loader.cpp
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama-vocab.cpp
M	tests/test-backend-ops.cpp
M	tools/quantize/quantize.cpp
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/ChatMessage.tsx

commit	f324a3b715d5c1081c110ce459f8a8486fb1ee89	be426425817bc3e6a2d91dae476dba6fa85894be	2025-08-05T20:43:36+02:00	Sigbjørn Skjæret	chat : only remove double bos/eos if added (#15086)
M	common/chat.cpp
M	common/chat.h
M	tests/test-chat-template.cpp

commit	be426425817bc3e6a2d91dae476dba6fa85894be	3306ceabf02e3df66666e5851800e843c7ca207e	2025-08-05T20:19:33+03:00	Georgi Gerganov	readme : update hot topics (#15097)
M	README.md

commit	3306ceabf02e3df66666e5851800e843c7ca207e	c81de6e107ef51ef76aadcb8a6f008711c462517	2025-08-05T18:39:55+02:00	Romain Biessy	sycl: fix mul_mat selection (#15092)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	c81de6e107ef51ef76aadcb8a6f008711c462517	22f060c9c4b5ef49a83a20eda25fcb792419580b	2025-08-05T13:56:44+01:00	Juk Armstrong	Fix `glm4moe` bug (#15088)
M	src/llama-model.cpp

commit	22f060c9c4b5ef49a83a20eda25fcb792419580b	ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6	2025-08-05T19:56:44+08:00	Alex Wu	webui: fix markdown table (#15081)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/index.scss

commit	ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6	ec428b02c347767f24c78111309e3f30d2ada289	2025-08-05T05:27:45-04:00	compilade	context : fix index overflow on huge outputs (#15080)
M	src/llama-context.cpp

commit	ec428b02c347767f24c78111309e3f30d2ada289	19f68fa5a4c3bf796de52a6db9008e77d29f423a	2025-08-04T16:05:36-07:00	Diego Devesa	llama : add --n-cpu-moe option (#15077)
M	common/arg.cpp

commit	19f68fa5a4c3bf796de52a6db9008e77d29f423a	41613437ffee0dbccad684fc744788bc504ec213	2025-08-04T17:26:52-04:00	compilade	imatrix : warn when GGUF imatrix is saved without .gguf suffix (#15076)
M	common/arg.cpp
M	common/common.h
M	tools/imatrix/imatrix.cpp

commit	41613437ffee0dbccad684fc744788bc504ec213	e5bebe5251cee2678e8531aa1598ca21b3c6ce1d	2025-08-04T21:29:14+02:00	Christian Kastner	cmake: Add GGML_BACKEND_DIR option (#15074)
M	ggml/CMakeLists.txt
M	ggml/cmake/ggml-config.cmake.in
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp

commit	e5bebe5251cee2678e8531aa1598ca21b3c6ce1d	ef0144c087b33e5b8da42d529ac71aaf05cb49df	2025-08-04T21:01:48+02:00	Sigbjørn Skjæret	gguf-py : add --chat-template-file to gguf_new_metadata (#15075)
M	gguf-py/gguf/scripts/gguf_new_metadata.py

commit	ef0144c087b33e5b8da42d529ac71aaf05cb49df	2721257e3e2c4c944ac8a08221113ee7cb503f1b	2025-08-05T04:29:25+10:00	Sam	model: support GLM 4.5 family of models (#14939)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	models/templates/README.md
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-model-loader.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	2721257e3e2c4c944ac8a08221113ee7cb503f1b	587d0118f50b7e8f4bafbcdd218aefd9da0272e1	2025-08-04T18:11:02+02:00	Sigbjørn Skjæret	quantize : fix confusing error message if ftype is invalid (#15071)
M	tools/quantize/quantize.cpp

commit	587d0118f50b7e8f4bafbcdd218aefd9da0272e1	5aa1105da24a8dd1661cea3db0582c9b2c2f54d3	2025-08-04T08:52:43-07:00	Reese Levine	ggml: WebGPU backend host improvements and style fixing (#14978)
M	.github/workflows/build.yml
M	ggml/src/ggml-webgpu/ggml-webgpu.cpp

commit	5aa1105da24a8dd1661cea3db0582c9b2c2f54d3	d31192b4ee1441bbbecd3cbf9e02633368bdc4f5	2025-08-04T00:09:19-05:00	Jeff Bolz	vulkan: fix build when using glslang that does not support coopmat2 (#15062)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	d31192b4ee1441bbbecd3cbf9e02633368bdc4f5	0a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed0	2025-08-03T16:00:05-04:00	compilade	imatrix : use GGUF by default (#14842)
M	common/arg.cpp
M	common/common.h
M	tools/imatrix/README.md
M	tools/imatrix/imatrix.cpp

commit	0a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed0	11a3811164ef2d75393c6b0a632f4c608e3e3dd2	2025-08-03T15:49:13-04:00	compilade	imatrix : fix 3d activation handling for hybrid and recurrent models (#14994)
M	tools/imatrix/imatrix.cpp

commit	11a3811164ef2d75393c6b0a632f4c608e3e3dd2	97366dc6abdd0bdc74260bd3c42bd06f0feb7428	2025-08-03T15:43:07-04:00	compilade	memory : handle kv_unified for hybrid models (#15050)
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-model.cpp

commit	97366dc6abdd0bdc74260bd3c42bd06f0feb7428	83bc2f288c0e08e676d9beca9c4669197e920593	2025-08-03T12:38:18-07:00	Csaba Kecskemeti	vocab : JetBrains Mellum pre-tokenizer (#15045)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama-vocab.cpp

commit	83bc2f288c0e08e676d9beca9c4669197e920593	6c7a441161080551ce8a52ba32563b6295067192	2025-08-03T09:56:25-05:00	Gabriel Larson	model : add text-only support for Kimi-VL (and find special tokens in text_config)  (#15051)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/vocab.py

commit	6c7a441161080551ce8a52ba32563b6295067192	5c0eb5ef544aeefd81c303e03208f768e158d93c	2025-08-03T07:23:57-05:00	Jeff Bolz	vulkan: Use coopmat2 for conv2d (#14982)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	5c0eb5ef544aeefd81c303e03208f768e158d93c	03d46982180c2fb624bd2a233e46426ab22be5d1	2025-08-02T10:51:18-07:00	lhez	opencl: fix adreno compiler detection logic (#15029)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	03d46982180c2fb624bd2a233e46426ab22be5d1	3303c19b1691088275ee864a823697177c94a15d	2025-08-02T16:37:08+02:00	Johannes Gäßler	CUDA: use mma FA kernel for gqa > 4 on RTX 4000 (#15035)
M	ggml/src/ggml-cuda/fattn.cu

commit	3303c19b1691088275ee864a823697177c94a15d	4fdea540bda4648f98b85e8ee9dc66db4bfb5945	2025-08-02T22:15:36+08:00	leejet	cuda: make im2col a little faster (#15025)
M	ggml/src/ggml-cuda/im2col.cu

commit	4fdea540bda4648f98b85e8ee9dc66db4bfb5945	a4569c41fd2253c89ef52fc2378687bdbf42f61a	2025-08-02T16:14:57+02:00	Daniel Bevenius	kv-cache : skip alignment of n_stream in kv-cache log msg [no ci] (#15040)
M	src/llama-kv-cache-unified.cpp

commit	a4569c41fd2253c89ef52fc2378687bdbf42f61a	15e92fd33791e60a4ddb5970b47242a855c27117	2025-08-02T17:14:21+03:00	Georgi Gerganov	llama : enable LLAMA_SET_ROWS=1 by default (#14959)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h

commit	15e92fd33791e60a4ddb5970b47242a855c27117	2bf3fbf0b54f97aef2b388b76d222789e1c170f1	2025-08-02T17:13:05+03:00	Georgi Gerganov	cuda, sycl : fix batched gemm when ne02 == 1 && ne03 > 1 (#15038)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	2bf3fbf0b54f97aef2b388b76d222789e1c170f1	711d5e6fe66eb6cd7a10d71cec4567321848be08	2025-08-02T14:39:01+02:00	Sigbjørn Skjæret	ci : check that pre-tokenizer hashes are up-to-date (#15032)
A	.github/workflows/pre-tokenizer-hashes.yml
M	convert_hf_to_gguf_update.py
M	requirements/requirements-convert_hf_to_gguf_update.txt

commit	711d5e6fe66eb6cd7a10d71cec4567321848be08	f738989dcb9ccbe468c945553eafbeef7b869675	2025-08-02T05:51:02-05:00	Douglas Hanley	convert : fix Qwen3-Embedding pre-tokenizer hash (#15030)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py

commit	f738989dcb9ccbe468c945553eafbeef7b869675	4cb208c93c1c938591a5b40354e2a6f9b94489bc	2025-08-02T18:04:48+08:00	Jhen-Jie Hong	chat : fix multiple tool_calls on hermes-2-pro (#14962)
M	common/chat.cpp
M	tests/test-chat.cpp

commit	4cb208c93c1c938591a5b40354e2a6f9b94489bc	3025b621d12a6931ff5e9775d4f644719980ad91	2025-08-02T04:21:37-05:00	Jeff Bolz	vulkan: coopmat2 mul_mat optimizations (#14934)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	3025b621d12a6931ff5e9775d4f644719980ad91	ec0b18802c91badd3ff1388ffd09ee163251bd72	2025-08-02T17:20:40+08:00	R0CKSTAR	llama-bench: rename DB table name from test to llama_bench (#15003)
M	scripts/compare-llama-bench.py
M	tools/llama-bench/llama-bench.cpp

commit	ec0b18802c91badd3ff1388ffd09ee163251bd72	339bd0268c498c89529cd0e90c44883c211e3745	2025-08-02T03:48:30-05:00	Jeff Bolz	vulkan: Support ne[3]>1 in noncontig matrix-vector multiply (#15015)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_nc.comp
M	tests/test-backend-ops.cpp

commit	339bd0268c498c89529cd0e90c44883c211e3745	f906275537d14c8fc7c6976d944233771fd6672c	2025-08-02T03:44:50-05:00	Douglas Hanley	model : support Qwen3-Embedding (#15023)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-model.cpp

commit	f906275537d14c8fc7c6976d944233771fd6672c	a9f7541ec25c4c8547daf5ff48700ad2836e2b7d	2025-08-02T10:12:41+02:00	Johannes Gäßler	server: enable token array inputs for OAI API (#15001)
M	tools/server/server.cpp

commit	a9f7541ec25c4c8547daf5ff48700ad2836e2b7d	9c35706b98ea271858acef4194f526a71b24cdc9	2025-08-02T02:57:04-05:00	Jeff Bolz	vulkan: optimizations for direct convolution (#14933)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9c35706b98ea271858acef4194f526a71b24cdc9	c76b420e4ce06f7b7cdfbb0b85d02c90e5cc5a3a	2025-08-01T20:47:32+02:00	Johannes Gäßler	CUDA: fix MMQ nwarps for AMD with warp_size==32 (#15014)
M	ggml/src/ggml-cuda/mmq.cuh

commit	c76b420e4ce06f7b7cdfbb0b85d02c90e5cc5a3a	0f5ccd6fd1a1f709010312933db0316867cc30b6	2025-08-01T16:59:06+02:00	l-austenfeld	vendor : update vendored copy of google/minja (#15011)
M	vendor/minja/chat-template.hpp
M	vendor/minja/minja.hpp

commit	0f5ccd6fd1a1f709010312933db0316867cc30b6	1c872f71fb8a25589efa3ee9b6bf8b517cb8caa4	2025-08-01T21:31:12+08:00	stevenkuang	model : add hunyuan dense (#14878)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	1c872f71fb8a25589efa3ee9b6bf8b517cb8caa4	baad94885df512bb24ab01e2b22d1998fce4d00e	2025-08-01T04:15:44-07:00	lhez	opencl: add f16 for `add`, `sub`, `mul`, `div` (#14984)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/add.cl
M	ggml/src/ggml-opencl/kernels/div.cl
M	ggml/src/ggml-opencl/kernels/mul.cl
M	ggml/src/ggml-opencl/kernels/sub.cl

commit	baad94885df512bb24ab01e2b22d1998fce4d00e	ba42794c9ead96ad52311ba1b23eefcbf3d6f63d	2025-08-01T11:50:33+05:30	Srihari-mcw	ggml : Q2k interleaving implementation - x86/x64 SIMD (#14373)
M	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	ggml/src/ggml-cpu/repack.cpp
M	ggml/src/ggml-cpu/repack.h

commit	ba42794c9ead96ad52311ba1b23eefcbf3d6f63d	2860d479b456e1caa026b40b829d5b13c42a8ed7	2025-08-01T06:38:12+03:00	Georgi Gerganov	graph : fix equal_seq() check (#14986)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.h

commit	2860d479b456e1caa026b40b829d5b13c42a8ed7	484b2091ce5017901483b5204c07878f171d1441	2025-08-01T10:02:34+08:00	diannao	docker : add cann build pipline (#14591)
A	.devops/cann.Dockerfile
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	484b2091ce5017901483b5204c07878f171d1441	daf2dd788066b8b239cb7f68210e090c2124c199	2025-08-01T08:47:27+08:00	R0CKSTAR	compare-commits.sh: support both llama-bench and test-backend-ops (#14392)
M	scripts/compare-commits.sh
M	scripts/compare-llama-bench.py

commit	daf2dd788066b8b239cb7f68210e090c2124c199	a06ed5feaec9f935fbf662035b2673167bc88460	2025-07-31T20:32:18+01:00	Ed Addario	quantize : skip tensor override when in fallback mode (#14995)
M	src/llama-quant.cpp

commit	a06ed5feaec9f935fbf662035b2673167bc88460	784524053d986255e383dae45235e4f76c6792a7	2025-07-31T11:15:41-07:00	Diego Devesa	llama : add simple option to enable CPU for MoE weights (--cpu-moe) (#14992)
M	common/arg.cpp

commit	784524053d986255e383dae45235e4f76c6792a7	d6818d06a6237631523bc0f45d42e79482667948	2025-08-01T01:22:58+08:00	Aman Gupta	Fix params bug in diffusion example (#14993)
M	common/common.h

commit	d6818d06a6237631523bc0f45d42e79482667948	e08a98826bcce70a3377592c51d0efed99eafe07	2025-07-31T09:11:34-07:00	Diego Devesa	llama : allow other bufts when overriding to CPU, add --no-repack option (#14990)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	include/llama.h
M	src/llama-model.cpp

commit	e08a98826bcce70a3377592c51d0efed99eafe07	952a47f455fbd92e2659b98b9b6317a2dafeb532	2025-07-31T17:46:54+02:00	Ruben Ortlam	Vulkan: Fix minor debug mode issues (#14899)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	952a47f455fbd92e2659b98b9b6317a2dafeb532	36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce	2025-07-31T23:22:17+08:00	tc-mb	mtmd : support MiniCPM-V 4.0 (#14983)
M	docs/multimodal/minicpmo2.6.md
A	docs/multimodal/minicpmo4.0.md
M	docs/multimodal/minicpmv2.5.md
M	docs/multimodal/minicpmv2.6.md
A	docs/multimodal/minicpmv4.0.md
M	tools/mtmd/clip.cpp
M	tools/mtmd/legacy-models/minicpmv-convert-image-encoder-to-gguf.py
M	tools/mtmd/mtmd.cpp

commit	36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce	94933c8c2eeaa9a7983e3f6c08af76bd86724094	2025-07-31T07:59:49-07:00	Csaba Kecskemeti	MODEL_TENSOR.SSM_DT_NORM has defined twice (#14991)
M	gguf-py/gguf/tensor_mapping.py

commit	94933c8c2eeaa9a7983e3f6c08af76bd86724094	c1dacaa99b4ead6edbac928cd2da59436573f6b0	2025-07-31T05:25:23-07:00	g2mt	server : implement universal assisted decoding (#12635)
M	common/arg.cpp
M	common/common.h
M	common/speculative.cpp
M	common/speculative.h
M	examples/speculative-simple/speculative-simple.cpp
M	tools/server/server.cpp

commit	c1dacaa99b4ead6edbac928cd2da59436573f6b0	a9f77a8be348deeb11fb3d54d412bf583003c90d	2025-07-31T20:12:20+08:00	Dongliang Wei	llama : merge build_moe_ffn_from_probs function into build_moe_ffn (#14968)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	a9f77a8be348deeb11fb3d54d412bf583003c90d	8a4a85627702b569d7d2810f2de06a4321656e9d	2025-07-31T14:08:23+02:00	Lukas Straub	server : add openai-style logit_bias support (#14946)
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/unit/test_completion.py

commit	8a4a85627702b569d7d2810f2de06a4321656e9d	11490b36723d511d75fb601995c79b5c363ba3a2	2025-07-31T19:49:09+08:00	Aman Gupta	Add LLaDA 8b Diffusion model (#14771)
M	common/arg.cpp
M	common/common.h
M	convert_hf_to_gguf.py
A	examples/diffusion/README.md
M	examples/diffusion/diffusion-cli.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	11490b36723d511d75fb601995c79b5c363ba3a2	66625a59a54d0a7504eda4c4e83abfcd83ba1cf8	2025-07-31T19:47:20+08:00	hipudding	CANN: Improve loading efficiency after converting weights to NZ format. (#14985)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	66625a59a54d0a7504eda4c4e83abfcd83ba1cf8	6e6725459a892b49602b596339de4916c7c7965a	2025-07-31T01:02:46-04:00	compilade	graph : reduce splits for recurrent and hybrid models (#14825)
M	src/llama-graph.cpp
M	src/llama-graph.h

commit	6e6725459a892b49602b596339de4916c7c7965a	e9192bec564780bd4313ad6524d20a0ab92797db	2025-07-30T14:56:55-07:00	lhez	opencl: add `mul_mat_f32_f32_l4_lm` and `mul_mat_f16_f32_l4_lm` (#14809)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/mul_mm_f16_f32_l4_lm.cl
A	ggml/src/ggml-opencl/kernels/mul_mm_f32_f32_l4_lm.cl

commit	e9192bec564780bd4313ad6524d20a0ab92797db	41e78c567e9a8c652e405f4f909deb598deecd31	2025-07-30T20:11:56+01:00	Ed Addario	quantize : fix using combined imatrix GGUFs (multiple datasets) (#14973)
M	tools/quantize/quantize.cpp

commit	41e78c567e9a8c652e405f4f909deb598deecd31	ad4a700117d1746799d2d6599e526e2c3a7938d2	2025-07-30T18:07:11+02:00	Daniel Bevenius	server : add support for `embd_normalize` parameter (#14964)
M	tools/server/README.md
M	tools/server/server.cpp

commit	ad4a700117d1746799d2d6599e526e2c3a7938d2	e32a4ec60ee472acf3fe82b5966976fd6965ac6b	2025-07-30T17:38:06+02:00	uvos	HIP: enable mfma mmq on gfx908 and gfx90a for select datatypes and shapes (#14949)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	e32a4ec60ee472acf3fe82b5966976fd6965ac6b	e228de94496636681b36690247d96f97d5f76c0d	2025-07-30T16:03:13+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	e228de94496636681b36690247d96f97d5f76c0d	73a8e5ca0372f4dcaf1aed4e42261723da0914aa	2025-07-30T14:53:16+02:00	Kai Pastor	cmake : Fix BLAS link interface (ggml/1316)
M	ggml/cmake/ggml-config.cmake.in

commit	73a8e5ca0372f4dcaf1aed4e42261723da0914aa	92b8810ec7aa6d778bc287cc918443cf67b962e2	2025-07-30T14:52:26+02:00	Kai Pastor	vulkan : fix 32-bit builds (ggml/1313)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	92b8810ec7aa6d778bc287cc918443cf67b962e2	00131d6eaf4df029e1ec84de868c2c5957503007	2025-07-30T15:46:13+02:00	Johannes Gäßler	CUDA: skip masked KV slices for all FA kernels (#14924)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu

commit	00131d6eaf4df029e1ec84de868c2c5957503007	1e15bfd42c3938506e0da5939bf7f42780965f01	2025-07-30T15:12:02+03:00	Georgi Gerganov	tests : update for LLAMA_SET_ROWS=1 (#14961)
M	examples/embedding/embedding.cpp
M	examples/save-load-state/save-load-state.cpp
M	src/llama-batch.cpp
M	tests/CMakeLists.txt
M	tests/test-thread-safety.cpp

commit	1e15bfd42c3938506e0da5939bf7f42780965f01	a118d80233d3bf92569c051346fd2638f87bf202	2025-07-30T13:52:11+03:00	Georgi Gerganov	graph : fix stack-use-after-return (#14960)
M	src/llama-graph.h

commit	a118d80233d3bf92569c051346fd2638f87bf202	61550f8231dc0aa478e2f537c5009ede6878ce22	2025-07-30T00:25:05-05:00	Douglas Hanley	embeddings: fix extraction of CLS pooling results (#14927)
M	src/llama-graph.cpp

commit	61550f8231dc0aa478e2f537c5009ede6878ce22	aa79524c51fb014f8df17069d31d7c44b9ea6cb8	2025-07-30T08:39:24+08:00	Xinpeng Dou	CANN: update ops docs (#14935)
M	docs/ops.md
A	docs/ops/CANN.csv

commit	aa79524c51fb014f8df17069d31d7c44b9ea6cb8	b77d11179d7efe68ce5c913006f2ef9ee17cc8f7	2025-07-29T20:23:04+02:00	uvos	HIP: remove the use of __HIP_PLATFORM_AMD__, explicitly support only AMD targets (#14945)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/vendors/hip.h

commit	b77d11179d7efe68ce5c913006f2ef9ee17cc8f7	c7aa1364fd59b2ac06fd9e0a719253d968472dc3	2025-07-29T17:44:30+02:00	uvos	HIP: add GGML_HIP_MMQ_MFMA option to allow disableing the MFMA path. (#14930)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-hip/CMakeLists.txt

commit	c7aa1364fd59b2ac06fd9e0a719253d968472dc3	1a67fcc30677e96dda76bb1b290788e7d8852b51	2025-07-29T17:43:43+02:00	uvos	HIP: Ignore unsupported unroll transformation in fattn-vec (#14931)
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	1a67fcc30677e96dda76bb1b290788e7d8852b51	204f2cf168dc01ca7b200b1510e0ff585ca9a92e	2025-07-30T00:05:38+09:00	kallewoof	common : avoid logging partial messages (which can contain broken UTF-8 sequences) (#14937)
M	common/chat.cpp

commit	204f2cf168dc01ca7b200b1510e0ff585ca9a92e	138b288b594eeb19d58e0ab0d74eae32009c9c20	2025-07-29T22:36:43+08:00	hipudding	CANN: Add ggml_set_rows (#14943)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	138b288b594eeb19d58e0ab0d74eae32009c9c20	bbd0f917797e9d524680f1b30d34a46eb06d7651	2025-07-29T14:22:03+02:00	Sigbjørn Skjæret	cuda : add softcap fusion (#14907)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/softcap.cu
A	ggml/src/ggml-cuda/softcap.cuh
M	tests/test-backend-ops.cpp

commit	bbd0f917797e9d524680f1b30d34a46eb06d7651	0a5036bee9cfb946870689db4400e9e0d17844c9	2025-07-29T10:40:50+02:00	Johannes Gäßler	server-bench: make seed choice configurable (#14929)
M	scripts/server-bench.py

commit	0a5036bee9cfb946870689db4400e9e0d17844c9	8ad7b3e65b5834e5574c2f5640056c9047b5d93b	2025-07-29T14:45:18+08:00	Aman Gupta	CUDA: add roll (#14919)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/roll.cu
A	ggml/src/ggml-cuda/roll.cuh

commit	8ad7b3e65b5834e5574c2f5640056c9047b5d93b	bda62193b2a6bebbf515c3c389303094a44458c1	2025-07-28T09:50:17-07:00	lhez	opencl : add ops docs (#14910)
M	docs/ops.md
A	docs/ops/OpenCL.csv

commit	bda62193b2a6bebbf515c3c389303094a44458c1	c556418b600ad5792440942079d93e393595688b	2025-07-28T09:04:27-07:00	Leonard Mosescu	test-backend-ops : extend test case filtering (#14865)
M	tests/test-backend-ops.cpp

commit	c556418b600ad5792440942079d93e393595688b	db16e2831c0f344f041af3d067db81c42b16eb22	2025-07-28T18:59:04+03:00	Radoslav Gerganov	llama-bench : use local GPUs along with RPC servers (#14917)
M	tools/llama-bench/llama-bench.cpp

commit	db16e2831c0f344f041af3d067db81c42b16eb22	cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc	2025-07-28T23:40:24+08:00	xctan	ggml-cpu : deduplicate scalar implementations (#14897)
M	ggml/src/ggml-cpu/arch/arm/quants.c
M	ggml/src/ggml-cpu/arch/arm/repack.cpp
M	ggml/src/ggml-cpu/arch/loongarch/quants.c
M	ggml/src/ggml-cpu/arch/powerpc/quants.c
M	ggml/src/ggml-cpu/arch/riscv/quants.c
M	ggml/src/ggml-cpu/arch/riscv/repack.cpp
M	ggml/src/ggml-cpu/arch/s390/quants.c
M	ggml/src/ggml-cpu/arch/wasm/quants.c
M	ggml/src/ggml-cpu/arch/x86/quants.c
M	ggml/src/ggml-cpu/arch/x86/repack.cpp

commit	cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc	00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2	2025-07-28T20:32:15+05:30	Akarshan Biswas	SYCL: Add set_rows support for quantized types  (#14883)
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/cpy.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/set_rows.cpp

commit	00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2	946b1f685909c8c9c044f145bce819c02f327eaa	2025-07-28T15:01:48+02:00	Xuan-Son Nguyen	mtmd : add support for Voxtral (#14862)
M	.gitignore
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/vocab.py
A	models/templates/unsloth-mistral-Devstral-Small-2507.jinja
M	requirements/requirements-convert_hf_to_gguf.txt
M	requirements/requirements-pydantic.txt
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/requirements.txt
M	tools/mtmd/tests.sh

commit	946b1f685909c8c9c044f145bce819c02f327eaa	6c6e397affc4fac717e718364fb4b635cec6433a	2025-07-28T14:30:22+02:00	Johannes Gäßler	CUDA: fix pointer incrementation in FA (#14916)
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	6c6e397affc4fac717e718364fb4b635cec6433a	afc0e8969896ada62238da07b98731e5a4b12ba4	2025-07-28T19:47:00+08:00	Dongliang Wei	model : add support for SmallThinker series (#14898)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	afc0e8969896ada62238da07b98731e5a4b12ba4	a5771c9eea801f573dc7375416e4c3306543563d	2025-07-28T11:05:53+01:00	Alberto Cabrera Pérez	sycl: refactor quantization to q8_1  (#14815)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/quantize.hpp

commit	a5771c9eea801f573dc7375416e4c3306543563d	c35f9eaf095e0db3aa9b77b56846bab5d3bf5661	2025-07-28T11:01:03+03:00	Georgi Gerganov	ops : update BLAS (#14914)
M	docs/ops.md
M	docs/ops/BLAS.csv
M	docs/ops/Metal.csv

commit	c35f9eaf095e0db3aa9b77b56846bab5d3bf5661	1f45f2890ef7f365ba0a45e08a8d1f46b8bc6b9e	2025-07-28T08:22:56+03:00	Georgi Gerganov	ops : update Metal (#14912)
M	docs/ops.md
M	docs/ops/Metal.csv

commit	1f45f2890ef7f365ba0a45e08a8d1f46b8bc6b9e	613c5095c33de9b7bbf1097d7c32510f51d58b01	2025-07-28T08:14:20+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	613c5095c33de9b7bbf1097d7c32510f51d58b01	7f97599581fcf0c37432dd3b1f503b91bed97695	2025-07-24T19:58:02+02:00	Kai Pastor	cmake : Indent ggml-config.cmake (ggml/1310)
M	ggml/cmake/ggml-config.cmake.in

commit	7f97599581fcf0c37432dd3b1f503b91bed97695	bf78f5439ee8e82e367674043303ebf8e92b4805	2025-07-27T22:31:11+01:00	Ed Addario	quantize : update README.md (#14905)
M	tools/quantize/README.md

commit	bf78f5439ee8e82e367674043303ebf8e92b4805	bbfc84927481d1e59d8af6939b93b76850f0ab53	2025-07-27T15:33:08+02:00	Ruben Ortlam	vulkan: add ops docs (#14900)
M	docs/ops.md
A	docs/ops/Vulkan.csv

commit	bbfc84927481d1e59d8af6939b93b76850f0ab53	ca0ef2dddb022cb1337d775cd05cd27d7808aff4	2025-07-27T17:52:58+05:30	Akarshan Biswas	SYCL: add ops doc (#14901)
M	docs/ops.md
A	docs/ops/SYCL.csv

commit	ca0ef2dddb022cb1337d775cd05cd27d7808aff4	89d1029559bd2968f76db854f9f113d73e34527c	2025-07-27T12:10:51+02:00	Daniel Bevenius	llama : clarify comment about pp and tg graphs [no ci] (#14895)
M	src/llama-context.cpp

commit	89d1029559bd2968f76db854f9f113d73e34527c	f1a4e72de5950ab7136aeadddd675caf30dd6b3f	2025-07-27T12:04:33+02:00	Erik Scholz	vulkan : add fp16 support for the conv_2d kernel (#14872)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	f1a4e72de5950ab7136aeadddd675caf30dd6b3f	4762ad7316dcdec20016ab5985fb46a27902204d	2025-07-27T04:05:34-05:00	Jeff Bolz	vulkan: skip empty set_rows to avoid invalid API usage (#14860)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	4762ad7316dcdec20016ab5985fb46a27902204d	1dc9614e0673e794d2e2bf88ba04f7d57b63a57b	2025-07-27T03:18:37-05:00	Gabriel Larson	model : make rope_yarn_log_mul optional for deepseek2 (#14896)
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	1dc9614e0673e794d2e2bf88ba04f7d57b63a57b	446595b9b3a113d9ba10506922c3a156cca9d477	2025-07-27T16:38:44+09:00	Shunta Saito	llama : fix kq_scale for the attention layers of PLaMo2 (#14892)
M	convert_hf_to_gguf.py
M	src/llama-model.cpp

commit	446595b9b3a113d9ba10506922c3a156cca9d477	66906cd82a4a1fd10151707cee3f66cb61fc4055	2025-07-27T09:36:43+08:00	Aman Gupta	Docs: add instructions for adding backends (#14889)
M	docs/ops.md
M	docs/ops/CPU.csv
M	docs/ops/CUDA.csv
M	scripts/create_ops_docs.py
M	tests/test-backend-ops.cpp

commit	66906cd82a4a1fd10151707cee3f66cb61fc4055	11dd5a44eb180e1d69fac24d3852b5222d66fb7f	2025-07-26T18:28:14-04:00	deepsek	HIP: Enable Matrix cores for MMQ Kernels, Enable stream-K for CDNA 3 (#14624)
M	.devops/rocm.Dockerfile
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/vendors/hip.h

commit	11dd5a44eb180e1d69fac24d3852b5222d66fb7f	9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b	2025-07-26T17:56:18+08:00	hipudding	CANN: Implement GLU ops (#14884)
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b	c7f3169cd523140a288095f2d79befb20a0b73f4	2025-07-26T10:36:02+08:00	R0CKSTAR	musa: fix build warnings (unused variable) (#14869)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/set-rows.cu

commit	c7f3169cd523140a288095f2d79befb20a0b73f4	793c0d7f46384001738c337d7afa46b45ae32745	2025-07-26T01:09:03+08:00	Aaron Teo	ggml-cpu : disable GGML_NNPA by default due to instability (#14880)
M	docs/build-s390x.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	793c0d7f46384001738c337d7afa46b45ae32745	ce111d39d666f4a3b6a561ad020f6feb8cc67790	2025-07-25T10:47:39-06:00	Gabe Goodhart	metal: SSM_SCAN performance (#14743)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	ce111d39d666f4a3b6a561ad020f6feb8cc67790	e7fecba93416c8aaf343932b5e36dd5e208a815e	2025-07-25T08:12:13-07:00	lhez	opencl: add fused `rms_norm_mul` (#14841)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/rms_norm.cl

commit	e7fecba93416c8aaf343932b5e36dd5e208a815e	e2b7621e7c265a6739225125cf9c534f471b3472	2025-07-25T23:25:05+09:00	wooksong	docs : update HOWTO‑add‑model.md for ModelBase and new model classes (#14874)
M	docs/development/HOWTO-add-model.md

commit	e2b7621e7c265a6739225125cf9c534f471b3472	c1dbea752a630169c104118fd0c82f3ffcb19c91	2025-07-25T13:29:57+02:00	Oliver Simons	ggml : remove invalid portPos specifiers from dot files (#14838)
M	ggml/src/ggml.c

commit	c1dbea752a630169c104118fd0c82f3ffcb19c91	749e0d27f0247337869f4698f59dd7fafba94326	2025-07-25T14:28:06+03:00	Georgi Gerganov	context : restore preemptive sched reset when LLAMA_SET_ROWS=0 (#14870)
M	src/llama-context.cpp
M	src/llama-context.h

commit	749e0d27f0247337869f4698f59dd7fafba94326	64bf1c3744053cf7def10aeed21ff48883ee755b	2025-07-25T19:08:04+08:00	kiwi	mtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503)
M	tools/export-lora/export-lora.cpp
M	tools/mtmd/clip.cpp

commit	64bf1c3744053cf7def10aeed21ff48883ee755b	c12bbde37258c6d053322d1cedd4a9672109ae58	2025-07-25T06:17:02-04:00	Chris Rohlf	rpc : check for null buffers in get/set/copy tensor endpoints (#14868)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	c12bbde37258c6d053322d1cedd4a9672109ae58	3f4fc97f1d745f1d5d3c853949503136d419e6de	2025-07-25T01:07:26-07:00	Diego Devesa	sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855)
M	ggml/src/ggml-backend.cpp

commit	3f4fc97f1d745f1d5d3c853949503136d419e6de	2df255da3cea108de0ae9b302ffdd31674b6d88d	2025-07-25T03:05:37+08:00	R0CKSTAR	musa: upgrade musa sdk to rc4.2.0 (#14498)
M	.devops/musa.Dockerfile
M	.github/workflows/build.yml
M	ci/README.md
M	docs/docker.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/vendors/musa.h
M	ggml/src/ggml-musa/CMakeLists.txt

commit	2df255da3cea108de0ae9b302ffdd31674b6d88d	60f816a79dd74007158745530e71738aa6caa67e	2025-07-24T18:30:33+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	60f816a79dd74007158745530e71738aa6caa67e	5592f278b6ec6aa4a1793e89e8c61838a12ebc9d	2025-07-22T20:13:21+02:00	Kai Pastor	cmake : fix usage issues (ggml/1257)
M	ggml/cmake/ggml-config.cmake.in
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	5592f278b6ec6aa4a1793e89e8c61838a12ebc9d	e4868d16d24dec55e61bcaadaca28feed8f98b13	2025-07-21T15:53:12+02:00	Daniel Bevenius	ggml-cpu : remove stdlib include from repack.cpp (ggml/1276)
M	ggml/src/ggml-cpu/repack.cpp

commit	e4868d16d24dec55e61bcaadaca28feed8f98b13	820de57d4faa427a3d0bfb14e48057247fae036e	2025-07-24T16:31:48+03:00	Georgi Gerganov	context : perform output reorder lazily upon access after sync (#14853)
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h

commit	820de57d4faa427a3d0bfb14e48057247fae036e	cb4a63aad6650c2b536a7578403935388cb2920e	2025-07-24T13:59:56+02:00	Xuan-Son Nguyen	chat : fix kimi-k2 chat template (#14852)
M	src/llama-arch.cpp
M	src/llama-chat.cpp

commit	cb4a63aad6650c2b536a7578403935388cb2920e	86f5623d904cfd392fdeb14a143097b4074660f6	2025-07-24T11:09:57+01:00	Alberto Cabrera Pérez	sycl: fixed semantics of block offset calculation (#14814)
M	ggml/src/ggml-sycl/quants.hpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	86f5623d904cfd392fdeb14a143097b4074660f6	39cffdf18855e0d2beba62572542251d87421e73	2025-07-24T17:50:51+08:00	yummy	llama : fix MiniCPM inference after Granite Four changes (#14850)
M	src/llama-model.cpp

commit	39cffdf18855e0d2beba62572542251d87421e73	065908cb09adff8b2a5f1173f80050d5d9a6790b	2025-07-24T12:26:44+03:00	Pouya	docs: add libcurl-dev install hint for Linux distros (#14801)
M	docs/build.md

commit	065908cb09adff8b2a5f1173f80050d5d9a6790b	4ec6291a2407404de52239c1f9ca66c07e7fb28b	2025-07-24T10:24:05+03:00	Georgi Gerganov	metal : fix fusion across different encoders (#14849)
M	ggml/src/ggml-metal/ggml-metal.m

commit	4ec6291a2407404de52239c1f9ca66c07e7fb28b	a12363bbf0ca11f787dee9756861043136edc0df	2025-07-24T13:50:41+09:00	Donghyeon Jeong	sycl: fix undefined variable in work group size check (#14843)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a12363bbf0ca11f787dee9756861043136edc0df	a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6	2025-07-23T23:23:57+02:00	jacekpoplawski	convert : text-only support for GLM-4.1V-9B-Thinking (#14823)
M	convert_hf_to_gguf.py

commit	a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6	b284197df426fb189cdcfe56a43c863a788ac756	2025-07-23T21:43:25+02:00	Johannes Gäßler	CUDA: fix overflow in FA, tune performance (#14840)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu

commit	b284197df426fb189cdcfe56a43c863a788ac756	221c0e0c5841a814e95b9bfd549de9d6ae00ac6e	2025-07-23T18:22:30+02:00	Johannes Gäßler	CUDA: fix compilation with GGML_CUDA_F16 (#14837)
M	ggml/src/ggml-cuda/convert.cu

commit	221c0e0c5841a814e95b9bfd549de9d6ae00ac6e	07a19e27a26f76d34be62da53807f93131fb3cab	2025-07-23T14:27:54+02:00	Sigbjørn Skjæret	ci : correct label refactor->refactoring (#14832)
M	.github/workflows/close-issue.yml

commit	07a19e27a26f76d34be62da53807f93131fb3cab	18f3b5ff9e5eda4e7d04bceff8ffdccb0a696ed8	2025-07-23T12:35:53+02:00	Johannes Gäßler	CUDA: fix quantized KV cache + multiple sequences (#14822)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/fattn-common.cuh

commit	18f3b5ff9e5eda4e7d04bceff8ffdccb0a696ed8	7233358d29df3dfbf80693f2de7e5865401ad724	2025-07-18T13:36:27+03:00	Georgi Gerganov	tests : add non-cont K,V FA tests
M	tests/test-backend-ops.cpp

commit	7233358d29df3dfbf80693f2de7e5865401ad724	6c88b3bb2509d980e6a64c50fdf8dd304929f770	2025-07-23T16:16:41+08:00	l3utterfly	memory : handle saving/loading null layers in recurrent memory (#14675)
M	src/llama-memory-recurrent.cpp

commit	6c88b3bb2509d980e6a64c50fdf8dd304929f770	14c28dfc50a2e3915e697122cd3c5343224009be	2025-07-23T14:39:51+08:00	lixing-star	ggml: fix loongarch quantize_row_q8_1 error (#14827)
M	ggml/src/ggml-cpu/arch/loongarch/quants.c

commit	14c28dfc50a2e3915e697122cd3c5343224009be	8c988fa41db4d9dbc05abfd666c04def1259c645	2025-07-23T11:58:00+08:00	chen fan	CANN: weight format to NZ for Ascend310P3 (#14407)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	8c988fa41db4d9dbc05abfd666c04def1259c645	acd6cb1c41676f6bbb25c2a76fa5abeb1719301e	2025-07-23T09:25:42+08:00	Aman Gupta	CUDA: add fused rms norm (#14800)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-cuda/norm.cuh
M	tests/test-backend-ops.cpp

commit	acd6cb1c41676f6bbb25c2a76fa5abeb1719301e	84712b60439453fb393c2ca753cee682a4ad41f5	2025-07-22T09:29:43-07:00	Csaba Kecskemeti	ggml : model card yaml tab->2xspace (#14819)
M	gguf-py/gguf/metadata.py

commit	84712b60439453fb393c2ca753cee682a4ad41f5	d4d1522b20809a350ffb094db20f40f17d3ab80f	2025-07-22T10:35:21-05:00	Jeff Bolz	vulkan: fix rms_norm_mul to handle broadcasting dim0 (#14817)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp

commit	d4d1522b20809a350ffb094db20f40f17d3ab80f	d1aa0cc5d13ec3fa553de5d298f9166679e58479	2025-07-22T23:01:29+08:00	Molly Sophia	llama : add model type detection for rwkv7 7B&14B (#14816)
M	src/llama-model.cpp

commit	d1aa0cc5d13ec3fa553de5d298f9166679e58479	c8ade30036139e32108fee53d8b7164dbfda4bee	2025-07-22T13:33:37+01:00	Ed Addario	imatrix: add option to display importance score statistics for a given imatrix file (#12718)
M	common/arg.cpp
M	common/common.h
M	tools/imatrix/README.md
M	tools/imatrix/imatrix.cpp

commit	c8ade30036139e32108fee53d8b7164dbfda4bee	e28c0b80c249b5618c3a0d5e960f63929f380ac9	2025-07-22T12:51:03+02:00	stduhpf	Mtmd: add a way to select device for vision encoder (#14236)
M	tools/mtmd/clip.cpp

commit	e28c0b80c249b5618c3a0d5e960f63929f380ac9	8e6f8bc875358968b63e08f7bbbe0a288f29d856	2025-07-22T12:33:10+02:00	Sigbjørn Skjæret	cuda : implement bf16 cpy ops and enable bf16 cont (#14763)
M	ggml/src/ggml-cuda/cpy-utils.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/set-rows.cu

commit	8e6f8bc875358968b63e08f7bbbe0a288f29d856	adef81781a15083f218eae6c488b95cdad781971	2025-07-21T23:53:30-07:00	lhez	opencl: remove unreachable `return` (#14806)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	adef81781a15083f218eae6c488b95cdad781971	48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245	2025-07-22T09:24:22+08:00	Molly Sophia	server : allow setting `--reverse-prompt` arg (#14799)
M	common/arg.cpp
M	tools/server/server.cpp

commit	48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245	38d3af1b73302377111e88ddd725257638339286	2025-07-22T07:45:26+08:00	R0CKSTAR	cuda: remove linking to cublasLt (#14790)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	38d3af1b73302377111e88ddd725257638339286	6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777	2025-07-21T22:55:10+02:00	Sigbjørn Skjæret	opencl: fix `im2col` when `KW!=KH` (#14803)
M	ggml/src/ggml-opencl/kernels/im2col_f16.cl
M	ggml/src/ggml-opencl/kernels/im2col_f32.cl

commit	6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777	cd465d823c378853f1f6570eebfb77f69c7e1d39	2025-07-21T19:03:19+02:00	rmatif	opencl: add conv2d kernel (#14403)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/conv2d.cl
A	ggml/src/ggml-opencl/kernels/conv2d_f16_f32.cl

commit	cd465d823c378853f1f6570eebfb77f69c7e1d39	922042601b8a16877ccb1c2afaa2071f76734f10	2025-07-21T18:39:29+02:00	Romain Biessy	sycl: Fix im2col (#14797)
M	ggml/src/ggml-sycl/im2col.cpp

commit	922042601b8a16877ccb1c2afaa2071f76734f10	2ba1333b35e471b344974dde553db11bf1c2836f	2025-07-21T15:49:52+02:00	Charles Xu	kleidiai: add support for get_rows (#14676)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kernels.cpp
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	2ba1333b35e471b344974dde553db11bf1c2836f	c2e058f1b4e799f1be085560c1bcef95b7b5ed02	2025-07-21T15:03:49+03:00	Radoslav Gerganov	docs : fix backends table in README.md (#14796)
M	README.md

commit	c2e058f1b4e799f1be085560c1bcef95b7b5ed02	c82d48ec23fb8749c341d0838f6891fd5f6b6da0	2025-07-21T06:35:40-05:00	Jeff Bolz	vulkan/cuda: Fix im2col when KW!=KH (#14789)
M	ggml/src/ggml-cuda/im2col.cu
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	tests/test-backend-ops.cpp

commit	c82d48ec23fb8749c341d0838f6891fd5f6b6da0	b4efd77f8ab407836ca73a5176f041650c5b2411	2025-07-21T17:38:36+08:00	Molly Sophia	llama : fix `--reverse-prompt` crashing issue (#14794)
M	tools/main/main.cpp

commit	b4efd77f8ab407836ca73a5176f041650c5b2411	2be60cbc2707359241c2784f9d2e30d8fc7cdabb	2025-07-21T09:24:51+02:00	IsaacDynamo	server : add parse_special option to /tokenize endpoint (#14783)
M	tools/server/README.md
M	tools/server/server.cpp

commit	2be60cbc2707359241c2784f9d2e30d8fc7cdabb	b526ad2668944a7b2b1721f60679153646313831	2025-07-21T02:13:47+08:00	Aman Gupta	docs : fix link for tools/perplexity in README.md (#14780)
M	README.md

commit	b526ad2668944a7b2b1721f60679153646313831	938b785764683c298e7805e712f8728489cc2f18	2025-07-20T23:55:32+07:00	rspOverflow	Documentation: Further revisions to the Vulkan section in build.md (#14785)
M	docs/build.md

commit	938b785764683c298e7805e712f8728489cc2f18	36c153248faf969af1b62ab231348694b2047b8b	2025-07-20T19:42:34+08:00	Aman Gupta	Clang-format: local files first + fix BinPacking (#14779)
M	.clang-format

commit	36c153248faf969af1b62ab231348694b2047b8b	a979ca22db0d737af1e548a73291193655c6be99	2025-07-19T22:47:21+02:00	0cc4m	Contrib: add 0cc4m as codeowner for Vulkan backend (#14775)
M	CODEOWNERS

commit	a979ca22db0d737af1e548a73291193655c6be99	90083283ec254fa8d33897746dea229aee401b37	2025-07-19T21:59:08+02:00	Ervin Áron Tasnádi	ggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	90083283ec254fa8d33897746dea229aee401b37	d4b91ea7b2da253e1355b503f0fcb7b428ce005d	2025-07-19T12:51:22-04:00	compilade	imatrix : use GGUF to store importance matrices (#9400)
M	common/common.cpp
M	common/common.h
M	gguf-py/gguf/constants.py
M	tools/imatrix/README.md
M	tools/imatrix/imatrix.cpp
M	tools/quantize/quantize.cpp

commit	d4b91ea7b2da253e1355b503f0fcb7b428ce005d	83f5872404baa39d826af2ef66351e63c64205a8	2025-07-19T16:58:03+01:00	Peter0x44	vulkan: Add logging for bf16 features to ggml_vk_print_gpu_info (#13274) (#14707)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	83f5872404baa39d826af2ef66351e63c64205a8	f0d4d176df72734a543c29eef9f942850c13311e	2025-07-19T17:47:53+02:00	0cc4m	Vulkan: Fix fprintf format-security warning (#14770)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	f0d4d176df72734a543c29eef9f942850c13311e	b17230917c18a25af9cd143a941001466af845a2	2025-07-19T17:18:36+07:00	rspOverflow	Documentation: Update build.md's Vulkan section (#14736)
M	docs/build.md

commit	b17230917c18a25af9cd143a941001466af845a2	bf9087f59aab940cf312b85a67067ce33d9e365a	2025-07-19T11:46:12+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	bf9087f59aab940cf312b85a67067ce33d9e365a	9fb1042ce6719bc46dbe88ab013148aabe3105f1	2025-07-18T20:37:26+03:00	Georgi Gerganov	metal : fuse add, mul + add tests (#14596)
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	src/llama-graph.cpp
M	tests/test-backend-ops.cpp

commit	9fb1042ce6719bc46dbe88ab013148aabe3105f1	2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b	2025-07-18T20:08:33+03:00	Georgi Gerganov	graph : fix graph reuse reset of params (#14760)
M	src/llama-graph.cpp

commit	2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b	021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2	2025-07-18T17:33:41+03:00	Georgi Gerganov	parallel : add option for different RNG seeds (#14757)
M	examples/parallel/parallel.cpp

commit	021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2	d498af3d5a00f96bdd37b534860f03a6d9e98d39	2025-07-18T13:35:32+02:00	Oliver Simons	cuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	d498af3d5a00f96bdd37b534860f03a6d9e98d39	eacdeb5bfcb6c6cd54461fd0e9f04cab78bf975b	2025-07-18T14:31:15+03:00	Georgi Gerganov	graph : avoid huge warm-up graphs for MoE models (#14753)
M	src/llama-context.cpp
M	src/llama-graph.cpp

commit	eacdeb5bfcb6c6cd54461fd0e9f04cab78bf975b	e0cb5c5cb8a61ac232130cf6bf878035f93824d9	2025-07-18T11:53:55+03:00	Georgi Gerganov	model : fix build after merge conflict (#14754)
M	src/llama-model.cpp

commit	e0cb5c5cb8a61ac232130cf6bf878035f93824d9	f9a31eea06a859e34cecb88b4d020c7f03d86cc4	2025-07-18T17:45:49+09:00	lgai-exaone	model : add EXAONE 4.0 support (#14630)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	f9a31eea06a859e34cecb88b4d020c7f03d86cc4	8f974bc1e980c06833504276021072e7a4088c81	2025-07-18T14:54:18+08:00	Aman Gupta	CUDA: set_rows + cpy.cu refactor (#14712)
A	ggml/src/ggml-cuda/cpy-utils.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/set-rows.cu

commit	8f974bc1e980c06833504276021072e7a4088c81	09651d09ffc1e941bd1be23163abf5495c416547	2025-07-18T08:29:28+03:00	Georgi Gerganov	graph : refactor context to not pass gf explicitly (#14629)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	09651d09ffc1e941bd1be23163abf5495c416547	349ea79fcebc75b0c55bf61594a47736966d4f95	2025-07-18T06:25:54+02:00	Nexes the Elder	graph : Pass the graph placeholder message in debug mode (#14748)
M	src/llama-graph.cpp

commit	349ea79fcebc75b0c55bf61594a47736966d4f95	670e1360cd40f242ae76ba0966542fae6cb59392	2025-07-18T10:23:14+08:00	Neo Zhang Jianyu	use max work group size for device to replace the magic number (#14732)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	670e1360cd40f242ae76ba0966542fae6cb59392	760b4484e3c192a2649a6ffd0d90086c5558f849	2025-07-18T01:17:16+02:00	Piotr Wilkin (ilintar)	convert : fix Ernie4.5 MoE without shared experts (#14746)
M	convert_hf_to_gguf.py

commit	760b4484e3c192a2649a6ffd0d90086c5558f849	cb887f1bc1001c92f7b4a595b9014f3a454a07ab	2025-07-18T00:18:16+02:00	Wroclaw	nix : use optionalAttrs for env mkDerivation attrset argument (#14726)
M	.devops/nix/package.nix

commit	cb887f1bc1001c92f7b4a595b9014f3a454a07ab	d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af	2025-07-17T23:15:32+02:00	Piotr Wilkin (ilintar)	model: add Ernie 4.5 MoE support (#14658)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af	01612b74090df592663cfa01f661c9628f403b59	2025-07-17T20:52:33+03:00	Georgi Gerganov	kv-cache : fix k-shift for multiple streams (#14742)
M	src/llama-kv-cache-unified.cpp

commit	01612b74090df592663cfa01f661c9628f403b59	086cf81e88fb75287b71ff19c08a206b7bc2e02f	2025-07-17T19:08:33+03:00	Georgi Gerganov	llama : reuse compute graphs (#14482)
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory-recurrent.cpp
M	src/llama-model.cpp
M	src/llama-model.h

commit	086cf81e88fb75287b71ff19c08a206b7bc2e02f	d9b691081c04ec5fb0daa9d2b979f915c142963d	2025-07-17T09:22:11+02:00	Tarek Dakhran	llama : fix parallel processing for lfm2 (#14705)
M	src/llama-model.cpp

commit	d9b691081c04ec5fb0daa9d2b979f915c142963d	ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0	2025-07-17T09:49:15+03:00	Georgi Gerganov	kv-cache : opt mask set input (#14600)
M	src/llama-kv-cache-unified.cpp

commit	ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0	1ba45d49822c39ca9a552c7b75efe0495ff400c3	2025-07-17T09:45:54+03:00	Georgi Gerganov	batch : fix uninitialized has_cpl flag (#14733)
M	src/llama-batch.cpp
M	src/llama-batch.h

commit	1ba45d49822c39ca9a552c7b75efe0495ff400c3	19e5943d9e976b59ccd5a0a87ae3d2ff3da44390	2025-07-17T01:52:08+02:00	Sigbjørn Skjæret	ci : disable failing vulkan crossbuilds (#14723)
M	.github/workflows/build-linux-cross.yml

commit	19e5943d9e976b59ccd5a0a87ae3d2ff3da44390	496957e1cbcb522abc63aa18521036e40efce985	2025-07-16T23:17:43+02:00	Sigbjørn Skjæret	convert : make hf token optional (#14717)
M	convert_hf_to_gguf_update.py

commit	496957e1cbcb522abc63aa18521036e40efce985	21c021745d781edf9c44b4972ef6cbbf53b0ecff	2025-07-16T15:17:25-04:00	Diner Burger	llama : fix parameter order for hybrid memory initialization (#14725)
M	src/llama-memory-hybrid.cpp

commit	21c021745d781edf9c44b4972ef6cbbf53b0ecff	b0f0ecc3dce806c68609d375a2b3edc430d8db18	2025-07-16T08:18:51-07:00	Reese Levine	ggml: Add initial WebGPU backend (#14521)
M	.github/workflows/build.yml
M	README.md
M	ci/run.sh
M	docs/build.md
M	ggml/CMakeLists.txt
A	ggml/include/ggml-webgpu.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
A	ggml/src/ggml-webgpu/CMakeLists.txt
A	ggml/src/ggml-webgpu/ggml-webgpu.cpp
A	ggml/src/ggml-webgpu/wgsl-shaders/cpy.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/embed_wgsl.py
A	ggml/src/ggml-webgpu/wgsl-shaders/memset.wgsl
A	ggml/src/ggml-webgpu/wgsl-shaders/mul_mat.wgsl

commit	b0f0ecc3dce806c68609d375a2b3edc430d8db18	225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06	2025-07-16T10:02:06-05:00	tempstudio	model : support output bias for qwen2 (#14711)
M	src/llama-model.cpp

commit	225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06	ab140198211385b85eeeb0abd549a4bbe259e10d	2025-07-16T16:35:42+03:00	Georgi Gerganov	llama : add high-throughput mode (#14363)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/embedding/embedding.cpp
M	examples/parallel/parallel.cpp
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-cparams.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory-hybrid.cpp
M	src/llama-model.cpp
M	tests/test-backend-ops.cpp
M	tools/batched-bench/batched-bench.cpp

commit	ab140198211385b85eeeb0abd549a4bbe259e10d	64978340b0b4a0a6e2fb74270c1509383d2eff32	2025-07-16T20:03:51+08:00	Aman Gupta	Support diffusion models: Add Dream 7B (#14644)
M	common/arg.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	examples/CMakeLists.txt
A	examples/diffusion/CMakeLists.txt
A	examples/diffusion/diffusion-cli.cpp
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	64978340b0b4a0a6e2fb74270c1509383d2eff32	6ffd4e9c442e99afac3d138543ebf86d5fc5ee03	2025-07-16T14:43:32+03:00	Georgi Gerganov	ggml : add asserts (#14720)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.cpp

commit	6ffd4e9c442e99afac3d138543ebf86d5fc5ee03	e4841d24d3485ea4af54f8b65a19ec3123f0ff3c	2025-07-16T14:04:12+03:00	Georgi Gerganov	server : pre-calculate EOG logit biases (#14721)
M	common/common.cpp
M	common/common.h
M	tools/server/server.cpp

commit	e4841d24d3485ea4af54f8b65a19ec3123f0ff3c	538cc77f7f44dfa047dba6a06d90c86dda69cf1d	2025-07-16T19:12:22+09:00	Shunta Saito	llama : fix parallel processing for plamo2 (#14716)
M	src/llama-model.cpp

commit	538cc77f7f44dfa047dba6a06d90c86dda69cf1d	5cae76654113160f691f581930b69fc5535e8159	2025-07-16T12:13:57+03:00	Georgi Gerganov	server : fix handling of the ignore_eos flag (#14710)
M	tools/server/server.cpp

commit	5cae76654113160f691f581930b69fc5535e8159	4b91d6f71f14040979bcdb7b6729b3bca93ec1c1	2025-07-16T09:33:28+02:00	Johannes Gäßler	scripts: synthetic prompt mode for server-bench.py (#14695)
M	scripts/server-bench.py
M	tools/server/README.md

commit	4b91d6f71f14040979bcdb7b6729b3bca93ec1c1	cf91f217f1c8b98b6db8e4ba6b480f017f81d206	2025-07-16T08:52:04+02:00	Sigbjørn Skjæret	convert : only check for tokenizer folder if we need it (#14704)
M	convert_hf_to_gguf_update.py

commit	cf91f217f1c8b98b6db8e4ba6b480f017f81d206	79e0b68c178656bb0632cb8602d2940b755077f8	2025-07-16T08:51:12+02:00	Sigbjørn Skjæret	convert : add pre-computed hashes first to prevent order mishaps (#14701)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py

commit	79e0b68c178656bb0632cb8602d2940b755077f8	c81f4192f91a1e209c1eec7a84fe5371ef9175da	2025-07-16T12:00:42+08:00	Min-Hua	llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
M	include/llama.h

commit	c81f4192f91a1e209c1eec7a84fe5371ef9175da	4a4f426944e79b79e389f9ed7b34831cb9b637ad	2025-07-15T23:04:42+01:00	Ed Addario	gguf-py : dump bpw per layer and model in markdown mode (#14703)
M	gguf-py/gguf/scripts/gguf_dump.py

commit	4a4f426944e79b79e389f9ed7b34831cb9b637ad	ba1ceb34566c889a1fc500efa79799ffed25d9b0	2025-07-15T14:54:22-05:00	Gabriel Larson	model : add Kimi-K2 support (#14654)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
A	models/templates/moonshotai-Kimi-K2.jinja
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-hparams.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/unicode.cpp
M	src/unicode.h

commit	ba1ceb34566c889a1fc500efa79799ffed25d9b0	10a0351a97c25471aea0bbde9cca54d32d163eec	2025-07-15T14:51:09-05:00	Jeff Bolz	vulkan: fix noncontig check for mat_mul_id splitting (#14683)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q6_k.comp

commit	10a0351a97c25471aea0bbde9cca54d32d163eec	68e37a61a7b24863f67541db65b4f6195962a268	2025-07-15T14:32:11-05:00	Jeff Bolz	vulkan: add RTE variants for glu/add/sub/mul/div (#14653)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/glu_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/rte.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	68e37a61a7b24863f67541db65b4f6195962a268	cbc68be51d88b1d5531643b926a4b359c3cff131	2025-07-16T01:11:42+09:00	Shunta Saito	model : add PLaMo-2 support (#14560)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	cbc68be51d88b1d5531643b926a4b359c3cff131	bdca38376f7e8dd928defe01ce6a16218a64b040	2025-07-15T15:28:53+08:00	R0CKSTAR	cuda: fix build warnings in set-rows.cu (unused variable) (#14687)
M	ggml/src/ggml-cuda/set-rows.cu

commit	bdca38376f7e8dd928defe01ce6a16218a64b040	55c509daf51d25bfaee9c8b8ce6abff103d4473b	2025-07-14T18:12:42+01:00	Anton Mitkov	sycl: Hotfix for non dnnl codepath (#14677)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	55c509daf51d25bfaee9c8b8ce6abff103d4473b	9c9e4fc6354fc811efa06a8eb7a86d3315cec9c8	2025-07-14T18:46:42+05:30	shalinib-ibm	ggml : refactor llamafile_sgemm PPC code (#14673)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	9c9e4fc6354fc811efa06a8eb7a86d3315cec9c8	494c5899cb76859f32ddd913534f2685fd684a3d	2025-07-14T21:01:41+08:00	Aman Gupta	llama-context: add ability to get logits (#14672)
M	src/llama-context.cpp

commit	494c5899cb76859f32ddd913534f2685fd684a3d	0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e	2025-07-14T13:14:30+02:00	Johannes Gäßler	scripts: benchmark for HTTP server throughput (#14668)
M	requirements/requirements-all.txt
A	requirements/requirements-server-bench.txt
A	scripts/server-bench.py
M	tools/server/utils.hpp

commit	0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e	65a3ebb0aa56d6c501466e0f950ad15105fd32d8	2025-07-14T15:07:55+05:30	Akarshan Biswas	SYCL: use 1D kernel for set_rows (#14618)
M	ggml/src/ggml-sycl/set_rows.cpp

commit	65a3ebb0aa56d6c501466e0f950ad15105fd32d8	0d9226763c82562186122f3b827fa3862864a19c	2025-07-14T10:37:35+01:00	Anton Mitkov	sycl: Batched mulmat rework for oneDNN dispatch (#14617)
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	0d9226763c82562186122f3b827fa3862864a19c	982e347255723fe6d02e60ee30cfdd0559c884c5	2025-07-14T07:43:43+08:00	Molly Sophia	llama : add jinja template for rwkv-world (#14665)
M	convert_hf_to_gguf.py
A	models/templates/llama-cpp-rwkv-world.jinja
M	src/llama-chat.cpp

commit	982e347255723fe6d02e60ee30cfdd0559c884c5	923e3ea2e3c96a0b4c208f53bc3bc90cdcdf13c0	2025-07-13T17:02:17+01:00	Ed Addario	quantize : fix minor logic flaw in --tensor-type (#14572)
M	src/llama-quant.cpp

commit	923e3ea2e3c96a0b4c208f53bc3bc90cdcdf13c0	e743cddb60dc3a8815b9de7dd7d5c491e61b2259	2025-07-13T15:01:24+02:00	Sigbjørn Skjæret	cuda : add set rows for bf16 (#14664)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/set-rows.cu

commit	e743cddb60dc3a8815b9de7dd7d5c491e61b2259	05fec5bd298d3c0243cbb9336e59b8b6aff75a81	2025-07-13T02:33:16-07:00	Yavor Ivanov	cuda : add ELU support (#14657)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh

commit	05fec5bd298d3c0243cbb9336e59b8b6aff75a81	dcf7f2ea3c4e3cf36dd9ab5a36785c00e6033267	2025-07-13T10:36:33+03:00	Georgi Gerganov	ggml : add build-time message to remind about ggml_set_rows (#14661)
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	dcf7f2ea3c4e3cf36dd9ab5a36785c00e6033267	84b396e0510855a95d591afdf1f21c562cb3712a	2025-07-12T22:38:13-07:00	Yavor Ivanov	metal : Add missing unary ops Metal support (#14660)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	84b396e0510855a95d591afdf1f21c562cb3712a	c31e60647def83d671bac5ab5b35579bf25d9aa1	2025-07-12T22:12:36-07:00	Yavor Ivanov	cmake : Add CMake presets for Linux and GCC (#14656)
M	CMakePresets.json

commit	c31e60647def83d671bac5ab5b35579bf25d9aa1	67eade1bf93f40e7c4975e5bd0782f426c89cff4	2025-07-12T19:10:14+02:00	Tarek Dakhran	tests : cover lfm2 cases in test_ssm_conv (#14651)
M	tests/test-backend-ops.cpp

commit	67eade1bf93f40e7c4975e5bd0782f426c89cff4	7de5c7cab61d4da4387ed9b216f88b96297bcc2d	2025-07-12T19:07:08+02:00	Tarek Dakhran	docs : add LFM2 to models section (#14650)
M	README.md

commit	7de5c7cab61d4da4387ed9b216f88b96297bcc2d	8eff95544e817704d44bec20f9fc956ce76a33be	2025-07-12T21:31:38+08:00	Aman Gupta	CUDA: add set rows for f32 and f16 (#14551)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/set-rows.cu
A	ggml/src/ggml-cuda/set-rows.cuh

commit	8eff95544e817704d44bec20f9fc956ce76a33be	3120413ccd7797d4cbdee32ef89a641765d1f6c4	2025-07-12T16:06:12+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	3120413ccd7797d4cbdee32ef89a641765d1f6c4	215535701d659e873c52d2a9163d4616a42da4f7	2025-07-12T12:39:32+03:00	Georgi Gerganov	vulkan : remove unused vars (#0)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp

commit	215535701d659e873c52d2a9163d4616a42da4f7	74bb294591054a6bf0cc3f6e4637d87414cf2c46	2025-07-12T12:39:27+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	74bb294591054a6bf0cc3f6e4637d87414cf2c46	3e303b1107e4748cd50a675544d8c7fabb40ec54	2025-07-12T12:37:37+03:00	Acly	vulkan : implement bilinear interpolation (ggml/1291)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp

commit	3e303b1107e4748cd50a675544d8c7fabb40ec54	0c1df14b5f8d992805cb22d0b77b44092a18aeab	2025-07-12T12:32:32+03:00	Acly	vulkan : implement ggml_roll (ggml/1290)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/roll.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	0c1df14b5f8d992805cb22d0b77b44092a18aeab	b3ad3a0191994d6c47b2bd389d5c7431526ecd2c	2025-07-12T06:21:02-04:00	Douglas Hanley	server : fix pooled embedding output (#14645)
M	tools/server/server.cpp

commit	b3ad3a0191994d6c47b2bd389d5c7431526ecd2c	98197e5c98388470030d908f355ec5937dcccaaa	2025-07-12T05:12:26-05:00	Jeff Bolz	vulkan: support SET_ROWS (#14587)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	98197e5c98388470030d908f355ec5937dcccaaa	f5e96b368f1acc7f53c390001b936517c4d18999	2025-07-12T04:51:58-05:00	Jeff Bolz	vulkan: optimizations for deepseek prompt processing (#14555)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	f5e96b368f1acc7f53c390001b936517c4d18999	756aa1020aabc70b71b9a8efcd35fbf42b3bb9ab	2025-07-11T20:27:01+02:00	Tarek Dakhran	model : support LiquidAI LFM2 hybrid family (#14620)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	ggml/src/ggml-cuda/ssm-conv.cu
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama-vocab.cpp

commit	756aa1020aabc70b71b9a8efcd35fbf42b3bb9ab	aaa088d87f9006d56866085fe46e4b2755ef723f	2025-07-11T18:55:00+02:00	Slobodan Josic	HIP : Add HIP 7.0+ compatibility for hipBLAS compute types (#14634)
M	ggml/src/ggml-cuda/vendors/hip.h

commit	aaa088d87f9006d56866085fe46e4b2755ef723f	0d5375d54b258ec63edd1fb5d58c37d58ce8be8b	2025-07-11T16:07:55+03:00	Georgi Gerganov	readme : add hot PRs (#14636)
M	README.md

commit	0d5375d54b258ec63edd1fb5d58c37d58ce8be8b	576c82eda210ca0111c04f5256bf77897a4d4cc4	2025-07-11T13:46:07+03:00	Georgi Gerganov	llama : move enum llama_vocab_pre_type to implementation (#14631)
M	include/llama.h
M	src/llama-vocab.h

commit	576c82eda210ca0111c04f5256bf77897a4d4cc4	0aedae00e6fb48680324a5ac5da9cba0e35de6b5	2025-07-11T16:36:04+09:00	Dowon	vocab : add midm-2.0 model pre-tokenizer (#14626)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama-vocab.cpp

commit	0aedae00e6fb48680324a5ac5da9cba0e35de6b5	6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8	2025-07-10T18:20:13-06:00	Gabe Goodhart	model : Granite Four (#13550)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8	0b8855775c6b873931d40b77a5e42558aacbde52	2025-07-10T23:58:12+02:00	rmatif	opencl: add tiled mul_mat_f16_f32 (#14535)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/mul_mat_f16_f32.cl

commit	0b8855775c6b873931d40b77a5e42558aacbde52	4bb625b713fd9b294b4f7af87eaa752b710c7cc1	2025-07-10T11:48:52-07:00	lhez	opencl: add `set_rows` for `f16` and `f32` (#14547)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/set_rows.cl

commit	4bb625b713fd9b294b4f7af87eaa752b710c7cc1	11ee0fea2a24da1d3206eeba8fc52b759d9dfb24	2025-07-10T13:41:00-04:00	Ryan Mangeno	Smoldocling support (#14597)
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	11ee0fea2a24da1d3206eeba8fc52b759d9dfb24	a457551332853ef19d0796fec12b62c538126ea5	2025-07-10T23:29:01+08:00	Aman Gupta	Docs: script to auto-generate ggml operations docs (#14598)
A	.github/workflows/update-ops-docs.yml
A	docs/ops.md
A	docs/ops/BLAS.csv
A	docs/ops/CPU.csv
A	docs/ops/CUDA.csv
A	docs/ops/Metal.csv
A	scripts/create_ops_docs.py
M	tests/test-backend-ops.cpp

commit	a457551332853ef19d0796fec12b62c538126ea5	704bb7a71c01dc07c1478b85f6322bf5dfde1eaf	2025-07-10T20:29:05+08:00	Eric Zhang	cmake : do not search for curl libraries by ourselves (#14613)
M	common/CMakeLists.txt
M	tools/run/CMakeLists.txt

commit	704bb7a71c01dc07c1478b85f6322bf5dfde1eaf	435a6d10d618a015060e45a38c7e9f27f4243316	2025-07-10T13:59:38+05:30	Akarshan Biswas	SYCL: Initial set_rows kernel implementation (#14562)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/set_rows.cpp
A	ggml/src/ggml-sycl/set_rows.hpp

commit	435a6d10d618a015060e45a38c7e9f27f4243316	f9a867f5921a85f3fa64d7b067f4c8ffc5f62eb4	2025-07-10T09:00:20+02:00	Xuan-Son Nguyen	llama : minor coding style fix for smollm3 (#14605)
M	src/llama-arch.cpp

commit	f9a867f5921a85f3fa64d7b067f4c8ffc5f62eb4	ac44eb6c808bd5d677261ce86edd8c43ec54cf2c	2025-07-10T13:19:37+08:00	Eric Zhang	cmake : bump llguidance version to v1.0.1 (#14609)
M	common/CMakeLists.txt

commit	ac44eb6c808bd5d677261ce86edd8c43ec54cf2c	a57d1bcb3c0165ac87b1f0dbb429839b0da69689	2025-07-10T13:19:13+08:00	Eric Zhang	cmake : llguidance build parser library only (#14608)
M	common/CMakeLists.txt

commit	a57d1bcb3c0165ac87b1f0dbb429839b0da69689	cb9178f885d1986cc0b12feb26ff426bc8a3556c	2025-07-09T23:54:38-04:00	compilade	cuda : support Falcon-H1 state size for SSM_SCAN (#14602)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/ssm-scan.cu
M	tests/test-backend-ops.cpp

commit	cb9178f885d1986cc0b12feb26ff426bc8a3556c	4a5686da22057867c23bd4a6be941ddc8c51e585	2025-07-09T23:09:28+02:00	Xuan-Son Nguyen	llama : remove llm_graph_input_one (#14603)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	4a5686da22057867c23bd4a6be941ddc8c51e585	98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a	2025-07-09T14:59:57-04:00	compilade	llama : support Jamba hybrid Transformer-Mamba models (#7531)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-memory-recurrent.cpp
M	src/llama-model.cpp
M	src/llama-model.h

commit	98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a	26a48ad699d50b6268900062661bd22f3e792579	2025-07-09T18:16:12+02:00	Xuan-Son Nguyen	ggml : add ggml_scale_bias (#14417)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-cuda/scale.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/scale.cl
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/scale.comp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	26a48ad699d50b6268900062661bd22f3e792579	ffd59e7d18a76459d5c31ba97073c7c9d73cb752	2025-07-09T20:33:53+08:00	Miaoqian Lin	ggml : prevent integer overflow in gguf tensor size calculation (#14595)
M	ggml/src/gguf.cpp

commit	ffd59e7d18a76459d5c31ba97073c7c9d73cb752	105554595f9a7bf3e02232ed7798201d47c2a4a2	2025-07-09T17:22:31+09:00	Dowon	model : add skt/A.X-4.0 model vocabulary (#14589)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama-vocab.cpp

commit	105554595f9a7bf3e02232ed7798201d47c2a4a2	04655063c47af6cbced295c8c7ad369402b15300	2025-07-09T10:19:50+02:00	Sigbjørn Skjæret	llama : remove unintended whitespace (#14592)
M	src/llama-model.cpp

commit	04655063c47af6cbced295c8c7ad369402b15300	20b7bf8a32259ad9189a4797fd3e3a859c537b99	2025-07-09T12:03:49+04:00	ibrahim khadraoui	model : add support for Falcon-H1 family (#14534)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	20b7bf8a32259ad9189a4797fd3e3a859c537b99	6efcd65945a98cf6883cdd9de4c8ccd8c79d219a	2025-07-09T08:26:13+02:00	Xuan-Son Nguyen	convert : fix smollm3 jinja template (#14586)
M	convert_hf_to_gguf.py

commit	6efcd65945a98cf6883cdd9de4c8ccd8c79d219a	699f4392a33f57c3352cf8d60bdc53db7ca235e7	2025-07-08T13:11:42-05:00	Jeff Bolz	vulkan: optimize flash attention split_k_reduce (#14554)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp

commit	699f4392a33f57c3352cf8d60bdc53db7ca235e7	08382869a2d6dca5d84710f2f82cc17a9696585a	2025-07-09T00:29:29+08:00	stevenkuang	model : fix hunyuan moe chat template (#14584)
M	src/llama-chat.cpp

commit	08382869a2d6dca5d84710f2f82cc17a9696585a	bb4f7a9e4eec171fecf0f640b1337a1c24485560	2025-07-08T18:07:01+02:00	Xuan-Son Nguyen	model : add SmolLM3 (#14581)
M	convert_hf_to_gguf.py
M	docs/development/HOWTO-add-model.md
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	bb4f7a9e4eec171fecf0f640b1337a1c24485560	b8eeb8741d4483daf576498cf90537b4de71633c	2025-07-08T11:37:47-04:00	compilade	memory : fix broken batch splits for recurrent cache (#14575)
M	src/llama-memory-recurrent.cpp

commit	b8eeb8741d4483daf576498cf90537b4de71633c	17a1f0d2d407040ee242e18dd79be8bb212cfcef	2025-07-08T08:21:21-05:00	Jeff Bolz	vulkan : fix rope with partial rotation and non-cont src (#14582)
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_multi.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_neox.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_norm.comp

commit	17a1f0d2d407040ee242e18dd79be8bb212cfcef	8f22dc0a53338c629c1ef8fa878d8e39bfe627c9	2025-07-08T11:47:33+03:00	Alawode Oluwandabira	server: Add ability to mount server at prefix (#14544)
M	common/arg.cpp
M	common/common.h
M	tools/server/server.cpp

commit	8f22dc0a53338c629c1ef8fa878d8e39bfe627c9	53903ae6fa5f1caf187889c839cdd1ad25da4018	2025-07-08T10:24:06+02:00	Xuan-Son Nguyen	model : add hunyuan moe (#14425)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	53903ae6fa5f1caf187889c839cdd1ad25da4018	4d0dcd4a06080e796e6742a88f2ffa7fc41b28b8	2025-07-08T02:38:31-05:00	Jeff Bolz	vulkan: increase timeout for CI (#14574)
M	.github/workflows/build.yml

commit	4d0dcd4a06080e796e6742a88f2ffa7fc41b28b8	75c91de6e955d5b8f3f28173f5040593e1964eb3	2025-07-08T10:15:21+03:00	Georgi Gerganov	cuda : fix rope with partial rotation and non-cont src (#14580)
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-sycl/rope.cpp
M	tests/test-backend-ops.cpp

commit	75c91de6e955d5b8f3f28173f5040593e1964eb3	68155c66f0e76680f34442247e589a090add22d3	2025-07-08T10:11:18+08:00	Aman Gupta	CUDA: add bilinear interpolation for upscale (#14563)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/upscale.cu

commit	68155c66f0e76680f34442247e589a090add22d3	e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e	2025-07-08T07:58:30+08:00	R0CKSTAR	musa: fix build warnings (unused variable) (#14561)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e	12f55c302b35cfe900b84c5fe67c262026af9c44	2025-07-07T23:35:35+02:00	Sigbjørn Skjæret	llama : fix incorrect minicpm3 v_states shape (#14571)
M	src/llama-model.cpp

commit	12f55c302b35cfe900b84c5fe67c262026af9c44	b9c3eefde1b67104bd993485ff38dd62abe9d70c	2025-07-07T21:35:08+02:00	Sigbjørn Skjæret	llama : remove ggml_cont where possible (#14568)
M	src/llama-model.cpp

commit	b9c3eefde1b67104bd993485ff38dd62abe9d70c	6491d6e4f1caf0ad2221865b4249ae6938a6308c	2025-07-07T21:45:43+08:00	Aman Gupta	CUDA: add bf16 and i32 to getrows (#14529)
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	6491d6e4f1caf0ad2221865b4249ae6938a6308c	e592be15756ae546ba87bb5a5250b71248121971	2025-07-06T10:29:36Z	Eve	vulkan: increase LOAD_VEC_A to 8 (IQ1/IQ2) or 4 (IQ3) (#14485)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	e592be15756ae546ba87bb5a5250b71248121971	a0374a67e2924f2e845cdc59dd67d9a44065a89c	2025-07-06T03:08:16-05:00	Jeff Bolz	vulkan: fix rms_norm+mul fusion (#14545)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	tests/test-backend-ops.cpp

commit	a0374a67e2924f2e845cdc59dd67d9a44065a89c	ddef99522d1ba74193b7394e803fab8db5c78bae	2025-07-05T02:26:04-05:00	Jeff Bolz	vulkan: Handle updated FA dim2/3 definition (#14518)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	ddef99522d1ba74193b7394e803fab8db5c78bae	668168814601d2aef6161ce49ab186bc74177ae7	2025-07-05T09:17:14+02:00	Sigbjørn Skjæret	server : fix assistant prefilling when content is an array (#14360)
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/utils.hpp

commit	668168814601d2aef6161ce49ab186bc74177ae7	bac8bed248d15419137c5bc7f834582397baaebc	2025-07-05T08:24:56+02:00	Sigbjørn Skjæret	opencl: add GELU_ERF (#14476)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/gelu.cl

commit	bac8bed248d15419137c5bc7f834582397baaebc	b81510a7b78f7c5a6f069c4f3d0e569b9d287913	2025-07-05T07:18:09+03:00	Georgi Gerganov	eval-callback : check for empty input (#14539)
M	examples/eval-callback/eval-callback.cpp

commit	b81510a7b78f7c5a6f069c4f3d0e569b9d287913	ef797db357e44ecb7437fa9d22f4e1614104b342	2025-07-05T12:10:53+08:00	R0CKSTAR	test-backend-ops: add support for specifying output format (#14368)
M	tests/test-backend-ops.cpp

commit	ef797db357e44ecb7437fa9d22f4e1614104b342	67d1ef23c68e1e09dc6d7423d1ef5fc0ea56ed5e	2025-07-04T19:19:09+03:00	Georgi Gerganov	metal : disable fast math in all quantize kernels (#14528)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	67d1ef23c68e1e09dc6d7423d1ef5fc0ea56ed5e	7b50f7c0257695d0f6918bffce4e68d5c13b0c9e	2025-07-04T09:08:59+03:00	Georgi Gerganov	batch : add optional for sequential equal split (#14511)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-recurrent.cpp

commit	7b50f7c0257695d0f6918bffce4e68d5c13b0c9e	c79184d2d192489e3c918bab8ed717d22f8c02bd	2025-07-04T09:05:36+03:00	Georgi Gerganov	graph : prepare for 4D mask (#14515)
M	src/llama-graph.cpp
M	src/llama-graph.h

commit	c79184d2d192489e3c918bab8ed717d22f8c02bd	499a8f5a787f5fdc7f3fdfb9d1ff01b6cb5e994e	2025-07-04T09:04:59+03:00	Georgi Gerganov	batch : add n_used count (#14512)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified.cpp
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-recurrent.cpp

commit	499a8f5a787f5fdc7f3fdfb9d1ff01b6cb5e994e	28657a8229b5adc6028cf1c4ed62191792d2fdb0	2025-07-04T11:50:07+08:00	luyhcsu	CANN: Replace aclrtMemsetSync with aclnnInplaceZero operator (#14002)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	28657a8229b5adc6028cf1c4ed62191792d2fdb0	bee28421be25fd447f61cb6db64d556cbfce32ec	2025-07-03T23:07:22+02:00	Sigbjørn Skjæret	ggml : implement GEGLU_ERF and GEGLU_QUICK ops (#14445)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/glu.cl
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/geglu_erf.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/geglu_quick.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	tools/mtmd/clip.cpp

commit	bee28421be25fd447f61cb6db64d556cbfce32ec	2b72bedec198a90bb5b0cceaf1d0aff9e34ffbc2	2025-07-03T11:22:24-07:00	lhez	opencl : broadcast for soft_max (#14510)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/softmax_4_f16.cl
M	ggml/src/ggml-opencl/kernels/softmax_4_f32.cl
M	ggml/src/ggml-opencl/kernels/softmax_f16.cl
M	ggml/src/ggml-opencl/kernels/softmax_f32.cl

commit	2b72bedec198a90bb5b0cceaf1d0aff9e34ffbc2	c8c4495b8d3a8799e2d46778f993965b0ac1ae43	2025-07-03T13:21:14-05:00	Jeff Bolz	vulkan: support mixed/deepseekR1 FA head sizes (#14509)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	c8c4495b8d3a8799e2d46778f993965b0ac1ae43	7b63a71a6b0f54effe9b94073d4d0519dcf53676	2025-07-03T17:05:18+02:00	Johannes Gäßler	ggml: backward pass for split swiglu (#14483)
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	7b63a71a6b0f54effe9b94073d4d0519dcf53676	0c2ee38ab729f3f6a7c28dc4c5dcd8d5f0cbf8fc	2025-07-03T11:00:03+02:00	Nicolò Scipione	Fix conditional enabling following arch checks for ggml-sycl (#14504)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	0c2ee38ab729f3f6a7c28dc4c5dcd8d5f0cbf8fc	a70c8a0c4b4c1606cd9a0ba889ce61aa88610095	2025-07-03T10:03:06+02:00	Xuan-Son Nguyen	convert : correct gemma 3n conversion (#14450)
M	gguf-py/gguf/gguf_writer.py

commit	a70c8a0c4b4c1606cd9a0ba889ce61aa88610095	9067487c4411efb20400103fcccfdd389c80d428	2025-07-03T10:53:35+03:00	Georgi Gerganov	kv-cache : use ggml_set_rows (#14285)
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-kv-cells.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h

commit	9067487c4411efb20400103fcccfdd389c80d428	d4cdd9c1c3cebdafca735958597de4ff7b7c0f54	2025-07-03T10:46:57+03:00	Georgi Gerganov	ggml : fix FA mask dim 2 and 3 (#14505)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	d4cdd9c1c3cebdafca735958597de4ff7b7c0f54	55c2646b452419be7552157b9b11373ccc1bf2f2	2025-07-03T07:48:32+03:00	Georgi Gerganov	ggml : remove kompute backend (#14501)
M	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
M	.github/ISSUE_TEMPLATE/011-bug-results.yml
M	.github/labeler.yml
M	.github/workflows/build.yml
M	.gitmodules
M	CMakeLists.txt
M	ggml/CMakeLists.txt
D	ggml/include/ggml-kompute.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
D	ggml/src/ggml-kompute/CMakeLists.txt
D	ggml/src/ggml-kompute/ggml-kompute.cpp
D	ggml/src/ggml-kompute/kompute
D	ggml/src/ggml-kompute/kompute-shaders/common.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_add.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_addrow.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f16_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f16_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f32_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f32_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_diagmask.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_gelu.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q4_0.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q4_1.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q6_k.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_mat_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_0.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_1.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_k.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q6_k.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q8_0.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n_pre.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_norm.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_relu.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rmsnorm.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_neox_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_neox_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_norm_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_norm_f32.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_scale.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_scale_8.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_silu.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_softmax.comp
D	ggml/src/ggml-kompute/kompute-shaders/rope_common.comp
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh
M	tests/test-c.c

commit	55c2646b452419be7552157b9b11373ccc1bf2f2	e75ba4c0434eb759eb7ff74e034ebe729053e575	2025-07-03T07:45:11+08:00	Aman Gupta	CUDA: add dynamic shared mem to softmax, refactor general usage (#14497)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cross-entropy-loss.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/softmax.cu
M	tests/test-backend-ops.cpp

commit	e75ba4c0434eb759eb7ff74e034ebe729053e575	5d46babdc2d4675d96ebcf23cac098a02f0d30cc	2025-07-02T21:02:35+02:00	Sigbjørn Skjæret	gguf-py : add support for chat template jinja files (#14508)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/vocab.py

commit	5d46babdc2d4675d96ebcf23cac098a02f0d30cc	e17991c466ac835b2c71bd813c1ca7ff8dd97b94	2025-07-02T13:10:24-04:00	compilade	llama : initial Mamba-2 support (#9126)
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/ssm-scan.cu
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tests/test-backend-ops.cpp

commit	e17991c466ac835b2c71bd813c1ca7ff8dd97b94	c46944aa25b5560e6195f8cbcbc8947e9a6395c3	2025-07-02T19:35:47+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	c46944aa25b5560e6195f8cbcbc8947e9a6395c3	f3ed38d793fab9f97987dc52d7a41622f2056701	2025-07-02T13:55:32+02:00	Daniel Bevenius	ggml : add version function to get lib version (ggml/1286)
M	ggml/CMakeLists.txt
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	f3ed38d793fab9f97987dc52d7a41622f2056701	55a1c5a5fdefef808e95aabd3d5563af1068cc80	2025-07-02T19:37:16+03:00	Rotem Dan	Set RPATH to "@loader_path" / "$ORIGIN" to ensure executables and dynamic libraries search for dependencies in their origin directory. (#14309)
M	.github/workflows/release.yml

commit	55a1c5a5fdefef808e95aabd3d5563af1068cc80	12a81af45f0dbbab24bd819a15f57c03ceb1be90	2025-07-02T20:34:24+08:00	Aman Gupta	CUDA: add softmax broadcast (#14475)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/softmax.cu

commit	12a81af45f0dbbab24bd819a15f57c03ceb1be90	8875523eb311cac832bfda0c581e852292185ae9	2025-07-02T13:42:12+02:00	Johannes Gäßler	CUDA: broadcasting for FlashAttention mask (#14500)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu

commit	8875523eb311cac832bfda0c581e852292185ae9	ec68e84c32325a3417fbcd2e60d4bda6adb4e4bc	2025-07-01T03:32:56-05:00	Jeff Bolz	vulkan: support softmax/FA batch and broadcast (#14449)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp

commit	ec68e84c32325a3417fbcd2e60d4bda6adb4e4bc	307e79d33d4cdd9f1d6c42fc861724e6ba12b98f	2025-06-27T21:50:57+03:00	Georgi Gerganov	ggml : support bcast ggml_soft_max_ext, ggml_flash_attn_ext (#14435)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	307e79d33d4cdd9f1d6c42fc861724e6ba12b98f	d7f5f4e578d1f60b0835d1734a50438c309b3e5c	2025-07-02T20:38:10+08:00	zhouwg	opencl : fix possible buffer overflow in dump_tensor (#14490)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	d7f5f4e578d1f60b0835d1734a50438c309b3e5c	c8a4e470f65c3a932e18eddc5fba1844876d7463	2025-07-02T14:12:07+03:00	Georgi Gerganov	simple-chat : fix context-exceeded condition (#14494)
M	examples/simple-chat/simple-chat.cpp

commit	c8a4e470f65c3a932e18eddc5fba1844876d7463	603e43dc913f90d9c3291624728b731687eddc35	2025-07-02T19:00:04+08:00	Eric Zhang	opencl : skip empty nodes on cgraph compute (#14491)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	603e43dc913f90d9c3291624728b731687eddc35	611ba4b264c8fbb9d2d978bd6a5c17aeab1700fb	2025-07-02T00:07:42-07:00	lhez	opencl : update upscale to support align corners (#14488)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/upscale.cl

commit	611ba4b264c8fbb9d2d978bd6a5c17aeab1700fb	85841e121db5b96ae4d277a3cd3995eef66b98ec	2025-07-02T09:02:51+02:00	Sigbjørn Skjæret	ci : add OpenCL to labeler workflow (#14496)
M	.github/labeler.yml

commit	85841e121db5b96ae4d277a3cd3995eef66b98ec	68b3cd65141586ef13a698baa9029627f038f102	2025-07-02T13:41:35+08:00	Eric Zhang	github : add OpenCL backend to issue templates (#14492)
M	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
M	.github/ISSUE_TEMPLATE/011-bug-results.yml

commit	68b3cd65141586ef13a698baa9029627f038f102	de569441470332ff922c23fb0413cc957be75b25	2025-07-02T07:19:31+02:00	Björn Ganster	ggml : Callback before abort (#14481)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	de569441470332ff922c23fb0413cc957be75b25	1b2aaf28acd632b79bc3b07acb5dad877dc7dbb1	2025-07-01T18:04:08+03:00	Georgi Gerganov	ci : disable fast-math for Metal GHA CI (#14478)
M	.github/workflows/build.yml
M	ggml/src/ggml-metal/CMakeLists.txt

commit	1b2aaf28acd632b79bc3b07acb5dad877dc7dbb1	343b6e94b61674ac94e64ede7b7ea3365793f7ed	2025-07-01T15:44:11+02:00	Grzegorz Grasza	Add Vulkan images to docker.md (#14472)
M	docs/docker.md

commit	343b6e94b61674ac94e64ede7b7ea3365793f7ed	6a746cf9c40f8d93d13eb8a6c2b989a15e7fa61a	2025-07-01T16:47:30+08:00	Chenguang Li	CANN: update aclnnGroupedMatmulV2 to aclnnGroupedMatmulV3 (#14411)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	6a746cf9c40f8d93d13eb8a6c2b989a15e7fa61a	eff5e45443a248f89cc61e64786f38b68b4da489	2025-07-01T03:43:08-05:00	Jeff Bolz	vulkan: Split large mul_mat_id to fit in shared memory (#14451)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	tests/test-backend-ops.cpp

commit	eff5e45443a248f89cc61e64786f38b68b4da489	a6a47958a1d9edc628cedc2f9320c84b59fe1f4f	2025-07-01T10:14:21+02:00	Sigbjørn Skjæret	add GELU_ERF (#14455)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/gelu_erf.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	a6a47958a1d9edc628cedc2f9320c84b59fe1f4f	f61c05d4b1f8ad498a5cf7f0f57a40383aad563c	2025-07-01T11:05:48+03:00	Georgi Gerganov	ggml : remove trailing whitespace (#0)
M	ggml/src/ggml.c

commit	f61c05d4b1f8ad498a5cf7f0f57a40383aad563c	431b2c24f31bf5411786c378b409d0202df8d53c	2025-07-01T10:27:52+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	431b2c24f31bf5411786c378b409d0202df8d53c	497be7c01dab243100f9c42e0a763a746e42d038	2025-07-01T09:11:00+02:00	Acly	ggml-cpu : "align corners" for bilinear upscale/downscale (ggml/1285)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	497be7c01dab243100f9c42e0a763a746e42d038	79b33b231774d5c39c8df018e9a276becae6d41a	2025-06-24T06:10:16+02:00	Daniel Bevenius	ggml-quants : rename best_mad to best_error (ggml/1283)
M	ggml/src/ggml-quants.c

commit	79b33b231774d5c39c8df018e9a276becae6d41a	0a5a3b5cdfd887cf0f8e09d9ff89dee130cfcdde	2025-07-01T00:19:16-07:00	lhez	opencl : add GEGLU, REGLU, SWIGLU (#14456)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/glu.cl

commit	0a5a3b5cdfd887cf0f8e09d9ff89dee130cfcdde	745f11fed09ba2303f3f494efb12286d382608e5	2025-06-30T23:57:04+08:00	Aman Gupta	Add Conv2d for CPU (#14388)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml.c

commit	745f11fed09ba2303f3f494efb12286d382608e5	5dd942de5922a22ec8446a4ad2203738dbcb9389	2025-06-30T18:03:03+03:00	Georgi Gerganov	memory : correctly handle failure in apply() (#14438)
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified.cpp
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-recurrent.cpp
M	src/llama-memory.cpp
M	src/llama-memory.h

commit	5dd942de5922a22ec8446a4ad2203738dbcb9389	a7417f55945eb7c7a5ea6807e66564b8066a4e50	2025-06-30T17:04:05+03:00	Georgi Gerganov	metal : disable fast-math for some cpy kernels (#14460)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	a7417f55945eb7c7a5ea6807e66564b8066a4e50	eb3fa2913e0ace38912011fcb331624c679656f5	2025-06-30T14:52:02+02:00	Romain Biessy	ggml-cpu: sycl: Re-enable exp f16 (#14462)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	eb3fa2913e0ace38912011fcb331624c679656f5	c839a2da1a0d4275c3a98f70c3a7627487573a46	2025-06-30T03:43:15-07:00	Diego Devesa	test-backend-ops : disable llama test (#14461)
M	tests/test-backend-ops.cpp

commit	c839a2da1a0d4275c3a98f70c3a7627487573a46	e9b6350e61d592634263a14b3d77ecbf6c1fb096	2025-06-30T17:48:24+08:00	xiaobing318	cmake : Remove redundant include path in CMakeLists.txt (#14452)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	e9b6350e61d592634263a14b3d77ecbf6c1fb096	caf5681fcb47dfe9bafee94ef9aa8f669ac986c7	2025-06-30T10:17:18+02:00	Vedran Miletić	scripts : make the shell scripts cross-platform (#14341)
M	.devops/tools.sh
M	build-xcframework.sh
M	ci/run.sh
M	examples/Miku.sh
M	examples/chat-13B.sh
M	examples/chat-persistent.sh
M	examples/chat-vicuna.sh
M	examples/chat.sh
M	examples/jeopardy/jeopardy.sh
M	examples/reason-act.sh
M	examples/server-llama2-13B.sh
M	examples/sycl/build.sh
M	examples/sycl/run-llama2.sh
M	examples/sycl/run-llama3.sh
M	examples/ts-type-to-grammar.sh
M	scripts/apple/validate-apps.sh
M	scripts/apple/validate-ios.sh
M	scripts/apple/validate-macos.sh
M	scripts/apple/validate-tvos.sh
M	scripts/apple/validate-visionos.sh
M	scripts/check-requirements.sh
M	scripts/ci-run.sh
M	scripts/compare-commits.sh
M	scripts/debug-test.sh
M	scripts/gen-authors.sh
M	scripts/get-hellaswag.sh
M	scripts/get-pg.sh
M	scripts/get-wikitext-103.sh
M	scripts/get-wikitext-2.sh
M	scripts/get-winogrande.sh
M	scripts/hf.sh
M	scripts/qnt-all.sh
M	scripts/run-all-perf.sh
M	scripts/run-all-ppl.sh
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh
M	scripts/tool_bench.sh
M	tests/test-lora-conversion-inference.sh
M	tests/test-tokenizer-0.sh
M	tests/test-tokenizers-repo.sh
M	tools/gguf-split/tests.sh
M	tools/mtmd/tests.sh
M	tools/quantize/tests.sh
M	tools/server/chat-llama2.sh
M	tools/server/chat.sh
M	tools/server/tests/tests.sh

commit	caf5681fcb47dfe9bafee94ef9aa8f669ac986c7	83790b0e7e09ab17238b16452a33053a71dbdfad	2025-06-29T20:02:53+02:00	matteo	server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.h
M	common/common.h
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	83790b0e7e09ab17238b16452a33053a71dbdfad	f47c1d7106e49062279bcc57fc1077c0db61e278	2025-06-29T19:29:57+02:00	Renat	server : fix appearance of the chats list context menu for Safari (#14322)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/Sidebar.tsx

commit	f47c1d7106e49062279bcc57fc1077c0db61e278	a5d1fb6212298db1be1639db4c03adb2c522ee13	2025-06-29T21:07:58+05:30	Akarshan Biswas	SYCL: disable faulty fp16 exp kernel (#14395)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a5d1fb6212298db1be1639db4c03adb2c522ee13	a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0	2025-06-29T14:38:10+02:00	Sigbjørn Skjæret	ggml : fix unmerged GGML_FPxx_TO_FPxx refactoring (#14443)
M	ggml/src/ggml-cpu/vec.h

commit	a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0	bd9c981d7226107f18deb8344c3301450311bb8b	2025-06-29T11:04:10+02:00	Sigbjørn Skjæret	ggml : implement REGLU/GEGLU/SWIGLU ops (#14158)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/geglu.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/glu_head.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/glu_main.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/reglu.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/swiglu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	src/llama-graph.cpp
M	src/llama-graph.h
M	tests/test-backend-ops.cpp

commit	bd9c981d7226107f18deb8344c3301450311bb8b	27208bf657cfe7262791df473927225e48efe482	2025-06-29T02:43:36-05:00	Jeff Bolz	vulkan: Add fusion support for RMS_NORM+MUL (#14366)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	27208bf657cfe7262791df473927225e48efe482	63a7bb3c7e1c6b0a92d03b0a594d3cd501d6ed3e	2025-06-29T01:30:53+08:00	Aman Gupta	CUDA: add bf16 and f32 support to cublas_mul_mat_batched (#14361)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	63a7bb3c7e1c6b0a92d03b0a594d3cd501d6ed3e	00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07	2025-06-28T10:36:40-05:00	Jeff Bolz	vulkan: handle noncontig in the final case of ggml_vk_get_cpy_pipeline (#14378)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07	566c16fcce44876a167c37f159085afe6f84b28c	2025-06-28T10:17:09-05:00	Jeff Bolz	vulkan: lock accesses of pinned_memory vector (#14333)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	566c16fcce44876a167c37f159085afe6f84b28c	b25e92774e2fa4ee3820e458d5cf43f40190f8d2	2025-06-28T22:08:21+08:00	Weizhao Ouyang	model : add support for ERNIE 4.5 0.3B model (#14408)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	b25e92774e2fa4ee3820e458d5cf43f40190f8d2	6609507a910aa7437aaa53fd999447de3947d998	2025-06-28T17:35:41+08:00	Xinpeng Dou	fix async_mode bug (#14432)
M	ggml/src/ggml-cann/common.h

commit	6609507a910aa7437aaa53fd999447de3947d998	ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e27481	2025-06-28T09:57:07+02:00	Sigbjørn Skjæret	ci : fix windows build and release (#14431)
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e27481	72babea5dea56c8a8e8420ccf731b12a5cf37854	2025-06-27T22:35:30-05:00	Jeff Bolz	vulkan: Fix GGML_VULKAN_SHADER_DEBUG_INFO (#14427)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	72babea5dea56c8a8e8420ccf731b12a5cf37854	43678060c1f4cfab2f899466fd615e358677f807	2025-06-27T21:42:02+03:00	Georgi Gerganov	graph : make llm_graph_context destructor virtual (#14410)
M	src/llama-graph.h

commit	43678060c1f4cfab2f899466fd615e358677f807	8d94219a4a7f2da72ee542019ca01f36af93d1d6	2025-06-27T17:55:45+03:00	Georgi Gerganov	recurrent : call balloc split_reset() in init_batch() (#14414)
M	src/llama-memory-recurrent.cpp

commit	8d94219a4a7f2da72ee542019ca01f36af93d1d6	f667f1e6244e1f420512fa66692b7096ff17f366	2025-06-27T16:41:40+03:00	Radoslav Gerganov	ggml : add ggml_set_rows (#14274)
M	examples/eval-callback/eval-callback.cpp
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	f667f1e6244e1f420512fa66692b7096ff17f366	8846aace4934ad29651ea61b8c7e3f6b0556e3d2	2025-06-27T10:42:19+02:00	Sigbjørn Skjæret	convert : fix broken sentencepiece vocab (#14416)
M	convert_hf_to_gguf.py

commit	8846aace4934ad29651ea61b8c7e3f6b0556e3d2	a01047b041aa04aeea351933658433ed004516ab	2025-06-26T19:34:02+02:00	Xuan-Son Nguyen	model : gemma3n text-only (#14400)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp

commit	a01047b041aa04aeea351933658433ed004516ab	b25346221dadb9101aa9dda55431dde4d3596943	2025-06-26T13:46:53-03:00	bandoti	cmake: regen vulkan shaders when shaders-gen sources change (#14398)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	b25346221dadb9101aa9dda55431dde4d3596943	e8215dbb96b8fb94a24c29cdd228166fb972dbfc	2025-06-26T15:01:14+02:00	Sigbjørn Skjæret	llama : return mistral-v7-tekken as default template only (#14390)
M	src/llama-model.cpp

commit	e8215dbb96b8fb94a24c29cdd228166fb972dbfc	5783ae43599400b723b5da0569c1f848419ff3c7	2025-06-26T15:51:19+03:00	Georgi Gerganov	metal : add special-case mat-vec mul for ne00 == 4 (#14385)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	5783ae43599400b723b5da0569c1f848419ff3c7	bf5bcd0b857db420235e03639f0a5f218a7f8cf8	2025-06-26T15:50:15+03:00	Georgi Gerganov	metal : batch rows copy in a single threadgroup (#14384)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	bf5bcd0b857db420235e03639f0a5f218a7f8cf8	716301d1b03c31875ec3b24526c48c8b1bd0fd8c	2025-06-26T18:41:41+08:00	Aaron Teo	docs: update s390x documentation + add faq (#14389)
M	docs/build-s390x.md

commit	ba67d6c03fed3193987a4ef13050e6e2a4451df4	8f52c6f8abb2ed9ad967cc0bfb90acb073011193	2025-06-26T17:42:32+08:00	Yunzhe Jia	llama-calrt: 	infer-op: copy data from output buffer to dst-tensor.data
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/ggml-calrt.cpp
M	gguf-py/examples/cal_test.gguf
M	gguf-py/examples/writer_cal_test.py
M	src/llama-arch.cpp
M	src/llama-model.cpp

commit	8f52c6f8abb2ed9ad967cc0bfb90acb073011193	d2f325130c4ed77a3dcff2c23a926587fb08e2cc	2025-06-26T15:10:45+08:00	Yunzhe Jia	Squashed commit of the following:
M	.devops/intel.Dockerfile
M	.editorconfig
M	.github/labeler.yml
A	.github/workflows/build-cmake-pkg.yml
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml
M	.github/workflows/release.yml
M	.github/workflows/server.yml
M	CMakeLists.txt
M	Makefile
M	README.md
M	ci/run.sh
M	common/CMakeLists.txt
M	common/arg.cpp
M	common/build-info.cpp.in
M	common/chat-parser.cpp
M	common/chat-parser.h
M	common/chat.cpp
M	common/chat.h
D	common/cmake/build-info-gen-cpp.cmake
M	common/common.cpp
M	common/common.h
M	common/json-partial.cpp
M	common/json-partial.h
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
M	common/speculative.cpp
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	docs/backend/CANN.md
M	docs/backend/SYCL.md
A	docs/build-s390x.md
M	docs/build.md
M	docs/function-calling.md
M	docs/install.md
M	docs/multimodal.md
M	examples/batched.swift/Sources/main.swift
M	examples/embedding/embedding.cpp
M	examples/gritlm/gritlm.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/parallel/README.md
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/simple-chat/simple-chat.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	ggml/CMakeLists.txt
M	ggml/cmake/common.cmake
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas/CMakeLists.txt
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/amx.cpp
M	ggml/src/ggml-cpu/amx/mmq.cpp
A	ggml/src/ggml-cpu/arch-fallback.h
A	ggml/src/ggml-cpu/arch/arm/cpu-feats.cpp
A	ggml/src/ggml-cpu/arch/arm/quants.c
A	ggml/src/ggml-cpu/arch/arm/repack.cpp
A	ggml/src/ggml-cpu/arch/loongarch/quants.c
A	ggml/src/ggml-cpu/arch/powerpc/cpu-feats.cpp
A	ggml/src/ggml-cpu/arch/powerpc/quants.c
A	ggml/src/ggml-cpu/arch/riscv/quants.c
A	ggml/src/ggml-cpu/arch/riscv/repack.cpp
A	ggml/src/ggml-cpu/arch/s390/quants.c
A	ggml/src/ggml-cpu/arch/wasm/quants.c
R100	ggml/src/ggml-cpu/cpu-feats-x86.cpp	ggml/src/ggml-cpu/arch/x86/cpu-feats.cpp
A	ggml/src/ggml-cpu/arch/x86/quants.c
R067	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	ggml/src/ggml-cpu/common.h
D	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
D	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
R098	ggml/src/ggml-cpu/ggml-cpu-hbm.cpp	ggml/src/ggml-cpu/hbm.cpp
R100	ggml/src/ggml-cpu/ggml-cpu-hbm.h	ggml/src/ggml-cpu/hbm.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.h
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
A	ggml/src/ggml-cpu/quants.c
R056	ggml/src/ggml-cpu/ggml-cpu-quants.h	ggml/src/ggml-cpu/quants.h
A	ggml/src/ggml-cpu/repack.cpp
A	ggml/src/ggml-cpu/repack.h
M	ggml/src/ggml-cpu/simd-mappings.h
R097	ggml/src/ggml-cpu/ggml-cpu-traits.cpp	ggml/src/ggml-cpu/traits.cpp
R100	ggml/src/ggml-cpu/ggml-cpu-traits.h	ggml/src/ggml-cpu/traits.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-cuda/common.cuh
A	ggml/src/ggml-cuda/conv2d-dw.cu
A	ggml/src/ggml-cuda/conv2d-dw.cuh
A	ggml/src/ggml-cuda/conv2d-transpose.cu
A	ggml/src/ggml-cuda/conv2d-transpose.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/mean.cu
A	ggml/src/ggml-cuda/mean.cuh
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/mmv.cuh
M	ggml/src/ggml-cuda/ssm-scan.cu
M	ggml/src/ggml-cuda/sumrows.cu
M	ggml/src/ggml-cuda/sumrows.cuh
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal/CMakeLists.txt
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/concat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_id_q4_0_f32_8x_flat.cl
A	ggml/src/ggml-opencl/kernels/pad.cl
A	ggml/src/ggml-opencl/kernels/repeat.cl
A	ggml/src/ggml-opencl/kernels/tanh.cl
A	ggml/src/ggml-opencl/kernels/tsembd.cl
A	ggml/src/ggml-opencl/kernels/upscale.cl
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/conv.cpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/dequantize.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/gla.cpp
M	ggml/src/ggml-sycl/im2col.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/quants.hpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/sycl_hw.cpp
M	ggml/src/ggml-sycl/sycl_hw.hpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/vecdotq.hpp
M	ggml/src/ggml-sycl/wkv.cpp
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
A	ggml/src/ggml-vulkan/vulkan-shaders/conv_transpose_1d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
A	ggml/src/ggml.cpp
M	ggml/src/gguf.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	include/llama.h
M	models/ggml-vocab-bert-bge.gguf.inp
M	models/ggml-vocab-bert-bge.gguf.out
D	models/ggml-vocab-chameleon.gguf.inp
D	models/ggml-vocab-chameleon.gguf.out
M	models/ggml-vocab-command-r.gguf.inp
M	models/ggml-vocab-command-r.gguf.out
M	models/ggml-vocab-deepseek-coder.gguf.inp
M	models/ggml-vocab-deepseek-coder.gguf.out
M	models/ggml-vocab-deepseek-llm.gguf.inp
M	models/ggml-vocab-deepseek-llm.gguf.out
D	models/ggml-vocab-deepseek-r1-qwen.gguf.inp
D	models/ggml-vocab-deepseek-r1-qwen.gguf.out
M	models/ggml-vocab-falcon.gguf.inp
M	models/ggml-vocab-falcon.gguf.out
M	models/ggml-vocab-gpt-2.gguf.inp
M	models/ggml-vocab-gpt-2.gguf.out
D	models/ggml-vocab-gpt-4o.gguf.inp
D	models/ggml-vocab-gpt-4o.gguf.out
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	models/ggml-vocab-llama-spm.gguf.inp
M	models/ggml-vocab-llama-spm.gguf.out
D	models/ggml-vocab-llama4.gguf.inp
D	models/ggml-vocab-llama4.gguf.out
M	models/ggml-vocab-mpt.gguf.inp
M	models/ggml-vocab-mpt.gguf.out
D	models/ggml-vocab-nomic-bert-moe.gguf.inp
D	models/ggml-vocab-nomic-bert-moe.gguf.out
M	models/ggml-vocab-phi-3.gguf.inp
M	models/ggml-vocab-phi-3.gguf.out
D	models/ggml-vocab-pixtral.gguf.inp
D	models/ggml-vocab-pixtral.gguf.out
M	models/ggml-vocab-qwen2.gguf.inp
M	models/ggml-vocab-qwen2.gguf.out
M	models/ggml-vocab-refact.gguf.inp
M	models/ggml-vocab-refact.gguf.out
D	models/ggml-vocab-roberta-bpe.gguf.inp
D	models/ggml-vocab-roberta-bpe.gguf.out
M	models/ggml-vocab-starcoder.gguf.inp
M	models/ggml-vocab-starcoder.gguf.out
A	models/templates/Mistral-Small-3.2-24B-Instruct-2506.jinja
M	requirements/requirements-compare-llama-bench.txt
M	scripts/compare-llama-bench.py
M	scripts/sync-ggml.last
A	scripts/sync_vendor.py
M	src/CMakeLists.txt
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-cparams.cpp
M	src/llama-cparams.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
A	src/llama-kv-cache-unified-iswa.cpp
A	src/llama-kv-cache-unified-iswa.h
A	src/llama-kv-cache-unified.cpp
A	src/llama-kv-cache-unified.h
D	src/llama-kv-cache.cpp
D	src/llama-kv-cache.h
M	src/llama-kv-cells.h
A	src/llama-memory-hybrid.cpp
A	src/llama-memory-hybrid.h
A	src/llama-memory-recurrent.cpp
A	src/llama-memory-recurrent.h
M	src/llama-memory.cpp
M	src/llama-memory.h
M	src/llama-mmap.cpp
M	src/llama-model-loader.cpp
M	src/llama-model-saver.cpp
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp
M	src/unicode.cpp
M	tests/CMakeLists.txt
M	tests/test-backend-ops.cpp
M	tests/test-chat.cpp
M	tests/test-gguf.cpp
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp
A	tests/test-thread-safety.cpp
A	tests/test-tokenizers-repo.sh
M	tools/batched-bench/batched-bench.cpp
M	tools/cvector-generator/cvector-generator.cpp
M	tools/imatrix/imatrix.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/main/main.cpp
M	tools/mtmd/CMakeLists.txt
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/perplexity/perplexity.cpp
M	tools/quantize/quantize.cpp
M	tools/run/run.cpp
M	tools/server/CMakeLists.txt
M	tools/server/README.md
M	tools/server/public/index.html.gz
M	tools/server/server.cpp
M	tools/server/tests/unit/test_tool_call.py
M	tools/server/tests/utils.py
M	tools/server/utils.hpp
M	tools/server/webui/src/App.tsx
A	tools/server/webui/src/components/ModalProvider.tsx
M	tools/server/webui/src/components/SettingDialog.tsx
M	tools/server/webui/src/components/Sidebar.tsx
M	tools/server/webui/src/index.scss
M	tools/tts/tts.cpp
R099	tools/server/httplib.h	vendor/cpp-httplib/httplib.h
R100	tools/mtmd/vendor/miniaudio.h	vendor/miniaudio/miniaudio.h
R099	common/minja/chat-template.hpp	vendor/minja/chat-template.hpp
R099	common/minja/minja.hpp	vendor/minja/minja.hpp
R094	common/json.hpp	vendor/nlohmann/json.hpp
A	vendor/nlohmann/json_fwd.hpp
R100	tools/mtmd/vendor/stb_image.h	vendor/stb/stb_image.h

commit	716301d1b03c31875ec3b24526c48c8b1bd0fd8c	60ef23d6c14d325d83eae5752e5de39ad268e9b0	2025-06-26T12:11:59+08:00	R0CKSTAR	musa: enable fp16 mma (all) and cublas on qy2 (#13842)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-musa/mudnn.cuh

commit	60ef23d6c14d325d83eae5752e5de39ad268e9b0	b193d5306912a2adae0fde7481819f6ee0941bc6	2025-06-26T05:49:04+08:00	Aaron Teo	ggml-cpu: enable IBM NNPA Vector Intrinsics (#14317)
M	docs/build-s390x.md
M	docs/build.md
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/mmq.cpp
M	ggml/src/ggml-cpu/arch/arm/quants.c
M	ggml/src/ggml-cpu/arch/arm/repack.cpp
M	ggml/src/ggml-cpu/arch/loongarch/quants.c
M	ggml/src/ggml-cpu/arch/powerpc/quants.c
M	ggml/src/ggml-cpu/arch/riscv/quants.c
M	ggml/src/ggml-cpu/arch/riscv/repack.cpp
M	ggml/src/ggml-cpu/arch/s390/quants.c
M	ggml/src/ggml-cpu/arch/wasm/quants.c
M	ggml/src/ggml-cpu/arch/x86/quants.c
M	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	ggml/src/ggml-cpu/common.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/quants.c
M	ggml/src/ggml-cpu/repack.cpp
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c

commit	b193d5306912a2adae0fde7481819f6ee0941bc6	2bf9d539dd158345e3a3b096e16474af535265b4	2025-06-25T23:26:51+02:00	Sigbjørn Skjæret	ggml : do not output unprintable characters on GGUF load failure (#14381)
M	ggml/src/gguf.cpp

commit	2bf9d539dd158345e3a3b096e16474af535265b4	73e53dc834c0a2336cd104473af6897197b96277	2025-06-25T17:09:55+01:00	Anton Mitkov	sycl: GGML_SYCL_DISABLE_OPT on by default for all Intel Devices (#13973)
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/sycl_hw.cpp
M	ggml/src/ggml-sycl/sycl_hw.hpp

commit	73e53dc834c0a2336cd104473af6897197b96277	62af464227dafa1c55e0535bcb24346326748f46	2025-06-24T11:46:25-07:00	lhez	opencl: ref count `ggml_backend_opencl_context` and refactor profiling (#14254)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	62af464227dafa1c55e0535bcb24346326748f46	c148cf1946275952a79ad50b6199725f12a70411	2025-06-24T18:26:30+03:00	Georgi Gerganov	batch : fix check for empty sequences in memory (#14364)
M	src/llama-batch.cpp

commit	c148cf1946275952a79ad50b6199725f12a70411	1b809cee225222094a0ff5be8467240487ce4ae4	2025-06-24T15:05:31+02:00	Mathieu Baudier	cmake : use LLAMA_BUILD_NUMBER when defining LLAMA_INSTALL_VERSION (#14362)
M	CMakeLists.txt

commit	1b809cee225222094a0ff5be8467240487ce4ae4	abf241045d09cad70dc797b0fba393ad09ee2cbe	2025-06-24T08:59:11Z	Nigel Bosch	server : move no API key doc to /health (#14352)
M	tools/server/README.md

commit	abf241045d09cad70dc797b0fba393ad09ee2cbe	901e20bbe571fbde48d13eb188f4e7cdc7562fb6	2025-06-24T09:31:00+02:00	Sigbjørn Skjæret	main : honor --verbose-prompt on interactive prompts (#14350)
M	tools/main/main.cpp

commit	901e20bbe571fbde48d13eb188f4e7cdc7562fb6	0142961a2e67909e33cdf410274b56c08c5dce7a	2025-06-24T02:17:58-04:00	Bartowski	jinja : Add Mistral-Small-3.2-24B-Instruct-2506.jinja (#14349)
A	models/templates/Mistral-Small-3.2-24B-Instruct-2506.jinja

commit	0142961a2e67909e33cdf410274b56c08c5dce7a	ce82bd0117bd3598300b3a089d13d401b90279c7	2025-06-24T01:12:56+02:00	uvos	CUDA/HIP: optimize mmv paths taken for HIP devices (#14324)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmv.cu

commit	ce82bd0117bd3598300b3a089d13d401b90279c7	bf2a99e3cb06a14dce2a586450d012dc31f922ae	2025-06-23T15:30:51-03:00	bandoti	ci: add workflow for relocatable cmake package (#14346)
A	.github/workflows/build-cmake-pkg.yml
M	.github/workflows/build.yml

commit	bf2a99e3cb06a14dce2a586450d012dc31f922ae	72c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3	2025-06-23T08:44:48-05:00	Jeff Bolz	vulkan: update windows SDK in release.yml (#14344)
M	.github/workflows/release.yml

commit	72c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3	defe2158dd5e250b4ef53994057a4ec03131a263	2025-06-23T19:56:19+08:00	Molly Sophia	llama : better rwkv chat template and add missing `inputs.use_jinja` setting (#14336)
M	src/llama-chat.cpp
M	tools/main/main.cpp

commit	defe2158dd5e250b4ef53994057a4ec03131a263	7b50d589a863c7631135c1226f6eab65cb406212	2025-06-23T13:11:31+02:00	Johannes Gäßler	CUDA: mul_mat_v support for batch sizes > 1 (#14262)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/mmv.cuh

commit	7b50d589a863c7631135c1226f6eab65cb406212	3a9457df962b5883f2773f1c295e8c19df60d89f	2025-06-23T12:27:35+03:00	Georgi Gerganov	kv-cells : fix tracking of seq_pos (#14339)
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-context.cpp
M	src/llama-kv-cells.h
M	tools/server/server.cpp

commit	3a9457df962b5883f2773f1c295e8c19df60d89f	fa4a9f2a1ccda2573189a9d4995bdf0bceb41156	2025-06-23T03:19:24-05:00	Jeff Bolz	vulkan: update windows SDK in CI (#14334)
M	.github/workflows/build.yml

commit	fa4a9f2a1ccda2573189a9d4995bdf0bceb41156	238005c2dc67426cf678baa2d54c881701693288	2025-06-22T22:16:26+01:00	Ed Addario	quantize : handle user-defined pruning of whole layers (blocks) (#13037)
M	include/llama.h
M	src/llama-quant.cpp
M	tools/quantize/quantize.cpp

commit	238005c2dc67426cf678baa2d54c881701693288	66aba7aca9a245d71f1ddf02c7a97223529752a8	2025-06-22T19:46:17+02:00	Sigbjørn Skjæret	gguf-py : fix SpecialVocab parsing when post_processor is null (#14330)
M	gguf-py/gguf/vocab.py

commit	66aba7aca9a245d71f1ddf02c7a97223529752a8	f1f5e82df6222dcbaca6396c0de44df259a1694f	2025-06-23T01:28:06+08:00	Ruikai Peng	run : avoid double tokenization (#14327)
M	tools/run/run.cpp

commit	f1f5e82df6222dcbaca6396c0de44df259a1694f	af3373f1adfca56119f3e4de0e6a0a8df8edf3d9	2025-06-22T20:10:07+03:00	Georgi Gerganov	examples : fix is_first logic for tokenization (#14329)
M	examples/simple-chat/simple-chat.cpp
M	tools/run/run.cpp

commit	af3373f1adfca56119f3e4de0e6a0a8df8edf3d9	5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3	2025-06-22T16:51:23+02:00	uvos	HIP: enable vec fattn on RDNA4 (#14323)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3	40bfa04c95c19fb42bafd4e21b5c2a7771846801	2025-06-22T21:44:57+09:00	yuiseki	mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326)
M	tools/mtmd/clip.cpp

commit	40bfa04c95c19fb42bafd4e21b5c2a7771846801	aa064b2eb7f7779db5e094a9d8d66d5033557de2	2025-06-22T07:37:43+02:00	Sigbjørn Skjæret	common : use std::string_view now that we target c++17 (#14319)
M	common/json-schema-to-grammar.cpp

commit	aa064b2eb7f7779db5e094a9d8d66d5033557de2	aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26	2025-06-22T12:39:54+08:00	Aman Gupta	CUDA: add mean operation (#14313)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/mean.cu
A	ggml/src/ggml-cuda/mean.cuh
M	ggml/src/ggml-cuda/sumrows.cu
M	ggml/src/ggml-cuda/sumrows.cuh
M	tests/test-backend-ops.cpp

commit	aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26	bb16041caef45cd4348cd6f84906b5dfec7a1f6a	2025-06-21T18:12:05+02:00	Sigbjørn Skjæret	gguf-py : fix Qwen3-Embedding eos token (#14314)
M	gguf-py/gguf/vocab.py

commit	bb16041caef45cd4348cd6f84906b5dfec7a1f6a	58cba76a9aab728717509d62b67c13afd8dc227a	2025-06-21T08:17:12+02:00	Markus Tavenrath	Add support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	58cba76a9aab728717509d62b67c13afd8dc227a	67ae5312e255ae97852a4a216e2245580bfafd72	2025-06-21T07:33:21+02:00	Sigbjørn Skjæret	gguf-py : fix TemplateProcessing pair when bos/eos is missing (#14312)
M	gguf-py/gguf/vocab.py

commit	67ae5312e255ae97852a4a216e2245580bfafd72	692e3cdd0a069ab56411b64506a67537d767683e	2025-06-21T08:04:18+03:00	Georgi Gerganov	metal : fix thread-safety (#14300)
M	ggml/src/ggml-metal/ggml-metal.m

commit	692e3cdd0a069ab56411b64506a67537d767683e	b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd	2025-06-21T08:03:46+03:00	Georgi Gerganov	memory : rename interface to llama_memory_context_i (#14296)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	src/llama-model.cpp

commit	b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd	06cbedfca1587473df9b537f1dd4d6bfa2e3de13	2025-06-20T21:32:01-07:00	Daniel Han	convert : fix Llama 4 conversion (#14311)
M	convert_hf_to_gguf.py

commit	06cbedfca1587473df9b537f1dd4d6bfa2e3de13	b7147673f26c7ceb926a43c4734002bba291bcb8	2025-06-20T20:50:24+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	b7147673f26c7ceb926a43c4734002bba291bcb8	d860dd99a4178f58d1d1fa64eebc2aabc95392a7	2025-06-18T13:34:50+02:00	Acly	Add `ggml_roll` (ggml/1274)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml.c

commit	d860dd99a4178f58d1d1fa64eebc2aabc95392a7	c959f462a0b4d42eaf930ffd72df0e435c97d5d5	2025-06-21T01:43:35+08:00	David Chiu	docs : fix the link to llama.h (#14293)
M	docs/build.md

commit	c959f462a0b4d42eaf930ffd72df0e435c97d5d5	22015b2092e291022ea3cfedc6aeb8f2643807da	2025-06-20T22:48:24+08:00	Aman Gupta	CUDA: add conv_2d_transpose (#14287)
A	ggml/src/ggml-cuda/conv2d-transpose.cu
A	ggml/src/ggml-cuda/conv2d-transpose.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	22015b2092e291022ea3cfedc6aeb8f2643807da	dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af	2025-06-20T16:37:44+02:00	Sigbjørn Skjæret	lint : remove trailing whitepace (#14304)
M	src/llama-vocab.cpp

commit	dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af	8308f98c7fb778e54bf75538f5234d8bd20915e9	2025-06-20T22:13:06+08:00	Ruikai Peng	vocab : prevent tokenizer overflow (#14301)
M	common/common.cpp
M	include/llama.h
M	src/llama-vocab.cpp

commit	8308f98c7fb778e54bf75538f5234d8bd20915e9	6369be07359d03723f38c0a4a014ff0f698a0738	2025-06-20T15:07:21+02:00	Nicolò Scipione	sycl: add usage of enqueue_functions extension (#14244)
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/conv.cpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/gla.cpp
M	ggml/src/ggml-sycl/im2col.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/wkv.cpp

commit	6369be07359d03723f38c0a4a014ff0f698a0738	88fc854b4bd2e3caf10e705e6afcbbca136f0a3c	2025-06-20T12:17:32Z	Christian Kastner	Implement GGML_CPU_ALL_VARIANTS for PowerPC (#14286)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-cpu/arch/powerpc/cpu-feats.cpp
M	ggml/src/ggml-cpu/repack.cpp

commit	88fc854b4bd2e3caf10e705e6afcbbca136f0a3c	e28c1b93fd7d3f8faf9551d962e8a65fe2122e38	2025-06-20T14:04:09+02:00	Sigbjørn Skjæret	llama : improve sep token handling (#14272)
M	ci/run.sh
M	common/arg.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	examples/embedding/embedding.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model-saver.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	tools/server/utils.hpp

commit	e28c1b93fd7d3f8faf9551d962e8a65fe2122e38	d27b3ca1758dfb1718e333d497ef4b68ad109bc2	2025-06-20T04:57:36-07:00	Diego Devesa	cuda : synchronize graph capture and cublas handle destruction (#14288)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	d27b3ca1758dfb1718e333d497ef4b68ad109bc2	9230dbe2c757e2d5071329095727d0fa9d4b85c4	2025-06-20T11:19:15+03:00	Georgi Gerganov	ggml : fix repack work size for mul_mat_id (#14292)
M	ggml/src/ggml-cpu/repack.cpp

commit	9230dbe2c757e2d5071329095727d0fa9d4b85c4	812939a9e90f99d1bd5bb1bc6b99d12600671d50	2025-06-20T09:51:01+02:00	Charles Xu	ggml: Update KleidiAI to v1.9.0 (#14277)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	812939a9e90f99d1bd5bb1bc6b99d12600671d50	4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd	2025-06-20T10:50:27+03:00	Georgi Gerganov	model : more uniform output id handling (#14275)
M	src/llama-graph.cpp
M	src/llama-model.cpp

commit	4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd	9eaa51e7f08593f123f00136591179a8f5956ecd	2025-06-20T10:14:14+03:00	Georgi Gerganov	ubatch : new splitting logic (#14217)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-kv-cells.h
M	src/llama-memory-hybrid.cpp
M	src/llama-memory-hybrid.h
M	src/llama-memory-recurrent.cpp
M	src/llama-memory-recurrent.h
M	src/llama-memory.h
M	tools/server/server.cpp

commit	d2f325130c4ed77a3dcff2c23a926587fb08e2cc	6391ee7ffd97e723dfbdcc32f001e1b95a63cba6	2025-06-17T11:53:33+08:00	Yunzhe Jia	calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/common.h
M	ggml/src/ggml-calrt/ggml-calrt.cpp
M	gguf-py/examples/cal_test.gguf
M	gguf-py/examples/writer_cal_test.py
M	src/llama-arch.cpp
M	src/llama-model.cpp

commit	9eaa51e7f08593f123f00136591179a8f5956ecd	8f71d0f3e86ccbba059350058af8758cafed73e6	2025-06-20T09:50:24+08:00	Aman Gupta	CUDA: add conv_2d_dw (#14265)
A	ggml/src/ggml-cuda/conv2d-dw.cu
A	ggml/src/ggml-cuda/conv2d-dw.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	8f71d0f3e86ccbba059350058af8758cafed73e6	381174bbdaf10d6a80dc2099f284b20544d86962	2025-06-19T12:24:14-07:00	Diego Devesa	ggml-cpu : remove unnecesary arm feature detection (#14281)
M	ggml/src/ggml-cpu/arch/arm/repack.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	381174bbdaf10d6a80dc2099f284b20544d86962	d67341dc18fc5cc63362880ab2f8f9ecfc7932e7	2025-06-19T09:56:12-04:00	Alex Trotta	gguf-py : make sentencepiece optional (#14200)
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml

commit	d67341dc18fc5cc63362880ab2f8f9ecfc7932e7	456af35eb70177b8dd5779b6d4c21bb020f9cebd	2025-06-19T16:01:03+03:00	aa956	server : add server parameters for draft model cache type (#13782)
M	common/arg.cpp
M	common/common.h
M	tools/server/README.md
M	tools/server/server.cpp

commit	456af35eb70177b8dd5779b6d4c21bb020f9cebd	600e3e9b50c1f0c9fc4a70356241fd87f00e8e14	2025-06-19T20:49:48+08:00	fanyang	build : suppress gcc15 compile warnings (#14261)
M	common/common.cpp
M	ggml/src/ggml-backend-reg.cpp
M	src/llama-vocab.cpp
M	src/unicode.cpp

commit	600e3e9b50c1f0c9fc4a70356241fd87f00e8e14	fffcce535ebbdc25f81966a15b758658788e7466	2025-06-19T11:40:21+01:00	Anton Mitkov	sycl: Cleanup codepaths in Get Rows in sycl backend (#14215)
M	ggml/src/ggml-sycl/getrows.cpp

commit	fffcce535ebbdc25f81966a15b758658788e7466	5fc7856815920f828f9e90cb759ac82c7f0c1ea5	2025-06-19T13:24:12+03:00	bashayer hijji	llama-bench : add --no-warmup flag (#14224) (#14270)
M	tools/llama-bench/llama-bench.cpp

commit	5fc7856815920f828f9e90cb759ac82c7f0c1ea5	faed5a5f5dde4d816adecdccb4f4682a04126f92	2025-06-19T12:21:40+02:00	pqnet	convert : fix remote option in Windows (#14100)
M	convert_hf_to_gguf.py

commit	faed5a5f5dde4d816adecdccb4f4682a04126f92	10bb545c5b54175ed9874ad8d187effa2bcb4b5f	2025-06-19T17:48:54+08:00	Aaron Teo	llamafile : support s390x SIMD instruction set (#14273)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.h

commit	10bb545c5b54175ed9874ad8d187effa2bcb4b5f	edc4a29effe716956fdfd2bc5b9cba2a6d8492f8	2025-06-19T09:15:42+02:00	0cc4m	Vulkan: Set device max size for host memory to avoid OOM warning and fallback to CPU buffer (#14249)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	edc4a29effe716956fdfd2bc5b9cba2a6d8492f8	ed3290ab34493fd3d2e0f925f816a401da4f2dfd	2025-06-19T00:08:14-05:00	Gabe Goodhart	memory : Hybrid recurrent cache (#13979)
M	src/CMakeLists.txt
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
A	src/llama-memory-hybrid.cpp
A	src/llama-memory-hybrid.h
R067	src/llama-kv-cache-recurrent.cpp	src/llama-memory-recurrent.cpp
R072	src/llama-kv-cache-recurrent.h	src/llama-memory-recurrent.h
M	src/llama-model.cpp

commit	ed3290ab34493fd3d2e0f925f816a401da4f2dfd	8d947136546773f6410756f37fcc5d3e65b8135d	2025-06-19T08:05:21+03:00	Georgi Gerganov	metal : add mean kernel (#14267)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	8d947136546773f6410756f37fcc5d3e65b8135d	50d2227953ca9024f04255b4f116d06fcc0db74c	2025-06-19T01:10:26+08:00	Aaron Teo	docs: add s390x build documentation (#14264)
A	docs/build-s390x.md

commit	50d2227953ca9024f04255b4f116d06fcc0db74c	6231c5cd6d49d61511f328b5f43322407df90a91	2025-06-19T01:10:08+08:00	Aaron Teo	ggml-cpu: reduce asm calls for hsum (#14037)
M	ggml/src/ggml-cpu/simd-mappings.h

commit	6231c5cd6d49d61511f328b5f43322407df90a91	ef035803eb9dbc306ea9a8ff82e30af12b567cf7	2025-06-19T01:06:49+08:00	Aaron Teo	ggml-cpu: fix uncaught underscore terminators (#14023)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	ef035803eb9dbc306ea9a8ff82e30af12b567cf7	413977de32e90712ecec84d0b9c738847da8dc02	2025-06-18T13:40:07+02:00	Charles Xu	ggml: Add Apple support for GGML_CPU_ALL_VARIANTS (#14258)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	413977de32e90712ecec84d0b9c738847da8dc02	95402553a5effc61ddc9e29c7bcb56f71311dd4a	2025-06-18T10:43:57+02:00	Xuan-Son Nguyen	mtmd : refactor llava-uhd preprocessing logic (#14247)
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd.cpp

commit	95402553a5effc61ddc9e29c7bcb56f71311dd4a	3865cff4f5b84c16119590efd6ce537789a27715	2025-06-18T09:58:43+02:00	Xuan-Son Nguyen	llama-chat : fix multiple system message for gemma, orion (#14246)
M	src/llama-chat.cpp

commit	3865cff4f5b84c16119590efd6ce537789a27715	d03172cc797b6adbbc00bfc09caf614fb0f895a0	2025-06-18T09:52:07+02:00	Sigbjørn Skjæret	convert : fix null head_dim AutoConfig regression (#14248)
M	convert_hf_to_gguf.py

commit	d03172cc797b6adbbc00bfc09caf614fb0f895a0	dd8e59f4435342eda93c5b0cf4109e21c9c7d0eb	2025-06-18T09:58:23+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	dd8e59f4435342eda93c5b0cf4109e21c9c7d0eb	bbe98d27840453c8787d18470963530fdc27d89f	2025-06-13T15:06:42+02:00	Daniel Bevenius	ggml : disable warnings for tests when using MSVC (ggml/1273)
M	ggml/CMakeLists.txt

commit	bbe98d27840453c8787d18470963530fdc27d89f	c2056ed6d461e6d5432f04f221e221ab795dc652	2025-06-13T09:05:44+02:00	Daniel Bevenius	ggml : remove unused ggml_context_container (ggml/1272)
M	ggml/src/ggml.c

commit	c2056ed6d461e6d5432f04f221e221ab795dc652	c46503014db0d63fa7b1b28c58adfb51054e2dec	2025-06-12T12:27:09+02:00	Daniel Bevenius	examples : include examples in msvc disable warn (ggml/1270)
M	ggml/CMakeLists.txt

commit	c46503014db0d63fa7b1b28c58adfb51054e2dec	860a9e4eeff3eb2e7bd1cc38f65787cc6c8177af	2025-06-17T17:33:25-03:00	bandoti	cmake: remove shader-gen step-targets from ggml-vulkan (#14226)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	860a9e4eeff3eb2e7bd1cc38f65787cc6c8177af	fe9d60e74a6cb71bcaed2029377bfa2872b4abb0	2025-06-17T17:58:32+08:00	xctan	ggml-cpu : remove the weak alias trick (#14221)
D	ggml/src/ggml-cpu/apple-fallback.h
A	ggml/src/ggml-cpu/arch-fallback.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/quants.c
M	ggml/src/ggml-cpu/repack.cpp
M	ggml/src/ggml-cpu/repack.h

commit	fe9d60e74a6cb71bcaed2029377bfa2872b4abb0	e434e69183fd9e1031f4445002083178c331a28b	2025-06-17T17:48:08+08:00	R0CKSTAR	musa: fix build warning (unused variable) (#14231)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	e434e69183fd9e1031f4445002083178c331a28b	89fea80d298184d1cd93564f48e060d9f541f4b4	2025-06-16T21:58:42+02:00	Sigbjørn Skjæret	common : suggest --jinja when autodetection fails (#14222)
M	common/chat.cpp

commit	89fea80d298184d1cd93564f48e060d9f541f4b4	6adc3c3ebc029af058ac950a8e2a825fdf18ecc6	2025-06-16T22:33:27+03:00	Georgi Gerganov	server : fix incorrect usage of llama_get_embeddings() (#14225)
M	include/llama.h
M	tools/server/server.cpp

commit	6adc3c3ebc029af058ac950a8e2a825fdf18ecc6	0dbcabde8c006d5cf781ca0fe071c41559572a72	2025-06-16T08:11:43-07:00	Diego Devesa	llama : add thread safety test (#14035)
M	.github/workflows/build.yml
M	ci/run.sh
M	common/common.cpp
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	src/llama.cpp
M	tests/CMakeLists.txt
A	tests/test-thread-safety.cpp

commit	0dbcabde8c006d5cf781ca0fe071c41559572a72	ad590be98c83217fcf1a101d78d9ab389fd5dc0b	2025-06-16T10:32:13-03:00	bandoti	cmake: clean up external project logic for vulkan-shaders-gen (#14179)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	ad590be98c83217fcf1a101d78d9ab389fd5dc0b	7d6d91babfa129906b39c9099eca4234c44f4f1e	2025-06-16T21:53:41+09:00	Đinh Trọng Huy	model : add NeoBERT (#14164)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	7d6d91babfa129906b39c9099eca4234c44f4f1e	d3e64b9f490cee41b7b9aa275dae2f6568ae3054	2025-06-16T13:47:38+02:00	uvos	HIP: disable rocwmma on gfx12 by default until rocm 7.0 (#14202)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-hip/CMakeLists.txt

commit	d3e64b9f490cee41b7b9aa275dae2f6568ae3054	3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb	2025-06-16T14:14:00+03:00	Georgi Gerganov	llama : rework embeddings logic (#14208)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/gritlm/gritlm.cpp
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-kv-cache-recurrent.cpp
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory.h
M	tools/server/server.cpp

commit	3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb	0bf49eb668bb95b50e41583e22aaf60ddade1fbe	2025-06-16T11:47:57+02:00	Charles Xu	ggml: Add Android support for GGML_CPU_ALL_VARIANTS (#14206)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	0bf49eb668bb95b50e41583e22aaf60ddade1fbe	4ad243677bca6c97f14dbc187b2116b51fcb7ffd	2025-06-16T09:16:06+01:00	Bartowski	convert : remove arcee change in convert_hf_to_gguf_update.py (#14207)
M	convert_hf_to_gguf_update.py

commit	4ad243677bca6c97f14dbc187b2116b51fcb7ffd	c89c2d1ab94b11845240b7d3313c87691ea18d88	2025-06-16T16:20:59+09:00	Đinh Trọng Huy	gguf-py : allow key override when adding value to GGUFWriter (#14194)
M	gguf-py/gguf/gguf_writer.py

commit	c89c2d1ab94b11845240b7d3313c87691ea18d88	3555b3004ba7687be3d734acade52a3345758aa4	2025-06-16T00:21:08-06:00	Jeff Bolz	vulkan: mutex around vkQueueSubmit (#14127)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	3555b3004ba7687be3d734acade52a3345758aa4	d7da8dc83a03b30e1ec10317080082ea76840c38	2025-06-16T13:54:15+08:00	xctan	ggml-cpu : rework weak alias on apple targets (#14146)
M	ggml/cmake/common.cmake
A	ggml/src/ggml-cpu/apple-fallback.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/quants.c
M	ggml/src/ggml-cpu/quants.h
M	ggml/src/ggml-cpu/repack.cpp
M	ggml/src/ggml-cpu/repack.h

commit	d7da8dc83a03b30e1ec10317080082ea76840c38	cd355eda7df1898d25d433b4bdaa4b4b479e0bad	2025-06-16T00:04:06+01:00	Bartowski	model : Add support for Arcee AI's upcoming AFM model (#14185)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	cd355eda7df1898d25d433b4bdaa4b4b479e0bad	30e5b01de2a0bcddc7c063c8ef0802703a958417	2025-06-15T23:36:22+02:00	Eric Curtin	server : When listening on a unix domain socket don't print http:// and port (#14180)
M	tools/server/server.cpp

commit	30e5b01de2a0bcddc7c063c8ef0802703a958417	e54b394082de242be4ee2e692b11fcc8d4eba371	2025-06-15T17:53:45+01:00	Ed Addario	quantize : change int to unsigned int for KV overrides (#14197)
M	src/llama-quant.cpp

commit	e54b394082de242be4ee2e692b11fcc8d4eba371	2c2caa444341d99c87ff153f142c2d4762a776a2	2025-06-15T17:30:13+02:00	uvos	CUDA/HIP: fix ssm_scan on devices where warp size is not 32 (#14196)
M	ggml/src/ggml-cuda/ssm-scan.cu

commit	2c2caa444341d99c87ff153f142c2d4762a776a2	5fce5f948df8f189a5401a8ecaa9753106e75abb	2025-06-15T15:45:27+02:00	uvos	HIP: Replace usage of depricated preprocessor macro __AMDGCN_WAVEFRONT_SIZE__ (#14183)
M	ggml/src/ggml-cuda/common.cuh

commit	5fce5f948df8f189a5401a8ecaa9753106e75abb	9ae4143bc6ecb4c2f0f0301578f619f6c201b857	2025-06-15T10:52:11+03:00	Georgi Gerganov	kv-cache : fix use-after-move of defrag info (#14189)
M	src/llama-kv-cache-unified.cpp

commit	9ae4143bc6ecb4c2f0f0301578f619f6c201b857	c311ac664d68d10781a3e7b9f02d9d9520837d80	2025-06-15T00:52:06-07:00	Mikko Juola	model : add dots.llm1 architecture support (#14044) (#14118)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	c311ac664d68d10781a3e7b9f02d9d9520837d80	b9912ac570de8945ae9383c9ca8291027bf287dd	2025-06-15T10:08:58+03:00	Georgi Gerganov	cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188)
M	src/llama-batch.cpp
M	src/llama-context.cpp
M	src/llama-cparams.cpp
M	src/llama-cparams.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cells.h

commit	b9912ac570de8945ae9383c9ca8291027bf287dd	00ba7726100d7e1941d9f5a06f56a7559945b33c	2025-06-15T09:18:37+03:00	Georgi Gerganov	batch : auto-gen positions + verify multi-sequence input (#14177)
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-cparams.h

commit	00ba7726100d7e1941d9f5a06f56a7559945b33c	3cb203c89f60483e349f841684173446ed23c28f	2025-06-15T08:06:37+02:00	Pepijn de Vos	docs : remove WIP since PR has been merged (#13912)
M	docs/function-calling.md

commit	3cb203c89f60483e349f841684173446ed23c28f	2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f	2025-06-14T18:25:15+02:00	Piotr	llama-chat : Do not throw when tool parsing fails (#14012)
M	common/chat-parser.cpp
M	common/chat-parser.h
M	common/chat.cpp

commit	2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f	fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46	2025-06-14T16:34:20+08:00	Aman Gupta	compare-llama-bench: add option to plot (#14169)
M	requirements/requirements-compare-llama-bench.txt
M	scripts/compare-llama-bench.py

commit	fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46	40643edb86eb10b471b0f57d4f3f7eb0e06a0df7	2025-06-13T20:03:05+03:00	Georgi Gerganov	vocab : fix build (#14175)
M	src/llama-vocab.cpp

commit	40643edb86eb10b471b0f57d4f3f7eb0e06a0df7	3cfbbdb44e08fd19429fed6cc85b982a91f0efd5	2025-06-13T17:32:56+01:00	Svetlozar Georgiev	sycl: fix docker image (#14144)
M	.devops/intel.Dockerfile

commit	3cfbbdb44e08fd19429fed6cc85b982a91f0efd5	80709b70a2f87c13ccaf1480b799393109996789	2025-06-13T19:20:25+03:00	Guy Goldenberg	Merge commit from fork
M	src/llama-vocab.cpp

commit	80709b70a2f87c13ccaf1480b799393109996789	26ff3685bfbaa4c8838d7afd988b17dd5eb99f92	2025-06-13T18:35:00+03:00	Georgi Gerganov	batch : add LLAMA_BATCH_DEBUG environment variable (#14172)
M	src/llama-batch.cpp
M	src/llama-batch.h

commit	26ff3685bfbaa4c8838d7afd988b17dd5eb99f92	60c666347becacff81cd4bc9a52038ba71038e41	2025-06-13T15:17:53+02:00	ddpasa	docs : Update multimodal.md (#14122)
M	docs/multimodal.md

commit	60c666347becacff81cd4bc9a52038ba71038e41	b7cc7745e38141060845145af0a1fd489d8e3e33	2025-06-13T13:47:55+03:00	Georgi Gerganov	batch : rework llama_batch_allocr (#14153)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache-unified.cpp

commit	b7cc7745e38141060845145af0a1fd489d8e3e33	cc8d08187918c6f643c3ffabb7b1ac21aa19f3d1	2025-06-13T11:55:44+03:00	Georgi Gerganov	readme : remove survey link (#14168)
M	README.md

commit	cc8d08187918c6f643c3ffabb7b1ac21aa19f3d1	d714dadb57d8feaa03d13b79345a4c3382172d61	2025-06-13T08:38:52Z	Christian Kastner	cmake: Add ability to pass in LLAMA_BUILD_NUMBER/COMMIT (#14167)
M	CMakeLists.txt
M	common/build-info.cpp.in

commit	d714dadb57d8feaa03d13b79345a4c3382172d61	ffad04397399ea1650fda6560c7c753059804876	2025-06-13T17:34:08+09:00	Đinh Trọng Huy	pooling : make cls_b and cls_out_b optional (#14165)
M	src/llama-graph.cpp

commit	ffad04397399ea1650fda6560c7c753059804876	0889eba570126f8a2f5a0e88fde776bbc91cca66	2025-06-13T11:18:25+03:00	Georgi Gerganov	server : fix SWA condition for full context reprocess (#14163)
M	tools/server/server.cpp

commit	0889eba570126f8a2f5a0e88fde776bbc91cca66	c61285e7396c8e526fe7794c19e8d4f1c99bfc51	2025-06-13T08:51:39+01:00	Anton Mitkov	sycl: Adding additional cpy dbg print output (#14034)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	c61285e7396c8e526fe7794c19e8d4f1c99bfc51	09cf2c7c655c90e53e100f29b830a788bab0653d	2025-06-13T08:45:37+01:00	Ewan Crawford	SYCL: Bump oneMath commit (#14152)
M	ggml/src/ggml-sycl/CMakeLists.txt

commit	09cf2c7c655c90e53e100f29b830a788bab0653d	c33fe8b8c4427202706b1434e9fc8ab5752c9cac	2025-06-13T06:51:34Z	Christian Kastner	cmake : Improve build-info.cpp generation (#14156)
M	common/CMakeLists.txt
D	common/cmake/build-info-gen-cpp.cmake

commit	c33fe8b8c4427202706b1434e9fc8ab5752c9cac	ed52f3668e633423054a4eab61bb7efee47025ab	2025-06-13T08:03:54+03:00	Georgi Gerganov	vocab : prevent heap overflow when vocab is too small (#14145)
M	src/llama-vocab.cpp

commit	6391ee7ffd97e723dfbdcc32f001e1b95a63cba6	b9850050a5b5147cb2e6720b98ed8c1e8e02eff9	2025-06-13T10:58:06+08:00	Yunzhe Jia	update .gitignore to update cal_test.gguf
M	.gitignore
A	gguf-py/examples/cal_test.gguf

commit	b9850050a5b5147cb2e6720b98ed8c1e8e02eff9	933b205c32551848589b8339437d778cb4f2a46d	2025-06-06T17:25:52+08:00	Yunzhe Jia	calrt: add call chain for using calrt::infer
M	ggml/src/ggml-calrt/CMakeLists.txt
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/calrt-op.h
M	ggml/src/ggml-calrt/common.h
M	ggml/src/ggml-calrt/ggml-calrt.cpp
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	ed52f3668e633423054a4eab61bb7efee47025ab	a681b4ba83a61dce71a4f24e558efe7278d8b1a9	2025-06-12T14:15:11+01:00	Anton Mitkov	sycl: Remove not needed copy f16->f32 for dnnl mul mat (#14125)
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a681b4ba83a61dce71a4f24e558efe7278d8b1a9	7d516443dd7766569110b38e6374649bee6eb1c4	2025-06-12T14:43:09+03:00	Georgi Gerganov	readme : remove project status link (#14149)
M	README.md

commit	933b205c32551848589b8339437d778cb4f2a46d	33fea9a8592fd338abe279b89350a3af2e0ff1f7	2025-06-12T17:47:19+08:00	Yunzhe Jia	gguf-py: add cal_test.py
A	gguf-py/examples/tokenizer.json
A	gguf-py/examples/writer_cal_test.py

commit	7d516443dd7766569110b38e6374649bee6eb1c4	f6e1a7aa8787b5c00acba6370cb70a0beff48b1e	2025-06-12T11:51:38+03:00	Georgi Gerganov	server : re-enable SWA speculative decoding (#14131)
M	tools/server/server.cpp

commit	f6e1a7aa8787b5c00acba6370cb70a0beff48b1e	c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c	2025-06-12T11:50:01+03:00	Georgi Gerganov	context : simplify output counting logic during decode (#14142)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp

commit	c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c	e2c0b6e46a5596665569ae765f0993cea2619af6	2025-06-12T11:49:26+03:00	Georgi Gerganov	batch : remove logits_all flag (#14141)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-kv-cache-recurrent.cpp
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory.h

commit	e2c0b6e46a5596665569ae765f0993cea2619af6	9596506965f65be5d802ecef6a315fe43d2391a8	2025-06-12T10:14:24+03:00	Georgi Gerganov	cmake : handle whitepsaces in path during metal build (#14126)
M	ggml/src/ggml-metal/CMakeLists.txt

commit	9596506965f65be5d802ecef6a315fe43d2391a8	a20b2b05bce6622c585459ebf46f142f113d021c	2025-06-12T10:02:15+03:00	Georgi Gerganov	kv-cache : fix split_equal handling in unified implementation (#14130)
M	src/llama-context.cpp
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified.cpp

commit	a20b2b05bce6622c585459ebf46f142f113d021c	2e89f76b7af2c0b827be785e445f2e2b3e52e1ca	2025-06-12T02:56:04-04:00	compilade	context : round n_tokens to next multiple of n_seqs when reserving (#14140)
M	src/llama-context.cpp

commit	2e89f76b7af2c0b827be785e445f2e2b3e52e1ca	532802f938c6a18cc6a704057ab571f253fd77ed	2025-06-11T17:19:44-03:00	bandoti	common: fix issue with regex_escape routine on windows (#14133)
M	common/common.cpp

commit	532802f938c6a18cc6a704057ab571f253fd77ed	d4e0d95cf581f50c9a21d06eaecae2dd580076bd	2025-06-11T19:07:44Z	Christian Kastner	Implement GGML_CPU_ALL_VARIANTS for ARM (#14080)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-cpu/arch/arm/cpu-feats.cpp

commit	d4e0d95cf581f50c9a21d06eaecae2dd580076bd	cc66a7f78f95dcb5208420f4dd1abc3fc6aec0cc	2025-06-11T19:04:23+02:00	Sigbjørn Skjæret	chore : clean up relative source dir paths (#14128)
M	common/CMakeLists.txt
M	tests/CMakeLists.txt

commit	cc66a7f78f95dcb5208420f4dd1abc3fc6aec0cc	bd248d4dc7265437e1918dc53ae3f49a0c592e5f	2025-06-11T17:16:32+02:00	Sigbjørn Skjæret	tests : add test-tokenizers-repo (#14017)
M	tests/CMakeLists.txt
A	tests/test-tokenizers-repo.sh

commit	bd248d4dc7265437e1918dc53ae3f49a0c592e5f	7781e5fe99f2a4fc1c8af0a8488eedac4644cb72	2025-06-11T09:48:52-05:00	Jeff Bolz	vulkan: Better thread-safety for command pools/buffers (#14116)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	7781e5fe99f2a4fc1c8af0a8488eedac4644cb72	89a184fa7125b7c3e2fb567337cc2bd7bc2d376c	2025-06-11T22:42:25+08:00	Aman	webui: Wrap long numbers instead of infinite horizontal scroll (#14062)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/index.scss

commit	89a184fa7125b7c3e2fb567337cc2bd7bc2d376c	2baf07727f921d9a4a1b63a2eff941e95d0488ed	2025-06-11T16:48:45+03:00	Georgi Gerganov	kv-cache : relax SWA masking condition (#14119)
M	src/llama-kv-cache-unified.cpp

commit	2baf07727f921d9a4a1b63a2eff941e95d0488ed	7ae2932116a4de3141cbc8c488f7f6e4e06d8171	2025-06-11T06:43:43-04:00	Taylor	server : pass default --keep argument (#14120)
M	tools/server/server.cpp

commit	7ae2932116a4de3141cbc8c488f7f6e4e06d8171	1f7d50b2936023b26eb218e944e62834b80a2ce0	2025-06-11T12:52:45+03:00	Georgi Gerganov	kv-cache : add LLAMA_KV_CACHE_DEBUG environment variable (#14121)
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h

commit	1f7d50b2936023b26eb218e944e62834b80a2ce0	4c763c8d1b4d4de20bf364ec1837430783cba984	2025-06-11T00:19:25-05:00	Jeff Bolz	vulkan: Track descriptor pools/sets per-context (#14109)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	4c763c8d1b4d4de20bf364ec1837430783cba984	dad5c44398b78467943ed0a603ea427fe9f6fc62	2025-06-10T16:55:58-07:00	lhez	opencl: add `mul_mv_id_q4_0_f32_8x_flat` (#14003)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/mul_mv_id_q4_0_f32_8x_flat.cl

commit	dad5c44398b78467943ed0a603ea427fe9f6fc62	55f6b9fa6563f6ae49113f9abdc980c12348cc1c	2025-06-10T18:20:14-04:00	compilade	kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache-recurrent.cpp
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-model.cpp

commit	55f6b9fa6563f6ae49113f9abdc980c12348cc1c	3678b838bb71eaccbaeb479ff38c2e12bfd2f960	2025-06-10T23:29:52+02:00	Sigbjørn Skjæret	convert : fix duplicate key DeepSeek-R1 conversion error (#14103)
M	convert_hf_to_gguf.py

commit	3678b838bb71eaccbaeb479ff38c2e12bfd2f960	652b70e6678d503626f3c9d33831ba604b473401	2025-06-10T18:02:08+02:00	Sigbjørn Skjæret	llama : support GEGLU for jina-bert-v2 (#14090)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-graph.cpp
M	src/llama-model.cpp

commit	652b70e6678d503626f3c9d33831ba604b473401	3a12db23b6918682ccb70ab15d897f11fe5fc320	2025-06-10T10:53:47-05:00	Jeff Bolz	vulkan: force device 0 in CI (#14106)
M	.github/workflows/build.yml

commit	3a12db23b6918682ccb70ab15d897f11fe5fc320	ae92c1855b1a5b604fa1bfcced19a556ab3e78c5	2025-06-10T16:48:07+01:00	Juk Armstrong	Fixed spec timings to: accepted/tested instead of accepted/drafted (#14104)
M	tools/server/server.cpp

commit	ae92c1855b1a5b604fa1bfcced19a556ab3e78c5	b7ce1ad1e332da5909772d173a7e6748fbd1887a	2025-06-10T17:37:45+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	b7ce1ad1e332da5909772d173a7e6748fbd1887a	97340b4c9924be86704dbf155e97c8319849ee19	2025-06-10T11:34:10+03:00	Georgi Gerganov	ggml : fix weak alias win32 (whisper/0)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	97340b4c9924be86704dbf155e97c8319849ee19	2bb0467043258bdc58dbaefb33786f1731b38937	2025-06-10T14:01:33+02:00	0cc4m	Vulkan: Don't default to CPU device (like llvmpipe), even if no other device is available, to allow fallback to CPU backend (#14099)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	2bb0467043258bdc58dbaefb33786f1731b38937	b8e2194efc529378be45ab9b27d6648a5b81458a	2025-06-10T02:41:01-04:00	Isaac McFadyen	rpc : nicer error messages for RPC server crash (#14076)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	b8e2194efc529378be45ab9b27d6648a5b81458a	1a3b5e80f77c51e6d9fb7762f19b9e61fceca3de	2025-06-10T09:20:51+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1a3b5e80f77c51e6d9fb7762f19b9e61fceca3de	1f63e75f3b5dc7f44dbe63c8a41d23958fe95bc0	2025-06-03T12:33:28+02:00	Kai Pastor	Add in-build ggml::ggml ALIAS library (ggml/1260)
M	ggml/src/CMakeLists.txt

commit	1f63e75f3b5dc7f44dbe63c8a41d23958fe95bc0	40cbf571c9210031340f022d104317e89a1a6bb2	2025-06-09T23:05:02+03:00	Georgi Gerganov	metal : use less stack memory in FA kernel (#14088)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	40cbf571c9210031340f022d104317e89a1a6bb2	7f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7	2025-06-09T23:04:35+03:00	Georgi Gerganov	kv-cache : fix shift and defrag logic (#14081)
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cells.h

commit	7f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7	f470bc36bed4d836b9de5a483fa0dfaee176d6f5	2025-06-09T11:03:09-07:00	Diego Devesa	llama : allow building all tests on windows when not using shared libs (#13980)
M	.github/workflows/build.yml
M	tests/CMakeLists.txt
M	tests/test-chat.cpp

commit	f470bc36bed4d836b9de5a483fa0dfaee176d6f5	8f47e25f56e9792093b7497c68e9f80bab82ed19	2025-06-09T22:47:13+08:00	xctan	ggml-cpu : split arch-specific implementations (#13892)
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/amx.cpp
M	ggml/src/ggml-cpu/amx/mmq.cpp
A	ggml/src/ggml-cpu/arch/arm/quants.c
A	ggml/src/ggml-cpu/arch/arm/repack.cpp
A	ggml/src/ggml-cpu/arch/loongarch/quants.c
A	ggml/src/ggml-cpu/arch/powerpc/quants.c
A	ggml/src/ggml-cpu/arch/riscv/quants.c
A	ggml/src/ggml-cpu/arch/riscv/repack.cpp
A	ggml/src/ggml-cpu/arch/s390/quants.c
A	ggml/src/ggml-cpu/arch/wasm/quants.c
R100	ggml/src/ggml-cpu/cpu-feats-x86.cpp	ggml/src/ggml-cpu/arch/x86/cpu-feats.cpp
A	ggml/src/ggml-cpu/arch/x86/quants.c
R068	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp	ggml/src/ggml-cpu/arch/x86/repack.cpp
M	ggml/src/ggml-cpu/common.h
D	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
D	ggml/src/ggml-cpu/ggml-cpu-quants.c
D	ggml/src/ggml-cpu/ggml-cpu-quants.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
R098	ggml/src/ggml-cpu/ggml-cpu-hbm.cpp	ggml/src/ggml-cpu/hbm.cpp
R100	ggml/src/ggml-cpu/ggml-cpu-hbm.h	ggml/src/ggml-cpu/hbm.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp
A	ggml/src/ggml-cpu/quants.c
A	ggml/src/ggml-cpu/quants.h
A	ggml/src/ggml-cpu/repack.cpp
A	ggml/src/ggml-cpu/repack.h
R097	ggml/src/ggml-cpu/ggml-cpu-traits.cpp	ggml/src/ggml-cpu/traits.cpp
R100	ggml/src/ggml-cpu/ggml-cpu-traits.h	ggml/src/ggml-cpu/traits.h
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-sycl/common.hpp

commit	8f47e25f56e9792093b7497c68e9f80bab82ed19	201b31dc2e6fef3de598280b53fd3b69420a4e49	2025-06-09T07:36:26-07:00	Diego Devesa	cuda : fix device sync on buffer clear (#14033)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	201b31dc2e6fef3de598280b53fd3b69420a4e49	e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57	2025-06-09T17:17:31+03:00	Georgi Gerganov	graph : fix geglu (#14077)
M	src/llama-graph.cpp

commit	e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57	dc0623fddb661926e0998538895155e4f081ff09	2025-06-09T19:47:39+08:00	Xinpeng Dou	CANN: Simplify the environment variable setting(#13104)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	dc0623fddb661926e0998538895155e4f081ff09	87d34b381d5868e75586210ec17b5ef5deddc276	2025-06-09T18:01:17+08:00	R0CKSTAR	webui: fix sidebar being covered by main content (#14082)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/App.tsx

commit	87d34b381d5868e75586210ec17b5ef5deddc276	b460d16ae858c6624fd37aec316622a4060ca325	2025-06-09T12:57:58+03:00	Georgi Gerganov	server : fix LRU check (#14079)
M	tools/server/server.cpp

commit	b460d16ae858c6624fd37aec316622a4060ca325	91a8ee6a6f1f4c8547ff7b745ef95c6edc1d2af6	2025-06-09T11:47:07+02:00	Nicolò Scipione	sycl: Add reorder to Q6_K mmvq implementation (#13885)
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/dequantize.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/quants.hpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	91a8ee6a6f1f4c8547ff7b745ef95c6edc1d2af6	056eb74534ffd3efc50a9b854156eb6876a52a44	2025-06-09T13:15:31+09:00	Đinh Trọng Huy	add geglu activation function (#14074)
M	src/llama-graph.cpp
M	src/llama-graph.h

commit	056eb74534ffd3efc50a9b854156eb6876a52a44	247e5c6e447707bb4539bdf1913d206088a8fc69	2025-06-09T11:20:06+08:00	Yuanhao Ji	CANN: Enable labeler for Ascend NPU (#13914)
M	.github/labeler.yml

commit	247e5c6e447707bb4539bdf1913d206088a8fc69	5787b5da57e54dba760c2deeac1edf892e8fc450	2025-06-08T11:39:56-07:00	Diego Devesa	cuda : fix buffer type check with integrated GPUs (#14069)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	5787b5da57e54dba760c2deeac1edf892e8fc450	228f34c9ceefa3ea4f4d6933edd858121e8106cb	2025-06-07T21:39:11+08:00	吴小白	ci: add LoongArch cross-compile build (#13944)
M	.github/workflows/build-linux-cross.yml

commit	228f34c9ceefa3ea4f4d6933edd858121e8106cb	0974ad7a7cd4bca846b15c484ff3be890135a52c	2025-06-07T18:58:20+05:30	Akarshan Biswas	SYCL: Implement few same quantized type copy kernels (#13739)
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	0974ad7a7cd4bca846b15c484ff3be890135a52c	745aa5319b9930068aff5e87cf5e9eef7227339b	2025-06-07T14:13:12+02:00	Sigbjørn Skjæret	llama : fix llama_model_chat_template with template name (LLM_KV with suffix) (#14050)
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	745aa5319b9930068aff5e87cf5e9eef7227339b	487a5e0401423bba02cd6e97e4d45131bb20b22b	2025-06-06T14:11:15+03:00	Georgi Gerganov	llama : deprecate llama_kv_self_ API (#14030)
M	common/common.cpp
M	common/speculative.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/embedding/embedding.cpp
M	examples/gritlm/gritlm.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/simple-chat/simple-chat.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-kv-cache-recurrent.cpp
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-memory.h
M	tools/batched-bench/batched-bench.cpp
M	tools/cvector-generator/cvector-generator.cpp
M	tools/imatrix/imatrix.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/main/main.cpp
M	tools/mtmd/mtmd-cli.cpp
M	tools/perplexity/perplexity.cpp
M	tools/run/run.cpp
M	tools/server/server.cpp

commit	487a5e0401423bba02cd6e97e4d45131bb20b22b	d17a809ef0af09b16625e991a76f6fe80d9c332e	2025-06-06T13:29:18+03:00	Georgi Gerganov	context : fix SWA-related warning for multiple sequences (#14045)
M	src/llama-context.cpp

commit	33fea9a8592fd338abe279b89350a3af2e0ff1f7	806f05a353d322e97d97e02f910de2b408a8b4ab	2025-06-06T17:25:52+08:00	Yunzhe Jia	calrt: add load calbin
M	ggml/src/ggml-calrt/CMakeLists.txt
M	ggml/src/ggml-calrt/calrt-op.cpp
M	ggml/src/ggml-calrt/calrt-op.h
M	ggml/src/ggml-calrt/ggml-calrt.cpp

commit	d17a809ef0af09b16625e991a76f6fe80d9c332e	1caae7fc6c77551cb1066515e0f414713eebb367	2025-06-06T09:03:25+02:00	Sigbjørn Skjæret	llama : support multiple classifier outputs and labels (#13940)
M	examples/embedding/embedding.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-model-loader.cpp
M	src/llama-model.cpp
M	src/llama-model.h

commit	806f05a353d322e97d97e02f910de2b408a8b4ab	ec9e0301fef6476df83e94842c3b625501c95566	2025-05-30T09:45:37+08:00	Yunzhe Jia	add calrt demo
M	ggml/CMakeLists.txt
A	ggml/include/ggml-calrt.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
A	ggml/src/ggml-calrt/CMakeLists.txt
A	ggml/src/ggml-calrt/cal-runtime.h
A	ggml/src/ggml-calrt/calrt-op.cpp
A	ggml/src/ggml-calrt/calrt-op.h
A	ggml/src/ggml-calrt/common.h
A	ggml/src/ggml-calrt/ggml-calrt.cpp
M	include/llama.h

commit	1caae7fc6c77551cb1066515e0f414713eebb367	669c13e0f67edfba891c5bd7105eb4376bcf8626	2025-06-05T17:42:31+02:00	Sigbjørn Skjæret	gguf-py : add add_classifier_output_labels method to writer (#14031)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/gguf_writer.py

commit	669c13e0f67edfba891c5bd7105eb4376bcf8626	146b88e8b3e16d22cea22f8be982a4d45e913b1e	2025-06-05T23:00:29+09:00	Masato Nakasaka	vulkan: Enable VK_KHR_cooperative_matrix extension for Intel Xe2 GPUs (#14001)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	146b88e8b3e16d22cea22f8be982a4d45e913b1e	7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748	2025-06-05T06:25:29-07:00	pockers21	ci: fix CUDA build failure on autodl cloud machines (#14005)
M	ci/run.sh

commit	7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748	3a077146a4761fdbd24bdd8eb098f46b8adc4dda	2025-06-05T15:29:22+03:00	Georgi Gerganov	memory : migrate from llama_kv_cache to more generic llama_memory (#14006)
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.h
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.h
D	src/llama-kv-cache.cpp
D	src/llama-kv-cache.h
M	src/llama-memory.h

commit	3a077146a4761fdbd24bdd8eb098f46b8adc4dda	d01d112abb055549d33bb8aac1755eb0c40918ad	2025-06-05T02:57:42-07:00	Diego Devesa	llama : allow using mmap without PrefetchVirtualMemory, apply GGML_WIN_VER to llama.cpp sources (#14013)
M	CMakeLists.txt
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	src/llama-mmap.cpp

commit	d01d112abb055549d33bb8aac1755eb0c40918ad	9f47fa5792bae5312615439e68dbf1826913f7ac	2025-06-05T10:50:55+03:00	Olexandr88	readme : add badge (#13938)
M	README.md

commit	9f47fa5792bae5312615439e68dbf1826913f7ac	9e31bec4fd53634c9e5b04650488a09a055f5dab	2025-06-05T09:29:18+02:00	Sigbjørn Skjæret	vocab : warn about missing mask token (#14022)
M	src/llama-vocab.cpp

commit	9e31bec4fd53634c9e5b04650488a09a055f5dab	5a8ae3053ced350ed300ba91600519fcad1c6ba7	2025-06-05T09:06:29+03:00	Georgi Gerganov	context : fix pos_min initialization upon error decode (#14008)
M	src/llama-context.cpp

commit	5a8ae3053ced350ed300ba91600519fcad1c6ba7	0d3984424f2973c49c4bcabe4cc0153b4f90c601	2025-06-05T00:17:58-05:00	Jeff Bolz	vulkan: automatically deduce size of push constants (#13936)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	0d3984424f2973c49c4bcabe4cc0153b4f90c601	3e63a58ef7addec35408e2eb67850d7cdc935dc3	2025-06-04T22:02:00+02:00	Ervin Áron Tasnádi	ggml-vulkan: adds support for op CONV_TRANSPOSE_1D (#13813)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/conv_transpose_1d.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	3e63a58ef7addec35408e2eb67850d7cdc935dc3	2589ad3704559f4dd860f5f303b19349c688a28a	2025-06-04T18:58:20+03:00	Georgi Gerganov	kv-cache : refactor the update/defrag mechanism (#13988)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache-recurrent.cpp
M	src/llama-kv-cache-recurrent.h
M	src/llama-kv-cache-unified-iswa.cpp
M	src/llama-kv-cache-unified-iswa.h
M	src/llama-kv-cache-unified.cpp
M	src/llama-kv-cache-unified.h
M	src/llama-kv-cache.h
M	src/llama-memory.cpp
M	src/llama-memory.h

commit	2589ad3704559f4dd860f5f303b19349c688a28a	482548716f664f76e325ded58c9e8b7563e5e23a	2025-06-04T06:37:40-07:00	Diego Devesa	ci : remove cuda 11.7 releases, switch runner to windows 2022 (#13997)
M	.github/workflows/build.yml
M	.github/workflows/release.yml
M	.github/workflows/server.yml

commit	482548716f664f76e325ded58c9e8b7563e5e23a	3ac67535c86e2fc43e4eddf594412acc370bbb04	2025-06-04T04:15:54-07:00	Diego Devesa	releases : use dl backend for linux release, remove arm64 linux release (#13996)
M	.github/workflows/release.yml
M	ggml/src/ggml-cpu/ops.cpp

commit	3ac67535c86e2fc43e4eddf594412acc370bbb04	0b4be4c435849b00dbd98b109cf7a22298d27b69	2025-06-04T10:11:26+02:00	Xuan-Son Nguyen	llama-graph : use ggml_repeat_4d (#13998)
M	src/llama-graph.cpp

commit	0b4be4c435849b00dbd98b109cf7a22298d27b69	e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a	2025-06-04T08:57:05+02:00	Johannes Gäßler	CUDA: fix FTZ in FA for Gemma 3 (#13991)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh

commit	e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a	7e00e60ef86645a01fda738fef85b74afa016a34	2025-06-04T09:50:32+03:00	Georgi Gerganov	kv-cache : fix unified::seq_rm to work with seq_id < 0 (#13985)
M	src/llama-kv-cache-unified.cpp

commit	7e00e60ef86645a01fda738fef85b74afa016a34	ea1431b0fa3a8108aac1e0a94a13ccc4a749963e	2025-06-03T13:30:22-05:00	Jeff Bolz	vulkan: fix warnings in perf logger querypool code (#13937)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	ea1431b0fa3a8108aac1e0a94a13ccc4a749963e	71e74a3ac929b8af91f16f73f3c2b9b2f796d207	2025-06-03T13:09:36+02:00	Xuan-Son Nguyen	docs : add "Quick start" section for new users (#13862)
M	README.md
M	docs/build.md
M	docs/install.md

commit	71e74a3ac929b8af91f16f73f3c2b9b2f796d207	bfb1e012a0b7658e8f00ed4333d059943ea9d648	2025-06-02T16:54:58-07:00	lhez	opencl: add `backend_synchronize` (#13939)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	bfb1e012a0b7658e8f00ed4333d059943ea9d648	363757628848a27a435bbf22ff9476e9aeda5f40	2025-06-02T23:53:36Z	rmatif	OpenCL: Add concat, tsembd, upscale, tanh, pad and repeat (#13840)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/concat.cl
A	ggml/src/ggml-opencl/kernels/pad.cl
A	ggml/src/ggml-opencl/kernels/repeat.cl
A	ggml/src/ggml-opencl/kernels/tanh.cl
A	ggml/src/ggml-opencl/kernels/tsembd.cl
A	ggml/src/ggml-opencl/kernels/upscale.cl

commit	363757628848a27a435bbf22ff9476e9aeda5f40	ea394d7ab1f8101716d48ce9421c94c71b93a00f	2025-06-02T21:34:40+03:00	Georgi Gerganov	server : disable speculative decoding for SWA models (#13970)
M	tools/server/server.cpp

commit	ea394d7ab1f8101716d48ce9421c94c71b93a00f	5582c49c3961269eca96822abfb87528e942dd07	2025-06-02T21:33:40+03:00	Georgi Gerganov	metal : use F32 accumulators in FA kernels (#13975)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	5582c49c3961269eca96822abfb87528e942dd07	c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19	2025-06-02T20:54:26+03:00	Georgi Gerganov	gemma : more consistent attention scaling for v2 and v3 (#13951)
M	src/llama-model.cpp

commit	c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19	bfd322796cd838f906535ff3352624fc46338894	2025-06-02T10:15:44-07:00	Olivier Chafik	`server`: update deepseek reasoning format (pass reasoning_content as diffs) (#13933)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.h
M	common/common.h
M	tests/test-chat.cpp
M	tools/server/server.cpp
M	tools/server/tests/unit/test_tool_call.py
M	tools/server/tests/utils.py

commit	bfd322796cd838f906535ff3352624fc46338894	093e3f1feb16e25e58f7d61e01266c830dd424b8	2025-06-02T16:29:28+02:00	Xuan-Son Nguyen	mtmd : fix memory leak in mtmd_helper_eval_chunk_single (#13961)
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp

commit	093e3f1feb16e25e58f7d61e01266c830dd424b8	663445b0deb21fb602176da030d4154197a4fca6	2025-06-02T17:48:36+05:30	shalinib-ibm	cmake : Handle mixed-case 'Power' strings in POWER CPU detection (#13966)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	663445b0deb21fb602176da030d4154197a4fca6	7675c555a13c9f473249e59a54db35032ce8e0fc	2025-06-02T10:12:20+01:00	Atharva Dubey	sycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	7675c555a13c9f473249e59a54db35032ce8e0fc	5e1c3aed4074480f63e914d6c44c93536ed1452a	2025-06-01T18:08:05+02:00	Johannes Gäßler	gguf: fix failure on version == 0 (#13956)
M	ggml/src/gguf.cpp
M	tests/test-gguf.cpp

commit	5e1c3aed4074480f63e914d6c44c93536ed1452a	c496fe0b1da28618dd17bda8b0a6bf5004554080	2025-06-01T18:07:21+02:00	Sigbjørn Skjæret	convert : fix nomic-bert-moe mask token (#13757)
M	convert_hf_to_gguf.py
M	src/llama-vocab.cpp

commit	c496fe0b1da28618dd17bda8b0a6bf5004554080	e57bb87cede38341963a7a884630dbfb09c7dc00	2025-06-01T17:23:11+02:00	Sigbjørn Skjæret	convert : fix vocab padding code for bert models (#13954)
M	convert_hf_to_gguf.py

commit	e57bb87cede38341963a7a884630dbfb09c7dc00	f3a4b1659ccc94ebdf3590d472b518377bfecc7a	2025-06-01T22:53:57+08:00	Aaron Teo	ggml: check if non-native endian model is being loaded (#13943)
M	ggml/src/gguf.cpp

commit	f3a4b1659ccc94ebdf3590d472b518377bfecc7a	108009f5c7267b77292c11f788f602d6d7ae8fcd	2025-06-01T12:23:14+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	108009f5c7267b77292c11f788f602d6d7ae8fcd	d337252acf14a91a685c355fa4f3f599a8068207	2025-05-31T12:49:55+02:00	Kai Pastor	vulkan : Remove unexpected ; (ggml/1253)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	d337252acf14a91a685c355fa4f3f599a8068207	af6f91db470da543dc32bc00c057aad8f060dfdb	2025-05-31T12:39:19+02:00	Kai Pastor	cmake : Fix broken CMake error messages (ggml/1252)
M	ggml/src/ggml-blas/CMakeLists.txt
M	ggml/src/ggml-sycl/CMakeLists.txt

commit	af6f91db470da543dc32bc00c057aad8f060dfdb	a7b8d35f780ab3e7639ae5345442fb1ad10f0163	2025-05-30T09:11:09+03:00	Radoslav Gerganov	ggml : remove ggml_graph_import and ggml_graph_export declarations (ggml/1247)
M	ggml/include/ggml.h

commit	a7b8d35f780ab3e7639ae5345442fb1ad10f0163	6eba72b71c677ce9aae33c422a6e67008137987a	2025-05-29T13:29:50+03:00	Georgi Gerganov	sync : whisper.cpp (ggml/1250)
M	ggml/src/ggml.c

commit	6eba72b71c677ce9aae33c422a6e67008137987a	fedf034a98378059274e4243d2a370a243335e73	2025-05-29T08:34:46+03:00	Radoslav Gerganov	ggml : install dynamic backends (ggml/1240)
M	ggml/src/CMakeLists.txt

commit	fedf034a98378059274e4243d2a370a243335e73	8726392d3d927fe3e504868d3548d694496ee37e	2025-05-27T20:58:46-04:00	Daniel Tang	ggml : Print backtrace on uncaught C++ exceptions (ggml/1232)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c
A	ggml/src/ggml.cpp

commit	8726392d3d927fe3e504868d3548d694496ee37e	c04621711a893cbd09cff6c927cb005bc6749e36	2025-06-01T03:44:30-05:00	ddh0	readme : update bindings (#13950)
M	README.md

commit	c04621711a893cbd09cff6c927cb005bc6749e36	0fc16b42e8793364918e830c234c1f3caec29dae	2025-06-01T11:42:16+03:00	Georgi Gerganov	parallel : fix n_junk == 0 (#13952)
M	examples/parallel/parallel.cpp

commit	0fc16b42e8793364918e830c234c1f3caec29dae	053b1539c02617eff744f89525ee57497c3c1fbe	2025-06-01T11:39:27+03:00	Georgi Gerganov	kv-cache : split implementation in separate sources (#13920)
M	src/CMakeLists.txt
M	src/llama-graph.cpp
A	src/llama-kv-cache-recurrent.cpp
A	src/llama-kv-cache-recurrent.h
A	src/llama-kv-cache-unified-iswa.cpp
A	src/llama-kv-cache-unified-iswa.h
A	src/llama-kv-cache-unified.cpp
A	src/llama-kv-cache-unified.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-model.cpp

commit	053b1539c02617eff744f89525ee57497c3c1fbe	b3a89c3d9e34c28c5be70d8b687a84775746d4a0	2025-05-31T15:39:19-07:00	Max Krasnyansky	threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995)
M	common/arg.cpp
M	common/common.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	tools/llama-bench/llama-bench.cpp

commit	b3a89c3d9e34c28c5be70d8b687a84775746d4a0	e15898d1c7e87f1b3d14e0a3c385eeb424b085fe	2025-05-31T18:58:35+02:00	Jiří Podivín	docs : Note about necessity of having libcurl installed for standard build. (#13945)
M	docs/build.md

commit	e15898d1c7e87f1b3d14e0a3c385eeb424b085fe	803f8baf4f741d2f0465c46c33f285886b97a071	2025-05-31T08:26:10-07:00	Olivier Chafik	server: allow unclosed thinking tags (#13931)
M	common/chat-parser.cpp
M	tests/test-chat.cpp

commit	803f8baf4f741d2f0465c46c33f285886b97a071	3600cc2886956fc0a07ef6ad2f4128ccfdbc8c6f	2025-05-31T15:58:33+03:00	Georgi Gerganov	llama : deprecate explicit kv_self defrag/update calls (#13921)
M	examples/passkey/passkey.cpp
M	include/llama.h
M	src/llama-context.cpp

commit	3600cc2886956fc0a07ef6ad2f4128ccfdbc8c6f	c7e0a2054b908c28bf93bb18d4b63ccbff2c4127	2025-05-31T15:57:44+03:00	Georgi Gerganov	llama : use n_swa + n_ubatch cells for SWA cache (#13833)
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-model.cpp
M	tools/server/server.cpp

commit	c7e0a2054b908c28bf93bb18d4b63ccbff2c4127	3f55f781f1da9241f209648636fa0426fe62a495	2025-05-31T12:56:08+03:00	igardev	webui : Replace alert and confirm with custom modals. (#13711)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/App.tsx
A	tools/server/webui/src/components/ModalProvider.tsx
M	tools/server/webui/src/components/SettingDialog.tsx
M	tools/server/webui/src/components/Sidebar.tsx

commit	3f55f781f1da9241f209648636fa0426fe62a495	51fa76f172957c9916e43aeb581f82c533e12394	2025-05-31T12:55:57+03:00	Georgi Gerganov	llama : auto-batch preparation (#13845)
M	examples/parallel/parallel.cpp
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-kv-cache.cpp
M	tools/server/server.cpp

commit	51fa76f172957c9916e43aeb581f82c533e12394	12d0188c0dc6146ffde6d277a93f232ccbe699f8	2025-05-31T10:14:29+02:00	Xuan-Son Nguyen	mtmd : drop `_shared` from `libmtmd` name, merge helpers into libmtmd (⚠️ breaking change) (#13917)
M	tools/mtmd/CMakeLists.txt
M	tools/mtmd/mtmd.h
M	tools/server/CMakeLists.txt

commit	12d0188c0dc6146ffde6d277a93f232ccbe699f8	eb3949938e82a128855bc0676220bb2ce6e4228d	2025-05-31T10:24:04+03:00	Georgi Gerganov	kv-cache : refactor + add llama_memory_state_i (#13746)
M	examples/parallel/parallel.cpp
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-kv-cells.h
M	src/llama-memory.h
M	src/llama-model.cpp
M	tools/server/server.cpp

commit	eb3949938e82a128855bc0676220bb2ce6e4228d	e562eece7cb476276bfc4cbb18deb7c0369b2233	2025-05-31T14:48:04+08:00	Shawn yang	CUDA: add a prop in ggml_cuda_device_infor for distinguish iGPU or dGPU in cuda (#13856) (#13895)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	e562eece7cb476276bfc4cbb18deb7c0369b2233	b47ab7b8e9c4f6154eb6abb6234866ab117d64c7	2025-05-30T21:22:03+02:00	Johannes Gäßler	CUDA: fix typo in FlashAttention code (#13926)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh

commit	b47ab7b8e9c4f6154eb6abb6234866ab117d64c7	dd665cc9d4b378626cde11ea0c4c91f514fdc994	2025-05-30T09:56:19-07:00	Diego Devesa	sched : avoid changing cur_copy when a graph is already allocated (#13922)
M	ggml/src/ggml-backend.cpp

commit	dd665cc9d4b378626cde11ea0c4c91f514fdc994	df0c0c7d02f951dc639d48fd536f79200460ac83	2025-05-30T19:38:07+03:00	Georgi Gerganov	parallel : increase the variability of the prompt lengths (#13927)
M	examples/parallel/README.md
M	examples/parallel/parallel.cpp

commit	df0c0c7d02f951dc639d48fd536f79200460ac83	b49a8ff96b769b8a4c36d89fb783ec0135be582b	2025-05-30T07:37:18-07:00	Diego Devesa	cuda : prevent using split buffers with 3d/4d matrices (#13919)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	b49a8ff96b769b8a4c36d89fb783ec0135be582b	53f925074de02c5304b00c14b4d6d8910c58667d	2025-05-30T19:40:57+05:30	Akarshan Biswas	SYCL: Add mrope kernel (#13755)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/rope.cpp

commit	53f925074de02c5304b00c14b4d6d8910c58667d	db38704f0133be7832123495fa8fc2601ea999d4	2025-05-30T16:25:45+03:00	Georgi Gerganov	sync : vendor (#13901)
M	.editorconfig
M	common/CMakeLists.txt
M	common/arg.cpp
M	common/chat-parser.h
M	common/chat.cpp
M	common/json-partial.cpp
M	common/json-partial.h
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
A	scripts/sync_vendor.py
M	tests/test-chat.cpp
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp
M	tools/mtmd/CMakeLists.txt
M	tools/mtmd/mtmd-helper.cpp
M	tools/run/run.cpp
M	tools/server/CMakeLists.txt
M	tools/server/server.cpp
M	tools/server/utils.hpp
M	tools/tts/tts.cpp
R099	tools/server/httplib.h	vendor/cpp-httplib/httplib.h
R100	tools/mtmd/vendor/miniaudio.h	vendor/miniaudio/miniaudio.h
R099	common/minja/chat-template.hpp	vendor/minja/chat-template.hpp
R099	common/minja/minja.hpp	vendor/minja/minja.hpp
R094	common/json.hpp	vendor/nlohmann/json.hpp
A	vendor/nlohmann/json_fwd.hpp
R100	tools/mtmd/vendor/stb_image.h	vendor/stb/stb_image.h

commit	db38704f0133be7832123495fa8fc2601ea999d4	07e4351ce663a7802b31f92fd7bc0e555c2044b6	2025-05-30T14:50:43+02:00	Sigbjørn Skjæret	convert : fix rwkv bos/eos token (#13844)
M	convert_hf_to_gguf.py

commit	07e4351ce663a7802b31f92fd7bc0e555c2044b6	291f2b6913c7ef8350dbf0e77da38f7af131a08e	2025-05-30T12:24:37+02:00	Xuan-Son Nguyen	convert : allow partial update to the chkhsh pre-tokenizer list (#13847)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	models/ggml-vocab-bert-bge.gguf.inp
M	models/ggml-vocab-bert-bge.gguf.out
D	models/ggml-vocab-chameleon.gguf.inp
D	models/ggml-vocab-chameleon.gguf.out
M	models/ggml-vocab-command-r.gguf.inp
M	models/ggml-vocab-command-r.gguf.out
M	models/ggml-vocab-deepseek-coder.gguf.inp
M	models/ggml-vocab-deepseek-coder.gguf.out
M	models/ggml-vocab-deepseek-llm.gguf.inp
M	models/ggml-vocab-deepseek-llm.gguf.out
D	models/ggml-vocab-deepseek-r1-qwen.gguf.inp
D	models/ggml-vocab-deepseek-r1-qwen.gguf.out
M	models/ggml-vocab-falcon.gguf.inp
M	models/ggml-vocab-falcon.gguf.out
M	models/ggml-vocab-gpt-2.gguf.inp
M	models/ggml-vocab-gpt-2.gguf.out
D	models/ggml-vocab-gpt-4o.gguf.inp
D	models/ggml-vocab-gpt-4o.gguf.out
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	models/ggml-vocab-llama-spm.gguf.inp
M	models/ggml-vocab-llama-spm.gguf.out
D	models/ggml-vocab-llama4.gguf.inp
D	models/ggml-vocab-llama4.gguf.out
M	models/ggml-vocab-mpt.gguf.inp
M	models/ggml-vocab-mpt.gguf.out
D	models/ggml-vocab-nomic-bert-moe.gguf.inp
D	models/ggml-vocab-nomic-bert-moe.gguf.out
M	models/ggml-vocab-phi-3.gguf.inp
M	models/ggml-vocab-phi-3.gguf.out
D	models/ggml-vocab-pixtral.gguf.inp
D	models/ggml-vocab-pixtral.gguf.out
M	models/ggml-vocab-qwen2.gguf.inp
M	models/ggml-vocab-qwen2.gguf.out
M	models/ggml-vocab-refact.gguf.inp
M	models/ggml-vocab-refact.gguf.out
D	models/ggml-vocab-roberta-bpe.gguf.inp
D	models/ggml-vocab-roberta-bpe.gguf.out
M	models/ggml-vocab-starcoder.gguf.inp
M	models/ggml-vocab-starcoder.gguf.out
M	tests/CMakeLists.txt

commit	291f2b6913c7ef8350dbf0e77da38f7af131a08e	2c90da4c7ec694797f524042aaafbb047a7e65ff	2025-05-30T18:56:02+09:00	Đinh Trọng Huy	llama : add support for DistilBert (#13907)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-model.cpp

commit	2c90da4c7ec694797f524042aaafbb047a7e65ff	ec9e0301fef6476df83e94842c3b625501c95566	2025-05-30T16:31:48+08:00	zhangkaihuo	llama : use llm_build_granite for minicpm (#13911)
M	src/llama-model.cpp

commit	ec9e0301fef6476df83e94842c3b625501c95566	e83ba3e460651b20a594e9f2f0f0bffb998d3ce1	2025-05-30T01:28:54+02:00	Christian Kastner	cmake: Guard GGML_CPU_ALL_VARIANTS by architecture (#13890)
M	ggml/src/CMakeLists.txt

commit	e83ba3e460651b20a594e9f2f0f0bffb998d3ce1	2b131621e60d8ec2cc961201beb6773ab37b6b69	2025-05-29T21:42:31+02:00	Sigbjørn Skjæret	llama : add support for jina-reranker-v2 (#13900)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-model.cpp

commit	2b131621e60d8ec2cc961201beb6773ab37b6b69	54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c	2025-05-29T15:36:05+02:00	Sigbjørn Skjæret	gguf-py : add support for sub_type (in arrays) in GGUFWriter add_key_value method (#13561)
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/scripts/gguf_editor_gui.py
M	gguf-py/gguf/scripts/gguf_new_metadata.py
M	gguf-py/pyproject.toml
M	requirements/requirements-gguf_editor_gui.txt

commit	54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c	21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7	2025-05-29T19:39:20+08:00	Yibo Cai	arm64: optimize q4_k_q8_k kernel with i8mm (#13886)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7	dd8ba93416f492c168f7e20f0b1434c08ebeaeb5	2025-05-29T12:50:25+02:00	Christian Kastner	cmake: Factor out CPU architecture detection (#13883)
M	ggml/cmake/common.cmake
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	dd8ba93416f492c168f7e20f0b1434c08ebeaeb5	66c92061f5c34d2f9a630b7b50cca5ce3ebb4b16	2025-05-29T14:48:43+05:30	Vineel Abhinav	ggml: aarch64: Implement SVE F32 kernels for Mamba Sequential Scan Algorithm (#13882)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.h

commit	66c92061f5c34d2f9a630b7b50cca5ce3ebb4b16	5ca82fc1d7f8cb27f3cbb3019e944a80d5219828	2025-05-29T12:17:16+03:00	Georgi Gerganov	tests : remove json.hpp from a test (#13880)
M	tests/test-chat-parser.cpp

commit	5ca82fc1d7f8cb27f3cbb3019e944a80d5219828	6385b843a8dc8e15b8362196039720c58dd79fa2	2025-05-29T10:00:57+02:00	Sigbjørn Skjæret	convert : workaround for AutoConfig dummy labels (#13881)
M	convert_hf_to_gguf.py

commit	6385b843a8dc8e15b8362196039720c58dd79fa2	1b8fb8152d0f3357a9c1d9b4c02f6cc5b9cb7232	2025-05-29T08:15:01+02:00	Sigbjørn Skjæret	llama : add RobertaForSequenceClassification reranker support (#13875)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	1b8fb8152d0f3357a9c1d9b4c02f6cc5b9cb7232	53ae30640e131082d8d19bd80485b47c4553d551	2025-05-29T11:31:33+05:30	Vineel Abhinav	ggml: aarch64: Implement SVE F32 kernels for vector functions (#13843)
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cpu/vec.h

commit	53ae30640e131082d8d19bd80485b47c4553d551	763d06edb7dd5094ea58bad1d81e2e8d35033e34	2025-05-28T14:50:20-07:00	Beinsezii	gguf-py : fix SafetensorRemote return on undefined size (< 0) (#13841)
M	gguf-py/gguf/utility.py

commit	763d06edb7dd5094ea58bad1d81e2e8d35033e34	10961339b26bd2eff01d5479e8879f435da261b7	2025-05-28T22:35:31+02:00	Xuan-Son Nguyen	llama : fix KV shift for qwen2vl (#13870)
M	src/llama-graph.cpp
M	src/llama-kv-cache.cpp

commit	10961339b26bd2eff01d5479e8879f435da261b7	d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef	2025-05-28T22:35:22+02:00	Xuan-Son Nguyen	mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866)
M	.editorconfig
M	tools/mtmd/CMakeLists.txt
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd-audio.cpp
M	tools/mtmd/mtmd-audio.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp
A	tools/mtmd/mtmd-helper.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
R100	tools/mtmd/miniaudio.h	tools/mtmd/vendor/miniaudio.h
R100	common/stb_image.h	tools/mtmd/vendor/stb_image.h
M	tools/server/CMakeLists.txt
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef	e0e3aa231d899720c2864d09cdb89d4c400eeb55	2025-05-28T15:46:47-03:00	bandoti	ci: disable LLAMA_CURL for Linux cross-builds (#13871)
M	.github/workflows/build-linux-cross.yml

commit	e0e3aa231d899720c2864d09cdb89d4c400eeb55	aa6dff05be25709bb218bf648951d690029c4b19	2025-05-29T02:01:58+09:00	Đinh Trọng Huy	llama : add support for BertForSequenceClassification reranker (#13858)
M	common/common.cpp
M	convert_hf_to_gguf.py
M	src/llama-graph.cpp
M	tools/server/utils.hpp

commit	aa6dff05be25709bb218bf648951d690029c4b19	c962ae3382a1e759c8517a229549ee53685313a1	2025-05-28T23:34:18+09:00	Đinh Trọng Huy	convert: small addition to support LlamaModel (#13838)
M	convert_hf_to_gguf.py

commit	c962ae3382a1e759c8517a229549ee53685313a1	a3938fb53d0b5183db4f5a6db21fd9122a0e4780	2025-05-28T22:33:54+08:00	Sky	server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
M	tools/server/utils.hpp

commit	a3938fb53d0b5183db4f5a6db21fd9122a0e4780	f7873fc698c09047e2873630ab7e7730a0bfb224	2025-05-28T16:12:35+02:00	Xuan-Son Nguyen	convert : fix qwen omni conversion (#13859)
M	convert_hf_to_gguf.py

commit	f7873fc698c09047e2873630ab7e7730a0bfb224	a68247439bd6fb756cc93ad2817e55a02aa0b100	2025-05-28T14:49:28+01:00	Alex Fanthome	tests : change umlaut test (#11600)
M	convert_hf_to_gguf_update.py

commit	a68247439bd6fb756cc93ad2817e55a02aa0b100	26b79b6cb3e7840ff15729350e95907e19f9f480	2025-05-28T13:33:37+02:00	Johannes Gäßler	CUDA: fix FA tg at long context for CC >= 8.9 (#13852)
M	ggml/src/ggml-cuda/fattn-common.cuh

commit	26b79b6cb3e7840ff15729350e95907e19f9f480	1e8659e65ad0f640674d2785d02b556ab938728c	2025-05-28T10:05:54+02:00	Xuan-Son Nguyen	convert : fix tensor naming conflict for llama 4 vision (#13836)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py

commit	1e8659e65ad0f640674d2785d02b556ab938728c	a3c30846e410c91c11d7bf80978795a03bb03dee	2025-05-28T11:54:20+08:00	leo-pony	CANN: Add SOC TYPE printing in cmake configuration (#13837)
M	ggml/src/ggml-cann/CMakeLists.txt

commit	a3c30846e410c91c11d7bf80978795a03bb03dee	1701d4c54f93c0d203bf92ea7202a94b037c2338	2025-05-27T12:56:08-07:00	lhez	opencl: add new ops - `argsort`, `div`, `sub`, `addrows`, `sigmoid`, `group_norm` (#13787)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/argsort.cl
A	ggml/src/ggml-opencl/kernels/div.cl
A	ggml/src/ggml-opencl/kernels/group_norm.cl
A	ggml/src/ggml-opencl/kernels/sigmoid.cl
A	ggml/src/ggml-opencl/kernels/sub.cl
A	ggml/src/ggml-opencl/kernels/sum_rows.cl

commit	1701d4c54f93c0d203bf92ea7202a94b037c2338	bef817638780dcbd8c0c80c97b7a4f8e92c8fe74	2025-05-27T12:53:14-07:00	lhez	opencl: mark `mul_mat` `f32f32` as supporting non-contiguous tensors (#13790)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	bef817638780dcbd8c0c80c97b7a4f8e92c8fe74	34b7c0439ed0f98575cc4689dfecd98991dee8be	2025-05-27T11:39:07-05:00	Jeff Bolz	vulkan: use timestamp queries for GGML_VULKAN_PERF (#13817)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	34b7c0439ed0f98575cc4689dfecd98991dee8be	f3101a8cc665f73217c752a10a7042889275cfbc	2025-05-27T19:08:44+03:00	Georgi Gerganov	cmake : add llama-cparams.cpp to build (#13832)
M	src/CMakeLists.txt

commit	f3101a8cc665f73217c752a10a7042889275cfbc	1c49c70d07ef87635daa5e8fdd0b5bfd88493dd3	2025-05-27T20:52:59+05:30	Akarshan Biswas	SYCL: add gelu_erf kernel (#13749)
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	1c49c70d07ef87635daa5e8fdd0b5bfd88493dd3	a8ea03d8ad9c984fe6cfafead183ab188f8cbeb0	2025-05-27T18:04:38+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a8ea03d8ad9c984fe6cfafead183ab188f8cbeb0	05f6ac6283a7859a03cd59405504262c85c4bf06	2025-05-27T15:53:55+02:00	Xuan-Son Nguyen	ggml : add ggml_repeat_4d (#13824)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	05f6ac6283a7859a03cd59405504262c85c4bf06	bc583e3c63c04a11d287c108ea9e6a515ead0423	2025-05-27T21:21:36+08:00	xctan	ggml : riscv: add xtheadvector support (#13720)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-impl.h

commit	bc583e3c63c04a11d287c108ea9e6a515ead0423	72b090da2c50e540143fd312a2f9aa5f151e6136	2025-05-27T14:06:10+02:00	Xuan-Son Nguyen	mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd.cpp
A	tools/mtmd/test-2.mp3
M	tools/mtmd/tests.sh

commit	72b090da2c50e540143fd312a2f9aa5f151e6136	7fe03e7446ed4388539d3bcc013ae4e851b8d1e2	2025-05-27T08:52:40-03:00	bandoti	docs: remove link for llama-cli function calling (#13810)
M	docs/function-calling.md

commit	7fe03e7446ed4388539d3bcc013ae4e851b8d1e2	952f3953c1b61cc70e79e536c42ddce6a5ea5ea7	2025-05-27T13:18:39+02:00	Christian Kastner	ggml-cpu: x86 feature detection is specific to x86 (#13811)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	952f3953c1b61cc70e79e536c42ddce6a5ea5ea7	81713121ee56755ba4a147d1a1e3fa248ec31a66	2025-05-27T04:05:18-07:00	Diego Devesa	ggml : allow CUDA graphs when using pipeline parallelism (#13814)
M	ggml/src/ggml-backend.cpp

commit	81713121ee56755ba4a147d1a1e3fa248ec31a66	f9cd68398baf2ba8af4725ca9ed00bef205e6706	2025-05-27T13:49:41+03:00	Georgi Gerganov	kv-cells : track min/max used cells and per-sequence positions (#13808)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-kv-cells.h

commit	f9cd68398baf2ba8af4725ca9ed00bef205e6706	4f81b33e324b1669b282eb81104e4a1131be7dce	2025-05-27T12:07:52+03:00	Georgi Gerganov	sampling : make sure samplers return at least 1 token (#13822)
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	4f81b33e324b1669b282eb81104e4a1131be7dce	cdf94a18023c92f41808ec874ba577d914674717	2025-05-27T09:40:59+03:00	Georgi Gerganov	llama : validate seq id batch input (#13809)
M	src/llama-context.cpp

commit	cdf94a18023c92f41808ec874ba577d914674717	a26c4cc11ec7c6574e3691e90ecdbd67deeea35b	2025-05-26T14:34:27-07:00	Olivier Chafik	server: --offline mode (#13804)
M	common/arg.cpp
M	common/common.h

commit	a26c4cc11ec7c6574e3691e90ecdbd67deeea35b	4265a87b59ebfc25f35adbf4db3b608995b0a78a	2025-05-26T22:24:01+03:00	Georgi Gerganov	scripts : add option to compare commits in Debug (#13806)
M	scripts/compare-commits.sh

commit	4265a87b59ebfc25f35adbf4db3b608995b0a78a	6f180b915c9ed9ec0c240b5dcd64644988fb5e82	2025-05-26T22:14:52+03:00	Georgi Gerganov	cuda : avoid cuGetErrorString (#13791)
M	ggml/src/ggml-cuda/common.cuh

commit	6f180b915c9ed9ec0c240b5dcd64644988fb5e82	03f582ae8fccecff225c30a2802461b44761e822	2025-05-26T21:10:36+05:30	Akarshan Biswas	SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/norm.cpp

commit	03f582ae8fccecff225c30a2802461b44761e822	88c125f2acce0e25e5fc8481ab0681415fc64a10	2025-05-26T08:03:57-07:00	Olivier Chafik	server: fix streaming crashes (#13786)
M	common/chat-parser.cpp
M	common/chat-parser.h
M	common/chat.cpp
M	common/chat.h
M	tests/test-chat.cpp
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	88c125f2acce0e25e5fc8481ab0681415fc64a10	d74e94c1b3ac02db01e47008e1f8d371029d81ac	2025-05-26T23:55:24+09:00	standby24x7	examples/training: Fix file name in README (#13803)
M	examples/training/README.md

commit	d74e94c1b3ac02db01e47008e1f8d371029d81ac	f13847cfb560d92492b480cca2c5d6aa9473cde3	2025-05-26T06:56:49-07:00	Olivier Chafik	`server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800)
M	common/chat.cpp
M	tests/test-chat.cpp
M	tools/server/tests/utils.py

commit	f13847cfb560d92492b480cca2c5d6aa9473cde3	79c137f77677b3c8ee3c60a7da033721b938399a	2025-05-26T06:16:37-07:00	Olivier Chafik	server: fix regression on streamed non-chat completion w/ stops (#13785)
M	common/chat.cpp
M	tools/server/tests/unit/test_completion.py

commit	79c137f77677b3c8ee3c60a7da033721b938399a	22229314fc46b2f741bb21b12cde71f6c6a60b52	2025-05-26T14:03:54+03:00	Georgi Gerganov	examples : allow extracting embeddings from decoder contexts (#13797)
M	examples/embedding/embedding.cpp
M	examples/retrieval/retrieval.cpp
M	src/llama-context.cpp
M	tools/server/server.cpp

commit	22229314fc46b2f741bb21b12cde71f6c6a60b52	9012eb9b454a82eaa4cd77ae904c0ea391e4db42	2025-05-26T12:57:50+03:00	Georgi Gerganov	llama : clarify deprecation message (#13794)
M	include/llama.h

commit	9012eb9b454a82eaa4cd77ae904c0ea391e4db42	fef693dc6b959a8e8ba11558fbeaad0b264dd457	2025-05-26T10:28:53+02:00	Romain Biessy	sycl: Add more debug prints (#13640)
M	ggml/src/ggml-sycl/binbcast.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/conv.cpp
M	ggml/src/ggml-sycl/cpy.cpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/gla.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/outprod.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/wkv.cpp

commit	fef693dc6b959a8e8ba11558fbeaad0b264dd457	2d38b6e4004fb1c341723e657fb1e71a4d3fb473	2025-05-25T23:02:07-05:00	Jeff Bolz	vulkan: mark IM2COL as supporting non-contig (#13783)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	2d38b6e4004fb1c341723e657fb1e71a4d3fb473	e121edc4324a640be11b7e567edd39b721b0f8e4	2025-05-26T10:20:18+08:00	Bizhao Shi	CANN: Add the basic supports of Flash Attention kernel (#13627)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/Doxyfile
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/acl_tensor.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	e121edc4324a640be11b7e567edd39b721b0f8e4	2f099b510f460374acd52742b494595e3e3442d3	2025-05-26T00:30:51+01:00	Olivier Chafik	`server`: add `--reasoning-budget 0` to disable thinking (incl. qwen3 w/ enable_thinking:false) (#13771)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.h
M	common/common.h
A	models/templates/Qwen-Qwen3-0.6B.jinja
M	models/templates/README.md
M	tests/test-chat.cpp
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/tests/unit/test_template.py
M	tools/server/tests/utils.py
M	tools/server/utils.hpp

commit	2f099b510f460374acd52742b494595e3e3442d3	aa50ba462f63759e1731227f20f5009cfc2a0f16	2025-05-25T19:02:18+02:00	Xuan-Son Nguyen	webui : bump max upload file size to 500MB (#13779)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/useChatExtraContext.tsx

commit	aa50ba462f63759e1731227f20f5009cfc2a0f16	de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac	2025-05-25T16:22:29+02:00	Sigbjørn Skjæret	tests : improve UGM tokenizer test coverage (#13773)
A	models/ggml-vocab-nomic-bert-moe.gguf
A	models/ggml-vocab-nomic-bert-moe.gguf.inp
A	models/ggml-vocab-nomic-bert-moe.gguf.out
M	tests/CMakeLists.txt

commit	de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac	c508256db2de2b032e19c8ed833f4683c827c9a1	2025-05-25T16:34:36+03:00	Georgi Gerganov	kv-cache : rework kv_cell (#13706)
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-cparams.cpp
M	src/llama-cparams.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
A	src/llama-kv-cells.h
M	src/llama-memory.h

commit	c508256db2de2b032e19c8ed833f4683c827c9a1	40aaa8a403df5dcfb515eb2fd7a817fd99779526	2025-05-25T13:35:53+01:00	Percy Piper	rpc : Fix build on OpenBSD (#13541)
M	common/common.cpp
M	tools/rpc/rpc-server.cpp

commit	40aaa8a403df5dcfb515eb2fd7a817fd99779526	a08c1d2845dc279d58d826ef3c3ecad97cbbcef7	2025-05-25T14:06:32+02:00	Xuan-Son Nguyen	mtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760)
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h

commit	a08c1d2845dc279d58d826ef3c3ecad97cbbcef7	d785f9c1fd1a1929c6d0e2a0b12cae5db867908b	2025-05-25T14:04:49+02:00	ddpasa	docs : add Moondream2 pre-quantized link (#13745)
M	docs/multimodal.md

commit	d785f9c1fd1a1929c6d0e2a0b12cae5db867908b	4032ca406632212b075e3c61c2a4476128321410	2025-05-25T10:45:49+01:00	Olivier Chafik	server: fix/test add_generation_prompt (#13770)
M	tools/server/tests/unit/test_template.py
M	tools/server/utils.hpp

commit	4032ca406632212b075e3c61c2a4476128321410	515fdbf7ed839dfe6a24aeb6225936609a7f6d6d	2025-05-25T10:29:43+02:00	Piotr Jasiukajtis	llama : add support for Qwen3 MoE tied word embeddings (#13768)
M	src/llama-model.cpp

commit	515fdbf7ed839dfe6a24aeb6225936609a7f6d6d	f5cd27b71da3ac375a04a41643d14fc779a8057b	2025-05-25T12:38:37+05:30	Akarshan Biswas	SYCL: revert "sycl: simplify bin_bcast_kernel (#13383)" (#13752)
M	ggml/src/ggml-sycl/binbcast.cpp

commit	f5cd27b71da3ac375a04a41643d14fc779a8057b	a2d02d5793fd9af7a7224773456501691b95fd02	2025-05-25T01:48:08+01:00	Olivier Chafik	`server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
M	common/CMakeLists.txt
A	common/chat-parser.cpp
A	common/chat-parser.h
M	common/chat.cpp
M	common/chat.h
M	common/common.h
A	common/json-partial.cpp
A	common/json-partial.h
M	common/sampling.cpp
M	docs/function-calling.md
A	models/templates/Qwen-QwQ-32B.jinja
M	models/templates/README.md
M	scripts/tool_bench.py
M	src/llama-grammar.cpp
M	tests/CMakeLists.txt
A	tests/test-chat-parser.cpp
M	tests/test-chat.cpp
A	tests/test-json-partial.cpp
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py
M	tools/server/tests/unit/test_tool_call.py
M	tools/server/tests/utils.py
M	tools/server/utils.hpp

commit	a2d02d5793fd9af7a7224773456501691b95fd02	17fc817b58942569c43aa63299cedde217b61f68	2025-05-24T15:55:16-07:00	Diego Devesa	releases : bundle llvm omp library in windows release (#13763)
M	.github/workflows/release.yml

commit	17fc817b58942569c43aa63299cedde217b61f68	2bd1b30f6979235ec67b95c183b9b77baa7ab9ce	2025-05-24T13:27:03-07:00	Diego Devesa	releases : enable openmp in windows cpu backend build (#13756)
M	.github/workflows/release.yml

commit	2bd1b30f6979235ec67b95c183b9b77baa7ab9ce	259469c4b57c1a32606353bcac52ba683424a990	2025-05-24T13:26:47-07:00	Diego Devesa	ggml-cpu : set openmp wait time if not set (#13758)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	259469c4b57c1a32606353bcac52ba683424a990	4c32832c59e97d96c19349fdc92763e8949fda83	2025-05-24T16:49:12+02:00	0cc4m	Move GLM4 f32 attention fix to the correct function (#13750)
M	src/llama-graph.cpp

commit	4c32832c59e97d96c19349fdc92763e8949fda83	c3a2624339187e89c4f65fd72a5fe7103968b5ad	2025-05-24T13:06:47+02:00	Xuan-Son Nguyen	ggml : add ggml_gelu_erf() CUDA kernel (#13719)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh

commit	c3a2624339187e89c4f65fd72a5fe7103968b5ad	ffd0eae60b7642e942c8245b89642527e36099e6	2025-05-24T12:29:09+02:00	Sigbjørn Skjæret	vocab : fix ugm tokenizer precision (#13743)
M	src/llama-vocab.cpp

commit	ffd0eae60b7642e942c8245b89642527e36099e6	b775345d788ac16260e7eef49e11fe57ee5677f7	2025-05-24T11:46:19+02:00	Johannes Gäßler	CUDA: fix race condition in FA vector kernels (#13742)
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	b775345d788ac16260e7eef49e11fe57ee5677f7	a70a8a69c2ad3de8d5525ad2b185b098011be2e8	2025-05-23T13:14:00-07:00	Diego Devesa	ci : enable winget package updates (#13734)
M	.github/workflows/winget.yml

commit	a70a8a69c2ad3de8d5525ad2b185b098011be2e8	d13d0f6135803822ec1cd7e3efb49360b88a1bdf	2025-05-23T13:09:38-07:00	Diego Devesa	ci : add winget package updater (#13732)
A	.github/workflows/winget.yml

commit	d13d0f6135803822ec1cd7e3efb49360b88a1bdf	8a2afb7520bbc8f9fa1bbe314d5f2807eb0116b2	2025-05-23T20:16:13+03:00	Georgi Gerganov	hparams : initialize arrays (#13728)
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	8a2afb7520bbc8f9fa1bbe314d5f2807eb0116b2	9ecf3e66a38f20e41d221f62f05b17f70d040839	2025-05-23T17:07:04+02:00	Xuan-Son Nguyen	llama : allow custom list of swa_layers (#13726)
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	9ecf3e66a38f20e41d221f62f05b17f70d040839	faaaff5f947064d13ef8b98659d81a1384c3e57b	2025-05-23T11:03:47+02:00	Xuan-Son Nguyen	server : support audio input (#13714)
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/server/public/index.html.gz
M	tools/server/server.cpp
M	tools/server/tests/unit/test_vision_api.py
M	tools/server/utils.hpp
M	tools/server/webui/src/components/ChatInputExtraContextItem.tsx
M	tools/server/webui/src/components/ChatScreen.tsx
M	tools/server/webui/src/components/useChatExtraContext.tsx
M	tools/server/webui/src/utils/misc.ts
M	tools/server/webui/src/utils/types.ts

commit	faaaff5f947064d13ef8b98659d81a1384c3e57b	e16c4731c7a6bfa8f61b5b39c77245a37e7fc232	2025-05-23T16:47:53+08:00	Chenguang Li	CANN: Support MUL_MAT_ID for q8_0 and q4_0 (#13705)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	e16c4731c7a6bfa8f61b5b39c77245a37e7fc232	1dcd01960c33f52afb782b3d850fc2149a08cc6b	2025-05-23T08:12:48+02:00	Xuan-Son Nguyen	ggml : fix the order of ggml_unary_op (#13718)
M	ggml/include/ggml.h

commit	1dcd01960c33f52afb782b3d850fc2149a08cc6b	c10ed6cbcc3904b7d6bbcd137589eebd899aa38f	2025-05-23T00:45:02-04:00	Jeff Bolz	vulkan: support CPY from any type to itself (#13695)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	c10ed6cbcc3904b7d6bbcd137589eebd899aa38f	a127ff17800452075bb323277e3b9f8db8612ced	2025-05-23T00:33:45-04:00	Jeff Bolz	vulkan: Disable coopmat/coopmat2/bfloat extensions if glslc doesn't support it (#13696)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	a127ff17800452075bb323277e3b9f8db8612ced	3079e9ac8e04ef6eddeb0c164d72edb6b6fd2df5	2025-05-23T12:33:08+08:00	Judd	use LOG_WARN to replace `std::cerr` (#13657)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	3079e9ac8e04ef6eddeb0c164d72edb6b6fd2df5	8a1d206f1d2b4e45918b589f3165b4be232f7ba8	2025-05-22T15:21:37-07:00	Diego Devesa	release : fix windows hip release (#13707)
M	.github/workflows/release.yml

commit	8a1d206f1d2b4e45918b589f3165b4be232f7ba8	797990c4bca0dca5be295c63e3fb2800dc0a69c2	2025-05-22T22:21:07+03:00	Georgi Gerganov	tts : fix n_ubatch + make WavTokenizer cache-less (#13713)
M	src/llama-model.cpp
M	tools/tts/tts.cpp

commit	797990c4bca0dca5be295c63e3fb2800dc0a69c2	ab86335760ebb441574eb47f886fa1ee302e2131	2025-05-22T20:42:48+02:00	Xuan-Son Nguyen	mtmd : add ultravox audio input (#13623)
M	.editorconfig
M	README.md
M	common/arg.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/CMakeLists.txt
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
A	tools/mtmd/miniaudio.h
A	tools/mtmd/mtmd-audio.cpp
A	tools/mtmd/mtmd-audio.h
M	tools/mtmd/mtmd-cli.cpp
M	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h
M	tools/server/utils.hpp

commit	ab86335760ebb441574eb47f886fa1ee302e2131	cc74d5be990e37f201591fd868a92e64abdbf902	2025-05-23T02:31:29+08:00	Aaron Teo	common: Include torch package for s390x (#13699)
M	requirements/requirements-convert_hf_to_gguf.txt
M	requirements/requirements-convert_hf_to_gguf_update.txt
M	requirements/requirements-convert_lora_to_gguf.txt

commit	cc74d5be990e37f201591fd868a92e64abdbf902	5be24af73d77ea23d399726f1d2a01a70ee86331	2025-05-22T16:33:39+03:00	Georgi Gerganov	server : pad small embedding batches (#13692)
M	tools/server/server.cpp

commit	5be24af73d77ea23d399726f1d2a01a70ee86331	d394a9aedc50a13b7f6373416f7c1ccabfe79c32	2025-05-22T14:25:05+02:00	Sigbjørn Skjæret	gguf-py : correct charsmap parameter typing (#13701)
M	gguf-py/gguf/gguf_writer.py

commit	d394a9aedc50a13b7f6373416f7c1ccabfe79c32	6b56a64690a318fcabcd7739ac7e314d44785ea8	2025-05-22T13:54:43+02:00	Nicolò Scipione	sycl : Remove waits from function calls (#13702)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	6b56a64690a318fcabcd7739ac7e314d44785ea8	a4e8912dfd4604be1e39bc86ba4c0b02969967ef	2025-05-22T09:24:09+01:00	Ewan Crawford	SYCL: Avoid using with SYCL-Graph for unsupported nodes (#13587)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a4e8912dfd4604be1e39bc86ba4c0b02969967ef	edbf42edfdabb9cea72ae12137570cf48f5d8076	2025-05-22T02:21:45+03:00	Henry Linjamäki	opencl: Add support for multiple devices (#12622)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	edbf42edfdabb9cea72ae12137570cf48f5d8076	d643bb2c798df9c2cd61067d2692b1cd417df402	2025-05-21T23:21:17+03:00	Henry Linjamäki	opencl: fix couple crashes (#12795)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	d643bb2c798df9c2cd61067d2692b1cd417df402	8e186ef0e764c7a620e402d1f76ebad60bf31c49	2025-05-21T13:09:57-07:00	Diego Devesa	releases : build CPU backend separately (windows) (#13642)
M	.github/workflows/release.yml

commit	8e186ef0e764c7a620e402d1f76ebad60bf31c49	5fbfe384d4659f81c47a477eb8ee97692c7ffef9	2025-05-21T20:00:49+03:00	Georgi Gerganov	hparams : support models for which all layers use SWA (#13682)
M	src/llama-hparams.cpp
M	src/llama-hparams.h

commit	5fbfe384d4659f81c47a477eb8ee97692c7ffef9	c76532e7ba128bb097bf6836bf0f5592e1b56b76	2025-05-21T19:46:56+03:00	Georgi Gerganov	server : improve error reporting (#13680)
M	tools/server/server.cpp

commit	c76532e7ba128bb097bf6836bf0f5592e1b56b76	2aa777d86d3f7bb80b93e226f1c25e47825f6a83	2025-05-21T19:40:35+03:00	antichristHater	convert : add qwen2vl support for unsloth merges (#13686)
M	convert_hf_to_gguf.py

commit	2aa777d86d3f7bb80b93e226f1c25e47825f6a83	eb0f5c28d37126baa756117d5bdaadc62e03344e	2025-05-21T16:57:38+02:00	Sigbjørn Skjæret	examples : switch retrieval to llama_encode (#13685)
M	common/arg.cpp
M	examples/retrieval/retrieval.cpp

commit	eb0f5c28d37126baa756117d5bdaadc62e03344e	cf4cb59e64d72a1b4c781f71a74de5756a4e2376	2025-05-21T17:33:54+03:00	Emmanuel Ferdman	gguf-py : display the invalid gguf type (#13687)
M	gguf-py/gguf/gguf_reader.py

commit	cf4cb59e64d72a1b4c781f71a74de5756a4e2376	0d5c74216170ef97e5e7511563837263f2d1a496	2025-05-21T16:26:33+02:00	Xuan-Son Nguyen	ggml : add ggml_gelu_erf() (#13667)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml.c

commit	0d5c74216170ef97e5e7511563837263f2d1a496	42158ae2e8ead667a83f07247321ce85f32ace66	2025-05-21T15:15:27+02:00	Robin Davidsson	server : Add the endpoints /api/tags and /api/chat (#13659)
M	tools/server/server.cpp

commit	42158ae2e8ead667a83f07247321ce85f32ace66	797f2ac0625b22edeff03cc30e0f988da6b6b068	2025-05-21T16:07:57+03:00	Dorin-Andrei Geman	server : fix first message identification (#13634)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_chat_completion.py

commit	797f2ac0625b22edeff03cc30e0f988da6b6b068	b44890df2e4fad0ece1d5366dcbc8bedae23b658	2025-05-21T15:11:13+03:00	Georgi Gerganov	kv-cache : simplify the interface (#13660)
M	examples/simple-chat/simple-chat.cpp
M	include/llama.h
M	src/llama-batch.cpp
M	src/llama-context.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-model.cpp
M	tools/run/run.cpp
M	tools/server/server.cpp

commit	b44890df2e4fad0ece1d5366dcbc8bedae23b658	33983057d0f578aca74ba15eccc3de9c267a5ff6	2025-05-21T13:09:21+03:00	Georgi Gerganov	model : disable SWA for Phi models (#13676)
M	src/llama-graph.cpp
M	src/llama-model.cpp

commit	33983057d0f578aca74ba15eccc3de9c267a5ff6	fb1cab201c6c4cd36731f100df74eece2f4706fa	2025-05-21T09:58:49+08:00	R0CKSTAR	musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647)
M	.devops/musa.Dockerfile
M	.github/workflows/build.yml
M	README.md
M	ci/README.md
M	docs/docker.md
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-musa/CMakeLists.txt
A	ggml/src/ggml-musa/mudnn.cu
A	ggml/src/ggml-musa/mudnn.cuh

commit	fb1cab201c6c4cd36731f100df74eece2f4706fa	b7a17463ec190aeee7b9077c606c910fb4688b84	2025-05-20T21:35:16Z	Eve	vulkan: fix warnings (#13626)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq1_m.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp

commit	b7a17463ec190aeee7b9077c606c910fb4688b84	be0239693c1530a18496086331fc18d8a9adbad1	2025-05-21T00:55:30+08:00	l3utterfly	mtmd-helper : bug fix to token batching in mtmd (#13650)
M	tools/mtmd/mtmd-helper.cpp

commit	be0239693c1530a18496086331fc18d8a9adbad1	a4090d1174aed22dde5cacce2a4c27656b987a2f	2025-05-20T19:21:04+03:00	Georgi Gerganov	model : fix llama4 graph (#13663)
M	src/llama-model.cpp

commit	a4090d1174aed22dde5cacce2a4c27656b987a2f	b69f1647f9953cb3773266d2c83a92fd0e7e6d66	2025-05-20T16:13:16+03:00	Georgi Gerganov	llama : remove llama_kv_cache_view API + remove deprecated (#13653)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/parallel/parallel.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h

commit	b69f1647f9953cb3773266d2c83a92fd0e7e6d66	759e37b0d89bc4bd1bce860dc5f3c3052e08575c	2025-05-20T14:45:07+02:00	Johannes Gäßler	CUDA: skip fully masked-out KV in FA vec kernel (#13584)
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	759e37b0d89bc4bd1bce860dc5f3c3052e08575c	4245e622e0cc3af1ca3056104e465dc4d303bd7d	2025-05-20T12:03:17+02:00	Sigbjørn Skjæret	tests : avoid github urls due to throttling (#13654)
M	tests/test-arg-parser.cpp

commit	4245e622e0cc3af1ca3056104e465dc4d303bd7d	c9c64dee572c5eedf073a6c6eb5d92d8283f7639	2025-05-20T10:34:15+01:00	Svetlozar Georgiev	sycl: disable reorder for sycl mulmat (#13536)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	c9c64dee572c5eedf073a6c6eb5d92d8283f7639	c00a2634bec49805c6b31438b1a6006a2bd793cb	2025-05-20T10:11:56+02:00	0cc4m	Set GLM4 blk.*.attn_output.weight, kqv_out-* matmul to GGML_PREC_F32 to fix infinity values in output (#13639)
M	src/llama-graph.cpp

commit	c00a2634bec49805c6b31438b1a6006a2bd793cb	e298d2fbd082a52c0f6ed02729f94e9bf630cf17	2025-05-20T10:41:40+03:00	Georgi Gerganov	metal : fix typo in FA kernel comments (#13651)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	e298d2fbd082a52c0f6ed02729f94e9bf630cf17	f0adb80bf7c2c0d80abb04f4533b5513622d9964	2025-05-20T08:05:46+03:00	Georgi Gerganov	kv-cache : add SWA support (#13194)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory.h
M	src/llama-model.cpp
M	src/llama-model.h
M	tools/llama-bench/llama-bench.cpp
M	tools/server/server.cpp

commit	f0adb80bf7c2c0d80abb04f4533b5513622d9964	f7c9429c85748cde9599499601ba48d0057722e6	2025-05-20T11:43:43+08:00	Xinpeng Dou	CANN: Update CANN model support (#13162)
M	docs/backend/CANN.md

commit	f7c9429c85748cde9599499601ba48d0057722e6	1dfbf2cf3a9f15193dd893396d07762bbd2c4785	2025-05-20T02:54:43+02:00	Nicolò Scipione	sycl : Overcoming workaround for mmap() allocation on Windows (#13482)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	tools/llama-bench/README.md

commit	1dfbf2cf3a9f15193dd893396d07762bbd2c4785	8960efd0a65e5a4830a14f6937c10703534f2569	2025-05-19T21:17:36+02:00	psocolovsky	common : add load_progress_callback (#13617)
M	common/common.cpp
M	common/common.h

commit	8960efd0a65e5a4830a14f6937c10703534f2569	725f23f1f3f0d3adf49f95d8dfa6e7c74adff149	2025-05-19T17:54:08+02:00	0cc4m	Vulkan: Add f32 accumulator support to quantized mul mat to fix GLM4 32B incoherence (#13607)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	725f23f1f3f0d3adf49f95d8dfa6e7c74adff149	92ecdcc06a4c405a415bcaa0cb772bc560aa23b1	2025-05-19T14:38:20+01:00	Alberto Cabrera Pérez	sycl : backend documentation review (#13544)
M	docs/backend/SYCL.md
M	docs/docker.md
M	examples/sycl/run-llama2.sh
A	examples/sycl/run-llama3.sh
M	examples/sycl/win-run-llama2.bat
A	examples/sycl/win-run-llama3.bat

commit	92ecdcc06a4c405a415bcaa0cb772bc560aa23b1	f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c	2025-05-19T13:04:14+02:00	Xuan-Son Nguyen	mtmd : add vision support for llama 4 (#13282)
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/tests.sh

commit	f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c	d30cb5a7fa17362c47e94a023276f169916e0d03	2025-05-19T11:46:09+01:00	Alberto Cabrera Pérez	ci : upgraded oneAPI version in SYCL workflows and dockerfile (#13532)
M	.devops/intel.Dockerfile
M	.github/workflows/build.yml
M	.github/workflows/release.yml

commit	d30cb5a7fa17362c47e94a023276f169916e0d03	6c35981a643d4f74a286268b62f65bfa156af2e6	2025-05-19T12:50:29+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	6c35981a643d4f74a286268b62f65bfa156af2e6	8b5e19aea6ce9fe4452598663924373234041440	2025-05-19T09:33:35+02:00	Johannes Gäßler	mnist: fix segmentation fault (ggml/1227)
M	ggml/include/ggml-opt.h
M	ggml/src/ggml-opt.cpp

commit	8b5e19aea6ce9fe4452598663924373234041440	60aea028b575ab54e0dfbb31db641bb93d2ae8c4	2025-05-18T18:30:13-07:00	Diego Devesa	ggml : fix apple OS check in ggml_print_backtrace (ggml/1229)
M	ggml/src/ggml.c

commit	60aea028b575ab54e0dfbb31db641bb93d2ae8c4	9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1	2025-05-17T19:06:26-04:00	Daniel Tang	ggml : Fix missing backtrace on Linux (ggml/1228)
M	ggml/src/ggml.c

commit	9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1	33d7aed4a83e7bbecac4af535208d4ed3e1ca8fd	2025-05-19T18:25:41+08:00	Nick	fix: check model pointer validity before use (#13631)
M	examples/simple/simple.cpp

commit	33d7aed4a83e7bbecac4af535208d4ed3e1ca8fd	6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c	2025-05-19T14:21:17+08:00	Chenguang Li	CANN: Support MOE Model MUL_MAT_ID (#13042)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c	e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9	2025-05-17T17:59:48-04:00	Isaac McFadyen	server : added --no-prefill-assistant flag (#13608)
M	common/arg.cpp
M	common/common.h
M	tools/server/README.md
M	tools/server/server.cpp
M	tools/server/utils.hpp

commit	e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9	518329b2d4434d0683c30b741b4f4cf5734b5f99	2025-05-17T21:26:43+03:00	Gilad S.	cmake: use the current build config for vulkan-shaders-gen (#13595)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	518329b2d4434d0683c30b741b4f4cf5734b5f99	2f5a4e1e09567e09be8b84a5f976334de9539d17	2025-05-17T12:58:55+03:00	Georgi Gerganov	parallel : add option for non-shared and larger prompts (#13598)
M	common/arg.cpp
M	examples/parallel/README.md
M	examples/parallel/parallel.cpp

commit	2f5a4e1e09567e09be8b84a5f976334de9539d17	4f41ee11d6a4ddb02e4644922bf0b56880ee6f55	2025-05-17T16:14:55+09:00	Jeff Bolz	vulkan: move common FA code to flash_attn_base.comp (#13556)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	4f41ee11d6a4ddb02e4644922bf0b56880ee6f55	3e0be1cacef290c99cbb99ceaa433b4344f87355	2025-05-17T15:35:47+09:00	Jeff Bolz	vulkan: use scalar FA rather than coopmat2 when N==1 (#13554)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	3e0be1cacef290c99cbb99ceaa433b4344f87355	6aa892ec2aa7fe0c93e87c4b970d83a942fb9454	2025-05-16T14:56:28-06:00	Z	llguidance : official v0.7.20 release (no actual changes) [noci] (#13594)
M	common/CMakeLists.txt

commit	6aa892ec2aa7fe0c93e87c4b970d83a942fb9454	aea9f8b4e73876739bf88fb705502f291294e469	2025-05-16T21:50:00+02:00	Xuan-Son Nguyen	server : do not return error out of context (with ctx shift disabled) (#13577)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_ctx_shift.py

commit	aea9f8b4e73876739bf88fb705502f291294e469	06c1e4abc1e50ef6dcf6369f9685ca8fe82d21fe	2025-05-16T21:49:01+02:00	Xuan-Son Nguyen	webui : improve accessibility for visually impaired people (#13551)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/App.tsx
M	tools/server/webui/src/components/ChatInputExtraContextItem.tsx
M	tools/server/webui/src/components/ChatMessage.tsx
M	tools/server/webui/src/components/ChatScreen.tsx
M	tools/server/webui/src/components/Header.tsx
M	tools/server/webui/src/components/SettingDialog.tsx
M	tools/server/webui/src/components/Sidebar.tsx
M	tools/server/webui/src/index.scss
M	tools/server/webui/src/utils/common.tsx

commit	06c1e4abc1e50ef6dcf6369f9685ca8fe82d21fe	415e40a357002d5d9b7a97ef20ccea9f4ae04c80	2025-05-16T20:04:18+02:00	Xuan-Son Nguyen	readme : add list of dependencies and their license (#13591)
M	README.md

commit	415e40a357002d5d9b7a97ef20ccea9f4ae04c80	654a67794f7a420c6931de2f4c145eaaade5dd16	2025-05-16T10:36:51-07:00	Diego Devesa	releases : use arm version of curl for arm releases (#13592)
M	.github/actions/windows-setup-curl/action.yml
M	.github/workflows/release.yml

commit	654a67794f7a420c6931de2f4c145eaaade5dd16	5364ae4ba53cc6367b8c8bf78876839122ca4e57	2025-05-16T20:32:58+03:00	Georgi Gerganov	metal : add FA-vec kernel for head size 64 (#13583)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	5364ae4ba53cc6367b8c8bf78876839122ca4e57	7c07ac244d59c833bf209582f6df019a77cdda59	2025-05-16T07:38:07-07:00	Diego Devesa	llama : print hint when loading a model when no backends are loaded (#13589)
M	src/llama.cpp

commit	7c07ac244d59c833bf209582f6df019a77cdda59	0a338ed013c23aecdce6449af736a35a465fa60f	2025-05-16T14:54:23+02:00	Sigbjørn Skjæret	ci : add ppc64el to build-linux-cross (#13575)
M	.github/workflows/build-linux-cross.yml

commit	0a338ed013c23aecdce6449af736a35a465fa60f	bc098c3cf0aac93e57e9bda9d95e2456acf88894	2025-05-16T12:15:29+02:00	Łukasz Ślusarczyk	sycl : fixed compilation warnings (#13582)
M	ggml/src/ggml-sycl/element_wise.cpp

commit	bc098c3cf0aac93e57e9bda9d95e2456acf88894	c6a2c9e7411f54b0770b319740561bbd6a2ebd27	2025-05-15T23:29:10+01:00	Olivier Chafik	minja: sync (qwen3) (#13573)
M	common/minja/chat-template.hpp
M	common/minja/minja.hpp

commit	c6a2c9e7411f54b0770b319740561bbd6a2ebd27	07ad2b6db3c117868728e2cdfe3b711473d66e14	2025-05-15T10:13:11-07:00	Diego Devesa	gguf : use ggml log system (#13571)
M	ggml/src/gguf.cpp
M	src/llama-model-loader.cpp

commit	07ad2b6db3c117868728e2cdfe3b711473d66e14	c531edfa34fec8074d0b424396cdd450df23b612	2025-05-15T12:47:10-04:00	Daniel Tang	gguf-py : fix disconnect-before-connect in editor-gui (#13569)
M	gguf-py/gguf/scripts/gguf_editor_gui.py

commit	c531edfa34fec8074d0b424396cdd450df23b612	02cdd2d8b092b5a4bb18e013c6887ce49ba20ac5	2025-05-15T17:40:07+02:00	Xuan-Son Nguyen	convert : fix conversion for llama 4 (#13567)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py

commit	02cdd2d8b092b5a4bb18e013c6887ce49ba20ac5	64bb51cf90d3eede8c150a23d59a0c718b78065b	2025-05-15T16:39:52+01:00	Atharva Dubey	sycl: simplify bin_bcast_kernel (#13383)
M	ggml/src/ggml-sycl/binbcast.cpp

commit	64bb51cf90d3eede8c150a23d59a0c718b78065b	9c404ed54c3c8d8d2aa3153313766c8286739387	2025-05-15T16:35:44+01:00	Svetlozar Georgiev	sycl: reordered Q4_K MMVQ (#13109)
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/dequantize.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/quants.hpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	9c404ed54c3c8d8d2aa3153313766c8286739387	6c8b91500e75df6664278d1e9af3e39e8a2fb0d0	2025-05-15T16:53:41+02:00	Łukasz Ślusarczyk	sycl: use oneDNN for matrices multiplication (#12972)
M	docs/backend/SYCL.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	6c8b91500e75df6664278d1e9af3e39e8a2fb0d0	3cc1f1f1d24472a6558c942b1c78989ff4b0e569	2025-05-15T06:46:55-07:00	Diego Devesa	llama-bench : fix -ot with dl backends (#13563)
M	tools/llama-bench/llama-bench.cpp

commit	3cc1f1f1d24472a6558c942b1c78989ff4b0e569	c753d7bed0dc2cc2d5c42dfa9806cba91748392e	2025-05-15T14:24:50+02:00	Xuan-Son Nguyen	webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/src/Config.ts
M	tools/server/webui/src/components/ChatScreen.tsx
M	tools/server/webui/src/components/SettingDialog.tsx
M	tools/server/webui/src/components/useChatExtraContext.tsx
M	tools/server/webui/vite.config.ts

commit	c753d7bed0dc2cc2d5c42dfa9806cba91748392e	b2838049ccf50859cea4c390e81405c2fb01e820	2025-05-15T08:40:58+02:00	Piotr Wilkin (ilintar)	server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540)
M	tools/server/utils.hpp

commit	b2838049ccf50859cea4c390e81405c2fb01e820	aa48e373f256df9608395ee6881e7010840d6202	2025-05-15T05:57:02+03:00	Georgi Gerganov	bench : handle decode errors (#13548)
M	tools/llama-bench/llama-bench.cpp

commit	aa48e373f256df9608395ee6881e7010840d6202	e3a9421b78da5c810d812e6348a405f5acc39f34	2025-05-15T02:39:51+01:00	Olivier Chafik	`server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802)
M	common/chat.cpp
M	common/chat.h
M	tests/test-chat.cpp
A	tools/server/tests/unit/test_template.py
M	tools/server/tests/unit/test_tool_call.py

commit	e3a9421b78da5c810d812e6348a405f5acc39f34	5ab5d5fb256aa23f8ab4de8463515ea627f43006	2025-05-14T23:15:15+03:00	Georgi Gerganov	kv-cache : fix out-of-bounds view during reserve graph (#13547)
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h

commit	5ab5d5fb256aa23f8ab4de8463515ea627f43006	3198405e98530c683d12fd123e3920f2bd2aafa5	2025-05-15T03:53:52+08:00	Yibo Cai	arm64: optimize q6_k_q8_k kernel with i8mm (#13519)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	3198405e98530c683d12fd123e3920f2bd2aafa5	f5170c1d7a66222ca7c75d2022fec3ed87257e0b	2025-05-14T19:50:57+01:00	Olivier Chafik	`common`: add partial regex support (#12808)
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
A	common/regex-partial.cpp
A	common/regex-partial.h
M	tests/CMakeLists.txt
A	tests/test-regex-partial.cpp
M	tools/server/server.cpp

commit	f5170c1d7a66222ca7c75d2022fec3ed87257e0b	017f10b5fa630a013ec4f9936e410a60d4f460d5	2025-05-14T20:22:49+02:00	Sigbjørn Skjæret	editorconfig : fix trailing whitespace from #13542 (#13546)
M	src/llama-context.cpp

commit	017f10b5fa630a013ec4f9936e410a60d4f460d5	4696d5674999dc10a7fb8c27b33406a929f7463a	2025-05-14T19:18:18+03:00	Gilad S.	fix: crash when calling `llama_state_get_size` on a context without a KV cache (#13542)
M	src/llama-context.cpp

commit	4696d5674999dc10a7fb8c27b33406a929f7463a	b7d26720821823e23e2273a99e38398d511242e9	2025-05-14T16:41:02+02:00	Johannes Gäßler	CUDA: fix crash on large batch size for quant. MoE (#13537)
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/quantize.cu

commit	b7d26720821823e23e2273a99e38398d511242e9	6da34fa27620fa56e3334172e023f4f2533df51f	2025-05-14T07:12:36-07:00	Diego Devesa	llama : fix quantize with dl backends (#13539)
M	src/llama-model-loader.cpp

commit	6da34fa27620fa56e3334172e023f4f2533df51f	5e7d95e22e386d316f7f659b74c9c34b65507912	2025-05-14T16:08:20+02:00	Johannes Gäßler	CUDA: faster Deepseek FA, add Turing support (#13435)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	5e7d95e22e386d316f7f659b74c9c34b65507912	053174436f3b3cbb01077f26ff17809537b832c7	2025-05-14T06:53:59-06:00	Gabe Goodhart	fix: Move build_inp_pos to the top of the graph section for build_granite (#13538)
M	src/llama-model.cpp

commit	053174436f3b3cbb01077f26ff17809537b832c7	360a9c98e13d35f322b4c5b1309aab0cc90ed82b	2025-05-14T15:42:10+03:00	Georgi Gerganov	server : passthrough the /models endpoint during loading (#13535)
M	tools/server/README.md
M	tools/server/server.cpp

commit	360a9c98e13d35f322b4c5b1309aab0cc90ed82b	09d13d94fb169093095416ac6323551c37b75339	2025-05-14T13:35:07+02:00	Xuan-Son Nguyen	server : fix cache_tokens bug with no cache_prompt (#13533)
M	tools/server/server.cpp
M	tools/server/tests/unit/test_completion.py
M	tools/server/utils.hpp

commit	09d13d94fb169093095416ac6323551c37b75339	24e86cae7219b0f3ede1d5abdf5bf3ad515cccb8	2025-05-14T07:53:57-03:00	bandoti	cmake: simplify vulkan shader test logic (#13263)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	24e86cae7219b0f3ede1d5abdf5bf3ad515cccb8	bb1681fbd532eba26ae4c14cd8be884c8afeb31c	2025-05-14T18:55:26+09:00	Jeff Bolz	vulkan: KHR_coopmat flash attention (#13506)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	bb1681fbd532eba26ae4c14cd8be884c8afeb31c	d486dd3e8ecfba0170f8632a1530540de560f4a3	2025-05-14T10:26:12+02:00	Xuan-Son Nguyen	webui : use fflate for more deterministic gzip compress (#13525)
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/vite.config.ts

commit	d486dd3e8ecfba0170f8632a1530540de560f4a3	21ca987fba504d273ea28ebc4d3e5b3736a11c8e	2025-05-14T10:07:31+02:00	Luca Stefani	webui: Allow pasting file from clipboard (#13526)
M	tools/server/public/index.html.gz
M	tools/server/webui/package.json
M	tools/server/webui/src/components/ChatScreen.tsx

commit	21ca987fba504d273ea28ebc4d3e5b3736a11c8e	be1d4a13db26750fac702ceb3af88ae4f39dc9f4	2025-05-14T09:59:12+02:00	ddpasa	docs: Update link to ggml-org in multimodal.md (#13513)
M	docs/multimodal.md

commit	be1d4a13db26750fac702ceb3af88ae4f39dc9f4	ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2	2025-05-14T08:41:01+02:00	Sigbjørn Skjæret	scripts : fix compare-llama-bench.py show parameter (#13514)
M	scripts/compare-llama-bench.py

commit	ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2	e5c834f718a32b7584f142799bbf508fddb9021c	2025-05-14T13:15:50+09:00	Jeff Bolz	vulkan: workaround FA compile failures on macos (#13517)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp

commit	e5c834f718a32b7584f142799bbf508fddb9021c	71bdbdb58757d508557e6d8b387f666cdfb25c5e	2025-05-13T18:12:31+01:00	Ed Addario	quantize : improve tensor-type pattern matching (#13033)
M	src/llama-quant.cpp
M	tools/quantize/quantize.cpp

commit	71bdbdb58757d508557e6d8b387f666cdfb25c5e	f0995d28ce3d15095b6845d94ce4465e46575873	2025-05-13T17:07:21+02:00	Xuan-Son Nguyen	clip : clip.h become private API (⚠️ breaking change) (#13510)
M	tools/mtmd/clip.cpp
M	tools/mtmd/clip.h
D	tools/mtmd/qwen2vl-test.cpp

commit	f0995d28ce3d15095b6845d94ce4465e46575873	c252e0c4097b34666e5a81db9d0450d71fa3098f	2025-05-13T18:04:39+03:00	Georgi Gerganov	metal : use FA-vec kernel up to batch size 20 (#13496)
M	ggml/src/ggml-metal/ggml-metal.m

commit	c252e0c4097b34666e5a81db9d0450d71fa3098f	4f711afed5e7ef4304b567c8888ee1aa60e868eb	2025-05-13T18:04:00+03:00	Georgi Gerganov	metal : optimize multi-sequence FA vec kernel (#13493)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	4f711afed5e7ef4304b567c8888ee1aa60e868eb	b89d605a91dee0a518ecd582f8991a07d523e2fa	2025-05-13T17:02:28+02:00	Dan Johansson	ggml-cpu: Update KleidiAI to v1.6 and fix include directives (#13509)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	b89d605a91dee0a518ecd582f8991a07d523e2fa	b4726345aca49e2ad62d615e6e370b3dbad6434f	2025-05-13T18:01:53+03:00	Georgi Gerganov	batched-bench : fix pp batch contents (#13492)
M	tools/batched-bench/batched-bench.cpp

commit	b4726345aca49e2ad62d615e6e370b3dbad6434f	bf7937112058f2815fc3825a9ff7b536ecafa3bb	2025-05-13T15:33:58+02:00	Xuan-Son Nguyen	mtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460)
M	tools/mtmd/CMakeLists.txt
D	tools/mtmd/README-quantize.md
M	tools/mtmd/README.md
D	tools/mtmd/android/adb_run.sh
D	tools/mtmd/android/build_64.sh
D	tools/mtmd/clip-quantize-cli.cpp
M	tools/mtmd/clip.cpp
R100	tools/mtmd/convert_image_encoder_to_gguf.py	tools/mtmd/legacy-models/convert_image_encoder_to_gguf.py
R100	tools/mtmd/glmedge-convert-image-encoder-to-gguf.py	tools/mtmd/legacy-models/glmedge-convert-image-encoder-to-gguf.py
R100	tools/mtmd/glmedge-surgery.py	tools/mtmd/legacy-models/glmedge-surgery.py
R100	tools/mtmd/llava_surgery.py	tools/mtmd/legacy-models/llava_surgery.py
R100	tools/mtmd/llava_surgery_v2.py	tools/mtmd/legacy-models/llava_surgery_v2.py
R100	tools/mtmd/minicpmv-convert-image-encoder-to-gguf.py	tools/mtmd/legacy-models/minicpmv-convert-image-encoder-to-gguf.py
R100	tools/mtmd/minicpmv-surgery.py	tools/mtmd/legacy-models/minicpmv-surgery.py
D	tools/mtmd/llava.cpp
D	tools/mtmd/llava.h

commit	bf7937112058f2815fc3825a9ff7b536ecafa3bb	d590cd4c244e5f260c42c290b83a358b9d86d763	2025-05-13T15:31:12+02:00	Sigbjørn Skjæret	scripts : support arbitrary input file formats in compare-llama-bench.py (#13455)
M	scripts/compare-llama-bench.py

commit	d590cd4c244e5f260c42c290b83a358b9d86d763	1e2809bc4b5d8db2a9ed12ac872eca832c53f5fd	2025-05-13T07:12:01-06:00	Gabe Goodhart	model : Granite MoE shared (#13269)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-model.cpp

commit	1e2809bc4b5d8db2a9ed12ac872eca832c53f5fd	cf0a43bb6490bd49344775abb22ba26f8047cb54	2025-05-13T14:01:45+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	cf0a43bb6490bd49344775abb22ba26f8047cb54	f0d46ef15717cd609a7b69cf6190edde64d466c8	2025-05-12T15:31:37-07:00	Diego Devesa	llama-bench : add defrag-thold, check for invalid ranges (#13487)
M	include/llama.h
M	tools/llama-bench/README.md
M	tools/llama-bench/llama-bench.cpp

commit	f0d46ef15717cd609a7b69cf6190edde64d466c8	de4c07f93783a1a96456a44dc16b9db538ee1618	2025-05-12T13:13:49-07:00	lhez	opencl: remove unnecessary assert for `add` (#13257)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	de4c07f93783a1a96456a44dc16b9db538ee1618	10d2af0eaa0aafd7c6577b279dfa5221ff44a63f	2025-05-12T15:06:51+02:00	Xuan-Son Nguyen	clip : cap max image size 1024 for qwen vl model (#13478)
M	tools/mtmd/clip.cpp

commit	10d2af0eaa0aafd7c6577b279dfa5221ff44a63f	064cc596ac44308dc326a17c9e3163c34a6f29d1	2025-05-12T14:44:49+02:00	Johannes Gäßler	llama/ggml: add LLM training support (#10544)
M	build-xcframework.sh
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
A	examples/training/CMakeLists.txt
A	examples/training/README.md
A	examples/training/finetune.cpp
M	ggml/include/ggml-opt.h
M	ggml/include/ggml.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cuda/acc.cu
M	ggml/src/ggml-cuda/sum.cu
M	ggml/src/ggml-opt.cpp
M	ggml/src/ggml.c
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model-loader.cpp
A	src/llama-model-saver.cpp
A	src/llama-model-saver.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-opt.cpp

commit	064cc596ac44308dc326a17c9e3163c34a6f29d1	91159ee9df84edb72ccf874e353d2414f3a8c60d	2025-05-12T15:12:27+03:00	Georgi Gerganov	context : fix state io for memory-less contexts (#13470)
M	src/llama-context.cpp

commit	91159ee9df84edb72ccf874e353d2414f3a8c60d	22cdab343b63edd0906f1c132616746085f81983	2025-05-12T18:56:42+07:00	Anudit Nagar	server : allow content to be null in oaicompat_completion_params_parse (#13477)
M	tools/server/utils.hpp

commit	22cdab343b63edd0906f1c132616746085f81983	a71a4075cdb8e81eaaa834e48ffda88b038286bc	2025-05-12T13:08:22+02:00	Diego Devesa	llama-bench : accept ranges for integer parameters (#13410)
M	tools/llama-bench/README.md
M	tools/llama-bench/llama-bench.cpp

commit	a71a4075cdb8e81eaaa834e48ffda88b038286bc	95e18884fc7ea4031f70f1a518d5d1df616e5717	2025-05-12T13:06:19+02:00	Dan Johansson	ggml-cpu: Integrate fp32=bf16xbf16 SME KleidiAI kernel (#13053)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kernels.cpp
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	95e18884fc7ea4031f70f1a518d5d1df616e5717	df8491922f0ea4e032338186350dff2fb6b2b4e3	2025-05-12T10:51:21+02:00	Johannes Gäßler	CUDA: fix misaligned synchronization in FA (#13469)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh

commit	df8491922f0ea4e032338186350dff2fb6b2b4e3	14492144c286bbf38bb1903128403d9e2ebad54c	2025-05-12T10:29:13+02:00	Xuan-Son Nguyen	ggml : add mrope kernel for metal (#13457)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	14492144c286bbf38bb1903128403d9e2ebad54c	c104023994d36a8e791fc6a43789b84fd552cefc	2025-05-12T06:15:32+01:00	Atharva Dubey	enable dpcpp nightly builds with libraries (#13406)
M	ggml/src/ggml-sycl/CMakeLists.txt

commit	c104023994d36a8e791fc6a43789b84fd552cefc	9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1	2025-05-12T00:39:06+02:00	City	mtmd : Use RMS norm for InternVL 3 38B and 78B mmproj (#13459)
M	tools/mtmd/clip.cpp

commit	9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1	09232370fc6426aa5dd9be01a8271b9c28f5af3a	2025-05-11T11:08:26-04:00	Anthony Umfer	tools : fix uninitialized llama_batch in server (#13436)
M	tools/server/server.cpp

commit	09232370fc6426aa5dd9be01a8271b9c28f5af3a	7474e00b34629e9cd8b06bc87ad935584ea30f8e	2025-05-11T16:20:39+02:00	Sigbjørn Skjæret	scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451)
M	scripts/compare-llama-bench.py

commit	7474e00b34629e9cd8b06bc87ad935584ea30f8e	7f323a589f8684c0eb722e7309074cb5eac0c8b5	2025-05-11T16:09:33+02:00	Johannes Gäßler	CUDA: fix crash with partial offloading of MoE (#13439)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmvq.cu

commit	7f323a589f8684c0eb722e7309074cb5eac0c8b5	3eac209319a6726fd9687c6188fc6b916b65953d	2025-05-11T20:18:39+08:00	David Huang	Add `--no-op-offload` to improve `-ot` pp perf in MoE models like llama4 400B (#13386)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-cparams.h
M	tests/test-opt.cpp
M	tools/llama-bench/llama-bench.cpp
M	tools/mtmd/clip.cpp

commit	3eac209319a6726fd9687c6188fc6b916b65953d	a634d75d1bb4034b8c945042ceea268b5b895730	2025-05-11T11:35:52+02:00	City	mtmd : support InternVL 3 38B and 78B mmproj (#13443)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	a634d75d1bb4034b8c945042ceea268b5b895730	62d4250e52917dc4d634f054b1e2183ed7dee944	2025-05-11T11:34:23+02:00	Xuan-Son Nguyen	mtmd : move helpers to dedicated file (#13442)
M	tools/mtmd/CMakeLists.txt
A	tools/mtmd/mtmd-helper.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h

commit	62d4250e52917dc4d634f054b1e2183ed7dee944	0208355f42bdab88a08507ead4a6302790a08323	2025-05-10T22:26:46+02:00	Thomas Germer	docs : Fix typo in InternVL3 model name (#13440)
M	docs/multimodal.md

commit	0208355f42bdab88a08507ead4a6302790a08323	d2a4ef05c60506ee48e7375eb36f2257de7ab0d2	2025-05-10T22:22:48+02:00	Johannes Gäßler	CUDA: fix race conditions FlashAttention kernels (#13438)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh

commit	d2a4ef05c60506ee48e7375eb36f2257de7ab0d2	15e6125a397f6086c1dfdf7584acdb7c730313dc	2025-05-10T22:08:07+02:00	Sigbjørn Skjæret	vocab : add ByteDance-Seed/Seed-Coder (#13423)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama-vocab.cpp

commit	15e6125a397f6086c1dfdf7584acdb7c730313dc	3b24d26c22b9d92b5aa39930988700c84e524cf4	2025-05-10T19:57:54+02:00	Xuan-Son Nguyen	mtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434)
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp

commit	3b24d26c22b9d92b5aa39930988700c84e524cf4	43dfd741a5da77982e0a94d1e522a2481dfb914d	2025-05-10T18:44:49+02:00	Xuan-Son Nguyen	server : update docs (#13432)
M	docs/multimodal.md
M	tools/server/README.md

commit	43dfd741a5da77982e0a94d1e522a2481dfb914d	b064a51a4e7246fa43a3307f58e59f65e6be170a	2025-05-10T17:19:52+02:00	Sigbjørn Skjæret	llguidance : set tokenizer slices to default (#13424)
M	common/llguidance.cpp

commit	b064a51a4e7246fa43a3307f58e59f65e6be170a	053367d149f778cdabc356ee3024494e0dd53223	2025-05-10T21:34:48+07:00	Thammachart Chinvarapon	ci: free_disk_space flag enabled for intel variant (#13426)
M	.github/workflows/docker.yml

commit	053367d149f778cdabc356ee3024494e0dd53223	d8919424f1dee7dc1638349c616f2ef5d2ee16fb	2025-05-10T16:26:42+02:00	Xuan-Son Nguyen	mtmd : support InternVL 2.5 and 3 (#13422)
M	convert_hf_to_gguf.py
M	docs/multimodal.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/mtmd/README.md
M	tools/mtmd/clip-impl.h
M	tools/mtmd/clip.cpp
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/tests.sh

commit	d8919424f1dee7dc1638349c616f2ef5d2ee16fb	7fef11766cdeb9fa7bbbe3db13580616b7d3d599	2025-05-10T09:16:52+02:00	Johannes Gäßler	CUDA: fix FlashAttention on Turing (#13415)
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh

commit	7fef11766cdeb9fa7bbbe3db13580616b7d3d599	dc1d2adfc0f4de84da7923866d00781ec5c4e666	2025-05-10T08:16:29+02:00	Xuan-Son Nguyen	arg : add env var to control mmproj (#13416)
M	common/arg.cpp

commit	dc1d2adfc0f4de84da7923866d00781ec5c4e666	7c28a74e0783f4bb74a246fb9f19bf212139e365	2025-05-09T23:07:07-07:00	Jeff Bolz	vulkan: scalar flash attention implementation (#13324)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	7c28a74e0783f4bb74a246fb9f19bf212139e365	33eff4024084d1f0c8441b79f7208a52fad79858	2025-05-09T17:15:39-03:00	Helton Reis	chore(llguidance): use tagged version that does not break the build (#13413)
M	common/CMakeLists.txt

commit	33eff4024084d1f0c8441b79f7208a52fad79858	17512a94d636c4b6c1332370acb3e5af3ca70918	2025-05-09T19:29:37+02:00	Xuan-Son Nguyen	 server : vision support via libmtmd (#12898)
M	README.md
M	common/arg.cpp
A	docs/multimodal.md
M	tools/mtmd/README.md
M	tools/server/CMakeLists.txt
M	tools/server/README.md
M	tools/server/server.cpp
A	tools/server/tests/unit/test_vision_api.py
M	tools/server/tests/utils.py
M	tools/server/utils.hpp

commit	17512a94d636c4b6c1332370acb3e5af3ca70918	611aa914ef4231fab5d1ad04773c42e119ae2d2e	2025-05-09T16:34:08+01:00	Alberto Cabrera Pérez	sycl : implementation of reordered Q4_0 MMVQ for Intel GPUs  (#12858)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
A	ggml/src/ggml-sycl/quants.hpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	611aa914ef4231fab5d1ad04773c42e119ae2d2e	0cf6725e9f9a164c39f7a87214d60342f7f946d8	2025-05-09T15:14:56+03:00	Georgi Gerganov	metal : optimize MoE for large batches (#13388)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml.c

commit	0cf6725e9f9a164c39f7a87214d60342f7f946d8	27ebfcacbaadc6104e2b18acd8f13515cbf63dce	2025-05-09T13:34:58+02:00	Johannes Gäßler	CUDA: FA support for Deepseek (Ampere or newer) (#13306)
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cp-async.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_16.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_8.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_1.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_2.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_4.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_16.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_4.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_8.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_1.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_2.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_16.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_2.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_4.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_8.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_64-ncols2_1.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_1.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_2.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_4.cu
M	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_8.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
M	src/llama-graph.cpp

commit	27ebfcacbaadc6104e2b18acd8f13515cbf63dce	5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90	2025-05-09T13:02:07+02:00	Diego Devesa	llama : do not crash if there is no CPU backend (#13395)
M	src/llama-adapter.cpp
M	src/llama-model-loader.cpp
M	src/llama-model.cpp
M	tools/main/main.cpp
M	tools/mtmd/clip.cpp
M	tools/mtmd/llava.cpp
M	tools/rpc/rpc-server.cpp

commit	5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90	efb8b47eda78ea8ae570d4fece3953aae499289e	2025-05-09T12:14:04+02:00	Johannes Gäßler	CUDA: fix crash on large batch size for MoE models (#13384)
M	ggml/src/ggml-cuda/getrows.cu

commit	efb8b47eda78ea8ae570d4fece3953aae499289e	0527771dd80bd18479dfaaa0a98be297fc3592bf	2025-05-09T05:53:58-04:00	Bartowski	imatrix : Add --parse-special for enabling parsing of special tokens in imatrix calculation (#13389)
M	common/arg.cpp
M	common/common.h
M	tools/imatrix/imatrix.cpp

commit	0527771dd80bd18479dfaaa0a98be297fc3592bf	2189fd3b6327a1d17893694125da8edcf74a6468	2025-05-09T17:25:50+08:00	R0CKSTAR	llama-run: add support for downloading models from ModelScope (#13370)
M	tools/run/README.md
M	tools/run/run.cpp

commit	2189fd3b6327a1d17893694125da8edcf74a6468	3f96aeff394e9b72bbd2fa665c3e023a70ed8648	2025-05-09T11:18:02+02:00	Xuan-Son Nguyen	mtmd : fix batch_view for m-rope (#13397)
M	tools/mtmd/mtmd.cpp

commit	3f96aeff394e9b72bbd2fa665c3e023a70ed8648	b486ba05bf973aae3652b3fd593e0b257d3a41d4	2025-05-09T11:17:51+02:00	Xuan-Son Nguyen	llama : one-off chat template fix for Mistral-Small-2503 (#13398)
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	tools/mtmd/README.md

commit	b486ba05bf973aae3652b3fd593e0b257d3a41d4	02115dcd9a6d0c03b527d5bee8c1493ab819ddbd	2025-05-09T10:31:07+03:00	Radoslav Gerganov	rpc : add rpc_msg_set_tensor_hash_req (#13353)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	02115dcd9a6d0c03b527d5bee8c1493ab819ddbd	d9c4accaff30926e8a5fd8a2429e549158a845e0	2025-05-09T02:23:41-05:00	Jeff Bolz	vulkan: Allow up to 4096 elements for mul_mat_id row_ids (#13326)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp

commit	d9c4accaff30926e8a5fd8a2429e549158a845e0	15e03282bb432631193464100c2237a3b6bcfe4c	2025-05-09T09:06:37+02:00	Xuan-Son Nguyen	server : (webui) rename has_multimodal --> modalities (#13393)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/useChatExtraContext.tsx
M	tools/server/webui/src/utils/types.ts

commit	15e03282bb432631193464100c2237a3b6bcfe4c	f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d	2025-05-08T23:45:22+02:00	Diego Devesa	ci : limit write permission to only the release step + fixes (#13392)
M	.github/workflows/build.yml
M	.github/workflows/release.yml
M	CMakeLists.txt
M	common/CMakeLists.txt

commit	f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d	ee01d71e585f4a17ae83ec55d77acfdcf0bfa798	2025-05-08T14:25:39-04:00	Matt Clayton	mtmd : Expose helper_decode_image_chunk (#13366)
M	tools/mtmd/mtmd.cpp
M	tools/mtmd/mtmd.h

commit	ee01d71e585f4a17ae83ec55d77acfdcf0bfa798	8c83449cb780c201839653812681c3a4cf17feed	2025-05-08T18:51:45+02:00	Xuan-Son Nguyen	server : (webui) fix a very small misalignment (#13387)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/Sidebar.tsx

commit	8c83449cb780c201839653812681c3a4cf17feed	1a844be132dbe865358e1de81136920c1d35ac73	2025-05-08T15:37:29+02:00	Xuan-Son Nguyen	server : (webui) revamp the input area, plus many small UI improvements (#13365)
M	common/chat.cpp
M	tools/server/public/index.html.gz
M	tools/server/webui/package-lock.json
M	tools/server/webui/package.json
M	tools/server/webui/src/App.tsx
M	tools/server/webui/src/Config.ts
A	tools/server/webui/src/components/ChatInputExtraContextItem.tsx
M	tools/server/webui/src/components/ChatMessage.tsx
M	tools/server/webui/src/components/ChatScreen.tsx
M	tools/server/webui/src/components/Header.tsx
M	tools/server/webui/src/components/MarkdownDisplay.tsx
M	tools/server/webui/src/components/Sidebar.tsx
A	tools/server/webui/src/components/useChatExtraContext.tsx
A	tools/server/webui/src/components/useChatScroll.tsx
M	tools/server/webui/src/components/useChatTextarea.ts
M	tools/server/webui/src/index.scss
M	tools/server/webui/src/utils/app.context.tsx
M	tools/server/webui/src/utils/common.tsx
M	tools/server/webui/src/utils/llama-vscode.ts
M	tools/server/webui/src/utils/misc.ts
M	tools/server/webui/src/utils/storage.ts
M	tools/server/webui/src/utils/types.ts
M	tools/server/webui/vite.config.ts

commit	1a844be132dbe865358e1de81136920c1d35ac73	0ccc1213549e39ef4c1affb1bf5f49651ef4ce48	2025-05-08T15:34:29+02:00	Sigbjørn Skjæret	convert : support rope_scaling type and rope_type (#13349)
M	convert_hf_to_gguf.py

commit	0ccc1213549e39ef4c1affb1bf5f49651ef4ce48	6562e5a4d6c58326dcd79002ea396d4141f1b18e	2025-05-08T22:03:53+09:00	welix	mtmd : fix the calculation of n_tokens for smolvlm (#13381)
M	tools/mtmd/clip.cpp

commit	6562e5a4d6c58326dcd79002ea396d4141f1b18e	51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8	2025-05-08T14:28:33+03:00	Georgi Gerganov	context : allow cache-less context for embeddings (#13108)
M	examples/embedding/embedding.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-model.cpp
M	tools/server/server.cpp

commit	51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8	70a6991edf1b60e7afa8962f830320583f3babb0	2025-05-08T14:26:50+03:00	Georgi Gerganov	context : remove logits_all flag (#13284)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	tools/imatrix/imatrix.cpp
M	tools/main/main.cpp
M	tools/perplexity/perplexity.cpp

commit	70a6991edf1b60e7afa8962f830320583f3babb0	f0610212069929f92d428ae3b5596bfbe69c020b	2025-05-08T13:15:28+02:00	Diego Devesa	ci : move release workflow to a separate file (#13362)
A	.github/actions/get-tag-name/action.yml
A	.github/actions/windows-setup-cuda/action.yml
M	.github/workflows/build.yml
A	.github/workflows/release.yml

commit	f0610212069929f92d428ae3b5596bfbe69c020b	8733e0cf6eefc7c7752297cc22d0836706f4222c	2025-05-08T13:15:15+02:00	Diego Devesa	llama : print size and type of overridden tensors (#13364)
M	src/llama-model.cpp

commit	8733e0cf6eefc7c7752297cc22d0836706f4222c	814f795e063c257f33b921eab4073484238a151a	2025-05-08T10:08:01+01:00	Alberto Cabrera Pérez	sycl: addressing non-contiguous src1 mul_mats (nc and batched) (#13343)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/convert.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	814f795e063c257f33b921eab4073484238a151a	d879433824ac3c16b3b5f00075895d0ee9688e34	2025-05-07T16:36:33+02:00	Diego Devesa	docker : disable arm64 and intel images (#13356)
M	.github/workflows/docker.yml

commit	d879433824ac3c16b3b5f00075895d0ee9688e34	13b0a04597a4581cad4d9027a848f450c623801d	2025-05-07T16:39:36+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	13b0a04597a4581cad4d9027a848f450c623801d	bba9d945c14b93c5264b7956e00736601ca6f89a	2025-05-05T13:09:35+02:00	Daniel Bevenius	whisper: remove MSVC warnings pragmas (whisper/3090)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/vec.cpp
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-sycl/common.hpp

commit	bba9d945c14b93c5264b7956e00736601ca6f89a	bc4e1128f78be0fbb4e2fa630adb6a04b969ac68	2025-05-02T02:41:35-07:00	Jared Tweed	cmake : removed stdc++fs (whisper/3097)
M	ggml/src/CMakeLists.txt

commit	bc4e1128f78be0fbb4e2fa630adb6a04b969ac68	39e73ae0d69f882d7e29cecc6dd8f5052fca6731	2025-05-07T12:49:27+02:00	Sigbjørn Skjæret	llama : deci : support ffn-free with attention (#13296)
M	src/llama-model.cpp

commit	39e73ae0d69f882d7e29cecc6dd8f5052fca6731	1f73301b63668d61b5f3109489050a27dc3f65be	2025-05-07T18:23:28+10:00	Ycros	common : Add a warning when we can't match samplers from a string or char. (#13330)
M	common/sampling.cpp

commit	1f73301b63668d61b5f3109489050a27dc3f65be	4773d7a02ffdb05ba9e673ff21ce95351836e33a	2025-05-07T15:48:23+08:00	R0CKSTAR	cuda : remove nrows_x in mul_mat_q_process_tile (#13325)
M	ggml/src/ggml-cuda/mmq.cuh

commit	4773d7a02ffdb05ba9e673ff21ce95351836e33a	6c7fd67b647a76846d1691cd181011dff4549d02	2025-05-07T10:28:02+03:00	Georgi Gerganov	examples : remove infill (#13283)
M	Makefile
M	common/arg.cpp
M	common/common.h
M	examples/CMakeLists.txt
D	examples/infill/CMakeLists.txt
D	examples/infill/README.md
D	examples/infill/infill.cpp

commit	6c7fd67b647a76846d1691cd181011dff4549d02	141a908a59bbc68ceae3bf090b850e33322a2ca9	2025-05-07T15:23:11+08:00	piDack	llama : support tie embedding for chatglm models (#13328)
M	src/llama-model.cpp

commit	141a908a59bbc68ceae3bf090b850e33322a2ca9	32916a49072f01c43e20df374af5f8a1f70d6963	2025-05-06T23:35:51+02:00	Johannes Gäßler	CUDA: mix virt/real CUDA archs for GGML_NATIVE=OFF (#13135)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	32916a49072f01c43e20df374af5f8a1f70d6963	ffc727203af1061fdeb49efef30f76171722e403	2025-05-06T22:40:24+02:00	Xuan-Son Nguyen	clip : refactor graph builder (#13321)
M	convert_hf_to_gguf.py
M	tools/mtmd/clip.cpp

commit	ffc727203af1061fdeb49efef30f76171722e403	91a86a6f354aa73a7aab7bc3d283be410fdc93a5	2025-05-06T13:36:24-07:00	DocShotgun	sampling : make top_n_sigma no-op at <=0 or a single candidate (#13345)
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	91a86a6f354aa73a7aab7bc3d283be410fdc93a5	f4ed10b69cc38c54070a47f841827de5e8984cdf	2025-05-06T15:24:15-03:00	oobabooga	sampling : don't consider -infinity values in top_n_sigma (#13344)
M	src/llama-sampling.cpp

commit	f4ed10b69cc38c54070a47f841827de5e8984cdf	1e333d5bba18e99bc328bb87ac1ee6a4e6260e0e	2025-05-06T20:15:31+02:00	Diego Devesa	cmake : remove arm64 msvc presets (#13342)
M	CMakePresets.json

commit	1e333d5bba18e99bc328bb87ac1ee6a4e6260e0e	2f54e348ad2999c4e31b8777592247622b20420f	2025-05-06T20:27:06+05:30	Akarshan Biswas	SYCL: Disable reorder optimize by default and stop setting tensor extras when optimize is disabled (#13254)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	2f54e348ad2999c4e31b8777592247622b20420f	2356fb1d53c86d838756211010bbabfafda7cb94	2025-05-06T14:25:40+02:00	Xuan-Son Nguyen	llama : fix build_ffn without gate (#13336)
M	src/llama-graph.cpp

commit	2356fb1d53c86d838756211010bbabfafda7cb94	764b85627b46f43d7ea801867cd1b6abef484574	2025-05-06T13:58:51+02:00	Johannes Gäßler	CUDA: fix bad asserts for partial offload (#13337)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml.c

commit	764b85627b46f43d7ea801867cd1b6abef484574	15a28ec8c705b188ebe178170966d1dcc36fe151	2025-05-06T11:12:06+02:00	Sigbjørn Skjæret	convert : qwen2/3moe : set yarn metadata if present (#13331)
M	convert_hf_to_gguf.py

commit	15a28ec8c705b188ebe178170966d1dcc36fe151	a7366faa5bb2fff97b9fb43340d853709f52d8c9	2025-05-06T08:36:46+02:00	Johannes Gäßler	CUDA: fix --split-mode row for MMQ (#13323)
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	a7366faa5bb2fff97b9fb43340d853709f52d8c9	907036502070ba608bdb2aaebf802092d4cfba07	2025-05-05T22:27:31-04:00	compilade	gguf-py : avoid requiring pyside6 for other scripts (#13036)
D	gguf-py/gguf/scripts/__init__.py
M	gguf-py/pyproject.toml
M	pyproject.toml

commit	907036502070ba608bdb2aaebf802092d4cfba07	233461f8121455f957a47e6a22a77b3bc88277b0	2025-05-05T22:32:13+02:00	Johannes Gäßler	CUDA: fix logic for clearing padding with -ngl 0 (#13320)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/quantize.cu

commit	233461f8121455f957a47e6a22a77b3bc88277b0	b34c859146630dff136943abc9852ca173a7c9d6	2025-05-05T17:12:19-03:00	oobabooga	sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264)
M	common/common.h
M	common/sampling.cpp
M	src/llama-sampling.cpp
M	tools/server/server.cpp

commit	b34c859146630dff136943abc9852ca173a7c9d6	9b61acf06041dcbaff6afa5f28940e93297f8520	2025-05-05T17:03:31+03:00	igardev	server : Webui - change setText command from parent window to also send the message. (#13309)
M	tools/server/public/index.html.gz
M	tools/server/webui/src/components/ChatScreen.tsx
M	tools/server/webui/src/components/useChatTextarea.ts
M	tools/server/webui/src/utils/llama-vscode.ts

commit	9b61acf06041dcbaff6afa5f28940e93297f8520	5215b91e9377ce23e4ccc92ec3156bf5c7f892a3	2025-05-05T16:02:55+02:00	Xuan-Son Nguyen	mtmd : rename llava directory to mtmd (#13311)
M	Makefile
M	common/arg.cpp
M	common/common.h
M	docs/multimodal/MobileVLM.md
M	docs/multimodal/glmedge.md
M	docs/multimodal/llava.md
M	docs/multimodal/minicpmo2.6.md
M	docs/multimodal/minicpmv2.5.md
M	docs/multimodal/minicpmv2.6.md
M	requirements/requirements-all.txt
M	tools/CMakeLists.txt
R100	tools/llava/CMakeLists.txt	tools/mtmd/CMakeLists.txt
R100	tools/llava/README-quantize.md	tools/mtmd/README-quantize.md
R100	tools/llava/README.md	tools/mtmd/README.md
R100	tools/llava/android/adb_run.sh	tools/mtmd/android/adb_run.sh
R100	tools/llava/android/build_64.sh	tools/mtmd/android/build_64.sh
R100	tools/llava/clip-impl.h	tools/mtmd/clip-impl.h
R100	tools/llava/clip-quantize-cli.cpp	tools/mtmd/clip-quantize-cli.cpp
R100	tools/llava/clip.cpp	tools/mtmd/clip.cpp
R100	tools/llava/clip.h	tools/mtmd/clip.h
R100	tools/llava/convert_image_encoder_to_gguf.py	tools/mtmd/convert_image_encoder_to_gguf.py
R100	tools/llava/deprecation-warning.cpp	tools/mtmd/deprecation-warning.cpp
R100	tools/llava/glmedge-convert-image-encoder-to-gguf.py	tools/mtmd/glmedge-convert-image-encoder-to-gguf.py
R100	tools/llava/glmedge-surgery.py	tools/mtmd/glmedge-surgery.py
R100	tools/llava/llava.cpp	tools/mtmd/llava.cpp
R100	tools/llava/llava.h	tools/mtmd/llava.h
R100	tools/llava/llava_surgery.py	tools/mtmd/llava_surgery.py
R100	tools/llava/llava_surgery_v2.py	tools/mtmd/llava_surgery_v2.py
R100	tools/llava/minicpmv-convert-image-encoder-to-gguf.py	tools/mtmd/minicpmv-convert-image-encoder-to-gguf.py
R100	tools/llava/minicpmv-surgery.py	tools/mtmd/minicpmv-surgery.py
R100	tools/llava/mtmd-cli.cpp	tools/mtmd/mtmd-cli.cpp
R100	tools/llava/mtmd.cpp	tools/mtmd/mtmd.cpp
R100	tools/llava/mtmd.h	tools/mtmd/mtmd.h
R100	tools/llava/qwen2vl-test.cpp	tools/mtmd/qwen2vl-test.cpp
R100	tools/llava/requirements.txt	tools/mtmd/requirements.txt
R100	tools/llava/test-1.jpeg	tools/mtmd/test-1.jpeg
R100	tools/llava/tests.sh	tools/mtmd/tests.sh

commit	5215b91e9377ce23e4ccc92ec3156bf5c7f892a3	ae803bfc3d0fc2d0d3e1cce22ee103a30939e104	2025-05-05T12:54:44+02:00	Xuan-Son Nguyen	clip :  fix confused naming ffn_up and ffn_down (#13290)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	tools/llava/clip.cpp
M	tools/llava/mtmd-cli.cpp

commit	ae803bfc3d0fc2d0d3e1cce22ee103a30939e104	66645a5285d8c4c5f9a3b3f360d042baac2d820a	2025-05-05T12:34:26+02:00	Sigbjørn Skjæret	convert : bailingmoe : set yarn metadata if present (#13312)
M	convert_hf_to_gguf.py

commit	66645a5285d8c4c5f9a3b3f360d042baac2d820a	27aa2595321c4d9cc4086a8e67bdea204b8309b0	2025-05-05T13:39:10+05:30	Akarshan Biswas	SYCL: Disable mul_mat kernels for noncontiguous tensor b (#13308)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	27aa2595321c4d9cc4086a8e67bdea204b8309b0	9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028	2025-05-04T23:43:42+02:00	Xuan-Son Nguyen	mtmd : add C public API (#13184)
M	tests/CMakeLists.txt
A	tests/test-mtmd-c-api.c
M	tools/llava/clip-impl.h
M	tools/llava/clip.h
M	tools/llava/mtmd-cli.cpp
M	tools/llava/mtmd.cpp
M	tools/llava/mtmd.h

commit	9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028	6eb7d25c700e29d9272064db408855178d01741b	2025-05-04T21:25:43+02:00	Diego Devesa	rpc : use backend registry, support dl backends (#13304)
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	tools/CMakeLists.txt
M	tools/rpc/rpc-server.cpp

commit	6eb7d25c700e29d9272064db408855178d01741b	86bd60d3fe4a08b8c9d920e6defbc2412d803569	2025-05-05T01:49:12+08:00	Aaron Teo	ggml : activate s390x simd for Q3_K (#13301)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	86bd60d3fe4a08b8c9d920e6defbc2412d803569	9f2da5871f4bbd205b8a3b952cdc76283218d595	2025-05-04T17:05:20+02:00	Diego Devesa	llava/mtmd : fixes to fully support dl backends (#13303)
M	tools/CMakeLists.txt
M	tools/llava/clip.cpp
M	tools/llava/llava.cpp

commit	9f2da5871f4bbd205b8a3b952cdc76283218d595	93c4e23905987949b714b21ae918ff6bfb55fe36	2025-05-04T14:20:49+02:00	Diego Devesa	llama : build windows releases with dl backends (#13220)
M	.github/workflows/build.yml
D	cmake/arm64-windows-msvc.cmake
M	cmake/x64-windows-llvm.cmake
M	tests/CMakeLists.txt

commit	93c4e23905987949b714b21ae918ff6bfb55fe36	8afbd968182909cf93fb15959fc867b6dd3adb53	2025-05-04T14:16:39+02:00	Johannes Gäßler	CUDA: fix race condition in MMQ stream-k fixup (#13299)
M	ggml/src/ggml-cuda/mmq.cuh

commit	8afbd968182909cf93fb15959fc867b6dd3adb53	8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c	2025-05-04T13:58:38+02:00	Johannes Gäßler	CUDA: fix race condition in MMQ ids_dst (#13294)
M	ggml/src/ggml-cuda/mmq.cuh

commit	8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c	3e959f09764a2bb0e64af594eab83f7fb3e08eb2	2025-05-04T00:17:16-05:00	Jeff Bolz	vulkan: Additional type support for unary, binary, and copy (#13266)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/relu.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sigmoid.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/tanh.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	3e959f09764a2bb0e64af594eab83f7fb3e08eb2	36667c8edcded08063ed51c7d57e9e086bbfc903	2025-05-04T00:50:37+02:00	Johannes Gäßler	imatrix: fix oob writes if src1 is not contiguous (#13286)
M	tools/imatrix/imatrix.cpp

commit	36667c8edcded08063ed51c7d57e9e086bbfc903	3bf785f3efa89ed28294fbf73054558a2b034bfb	2025-05-03T20:07:54+02:00	Xuan-Son Nguyen	clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259)
M	tools/llava/clip-impl.h
M	tools/llava/clip.cpp
M	tools/llava/mtmd.cpp

commit	3bf785f3efa89ed28294fbf73054558a2b034bfb	1d36b3670b285e69e58b9d687c770a2a0a192194	2025-05-03T23:39:51+08:00	ymcki	llama : Llama-3_1-Nemotron-Ultra-253B-v1 support (#12843)
M	convert_hf_to_gguf.py
M	src/llama-model.cpp
M	src/llama-model.h

commit	1d36b3670b285e69e58b9d687c770a2a0a192194	b34443923cad751483cc53af2e680d595daadce7	2025-05-02T20:27:13+02:00	Diego Devesa	llama : move end-user examples to tools directory (#13249)
M	.editorconfig
M	.flake8
M	.github/labeler.yml
M	.github/workflows/bench.yml.disabled
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	.gitignore
M	CMakeLists.txt
M	CODEOWNERS
M	Makefile
M	README.md
M	SECURITY.md
M	build-xcframework.sh
M	ci/run.sh
M	common/arg.cpp
M	common/common.h
M	docs/development/HOWTO-add-model.md
M	docs/multimodal/MobileVLM.md
M	docs/multimodal/glmedge.md
M	docs/multimodal/llava.md
M	docs/multimodal/minicpmo2.6.md
M	docs/multimodal/minicpmv2.5.md
M	docs/multimodal/minicpmv2.6.md
M	examples/CMakeLists.txt
M	examples/pydantic_models_to_grammar_examples.py
D	examples/server/public/index.html.gz
M	grammars/README.md
M	pyrightconfig.json
M	requirements/requirements-all.txt
M	scripts/fetch_server_test_models.py
M	scripts/tool_bench.py
M	scripts/xxd.cmake
M	tests/CMakeLists.txt
M	tests/run-json-schema-to-grammar.mjs
A	tools/CMakeLists.txt
R100	examples/batched-bench/CMakeLists.txt	tools/batched-bench/CMakeLists.txt
R100	examples/batched-bench/README.md	tools/batched-bench/README.md
R100	examples/batched-bench/batched-bench.cpp	tools/batched-bench/batched-bench.cpp
R100	examples/cvector-generator/CMakeLists.txt	tools/cvector-generator/CMakeLists.txt
R100	examples/cvector-generator/README.md	tools/cvector-generator/README.md
R100	examples/cvector-generator/completions.txt	tools/cvector-generator/completions.txt
R100	examples/cvector-generator/cvector-generator.cpp	tools/cvector-generator/cvector-generator.cpp
R100	examples/cvector-generator/mean.hpp	tools/cvector-generator/mean.hpp
R100	examples/cvector-generator/negative.txt	tools/cvector-generator/negative.txt
R100	examples/cvector-generator/pca.hpp	tools/cvector-generator/pca.hpp
R100	examples/cvector-generator/positive.txt	tools/cvector-generator/positive.txt
R100	examples/export-lora/CMakeLists.txt	tools/export-lora/CMakeLists.txt
R100	examples/export-lora/README.md	tools/export-lora/README.md
R100	examples/export-lora/export-lora.cpp	tools/export-lora/export-lora.cpp
R100	examples/gguf-split/CMakeLists.txt	tools/gguf-split/CMakeLists.txt
R100	examples/gguf-split/README.md	tools/gguf-split/README.md
R100	examples/gguf-split/gguf-split.cpp	tools/gguf-split/gguf-split.cpp
R100	examples/gguf-split/tests.sh	tools/gguf-split/tests.sh
R100	examples/imatrix/CMakeLists.txt	tools/imatrix/CMakeLists.txt
R098	examples/imatrix/README.md	tools/imatrix/README.md
R100	examples/imatrix/imatrix.cpp	tools/imatrix/imatrix.cpp
R100	examples/llama-bench/CMakeLists.txt	tools/llama-bench/CMakeLists.txt
R099	examples/llama-bench/README.md	tools/llama-bench/README.md
R100	examples/llama-bench/llama-bench.cpp	tools/llama-bench/llama-bench.cpp
R100	examples/llava/CMakeLists.txt	tools/llava/CMakeLists.txt
R100	examples/llava/README-quantize.md	tools/llava/README-quantize.md
R100	examples/llava/README.md	tools/llava/README.md
R100	examples/llava/android/adb_run.sh	tools/llava/android/adb_run.sh
R100	examples/llava/android/build_64.sh	tools/llava/android/build_64.sh
R100	examples/llava/clip-impl.h	tools/llava/clip-impl.h
R100	examples/llava/clip-quantize-cli.cpp	tools/llava/clip-quantize-cli.cpp
R100	examples/llava/clip.cpp	tools/llava/clip.cpp
R100	examples/llava/clip.h	tools/llava/clip.h
R100	examples/llava/convert_image_encoder_to_gguf.py	tools/llava/convert_image_encoder_to_gguf.py
R100	examples/llava/deprecation-warning.cpp	tools/llava/deprecation-warning.cpp
R100	examples/llava/glmedge-convert-image-encoder-to-gguf.py	tools/llava/glmedge-convert-image-encoder-to-gguf.py
R100	examples/llava/glmedge-surgery.py	tools/llava/glmedge-surgery.py
R100	examples/llava/llava.cpp	tools/llava/llava.cpp
R100	examples/llava/llava.h	tools/llava/llava.h
R100	examples/llava/llava_surgery.py	tools/llava/llava_surgery.py
R100	examples/llava/llava_surgery_v2.py	tools/llava/llava_surgery_v2.py
R100	examples/llava/minicpmv-convert-image-encoder-to-gguf.py	tools/llava/minicpmv-convert-image-encoder-to-gguf.py
R100	examples/llava/minicpmv-surgery.py	tools/llava/minicpmv-surgery.py
R100	examples/llava/mtmd-cli.cpp	tools/llava/mtmd-cli.cpp
R100	examples/llava/mtmd.cpp	tools/llava/mtmd.cpp
R100	examples/llava/mtmd.h	tools/llava/mtmd.h
R100	examples/llava/qwen2vl-test.cpp	tools/llava/qwen2vl-test.cpp
R100	examples/llava/requirements.txt	tools/llava/requirements.txt
R100	examples/llava/test-1.jpeg	tools/llava/test-1.jpeg
R100	examples/llava/tests.sh	tools/llava/tests.sh
R100	examples/main/CMakeLists.txt	tools/main/CMakeLists.txt
R099	examples/main/README.md	tools/main/README.md
R100	examples/main/main.cpp	tools/main/main.cpp
R100	examples/perplexity/CMakeLists.txt	tools/perplexity/CMakeLists.txt
R100	examples/perplexity/README.md	tools/perplexity/README.md
R100	examples/perplexity/perplexity.cpp	tools/perplexity/perplexity.cpp
R100	examples/quantize/CMakeLists.txt	tools/quantize/CMakeLists.txt
R100	examples/quantize/README.md	tools/quantize/README.md
R100	examples/quantize/quantize.cpp	tools/quantize/quantize.cpp
R100	examples/quantize/tests.sh	tools/quantize/tests.sh
R100	examples/rpc/CMakeLists.txt	tools/rpc/CMakeLists.txt
R100	examples/rpc/README.md	tools/rpc/README.md
R100	examples/rpc/rpc-server.cpp	tools/rpc/rpc-server.cpp
R100	examples/run/CMakeLists.txt	tools/run/CMakeLists.txt
R100	examples/run/README.md	tools/run/README.md
R100	examples/run/linenoise.cpp/linenoise.cpp	tools/run/linenoise.cpp/linenoise.cpp
R100	examples/run/linenoise.cpp/linenoise.h	tools/run/linenoise.cpp/linenoise.h
R100	examples/run/run.cpp	tools/run/run.cpp
R100	examples/server/CMakeLists.txt	tools/server/CMakeLists.txt
R099	examples/server/README.md	tools/server/README.md
R100	examples/server/bench/README.md	tools/server/bench/README.md
R100	examples/server/bench/bench.py	tools/server/bench/bench.py
R100	examples/server/bench/prometheus.yml	tools/server/bench/prometheus.yml
R100	examples/server/bench/requirements.txt	tools/server/bench/requirements.txt
R100	examples/server/bench/script.js	tools/server/bench/script.js
R100	examples/server/chat-llama2.sh	tools/server/chat-llama2.sh
R100	examples/server/chat.mjs	tools/server/chat.mjs
R100	examples/server/chat.sh	tools/server/chat.sh
R100	examples/server/httplib.h	tools/server/httplib.h
A	tools/server/public/index.html.gz
R100	examples/server/public/loading.html	tools/server/public/loading.html
R100	examples/server/public_legacy/colorthemes.css	tools/server/public_legacy/colorthemes.css
R100	examples/server/public_legacy/completion.js	tools/server/public_legacy/completion.js
R100	examples/server/public_legacy/favicon.ico	tools/server/public_legacy/favicon.ico
R100	examples/server/public_legacy/index-new.html	tools/server/public_legacy/index-new.html
R100	examples/server/public_legacy/index.html	tools/server/public_legacy/index.html
R100	examples/server/public_legacy/index.js	tools/server/public_legacy/index.js
R100	examples/server/public_legacy/json-schema-to-grammar.mjs	tools/server/public_legacy/json-schema-to-grammar.mjs
R100	examples/server/public_legacy/loading.html	tools/server/public_legacy/loading.html
R100	examples/server/public_legacy/prompt-formats.js	tools/server/public_legacy/prompt-formats.js
R100	examples/server/public_legacy/style.css	tools/server/public_legacy/style.css
R100	examples/server/public_legacy/system-prompts.js	tools/server/public_legacy/system-prompts.js
R100	examples/server/public_legacy/theme-beeninorder.css	tools/server/public_legacy/theme-beeninorder.css
R100	examples/server/public_legacy/theme-ketivah.css	tools/server/public_legacy/theme-ketivah.css
R100	examples/server/public_legacy/theme-mangotango.css	tools/server/public_legacy/theme-mangotango.css
R100	examples/server/public_legacy/theme-playground.css	tools/server/public_legacy/theme-playground.css
R100	examples/server/public_legacy/theme-polarnight.css	tools/server/public_legacy/theme-polarnight.css
R100	examples/server/public_legacy/theme-snowstorm.css	tools/server/public_legacy/theme-snowstorm.css
R100	examples/server/public_simplechat/datautils.mjs	tools/server/public_simplechat/datautils.mjs
R100	examples/server/public_simplechat/index.html	tools/server/public_simplechat/index.html
R097	examples/server/public_simplechat/readme.md	tools/server/public_simplechat/readme.md
R100	examples/server/public_simplechat/simplechat.css	tools/server/public_simplechat/simplechat.css
R100	examples/server/public_simplechat/simplechat.js	tools/server/public_simplechat/simplechat.js
R100	examples/server/public_simplechat/simplechat_screens.webp	tools/server/public_simplechat/simplechat_screens.webp
R100	examples/server/public_simplechat/ui.mjs	tools/server/public_simplechat/ui.mjs
R100	examples/server/server.cpp	tools/server/server.cpp
R100	examples/server/tests/.gitignore	tools/server/tests/.gitignore
R096	examples/server/tests/README.md	tools/server/tests/README.md
R100	examples/server/tests/conftest.py	tools/server/tests/conftest.py
R100	examples/server/tests/pytest.ini	tools/server/tests/pytest.ini
R100	examples/server/tests/requirements.txt	tools/server/tests/requirements.txt
R100	examples/server/tests/tests.sh	tools/server/tests/tests.sh
R100	examples/server/tests/unit/test_basic.py	tools/server/tests/unit/test_basic.py
R100	examples/server/tests/unit/test_chat_completion.py	tools/server/tests/unit/test_chat_completion.py
R100	examples/server/tests/unit/test_completion.py	tools/server/tests/unit/test_completion.py
R100	examples/server/tests/unit/test_ctx_shift.py	tools/server/tests/unit/test_ctx_shift.py
R100	examples/server/tests/unit/test_embedding.py	tools/server/tests/unit/test_embedding.py
R100	examples/server/tests/unit/test_infill.py	tools/server/tests/unit/test_infill.py
R100	examples/server/tests/unit/test_lora.py	tools/server/tests/unit/test_lora.py
R100	examples/server/tests/unit/test_rerank.py	tools/server/tests/unit/test_rerank.py
R100	examples/server/tests/unit/test_security.py	tools/server/tests/unit/test_security.py
R100	examples/server/tests/unit/test_slot_save.py	tools/server/tests/unit/test_slot_save.py
R100	examples/server/tests/unit/test_speculative.py	tools/server/tests/unit/test_speculative.py
R100	examples/server/tests/unit/test_tokenize.py	tools/server/tests/unit/test_tokenize.py
R100	examples/server/tests/unit/test_tool_call.py	tools/server/tests/unit/test_tool_call.py
R100	examples/server/tests/utils.py	tools/server/tests/utils.py
R100	examples/server/themes/README.md	tools/server/themes/README.md
R100	examples/server/themes/buttons-top/README.md	tools/server/themes/buttons-top/README.md
R100	examples/server/themes/buttons-top/buttons_top.png	tools/server/themes/buttons-top/buttons_top.png
R100	examples/server/themes/buttons-top/favicon.ico	tools/server/themes/buttons-top/favicon.ico
R100	examples/server/themes/buttons-top/index.html	tools/server/themes/buttons-top/index.html
R100	examples/server/themes/wild/README.md	tools/server/themes/wild/README.md
R100	examples/server/themes/wild/favicon.ico	tools/server/themes/wild/favicon.ico
R100	examples/server/themes/wild/index.html	tools/server/themes/wild/index.html
R100	examples/server/themes/wild/llama_cpp.png	tools/server/themes/wild/llama_cpp.png
R100	examples/server/themes/wild/llamapattern.png	tools/server/themes/wild/llamapattern.png
R100	examples/server/themes/wild/wild.png	tools/server/themes/wild/wild.png
R100	examples/server/utils.hpp	tools/server/utils.hpp
R100	examples/server/webui/.gitignore	tools/server/webui/.gitignore
R100	examples/server/webui/.prettierignore	tools/server/webui/.prettierignore
R100	examples/server/webui/eslint.config.js	tools/server/webui/eslint.config.js
R100	examples/server/webui/index.html	tools/server/webui/index.html
R100	examples/server/webui/package-lock.json	tools/server/webui/package-lock.json
R100	examples/server/webui/package.json	tools/server/webui/package.json
R100	examples/server/webui/postcss.config.js	tools/server/webui/postcss.config.js
R100	examples/server/webui/public/demo-conversation.json	tools/server/webui/public/demo-conversation.json
R100	examples/server/webui/src/App.tsx	tools/server/webui/src/App.tsx
R100	examples/server/webui/src/Config.ts	tools/server/webui/src/Config.ts
R100	examples/server/webui/src/components/CanvasPyInterpreter.tsx	tools/server/webui/src/components/CanvasPyInterpreter.tsx
R100	examples/server/webui/src/components/ChatMessage.tsx	tools/server/webui/src/components/ChatMessage.tsx
R100	examples/server/webui/src/components/ChatScreen.tsx	tools/server/webui/src/components/ChatScreen.tsx
R100	examples/server/webui/src/components/Header.tsx	tools/server/webui/src/components/Header.tsx
R100	examples/server/webui/src/components/MarkdownDisplay.tsx	tools/server/webui/src/components/MarkdownDisplay.tsx
R099	examples/server/webui/src/components/SettingDialog.tsx	tools/server/webui/src/components/SettingDialog.tsx
R100	examples/server/webui/src/components/Sidebar.tsx	tools/server/webui/src/components/Sidebar.tsx
R100	examples/server/webui/src/components/useChatTextarea.ts	tools/server/webui/src/components/useChatTextarea.ts
R100	examples/server/webui/src/index.scss	tools/server/webui/src/index.scss
R100	examples/server/webui/src/main.tsx	tools/server/webui/src/main.tsx
R100	examples/server/webui/src/utils/app.context.tsx	tools/server/webui/src/utils/app.context.tsx
R100	examples/server/webui/src/utils/common.tsx	tools/server/webui/src/utils/common.tsx
R100	examples/server/webui/src/utils/llama-vscode.ts	tools/server/webui/src/utils/llama-vscode.ts
R100	examples/server/webui/src/utils/misc.ts	tools/server/webui/src/utils/misc.ts
R100	examples/server/webui/src/utils/storage.ts	tools/server/webui/src/utils/storage.ts
R100	examples/server/webui/src/utils/types.ts	tools/server/webui/src/utils/types.ts
R100	examples/server/webui/src/vite-env.d.ts	tools/server/webui/src/vite-env.d.ts
R100	examples/server/webui/tailwind.config.js	tools/server/webui/tailwind.config.js
R100	examples/server/webui/tsconfig.app.json	tools/server/webui/tsconfig.app.json
R100	examples/server/webui/tsconfig.json	tools/server/webui/tsconfig.json
R100	examples/server/webui/tsconfig.node.json	tools/server/webui/tsconfig.node.json
R100	examples/server/webui/vite.config.ts	tools/server/webui/vite.config.ts
R100	examples/tokenize/CMakeLists.txt	tools/tokenize/CMakeLists.txt
R100	examples/tokenize/tokenize.cpp	tools/tokenize/tokenize.cpp
R100	examples/tts/CMakeLists.txt	tools/tts/CMakeLists.txt
R096	examples/tts/README.md	tools/tts/README.md
R100	examples/tts/convert_pt_to_hf.py	tools/tts/convert_pt_to_hf.py
R100	examples/tts/tts-outetts.py	tools/tts/tts-outetts.py
R100	examples/tts/tts.cpp	tools/tts/tts.cpp

commit	b34443923cad751483cc53af2e680d595daadce7	a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd	2025-05-02T20:54:30+03:00	Georgi Gerganov	sync : ggml (#13268)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/conv2d_dw.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	scripts/sync-ggml.last
M	tests/test-backend-ops.cpp

commit	a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd	3f3769ba76061a511f02f2a48da2ad2d93fce511	2025-05-02T20:54:13+03:00	Georgi Gerganov	context : fix reorder logic (#13267)
M	src/llama-context.cpp

commit	3f3769ba76061a511f02f2a48da2ad2d93fce511	2f567611c0234bbca0a4009762acb47b56866095	2025-05-02T22:23:12+05:30	shalinib-ibm	ggml : Enable MMA for BF16 in llamafile_sgemm (#13148)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	2f567611c0234bbca0a4009762acb47b56866095	7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d	2025-05-02T11:42:30-04:00	Jared Van Bortel	llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-model.cpp

commit	7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d	074e42ab31de4c99aa7d9d2d239660f64b2380d6	2025-05-02T11:41:54-04:00	Jared Van Bortel	convert : use correct context length for nomic-embed-text-v2 (#13216)
M	convert_hf_to_gguf.py

commit	074e42ab31de4c99aa7d9d2d239660f64b2380d6	c642bc014c105728ce45015813351dc5a37f60a2	2025-05-02T17:17:15+02:00	Xuan-Son Nguyen	convert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209)
M	convert_hf_to_gguf.py
M	examples/llava/README.md
D	examples/llava/qwen2_vl_surgery.py
M	examples/llava/tests.sh
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py

commit	c642bc014c105728ce45015813351dc5a37f60a2	cb06a3c363f50cd35113984fe8fb164aea419077	2025-05-02T17:48:36+03:00	Georgi Gerganov	kv-cache : separate recurrent vs non-recurrent impl (#12799)
M	src/llama-batch.cpp
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	cb06a3c363f50cd35113984fe8fb164aea419077	626083faf73faa54440f934bb1741bf443be91b1	2025-05-02T12:44:24+02:00	Sigbjørn Skjæret	llama : orion rope type is neox (#13261)
M	src/llama-model.cpp

commit	626083faf73faa54440f934bb1741bf443be91b1	2af6880178b4bc2c0eced726bab68b4bf333042b	2025-05-02T12:40:56+02:00	Sigbjørn Skjæret	llama : plamo rope type is neox (#13260)
M	src/llama-model.cpp

commit	2af6880178b4bc2c0eced726bab68b4bf333042b	e84773ab604fe0d935d03741df003716398dc57b	2025-05-02T17:06:09+08:00	piDack	llama-chat : reset glmedge chat template (#13253)
M	src/llama-chat.cpp
M	tests/test-chat-template.cpp

commit	e84773ab604fe0d935d03741df003716398dc57b	fab647e8842c5f80da7e8f2c625dab6a0e19e5d4	2025-05-02T14:20:27+06:00	Shakil Ahmed	mtmd-cli : fix out_of_range when input image path is empty (#13244)
M	examples/llava/mtmd-cli.cpp
M	examples/llava/mtmd.cpp

commit	fab647e8842c5f80da7e8f2c625dab6a0e19e5d4	dcf886007de4b8e5200f461a13233315f897fb9d	2025-05-02T09:48:31+03:00	Georgi Gerganov	server : add cache reuse card link to help (#13230)
M	common/arg.cpp
M	examples/server/README.md

commit	dcf886007de4b8e5200f461a13233315f897fb9d	d24d5928086471063fa9d9fd45aca710fd1336ae	2025-05-02T08:45:10+02:00	Xuan-Son Nguyen	convert : explicitly disable trust_remote_code for AutoConfig (#13246)
M	convert_hf_to_gguf.py

commit	d24d5928086471063fa9d9fd45aca710fd1336ae	8efbdadc616fa717c369059b9b388160958d886c	2025-05-01T19:06:39-03:00	bandoti	ci: fix cross-compile sync issues (#12804)
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml

commit	8efbdadc616fa717c369059b9b388160958d886c	f057808ffadce213f54c1884ab5096e60140f358	2025-05-01T17:32:11-04:00	Justin Santa Barbara	rpc : avoid uninitialized memory in serialize_tensor (#13210)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	f057808ffadce213f54c1884ab5096e60140f358	d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a	2025-05-01T13:46:10-07:00	Jesse Gross	ggml: Don't assert fail when tensor data changes (#13222)
M	ggml/src/ggml-alloc.c

commit	d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a	b6e4ff69b8abd509647b531bd5b4e86950204f66	2025-05-01T21:48:08+02:00	Diego Devesa	build : fix build info on windows (#13239)
M	cmake/build-info.cmake
M	common/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	b6e4ff69b8abd509647b531bd5b4e86950204f66	e0f572c8466e70d35cbd70ee536ad8fc83b2acac	2025-05-01T21:32:21+02:00	Loïc Carrère	clip : (minicpmv) Re-enable upscaling of images smaller than the CLIP image size (#13237)
M	examples/llava/clip.cpp

commit	e0f572c8466e70d35cbd70ee536ad8fc83b2acac	79f26e9e125b21760aeb016f34bfd42a93f48351	2025-05-01T21:16:38+02:00	matteo	llama-chat : update GLM4 chat template (#13238)
M	src/llama-chat.cpp
M	tests/test-chat-template.cpp

commit	79f26e9e125b21760aeb016f34bfd42a93f48351	fc727bcdd5a311c7c69a76dbf87f4784e828c7b4	2025-05-01T13:49:39-05:00	Jeff Bolz	vulkan: Add bfloat16 support (#12554)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/contig_copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/test_bfloat16_support.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	fc727bcdd5a311c7c69a76dbf87f4784e828c7b4	b0ecbd434be024c06bf547491be444ed92e1123e	2025-05-01T13:19:31-05:00	Jeff Bolz	vulkan: Handle src1 batch dimension in non-contiguous mat-vec-mul shader (#13191)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_nc.comp

commit	b0ecbd434be024c06bf547491be444ed92e1123e	b1dd4d08e8fe40c9484422c0c5ec9bbd13b067a9	2025-05-01T20:18:56+02:00	Johannes Gäßler	test: non-cont. b in test-backend-ops -o MUL_MAT (#13187)
M	tests/test-backend-ops.cpp

commit	b1dd4d08e8fe40c9484422c0c5ec9bbd13b067a9	99881f77d82efda80b21057d84f1cc2df2f1e0f6	2025-05-01T17:07:13+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	99881f77d82efda80b21057d84f1cc2df2f1e0f6	b5769d92b4510c77691ad9e3f8b643c2ba202e53	2025-05-01T10:05:24+02:00	Daniel Bevenius	whisper : add check that target name exists (whisper/3103)
M	ggml/CMakeLists.txt

commit	b5769d92b4510c77691ad9e3f8b643c2ba202e53	8936784f7a1ec4f91637d04b77fdc90ec36ebac9	2025-04-29T15:47:55+02:00	Daniel Bevenius	ggml : suppress Windows compiler warnings (whisper/3075)
M	ggml/CMakeLists.txt

commit	8936784f7a1ec4f91637d04b77fdc90ec36ebac9	13c9a3319b65469e883c49dd1c478abedc410157	2025-05-01T17:05:42+02:00	Xuan-Son Nguyen	mtmd : add **vision** support for Mistral Small 3.1 (#13231)
M	convert_hf_to_gguf.py
M	examples/llava/README.md
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/mtmd-cli.cpp
M	examples/llava/tests.sh
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py

commit	13c9a3319b65469e883c49dd1c478abedc410157	a70183eb0079fdf6ebeaed12966338a039461b5d	2025-05-01T10:23:25+02:00	Xuan-Son Nguyen	arg : remove CURLINFO_EFFECTIVE_METHOD (#13228)
M	common/arg.cpp

commit	a70183eb0079fdf6ebeaed12966338a039461b5d	8d33d740c308fe0049515668aac0e561269afe9e	2025-05-01T03:09:41-04:00	Jared Van Bortel	llama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223)
M	src/llama-model.cpp
M	src/llama-model.h

commit	8d33d740c308fe0049515668aac0e561269afe9e	4254bb49518e0f920f14c9aadd96eefdfd38b429	2025-05-01T09:59:02+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	4254bb49518e0f920f14c9aadd96eefdfd38b429	9998540149a490200894acfe595e9a1546bab723	2025-04-30T15:20:40+02:00	Diego Devesa	ggml : fix ggml_gallocr_ptr type (ggml/1205)
M	ggml/include/ggml-cpp.h

commit	9998540149a490200894acfe595e9a1546bab723	e1e8e0991ffd9e99a445c6812bb519d5bac9f4b5	2025-04-24T18:59:06+03:00	Georgi Gerganov	cuda : fix unused variable compile warning (whisper/0)
M	ggml/src/ggml-cuda/cpy.cu

commit	e1e8e0991ffd9e99a445c6812bb519d5bac9f4b5	6f67cf1f480926391ad75ff746e0a021214bf70c	2025-04-30T23:12:59+02:00	Johannes Gäßler	CUDA: batched+noncont MMQ, refactor bs>1 MoE code (#13199)
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/getrows.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/quantize.cu
M	ggml/src/ggml-cuda/quantize.cuh
M	tests/test-backend-ops.cpp

commit	6f67cf1f480926391ad75ff746e0a021214bf70c	16a457facd996915652f6274384c87602b27d21a	2025-04-30T22:29:15+02:00	Xuan-Son Nguyen	arg : -hf do not fail if url mismatch (#13219)
M	common/arg.cpp

commit	16a457facd996915652f6274384c87602b27d21a	3e168bede4d27b35656ab8026015b87659ecbec2	2025-04-30T15:28:43-05:00	ddh0	fix typo: `n_ctx_pre_seq` -> `n_ctx_per_seq` (#13221)
M	src/llama-context.cpp

commit	3e168bede4d27b35656ab8026015b87659ecbec2	ceda28ef8e310a8dee60bf275077a3eedae8e36c	2025-04-30T16:56:24+02:00	Xuan-Son Nguyen	convert : improve model arch handling (#13122)
M	convert_hf_to_gguf.py

commit	ceda28ef8e310a8dee60bf275077a3eedae8e36c	3b127c738535d95e06abd0d43da147bc13516ad0	2025-04-30T22:25:20+09:00	Tatsuya Tanaka	llava : remove duplicate include (#13207)
M	examples/llava/clip-impl.h

commit	3b127c738535d95e06abd0d43da147bc13516ad0	e5007a5edf2692ef7151a81a61ce2716b83374e5	2025-04-30T13:52:35+01:00	Olivier Chafik	common : add -jf / --json-schema-file flag (#12011)
M	common/arg.cpp

commit	e5007a5edf2692ef7151a81a61ce2716b83374e5	416313773b53585fddcafbcb914cbbfbaeb94b1f	2025-04-30T07:38:37-05:00	Jeff Bolz	vulkan: use uint array index to avoid glslang bug (#13193)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp

commit	416313773b53585fddcafbcb914cbbfbaeb94b1f	07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa	2025-04-30T16:47:08+05:30	shalinib-ibm	ggml : fix ppc64le build (#13176)
M	ggml/src/ggml-cpu/simd-mappings.h

commit	07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa	44cd8d91ff2c9e4a0f2e3151f8d6f04c928e2571	2025-04-30T13:06:15+02:00	Xuan-Son Nguyen	convert : correct typo image_mean --> image_std (#13208)
M	convert_hf_to_gguf.py

commit	44cd8d91ff2c9e4a0f2e3151f8d6f04c928e2571	5933e6fdc9c051eea6c83b5a7608de12f9f15670	2025-04-30T17:47:35+08:00	Aaron Teo	feat(ggml-cpu): enable z17 compile (#13182)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	5933e6fdc9c051eea6c83b5a7608de12f9f15670	da84c04d8fa43ff92b172feb8130c74d062f956a	2025-04-30T10:46:32+02:00	Xuan-Son Nguyen	arg : allow using -hf offline (#13202)
M	common/arg.cpp

commit	da84c04d8fa43ff92b172feb8130c74d062f956a	a0f7016d170ca4bfe24d9a9f26c024d034af69f2	2025-04-30T10:44:07+02:00	Xuan-Son Nguyen	docker : do not build tests (#13204)
M	.devops/cpu.Dockerfile
M	.devops/cuda.Dockerfile
M	.devops/intel.Dockerfile
M	.devops/llama-cli-cann.Dockerfile
M	.devops/musa.Dockerfile
M	.devops/rocm.Dockerfile
M	.devops/vulkan.Dockerfile
M	tests/test-quantize-stats.cpp

commit	a0f7016d170ca4bfe24d9a9f26c024d034af69f2	19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f	2025-04-30T14:29:22+08:00	xiaofei	rpc : fix cache directory initialization (#13188)
M	examples/rpc/rpc-server.cpp

commit	19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f	e2e1ddb93a01ce282e304431b37e60b3cddb6114	2025-04-29T23:32:04+02:00	Johannes Gäßler	scripts: n_depth for compare-llama-bench [no ci] (#13201)
M	scripts/compare-llama-bench.py

commit	e2e1ddb93a01ce282e304431b37e60b3cddb6114	d9d398f84f96d16c308d4976f5e90222ecc2a492	2025-04-29T20:33:10+02:00	matteo	server : Prefilling assistant message in openai compatible API (#13174)
M	examples/server/utils.hpp

commit	d9d398f84f96d16c308d4976f5e90222ecc2a492	5a6398011704c31178d7b774be67856ba57647c8	2025-04-29T20:22:57+03:00	Georgi Gerganov	sampling : when top-k <= 0 -> noop (#13173)
M	include/llama.h
M	src/llama-sampling.cpp

commit	5a6398011704c31178d7b774be67856ba57647c8	cdf76586b23c67abd3ca064ee2c084c57ae240bd	2025-04-29T16:24:36+01:00	Alberto Cabrera Pérez	llama-bench: fixed size of fields to correctly map to values (#13183)
M	examples/llama-bench/llama-bench.cpp

commit	cdf76586b23c67abd3ca064ee2c084c57ae240bd	7d3af70b089bb349b5d17eb01839224c99ec1952	2025-04-29T16:00:27+02:00	Johannes Gäßler	CUDA: fix non-cont. inputs for batched mat mul (#13155)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	src/llama-model.cpp

commit	7d3af70b089bb349b5d17eb01839224c99ec1952	00e3e5a194e88e604e7c91391b9e90332888fd72	2025-04-29T13:25:53+02:00	Sigbjørn Skjæret	llama : llm_type order by size (#13177)
M	src/llama-model.cpp
M	src/llama-model.h

commit	00e3e5a194e88e604e7c91391b9e90332888fd72	e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68	2025-04-29T11:47:04+02:00	Xuan-Son Nguyen	mtmd : add qwen2vl and qwen2.5vl (#13141)
M	README.md
M	examples/llava/CMakeLists.txt
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/llava/mtmd-cli.cpp
M	examples/llava/mtmd.cpp
M	examples/llava/mtmd.h
R099	examples/llava/qwen2vl-cli.cpp	examples/llava/qwen2vl-test.cpp
M	examples/llava/tests.sh

commit	e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68	b6ce7430b7eb51f032152316880204e0a9c0470e	2025-04-29T11:00:31+02:00	Sigbjørn Skjæret	llama : set qwen3 model type sizes (#13175)
M	src/llama-model.cpp
M	src/llama-model.h

commit	b6ce7430b7eb51f032152316880204e0a9c0470e	5f5e39e1ba5dbea814e41f2a15e035d749a520bc	2025-04-29T08:45:49+02:00	Xuan-Son Nguyen	llama-graph : fix text position for mrope (#13159)
M	src/llama-graph.cpp

commit	5f5e39e1ba5dbea814e41f2a15e035d749a520bc	eaea3253244dc4bbe07f6cd81325847ccc6cf93e	2025-04-28T15:52:15-04:00	AT	model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-graph.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	eaea3253244dc4bbe07f6cd81325847ccc6cf93e	43ddab6eeeaab5a04fe5a364af0bafb0e4d35065	2025-04-28T21:23:19+02:00	Xuan-Son Nguyen	clip : fix model size display (#13153)
M	examples/llava/clip.cpp

commit	43ddab6eeeaab5a04fe5a364af0bafb0e4d35065	1831f538f720d1d99fba146f24f0a8e970838cc4	2025-04-28T21:00:20+03:00	Ville Vesilehto	fix(rpc): Improve input validation and error handling (#13069)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	1831f538f720d1d99fba146f24f0a8e970838cc4	4e87962e34a4b257ec374c4baf6b1568554b81a9	2025-04-28T20:20:39+05:30	Vishal Agarwal	llama-bench: add `-d` depth arg (#13096)
M	examples/llama-bench/README.md
M	examples/llama-bench/llama-bench.cpp

commit	4e87962e34a4b257ec374c4baf6b1568554b81a9	fb0471d1753824e75474c24f82fbdd54c94dceda	2025-04-28T16:12:56+02:00	Xuan-Son Nguyen	mtmd : fix glm-edge redundant token count (#13139)
M	examples/llava/mtmd.cpp
M	src/llama-chat.cpp
M	tests/test-chat-template.cpp

commit	fb0471d1753824e75474c24f82fbdd54c94dceda	d2b2031e5f11b826dcc718138642f147a2009665	2025-04-28T06:45:40-07:00	pockers21	context : do not clear output buffer on reserve (#13152)
M	src/llama-context.cpp

commit	d2b2031e5f11b826dcc718138642f147a2009665	5fa9e63be82225fb3249c76f39ddda3e5bdec0a3	2025-04-28T14:20:56+02:00	Xuan-Son Nguyen	llama : (mrope) allow using normal 1D position for text token (#13138)
M	examples/llava/qwen2vl-cli.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h

commit	5fa9e63be82225fb3249c76f39ddda3e5bdec0a3	a4c340f974f9b7ac0c1aae897aabaa54549a97e5	2025-04-28T12:18:59+02:00	Xuan-Son Nguyen	clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
M	examples/llava/clip.cpp

commit	a4c340f974f9b7ac0c1aae897aabaa54549a97e5	d0a417f3c7a5a22ef05b3b76d91dbe1d3362bf0c	2025-04-28T15:03:25+05:30	Akarshan Biswas	SYCL: Add all missing unary kernels (#13074)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	d0a417f3c7a5a22ef05b3b76d91dbe1d3362bf0c	43f2b07193cbcccd266734320ea9b948f5a01926	2025-04-28T12:10:18+03:00	Georgi Gerganov	readme : update hot topics (#13150)
M	README.md

commit	43f2b07193cbcccd266734320ea9b948f5a01926	e5d6c2554e7597665e26991a93fa2f3d16c79ad5	2025-04-28T11:57:19+03:00	Georgi Gerganov	common : fix noreturn compile warning (#13151)
M	common/arg.cpp

commit	e5d6c2554e7597665e26991a93fa2f3d16c79ad5	f0dd6a1926cdb2f4183a937deee40db26ef8f1da	2025-04-28T10:11:58+02:00	Xuan-Son Nguyen	llama-chat : fix typo GML --> GLM (#13143)
M	src/llama-chat.cpp
M	src/llama-chat.h

commit	f0dd6a1926cdb2f4183a937deee40db26ef8f1da	69699be48a6b94570773532850667f1591dc5bbe	2025-04-28T15:33:28+08:00	R0CKSTAR	musa: fix typo in cc control (#13144)
M	ggml/src/ggml-cuda/common.cuh

commit	69699be48a6b94570773532850667f1591dc5bbe	85f36e5e7173eef7c671c778db44c034e1d0ab19	2025-04-28T09:29:26+02:00	Johannes Gäßler	CUDA: fix q_nope_absorbed prec for DS 2 Lite f16 (#13137)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	src/llama-model.cpp

commit	85f36e5e7173eef7c671c778db44c034e1d0ab19	c0a97b762e5ec767dc414f0dc4979befd4c09a52	2025-04-28T07:16:59+02:00	Xuan-Son Nguyen	arg : fix unused variable (#13142)
M	common/arg.cpp

commit	c0a97b762e5ec767dc414f0dc4979befd4c09a52	ced44be34290fab450f8344efa047d8a08e723b4	2025-04-27T14:48:26-07:00	4onen	llama-bench : Add `--override-tensors` arg (#12922)
M	examples/llama-bench/llama-bench.cpp

commit	ced44be34290fab450f8344efa047d8a08e723b4	e291450b7602d7a36239e4ceeece37625f838373	2025-04-27T21:57:32+02:00	matteo	llama-chat : fix wrong template in GLM4-0414 (#13140)
M	convert_hf_to_gguf.py
M	src/llama-chat.cpp

commit	e291450b7602d7a36239e4ceeece37625f838373	59e991c23cc44cb5fb657e7b9358cac21fb79828	2025-04-27T19:22:49+08:00	R0CKSTAR	musa: fix build warning (#13129)
M	ggml/src/ggml-cuda/cpy.cu

commit	59e991c23cc44cb5fb657e7b9358cac21fb79828	ca2bb89eac2097ab4620448737e58af8452e444b	2025-04-27T18:43:37+08:00	LostRuins Concedo	Fixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133)
M	examples/llava/clip.cpp

commit	ca2bb89eac2097ab4620448737e58af8452e444b	2d451c80590b9ac250322769ac13d3b4870dbcf7	2025-04-27T16:10:34+08:00	HimariO	clip : Add Qwen2.5VL support (#12402)
M	convert_hf_to_gguf.py
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/qwen2_vl_surgery.py
M	examples/llava/qwen2vl-cli.cpp
M	examples/llava/tests.sh

commit	2d451c80590b9ac250322769ac13d3b4870dbcf7	4753791e70acd4d4e02f2098f14a03df26c992bd	2025-04-26T22:58:12+02:00	Xuan-Son Nguyen	common : add common_remote_get_content (#13123)
M	common/arg.cpp
M	common/arg.h
M	tests/test-arg-parser.cpp

commit	4753791e70acd4d4e02f2098f14a03df26c992bd	77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba	2025-04-26T22:39:47+02:00	Xuan-Son Nguyen	clip : improve projector naming (#13118)
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/clip.h

commit	77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba	d5fe4e81bd447124836ecfb47d794f8768665b9f	2025-04-26T22:05:31+08:00	SXX	ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107)
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml.c

commit	d5fe4e81bd447124836ecfb47d794f8768665b9f	295354ea6848a77bdee204ee1c971d9b92ffcca9	2025-04-26T10:10:20+02:00	frob	grammar : handle maxItems == 0 in JSON schema (#13117)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public_legacy/json-schema-to-grammar.mjs
M	tests/test-json-schema-to-grammar.cpp

commit	295354ea6848a77bdee204ee1c971d9b92ffcca9	558a764713468f26f5a163d25a22100c9a04a48f	2025-04-25T19:40:11+02:00	Diego Devesa	llama : fix K-shift with quantized K and BLAS backend (#13113)
M	src/llama-context.cpp
M	src/llama-context.h

commit	558a764713468f26f5a163d25a22100c9a04a48f	edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e	2025-04-25T14:38:34+02:00	City	Force FP32 compute in GLM4 FFN Down (#13101)
M	src/llama-graph.cpp

commit	edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e	514c45608f93f66106a712dee1abe062099ce790	2025-04-25T14:31:42+02:00	Xuan-Son Nguyen	clip : fix pixtral on some GPU backends (#13097)
M	examples/llava/clip.cpp
M	tests/test-backend-ops.cpp

commit	514c45608f93f66106a712dee1abe062099ce790	553a5c3a9fdf771be2101bc3529937963f817457	2025-04-25T17:37:51+08:00	Neo Zhang Jianyu	change the reorder tensor from init to execute OP (#13003)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	553a5c3a9fdf771be2101bc3529937963f817457	13be08daf992c89d5169518229b3740041c0f419	2025-04-25T10:08:08+03:00	Radoslav Gerganov	rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943)
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	13be08daf992c89d5169518229b3740041c0f419	226251ed56b85190e18a1cca963c45b888f4953c	2025-04-24T22:17:04+02:00	Xuan-Son Nguyen	clip : remove boi/eoi embeddings for GLM-edge model (#13081)
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/mtmd.cpp

commit	226251ed56b85190e18a1cca963c45b888f4953c	87616f0680947800ecba3e9f6bc6e101943bf8e6	2025-04-24T22:29:22+03:00	Georgi Gerganov	embeddings : fix batch sizes (#13076)
M	examples/embedding/embedding.cpp

commit	87616f0680947800ecba3e9f6bc6e101943bf8e6	63b4911494afe04778c61b9c19019341d71c99fc	2025-04-24T17:22:27+03:00	Georgi Gerganov	ggml : fix trailing whitespaces (#0)
M	ggml/src/ggml.c

commit	63b4911494afe04778c61b9c19019341d71c99fc	c6e8cc28c15166dba15629dba6a7366d4d5955ca	2025-04-24T16:47:43+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	c6e8cc28c15166dba15629dba6a7366d4d5955ca	b10d8bfdb1dac40cce34e8860ca5ec7d950c3a44	2025-04-17T14:16:45+02:00	Acly	ggml : Depthwise 2D convolution (ggml/1152)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml.c

commit	b10d8bfdb1dac40cce34e8860ca5ec7d950c3a44	13b4548877326fdabee3e831b8cfd65d9844383c	2025-04-24T15:57:10+02:00	Johannes Gäßler	CUDA: use switch statements in constexpr functions (#13095)
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu

commit	13b4548877326fdabee3e831b8cfd65d9844383c	572b3141d343d7f947bf53b57513016e90db5680	2025-04-24T16:00:10+03:00	Georgi Gerganov	cmake : do not include ./src as public for libllama (#13062)
M	common/arg.cpp
M	examples/CMakeLists.txt
D	examples/gbnf-validator/CMakeLists.txt
D	examples/quantize-stats/CMakeLists.txt
M	grammars/README.md
M	src/CMakeLists.txt
M	tests/CMakeLists.txt
M	tests/test-chat.cpp
R098	examples/gbnf-validator/gbnf-validator.cpp	tests/test-gbnf-validator.cpp
M	tests/test-grammar-integration.cpp
M	tests/test-grammar-llguidance.cpp
M	tests/test-grammar-parser.cpp
M	tests/test-json-schema-to-grammar.cpp
M	tests/test-llama-grammar.cpp
R099	examples/quantize-stats/quantize-stats.cpp	tests/test-quantize-stats.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-spm.cpp

commit	572b3141d343d7f947bf53b57513016e90db5680	7c727fbe39150fbe8381f4fa43fed08719ebebe6	2025-04-24T15:44:05+03:00	Georgi Gerganov	clang-tidy : disable warning about missing math parenthesis (#13091)
M	.clang-tidy

commit	7c727fbe39150fbe8381f4fa43fed08719ebebe6	80982e815e67bae2442237f4e11466f44c9a2988	2025-04-24T14:04:14+02:00	Xuan-Son Nguyen	arg : add --no-mmproj-offload (#13093)
M	common/arg.cpp
M	common/common.h
M	examples/llava/mtmd-cli.cpp

commit	80982e815e67bae2442237f4e11466f44c9a2988	7604a7d6b80e78eef8f275fc700d0f64820d672f	2025-04-24T12:14:13+02:00	Xuan-Son Nguyen	arg : clean up handling --mmproj with -hf (#13082)
M	common/arg.cpp
M	common/common.h
M	examples/llava/mtmd-cli.cpp

commit	7604a7d6b80e78eef8f275fc700d0f64820d672f	b3b6d862cfdf190e1b9ad961639a25f5ebc0c7e3	2025-04-24T10:38:30+03:00	Georgi Gerganov	metal : fix floating-point range of attention scores in FA kernels (#13090)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	b3b6d862cfdf190e1b9ad961639a25f5ebc0c7e3	56304069599f4dd9749d94b9bca2c2c65bb27c02	2025-04-24T07:18:33Z	Eve	vulkan: matmul gcn tuning (#13016)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	56304069599f4dd9749d94b9bca2c2c65bb27c02	ecda2ec4b347031a9b8a89ee2efc664ce63f599c	2025-04-24T02:32:35+05:00	pl752	llama-mtmd-cli: Sigint rework in mtmd vision example (#13080)
M	examples/llava/mtmd-cli.cpp

commit	ecda2ec4b347031a9b8a89ee2efc664ce63f599c	eb1776b15a32d832f1266deeeab75b9d255c5849	2025-04-23T20:21:59+02:00	Xuan-Son Nguyen	mtmd : Support Pixtral 12B (#13065)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	docs/multimodal/gemma3.md
M	examples/llava/README.md
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/mtmd.cpp
M	examples/llava/tests.sh
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
A	models/ggml-vocab-pixtral.gguf.inp
A	models/ggml-vocab-pixtral.gguf.out
M	src/llama-vocab.cpp

commit	eb1776b15a32d832f1266deeeab75b9d255c5849	2cca6c01e46d2fc1124d15730273ed2acdad1016	2025-04-23T22:59:14+08:00	piDack	convert : Append mult-eos,half-rope,bos to GLM4-0414 and Z (#13021)
M	convert_hf_to_gguf.py

commit	2cca6c01e46d2fc1124d15730273ed2acdad1016	658987cfc9d752dca7758987390d5fb1a7a0a54a	2025-04-23T10:32:49+03:00	Radoslav Gerganov	rpc : add command line option for number of threads for the CPU backend (#13060)
M	examples/rpc/rpc-server.cpp

commit	658987cfc9d752dca7758987390d5fb1a7a0a54a	dc39a5e7a84815a90fa0c515ed8927870cf858c9	2025-04-22T21:27:40+02:00	Johannes Gäßler	CUDA: noncont MMVQ + batched bs1 MUL_MAT_ID (#13014)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/mmv.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/mmvq.cuh
M	ggml/src/ggml-cuda/quantize.cu
M	ggml/src/ggml-cuda/quantize.cuh
M	ggml/src/ggml-cuda/vecdotq.cuh
M	tests/test-backend-ops.cpp

commit	dc39a5e7a84815a90fa0c515ed8927870cf858c9	ab47dec3d37aa1927c2ec590e166b76141374ed3	2025-04-22T16:24:54+02:00	Xuan-Son Nguyen	mtmd : support SmolVLM (version 1 and 2) (#13050)
M	convert_hf_to_gguf.py
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/mtmd.cpp
M	examples/llava/tests.sh
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-chat.cpp
M	src/llama-chat.h

commit	ab47dec3d37aa1927c2ec590e166b76141374ed3	7b53389c24a507564be39e1ea82746a39749059b	2025-04-22T16:16:10+03:00	Georgi Gerganov	security : add note about RPC and server functionality (#13061)
M	SECURITY.md

commit	7b53389c24a507564be39e1ea82746a39749059b	243453533e029334181dda50d911d5fc5a2b2486	2025-04-22T16:15:51+03:00	Georgi Gerganov	metal : add memory pool for temp allocs (#12850)
M	ggml/src/ggml-metal/ggml-metal.m

commit	243453533e029334181dda50d911d5fc5a2b2486	1d735c0b4fa0551c51c2f4ac888dd9a01f447985	2025-04-22T10:37:00+02:00	Xuan-Son Nguyen	llava : update documentations (#13055)
M	common/arg.cpp
R096	examples/llava/MobileVLM-README.md	docs/multimodal/MobileVLM.md
R082	examples/llava/README-gemma3.md	docs/multimodal/gemma3.md
R080	examples/llava/README-glmedge.md	docs/multimodal/glmedge.md
R092	examples/llava/README-granitevision.md	docs/multimodal/granitevision.md
A	docs/multimodal/llava.md
R073	examples/llava/README-minicpmo2.6.md	docs/multimodal/minicpmo2.6.md
R072	examples/llava/README-minicpmv2.5.md	docs/multimodal/minicpmv2.5.md
R071	examples/llava/README-minicpmv2.6.md	docs/multimodal/minicpmv2.6.md
M	examples/llava/README.md
M	examples/llava/android/adb_run.sh
D	examples/llava/gemma3_convert_encoder_to_gguf.py

commit	1d735c0b4fa0551c51c2f4ac888dd9a01f447985	5368ddda7a262d195b54687a31009dcc1f8b1602	2025-04-21T18:13:51+02:00	Diego Devesa	ggml : add SSE 4.2 and x64 base variant for CPUs without AVX (#12871)
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/cpu-feats-x86.cpp

commit	5368ddda7a262d195b54687a31009dcc1f8b1602	84a9bf2fc2875205f0806fbbfbb66dc67204094c	2025-04-21T19:13:30+05:30	Akarshan Biswas	SYCL: Add non-contiguous support in ROPE (#12993)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/rope.hpp

commit	84a9bf2fc2875205f0806fbbfbb66dc67204094c	2016f07bd106c73699ecbaace80f55db5ed95dac	2025-04-21T15:32:58+02:00	Xuan-Son Nguyen	mtmd : merge llava, gemma3 and minicpmv CLI into single `llama-mtmd-cli` (#13012)
M	README.md
M	common/arg.cpp
M	examples/llava/CMakeLists.txt
A	examples/llava/deprecation-warning.cpp
D	examples/llava/llava-cli.cpp
D	examples/llava/minicpmv-cli.cpp
R082	examples/llava/gemma3-cli.cpp	examples/llava/mtmd-cli.cpp
M	examples/llava/mtmd.cpp
M	examples/llava/tests.sh
M	src/llama-chat.cpp

commit	2016f07bd106c73699ecbaace80f55db5ed95dac	6602304814e679cc8c162bb760a034aceb4f8965	2025-04-20T23:29:36+02:00	Xuan-Son Nguyen	convert : experimental support for `--mmproj` flag (#13023)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	examples/llava/clip-impl.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py

commit	6602304814e679cc8c162bb760a034aceb4f8965	66168204be9559dc841f06f0025f3da01d9a8546	2025-04-20T03:15:41-07:00	Jeffrey Morgan	llava: fix errors in clip.h on certain compilers (#13030)
M	examples/llava/clip.h

commit	66168204be9559dc841f06f0025f3da01d9a8546	4ba9d711ba0a5bf0be00936d3258d4a5e4164d4f	2025-04-20T03:50:02-05:00	Jeff Bolz	vulkan: support noncontiguous rms_norm (#13031)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp

commit	4ba9d711ba0a5bf0be00936d3258d4a5e4164d4f	00137157fca3d17b90380762b4d7cc158d385bd3	2025-04-19T22:28:40-07:00	Jeffrey Morgan	metal: add neg operator (#13029)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	00137157fca3d17b90380762b4d7cc158d385bd3	fb28f4f80efb5a2990a6a240433b02e259b0dbb1	2025-04-19T13:05:03-03:00	bandoti	Disable CI cross-compile builds (#13022)
M	.github/workflows/build.yml

commit	fb28f4f80efb5a2990a6a240433b02e259b0dbb1	37b9f0d29d7301dd0ec5dfae8f357ccee96325d7	2025-04-19T16:26:38+02:00	Sigbjørn Skjæret	gguf-py : fix upload python package workflow (#13020)
M	gguf-py/pyproject.toml

commit	37b9f0d29d7301dd0ec5dfae8f357ccee96325d7	6408210082cc0a61b992b487be7e2ff2efbb9e36	2025-04-19T09:15:45+02:00	Xuan-Son Nguyen	clip : refactor, add `image_manipulation` and `llava_uhd` classes (#13011)
M	examples/llava/clip.cpp

commit	6408210082cc0a61b992b487be7e2ff2efbb9e36	aff9d107b066c9d464f7ab1324280acfdcebf569	2025-04-18T16:02:55-04:00	Daniel Tang	main : Fix Ctrl+D/newline handling (#12951)
M	examples/main/main.cpp

commit	aff9d107b066c9d464f7ab1324280acfdcebf569	35370ba94593c3abc9550328377d461fc4f822b7	2025-04-18T12:30:41-06:00	Chris Thompson	gguf-py : GGUF Editor GUI - Python + Qt6 (#12930)
M	gguf-py/README.md
M	gguf-py/gguf/scripts/__init__.py
A	gguf-py/gguf/scripts/gguf_editor_gui.py
M	gguf-py/pyproject.toml
M	requirements/requirements-all.txt
A	requirements/requirements-gguf_editor_gui.txt

commit	35370ba94593c3abc9550328377d461fc4f822b7	8d6600576318dfc6b091fca744b0fd36a5e5255f	2025-04-18T19:58:12+02:00	Xuan-Son Nguyen	server : use std::move whenever possible (#12936)
M	examples/server/server.cpp

commit	8d6600576318dfc6b091fca744b0fd36a5e5255f	b9154ecff93ff54dc554411eb844a2a654be49f2	2025-04-18T19:27:56+05:30	Akarshan Biswas	SYCL: Refactor and enable FP16 in binary broadcast OPs (#12975)
M	ggml/src/ggml-sycl/backend.hpp
A	ggml/src/ggml-sycl/binbcast.cpp
A	ggml/src/ggml-sycl/binbcast.hpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	b9154ecff93ff54dc554411eb844a2a654be49f2	2db9ba1464f3de0aceb2b5289963e69fc369cb66	2025-04-18T10:04:51+02:00	Xuan-Son Nguyen	mtmd : add methods to access `mtmd_image_tokens` (#12906)
M	examples/llava/gemma3-cli.cpp
M	examples/llava/mtmd.cpp
M	examples/llava/mtmd.h

commit	2db9ba1464f3de0aceb2b5289963e69fc369cb66	2f74c354c0f752ed9aabf7d3a350e6edebd7e744	2025-04-18T10:13:42+03:00	Radoslav Gerganov	rpc : add RPC_CMD_HELLO (#12955)
M	examples/rpc/rpc-server.cpp
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	2f74c354c0f752ed9aabf7d3a350e6edebd7e744	207c22ec2d6d793fc70830138617d1e016c5151c	2025-04-17T18:16:36+03:00	Georgi Gerganov	graph : make FA compatible with MLA + add initial Metal kernels (#12953)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-model.cpp
M	tests/test-backend-ops.cpp

commit	207c22ec2d6d793fc70830138617d1e016c5151c	7a395f67a7a02bb361d944b816d6e933889e28e1	2025-04-17T14:19:42+01:00	Alan Gray	ggml: Re-enable CUDA graphs in presence of CONT and DUP nodes (#12970)
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/cpy.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	7a395f67a7a02bb361d944b816d6e933889e28e1	971f245b3b5f3f55991bb779cb541b00f82eea1d	2025-04-17T20:34:16+08:00	hipudding	CANN: Add support for async operator submission (#12864)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	971f245b3b5f3f55991bb779cb541b00f82eea1d	12b17501e6015ffe568ac54fdf08e6580833bf1b	2025-04-17T01:37:05-07:00	Mikko Juola	llama : recognize IBM Granite 3.3 FIM tokens (#12988)
M	src/llama-vocab.cpp

commit	12b17501e6015ffe568ac54fdf08e6580833bf1b	015022bb53387baa8b23817ac03743705c7d472b	2025-04-17T06:25:57+09:00	kimminsu	opencl: fix incorrect local_size index in profiling log (#12868)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	015022bb53387baa8b23817ac03743705c7d472b	b43d89e311c5e7fbf62e5ec3c0401eb536677267	2025-04-16T13:37:25-05:00	Jeff Bolz	vulkan: enable coopmat2 FA gqa and split_k optimizations more often (#12931)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	tests/test-backend-ops.cpp

commit	b43d89e311c5e7fbf62e5ec3c0401eb536677267	80f19b41869728eeb6a26569957b92a773a2b2c6	2025-04-16T16:21:05+08:00	Chenguang Li	CANN: Add 310P operator support check (#12962)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	80f19b41869728eeb6a26569957b92a773a2b2c6	f8f820cc4dc37032d5375972ba904ce53043445d	2025-04-15T12:26:00-07:00	lhez	opencl: split `ggml-opencl.cl` into multiple files and cleanup (#12886)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/add.cl
A	ggml/src/ggml-opencl/kernels/clamp.cl
A	ggml/src/ggml-opencl/kernels/cpy.cl
R069	ggml/src/ggml-opencl/kernels/ggml-opencl_cvt.cl	ggml/src/ggml-opencl/kernels/cvt.cl
A	ggml/src/ggml-opencl/kernels/diag_mask_inf.cl
A	ggml/src/ggml-opencl/kernels/gelu.cl
R100	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle.cl	ggml/src/ggml-opencl/kernels/gemv_noshuffle.cl
R100	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle_general.cl	ggml/src/ggml-opencl/kernels/gemv_noshuffle_general.cl
A	ggml/src/ggml-opencl/kernels/get_rows.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl_im2col.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl_mm.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_16.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_32.cl
D	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_32_16.cl
A	ggml/src/ggml-opencl/kernels/im2col_f16.cl
A	ggml/src/ggml-opencl/kernels/im2col_f32.cl
A	ggml/src/ggml-opencl/kernels/mul.cl
R100	ggml/src/ggml-opencl/kernels/ggml-opencl_mul_mat_Ab_Bi_8x4.cl	ggml/src/ggml-opencl/kernels/mul_mat_Ab_Bi_8x4.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_f16_f16.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_f16_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_f16_f32_1row.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_f16_f32_l4.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_f32_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q4_0_f32.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q4_0_f32_1d_16x_flat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q4_0_f32_1d_8x_flat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q4_0_f32_8x_flat.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q4_0_f32_v.cl
A	ggml/src/ggml-opencl/kernels/mul_mv_q6_k.cl
A	ggml/src/ggml-opencl/kernels/norm.cl
A	ggml/src/ggml-opencl/kernels/relu.cl
A	ggml/src/ggml-opencl/kernels/rms_norm.cl
A	ggml/src/ggml-opencl/kernels/rope.cl
A	ggml/src/ggml-opencl/kernels/scale.cl
A	ggml/src/ggml-opencl/kernels/silu.cl
A	ggml/src/ggml-opencl/kernels/softmax_4_f16.cl
A	ggml/src/ggml-opencl/kernels/softmax_4_f32.cl
A	ggml/src/ggml-opencl/kernels/softmax_f16.cl
A	ggml/src/ggml-opencl/kernels/softmax_f32.cl
A	ggml/src/ggml-opencl/kernels/transpose.cl

commit	f8f820cc4dc37032d5375972ba904ce53043445d	54a72720432810c89c2693f34908b60b88da1e46	2025-04-15T14:45:05+03:00	Georgi Gerganov	metal : add FA-vec kernels for head size 96 (#12952)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	54a72720432810c89c2693f34908b60b88da1e46	84778e97703740d8ac5fb64e14d83b80eafa0f3c	2025-04-15T19:08:55+08:00	hipudding	CANN: Add x86 build ci (#12950)
M	.github/workflows/build.yml
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	84778e97703740d8ac5fb64e14d83b80eafa0f3c	510676475f885ec064ff147af9f20ee7a9b12a50	2025-04-15T17:20:38+08:00	David Huang	CUDA/HIP: Share the same unified memory allocation logic. (#12934)
M	Makefile
M	docs/build.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-hip/CMakeLists.txt

commit	510676475f885ec064ff147af9f20ee7a9b12a50	daa422881a0ec7944771bcc8ff8de34d11f5bd3b	2025-04-15T14:07:42+05:30	Akarshan Biswas	SYCL: Add ROPE vision kernel (#12887)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/rope.cpp

commit	daa422881a0ec7944771bcc8ff8de34d11f5bd3b	eccc7a1602f0752507de4aaad1008b9618a282c8	2025-04-15T07:49:57+01:00	Juk Armstrong	llama : DeepSeek V2/V3 MLA implementation (#12801)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-kv-cache.cpp
M	src/llama-model.cpp
M	src/llama-model.h

commit	eccc7a1602f0752507de4aaad1008b9618a282c8	0019279bb56f028e4eee19b59b19750736c719f7	2025-04-15T11:52:36+05:30	Srihari-mcw	ggml : Add AVX512 implementation of GEMM - Q4_Kx8 (#12829)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	0019279bb56f028e4eee19b59b19750736c719f7	b0c75ac9f93322b45e3766e149417334b4fd1ed9	2025-04-15T10:09:35+08:00	Chenguang Li	CANN: Opt ROPE optimization (#12865)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	b0c75ac9f93322b45e3766e149417334b4fd1ed9	d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33	2025-04-15T10:04:24+08:00	Xinpeng Dou	CANN: Optimize CANN buffer pool memory management (#12875)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33	75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088	2025-04-15T01:18:20+08:00	Russyyds	Add performance print for gemma3 in example (#12929)
M	examples/llava/gemma3-cli.cpp

commit	75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088	c772d549264c1be058411312a54049e0dc86a037	2025-04-14T17:53:53+05:30	Akarshan Biswas	SYCL: Fix im2col (#12910)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/im2col.cpp

commit	c772d549264c1be058411312a54049e0dc86a037	81c7e64fc239288e91a58adad9145110e0353822	2025-04-14T13:59:34+03:00	Radoslav Gerganov	rpc : use ggml_context_ptr (#12938)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	81c7e64fc239288e91a58adad9145110e0353822	526739b879c9d6a702ed681138611197fa4d3f18	2025-04-14T18:19:07+08:00	Neo Zhang Jianyu	dsiable curl lib check, this action is missed by commit bd3f59f81289b920bcc597a208c14f55e39ed37e (#12761) (#12937)
M	examples/sycl/build.sh

commit	526739b879c9d6a702ed681138611197fa4d3f18	a25355e2643b1feb2fcbbc4c00312aa86370d858	2025-04-14T08:52:10+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a25355e2643b1feb2fcbbc4c00312aa86370d858	e959d32b1c16c02c0bc0bcdc7bc3f7077bc32f99	2025-04-11T12:14:19+05:30	cmdr2	cpu: fix cpu backend's supports-op for GET_ROWS_BACK. fixes a fatal when running test-backend-ops with only the CPU backend (ggml/1190)
M	ggml/src/ggml-cpu/ggml-cpu.cpp

commit	e959d32b1c16c02c0bc0bcdc7bc3f7077bc32f99	307bfa253dea07c9270e78fa53b133504e9c3c9d	2025-04-14T13:47:55+08:00	SXX	ggml: use _mm[512/256]_dpbusd[_avx]_epi32 to directly accumulate into the result register (#12773)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	307bfa253dea07c9270e78fa53b133504e9c3c9d	71e90e8813f90097701e62f7fce137d96ddf41e2	2025-04-13T22:12:21+01:00	Alan Gray	ggml: disable CUDA graphs for unsupported DUP and CONT node types (#12891)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	71e90e8813f90097701e62f7fce137d96ddf41e2	bc091a4dc585af25c438c8473285a8cfec5c7695	2025-04-13T19:29:28+01:00	Ed Addario	quantize: Handle user-defined quantization levels for additional tensors (#12511)
M	examples/quantize/quantize.cpp
M	include/llama.h
M	src/llama-quant.cpp

commit	bc091a4dc585af25c438c8473285a8cfec5c7695	a4837577aae59c0ae640f3810094724bcac6bb28	2025-04-12T21:03:39+05:30	Prajwal B Mehendarkar	common : Define cache directory on AIX (#12915)
M	common/common.cpp
M	examples/rpc/rpc-server.cpp

commit	a4837577aae59c0ae640f3810094724bcac6bb28	e59ea539b83d2c7947c99bd350549364dbba450c	2025-04-12T03:44:48-05:00	Jeff Bolz	vulkan: use aligned loads for flash attention mask (#12853)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	e59ea539b83d2c7947c99bd350549364dbba450c	c94085df2871d2cad11f6411304d7798d7dd4cdd	2025-04-12T01:29:03-04:00	Matt Clayton	llava: Fix cpu-only clip image encoding sefault (#12907)
M	examples/llava/clip.cpp

commit	c94085df2871d2cad11f6411304d7798d7dd4cdd	e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca	2025-04-11T23:37:41+03:00	Georgi Gerganov	server : add VSCode's Github Copilot Chat support (#12896)
M	examples/server/server.cpp

commit	e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca	b6930ebc421e20399663bbd3bc7b7266d5236d06	2025-04-11T13:04:14-07:00	yuri@FreeBSD	rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903)
M	examples/rpc/rpc-server.cpp

commit	b6930ebc421e20399663bbd3bc7b7266d5236d06	68b08f36d047bfa048ebd7d16262c53bf9ece701	2025-04-11T12:47:52-07:00	Olivier Chafik	`tool-call`: fix non-tool-calling grammar crashes w/ Qwen / Hermes 2 templates (#12900)
M	common/chat.cpp
M	tests/test-chat.cpp

commit	68b08f36d047bfa048ebd7d16262c53bf9ece701	578754b3157d662c2fdd51eaa62b6c1f43d3172c	2025-04-11T12:45:44-07:00	yuri@FreeBSD	common : Define cache directory on FreeBSD (#12892)
M	common/common.cpp

commit	578754b3157d662c2fdd51eaa62b6c1f43d3172c	b2034c2b55b36b2192bdefb3b295db2a911370f5	2025-04-11T15:32:14+02:00	Ewan Crawford	sycl: Support sycl_ext_oneapi_limited_graph (#12873)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	b2034c2b55b36b2192bdefb3b295db2a911370f5	06bb53ad9b6e6d92b6ab6979927530080b1c990c	2025-04-11T20:01:56+08:00	tastelikefeet	contrib: support modelscope community (#12664)
M	README.md
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/run/run.cpp

commit	06bb53ad9b6e6d92b6ab6979927530080b1c990c	0c509239445088f21265580b86733c5b184261d9	2025-04-11T18:10:10+08:00	Yuxuan Zhang	llama-model : add Glm4Model implementation for GLM-4-0414 (#12867)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	0c509239445088f21265580b86733c5b184261d9	fccf9cae83e6c6cd31a0ecb403d237638e427d0a	2025-04-11T12:09:39+02:00	Xuan-Son Nguyen	clip : use smart pointer (⚠️ breaking change) (#12869)
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/llava/mtmd.cpp

commit	fccf9cae83e6c6cd31a0ecb403d237638e427d0a	ec6c09d0fac1f2699c3ea1994e10482cb4b95e0f	2025-04-11T13:33:50+05:30	Akarshan Biswas	SYCL: Add fp16 type support to unary op kernels (#12788)
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	ec6c09d0fac1f2699c3ea1994e10482cb4b95e0f	8ac9f5d765f2b1b7f821873618c0cff68ca59bc8	2025-04-11T00:49:09-07:00	Daniel Han	convert : Llama4 RoPE fix (#12889)
M	convert_hf_to_gguf.py

commit	8ac9f5d765f2b1b7f821873618c0cff68ca59bc8	12e9158f25cb47e97ca9b8083e1ec7415f262260	2025-04-11T15:26:17+08:00	R0CKSTAR	ci : Replace freediskspace to free_disk_space in docker.yml (#12861)
M	.github/workflows/docker.yml

commit	12e9158f25cb47e97ca9b8083e1ec7415f262260	5b1f13cb64dbb0de7e95dae86725928d350c188c	2025-04-11T09:24:34+02:00	Daniel Bevenius	xcf : add check for visionos build version (#12854)
M	build-xcframework.sh

commit	5b1f13cb64dbb0de7e95dae86725928d350c188c	8b91d5355a84bbb5a73fd23fb658272473240efe	2025-04-11T09:23:37+02:00	Xuan-Son Nguyen	convert : proper tensor name mapping for llama4 (#12870)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/tensor_mapping.py

commit	8b91d5355a84bbb5a73fd23fb658272473240efe	0fed24c34787d2aa916ed204db88889591ad6e55	2025-04-11T08:49:50+02:00	Xuan-Son Nguyen	llama : correct rms norm for llama 4 (#12882)
M	src/llama-model.cpp

commit	0fed24c34787d2aa916ed204db88889591ad6e55	47ba87d0a4f91eb181ea60f8a7fc2539b123aeaf	2025-04-11T13:20:07+08:00	Aaron Teo	ggml: fix compilation error s390x (#12848)
M	ggml/src/ggml-cpu/simd-mappings.h

commit	47ba87d0a4f91eb181ea60f8a7fc2539b123aeaf	1d2b613445bab6b179296aa63c8ee346fb947cc4	2025-04-11T00:08:23+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1d2b613445bab6b179296aa63c8ee346fb947cc4	eb420e11484ef32cc1abedb2a26ecef1bbf1e31b	2025-04-11T00:04:25+03:00	Georgi Gerganov	tests : fix init order (#0)
M	tests/test-backend-ops.cpp

commit	eb420e11484ef32cc1abedb2a26ecef1bbf1e31b	cb79c2e7fa28e874694c14598c1fd2fde82263e1	2025-04-10T23:59:16+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	cb79c2e7fa28e874694c14598c1fd2fde82263e1	fe92821ea9ae53f3088cf2699a9e102448295fa0	2025-04-10T17:53:08+05:30	cmdr2	ggml: don't include arm_neon.h when using CUDA 12 with ARM Neon (ggml/1187)
M	ggml/src/ggml-impl.h

commit	fe92821ea9ae53f3088cf2699a9e102448295fa0	459895c32629e36cc3ca53bf3596d3e1322cfe09	2025-04-09T12:32:13+02:00	Diego Devesa	ggml : add bilinear upscale support (ggml/1185)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	459895c32629e36cc3ca53bf3596d3e1322cfe09	e4bf72d631434b38656cb97e2411826d900433e8	2025-04-09T12:31:34+02:00	Diego Devesa	ggml : add more generic custom op, remove deprecated custom ops (ggml/1183)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-cpu/ops.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c

commit	e4bf72d631434b38656cb97e2411826d900433e8	8b9cc7cdd8a0dcf0176c60c755322c95b5965299	2025-04-10T23:59:01+03:00	Georgi Gerganov	scripts : fix sync-ggml-am.sh
M	scripts/sync-ggml-am.sh

commit	8b9cc7cdd8a0dcf0176c60c755322c95b5965299	64eda5deb9859e87a020e56bab5d2f9ca956f1de	2025-04-10T22:57:16+02:00	Xuan-Son Nguyen	llava : introduce libmtmd (#12849)
M	examples/llava/CMakeLists.txt
M	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/gemma3-cli.cpp
A	examples/llava/mtmd.cpp
A	examples/llava/mtmd.h

commit	64eda5deb9859e87a020e56bab5d2f9ca956f1de	fe5b78c89670b2f37ecb216306bed3e677b49d9f	2025-04-10T17:24:44+02:00	Xuan-Son Nguyen	convert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/utility.py

commit	fe5b78c89670b2f37ecb216306bed3e677b49d9f	11d07e1e69138b46375e9267b31acd58e3813577	2025-04-10T08:51:52+08:00	Chenguang Li	CANN: Support more ops (#12841)
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	11d07e1e69138b46375e9267b31acd58e3813577	b0091ecc1e5c0f689be856fade3803a534f35c9f	2025-04-10T04:48:01+05:30	Prajwal B Mehendarkar	Fixes #12823 (#12830)
M	ggml/src/ggml-cpu/simd-mappings.h

commit	b0091ecc1e5c0f689be856fade3803a534f35c9f	31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e	2025-04-09T23:17:12Z	Rudi Servo	docker : added all CPU to GPU images (#12749)
M	.devops/cuda.Dockerfile
M	.devops/intel.Dockerfile
M	.devops/musa.Dockerfile
M	.devops/rocm.Dockerfile
M	.devops/vulkan.Dockerfile

commit	31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e	2391506ace6abb56186def40c7107fdfa694ed55	2025-04-09T23:00:34Z	Piotr Kubaj	ggml-cpu-impl.h: do not redefine bool on POWER9 (#12856)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h

commit	2391506ace6abb56186def40c7107fdfa694ed55	d3bd7193ba66c15963fd1c59448f22019a8caf6e	2025-04-09T23:00:25Z	Piotr Kubaj	ggml-impl.h: fix build on POWER9 (#12855)
M	ggml/src/ggml-impl.h

commit	d3bd7193ba66c15963fd1c59448f22019a8caf6e	d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664	2025-04-09T17:47:36+08:00	Bo Zheng	llama : Support Qwen3 and Qwen3MoE (#12828)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp

commit	d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664	8ed71242f464dc0a3fb3cffcfe064e55bdec72f9	2025-04-09T17:22:30+08:00	R0CKSTAR	musa: enable freediskspace for docker image build (#12839)
M	.github/workflows/docker.yml

commit	8ed71242f464dc0a3fb3cffcfe064e55bdec72f9	381603a77504ad1788965f694094540c1bed9ea2	2025-04-09T11:22:04+02:00	Romain Biessy	sycl: update documentation to use -no-cnv (#12845)
M	docs/backend/SYCL.md

commit	381603a77504ad1788965f694094540c1bed9ea2	65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96	2025-04-09T11:11:11+03:00	Plamen Minev	ci: detach common from the library (#12827)
M	examples/server/utils.hpp
M	src/CMakeLists.txt
M	tests/test-chat-template.cpp

commit	65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96	47277d6d1d0d515cff34292a1a78a0d1b7252350	2025-04-09T10:09:53+02:00	Xuan-Son Nguyen	clip : do not print ftype (#12832)
M	examples/llava/clip.cpp

commit	47277d6d1d0d515cff34292a1a78a0d1b7252350	6e1c4cebdb697f925c523d3a969128d945161bdd	2025-04-09T10:54:42+03:00	Georgi Gerganov	readme : add rpc backend (#12842)
M	README.md

commit	6e1c4cebdb697f925c523d3a969128d945161bdd	0090950f679475c5ecaac2f7bca5049cca96492b	2025-04-09T14:04:14+08:00	Chenguang Li	CANN: Support Opt CONV_TRANSPOSE_1D and ELU (#12786)
M	.devops/llama-cli-cann.Dockerfile
M	.github/workflows/build.yml
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	0090950f679475c5ecaac2f7bca5049cca96492b	7ecd780b1a1d5214b8d04c25ebfc194d310816ed	2025-04-09T00:25:08-05:00	Jeff Bolz	vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	7ecd780b1a1d5214b8d04c25ebfc194d310816ed	7538246e7ce0606694c38055cc2fc9f60535be6c	2025-04-09T00:12:57-05:00	Jeff Bolz	vulkan: Use fp16 for the flash attention P*V multiplication (#12783)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	7538246e7ce0606694c38055cc2fc9f60535be6c	b32efad2bc42460637c3a364c9554ea8217b3d7f	2025-04-08T23:21:31+02:00	Sigbjørn Skjæret	cuda : add f32 to bf16 copy op (#12806)
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	b32efad2bc42460637c3a364c9554ea8217b3d7f	a19b5cef16d885c44c635da4a5c97113c1577de8	2025-04-08T16:01:58-04:00	Matt Clayton	llava: improve clip_ctx destructor to not memleak load_image_size (#12834)
M	examples/llava/clip.cpp
M	examples/llava/clip.h

commit	a19b5cef16d885c44c635da4a5c97113c1577de8	78a1ba0a4f2bfed5b8b8e312592143d22e531698	2025-04-08T19:54:51+03:00	Georgi Gerganov	llama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
M	examples/server/tests/unit/test_embedding.py
M	examples/server/tests/utils.py
M	examples/server_embd.py
M	ggml/src/ggml-cpu/ops.cpp
M	ggml/src/ggml-metal/ggml-metal.m
M	src/llama-graph.cpp

commit	78a1ba0a4f2bfed5b8b8e312592143d22e531698	2dabf759e7c8c827d38cdd18d0792070e6a4f4e1	2025-04-08T18:37:06+02:00	Xuan-Son Nguyen	server : fix thread.join() on exit (#12831)
M	examples/server/server.cpp

commit	2dabf759e7c8c827d38cdd18d0792070e6a4f4e1	1d343b4069c74b2c7b19ae84260cd98aa2320a9a	2025-04-08T21:49:13+08:00	dm4	llava: add more helper functions to check projector types in clip context (#12824)
M	examples/llava/clip.cpp
M	examples/llava/clip.h

commit	1d343b4069c74b2c7b19ae84260cd98aa2320a9a	8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88	2025-04-08T18:00:59+05:30	Prajwal B Mehendarkar	arg : Including limits file on AIX (#12822)
M	common/arg.cpp

commit	8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88	656babd6c21a3b9b3622324cfcc80a2ab78da25b	2025-04-08T14:14:59+05:00	characharm	server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatScreen.tsx
A	examples/server/webui/src/components/useChatTextarea.ts
M	examples/server/webui/src/utils/llama-vscode.ts

commit	656babd6c21a3b9b3622324cfcc80a2ab78da25b	a226bc7a9ac50551f9f113808de0f0046837f188	2025-04-08T15:03:21+08:00	Neo Zhang Jianyu	Revert "sycl:remove redundant memcopy in function ggml_backend_sycl_buffer_set_tensor" (#12812)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a226bc7a9ac50551f9f113808de0f0046837f188	1466621e738779eefe1bb672e17dc55d63d166bb	2025-04-08T03:03:07-04:00	compilade	gguf-py : support lazy tensor splitting (#12809)
M	gguf-py/gguf/lazy.py

commit	1466621e738779eefe1bb672e17dc55d63d166bb	82974011f312057b446c27267105bd7ad3810599	2025-04-07T23:06:44+02:00	Xuan-Son Nguyen	llama : Support llama 4 text-only (#12791)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	include/llama.h
A	models/ggml-vocab-llama4.gguf.inp
A	models/ggml-vocab-llama4.gguf.out
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	82974011f312057b446c27267105bd7ad3810599	4ccea213bc629c4eef7b520f7f6c59ce9bbdaca0	2025-04-07T13:22:54-07:00	lhez	opencl: better identify Adreno GPU (#12760)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	4ccea213bc629c4eef7b520f7f6c59ce9bbdaca0	1a1ab7e7a4a9b6e6440c1d9965d2b9d1b7e7dafb	2025-04-07T17:47:08+02:00	stduhpf	hellaswag: display estimated score confidence interval (#12797)
M	examples/perplexity/perplexity.cpp

commit	1a1ab7e7a4a9b6e6440c1d9965d2b9d1b7e7dafb	a4e46e28f99d7f64f38d8328cdb6bee5a3a1cd03	2025-04-07T13:18:07+03:00	Georgi Gerganov	cuda : fix HIP and MUSA BF16 (#0)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-cuda/vendors/musa.h

commit	a4e46e28f99d7f64f38d8328cdb6bee5a3a1cd03	ff067dbcb9e6ca4ed464d3db999ff8e9c503498b	2025-04-07T12:32:39+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	ff067dbcb9e6ca4ed464d3db999ff8e9c503498b	36ca8b362885e4b4984d72e348ba403568864a95	2025-04-07T12:25:15+03:00	Georgi Gerganov	ggml : simplify Arm fp16 CPU logic (ggml/1177)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/simd-mappings.h
M	ggml/src/ggml-impl.h

commit	36ca8b362885e4b4984d72e348ba403568864a95	995083e4ed24933e6a289472f9de0f0b53ca5eca	2025-04-04T21:05:12+02:00	Sigbjørn Skjæret	CUDA: don't convert BF16 weights to FP32 (ggml/1174)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/convert.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	995083e4ed24933e6a289472f9de0f0b53ca5eca	518a01480eb3a7c80a4951b430db9dee55428310	2025-04-02T17:46:16+05:30	cmdr2	cpu: move all the operators into a separate c++ file (except mul_mat) (ggml/1167)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu.c
A	ggml/src/ggml-cpu/ops.cpp
A	ggml/src/ggml-cpu/ops.h
A	ggml/src/ggml-cpu/simd-mappings.h
A	ggml/src/ggml-cpu/vec.cpp
A	ggml/src/ggml-cpu/vec.h

commit	518a01480eb3a7c80a4951b430db9dee55428310	e391d3ee8ddae86be70c034de1082ad51c55e211	2025-04-07T23:22:57+08:00	zhouwg	sycl: remove redundant memcopy in function ggml_backend_sycl_buffer_set_tensor (#12734)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	e391d3ee8ddae86be70c034de1082ad51c55e211	bd3f59f81289b920bcc597a208c14f55e39ed37e	2025-04-07T14:37:28+02:00	Xuan-Son Nguyen	ci : no curl on ggml-ci (#12796)
M	ci/run.sh

commit	bd3f59f81289b920bcc597a208c14f55e39ed37e	52b3d71f128c1eeab39b918adf1f7a8f5e256619	2025-04-07T13:35:19+02:00	Xuan-Son Nguyen	cmake : enable curl by default (#12761)
M	.devops/cpu.Dockerfile
M	.devops/cuda.Dockerfile
M	.devops/intel.Dockerfile
M	.devops/musa.Dockerfile
M	.devops/rocm.Dockerfile
A	.github/actions/windows-setup-curl/action.yml
M	.github/workflows/bench.yml.disabled
M	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	CMakeLists.txt
M	build-xcframework.sh
M	common/CMakeLists.txt
M	examples/llama.android/llama/build.gradle.kts
M	examples/run/CMakeLists.txt
M	examples/server/tests/README.md
M	examples/sycl/win-build-sycl.bat
A	licenses/LICENSE-curl
A	licenses/LICENSE-httplib
A	licenses/LICENSE-jsonhpp
R100	examples/run/linenoise.cpp/LICENSE	licenses/LICENSE-linenoise
M	tests/CMakeLists.txt

commit	52b3d71f128c1eeab39b918adf1f7a8f5e256619	d0d5b2232b3826cac2c6e62d0244a474ba79860f	2025-04-07T19:34:14+08:00	zhouwg	CANN: fix typo in ggml-cann (#12733)
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	d0d5b2232b3826cac2c6e62d0244a474ba79860f	916c83bfe7f8b08ada609c3b8e583cf5301e594b	2025-04-07T17:10:36+08:00	hipudding	CANN: Refactor to reduce duplicate code (#12731)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	916c83bfe7f8b08ada609c3b8e583cf5301e594b	0c74b04376b0b9efc096480fe10f866afc8d7c1c	2025-04-06T21:23:54+08:00	R0CKSTAR	musa: fix compilation warnings in mp_22/31 (#12780)
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	0c74b04376b0b9efc096480fe10f866afc8d7c1c	80b717d493a9a5bae7167ad2384c12c60bb2ef20	2025-04-06T04:03:47-05:00	Jeff Bolz	vulkan: fix NaN issue in flash attention shader (#12776)
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	80b717d493a9a5bae7167ad2384c12c60bb2ef20	6bf28f0111ff9f21b3c1b1eace20c590281e7ba6	2025-04-06T03:47:13-05:00	Jeff Bolz	vulkan: Use unclamped loads for flash attention mask (#12720)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	6bf28f0111ff9f21b3c1b1eace20c590281e7ba6	f1e3eb4249db68d97be352c0adf16eef7ae53795	2025-04-05T18:04:03+02:00	0cc4m	Vulkan: Tune Vulkan mmq int dot shader for performance (#12767)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	f1e3eb4249db68d97be352c0adf16eef7ae53795	0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4	2025-04-05T23:46:00+08:00	Sergey Fedorov	common : fix includes in arg.cpp and gemma3-cli.cpp (#12766)
M	common/arg.cpp
M	examples/llava/gemma3-cli.cpp

commit	0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4	c6ff5d2a8da2587cc78c9ede9171dfc3f076c757	2025-04-05T17:17:40+02:00	Xuan-Son Nguyen	clip : refactor clip_init, add tests (#12757)
A	examples/llava/clip-impl.h
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/gemma3-cli.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/qwen2vl-cli.cpp
A	examples/llava/test-1.jpeg
A	examples/llava/tests.sh

commit	c6ff5d2a8da2587cc78c9ede9171dfc3f076c757	7a84777f42a9b3ba47db5d20b7662f8ddf92f652	2025-04-05T21:31:42+08:00	エシュナヴァリシア	common: custom hf endpoint support (#12769)
M	common/arg.cpp

commit	7a84777f42a9b3ba47db5d20b7662f8ddf92f652	3e1d29348b5d77269f6931500dd1c1a729d429c8	2025-04-04T13:16:39-07:00	Olivier Chafik	sync: minja (#12739)
M	common/minja/chat-template.hpp
M	common/minja/minja.hpp

commit	3e1d29348b5d77269f6931500dd1c1a729d429c8	1be76e4620ddc99b3cbff0f206436117ae561047	2025-04-04T21:48:10+03:00	Georgi Gerganov	kv-cache : simplify + fix warning for recurrent models (#12756)
M	src/llama-context.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
M	src/llama-memory.h

commit	1be76e4620ddc99b3cbff0f206436117ae561047	b7723942970b70412793f1926a35cfb93d5c157c	2025-04-04T14:05:12-03:00	bandoti	ci: add Linux cross-compile build (#12428)
A	.github/workflows/build-linux-cross.yml
M	.github/workflows/build.yml

commit	b7723942970b70412793f1926a35cfb93d5c157c	23106f94ea2bc3da929afb7330655fd5515d08dc	2025-04-04T09:09:52-05:00	Nauful Shaikh	server : webui : Upgrade daisyui, tailwindcss. (#12735)
M	examples/server/public/index.html.gz
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
M	examples/server/webui/postcss.config.js
M	examples/server/webui/src/App.tsx
M	examples/server/webui/src/Config.ts
M	examples/server/webui/src/components/Header.tsx
M	examples/server/webui/src/index.scss

commit	23106f94ea2bc3da929afb7330655fd5515d08dc	94148ba330968bbfb8d9ecc67751bdc2218486cd	2025-04-04T22:09:12+08:00	nick huang	gguf-split : --merge now respects --dry-run option (#12681)
M	examples/gguf-split/gguf-split.cpp

commit	94148ba330968bbfb8d9ecc67751bdc2218486cd	9ac4d611d05b03f961e627f4f399e4377bdb4ad3	2025-04-04T16:00:46+02:00	Nicolò Scipione	sycl: allow ggml-sycl configuration and compilation using Visual Studio project/solution (#12625)
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/CMakeLists.txt

commit	9ac4d611d05b03f961e627f4f399e4377bdb4ad3	348888e0dc469a476f9e9eccb394893c513daab8	2025-04-04T15:12:40+02:00	Ronny Brendel	cmake: fix ggml-shaders-gen compiler paths containing spaces (#12747)
M	ggml/src/ggml-vulkan/cmake/host-toolchain.cmake.in

commit	348888e0dc469a476f9e9eccb394893c513daab8	74d4f5b041ad837153b0e90fc864b8290e01d8d5	2025-04-04T10:24:12+02:00	Daniel Bevenius	docs : add XCFramework section to README.md [no ci] (#12746)
M	README.md

commit	74d4f5b041ad837153b0e90fc864b8290e01d8d5	35e592eb30832187412360912ab8f2f5b7984df1	2025-04-04T00:54:35-05:00	Jeff Bolz	vulkan: Hybrid waitForFences/getFenceStatus to reduce fence latency (#12630)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	35e592eb30832187412360912ab8f2f5b7984df1	7d7b1bafa7980603a61cb102879fe38a33f66c08	2025-04-04T00:53:20-05:00	Jeff Bolz	vulkan: set cmake minimum and project name in vulkan-shaders (#12744)
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	7d7b1bafa7980603a61cb102879fe38a33f66c08	c262beddf29f3f3be5bbbf167b56029a19876956	2025-04-03T22:18:17-07:00	lhez	opencl: update doc for OpenCL (#12702)
M	docs/backend/OPENCL.md
M	docs/build.md

commit	c262beddf29f3f3be5bbbf167b56029a19876956	5dd5d1ab00d074e3b7c02ca3ae12f6bf3e86336a	2025-04-03T21:50:29+05:30	Gaurav Garg	CUDA: Prefer vector flash decoding kernel for Gemma models (#12738)
M	ggml/src/ggml-cuda/fattn.cu

commit	5dd5d1ab00d074e3b7c02ca3ae12f6bf3e86336a	1c059995e080e37aeaacaae35850fc4c044b9dbe	2025-04-03T23:32:54+08:00	yumeyao	vocab : use string_view::find() to avoid unnecessary looking up beyond the fragment range (#12706)
M	src/llama-vocab.cpp

commit	1c059995e080e37aeaacaae35850fc4c044b9dbe	2004644b7a5da6fe080e51861ab583480280f1d3	2025-04-03T10:08:26-05:00	Jeff Bolz	vulkan: Fix missing cmake logic for dot product extension (#12721)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	2004644b7a5da6fe080e51861ab583480280f1d3	5f696e88e0eb490c8028421d3c5419df9dcf5385	2025-04-03T13:12:39+01:00	Atharva Dubey	ci : add env variable in ggml-ci and document the same in SYCL.md (#12736)
M	ci/run.sh
M	docs/backend/SYCL.md

commit	5f696e88e0eb490c8028421d3c5419df9dcf5385	193c3e03a63ccda3ac3d6a2999e41e6d1414fe23	2025-04-03T19:51:35+08:00	R0CKSTAR	sync : minja (inclusionAI/Ling) and update tests (#12699)
M	common/minja/minja.hpp
M	tests/test-chat-template.cpp

commit	193c3e03a63ccda3ac3d6a2999e41e6d1414fe23	65cfe136a0793b2fdf5af8bdb1ab2cf10c3e1d2e	2025-04-03T15:32:55+08:00	a3sh	fix MUSA compiler warning (#12704)
M	ggml/src/ggml-cuda/ssm-conv.cu
M	ggml/src/ggml-cuda/ssm-scan.cu

commit	65cfe136a0793b2fdf5af8bdb1ab2cf10c3e1d2e	3f9da22c2b21a2cef216de50006436ef1cab8764	2025-04-03T15:18:08+08:00	Chenguang Li	CANN: Support operator SIN COS ARGMAX (#12709)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	3f9da22c2b21a2cef216de50006436ef1cab8764	2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2	2025-04-03T02:31:15+01:00	Alan Gray	Simplify and improve CUDA graphs through use of indirect copy pointers (#9017)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/cpy.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2	97a20c012be2f9bfbeee0209405a31001f93ccf9	2025-04-03T08:49:51+08:00	hipudding	CANN: Fix failed test cases (#12708)
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/acl_tensor.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/aclnn_ops.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	97a20c012be2f9bfbeee0209405a31001f93ccf9	f01bd02376f919b05ee635f438311be8dfc91d7c	2025-04-02T17:01:42-07:00	lhez	opencl: use `max_alloc_size` in backend ctx instead of querying again (#12705)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	f01bd02376f919b05ee635f438311be8dfc91d7c	6f3bd38640f07e4dec7f145d2fbf093ce48c9544	2025-04-02T14:25:08-05:00	Jeff Bolz	vulkan: Implement split_k for coopmat2 flash attention. (#12627)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_split_k_reduce.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	6f3bd38640f07e4dec7f145d2fbf093ce48c9544	be0a0f8cae039e2286f757612accebfb8f21b36e	2025-04-02T14:56:26-03:00	bandoti	cmake: remove caching from vulkan coopmat checks (#12719)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	be0a0f8cae039e2286f757612accebfb8f21b36e	92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2	2025-04-02T12:40:32-05:00	Jeff Bolz	vulkan: Implement grouped query attention in the coopmat2 FA shader (#12559)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp

commit	92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2	833e2b7409211a07df97716998c5002526642652	2025-04-02T19:12:30+02:00	0cc4m	Vulkan: Fix mmq int dot float cache size (#12722)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.comp

commit	833e2b7409211a07df97716998c5002526642652	e0e912f49b3195ef9d0c51378629ba03c9b972da	2025-04-02T16:38:54+03:00	Georgi Gerganov	model : print tensor size during load (#12711)
M	src/llama-model-loader.cpp

commit	e0e912f49b3195ef9d0c51378629ba03c9b972da	a10b36c91a091f4606710fba4e9327fd71e0e738	2025-04-02T14:52:01+02:00	Diego Devesa	llama : add option to override model tensor buffers (#11397)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	ggml/src/ggml.c
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-model-loader.cpp
M	src/llama-model-loader.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama.cpp

commit	a10b36c91a091f4606710fba4e9327fd71e0e738	83a88bd6affbe148a622ac730952ac5b8b585979	2025-04-02T14:32:59+03:00	Georgi Gerganov	llama : refactor kv cache guard (#12695)
M	examples/parallel/parallel.cpp
M	src/llama-context.cpp
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h

commit	83a88bd6affbe148a622ac730952ac5b8b585979	42eb248f46e1175349e553b6eda6cb63027d74d1	2025-04-02T11:21:48+02:00	Sigbjørn Skjæret	vocab : BailingMoE : change possessive quantifiers to greedy (#12677)
M	src/llama-vocab.cpp

commit	42eb248f46e1175349e553b6eda6cb63027d74d1	9bacd6b37461608385360fd64326c13247ccf18e	2025-04-02T09:58:34+02:00	Xuan-Son Nguyen	common : remove json.hpp from common.cpp (#12697)
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	9bacd6b37461608385360fd64326c13247ccf18e	267c1399f15a278ec8c3cdcf9c90dc94151fbc38	2025-04-02T15:22:13+08:00	Chenguang Li	[CANN] get_rows and dup optimization (#12671)
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp
D	ggml/src/ggml-cann/kernels/CMakeLists.txt
D	ggml/src/ggml-cann/kernels/ascendc_kernels.h
D	ggml/src/ggml-cann/kernels/dup.cpp
D	ggml/src/ggml-cann/kernels/get_row_f16.cpp
D	ggml/src/ggml-cann/kernels/get_row_f32.cpp
D	ggml/src/ggml-cann/kernels/get_row_q4_0.cpp
D	ggml/src/ggml-cann/kernels/get_row_q8_0.cpp
D	ggml/src/ggml-cann/kernels/quantize_f16_q8_0.cpp
D	ggml/src/ggml-cann/kernels/quantize_f32_q8_0.cpp
D	ggml/src/ggml-cann/kernels/quantize_float_to_q4_0.cpp

commit	267c1399f15a278ec8c3cdcf9c90dc94151fbc38	f423981ac806bf031d83784bcb47d2721bc70f97	2025-04-01T23:44:05+02:00	Xuan-Son Nguyen	common : refactor downloading system, handle mmproj with -hf option (#12694)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gritlm/gritlm.cpp
M	examples/llava/README-gemma3.md
M	examples/llava/gemma3-cli.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/qwen2vl-cli.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/server/server.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	examples/tts/tts.cpp
M	tests/test-arg-parser.cpp

commit	f423981ac806bf031d83784bcb47d2721bc70f97	e39e727e9a3daec7082b9c59540a429ad85914af	2025-04-02T01:54:34+09:00	Junil Kim	opencl : fix memory allocation size (#12649)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	e39e727e9a3daec7082b9c59540a429ad85914af	5936a616e46cffad4579ccaff8f8fa315809da4c	2025-04-01T20:54:28+08:00	jklincn	llama : use LLM_KV_GENERAL_FILE_TYPE instead of gguf_find_key (#12672)
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model-loader.cpp

commit	5936a616e46cffad4579ccaff8f8fa315809da4c	3fd072a54001a908c54e81fd2e82b682ecfdd475	2025-04-01T14:37:13+02:00	Sigbjørn Skjæret	convert : BailingMoE : fix qkv split when head_dim is 0 (#12687)
M	convert_hf_to_gguf.py

commit	3fd072a54001a908c54e81fd2e82b682ecfdd475	a6f32f0b3437ac79827ffb55521cb839343324ab	2025-04-01T14:57:19+03:00	Georgi Gerganov	metal : use F32 prec in FA kernels (#12688)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	a6f32f0b3437ac79827ffb55521cb839343324ab	2bb3597e426ce092c3e10ae0bdd876963765e6ed	2025-04-01T19:12:53+08:00	R0CKSTAR	Fix clang warning in gguf_check_reserved_keys (#12686)
M	common/minja/minja.hpp
M	ggml/src/gguf.cpp

commit	2bb3597e426ce092c3e10ae0bdd876963765e6ed	82939705421f4ef27e924879fdeed6d7b5f6d769	2025-04-01T06:38:07-03:00	Wagner Bruna	vulkan: fix build when glslc doesn't support coopmat (#12683)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	82939705421f4ef27e924879fdeed6d7b5f6d769	8bbf26083d93274240a20d16cda324441c57fcc6	2025-04-01T10:24:29+02:00	Romain Biessy	SYCL: Rename oneMKL to oneMath (#12192)
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/outprod.cpp

commit	8bbf26083d93274240a20d16cda324441c57fcc6	35782aeedb4f65140c0d522070901843213ff157	2025-04-01T13:41:39+05:30	Akarshan Biswas	SYCL: switch to SYCL namespace (#12674)
M	ggml/src/ggml-sycl/norm.cpp

commit	35782aeedb4f65140c0d522070901843213ff157	c80a7759dab10657b9b6c3e87eef988a133b9b6a	2025-03-31T23:09:48+02:00	Sigbjørn Skjæret	convert : BailingMoE : avoid setting rope_dim to 0 (#12678)
M	convert_hf_to_gguf.py

commit	c80a7759dab10657b9b6c3e87eef988a133b9b6a	250d7953e829ff0e16074510fef0e7cec696461b	2025-03-31T18:40:56+02:00	Daniel Bevenius	vocab : add special infill tokens for CodeLlama (#11850)
M	src/llama-vocab.cpp

commit	250d7953e829ff0e16074510fef0e7cec696461b	403fbacbbcd3650abcc53e84f5e6bf88e51dd6f5	2025-04-01T00:05:13+08:00	a3sh	ggml : faster ssm scan (#10558)
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/ssm-conv.cu
A	ggml/src/ggml-cuda/ssm-conv.cuh
A	ggml/src/ggml-cuda/ssm-scan.cu
A	ggml/src/ggml-cuda/ssm-scan.cuh

commit	403fbacbbcd3650abcc53e84f5e6bf88e51dd6f5	a8a1f3356786cbf8bcc3422e3c8737fc33b453e7	2025-03-31T16:36:25+02:00	Sigbjørn Skjæret	convert : Qwerky : use lora_rank_tokenshift and lora_rank_decay if present (#12667)
M	convert_hf_to_gguf.py

commit	a8a1f3356786cbf8bcc3422e3c8737fc33b453e7	1790e7315726ceda256ea91eaa66fc36b63f6067	2025-03-31T14:37:01+02:00	0cc4m	Vulkan: Add DP4A MMQ and Q8_1 quantization shader (#12135)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mmq_funcs.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/quantize_q8_1.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/test_integer_dot_support.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	1790e7315726ceda256ea91eaa66fc36b63f6067	0114a32da0adc21dc04f05278cd8e3f67ba5f8c7	2025-03-31T15:05:30+03:00	Georgi Gerganov	cmake : fix whitespace (#0)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	0114a32da0adc21dc04f05278cd8e3f67ba5f8c7	a7724480fd7eb5451981ba7458c1b3829f4897d1	2025-03-31T14:59:21+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a7724480fd7eb5451981ba7458c1b3829f4897d1	1a859490670c271e8e992c83cb11459ea0c3580c	2025-03-31T12:44:36+02:00	Sandro Hanea	cmake: improve Vulkan cooperative matrix support checks (whisper/2966)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	1a859490670c271e8e992c83cb11459ea0c3580c	6c02a032fa21d69e881ef9a5c94ba28ebaf1d749	2025-03-31T11:28:30+02:00	Sigbjørn Skjæret	llava : proper description fix (#12668)
M	examples/llava/clip.cpp

commit	6c02a032fa21d69e881ef9a5c94ba28ebaf1d749	f52d59d771dc231fc2ac39adacf157ddefc97730	2025-03-31T14:55:24+05:30	Akarshan Biswas	SYCL: Remove misleading ggml_sycl_op_flatten function (#12387)
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/getrows.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/im2col.cpp
M	ggml/src/ggml-sycl/im2col.hpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/norm.hpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/rope.hpp

commit	f52d59d771dc231fc2ac39adacf157ddefc97730	52de2e594979be52f0da92601747aa44a13e50e4	2025-03-31T11:07:07+02:00	Sigbjørn Skjæret	llava : fix clip loading GGUFs with missing description (#12660)
M	examples/llava/clip.cpp

commit	52de2e594979be52f0da92601747aa44a13e50e4	2c3f8b850a4a6cff0f5dda2135c03fc81d33ed8b	2025-03-31T10:20:30+02:00	marcoStocchi	tts : remove printfs (#12640)
M	examples/tts/tts.cpp

commit	2c3f8b850a4a6cff0f5dda2135c03fc81d33ed8b	4663bd353c61c1136cd8a97b9908755e4ab30cec	2025-03-30T22:21:03+02:00	Sigbjørn Skjæret	llama : support BailingMoE (Ling) (#12634)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp

commit	4663bd353c61c1136cd8a97b9908755e4ab30cec	b3de7cac732e7dc0e10e1bb07502a500b0ee9022	2025-03-30T22:04:04+03:00	Georgi Gerganov	metal : use constexpr in FA kernels + fix typedef (#12659)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	b3de7cac732e7dc0e10e1bb07502a500b0ee9022	7242dd96756472f90ba41db4e5ebb3969dfc7e7c	2025-03-31T03:38:33+09:00	Juyoung Suk	llama : add Trillion 7B model support (#12556)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama-vocab.cpp

commit	7242dd96756472f90ba41db4e5ebb3969dfc7e7c	492d7f1ff77e116e44962b832cc3db24cfc46d24	2025-03-30T21:12:03+03:00	Sergei Vorobyov	llama-chat : Add Yandex instruct model template support (#12621)
M	src/llama-chat.cpp
M	src/llama-chat.h
M	tests/test-chat-template.cpp

commit	492d7f1ff77e116e44962b832cc3db24cfc46d24	d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8	2025-03-30T16:59:38+08:00	R0CKSTAR	musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611)
M	ci/README.md
M	ci/run.sh
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/concat.cu
M	ggml/src/ggml-cuda/conv-transpose-1d.cu
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/pad.cu
M	ggml/src/ggml-cuda/upscale.cu

commit	d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8	360dc22c007c7b926d0721930e279d87317d8466	2025-03-29T15:37:54+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	360dc22c007c7b926d0721930e279d87317d8466	a62d7fa7a979d21bcd760f1d7c19a66e55611f44	2025-03-29T11:59:56+01:00	Xuan-Son Nguyen	cpu : rm unused variable (ggml/1166)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	a62d7fa7a979d21bcd760f1d7c19a66e55611f44	e408d4351a4ad143656672479d8ae1479306ce31	2025-03-29T11:37:13+05:30	cmdr2	cpu: de-duplicate some of the operators and refactor (ggml/1144)
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-cpu/binary-ops.cpp
A	ggml/src/ggml-cpu/binary-ops.h
A	ggml/src/ggml-cpu/common.h
M	ggml/src/ggml-cpu/ggml-cpu.c
A	ggml/src/ggml-cpu/unary-ops.cpp
A	ggml/src/ggml-cpu/unary-ops.h

commit	e408d4351a4ad143656672479d8ae1479306ce31	3891e183c61c1e25c2c61afe68d7b95019ea3f89	2025-03-24T09:53:38+01:00	Daniel Bevenius	ggml : add logging for native build options/vars (whisper/2935)
M	ggml/CMakeLists.txt

commit	3891e183c61c1e25c2c61afe68d7b95019ea3f89	af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1	2025-03-20T07:02:18+01:00	Daniel Bevenius	examples : command.wasm updates (whisper/2904)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1	0bb2919335d00ff0bc79d5015da95c422de51f03	2025-03-30T00:07:37+01:00	Xuan-Son Nguyen	llama : fix non-causal mask for gemma 3 (#12615)
M	src/llama-context.cpp
M	src/llama-graph.cpp

commit	0bb2919335d00ff0bc79d5015da95c422de51f03	a69f8463510a70fe0c85701b8c7ede283a0d1a7d	2025-03-29T14:07:37+01:00	Djip007	llama : change cpu_buft_list order: ACCEL -> GPU host -> CPU extra -> CPU (#12632)
M	src/llama-model.cpp

commit	a69f8463510a70fe0c85701b8c7ede283a0d1a7d	d07a0d7a79bafb01fb3b6c8992121e75c57c0c2f	2025-03-29T18:04:58+08:00	Jay	cmake : fix ccache conflict (#12522)
M	ggml/src/CMakeLists.txt

commit	d07a0d7a79bafb01fb3b6c8992121e75c57c0c2f	3714c3ee1a62ed64ac328ec7d699410ad1219150	2025-03-29T18:03:28+08:00	hipudding	CANN : remove clang-format in ggml-cann (#12607)
D	ggml/src/ggml-cann/.clang-format

commit	3714c3ee1a62ed64ac328ec7d699410ad1219150	b4ae50810e4304d052e630784c14bde7e79e4132	2025-03-28T22:13:02+01:00	Sigbjørn Skjæret	llama : fix incorrect Qwen2Moe ffn_moe_out graph callback (#12631)
M	src/llama-model.cpp

commit	b4ae50810e4304d052e630784c14bde7e79e4132	b86f6007234da4bff51a3ebef2bdb952b52059c6	2025-03-28T20:21:59+02:00	Georgi Gerganov	metal : improve FA + improve MoE (#12612)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	src/llama-context.cpp
M	tests/test-backend-ops.cpp

commit	b86f6007234da4bff51a3ebef2bdb952b52059c6	dd373dd3bf81eced3e711fb7cb49123a6105933e	2025-03-29T01:51:06+08:00	Icenowy Zheng	vulkan: fix coopmat shader generation when cross-compiling (#12272)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	dd373dd3bf81eced3e711fb7cb49123a6105933e	5d01670266859444366e4f333ade5e0e5e2ae63d	2025-03-28T18:08:52+01:00	Johannes Gäßler	llama: fix error on bad grammar (#12628)
M	common/sampling.cpp
M	include/llama.h
M	src/llama-sampling.cpp

commit	5d01670266859444366e4f333ade5e0e5e2ae63d	ef03229ff423dd1991f4f44ef1352f03334d86eb	2025-03-28T01:05:44-07:00	Benson Wong	server : include speculative decoding stats when timings_per_token is enabled (#12603)
M	examples/server/server.cpp

commit	ef03229ff423dd1991f4f44ef1352f03334d86eb	13731766db91ec927c1b61bf502ac7a9be2b11b9	2025-03-28T09:44:13+02:00	Radoslav Gerganov	rpc : update README for cache usage (#12620)
M	examples/rpc/README.md

commit	13731766db91ec927c1b61bf502ac7a9be2b11b9	ab6ab8f809bd514d88e02a63869b4d619f13fa86	2025-03-28T13:13:22+05:30	amritahs-ibm	llamafile : ppc64le GEMV forwarding for FP32. (#12594)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	ab6ab8f809bd514d88e02a63869b4d619f13fa86	2099a9d5dbdcd2841d02dd396a71d0de70bf4490	2025-03-28T08:18:04+02:00	Radoslav Gerganov	rpc : send hash when tensor data is above some fixed threshold (#12496)
M	examples/rpc/CMakeLists.txt
M	examples/rpc/rpc-server.cpp
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	2099a9d5dbdcd2841d02dd396a71d0de70bf4490	296901983700f3c37449bcb555d85d27150a679d	2025-03-27T23:41:04+01:00	Piotr	server : Support listening on a unix socket (#12613)
M	common/arg.cpp
M	examples/server/httplib.h
M	examples/server/server.cpp

commit	296901983700f3c37449bcb555d85d27150a679d	5dec47dcd411fdf815a3708fd6194e2b13d19006	2025-03-27T23:09:05+02:00	Georgi Gerganov	media : add SVG logo [no ci] (#12616)
A	media/llama1-logo.svg

commit	5dec47dcd411fdf815a3708fd6194e2b13d19006	f125b8dccff34439a26bf750c9edef358c48c1f8	2025-03-27T08:08:08-07:00	lhez	opencl: add multi and vision rope, `gelu_quick` and `im2col` (#12600)
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/ggml-opencl.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_im2col.cl

commit	f125b8dccff34439a26bf750c9edef358c48c1f8	953c2a62cf487e618140f3ea18d94e3b0257af93	2025-03-27T10:49:15Z	Si1w	llama : add PLM GGUF Conversion & Inference Support (#12457)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h

commit	953c2a62cf487e618140f3ea18d94e3b0257af93	d5c6309d91cb22ebc947920f92eb686d92f84eae	2025-03-27T18:43:33+08:00	HighDoping	model : restore support for T5Encoder (#12590)
M	src/llama-model.cpp

commit	d5c6309d91cb22ebc947920f92eb686d92f84eae	029c693fdcdc80e8508553df61a4337bb5fe49a9	2025-03-27T03:11:23-07:00	Csaba Kecskemeti	convert : Support Qwen2_5_VLForConditionalGeneration (#12595)
M	convert_hf_to_gguf.py

commit	029c693fdcdc80e8508553df61a4337bb5fe49a9	771d84371c0785c2554aef9a47cdd551b8c7ceaf	2025-03-27T09:36:13+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	771d84371c0785c2554aef9a47cdd551b8c7ceaf	df0665a483b08da1c9b55534b624ae4e1fe89767	2025-03-27T09:22:30+02:00	Georgi Gerganov	scripts : update sync + fix cmake merge
M	ggml/CMakeLists.txt
A	ggml/cmake/GitVars.cmake
M	ggml/cmake/ggml-config.cmake.in
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	df0665a483b08da1c9b55534b624ae4e1fe89767	0306aad1ca89a92fdb33450b35547b90b92f5dbe	2025-03-27T09:01:21+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	0306aad1ca89a92fdb33450b35547b90b92f5dbe	c7b43ab60855f752ae79937fb93d561bc30b69a4	2025-03-27T09:00:57+02:00	Georgi Gerganov	cmake : sync/merge PowerPC build commands (#0)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	c7b43ab60855f752ae79937fb93d561bc30b69a4	24feaec05792b972d5ff3e2b12d9237ebd50d1ac	2025-03-27T12:21:47+05:30	amritahs-ibm	llamafile : ppc64le MMA implementation for Q4_0. (#12489)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	24feaec05792b972d5ff3e2b12d9237ebd50d1ac	f28bc4c286c453cd8385388eea057a404fdb6402	2025-03-27T14:38:34+08:00	xctan	ggml : riscv: add 128-bit RVV support (#12530)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-impl.h

commit	f28bc4c286c453cd8385388eea057a404fdb6402	f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01	2025-03-27T08:24:10+02:00	Georgi Gerganov	llama : make loras compatible with repacking (#12593)
M	src/llama-adapter.cpp

commit	f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01	bd40678df768ab189b26b8b03e3de4062e3b71a3	2025-03-27T07:16:00+05:30	Akarshan Biswas	SYCL: implement memset ggml backend buffer interface (#12580)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	bd40678df768ab189b26b8b03e3de4062e3b71a3	b3298fa47a2d56ae892127ea038942ab1cada190	2025-03-26T23:46:30+01:00	Slobodan Josic	HIP: Add support for RDNA4 targets (#12372)
M	docs/build.md
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	b3298fa47a2d56ae892127ea038942ab1cada190	2447ad8a981253a2b8e9f4b31cc8e7fdff83423e	2025-03-26T21:38:38+02:00	Georgi Gerganov	metal : refactor mat-vec code (#12569)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	2447ad8a981253a2b8e9f4b31cc8e7fdff83423e	02082f1519565fc7b49de211b28bc5404a69209b	2025-03-26T11:06:09-07:00	Michał Moskal	upgrade to llguidance 0.7.10 (#12576)
M	common/CMakeLists.txt
M	common/llguidance.cpp
M	tests/test-grammar-llguidance.cpp

commit	02082f1519565fc7b49de211b28bc5404a69209b	df4d20cd53d5bb6fc21c1dc65f026d53b566d097	2025-03-26T22:06:04+08:00	Ivy233	clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
M	examples/llava/clip.cpp

commit	df4d20cd53d5bb6fc21c1dc65f026d53b566d097	5ed38b6852bd509d56acfdae54bceec8ab3cc396	2025-03-26T14:21:05+02:00	Georgi Gerganov	convert : fix squeeze for ssm_conv tensors (#12573)
M	convert_hf_to_gguf.py

commit	5ed38b6852bd509d56acfdae54bceec8ab3cc396	fd7855f8f522ab26681b25ae506ff99c654e2dd5	2025-03-26T13:02:00+02:00	Georgi Gerganov	ggml : fix MUL_MAT_ID repack with Q8_K (#12544)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	fd7855f8f522ab26681b25ae506ff99c654e2dd5	53af4dba425768fd507ce6b45873cfbb3df2295f	2025-03-26T15:09:48+08:00	R0CKSTAR	doc: [MUSA] minor changes (#12583)
M	ci/README.md
M	docs/build.md

commit	53af4dba425768fd507ce6b45873cfbb3df2295f	ef19c71769681a0b3dde6bc90911728376e5d236	2025-03-25T23:03:10+01:00	Sigbjørn Skjæret	convert: fix Mistral3/Gemma3 model hparams init (#12571)
M	convert_hf_to_gguf.py

commit	ef19c71769681a0b3dde6bc90911728376e5d236	053b3f9aae63151732eccf6b7408c6418ba8746e	2025-03-25T17:46:11Z	Eric Curtin	run: de-duplicate fmt and format functions and optimize (#11596)
M	examples/run/run.cpp

commit	053b3f9aae63151732eccf6b7408c6418ba8746e	e2f560175a195f63c3276972a3d1caec0bd13e05	2025-03-25T12:10:18+01:00	Dan Johansson	ggml-cpu : update KleidiAI to v1.5.0 (#12568)
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/kleidiai/kernels.cpp
M	ggml/src/ggml-cpu/kleidiai/kernels.h
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	e2f560175a195f63c3276972a3d1caec0bd13e05	36ee06dd2dcf8d3d1157ebe36366d7670770e75f	2025-03-25T16:10:18+05:30	Akarshan Biswas	SYCL: disable Q4_0 reorder optimization (#12560)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	36ee06dd2dcf8d3d1157ebe36366d7670770e75f	3cd3a395323fa9cdf6ecfa1fea290bf228d4e856	2025-03-25T10:35:20+01:00	Dan Johansson	docs : add build instructions for KleidiAI (#12563)
M	docs/build.md

commit	3cd3a395323fa9cdf6ecfa1fea290bf228d4e856	2d77d88e70d017cd82c3f1a4517e3102e2028ac4	2025-03-25T15:45:08+08:00	R0CKSTAR	ci: [MUSA] add CI and update doc (#12562)
M	ci/README.md
M	ci/run.sh

commit	2d77d88e70d017cd82c3f1a4517e3102e2028ac4	c95fa362b3587d1822558f7e28414521075f254f	2025-03-25T09:19:23+02:00	Georgi Gerganov	context : fix worst-case reserve outputs (#12545)
M	src/llama-context.cpp

commit	c95fa362b3587d1822558f7e28414521075f254f	2b65ae30299b9c67e25c51ee567e9a2ef22279ab	2025-03-24T23:05:38+05:30	Akarshan Biswas	ci: [SYCL] ggml-ci Use main GPU and enable sysman (#12547)
M	ci/run.sh

commit	2b65ae30299b9c67e25c51ee567e9a2ef22279ab	48d7021c61ceda6fcf1a7294d2115b8e1a53ae95	2025-03-24T09:20:47-07:00	lhez	opencl: simplify kernel embedding logic in cmakefile (#12503)
M	ggml/src/ggml-opencl/CMakeLists.txt

commit	48d7021c61ceda6fcf1a7294d2115b8e1a53ae95	3361e2deba0f24942877559b35c430dec68528c3	2025-03-24T18:28:32+05:30	Akarshan Biswas	CI: fix SYCL build (#12546)
M	ci/run.sh

commit	3361e2deba0f24942877559b35c430dec68528c3	00d53800e00bb22a26bf710fa6bd1150e412cc1d	2025-03-24T19:02:26+08:00	Tei Home	docs: update: improve the Fedoa CUDA guide (#12536)
R078	docs/cuda-fedora.md	docs/backend/CUDA-FEDORA.md
M	docs/build.md

commit	00d53800e00bb22a26bf710fa6bd1150e412cc1d	7ea75035b67f44c22ed7039967f718011fd35ce5	2025-03-24T06:47:24-04:00	compilade	llama-vocab : add SuperBPE pre-tokenizer (#12532)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama-vocab.cpp

commit	7ea75035b67f44c22ed7039967f718011fd35ce5	c54f6b7988b63714b87b0390e01a1e69aee79a12	2025-03-24T18:28:34+08:00	R0CKSTAR	CUDA: Fix clang warnings (#12540)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	c54f6b7988b63714b87b0390e01a1e69aee79a12	9b169a4d4e01af7bc07a6981b53b27c18c9470d8	2025-03-24T15:47:10+05:30	Prajwal B Mehendarkar	mmap : skip resource limit checks on AIX (#12541)
M	src/llama-mmap.cpp

commit	9b169a4d4e01af7bc07a6981b53b27c18c9470d8	77f9c6bbe55fccd9ea567794024cb80943947901	2025-03-24T01:56:17-05:00	Jeff Bolz	vulkan: fix mul_mat_vec failure in backend tests (#12529)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	tests/test-backend-ops.cpp

commit	77f9c6bbe55fccd9ea567794024cb80943947901	18b663d8e4ef352a9a15ff15d695fc3258801d60	2025-03-23T19:30:26+01:00	Marius Gerdes	server : Add verbose output to OAI compatible chat endpoint. (#12246)
M	examples/server/server.cpp

commit	18b663d8e4ef352a9a15ff15d695fc3258801d60	fbdfefe74e736f1a3687283c25ac21b11ba07b2e	2025-03-23T09:21:48+01:00	Lars Sonchocky-Helldorf	install : add macports (#12518)
M	docs/install.md

commit	fbdfefe74e736f1a3687283c25ac21b11ba07b2e	ba932dfb50cc694645b1a148c72f8c06ee080b17	2025-03-22T23:28:19+01:00	Xuan-Son Nguyen	llama : gemma3 : use output tensor if it exists in model weight (#12506)
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-model.cpp

commit	ba932dfb50cc694645b1a148c72f8c06ee080b17	fac63a3d786b2a0f97876c30add02cb525a9648e	2025-03-22T16:23:26+02:00	Georgi Gerganov	ggml : fix quantized cpy op (#12310)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	tests/test-backend-ops.cpp

commit	fac63a3d786b2a0f97876c30add02cb525a9648e	eddfb438502bd5d1014d63a812e9b6d03d326f8c	2025-03-22T17:11:37+08:00	R0CKSTAR	musa: refine compute capability (#12493)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	eddfb438502bd5d1014d63a812e9b6d03d326f8c	4375415b4abf94fb36a5fd15f233ac0ee23c0bd1	2025-03-22T03:40:11-05:00	Jeff Bolz	vulkan: Optimize mul_mat_vec p021 and nc shaders (#12505)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_nc.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_p021.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	4375415b4abf94fb36a5fd15f233ac0ee23c0bd1	30c42ef5cbb2db756eff9aadc6b6c528ba68388d	2025-03-21T20:34:50+01:00	stduhpf	Vulkan: RTE rounding for cpy to quant (#12480)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	30c42ef5cbb2db756eff9aadc6b6c528ba68388d	af04481e6b3b8dcdf5c1cc7d84bc7ece5658e9ab	2025-03-21T19:27:47Z	Eve	vulkan: workaround for AMD Windows driver 16 bit unpack8 bug (#12472)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq3_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp

commit	af04481e6b3b8dcdf5c1cc7d84bc7ece5658e9ab	960e72607761eb2dd170b33f02a5a2840ec412fe	2025-03-21T16:14:29+02:00	Georgi Gerganov	model : do not repack if a GPU device is present (#12498)
M	src/llama-model.cpp

commit	960e72607761eb2dd170b33f02a5a2840ec412fe	ea1518e839abe668c20f7e0074c0721f803da898	2025-03-21T10:21:36+01:00	Sigbjørn Skjæret	chore : cleanup llama_model_loader::TENSOR_ usage (#12492)
M	src/llama-model.cpp

commit	ea1518e839abe668c20f7e0074c0721f803da898	1aa87ee53d05505247c54612e40f6a38c680b433	2025-03-21T10:12:45+01:00	marcoStocchi	llama-tts : avoid crashes related to bad model file paths (#12482)
M	examples/tts/tts.cpp

commit	1aa87ee53d05505247c54612e40f6a38c680b433	9ffcc9e374080f73b16b7a351e6d76e7a8a19ce3	2025-03-21T14:58:47+08:00	蕭澧邦	[SYCL] Fix build on Windows when ccache enabled (#9954) (#9976)
M	ggml/src/CMakeLists.txt

commit	9ffcc9e374080f73b16b7a351e6d76e7a8a19ce3	e04643063b3d240b8c0fdba98677dff6ba346784	2025-03-21T02:15:56Z	Svetlozar Georgiev	sycl: cleanup oneDNN related code (#12097)
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	e04643063b3d240b8c0fdba98677dff6ba346784	dbb3a4739e53226346c772dd72666e68b78dc583	2025-03-20T14:57:43Z	Woof Dog	webui : Prevent rerendering on textarea input (#12299)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/utils/llama-vscode.ts

commit	dbb3a4739e53226346c772dd72666e68b78dc583	3d82dbcbce2c677fc35fbf99574ccd107d95a1f8	2025-03-20T12:49:59+01:00	Sigbjørn Skjæret	llama : make Qwen2MoE QKV bias optional (#12477)
M	src/llama-model.cpp

commit	3d82dbcbce2c677fc35fbf99574ccd107d95a1f8	732b5fbf5e7f9cf069942f0c5850ee959ef321ba	2025-03-20T17:05:34+05:30	Srihari-mcw	ggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	732b5fbf5e7f9cf069942f0c5850ee959ef321ba	568013d0cd3d5add37c376b3d5e959809b711fc7	2025-03-20T02:36:37-04:00	Bartowski	convert : avoid calls to tokenizer.added_tokens_decoder (#12473)
M	convert_hf_to_gguf.py

commit	568013d0cd3d5add37c376b3d5e959809b711fc7	517b5ddbf002b91fd6d6daf5d8db8c88a0173039	2025-03-19T21:01:57+01:00	fairydreaming	context : clear sets containing encoder output sequence ids before storing new values (#12470)
M	src/llama-context.cpp

commit	517b5ddbf002b91fd6d6daf5d8db8c88a0173039	a9b59288e222f39fc0311dc66944ed5a86c815fa	2025-03-20T01:22:06+05:30	Gaurav Garg	CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-cuda/vendors/musa.h
M	tests/test-backend-ops.cpp

commit	a9b59288e222f39fc0311dc66944ed5a86c815fa	0fd8487b142b2b92565bc95b39ddc440955a237c	2025-03-19T13:56:23-05:00	Jeff Bolz	vulkan: optimize iq1 coopmat2 dequant functions (#12427)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp

commit	0fd8487b142b2b92565bc95b39ddc440955a237c	108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5	2025-03-19T10:15:23Z	Guus Waals	Fix visionOS build and add CI (#12415)
M	.github/workflows/build.yml
M	build-xcframework.sh
M	ggml/src/CMakeLists.txt

commit	108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5	a686171ea71ed8cb8a324850d146cb65a001e141	2025-03-19T09:08:49+01:00	Sigbjørn Skjæret	llama : add support for GPT2, Bloom and CodeShell tied word embeddings (#12456)
M	convert_hf_to_gguf.py
M	src/llama-model.cpp

commit	a686171ea71ed8cb8a324850d146cb65a001e141	c446b2edd2a9fe2772a1a18923c3e54a6749c364	2025-03-19T08:58:13+01:00	Sigbjørn Skjæret	convert : Support chat_template.json (#12460)
M	gguf-py/gguf/vocab.py

commit	c446b2edd2a9fe2772a1a18923c3e54a6749c364	d84635b1b085d54d6a21924e6171688d6e3dfb46	2025-03-19T02:26:26-05:00	Jeff Bolz	vulkan: Submit once enough matmul work has been recorded (#12406)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	d84635b1b085d54d6a21924e6171688d6e3dfb46	75422e8bc42646005be0754f7aa438b97a5e777e	2025-03-18T12:54:55-07:00	lhez	opencl: improve profiling (#12442)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	75422e8bc42646005be0754f7aa438b97a5e777e	bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71	2025-03-18T21:35:19+02:00	Georgi Gerganov	graph : normalize Q, K, V shapes + sync cross attention (#12449)
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71	29fff308c704c1c752cdb5153361e545e2bac09d	2025-03-19T02:28:26+08:00	R0CKSTAR	musa: override warp_size of musa device to 32 (#12445)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	29fff308c704c1c752cdb5153361e545e2bac09d	c6af2161b200284d55633cf184a07406ca89908e	2025-03-18T19:16:19+01:00	Xuan-Son Nguyen	llama : support converting Mistral Small text-only (#12450)
M	convert_hf_to_gguf.py

commit	c6af2161b200284d55633cf184a07406ca89908e	99aa304fb900654ec338749f64e62895b9a88afd	2025-03-18T19:35:11+02:00	Georgi Gerganov	speculative : fix seg fault in certain cases (#12454)
M	examples/speculative/speculative.cpp

commit	99aa304fb900654ec338749f64e62895b9a88afd	8551c44d840a7db50adb958ccaf464dc3ded82e7	2025-03-18T17:24:33+01:00	Xuan-Son Nguyen	llama : add support for EXAONE tied word embeddings (#12451)
M	src/llama-model.cpp

commit	8551c44d840a7db50adb958ccaf464dc3ded82e7	35cae5ba05a5292dc3108636a71ec59fa2f80ab7	2025-03-18T13:05:49+02:00	Georgi Gerganov	context : always use non-causal attention for encoder graphs (#12447)
M	src/llama-context.cpp

commit	35cae5ba05a5292dc3108636a71ec59fa2f80ab7	810e0af3f50379682dd46b7967c4aadf3f8286f6	2025-03-18T11:16:31+01:00	Łukasz Ślusarczyk	SYCL: using graphs is configurable by environment variable and compile option (#12371)
M	docs/backend/SYCL.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	810e0af3f50379682dd46b7967c4aadf3f8286f6	eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c	2025-03-18T12:05:42+02:00	Georgi Gerganov	server : fix warmup draft cache type (#12446)
M	examples/server/server.cpp

commit	eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c	d9a14523bb9074eef42d1b43ae4a1e149f81b7e2	2025-03-18T15:07:33+05:30	Prajwal B Mehendarkar	cmake : fix PowerPC build (#12241)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	d9a14523bb9074eef42d1b43ae4a1e149f81b7e2	fd123cfead49eb32e386e26b8ef7a6d41554dda5	2025-03-18T17:14:39+09:00	fj-y-saito	ggml : add SVE support for q6_K_q8_K (#12361)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	fd123cfead49eb32e386e26b8ef7a6d41554dda5	a53f7f7b8859f3e634415ab03e1e295b9861d7e6	2025-03-18T07:21:40+01:00	0cc4m	Vulkan: Default to 1GB allocations instead of 4GB to avoid fragmentation and driver issues (#12434)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	a53f7f7b8859f3e634415ab03e1e295b9861d7e6	7dfad387e3f6ac98d383ded2d175eb59736a3993	2025-03-18T01:51:25+01:00	Łukasz Ślusarczyk	fixed compilation warnings in ggml-sycl (#12424)
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/getrows.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/softmax.cpp

commit	7dfad387e3f6ac98d383ded2d175eb59736a3993	60c902926c928f9c2cd6390ce411876f92feeaf3	2025-03-18T07:27:50+08:00	Molly Sophia	llama: Add support for RWKV v7 architecture (#12412)
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-cuda/norm.cuh
A	ggml/src/ggml-cuda/wkv.cu
R062	ggml/src/ggml-cuda/wkv6.cuh	ggml/src/ggml-cuda/wkv.cuh
D	ggml/src/ggml-cuda/wkv6.cu
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/norm.hpp
A	ggml/src/ggml-sycl/wkv.cpp
A	ggml/src/ggml-sycl/wkv.hpp
D	ggml/src/ggml-sycl/wkv6.cpp
D	ggml/src/ggml-sycl/wkv6.hpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/l2_norm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/wkv7.comp
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	tests/test-backend-ops.cpp

commit	60c902926c928f9c2cd6390ce411876f92feeaf3	b1b132efcba216c873715c483809730bb253f4a1	2025-03-17T21:14:32+01:00	Sigbjørn Skjæret	docs : bring llama-cli conversation/template docs up-to-date (#12426)
M	examples/main/README.md

commit	b1b132efcba216c873715c483809730bb253f4a1	01e8f2138b2e40902afe2983ecbf503a08d74b1d	2025-03-17T23:55:13+05:30	Gaurav Garg	cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-cuda/vendors/musa.h
M	ggml/src/ggml-musa/CMakeLists.txt

commit	01e8f2138b2e40902afe2983ecbf503a08d74b1d	484a8ab513bbd740cc49f30280c1acf52cb4e7e9	2025-03-18T00:35:43+08:00	Guus Waals	ggml-vulkan: remove unused find_program(glslc) (#12416)
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt

commit	484a8ab513bbd740cc49f30280c1acf52cb4e7e9	cf2270e4d3685ac46f4a166d8718997ba7cbc45a	2025-03-17T09:26:18-05:00	Jeff Bolz	vulkan: Add N/2 and N/4 optimized paths in coopmat2 shader (#12312)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	cf2270e4d3685ac46f4a166d8718997ba7cbc45a	f07690c930f74d82d4f108e567c7092544847f77	2025-03-17T12:42:33+01:00	Daniele	vulkan: subgroup size tuning (#12087)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	f07690c930f74d82d4f108e567c7092544847f77	891c63956dbfbdf7ed2ecd0b5882cff49dbfe90f	2025-03-17T04:43:35-05:00	Jeff Bolz	vulkan: use fp32 in coopmat2 q4_k dequant function (#12309)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp

commit	891c63956dbfbdf7ed2ecd0b5882cff49dbfe90f	2f21123c1deb3ce1be3c0578c5f6980fe19ed077	2025-03-17T04:41:59-05:00	Jeff Bolz	vulkan: Pad N dimension of B matrix for coopmat2 perf, to avoid bounds checking (#12273)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp

commit	2f21123c1deb3ce1be3c0578c5f6980fe19ed077	374101fd742bb35cb9bf46c86836e54d51191ffd	2025-03-17T04:35:00-05:00	Jeff Bolz	vulkan: Adjust coopmat2 tile sizes and selection heuristic (#12258)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	374101fd742bb35cb9bf46c86836e54d51191ffd	b3c9a65673a63a6c9a75da24ee00d13499494e0c	2025-03-17T10:05:23+01:00	Christian Kastner	cmake : enable building llama.cpp using system libggml (#12321)
M	CMakeLists.txt
M	cmake/common.cmake
A	ggml/cmake/common.cmake
M	ggml/src/CMakeLists.txt

commit	b3c9a65673a63a6c9a75da24ee00d13499494e0c	8ba95dca2065c0073698afdfcda4c8a8f08bf0d9	2025-03-17T07:15:12+05:30	Akarshan Biswas	SYCL: set extras only on GGML_TYPE_Q4_0 (#12366)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	8ba95dca2065c0073698afdfcda4c8a8f08bf0d9	dc079cfdffa1141a6caf5d41a33d73a1ef03da55	2025-03-16T18:46:36+01:00	Sigbjørn Skjæret	llama : fix OLMo-2-0325-32B-Instruct K-norm size (#12400)
M	src/llama-model.cpp

commit	dc079cfdffa1141a6caf5d41a33d73a1ef03da55	7b61bcc87cfdeab88350e82df1c4b7be64331ea6	2025-03-16T19:29:36+02:00	Georgi Gerganov	context : fix init of n_outputs (#12397)
M	src/llama-context.cpp

commit	7b61bcc87cfdeab88350e82df1c4b7be64331ea6	f4c3dd5daa3a79f713813cf1aabdc5886071061d	2025-03-16T18:22:05+01:00	Daniel Bevenius	ci : add --symlinks to xcframework zip command (#12409)
M	.github/workflows/build.yml

commit	f4c3dd5daa3a79f713813cf1aabdc5886071061d	3d35d87b4113648e224b837bb88e6b2c4c7f29e5	2025-03-15T17:23:11+01:00	marcoStocchi	llama-tts : add '-o' option (#12398)
M	common/arg.cpp
M	examples/tts/tts.cpp

commit	3d35d87b4113648e224b837bb88e6b2c4c7f29e5	b19bd064c09822cb81efe4a38abafab3e979c9ce	2025-03-15T22:49:03+08:00	aubreyli	SYCL: Delete redundant plus sign and space (#12391)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	b19bd064c09822cb81efe4a38abafab3e979c9ce	92a391327e9201b9b5b32fdd3afb452026c22d4c	2025-03-15T15:19:30+01:00	fairydreaming	SYCL : support non-contiguous tensors in binary ops (add, sub, etc) (#12399)
M	ggml/src/ggml-sycl/common.hpp

commit	92a391327e9201b9b5b32fdd3afb452026c22d4c	9f2250ba722738ec0e6ab684636268a79160c854	2025-03-15T09:31:08+08:00	Chenguang Li	[CANN]MUL_MAT optimization (#12382)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	9f2250ba722738ec0e6ab684636268a79160c854	774973b8f3d5e375b0b74d58638eeb1817e950a8	2025-03-14T16:41:20Z	Eric Curtin	Add CLI arg to llama-run to adjust the number of threads used (#12370)
M	examples/run/run.cpp

commit	774973b8f3d5e375b0b74d58638eeb1817e950a8	8fcb563613e20a04dd9791f0a9b8a41086428c09	2025-03-14T16:57:05+01:00	Sigbjørn Skjæret	main : add -sysf / --system-prompt-file (#12249) (#12250)
M	common/arg.cpp

commit	8fcb563613e20a04dd9791f0a9b8a41086428c09	add2a3aa5a1571211aa5c7303b8e80c8d1824b91	2025-03-14T13:47:05+01:00	fairydreaming	Load all MoE experts during warmup (#11571)
M	common/common.cpp
M	include/llama.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-cparams.h
M	src/llama-graph.cpp

commit	add2a3aa5a1571211aa5c7303b8e80c8d1824b91	c522ce4143a2b5c277f1e5f65cd570dbd0626466	2025-03-14T11:21:17+01:00	Victor	server: fix "--grammar-file" parameter (#12285)
M	examples/server/utils.hpp

commit	c522ce4143a2b5c277f1e5f65cd570dbd0626466	081bee8c643b1f6302e9edfe789ce2d5f0be6c77	2025-03-14T10:47:44+02:00	Georgi Gerganov	graph : simplify attn input build for unified KV cache (#12381)
M	src/llama-graph.cpp
M	src/llama-graph.h
M	src/llama-model.cpp

commit	081bee8c643b1f6302e9edfe789ce2d5f0be6c77	84d547554123a62e9ac77107cb20e4f6cc503af4	2025-03-14T09:03:24+02:00	Georgi Gerganov	hparams : add SWA rope parameters (#12374)
M	src/llama-context.cpp
M	src/llama-graph.cpp
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	84d547554123a62e9ac77107cb20e4f6cc503af4	be7c3034108473beda214fd1d7c98fd6a7a3bdf5	2025-03-13T19:08:07+02:00	Georgi Gerganov	llama : fix Gemma3 SWA KV cache shift (#12373)
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-graph.cpp
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp

commit	be7c3034108473beda214fd1d7c98fd6a7a3bdf5	e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b	2025-03-13T12:34:54+01:00	Xuan-Son Nguyen	arg : no n_predict = -2 for examples except for main and infill (#12364)
M	common/arg.cpp

commit	e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b	2048b5913d51beab82dfe29955f9008130b936c0	2025-03-13T12:35:44+02:00	Georgi Gerganov	llama : refactor llama_context, llama_kv_cache, llm_build_context (#12181)
M	common/common.cpp
M	common/speculative.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/gemma3-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/retrieval/retrieval.cpp
M	examples/run/run.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/tests/utils.py
M	examples/simple-chat/simple-chat.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/CMakeLists.txt
M	src/llama-adapter.cpp
M	src/llama-adapter.h
M	src/llama-batch.h
M	src/llama-context.cpp
M	src/llama-context.h
A	src/llama-graph.cpp
A	src/llama-graph.h
A	src/llama-io.cpp
A	src/llama-io.h
M	src/llama-kv-cache.cpp
M	src/llama-kv-cache.h
A	src/llama-memory.cpp
A	src/llama-memory.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama.cpp

commit	2048b5913d51beab82dfe29955f9008130b936c0	f08f4b3187b691bb08a8884ed39ebaa94e956707	2025-03-13T06:10:05-04:00	Ishaan Gandhi	server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
M	examples/server/server.cpp

commit	f08f4b3187b691bb08a8884ed39ebaa94e956707	80a02aa8588ef167d616f76f1781b104c245ace0	2025-03-12T20:06:58+01:00	Oscar Barenys	Update build.yml for Windows Vulkan builder to use Vulkan 1.4.304 SDK for VK_NV_cooperative_matrix2 support (#12301)
M	.github/workflows/build.yml

commit	80a02aa8588ef167d616f76f1781b104c245ace0	363f8c5d67dcf80e00c39580dfa86dc2774d74c2	2025-03-12T13:45:32+01:00	Daniel Bevenius	llama.swiftui : fix xcframework dir in README [no ci] (#12353)
M	examples/llama.swiftui/README.md

commit	363f8c5d67dcf80e00c39580dfa86dc2774d74c2	34c961b181836a4f06ab4c56d5ce61ce03fc478b	2025-03-12T09:57:32Z	Alberto Cabrera Pérez	sycl : variable sg_size support for mmvq kernels (#12336)
M	ggml/src/ggml-sycl/mmvq.cpp

commit	34c961b181836a4f06ab4c56d5ce61ce03fc478b	7841fc723e059d1fd9640e5c0ef19050fcc7c698	2025-03-12T10:14:11+01:00	uvos	CUDA/HIP: Fix fattn-vec-* when device warp size is not 32 (#12315)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu

commit	7841fc723e059d1fd9640e5c0ef19050fcc7c698	bf69cfe62f9ccc01112c0232a55820b95a8c1fda	2025-03-12T09:30:24+01:00	Xuan-Son Nguyen	llama : Add Gemma 3 support (+ experimental vision capability) (#12343)
M	convert_hf_to_gguf.py
M	examples/llava/CMakeLists.txt
A	examples/llava/README-gemma3.md
M	examples/llava/clip.cpp
A	examples/llava/gemma3-cli.cpp
A	examples/llava/gemma3_convert_encoder_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama.cpp

commit	bf69cfe62f9ccc01112c0232a55820b95a8c1fda	10f2e81809bbb69ecfe64fc8b4686285f84b0c07	2025-03-12T00:59:19-05:00	Jeff Bolz	vulkan: fix bug in coopmat1 mul_mat_id (#12316)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	tests/test-backend-ops.cpp

commit	10f2e81809bbb69ecfe64fc8b4686285f84b0c07	ba7654380a3c7c1b5ae154bea19134a3a9417a1e	2025-03-11T20:16:03+01:00	uvos	CUDA/HIP: refractor mmqv to unify the calculation of nwarps and rows per block between host and device code. (#12177)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmvq.cu

commit	ba7654380a3c7c1b5ae154bea19134a3a9417a1e	6ab2e4765a673abcd162258a2671560a76106d69	2025-03-11T21:25:17+08:00	jklincn	ggml-backend : fix backend search path (#12330)
M	ggml/src/ggml-backend-reg.cpp

commit	6ab2e4765a673abcd162258a2671560a76106d69	96e1280839561aaabb73851f94972a2cd37b2d96	2025-03-11T19:45:02+08:00	BB-fat	metal : Cache the Metal library at the device context level (#12265)
M	ggml/src/ggml-metal/ggml-metal.m

commit	96e1280839561aaabb73851f94972a2cd37b2d96	2c9f833d17bb5b8ea89dec663b072b5420fc5438	2025-03-11T09:20:16+01:00	Xuan-Son Nguyen	clip : bring back GPU support (#12322)
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/minicpmv-cli.cpp

commit	2c9f833d17bb5b8ea89dec663b072b5420fc5438	251364549fe4a78d4e2e66f1adfaf2bd53041d2c	2025-03-10T19:28:11Z	Eve	mat vec double buffer (#12188)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp

commit	251364549fe4a78d4e2e66f1adfaf2bd53041d2c	8acdacb3ea00697477eb019efbb6fc183371055c	2025-03-11T01:18:25+08:00	R0CKSTAR	musa: support new arch mp_31 and update doc (#12296)
M	Makefile
M	docs/build.md
M	ggml/src/ggml-musa/CMakeLists.txt

commit	8acdacb3ea00697477eb019efbb6fc183371055c	89b2b56e8658800375a8314200870b1ad4208a0b	2025-03-10T18:57:00+02:00	Henry Linjamäki	opencl: use OpenCL C standard supported by the device (#12221)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-opencl/CMakeLists.txt
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	89b2b56e8658800375a8314200870b1ad4208a0b	e128a1bf5b65741b485dd094a4201264d0580d68	2025-03-10T22:13:09+08:00	John Bean	readme: added Sidekick to available UIs (#12311)
M	README.md

commit	e128a1bf5b65741b485dd094a4201264d0580d68	6ef79a67caf1159b0150b44ee80888c7ec98b83f	2025-03-10T14:07:15+02:00	Georgi Gerganov	tests : fix test-quantize-fns to init the CPU backend (#12306)
M	tests/test-quantize-fns.cpp

commit	6ef79a67caf1159b0150b44ee80888c7ec98b83f	4e39a3c332f84b890e91353ec448502cb8373a6f	2025-03-10T12:34:13+01:00	marcoStocchi	common : refactor '-o' option (#12278)
M	common/arg.cpp
M	common/common.h
M	examples/cvector-generator/cvector-generator.cpp
M	examples/export-lora/export-lora.cpp
M	examples/imatrix/imatrix.cpp

commit	4e39a3c332f84b890e91353ec448502cb8373a6f	be421fc429795d135786f5a0e489709220a9c43a	2025-03-10T10:59:03Z	Olivier Chafik	`server`: extract <think> tags from qwq outputs (#12297)
M	common/chat.cpp
M	common/chat.h
M	tests/test-chat.cpp

commit	be421fc429795d135786f5a0e489709220a9c43a	87c2630546cd8ccc836ae4c7d87d03fa597d2267	2025-03-10T09:45:29Z	Olivier Chafik	`tool-call`: ensure there's always a non-empty tool call id (#12292)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_tool_call.py
M	examples/server/utils.hpp

commit	87c2630546cd8ccc836ae4c7d87d03fa597d2267	2b3a25c212f8c4d8a49cec23e03343a7719d51c9	2025-03-10T09:45:07Z	Olivier Chafik	allow missing content in message if tool_calls provided (#12293)
M	common/chat.cpp
M	tests/test-chat.cpp

commit	2b3a25c212f8c4d8a49cec23e03343a7719d51c9	8352cdc87b207a735d34c431a36c425728cb4586	2025-03-10T09:44:42Z	Olivier Chafik	`sampler`: fixes trigger tokens + lazy grammars (fix typo cast from token to string) (#12291)
M	examples/server/server.cpp

commit	8352cdc87b207a735d34c431a36c425728cb4586	1e2f78a00450593e2dfa458796fcdd9987300dfc	2025-03-10T16:33:24+08:00	tc-mb	llava : fix bug in minicpm-v code (#11513)
M	examples/llava/README-minicpmo2.6.md
M	examples/llava/README-minicpmv2.5.md
M	examples/llava/README-minicpmv2.6.md
M	examples/llava/clip.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/minicpmv-convert-image-encoder-to-gguf.py

commit	1e2f78a00450593e2dfa458796fcdd9987300dfc	0fd7ca7a210bd4abc995cd728491043491dbdef7	2025-03-09T19:08:20+02:00	Georgi Gerganov	server : add speculative decoding presets for FIM (#12287)
M	common/arg.cpp

commit	0fd7ca7a210bd4abc995cd728491043491dbdef7	6fefc05a7a4e676780ae10b0a4d0728e5281f367	2025-03-08T18:26:00+02:00	Georgi Gerganov	authors : update (#12271)
M	AUTHORS

commit	6fefc05a7a4e676780ae10b0a4d0728e5281f367	7ab364390f92b0b8d83f69821a536b424838f3f8	2025-03-09T00:02:39+08:00	Jason C.H	ggml-backend : make path_str compatible with C++20 (#12269)
M	AUTHORS
M	ggml/src/ggml-backend-reg.cpp

commit	7ab364390f92b0b8d83f69821a536b424838f3f8	7c7f3b7f435f41f2508e0e3010f0013cd8335156	2025-03-07T20:54:30+02:00	Georgi Gerganov	server : infill gen ends on new line (#12254)
M	examples/server/server.cpp

commit	7c7f3b7f435f41f2508e0e3010f0013cd8335156	102ac1891db32c346a7b6b96145a2a23c1e4c352	2025-03-07T14:15:27+01:00	Daniel Bevenius	ggml : skip intermediate .air file when compiling .metallib (#12247)
M	ggml/src/ggml-metal/CMakeLists.txt

commit	102ac1891db32c346a7b6b96145a2a23c1e4c352	d6ae2fa06139e496880cbf65197c84341e9d98e7	2025-03-07T14:00:27+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	d6ae2fa06139e496880cbf65197c84341e9d98e7	68d0027f3d19eb579c1863814c91e37ffa699014	2025-03-07T11:11:40+03:00	vmobilis	ggml : ggml_compute_forward_concat() for arbitrary tensor type (ggml/1118)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml.c

commit	68d0027f3d19eb579c1863814c91e37ffa699014	ea002810a209246d034d1b6ddac387f778751588	2025-03-07T12:54:22+01:00	Rémy O	ggml-cpu: faster AVX2 variant for IQ1_M (#12216)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	ea002810a209246d034d1b6ddac387f778751588	8fad3c7a7c54a25a1ca38dfb08244df55288e675	2025-03-07T12:19:31+02:00	Georgi Gerganov	ci : fix save-load test invocations (#12245)
M	ci/run.sh

commit	8fad3c7a7c54a25a1ca38dfb08244df55288e675	7cf64f6beecf54c6ac71503181f154667fd4228a	2025-03-07T11:15:33+01:00	Sigbjørn Skjæret	server : Log original chat template parsing error (#12233)
M	examples/server/server.cpp

commit	7cf64f6beecf54c6ac71503181f154667fd4228a	5e2d57b2b2e43eadbe6d66ba3e873a824b95e725	2025-03-07T09:33:37Z	Olivier Chafik	sync: minja - support QwQ-32B (#12235)
M	common/minja/minja.hpp

commit	5e2d57b2b2e43eadbe6d66ba3e873a824b95e725	f1648e91cf6c52e9593810aa70857e412d474c09	2025-03-07T15:35:57+08:00	BB-fat	metal : simplify kernel arguments using a struct (#3229) (#12194)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	f1648e91cf6c52e9593810aa70857e412d474c09	d6c95b0740510231b3797b80d6d3440d8fe188b6	2025-03-07T15:06:08+08:00	David Huang	HIP: fix rocWMMA build flags under Windows (#12230)
M	.github/workflows/build.yml

commit	d6c95b0740510231b3797b80d6d3440d8fe188b6	d76a86d967ef491d530400b08bc8ef8a14807936	2025-03-07T06:23:16+01:00	Daniel Bevenius	metal : fix default.metallib build (#12224)
M	ggml/src/ggml-metal/CMakeLists.txt
M	ggml/src/ggml-metal/ggml-metal.metal

commit	d76a86d967ef491d530400b08bc8ef8a14807936	776f9e59cc8a85e840d1d4af8540d199c77190ac	2025-03-06T16:20:35-08:00	lhez	opencl: Noncontiguous `norm`, `rms_norm`, disable `fp16` for some ops (#12217)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/ggml-opencl.cl

commit	776f9e59cc8a85e840d1d4af8540d199c77190ac	3d652bfddfba09022525067e672c3c145c074649	2025-03-07T06:58:25+08:00	xiaofei	cmake : fix undefined reference errors for std::filesystem in ggml (#12092) (#12094)
M	ggml/src/CMakeLists.txt

commit	3d652bfddfba09022525067e672c3c145c074649	5220a16d18563d3ffc509002f0514415fdda4036	2025-03-06T16:15:13-03:00	Lucas Moura Belo	readme : update bindings (#12229)
M	README.md

commit	5220a16d18563d3ffc509002f0514415fdda4036	3ffbbd5ce130859be91909e9b77d4c1962a6be2c	2025-03-06T18:45:09+01:00	Johannes Gäßler	CUDA: fix FA logic for PTX 7.0 and CC >= 7.5 (#12222)
M	ggml/src/ggml-cuda/fattn.cu

commit	3ffbbd5ce130859be91909e9b77d4c1962a6be2c	42994048a34b0bddd72b57c26f8ae2c7d417946d	2025-03-06T21:14:11+08:00	David Huang	HIP: rocWMMA documentation and enabling in workflow builds (#12179)
M	.github/workflows/build.yml
M	docs/build.md

commit	42994048a34b0bddd72b57c26f8ae2c7d417946d	e9b2f84f145fbd458dcb98f227bd09370918be6e	2025-03-06T09:03:31Z	Olivier Chafik	update function-calling.md w/ template override for functionary-small-v3.2 (#12214)
M	docs/function-calling.md

commit	e9b2f84f145fbd458dcb98f227bd09370918be6e	e721c05c9336a72fbb59d5c75967360bc67036c6	2025-03-06T16:33:21+08:00	Aaron Teo	llava: add big-endian conversion for image encoder (#12218)
M	examples/llava/convert_image_encoder_to_gguf.py

commit	e721c05c9336a72fbb59d5c75967360bc67036c6	57b6abf85acb1f697913a44e5e105e333d894b78	2025-03-06T08:20:52+01:00	uvos	HIP/CUDA: set the paramerter value in maintain_cuda_graph instead of replaceing it. (#12209)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	57b6abf85acb1f697913a44e5e105e333d894b78	94bb63e4f0f6135579b88e5700ed40cefa374e09	2025-03-05T22:22:49-08:00	Han Yin	android : fix KV cache log message condition (#12212)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp

commit	94bb63e4f0f6135579b88e5700ed40cefa374e09	f79243992cd31e4e4844d5158d2f3325b1d2d811	2025-03-06T03:33:40+02:00	Henry Linjamäki	opencl : fix buffer alignment (#12197)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	f79243992cd31e4e4844d5158d2f3325b1d2d811	ed4ce0dda24986c80d58e2ce112049af00f632f4	2025-03-06T03:31:14+02:00	Henry Linjamäki	opencl : fix `ulong` kernel args were set from `int` variables (#12174)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	ed4ce0dda24986c80d58e2ce112049af00f632f4	07d15723470a0a5b15d8ccad1aff5b20354ffbe1	2025-03-06T09:30:05+08:00	simon886212	opencl : fix profile-related errors (#12095)
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	07d15723470a0a5b15d8ccad1aff5b20354ffbe1	5e43f104cca1a14874e980326a506b44fde022b8	2025-03-06T02:26:10+01:00	Rémy O	ggml-cpu: Faster IQ1 mul_mat_vec on AVX2 using BMI2 instructions (#12154)
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/cpu-feats-x86.cpp
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp

commit	5e43f104cca1a14874e980326a506b44fde022b8	16e4b22c5e58ee200ede913fd7b7b8ba92132ce8	2025-03-05T21:28:23+05:30	Akarshan Biswas	SYCL: Disable f16 Unary OPs as not supported by the kernels (#12201)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	16e4b22c5e58ee200ede913fd7b7b8ba92132ce8	074c4fd39df3af974e10fbee6cc6db5d9304655b	2025-03-05T17:16:01+02:00	Plamen Minev	ggml : fix GGMLMetalClass ODR (#12200)
M	ggml/src/ggml-metal/ggml-metal.m

commit	074c4fd39df3af974e10fbee6cc6db5d9304655b	669912d9a5bf927312c553332ff997f0a99da8fb	2025-03-05T14:16:40+01:00	Daniel Bevenius	ci : add fetch-depth to xcframework upload (#12195)
M	.github/workflows/build.yml

commit	669912d9a5bf927312c553332ff997f0a99da8fb	fa31c438e0e709242ab7334d26fc3be3dcda07a0	2025-03-05T13:05:13Z	Olivier Chafik	`tool-call`: fix Qwen 2.5 Coder support, add micro benchmarks, support trigger patterns for lazy grammars (#12034)
M	README.md
M	common/chat.cpp
M	common/common.cpp
M	common/common.h
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
M	common/sampling.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public_legacy/json-schema-to-grammar.mjs
M	examples/server/server.cpp
M	examples/server/tests/unit/test_tool_call.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp
M	include/llama.h
M	models/templates/README.md
M	requirements.txt
M	requirements/requirements-all.txt
A	requirements/requirements-tool_bench.txt
M	scripts/fetch_server_test_models.py
A	scripts/tool_bench.py
A	scripts/tool_bench.sh
M	src/llama-grammar.cpp
M	src/llama-grammar.h
M	src/llama-sampling.cpp
M	tests/test-chat.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	fa31c438e0e709242ab7334d26fc3be3dcda07a0	3ccbfe5a71c74ac574b00607067d0aa0a49df04c	2025-03-05T10:22:29+01:00	Daniel Bevenius	ci : fix xcframework artifact tag (#12191)
M	.github/workflows/build.yml

commit	3ccbfe5a71c74ac574b00607067d0aa0a49df04c	06a92a193a07afe445929607be9d5e4d033956fb	2025-03-05T08:34:02+01:00	Daniel Bevenius	ci : remove xframework upload (#12190)
M	.github/workflows/build.yml

commit	06a92a193a07afe445929607be9d5e4d033956fb	a057897ad4e48e3df0354256e0cc80dadcb57595	2025-03-05T15:25:45+08:00	Clauszy	server : fix cache reuse logic (#12161)
M	examples/server/server.cpp

commit	a057897ad4e48e3df0354256e0cc80dadcb57595	5bbe6a9fe9a8796a9389c85accec89dbc4d91e39	2025-03-05T06:30:31+01:00	Daniel Bevenius	llama : add xcframework build script (#11996)
M	.github/workflows/build.yml
D	Package.swift
D	Sources/llama/llama.h
D	Sources/llama/module.modulemap
A	build-xcframework.sh
M	examples/llama.swiftui/README.md
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
A	scripts/apple/validate-apps.sh
A	scripts/apple/validate-ios.sh
A	scripts/apple/validate-macos.sh
A	scripts/apple/validate-tvos.sh
A	scripts/apple/validate-visionos.sh
D	spm-headers/ggml-alloc.h
D	spm-headers/ggml-backend.h
D	spm-headers/ggml-cpp.h
D	spm-headers/ggml-cpu.h
D	spm-headers/ggml-metal.h
D	spm-headers/ggml.h
D	spm-headers/llama.h
M	src/llama-mmap.cpp

commit	5bbe6a9fe9a8796a9389c85accec89dbc4d91e39	20a9b8f5e1380243ed03aeb50ae1bf94b8d68501	2025-03-04T17:53:26+01:00	mgroeber9110	ggml : portability fixes for VS 2017 (#12150)
M	common/ngram-cache.cpp
M	common/sampling.cpp
M	common/speculative.cpp
M	examples/embedding/embedding.cpp
M	examples/lookahead/lookahead.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/quantize/quantize.cpp
M	examples/tts/tts.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-quants.c
M	ggml/src/ggml.c
M	src/llama-chat.cpp
M	src/llama-kv-cache.h
M	src/llama-mmap.cpp
M	src/llama-vocab.cpp

commit	20a9b8f5e1380243ed03aeb50ae1bf94b8d68501	56d7a9f81274717fe035db192f315a049261c7fa	2025-03-04T18:42:44+02:00	Georgi Gerganov	readme : fix roadmap link (#12185)
M	README.md

commit	56d7a9f81274717fe035db192f315a049261c7fa	1a24c4621f0280306b0d53a4fa474fc65d3f1b2e	2025-03-04T17:19:39+01:00	Sigbjørn Skjæret	main: allow preloading conversation with -p and add -st / --single-turn (#12145)
M	common/arg.cpp
M	common/common.h
M	examples/main/main.cpp

commit	1a24c4621f0280306b0d53a4fa474fc65d3f1b2e	becade5de77674696539163dfbaf5c041a1a8e97	2025-03-04T06:24:07Z	Olivier Chafik	`server`: fix deadly typo in response_format.json_schema.schema handling (#12168)
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/utils.hpp

commit	becade5de77674696539163dfbaf5c041a1a8e97	dfd6b2c0be191b3abe2fd9c1b25deff01c6249d8	2025-03-04T05:10:54+08:00	David Huang	HIP: implement FlashAttention via rocWMMA for CDNA and RDNA3+ (#12032)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-hip/CMakeLists.txt

commit	dfd6b2c0be191b3abe2fd9c1b25deff01c6249d8	b64d7cc2720a90c03480d9408fae40d936c110e2	2025-03-03T17:57:38+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	b64d7cc2720a90c03480d9408fae40d936c110e2	3d1cf3cf3394f2288dca3e1fb1fbb467d366e4bb	2025-03-03T20:51:31+05:30	cmdr2	cuda: unary ops as float + de-duplicate (ggml/1130)
M	ggml/src/ggml-cuda/clamp.cu
M	ggml/src/ggml-cuda/unary.cu

commit	3d1cf3cf3394f2288dca3e1fb1fbb467d366e4bb	0cbee131ad332a8dab5bc72315f085a544682c26	2025-02-28T12:37:35+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	0cbee131ad332a8dab5bc72315f085a544682c26	8371d445958195f9ecdff39f67c0b357f1347e3a	2025-02-28T12:36:46+02:00	cmdr2	cuda/vulkan: specify fp32-only support for some operations in supports_op (ggml/1129)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	tests/test-backend-ops.cpp

commit	8371d445958195f9ecdff39f67c0b357f1347e3a	87abb7e903635a2660e89f9336122f374d683e0a	2025-02-28T09:09:58+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	87abb7e903635a2660e89f9336122f374d683e0a	6d4c23b81b03c7b089a5f7a21ca73d1385d37191	2025-02-28T12:34:39+05:30	cmdr2	cuda/cpu: Increase support for fp16 unary operations (ggml/1125)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/clamp.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-metal/ggml-metal.m
M	tests/test-backend-ops.cpp

commit	6d4c23b81b03c7b089a5f7a21ca73d1385d37191	6512a9003741bd3fe2e11bf3bb3608ec497d368d	2025-02-27T13:35:07+01:00	Diego Devesa	whisper : support GGML_BACKEND_DL (whisper/2843)
M	ggml/src/CMakeLists.txt

commit	6512a9003741bd3fe2e11bf3bb3608ec497d368d	4512055792cff7ea107f2d2231f79aa1af073c62	2025-02-05T04:41:10-08:00	midnight	cmake : fix compile assumptions for power9/etc (whisper/2777)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	4512055792cff7ea107f2d2231f79aa1af073c62	f54a4ba11ed8ab59da778d5e280f7dc73c775a7a	2025-02-26T21:44:00+01:00	petterreinholdtsen	Told cmake to install ggml-cpp.h as a public header file. (ggml/1126)
M	ggml/CMakeLists.txt

commit	f54a4ba11ed8ab59da778d5e280f7dc73c775a7a	aede2074f608d7bf6614cdd047bce687a2b3d908	2025-02-25T18:06:34+05:30	cmdr2	Support pure float16 add/sub/mul/div operations in the CUDA (and CPU) backend (ggml/1121)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/binbcast.cu
M	tests/test-backend-ops.cpp

commit	aede2074f608d7bf6614cdd047bce687a2b3d908	2679c3b55d1c9c3fed56dea00fea713622e42594	2025-02-28T09:09:38+02:00	Georgi Gerganov	scripts : sync-ggml-am.sh fix
M	scripts/sync-ggml-am.sh

commit	2679c3b55d1c9c3fed56dea00fea713622e42594	c43af9276b119dae7436b7878d59671d0f6b1a97	2025-03-03T16:17:36+01:00	Daniel Bevenius	ci : set GITHUB_ACTION env var for server tests (#12162)
M	.github/workflows/server.yml

commit	c43af9276b119dae7436b7878d59671d0f6b1a97	d5c63cd7f932663a20a860ef11a238e627abac53	2025-03-03T21:09:29+08:00	dm4	tts: add speaker file support (#12048)
M	common/arg.cpp
M	common/common.h
M	examples/tts/tts.cpp

commit	d5c63cd7f932663a20a860ef11a238e627abac53	9660ffef582ca275092b621c87085a6eea136a90	2025-03-03T14:00:46+01:00	Diego Devesa	test-backend-ops : add option -p to filter by op params (#12155)
M	tests/test-backend-ops.cpp

commit	9660ffef582ca275092b621c87085a6eea136a90	c950a1f69269bff416d74349a82d78181ce6f0f8	2025-03-03T20:54:08+08:00	ag2s20150909	ggml : fix kleidiai build (#12159)
M	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp

commit	c950a1f69269bff416d74349a82d78181ce6f0f8	7b69003af74924ac04d97313c2e57c45ba56b616	2025-03-03T12:44:56Z	Eric Curtin	Adding UTF-8 support to llama.cpp (#12111)
M	examples/run/linenoise.cpp/linenoise.cpp
M	examples/run/linenoise.cpp/linenoise.h

commit	7b69003af74924ac04d97313c2e57c45ba56b616	ece9745bb8079b9f4af45df29b67ad0c6e50584d	2025-03-03T11:42:45+01:00	Xuan-Son Nguyen	webui : add ?m=... and ?q=... params (#12148)
M	examples/server/public/index.html.gz
M	examples/server/tests/utils.py
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/utils/misc.ts

commit	ece9745bb8079b9f4af45df29b67ad0c6e50584d	cc473cac7cea1484c1f870231073b0bf0352c6f9	2025-03-03T15:37:22+05:30	Akarshan Biswas	SYCL: Move CPY kernels to a separate file and add few missing kernels (#12133)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/common.hpp
A	ggml/src/ggml-sycl/cpy.cpp
A	ggml/src/ggml-sycl/cpy.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	cc473cac7cea1484c1f870231073b0bf0352c6f9	14dec0c2f29ae56917907dbf2eed6b19438d0a0e	2025-03-02T22:11:00+01:00	Diego Devesa	ggml-backend : keep paths in native string type when possible (#12144)
M	ggml/src/ggml-backend-reg.cpp

commit	14dec0c2f29ae56917907dbf2eed6b19438d0a0e	1782cdfed60952f9ff333fc2ab5245f2be702453	2025-03-02T14:53:48+01:00	Sigbjørn Skjæret	main: use jinja chat template system prompt by default (#12118)
M	examples/main/main.cpp

commit	1782cdfed60952f9ff333fc2ab5245f2be702453	45a8e7674548fca9b4ff6d8de97b73bf60f83d72	2025-03-01T15:22:27+01:00	Sigbjørn Skjæret	main: update outdated system prompt message (followup to #12131) (#12132)
M	examples/main/main.cpp

commit	45a8e7674548fca9b4ff6d8de97b73bf60f83d72	80c41ddd8f11b8094018296d9820c2b6c119ac12	2025-03-01T13:56:45+01:00	Sigbjørn Skjæret	common : add --system-prompt parameter, replace behavior of -p in conversation mode (#12131)
M	common/arg.cpp
M	common/common.h
M	examples/main/main.cpp

commit	80c41ddd8f11b8094018296d9820c2b6c119ac12	2cc4a5e44a3a9ab94426816770d611b33fae8f77	2025-03-01T12:57:22+01:00	Erik Scholz	CUDA: compress mode option and default to size (#12029)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	2cc4a5e44a3a9ab94426816770d611b33fae8f77	06c2b1561d8b882bc018554591f8c35eb04ad30e	2025-03-01T15:45:09+05:30	Vivian	webui : minor typo fixes (#12116)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/SettingDialog.tsx

commit	06c2b1561d8b882bc018554591f8c35eb04ad30e	70680c48e5f77d2d3138712a6582bd8c1e548922	2025-02-28T17:44:46+01:00	Xuan-Son Nguyen	convert : fix Norway problem when parsing YAML (#12114)
M	gguf-py/gguf/metadata.py

commit	70680c48e5f77d2d3138712a6582bd8c1e548922	c43a3e7996e585e2addde1e44057a4f3cdbadef8	2025-02-28T05:41:47-08:00	William Tambellini	ggml : upgrade init_tensor API to return a ggml_status (#11854)
M	.gitignore
M	CONTRIBUTING.md
M	ggml/include/ggml-alloc.h
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/amx/amx.cpp
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	tests/test-backend-ops.cpp

commit	c43a3e7996e585e2addde1e44057a4f3cdbadef8	84d5f4bc195b9540fcb902d869015fba7ef6baa4	2025-02-28T12:44:11+01:00	Xuan-Son Nguyen	llama : add Phi-4-mini support (supersede #12099) (#12108)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
A	models/ggml-vocab-gpt-4o.gguf.inp
A	models/ggml-vocab-gpt-4o.gguf.out
M	src/llama-model.cpp
M	src/llama-vocab.cpp

commit	84d5f4bc195b9540fcb902d869015fba7ef6baa4	438a83926afcff3643ffef5543db67545ceffe39	2025-02-28T04:31:47-07:00	Alex Brooks	Update granite vision docs for 3.2 model (#12105)
M	examples/llava/README-granitevision.md

commit	438a83926afcff3643ffef5543db67545ceffe39	9c42b1718ca8299f9afeabdc122badeab64c9690	2025-02-28T09:42:52+01:00	Rémy O	vulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_s.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_xs.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq2_xxs.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq3_s.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq3_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9c42b1718ca8299f9afeabdc122badeab64c9690	05e6f5aad0a4bb48fb2775f2a78505540fdbc47d	2025-02-28T09:26:43+01:00	Johannes Gäßler	CUDA: fix logic for V100 + GGML_CUDA_FORCE_MMQ (#12098)
M	ggml/src/ggml-cuda/mmq.cuh

commit	05e6f5aad0a4bb48fb2775f2a78505540fdbc47d	673cfef9aa8daad09966208909f346eb996628a4	2025-02-28T13:06:12+05:30	Prashant Vithule	ggml: aarch64: implement SVE kernels for q2_k_q8_k vector dot (#12064)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	673cfef9aa8daad09966208909f346eb996628a4	fbeda9002d4b8b79a4f9288a7ff0d34ef4fb23d5	2025-02-28T15:23:47+08:00	hipudding	CANN: Fix build error with GCC 13 (#11990)
M	ggml/src/ggml-cann/kernels/dup.cpp

commit	fbeda9002d4b8b79a4f9288a7ff0d34ef4fb23d5	581650b7cacec2872982fde381bd3bcda0f78699	2025-02-28T07:20:08Z	Eve	vulkan: matmul dequantization improvements (#12015)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	581650b7cacec2872982fde381bd3bcda0f78699	b95c8af37ccf169b0a3216b7ed691af0534e5091	2025-02-28T06:52:51Z	Daniele	vulkan: improve im2col (#11826)
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp

commit	b95c8af37ccf169b0a3216b7ed691af0534e5091	a800ae46da2ed7dac236aa6bf2b595da6b6294b5	2025-02-27T08:42:48+01:00	Vladimir Vuksanovic	cmake: Fix ggml backend dependencies and installation (#11818)
M	ggml/CMakeLists.txt
M	ggml/cmake/ggml-config.cmake.in

commit	a800ae46da2ed7dac236aa6bf2b595da6b6294b5	69050a11be0ae3e01329f11371ecb6850bdaded5	2025-02-26T22:26:52+08:00	Ting Lou	llava : add struct for FFI bindgen (#12079)
M	examples/llava/clip.h

commit	69050a11be0ae3e01329f11371ecb6850bdaded5	3567ee3a94d57ba72b6d023ca507d11e75767edb	2025-02-26T14:04:48+01:00	Sigbjørn Skjæret	Refactor gguf scripts to improve metadata handling (#11909)
M	gguf-py/examples/reader.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/scripts/gguf_convert_endian.py
M	gguf-py/gguf/scripts/gguf_dump.py
M	gguf-py/gguf/scripts/gguf_new_metadata.py
M	gguf-py/pyproject.toml

commit	3567ee3a94d57ba72b6d023ca507d11e75767edb	53e4db10126e277486eccb94c6728f4146c75741	2025-02-26T12:39:27+01:00	Aleksei Nikiforov	gguf-py: enable reading non-native endian files (#12081)
M	gguf-py/gguf/gguf_reader.py

commit	53e4db10126e277486eccb94c6728f4146c75741	d7cfe1ffe0f435d0048a6058d529daf76e072d9c	2025-02-26T15:49:36+08:00	Kante Yin	readme : update infra list (#9096)
M	README.md

commit	d7cfe1ffe0f435d0048a6058d529daf76e072d9c	a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552	2025-02-25T18:52:56Z	Olivier Chafik	docs: add docs/function-calling.md to lighten server/README.md's plight (#12069)
A	docs/function-calling.md
M	examples/server/README.md

commit	a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552	401af80b546005a06854827b732e3b46979ae028	2025-02-25T09:30:21-06:00	Jeff Bolz	vulkan: fix assertion when qy_needs_dequant (#12068)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	401af80b546005a06854827b732e3b46979ae028	c132239bfbc1aae3a96dfee3350afcb491f64ade	2025-02-25T11:52:52Z	rhjdvsgsgks	server: handle echo=false on /v1/completions (#12060)
M	examples/server/utils.hpp

commit	c132239bfbc1aae3a96dfee3350afcb491f64ade	393fca629e6ec391b76edf778cb3f7a8a3bc56f9	2025-02-25T19:32:20+08:00	Judd	add OP sigmoid (#12056)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/sigmoid.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	393fca629e6ec391b76edf778cb3f7a8a3bc56f9	61d4f39dfeaf3bbcf4e1535ac03953a5d766680b	2025-02-25T19:28:22+08:00	Molly Sophia	ggml-cpu: Fix build with sve (#12059)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	61d4f39dfeaf3bbcf4e1535ac03953a5d766680b	0b52745649062c04b546aab662cfdb220f4f0621	2025-02-25T12:04:45+01:00	Rémy O	vulkan: implement more backpropagation operators (#11914)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/silu_back.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/soft_max_back.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	0b52745649062c04b546aab662cfdb220f4f0621	4d1051a40ffc2fdff80bc532eea5b9568b85c156	2025-02-25T10:40:22Z	Olivier Chafik	server: support add_generation_prompt query param (#12062)
M	examples/server/utils.hpp

commit	4d1051a40ffc2fdff80bc532eea5b9568b85c156	3e9a2860e996657fc10db8393cf65adc40703082	2025-02-25T02:46:05-07:00	Alex Brooks	Add Doc for Converting Granite Vision -> GGUF (#12006)
A	examples/llava/README-granitevision.md

commit	3e9a2860e996657fc10db8393cf65adc40703082	58d07a8043a1395177cf77b3e4f388e34182ae64	2025-02-25T01:29:33-08:00	Vitali Lovich	llama : expose llama_model_n_head_kv in the API (#11997)
M	include/llama.h
M	src/llama-model.cpp

commit	58d07a8043a1395177cf77b3e4f388e34182ae64	34a846b5847a18d133b360074f1fb485b2632b2d	2025-02-25T10:27:58+01:00	Gian-Carlo Pascutto	metal : copy kernels for quant to F32/F16 conversions (#12017)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	34a846b5847a18d133b360074f1fb485b2632b2d	7a2c913e66353362d7f28d612fd3c9d51a831eda	2025-02-24T13:47:07-08:00	lhez	opencl: fix for small models (#11950)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/ggml-opencl.cl
M	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle.cl
M	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle_general.cl
M	ggml/src/ggml-opencl/kernels/ggml-opencl_mul_mat_Ab_Bi_8x4.cl
M	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_16.cl

commit	7a2c913e66353362d7f28d612fd3c9d51a831eda	08d5986290cc42d2c52739e046642b8252f97e4b	2025-02-24T09:09:51-07:00	Alex Brooks	llava : Add Granite Vision Support (#11794)
M	examples/llava/README.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/convert_image_encoder_to_gguf.py
M	examples/llava/llava.cpp
M	examples/llava/llava_surgery_v2.py

commit	08d5986290cc42d2c52739e046642b8252f97e4b	651adf4b6675339465179b81b194d98cc14704d6	2025-02-24T22:33:23+08:00	Neo Zhang Jianyu	[SYCL] Optimize mul_mat for Q4_0 on Intel GPU (#12035)
M	docs/backend/SYCL.md
M	examples/sycl/run-llama2.sh
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/convert.hpp
M	ggml/src/ggml-sycl/dequantize.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
A	ggml/src/ggml-sycl/getrows.cpp
A	ggml/src/ggml-sycl/getrows.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/sycl_hw.cpp
A	ggml/src/ggml-sycl/sycl_hw.hpp

commit	651adf4b6675339465179b81b194d98cc14704d6	8303e8b0fb2c1e26a8edd58071f9120a5bd6930a	2025-02-24T12:27:01+01:00	Aleksei Nikiforov	gguf_convert_endian.py: implement byteswapping for q4_k and q6_k (#11349)
M	gguf-py/gguf/scripts/gguf_convert_endian.py

commit	8303e8b0fb2c1e26a8edd58071f9120a5bd6930a	7ad0779f5de84a68143b2c00ab5dc94a948925d3	2025-02-24T15:48:25+05:30	Akarshan Biswas	SYCL: Fix GGML_SYCL_DEBUG macro (#11995)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/softmax.cpp

commit	7ad0779f5de84a68143b2c00ab5dc94a948925d3	f777a73e18c218848bca0748581c043987348a5d	2025-02-23T18:15:51+01:00	Florent BENOIT	run: allow to customize prompt by env var LLAMA_PROMPT_PREFIX (#12041)
M	examples/run/run.cpp

commit	f777a73e18c218848bca0748581c043987348a5d	af7747c95ae71a5db4184947f837179e82c70b77	2025-02-23T13:14:32Z	Eric Curtin	Some llama-run cleanups (#11973)
M	examples/run/run.cpp

commit	af7747c95ae71a5db4184947f837179e82c70b77	a28e0d5eb18c18e6a4598286158f427269b1444e	2025-02-23T05:39:24+08:00	Aaron Teo	ggml-cpu: Support s390x SIMD Instruction Set (#12019)
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml.c

commit	a28e0d5eb18c18e6a4598286158f427269b1444e	36c258ee921dbb5c96bdc57c0872e4a9a129bef6	2025-02-22T20:44:34+01:00	Johannes Gäßler	CUDA: app option to compile without FlashAttention (#12025)
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-musa/CMakeLists.txt

commit	36c258ee921dbb5c96bdc57c0872e4a9a129bef6	f3e64859edb0d55d4223ead78672597cd1a218df	2025-02-22T22:28:28+08:00	Ting Lou	llava: build clip image from pixels (#11999)
M	examples/llava/clip.cpp
M	examples/llava/clip.h

commit	f3e64859edb0d55d4223ead78672597cd1a218df	5fa07c2f93c73161bf09ef0b23b5d2686f9a073e	2025-02-22T15:03:00+02:00	Georgi Gerganov	ci : fix arm upload artifacts (#12024)
M	.github/workflows/build.yml

commit	5fa07c2f93c73161bf09ef0b23b5d2686f9a073e	335eb04a91f481f37c0c9b302ee31b449b04c3e9	2025-02-22T12:20:17+01:00	Johannes Gäßler	CUDA: optimize FA for GQA + large batches (#12014)
M	ggml/src/ggml-cuda/cp-async.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/mma.cuh
D	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb32.cu
D	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb64.cu
D	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb8.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_8.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_2.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_4.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_4.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_8.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_2.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_2.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_4.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_8.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_64-ncols2_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_1.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_2.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_4.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_8.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
M	tests/test-backend-ops.cpp

commit	335eb04a91f481f37c0c9b302ee31b449b04c3e9	cf756d6e0a314e0fe25ff944341d79ea8c94cc96	2025-02-22T04:48:57-06:00	Rohanjames1997	ci : Build on Github-hosted arm64 runners (#12009)
M	.github/workflows/build.yml

commit	cf756d6e0a314e0fe25ff944341d79ea8c94cc96	d70908421ff22b013e8209f2d12e5c750663c620	2025-02-22T12:46:31+02:00	Georgi Gerganov	server : disable Nagle's algorithm (#12020)
M	examples/server/utils.hpp

commit	d70908421ff22b013e8209f2d12e5c750663c620	de8b5a3624499bdb9fa6e99840259998638f093f	2025-02-22T09:43:24+01:00	Gian-Carlo Pascutto	cuda: Add Q5_1, Q5_0, Q4_1 and Q4_0 to F32 conversion support. (#12000)
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	de8b5a3624499bdb9fa6e99840259998638f093f	51f311e057723b7454d0ebe20f545a1a2c4db6b2	2025-02-22T06:33:29+01:00	Daniel Bevenius	llama.swiftui : add "Done" dismiss button to help view (#11998)
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift

commit	51f311e057723b7454d0ebe20f545a1a2c4db6b2	586d5fe6ebb8f92e9dd53420e04cec2697046073	2025-02-21T18:33:18+02:00	Georgi Gerganov	llama : skip loading unused tensors (#12004)
M	src/llama-model.cpp

commit	586d5fe6ebb8f92e9dd53420e04cec2697046073	ecc8e3aeff269037aa786dfb393e8b531f96832f	2025-02-21T12:51:25+01:00	Johannes Gäßler	doc: update contributing guidelines [no ci] (#11969)
M	CONTRIBUTING.md

commit	ecc8e3aeff269037aa786dfb393e8b531f96832f	0b3863ff9576872855b0265da2cab2ce7e25c4d9	2025-02-21T19:21:05+08:00	PureJourney	CUDA: correct the lowest Maxwell supported by CUDA 12 (#11984)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	0b3863ff9576872855b0265da2cab2ce7e25c4d9	ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe	2025-02-21T15:46:23+08:00	Bodhi	MUSA: support ARM64 and enable dp4a .etc (#11843)
M	Makefile
M	docs/build.md
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cross-entropy-loss.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-musa/CMakeLists.txt

commit	ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe	c392e5094deaf2d1a7c18683214f007fad3fe42b	2025-02-20T23:11:03-07:00	Alex Brooks	clip : fix visual encoders with no CLS (#11982)
M	examples/llava/clip.cpp

commit	c392e5094deaf2d1a7c18683214f007fad3fe42b	c5d91a74006c49376590ef2b67420bc7ce206397	2025-02-21T03:43:22+09:00	momonga	server (webui): Fix Premature Submission During IME Conversion (#11971)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/utils/llama-vscode.ts

commit	c5d91a74006c49376590ef2b67420bc7ce206397	4806498bf15ef767de3776b00856e56c373dd1b1	2025-02-20T14:06:51+01:00	Charles Xu	ggml-cpu: Add CPU backend support for KleidiAI library (#11390)
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
A	ggml/src/ggml-cpu/kleidiai/kernels.cpp
A	ggml/src/ggml-cpu/kleidiai/kernels.h
A	ggml/src/ggml-cpu/kleidiai/kleidiai.cpp
A	ggml/src/ggml-cpu/kleidiai/kleidiai.h

commit	4806498bf15ef767de3776b00856e56c373dd1b1	0d559580a0a74c842c3a876035ba96a338aabfb2	2025-02-20T15:38:32+05:30	Prashant Vithule	ggml: aarch64: implement SVE kernels for q3_K_q8_K vector dot (#11917)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	0d559580a0a74c842c3a876035ba96a338aabfb2	d04e7163c85a847bc61d58c22f2c503596db7aa8	2025-02-20T09:35:11+01:00	Michael Engel	run : add --chat-template-file (#11961)
M	examples/run/run.cpp

commit	d04e7163c85a847bc61d58c22f2c503596db7aa8	d07c621393fab6cf32f3add2aa65e4d5331d4a67	2025-02-19T20:45:17+01:00	Johannes Gäßler	doc: add links to ggml examples [no ci] (#11958)
M	CONTRIBUTING.md

commit	d07c621393fab6cf32f3add2aa65e4d5331d4a67	abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39	2025-02-19T12:29:52+01:00	Daniel Bevenius	common : add llama.vim preset for Qwen2.5 Coder (#11945)
M	common/arg.cpp

commit	abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39	9626d9351a6dfb665400d9fccbda876a0a96ef67	2025-02-19T13:29:42+02:00	Georgi Gerganov	speculative : update default params (#11954)
M	common/common.h
M	common/speculative.cpp
M	common/speculative.h
M	examples/server/server.cpp

commit	9626d9351a6dfb665400d9fccbda876a0a96ef67	b58934c1836b5ea51dbacbe899eee125775e77c9	2025-02-19T06:16:23+01:00	Daniel Bevenius	llama : fix indentation in llama-grammar [no ci] (#11943)
M	src/llama-grammar.cpp

commit	b58934c1836b5ea51dbacbe899eee125775e77c9	63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d	2025-02-19T00:01:44+02:00	igardev	server : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatMessage.tsx
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/utils/app.context.tsx
A	examples/server/webui/src/utils/llama-vscode.ts
M	examples/server/webui/src/utils/misc.ts
M	examples/server/webui/src/utils/types.ts

commit	63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d	63ac12856303108ee46635e6c9e751f81415ee64	2025-02-18T18:03:23Z	Olivier Chafik	tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900)
M	Makefile
M	common/CMakeLists.txt
M	common/arg.cpp
M	common/chat.cpp
A	common/chat.h
D	common/chat.hpp
M	common/common.cpp
M	common/common.h
R100	common/chat-template.hpp	common/minja/chat-template.hpp
R100	common/minja.hpp	common/minja/minja.hpp
M	examples/main/main.cpp
M	examples/run/run.cpp
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_tool_call.py
M	examples/server/utils.hpp
M	tests/test-chat-template.cpp
M	tests/test-chat.cpp

commit	63ac12856303108ee46635e6c9e751f81415ee64	5137da7b8c3eaa090476a632888ca178ba109f8a	2025-02-18T14:21:41+01:00	Xuan-Son Nguyen	server : add TEI API format for /rerank endpoint (#11942)
M	.gitignore
M	examples/server/server.cpp
M	examples/server/tests/unit/test_rerank.py
M	examples/server/utils.hpp

commit	5137da7b8c3eaa090476a632888ca178ba109f8a	09aaf4f1f5b69b5173b7fcd24eab96729f6b242a	2025-02-18T10:30:16+01:00	MoonRide303	scripts: corrected encoding when getting chat template (#11866) (#11907)
M	scripts/get_chat_template.py

commit	09aaf4f1f5b69b5173b7fcd24eab96729f6b242a	73e2ed3ce3492d3ed70193dd09ae8aa44779651d	2025-02-18T17:12:49+08:00	xiaobing318	docs : Fix duplicated file extension in test command (#11935)
M	examples/server/tests/README.md

commit	73e2ed3ce3492d3ed70193dd09ae8aa44779651d	f7b1116af102bcac450c1a522e9c59db241c6767	2025-02-17T14:03:24+01:00	Johannes Gäßler	CUDA: use async data loading for FlashAttention (#11894)
M	ggml/src/ggml-cuda/common.cuh
A	ggml/src/ggml-cuda/cp-async.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cuh

commit	f7b1116af102bcac450c1a522e9c59db241c6767	c4d29baf3236b011730b6ccaae6852e781fb1b91	2025-02-17T11:20:23Z	Eve	update release requirements (#11897)
M	.github/workflows/build.yml

commit	c4d29baf3236b011730b6ccaae6852e781fb1b91	2eea03d86a2d132c8245468c26290ce07a27a8e8	2025-02-17T11:25:12+01:00	Antoine Viallon	server : fix divide-by-zero in metrics reporting (#11915)
M	examples/server/server.cpp

commit	2eea03d86a2d132c8245468c26290ce07a27a8e8	0f2bbe656473177538956d22b6842bcaa0449fab	2025-02-17T07:55:57+01:00	Rémy O	vulkan: implement several ops relevant for ggml_opt (#11769)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/argmax.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/count_equal.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/opt_step_adamw.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/repeat_back.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/sub.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	0f2bbe656473177538956d22b6842bcaa0449fab	fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf	2025-02-16T18:11:22+01:00	Xuan-Son Nguyen	server : bump httplib to 0.19.0 (#11908)
M	examples/server/httplib.h

commit	fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf	818a340ea8be55b3706e1772527cb8738e90a8c7	2025-02-16T18:51:13+09:00	standby24x7	common : Fix a typo in help (#11899)
M	common/arg.cpp

commit	818a340ea8be55b3706e1772527cb8738e90a8c7	bf42a23d0a515a508aecf10fde1d52c5ed5104c6	2025-02-16T10:36:39+01:00	Xuan-Son Nguyen	ci : fix (again) arm64 build fails (#11895)
M	.github/workflows/docker.yml

commit	bf42a23d0a515a508aecf10fde1d52c5ed5104c6	c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4	2025-02-16T01:52:23-06:00	Jeff Bolz	vulkan: support multi/vision rope, and noncontiguous rope (#11902)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/rope_multi.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_neox.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_norm.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/rope_vision.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4	6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27	2025-02-16T14:50:26+08:00	Hale Chan	metal : fix the crash caused by the lack of residency set support on Intel Macs. (#11904)
M	ggml/src/ggml-metal/ggml-metal.m

commit	6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27	fc10c38ded84670955d4c44770f8acfb64617e15	2025-02-15T20:23:22+01:00	Johannes Gäßler	scripts: fix compare-llama-bench commit hash logic (#11891)
M	scripts/compare-llama-bench.py

commit	fc10c38ded84670955d4c44770f8acfb64617e15	22885105a6b034abaf1c1471ad90fb2ae96146bb	2025-02-15T20:03:30+01:00	708-145	examples: fix typo in imatrix/README.md (#11884)
M	examples/imatrix/README.md

commit	22885105a6b034abaf1c1471ad90fb2ae96146bb	c2cd24fbfdfeacc2fc6ad03878379de104264114	2025-02-15T19:39:20+01:00	Adrian Kretz	metal : optimize dequant q6_K kernel (#11892)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	c2cd24fbfdfeacc2fc6ad03878379de104264114	68ff663a04ed92044a9937bcae353e9d9733f9cd	2025-02-15T20:29:56+02:00	Georgi Gerganov	readme : add notice about new package registry (#11890)
M	README.md

commit	68ff663a04ed92044a9937bcae353e9d9733f9cd	f3552296924e704c11ca936907b9cad7873db8e2	2025-02-15T16:40:57+02:00	Georgi Gerganov	repo : update links to new url (#11886)
M	.devops/llama-cpp-cuda.srpm.spec
M	.devops/llama-cpp.srpm.spec
M	.devops/nix/package.nix
M	.devops/rocm.Dockerfile
M	.github/ISSUE_TEMPLATE/020-enhancement.yml
M	.github/ISSUE_TEMPLATE/030-research.yml
M	.github/ISSUE_TEMPLATE/040-refactor.yml
M	.github/ISSUE_TEMPLATE/config.yml
M	.github/pull_request_template.md
M	.github/workflows/bench.yml.disabled
M	.github/workflows/build.yml
M	.github/workflows/labeler.yml
M	CONTRIBUTING.md
M	Makefile
M	README.md
M	SECURITY.md
M	ci/README.md
M	common/arg.cpp
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	convert_lora_to_gguf.py
M	docs/android.md
M	docs/backend/OPENCL.md
M	docs/backend/SYCL.md
M	docs/build.md
M	docs/cuda-fedora.md
M	docs/development/HOWTO-add-model.md
M	docs/docker.md
M	docs/install.md
M	examples/cvector-generator/README.md
M	examples/imatrix/README.md
M	examples/imatrix/imatrix.cpp
M	examples/llama.android/llama/src/main/cpp/CMakeLists.txt
M	examples/llama.swiftui/README.md
M	examples/llama.vim
M	examples/llava/README-minicpmo2.6.md
M	examples/llava/README-minicpmv2.5.md
M	examples/lookahead/README.md
M	examples/lookup/README.md
M	examples/main/README.md
M	examples/passkey/README.md
M	examples/pydantic_models_to_grammar_examples.py
M	examples/quantize/README.md
M	examples/retrieval/README.md
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/simple-cmake-pkg/README.md
M	examples/speculative/README.md
M	flake.nix
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	gguf-py/README.md
M	gguf-py/gguf/scripts/gguf_dump.py
M	gguf-py/gguf/utility.py
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	grammars/README.md
M	include/llama.h
M	pyproject.toml
M	scripts/check-requirements.sh
M	src/unicode.cpp

commit	f3552296924e704c11ca936907b9cad7873db8e2	fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88	2025-02-15T10:11:36Z	Olivier Chafik	server: fix type promotion typo causing crashes w/ --jinja w/o tools  (#11880)
M	common/chat.cpp

commit	fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88	89daa2564f6eab33be53c6a1b39273af536d6bb3	2025-02-15T09:01:40+01:00	Rémy O	vulkan: initial support for IQ1_S and IQ1_M quantizations (#11528)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq1_m.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq1_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq1_m.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_iq1_s.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	89daa2564f6eab33be53c6a1b39273af536d6bb3	300907b2110cc17b4337334dc397e05de2d8f5e0	2025-02-14T12:46:08-08:00	Michał Moskal	llguidance build fixes for Windows (#11664)
M	common/CMakeLists.txt
M	docs/build.md
M	docs/llguidance.md

commit	300907b2110cc17b4337334dc397e05de2d8f5e0	94b87f87b502d2ab6c8b28d2b5935cf008ca1505	2025-02-14T11:12:23-08:00	lhez	opencl: Fix rope and softmax (#11833)
M	ggml/src/ggml-opencl/ggml-opencl.cpp
M	ggml/src/ggml-opencl/kernels/ggml-opencl.cl

commit	94b87f87b502d2ab6c8b28d2b5935cf008ca1505	dbc2ec59b5603fbd25f3833b2407b4f3612b9f02	2025-02-14T15:33:52+01:00	Diego Devesa	cuda : add ampere to the list of default architectures (#11870)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	dbc2ec59b5603fbd25f3833b2407b4f3612b9f02	3d68f034dad53f0f27ad626b2732ef48fbcea4ee	2025-02-14T14:48:40+02:00	Georgi Gerganov	docker : drop to CUDA 12.4 (#11869)
M	.devops/cuda.Dockerfile
M	docs/docker.md

commit	3d68f034dad53f0f27ad626b2732ef48fbcea4ee	38e32eb6a0cec32130b699ce9fefad6c74571953	2025-02-14T11:16:56+01:00	Daniel Bevenius	llama : add completion for --chat-template-file (#11860)
M	common/arg.cpp

commit	38e32eb6a0cec32130b699ce9fefad6c74571953	a4f011e8d02179f032627130f961eb77ee30401c	2025-02-14T16:54:27+08:00	Jinyang He	ggml: optimize some vec dot functions for LoongArch ASX (#11842)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	a4f011e8d02179f032627130f961eb77ee30401c	a7b8ce226071b2b0faaad0d36cc5ebd7fb074730	2025-02-14T02:59:40Z	Eve	vulkan: linux builds + small subgroup size fixes (#11767)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	a7b8ce226071b2b0faaad0d36cc5ebd7fb074730	04045bb84288dc7e9e424d4e2bf7f40d259b4c6a	2025-02-14T09:13:43+08:00	theraininsky	llama-bench : fix unexpected global variable initialize sequence issue (#11832)
M	examples/llama-bench/llama-bench.cpp

commit	04045bb84288dc7e9e424d4e2bf7f40d259b4c6a	8a8c4ceb6050bd9392609114ca56ae6d26f5b8f5	2025-02-14T00:16:56+02:00	Georgi Gerganov	readme : minor
M	README.md

commit	8a8c4ceb6050bd9392609114ca56ae6d26f5b8f5	c1f958c0381e797135b7d42a677542133264193c	2025-02-13T09:05:04-08:00	Jeffrey Morgan	llamafile: use member variable instead of constant for iq4nlt (#11780)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	c1f958c0381e797135b7d42a677542133264193c	c48f630d1c1942fce08aa7cb18a53ace443cd611	2025-02-13T17:22:44+01:00	Reza Rahemtola	server : (docs) Update wrong tool calling example (#11809)
M	examples/server/README.md

commit	c48f630d1c1942fce08aa7cb18a53ace443cd611	bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1	2025-02-13T14:46:59+01:00	Daniel Bevenius	llama : add --completion-bash option (#11846)
M	README.md
M	common/arg.cpp
M	common/common.h

commit	bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1	c7f460ab882065ec5696e3d51e24dbf67b539287	2025-02-13T20:28:18+08:00	R0CKSTAR	musa: bump MUSA SDK version to rc3.1.1  (#11822)
M	.devops/musa.Dockerfile
M	.github/workflows/build.yml
M	docs/docker.md
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	c7f460ab882065ec5696e3d51e24dbf67b539287	27e8a23300e30cd6ff6107ce262acf832ca60597	2025-02-13T10:05:16Z	Olivier Chafik	`server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607)
M	common/arg.cpp
M	common/chat.cpp
M	common/chat.hpp
M	common/common.h
M	common/sampling.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_tool_call.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp
A	models/templates/README.md
M	models/templates/deepseek-ai-DeepSeek-R1-Distill-Llama-8B.jinja
M	models/templates/deepseek-ai-DeepSeek-R1-Distill-Qwen-32B.jinja
A	models/templates/llama-cpp-deepseek-r1.jinja
M	scripts/get_chat_template.py
M	src/llama-grammar.cpp
M	tests/test-chat.cpp

commit	27e8a23300e30cd6ff6107ce262acf832ca60597	e4376270d971cff7992bdb6c5412a739195b1459	2025-02-13T00:45:57-06:00	Vinesh Janarthanan	sampling: add Top-nσ sampler (#11223)
M	common/arg.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/main/README.md
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	e4376270d971cff7992bdb6c5412a739195b1459	3e693197724c31d53a9b69018c2f1bd0b93ebab2	2025-02-13T01:25:34-05:00	Oleksandr Kuvshynov	llama.cpp: fix warning message (#11839)
M	examples/server/server.cpp

commit	3e693197724c31d53a9b69018c2f1bd0b93ebab2	a394039db004c6ee00098250d160b5aa018c2314	2025-02-13T07:07:51+01:00	Daniel Bevenius	llama : update llama_decode_internal ref [no ci] (#11840)
M	src/llama-kv-cache.h

commit	a394039db004c6ee00098250d160b5aa018c2314	be3bbd62153820ff6d358c817360927f429105c4	2025-02-13T01:02:38+01:00	Diego Devesa	ggml-cpu : add chunking support to mul_mat_id (#11666)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	be3bbd62153820ff6d358c817360927f429105c4	31afcbee0eebbc998ab311aa314e389d60aa2127	2025-02-13T00:33:45+01:00	Xuan-Son Nguyen	ggml : x2 speed for WASM by optimizing SIMD (#11453)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	31afcbee0eebbc998ab311aa314e389d60aa2127	5c4284d57bbc613121e90de5271f1cbc95d55872	2025-02-12T22:47:11Z	Woof Dog	server : (webui) Give copy button back to all message bubbles (#11814)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatMessage.tsx

commit	5c4284d57bbc613121e90de5271f1cbc95d55872	bfd11a2344ce6005bfbd5432a06fc7325bc0ecae	2025-02-12T22:25:28+01:00	uvos	HIP: Remove GCN from list of devices that avoid MMQ (#11831)
M	ggml/src/ggml-cuda/mmq.cu

commit	bfd11a2344ce6005bfbd5432a06fc7325bc0ecae	0fb77f821f6e70ad8b8247a97d1022f0fef78991	2025-02-12T20:36:11Z	JC	Fix: Compile failure due to Microsoft STL breaking change (#11836)
M	common/log.cpp
M	examples/imatrix/imatrix.cpp
M	examples/perplexity/perplexity.cpp

commit	0fb77f821f6e70ad8b8247a97d1022f0fef78991	e598697d63d062b4af939f1b0383d6adc6292d1a	2025-02-12T21:46:02+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	e598697d63d062b4af939f1b0383d6adc6292d1a	fef0cbeadf5c8e221f832158cb4006ade39ef786	2025-02-12T17:25:03+01:00	uvos	HIP: Switch to std::vector in rocblas version check (#11820)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	fef0cbeadf5c8e221f832158cb4006ade39ef786	748ee9fe9312acb8755ee4bf46fd9de2e6a45f29	2025-02-12T10:06:53-04:00	bandoti	cleanup: fix compile warnings associated with gnu_printf (#11811)
M	common/common.h
M	common/log.h
M	ggml/include/ggml.h
M	src/llama-impl.h
M	tests/test-gguf.cpp

commit	748ee9fe9312acb8755ee4bf46fd9de2e6a45f29	198b1ec611a2c551ea40e5b9c0b862f37555a4cc	2025-02-12T13:57:33Z	Richard	ggml : fix multi-threaded clamp_f32 (#11824)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	198b1ec611a2c551ea40e5b9c0b862f37555a4cc	c3d6af7cd2d79dc89da086b2d08c777d0319d829	2025-02-12T20:22:58+08:00	Weizhao Ouyang	ggml-cpu: Fix duplicate MATMUL_INT8 (#11817)
M	ggml/src/ggml-cpu/ggml-cpu.cpp

commit	c3d6af7cd2d79dc89da086b2d08c777d0319d829	369be5598ac5f71f6aa6d6606e9aec769a23dafa	2025-02-12T13:16:39+01:00	Johannes Gäßler	CUDA: fix CUDART_VERSION checks (#11821)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/sum.cu

commit	369be5598ac5f71f6aa6d6606e9aec769a23dafa	4078c77f9891831f29ffc7c315c8ec6695ba5ce7	2025-02-12T08:40:01+01:00	Daniel Bevenius	llama : fix typo in llama-grammar.h [no ci] (#11816)
M	src/llama-grammar.h

commit	4078c77f9891831f29ffc7c315c8ec6695ba5ce7	90e4dba461b07e635fd1daf3b491c978c7dd0013	2025-02-11T14:04:13-08:00	lhez	docs: add OpenCL (#11697)
M	README.md
A	docs/backend/OPENCL.md

commit	90e4dba461b07e635fd1daf3b491c978c7dd0013	a18f481f99962638092d6f1c98b1d34d3e3256de	2025-02-11T10:55:45-05:00	Sheldon Robinson	Fix #11802: Compile bug - RegQueryValueExA changed to RegQueryValueEx (#11803)
M	ggml/src/ggml-cpu/ggml-cpu.cpp

commit	a18f481f99962638092d6f1c98b1d34d3e3256de	b9ab0a4d0b2ed19effec130921d05fb5c30b68c5	2025-02-11T14:06:45+01:00	Daniel Bevenius	server : use common_token_to_piece instead of common_detokenize (#11740)
M	examples/server/server.cpp

commit	b9ab0a4d0b2ed19effec130921d05fb5c30b68c5	7b891bdc863663b4dc1155aa9429b58c721524b2	2025-02-11T00:17:22+01:00	Johannes Gäßler	CUDA: use arch list for compatibility check (#11775)
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	7b891bdc863663b4dc1155aa9429b58c721524b2	81732619fd2d570712dc78db5965cee9224b38bd	2025-02-10T23:21:31+01:00	Maxim Evtush	fix: typos in documentation files (#11791)
M	common/arg.cpp
M	common/speculative.h
M	ggml/src/ggml.c

commit	81732619fd2d570712dc78db5965cee9224b38bd	507f9174fe856772b6c7c17e81be442de7ee6d1e	2025-02-11T06:17:48+08:00	jason_w	docs: utilize the forward slash (/) as the path separator for Unix-like systems (#11770)
commit	507f9174fe856772b6c7c17e81be442de7ee6d1e	19b392d58dc08c366d0b29bd3b9c6991fa4e1662	2025-02-10T21:23:17+01:00	Xuan-Son Nguyen	server : (webui) introduce conversation branching + idb storage (#11792)
M	examples/server/public/index.html.gz
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
M	examples/server/webui/src/components/ChatMessage.tsx
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/components/Header.tsx
M	examples/server/webui/src/components/Sidebar.tsx
M	examples/server/webui/src/utils/app.context.tsx
M	examples/server/webui/src/utils/misc.ts
M	examples/server/webui/src/utils/storage.ts
M	examples/server/webui/src/utils/types.ts

commit	19b392d58dc08c366d0b29bd3b9c6991fa4e1662	0893e0114e934bdd0eba0ff69d9ef8c59343cbc3	2025-02-10T19:58:18+01:00	Wilken Gottwalt	llama-mmap: fix missing include (#11796)
M	src/llama-mmap.h

commit	0893e0114e934bdd0eba0ff69d9ef8c59343cbc3	d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7	2025-02-10T18:03:28+01:00	Xuan-Son Nguyen	server : correct signal handler (#11795)
M	examples/server/server.cpp

commit	d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7	9ac3457b39c78c5eb103280e08fb6163642484ff	2025-02-10T09:34:09Z	Olivier Chafik	sync: minja (https://github.com/google/minja/commit/a72057e5190de2c612d4598bb10b4bfd0f53011f) (#11774)
M	common/chat-template.hpp
M	common/minja.hpp

commit	9ac3457b39c78c5eb103280e08fb6163642484ff	c2a67efe38e6782c0217e1de3edc68de6951612b	2025-02-10T16:05:57+08:00	pascal-lc	Update README.md [no ci] (#11781)
M	examples/main/README.md

commit	c2a67efe38e6782c0217e1de3edc68de6951612b	b044a0fe3ca0cbef9dd041edce3ebda8c501fae4	2025-02-10T07:17:21+01:00	Danny Milosavljevic	vulkan: Make Vulkan optional at runtime (#11493). (#11494)
M	ggml/include/ggml-vulkan.h
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	b044a0fe3ca0cbef9dd041edce3ebda8c501fae4	19d3c8293b1f61acbe2dab1d49a17950fd788a4a	2025-02-10T03:08:22-03:00	Wagner Bruna	vulkan: add environment variable GGML_VK_PREFER_HOST_MEMORY to avoid VRAM allocation (#11592)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	19d3c8293b1f61acbe2dab1d49a17950fd788a4a	98f6b0fd1ea88ce33f4fcd1775d9a463067156ac	2025-02-09T10:34:49Z	Eric Curtin	There's a better way of clearing lines (#11756)
M	common/log.h
M	examples/run/run.cpp

commit	98f6b0fd1ea88ce33f4fcd1775d9a463067156ac	55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1	2025-02-09T01:43:51-06:00	Jeff Bolz	vulkan: account for lookup tables when checking shared memory size (#11502)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1	e6e658319952f7ad269dc11275b9edddc721fc6d	2025-02-08T21:54:50+01:00	Xuan-Son Nguyen	server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759)
M	examples/server/public/index.html.gz
M	examples/server/server.cpp
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
M	examples/server/webui/src/App.tsx
M	examples/server/webui/src/Config.ts
A	examples/server/webui/src/components/CanvasPyInterpreter.tsx
M	examples/server/webui/src/components/ChatMessage.tsx
M	examples/server/webui/src/components/ChatScreen.tsx
M	examples/server/webui/src/components/Header.tsx
M	examples/server/webui/src/components/MarkdownDisplay.tsx
M	examples/server/webui/src/components/SettingDialog.tsx
M	examples/server/webui/src/index.scss
M	examples/server/webui/src/utils/app.context.tsx
A	examples/server/webui/src/utils/common.tsx
M	examples/server/webui/src/utils/misc.ts
M	examples/server/webui/src/utils/types.ts
M	examples/server/webui/vite.config.ts

commit	e6e658319952f7ad269dc11275b9edddc721fc6d	aaa55053076f3d5d7da4d9a877cb77e112dabed4	2025-02-08T19:09:55Z	Woof Dog	server : (webui) increase edit textarea size (#11763)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/ChatMessage.tsx

commit	aaa55053076f3d5d7da4d9a877cb77e112dabed4	bdcf8b6a56f4d49d3420ae5b21cdf9a116040551	2025-02-08T18:08:43+02:00	Georgi Gerganov	server : minor log updates (#11760)
M	examples/server/server.cpp

commit	bdcf8b6a56f4d49d3420ae5b21cdf9a116040551	4d3465c5aeca8be29cac77f1535c35f4fb274eca	2025-02-08T16:49:38+02:00	Georgi Gerganov	cont : fix mmap flag print (#11699)
M	src/llama-model.cpp
M	src/llama.cpp

commit	4d3465c5aeca8be29cac77f1535c35f4fb274eca	d80be897acdca45f8f7ea2e52c930b1d0e738a14	2025-02-08T15:30:53+01:00	Karol Kontny	ggml: Fix data race in ggml threadpool (#11736)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	d80be897acdca45f8f7ea2e52c930b1d0e738a14	3ab410f55f26038de45d6cc569aaa5cb29acb918	2025-02-08T10:46:07+01:00	Johannes Gäßler	CUDA: fix min. version for movmatrix (#11751)
M	ggml/src/ggml-cuda/mma.cuh

commit	3ab410f55f26038de45d6cc569aaa5cb29acb918	0cf867160ca9d492e06c0bc688b337cffd1eb187	2025-02-08T11:43:04+02:00	Nikolaos Pothitos	readme : update front-end framework (#11753)
M	examples/server/README.md

commit	0cf867160ca9d492e06c0bc688b337cffd1eb187	d2fe216fb2fb7ca8627618c9ea3a2e7886325780	2025-02-08T10:42:34+01:00	Xuan-Son Nguyen	server : (webui) fix numeric settings being saved as string (#11739)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/components/MarkdownDisplay.tsx
M	examples/server/webui/src/components/SettingDialog.tsx

commit	d2fe216fb2fb7ca8627618c9ea3a2e7886325780	ed926d8833df3c29797edbc98dafd9b575aa0729	2025-02-07T14:42:46Z	Eric Curtin	Make logging more verbose (#11714)
M	examples/run/run.cpp

commit	ed926d8833df3c29797edbc98dafd9b575aa0729	2d219b389e8c8c40bce547b08c8aa7add60fde1f	2025-02-07T16:05:34+02:00	Georgi Gerganov	llama : fix defrag logic (#11707)
M	src/llama.cpp

commit	2d219b389e8c8c40bce547b08c8aa7add60fde1f	333820d7491cd31c707a340ff23b984a84e40154	2025-02-07T08:55:47-05:00	Christian Fillion	vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
M	src/unicode.cpp

commit	333820d7491cd31c707a340ff23b984a84e40154	c026ba3c23765a648ca27c7a15ecf179f8e27f26	2025-02-07T15:48:47+02:00	magicse	llama : fix progress dots (#11730)
M	src/llama.cpp

commit	c026ba3c23765a648ca27c7a15ecf179f8e27f26	7ee953a64a40c09438b2064539becdbc577cefd0	2025-02-07T04:26:03-06:00	Jeff Bolz	vulkan: print shared memory size (#11719)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	7ee953a64a40c09438b2064539becdbc577cefd0	ec3bc8270bc67b58955748d40a3e558a05b2d8f2	2025-02-07T04:33:27-05:00	Christian Fillion	llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727)
M	common/llguidance.cpp
M	include/llama.h
M	src/llama-sampling.cpp

commit	ec3bc8270bc67b58955748d40a3e558a05b2d8f2	b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7	2025-02-07T14:57:53+05:30	Akarshan Biswas	SYCL: remove XMX info from print devices (#11712)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7	225bbbfa39930cda38a2e5d1f3e5b38226732009	2025-02-07T09:15:22+01:00	Daniel Bevenius	common : add default embeddings presets (#11677)
M	common/arg.cpp

commit	225bbbfa39930cda38a2e5d1f3e5b38226732009	855cd0734aca26c86cc23d94aefd34f934464ac9	2025-02-07T15:38:31+08:00	Jinyang He	ggml : optimize and build warning fix for LoongArch (#11709)
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	855cd0734aca26c86cc23d94aefd34f934464ac9	8a59053f63fffc24e730cd3ea067760abfe4a919	2025-02-06T22:48:51+01:00	tv1wnd	llama : fix old glm4 models (#11670)
M	src/llama.cpp

commit	8a59053f63fffc24e730cd3ea067760abfe4a919	1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19	2025-02-06T21:23:03+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19	2fb3c32a1634488a5265d1304ab37628eeb5480d	2025-02-06T09:29:13-05:00	Patrick Peng	rpc: fix known RCE in rpc-server (ggml/1103)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	2fb3c32a1634488a5265d1304ab37628eeb5480d	9ab42dc722ad19a12af80f38a06474d498f96da3	2025-02-06T17:32:29+01:00	Xuan-Son Nguyen	server : (webui) migrate project to ReactJS with typescript (#11688)
M	.github/workflows/server.yml
M	examples/server/public/index.html.gz
A	examples/server/webui/.gitignore
A	examples/server/webui/.prettierignore
A	examples/server/webui/eslint.config.js
M	examples/server/webui/index.html
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
M	examples/server/webui/public/demo-conversation.json
A	examples/server/webui/src/App.tsx
A	examples/server/webui/src/Config.ts
A	examples/server/webui/src/components/ChatMessage.tsx
A	examples/server/webui/src/components/ChatScreen.tsx
A	examples/server/webui/src/components/Header.tsx
A	examples/server/webui/src/components/MarkdownDisplay.tsx
A	examples/server/webui/src/components/SettingDialog.tsx
A	examples/server/webui/src/components/Sidebar.tsx
D	examples/server/webui/src/highlight-config.js
R083	examples/server/webui/src/styles.scss	examples/server/webui/src/index.scss
D	examples/server/webui/src/katex-gpt.js
D	examples/server/webui/src/main.js
A	examples/server/webui/src/main.tsx
A	examples/server/webui/src/utils/app.context.tsx
A	examples/server/webui/src/utils/misc.ts
A	examples/server/webui/src/utils/storage.ts
A	examples/server/webui/src/utils/types.ts
A	examples/server/webui/src/vite-env.d.ts
A	examples/server/webui/tsconfig.app.json
A	examples/server/webui/tsconfig.json
A	examples/server/webui/tsconfig.node.json
R058	examples/server/webui/vite.config.js	examples/server/webui/vite.config.ts

commit	9ab42dc722ad19a12af80f38a06474d498f96da3	194b2e69f8da3a22395c74fd9acd6d5835437b96	2025-02-06T20:16:15+08:00	Tei Home	docs: update fedora cuda guide for 12.8 release (#11393)
M	docs/build.md
M	docs/cuda-fedora.md

commit	194b2e69f8da3a22395c74fd9acd6d5835437b96	9dd7a0390feffcc1f4b17eb7692a6e43030d85af	2025-02-06T17:12:35+05:30	Akarshan Biswas	SYCL: Adjust support condition for norm operators (#11674)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	9dd7a0390feffcc1f4b17eb7692a6e43030d85af	c0d4843225eed38903ea71ef302a02fa0b27f048	2025-02-06T13:41:37+02:00	Georgi Gerganov	llama : add log about loading model tensors (#11699)
M	src/llama-model.cpp

commit	c0d4843225eed38903ea71ef302a02fa0b27f048	8d4d2be143a3919c3d194b9bf7a221e50abed893	2025-02-06T12:08:13+01:00	Adrien Gallouët	build : fix llama.pc (#11658)
M	CMakeLists.txt
M	cmake/llama.pc.in

commit	8d4d2be143a3919c3d194b9bf7a221e50abed893	2c6c8df56d8a3edd657b9a295e95d469a37f0044	2025-02-06T17:20:00+08:00	junchao-zhao	ggml : fix LoongArch compile error with 128-bit SIMD (#11701)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	2c6c8df56d8a3edd657b9a295e95d469a37f0044	8a7e3bf17aa5a8412854787746c92a28623a8925	2025-02-06T00:15:30-06:00	Jeff Bolz	vulkan: optimize coopmat2 iq2/iq3 callbacks (#11521)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp

commit	8a7e3bf17aa5a8412854787746c92a28623a8925	1b598b30581bad59e5af86c94362f9a30f261fac	2025-02-06T07:09:59+01:00	Rémy O	vulkan: initial support for IQ4_XS quantization (#11501)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_xs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	1b598b30581bad59e5af86c94362f9a30f261fac	902368a06b915b860236cfc97ff885b2aceae256	2025-02-06T00:02:18-06:00	Jeff Bolz	vulkan: use smaller combined allocations to avoid fragmentation (#11551)
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	902368a06b915b860236cfc97ff885b2aceae256	c3db0480bb820e120249014b380e1f4badf2a1c1	2025-02-05T19:52:31-06:00	Charles Duffy	metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690)
M	ggml/src/ggml-metal/ggml-metal.m

commit	c3db0480bb820e120249014b380e1f4badf2a1c1	d774ab3acc4fee41fbed6dbfc192b57d5f79f34b	2025-02-06T01:55:25+01:00	Matvey Soloviev	readme : add link to Autopen under UIs (#11684)
M	README.md

commit	d774ab3acc4fee41fbed6dbfc192b57d5f79f34b	fa62da9b2dc03539a30f1306f59c4c6ffbe4f50a	2025-02-05T10:57:42+02:00	Georgi Gerganov	metal : adjust support conditions for norm operators (#11671)
M	ggml/src/ggml-metal/ggml-metal.m

commit	fa62da9b2dc03539a30f1306f59c4c6ffbe4f50a	1ec208083cb896dd8772a2f962151fa3d4a74e36	2025-02-05T08:58:31+01:00	Johannes Gäßler	CUDA: support for mat. mul. with ne03 != ne13 (#11656)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmv.cu

commit	1ec208083cb896dd8772a2f962151fa3d4a74e36	9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6	2025-02-05T14:45:40+07:00	SAMI	llava: add quantization for the visual projector LLAVA, Qwen2VL (#11644)
M	examples/llava/CMakeLists.txt
A	examples/llava/README-quantize.md
A	examples/llava/clip-quantize-cli.cpp
M	examples/llava/clip.cpp

commit	9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6	fd08255d0dea6625596c0367ee0a11d195f36762	2025-02-05T01:00:12Z	Olivier Chafik	`sync`: minja (#11641)
M	common/chat-template.hpp
M	common/chat.cpp
M	common/common.cpp
M	common/minja.hpp
M	examples/run/run.cpp
M	tests/test-chat.cpp

commit	fd08255d0dea6625596c0367ee0a11d195f36762	3ec9fd4b77b6aca03a3c2bf678eae3f9517d6904	2025-02-04T22:21:42+01:00	Johannes Gäßler	CUDA: non-contiguous (RMS) norm support (#11659)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	3ec9fd4b77b6aca03a3c2bf678eae3f9517d6904	3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e	2025-02-05T02:18:38+08:00	fxzjshm	HIP: force max threads per block to be 1024 (#11621)
M	ggml/src/ggml-hip/CMakeLists.txt

commit	3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e	1bef571f6a23c36a26dabacba631763f9a893b83	2025-02-04T18:25:42+01:00	Xuan-Son Nguyen	server : add try..catch to places not covered by set_exception_handler (#11620)
M	examples/server/server.cpp

commit	1bef571f6a23c36a26dabacba631763f9a893b83	db288b60cb49eab69703f995379b8d75c18bf5b3	2025-02-04T18:16:20+02:00	Radoslav Gerganov	arg : list RPC devices first when using --list-devices (#11655)
M	common/arg.cpp

commit	db288b60cb49eab69703f995379b8d75c18bf5b3	106045e7bb8db481bb2ebbc60e3b53cb27ada117	2025-02-04T15:48:53Z	Olivier Chafik	`tool-call`: command r7b fix for normal responses (#11608)
M	common/chat.cpp
M	examples/server/tests/unit/test_tool_call.py
M	tests/test-chat.cpp

commit	106045e7bb8db481bb2ebbc60e3b53cb27ada117	f117d84b48104992ba16961b35a96fa93efbb355	2025-02-04T05:20:55-06:00	Shelby Jenkins	readme : add llm_client Rust crate to readme bindings (#11628)
M	README.md

commit	f117d84b48104992ba16961b35a96fa93efbb355	534c46b53c23613628d72e93c63ea01ea4d1e2ac	2025-02-04T19:15:24+08:00	Jhen-Jie Hong	swift : fix llama-vocab api usage (#11645)
M	examples/batched.swift/Sources/main.swift
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift

commit	534c46b53c23613628d72e93c63ea01ea4d1e2ac	387a1598ca094a4755303ec964c3b09b4c5c300e	2025-02-04T19:07:18+08:00	Jhen-Jie Hong	metal : use residency set for other platforms (#11648)
M	ggml/src/ggml-metal/ggml-metal.m

commit	387a1598ca094a4755303ec964c3b09b4c5c300e	7c9e0ca52039530b6ddf16015cf1263491e92d75	2025-02-04T13:04:10+02:00	Georgi Gerganov	authors : update
M	AUTHORS

commit	7c9e0ca52039530b6ddf16015cf1263491e92d75	8f8290ada96194138bb3d4dc6958323bc728ef83	2025-02-04T12:59:21+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	8f8290ada96194138bb3d4dc6958323bc728ef83	b34aedd558dcf67f7e96b0260d6b554877bd3499	2025-02-04T00:17:15+01:00	Christian Kastner	cmake: Add ability to pass in GGML_BUILD_NUMBER (ggml/1096)
M	ggml/CMakeLists.txt

commit	b34aedd558dcf67f7e96b0260d6b554877bd3499	cde383323959544abe10a4d79e1d3e1ee479933c	2025-02-04T09:30:42+02:00	Georgi Gerganov	ci : do not stale-close roadmap issues
M	.github/workflows/close-issue.yml

commit	cde383323959544abe10a4d79e1d3e1ee479933c	b3451785aca16fbf4214eeba7e4612676cdf8ccb	2025-02-03T23:49:27Z	Olivier Chafik	`tool-call`: allow `--chat-template chatml` w/ `--jinja`, default to chatml upon parsing issue, avoid double bos (#11616)
M	common/common.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_tool_call.py

commit	b3451785aca16fbf4214eeba7e4612676cdf8ccb	1d1e6a90bcf485ad2dee309c31cf19bd802465e5	2025-02-04T00:10:52+01:00	Xuan-Son Nguyen	server : (webui) revert hacky solution from #11626 (#11634)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/main.js

commit	1d1e6a90bcf485ad2dee309c31cf19bd802465e5	5598f475be3e31430fbe17ebb85654ec90dc201e	2025-02-03T22:16:27Z	Woof Dog	server : (webui) allow typing and submitting during llm response (#11626)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html
M	examples/server/webui/src/main.js

commit	5598f475be3e31430fbe17ebb85654ec90dc201e	8ec05832fa8409c49b3bbd13f957c6ae8486e618	2025-02-03T16:45:38+01:00	Daniel Bevenius	server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622)
M	examples/server/utils.hpp

commit	8ec05832fa8409c49b3bbd13f957c6ae8486e618	21c84b5d2dc04050714567501bf78762bfa17846	2025-02-03T14:57:08+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	21c84b5d2dc04050714567501bf78762bfa17846	d92cb67e37abc23b1c6f7b0ef27a9889da8537e3	2025-02-03T13:25:56+01:00	Johannes Gäßler	CUDA: fix Volta FlashAttention logic (#11615)
M	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn.cu

commit	d92cb67e37abc23b1c6f7b0ef27a9889da8537e3	6eecde3cc8fda44da7794042e3668de4af3c32c6	2025-02-03T09:42:55Z	mashdragon	server : (webui) Fix Shift+Enter handling (#11609)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html

commit	6eecde3cc8fda44da7794042e3668de4af3c32c6	396856b40029dd6747d2fbdb179e828683418045	2025-02-02T23:48:29+01:00	Johannes Gäßler	HIP: fix flash_attn_stream_k_fixup warning (#11604)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/softmax.cu

commit	396856b40029dd6747d2fbdb179e828683418045	4d0598e1445a64c99cf2faac72f8d5d023f1e6a1	2025-02-02T22:40:09+01:00	uvos	CUDA/HIP: add support for selectable warp size to mmv (#11519)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	4d0598e1445a64c99cf2faac72f8d5d023f1e6a1	90f9b88afb6447d3929843a2aa98c0f11074762d	2025-02-02T22:08:05+01:00	uvos	HIP: add GGML_CUDA_CC_IS_* for amd familys as increasing cc archtectures for amd gpus are not supersets of eatch other (#11601)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	90f9b88afb6447d3929843a2aa98c0f11074762d	864a0b67a6c8f648c43ce8271f9cb2e12dd5df6e	2025-02-02T19:58:34Z	Olivier Chafik	nit: more informative crash when grammar sampler fails (#11593)
M	src/llama-grammar.cpp

commit	864a0b67a6c8f648c43ce8271f9cb2e12dd5df6e	84ec8a58f7b6aad6887bbfbd1321f3ff417341a5	2025-02-02T19:31:09+01:00	Johannes Gäßler	CUDA: use mma PTX instructions for FlashAttention (#11583)
M	Makefile
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
A	ggml/src/ggml-cuda/fattn-mma-f16.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
A	ggml/src/ggml-cuda/fattn-wmma-f16.cu
M	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb16.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb32.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb64.cu
A	ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-cpb8.cu
D	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb32.cu
D	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb16.cu
D	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb32.cu
D	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb8.cu
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-musa/CMakeLists.txt

commit	84ec8a58f7b6aad6887bbfbd1321f3ff417341a5	bfcce4d693617ec843d0b2510f6ee16e6bc6720d	2025-02-02T16:14:48+01:00	Eric Curtin	Name colors (#11573)
M	common/log.cpp
M	common/log.h
M	examples/run/run.cpp

commit	bfcce4d693617ec843d0b2510f6ee16e6bc6720d	69804487e0b10f2c5c06316f0ac0eb6ada68433f	2025-02-02T09:25:38Z	Olivier Chafik	`tool-call`: support Command R7B (+ return tool_plan "thoughts" in API) (#11585)
M	common/chat.cpp
M	common/chat.hpp
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp
A	models/templates/CohereForAI-c4ai-command-r7b-12-2024-tool_use.jinja
M	tests/test-chat.cpp

commit	69804487e0b10f2c5c06316f0ac0eb6ada68433f	ff227703d6d6e1888bdc7af6138514092ffcdb96	2025-02-02T09:10:15Z	Olivier Chafik	Fix exotic ci env that lacks ostringstream::str (#11581)
M	common/minja.hpp

commit	ff227703d6d6e1888bdc7af6138514092ffcdb96	0cec062a638700495673f5494d200b74340538be	2025-02-01T23:55:32-08:00	Michał Moskal	sampling : support for llguidance grammars (#10224)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	common/CMakeLists.txt
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
A	common/llguidance.cpp
M	common/sampling.cpp
M	common/sampling.h
A	docs/llguidance.md
M	tests/CMakeLists.txt
M	tests/test-grammar-integration.cpp
A	tests/test-grammar-llguidance.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	0cec062a638700495673f5494d200b74340538be	53debe6f3c9cca87e9520a83ee8c14d88977afa4	2025-02-02T15:48:46+08:00	piDack	llama : add support for GLM-Edge and GLM-Edge-V series models (#10573)
M	README.md
M	convert_hf_to_gguf.py
A	examples/llava/README-glmedge.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
A	examples/llava/glmedge-convert-image-encoder-to-gguf.py
A	examples/llava/glmedge-surgery.py
M	examples/llava/llava.cpp
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-model.cpp
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	53debe6f3c9cca87e9520a83ee8c14d88977afa4	cfd74c86dbaa95ed30aa6b30e14d8801eb975d63	2025-02-01T18:22:38Z	Olivier Chafik	ci: use sccache on windows HIP jobs (#11553)
M	.github/workflows/build.yml

commit	cfd74c86dbaa95ed30aa6b30e14d8801eb975d63	ecef206ccb186a1cde8dd2523b1da3e12f593f9e	2025-02-01T12:24:51Z	Olivier Chafik	`sync`: minja (https://github.com/google/minja/commit/418a2364b56dc9be4ed9a1a2b0fb16fb53a7a22e) (#11574)
M	common/minja.hpp

commit	ecef206ccb186a1cde8dd2523b1da3e12f593f9e	5bbc7362cb93265f4c853fd89800a6255cc26985	2025-02-01T11:30:54+01:00	Eric Curtin	Implement s3:// protocol (#11511)
M	examples/run/run.cpp

commit	5bbc7362cb93265f4c853fd89800a6255cc26985	aa6fb1321333fae8853d0cdc26bcb5d438e650a1	2025-02-01T00:01:20Z	Olivier Chafik	ci: simplify cmake build commands (#11548)
M	.github/workflows/build.yml

commit	aa6fb1321333fae8853d0cdc26bcb5d438e650a1	a83f528688324a21484a97af1d1be5e1bc8d4c8e	2025-01-31T17:12:40Z	Olivier Chafik	`ci`: use sccache on windows instead of ccache (#11545)
M	.github/workflows/build.yml
M	ggml/src/CMakeLists.txt

commit	a83f528688324a21484a97af1d1be5e1bc8d4c8e	b1bcd309fc8ac929cbd4a6207b3a19886bda031f	2025-01-31T14:15:25Z	Olivier Chafik	`tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539)
M	common/chat-template.hpp
M	common/chat.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	b1bcd309fc8ac929cbd4a6207b3a19886bda031f	5783575c9d99c4d9370495800663aa5397ceb0be	2025-01-31T13:48:31Z	Olivier Chafik	fix stop regression (#11543)
M	examples/server/utils.hpp

commit	5783575c9d99c4d9370495800663aa5397ceb0be	4a2b196d03d52da31236390e9f5694a88d43d11d	2025-01-31T08:24:29Z	Olivier Chafik	Fix chatml fallback for unsupported builtin templates (when --jinja not enabled) (#11533)
M	examples/server/server.cpp

commit	4a2b196d03d52da31236390e9f5694a88d43d11d	1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f	2025-01-31T08:12:40Z	Olivier Chafik	server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531)
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/utils.hpp

commit	1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f	a2df2787b32e0846205f7151dfad88ceab592beb	2025-01-31T00:58:55-05:00	Steve Grubb	common: Add missing va_end (#11529)
M	common/log.cpp

commit	a2df2787b32e0846205f7151dfad88ceab592beb	553f1e46e9e864514bbd6bf4009146db66be0541	2025-01-31T06:04:53+01:00	Daniel Bevenius	server : update help metrics processing/deferred (#11512)
M	examples/server/server.cpp

commit	553f1e46e9e864514bbd6bf4009146db66be0541	8b576b6c55bc4e6be898b47522f0ef402b93ef62	2025-01-30T22:01:06Z	Olivier Chafik	`ci`: ccache for all github worfklows (#11516)
M	.github/workflows/build.yml

commit	8b576b6c55bc4e6be898b47522f0ef402b93ef62	27d135c970c00f655d486f870edacded792bef5c	2025-01-30T19:13:58Z	Olivier Chafik	Tool call support (generic + native for Llama, Functionary, Hermes, Mistral, Firefunction, DeepSeek) w/ lazy grammars (#9639)
M	.editorconfig
M	.github/workflows/server.yml
M	Makefile
M	README.md
M	common/CMakeLists.txt
A	common/chat.cpp
A	common/chat.hpp
M	common/common.cpp
M	common/common.h
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
M	common/sampling.cpp
M	examples/gbnf-validator/gbnf-validator.cpp
M	examples/main/main.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/README.md
A	examples/server/tests/pytest.ini
M	examples/server/tests/tests.sh
M	examples/server/tests/unit/test_chat_completion.py
A	examples/server/tests/unit/test_tool_call.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp
M	include/llama.h
A	models/templates/CohereForAI-c4ai-command-r-plus-tool_use.jinja
A	models/templates/NousResearch-Hermes-2-Pro-Llama-3-8B-tool_use.jinja
A	models/templates/NousResearch-Hermes-3-Llama-3.1-8B-tool_use.jinja
A	models/templates/Qwen-Qwen2.5-7B-Instruct.jinja
A	models/templates/deepseek-ai-DeepSeek-R1-Distill-Llama-8B.jinja
A	models/templates/deepseek-ai-DeepSeek-R1-Distill-Qwen-32B.jinja
A	models/templates/fireworks-ai-llama-3-firefunction-v2.jinja
A	models/templates/google-gemma-2-2b-it.jinja
A	models/templates/meetkai-functionary-medium-v3.1.jinja
A	models/templates/meetkai-functionary-medium-v3.2.jinja
A	models/templates/meta-llama-Llama-3.1-8B-Instruct.jinja
A	models/templates/meta-llama-Llama-3.2-3B-Instruct.jinja
A	models/templates/meta-llama-Llama-3.3-70B-Instruct.jinja
A	models/templates/microsoft-Phi-3.5-mini-instruct.jinja
A	models/templates/mistralai-Mistral-Nemo-Instruct-2407.jinja
A	scripts/fetch_server_test_models.py
R086	scripts/get_hf_chat_template.py	scripts/get_chat_template.py
M	src/llama-grammar.cpp
M	src/llama-grammar.h
M	src/llama-sampling.cpp
M	tests/CMakeLists.txt
M	tests/test-chat-template.cpp
A	tests/test-chat.cpp
M	tests/test-grammar-integration.cpp

commit	27d135c970c00f655d486f870edacded792bef5c	6af1ca48cbdf9a438438afd0a9a549a272bc95bf	2025-01-29T19:36:00+01:00	uvos	HIP: require at least HIP 5.5
M	ggml/src/ggml-hip/CMakeLists.txt

commit	6af1ca48cbdf9a438438afd0a9a549a272bc95bf	c300e68ef490e6cf6c04ed96fd27a6a53ab8a422	2025-01-29T19:12:42+01:00	uvos	HIP: Prepare reduction operators for wave 64
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	c300e68ef490e6cf6c04ed96fd27a6a53ab8a422	3d804dec7661fbb7de9b7f93267e2fc3ca0193c1	2025-01-29T17:46:23+01:00	uvos	CUDA/HIP: add warp_size to cuda_device_info
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	3d804dec7661fbb7de9b7f93267e2fc3ca0193c1	ffd0821c57edc7e5d04338ab0c6b1461198df15f	2025-01-30T10:30:27Z	Olivier Chafik	sync: minja (#11499)
M	common/chat-template.hpp
M	common/minja.hpp

commit	ffd0821c57edc7e5d04338ab0c6b1461198df15f	4314e56c4f8c5091f45732f39bd94c0c6c323798	2025-01-30T11:10:59+01:00	mgroeber9110	vocab : correctly identify LF token for GPT-2 style BPE tokenizer (#11496)
M	src/llama-vocab.cpp

commit	4314e56c4f8c5091f45732f39bd94c0c6c323798	496e5bf46bab757d05e18227cb4e17055ae42f42	2025-01-30T11:05:00+01:00	Daniel Bevenius	server : use lambda instead of std::bind (#11507)
M	examples/server/server.cpp

commit	496e5bf46bab757d05e18227cb4e17055ae42f42	7919256c57f05c09b0b50ec9abb37ff62dab7251	2025-01-30T04:11:53-05:00	Isaac McFadyen	server : (docs) added response format for /apply-template [no ci] (#11503)
M	examples/server/README.md

commit	7919256c57f05c09b0b50ec9abb37ff62dab7251	e0449763a4f335cca374254a72892141f41eaa59	2025-01-30T12:58:02+07:00	Guspan Tanadi	readme : reference examples relative links (#11505)
M	README.md

commit	e0449763a4f335cca374254a72892141f41eaa59	eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc	2025-01-30T05:48:14+01:00	Daniel Bevenius	server : update json snippets in README.md [no ci] (#11492)
M	examples/server/README.md

commit	eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc	66ee4f297cff3c7ce98b31dbc0ce909d41b9e408	2025-01-29T12:45:44-06:00	Nigel Bosch	server : add /apply-template endpoint for additional use cases of Minja functionality (#11489)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py

commit	66ee4f297cff3c7ce98b31dbc0ce909d41b9e408	e51c47b401f8cb5f21630a05171e2529cde4d186	2025-01-29T18:29:39+01:00	Rémy Oudompheng	vulkan: implement initial support for IQ2 and IQ3 quantizations (#11360)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_s.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_xs.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq2_xxs.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_s.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq3_xxs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_nl.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	e51c47b401f8cb5f21630a05171e2529cde4d186	2711d0215ff6a1ecb2202ac8c1f135bceed7057b	2025-01-29T16:34:18+01:00	Daniel Bevenius	server : update auto gen files comments [no ci] (#11484)
M	examples/server/README.md
M	examples/server/server.cpp

commit	2711d0215ff6a1ecb2202ac8c1f135bceed7057b	f0d4b29edfc633ec3ba6442482a6b43a5cd80a01	2025-01-29T09:26:50-06:00	Jeff Bolz	vulkan: Catch pipeline creation failure and print an error message (#11436)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	f0d4b29edfc633ec3ba6442482a6b43a5cd80a01	815857791d3639a4d544d0a8cf25a49b0325c08c	2025-01-29T12:23:10+01:00	Eric Curtin	Parse https://ollama.com/library/ syntax (#11480)
M	examples/run/run.cpp

commit	815857791d3639a4d544d0a8cf25a49b0325c08c	1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6	2025-01-29T11:25:29+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6	d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d	2025-01-23T11:59:08-08:00	William Tambellini	ggml : add option to not print stack on abort (ggml/1081)
M	ggml/src/ggml.c

commit	d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d	b636228c0ad0db95bf73008094c6145a05615cf6	2025-01-17T21:29:08+09:00	issixx	ggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	b636228c0ad0db95bf73008094c6145a05615cf6	325afb370a1a7b32b5fe46a749bc840c66db9765	2025-01-29T09:38:54+01:00	Daniel Bevenius	embedding : enable --no-warmup option (#11475)
M	common/arg.cpp

commit	325afb370a1a7b32b5fe46a749bc840c66db9765	794fe23f29fb40104975c91fe19f23798f7c726e	2025-01-29T12:07:21+08:00	Molly Sophia	llama: fix missing k_cache store for rwkv6qwen2 (#11445)
M	src/llama.cpp

commit	794fe23f29fb40104975c91fe19f23798f7c726e	cf8cc856d7d02165bd08593b4757e1256a62d501	2025-01-29T02:22:06+03:00	Emreerdog	cmake: add hints for locating ggml on Windows using Llama find-package (#11466)
M	cmake/llama-config.cmake.in

commit	cf8cc856d7d02165bd08593b4757e1256a62d501	d0c08040b6c8bebeade7b8d5764df6cf901678d5	2025-01-28T16:03:42-07:00	peidaqi	server : Fixed wrong function name in llamacpp server unit test (#11473)
M	examples/server/tests/unit/test_completion.py

commit	d0c08040b6c8bebeade7b8d5764df6cf901678d5	be5ef7963fcf14a9c77c963fdd3f7b606eacb498	2025-01-29T00:02:56+01:00	Xuan-Son Nguyen	ci : fix build CPU arm64 (#11472)
M	.devops/vulkan.Dockerfile
M	.github/workflows/docker.yml

commit	be5ef7963fcf14a9c77c963fdd3f7b606eacb498	cae9fb4361138b937464524eed907328731b81f6	2025-01-28T23:06:32+01:00	uvos	HIP: Supress transformation warning in softmax.cu
M	ggml/src/ggml-cuda/softmax.cu

commit	cae9fb4361138b937464524eed907328731b81f6	7fee2889e6565830631fbe76d47ef85cf8fd946a	2025-01-28T07:42:20-08:00	Nikita Sarychev	HIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	7fee2889e6565830631fbe76d47ef85cf8fd946a	d7d1eccacccaa698c9232014b96a82b359595d6e	2025-01-28T15:45:41+01:00	Eric Curtin	Add github protocol pulling and http:// (#11465)
M	examples/run/run.cpp

commit	d7d1eccacccaa698c9232014b96a82b359595d6e	4bf3119d61c1de5660025fd5a611effe503e3d2b	2025-01-28T15:17:25+01:00	Nuno	docker: allow installing pip packages system-wide (#11437)
M	.devops/vulkan.Dockerfile

commit	4bf3119d61c1de5660025fd5a611effe503e3d2b	f643120bad8ab3a753daa64aaac8288ee5800e06	2025-01-28T09:15:34-05:00	someone13574	cmake : don't fail on `GGML_CPU=OFF` (#11457)
M	ggml/src/CMakeLists.txt

commit	f643120bad8ab3a753daa64aaac8288ee5800e06	6e84b0ab8e10b8f6f99a32855f976ebcd35b0353	2025-01-28T11:42:32+01:00	Nuno	docker: add perplexity and bench commands to full image (#11438)
M	.devops/tools.sh

commit	6e84b0ab8e10b8f6f99a32855f976ebcd35b0353	2b8525d5c89b124c4578a2621cbeb64354ff3d9c	2025-01-28T15:26:58+05:30	Akarshan Biswas	SYCL : SOFTMAX F16 mask support and other fixes (#11261)
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/softmax.hpp
M	tests/test-backend-ops.cpp

commit	2b8525d5c89b124c4578a2621cbeb64354ff3d9c	a4417ddda98fd0558fb4d802253e68a933704b59	2025-01-28T09:32:40+01:00	Michael Engel	Handle missing model in CLI parameters for llama-run (#11399)
M	examples/run/run.cpp

commit	a4417ddda98fd0558fb4d802253e68a933704b59	d6d24cd9ed6d0b9558643dcc28f2124bef488c52	2025-01-27T19:36:10+01:00	Eric Curtin	Add new hf protocol for ollama (#11449)
M	examples/run/run.cpp

commit	d6d24cd9ed6d0b9558643dcc28f2124bef488c52	a5203b4465c5c87813936bde98170e25bb09024f	2025-01-27T08:58:17-05:00	Haus1	AMD: parse the architecture as supplied by gcnArchName (#11244)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	a5203b4465c5c87813936bde98170e25bb09024f	df984e014714cba4c99ef894b20b51cbcef31b16	2025-01-27T17:42:09+04:00	lexasub	llama : minor fixes for up llama load model speed (#11448)
M	src/llama-model-loader.cpp
M	src/llama-vocab.cpp

commit	df984e014714cba4c99ef894b20b51cbcef31b16	acd38efee316f3a5ed2e6afcbc5814807c347053	2025-01-27T12:07:12+01:00	Johannes Gäßler	llama: refactor llama_decode_impl (#11381)
M	src/llama.cpp

commit	acd38efee316f3a5ed2e6afcbc5814807c347053	caf773f249aa267c78d3da5567b8ab156080ea59	2025-01-27T02:41:59-05:00	Ihar Hrachyshka	metal: Handle null returned from MTLCreateSystemDefaultDevice() (#11441)
M	ggml/src/ggml-metal/ggml-metal.m

commit	caf773f249aa267c78d3da5567b8ab156080ea59	178a7eb952d211b8d4232d5e50ae1b64519172a9	2025-01-26T22:45:32+01:00	Xuan Son Nguyen	docker : fix ARM build and Vulkan build (#11434)
M	.devops/vulkan.Dockerfile
M	.github/workflows/docker.yml

commit	178a7eb952d211b8d4232d5e50ae1b64519172a9	6f53d8a6b41e48c73b345fc6c712c3b00ea4fb93	2025-01-26T20:06:16+02:00	Georgi Gerganov	metal : use residency sets (#11427)
M	ggml/src/ggml-metal/ggml-metal.m

commit	6f53d8a6b41e48c73b345fc6c712c3b00ea4fb93	19f65187cbf009801288861133267ee5573ceead	2025-01-26T18:22:43+01:00	Nuno	docker: add missing vulkan library to base layer and update to 24.04 (#11422)
M	.devops/vulkan.Dockerfile

commit	19f65187cbf009801288861133267ee5573ceead	1d8ee06000ecdd274e7f0a0465d6bf26ad2b3491	2025-01-26T12:07:48-04:00	bandoti	cmake: add ggml find package (#11369)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	cmake/llama-config.cmake.in
D	examples/main-cmake-pkg/CMakeLists.txt
D	examples/main-cmake-pkg/README.md
R100	examples/main-cmake-pkg/.gitignore	examples/simple-cmake-pkg/.gitignore
A	examples/simple-cmake-pkg/CMakeLists.txt
A	examples/simple-cmake-pkg/README.md
M	ggml/CMakeLists.txt
A	ggml/cmake/ggml-config.cmake.in
M	ggml/src/CMakeLists.txt

commit	1d8ee06000ecdd274e7f0a0465d6bf26ad2b3491	2cc9b8c32c78d09cd1b4df0aaa605ab2d0176243	2025-01-26T23:20:34+08:00	Frank Mai	rpc: fix register position (#11424)
M	src/llama-model.cpp
M	src/llama.cpp

commit	2cc9b8c32c78d09cd1b4df0aaa605ab2d0176243	f35726c2fb0a824246e004ab4bedcde37f3f0dd0	2025-01-26T14:30:15+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	f35726c2fb0a824246e004ab4bedcde37f3f0dd0	4a75d19376f2f00dbae6c266eb9c4f3001872b52	2025-01-25T20:10:03-06:00	Jeff Bolz	build: apply MSVC /bigobj option to c/cpp files only (#11423)
M	CMakeLists.txt

commit	4a75d19376f2f00dbae6c266eb9c4f3001872b52	26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0	2025-01-25T15:29:57-06:00	Jeff Bolz	vulkan: compile shaders on-demand (#11406)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0	ca6baf76c1a7adb9134b08d2bc4c65557297ff87	2025-01-25T21:01:12+01:00	uvos	Hip: disable VMM on hip as it seams that it dosent work in some configurations (#11420)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-hip/CMakeLists.txt

commit	ca6baf76c1a7adb9134b08d2bc4c65557297ff87	6e264a905bec9e4c0111eb4c91379c88accef7c6	2025-01-25T11:26:37-06:00	Jeff Bolz	build: add /bigobj to MSVC build (#11407)
M	CMakeLists.txt

commit	6e264a905bec9e4c0111eb4c91379c88accef7c6	49b0e3cec4b67dc9f4debe3a16acd4c819f751d6	2025-01-25T17:22:41+01:00	Diego Devesa	docker : add GGML_CPU_ARM_ARCH arg to select ARM architecture to build for (#11419)
M	.devops/cpu.Dockerfile

commit	49b0e3cec4b67dc9f4debe3a16acd4c819f751d6	20a758155bc5f37290b20ea44d76ba99c4e7f2cb	2025-01-25T16:36:44+01:00	Xuan Son Nguyen	server : fix cleaning up stream task (#11418)
M	examples/server/server.cpp

commit	20a758155bc5f37290b20ea44d76ba99c4e7f2cb	00c24acb2ac49d9f8318e808b6ada2f5649f253f	2025-01-25T15:22:29+01:00	Diego Devesa	docker : fix CPU ARM build (#11403)
M	.devops/cpu.Dockerfile

commit	00c24acb2ac49d9f8318e808b6ada2f5649f253f	466ea66f338d63109540dae1df97ccfdbf4cd08f	2025-01-25T13:36:48+02:00	Georgi Gerganov	ci : fix line breaks on windows builds (#11409)
M	.github/workflows/build.yml

commit	466ea66f338d63109540dae1df97ccfdbf4cd08f	5f0db9522f347b095f84c3033d6c1c1895402e25	2025-01-25T07:26:01+08:00	jiahao su	CANN: Add Ascend CANN build ci (#10217)
M	.github/workflows/build.yml

commit	5f0db9522f347b095f84c3033d6c1c1895402e25	c5d9effb49649db80a52caf5c0626de6f342f526	2025-01-25T00:02:23+01:00	uvos	hip : Add hipGraph and VMM support to ROCM (#11362)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-hip/CMakeLists.txt

commit	c5d9effb49649db80a52caf5c0626de6f342f526	9fbadaef4f0903c64895ba9c70f02ac6e6a4b41c	2025-01-24T21:02:43+01:00	Johannes Gäßler	CUDA: fix FP16 cuBLAS GEMM (#11396)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	9fbadaef4f0903c64895ba9c70f02ac6e6a4b41c	9755129c27da76d768bd7e47e206bac61b40cf18	2025-01-24T17:50:49+01:00	uvos	rocBLAS: Avoid fp32->fp16->fp32 conversion on cdna (#11356)
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmvq.cu

commit	9755129c27da76d768bd7e47e206bac61b40cf18	a07c2c8a52464646ce13040e62c1ea04459f721e	2025-01-24T18:41:30+02:00	Georgi Gerganov	release : pack /lib in the packages (#11392)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	a07c2c8a52464646ce13040e62c1ea04459f721e	8137b4bb2b5fd4cb4a752bfe69ccfd915a313d58	2025-01-24T13:30:13Z	Jafar Uruç	docs : Update readme to build targets for local docker build (#11368)
M	docs/backend/SYCL.md
M	docs/build.md
M	docs/docker.md

commit	8137b4bb2b5fd4cb4a752bfe69ccfd915a313d58	1af6945eb0d0e97525dc0ec18167abf05c28f482	2025-01-24T12:38:31+01:00	Johannes Gäßler	CPU/CUDA: fix (GQA) mul mat back, add CUDA support (#11380)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/out-prod.cu
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	1af6945eb0d0e97525dc0ec18167abf05c28f482	01f37edf1a6fae76fd9e2e02109aae6995a914f0	2025-01-24T12:21:35+01:00	Bernhard M. Wiedemann	cmake : avoid -march=native when reproducible build is wanted (#11366)
M	ggml/CMakeLists.txt

commit	01f37edf1a6fae76fd9e2e02109aae6995a914f0	c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4	2025-01-24T09:39:24Z	Eric Curtin	Update llama-run README.md (#11386)
M	examples/run/README.md

commit	c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4	564804b79b78df1469ec8646869972de5e885ec4	2025-01-24T09:02:38+01:00	stduhpf	server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html
M	examples/server/webui/src/main.js

commit	564804b79b78df1469ec8646869972de5e885ec4	05f63cc9ee859de07f585f7b12939345f39ada8b	2025-01-23T14:51:24-06:00	Jeff Bolz	tests: fix some mul_mat test gaps (#11375)
M	tests/test-backend-ops.cpp

commit	05f63cc9ee859de07f585f7b12939345f39ada8b	f7fb43cd0b84280c261f440dc8e85eafad4a0ca6	2025-01-23T20:04:31Z	Eric Curtin	Update documentation (#11373)
M	examples/run/run.cpp

commit	f7fb43cd0b84280c261f440dc8e85eafad4a0ca6	58456616408c828a1ce6d2481940fd1c97bce3b5	2025-01-23T16:16:18Z	Eric Curtin	Add -ngl (#11372)
M	examples/run/run.cpp

commit	58456616408c828a1ce6d2481940fd1c97bce3b5	f211d1dc10332b7e89a4abd1041903fa63bfed27	2025-01-23T13:56:05+01:00	Xuan Son Nguyen	server : add more clean up when cancel_tasks is called (#11340)
M	examples/server/server.cpp

commit	f211d1dc10332b7e89a4abd1041903fa63bfed27	955a6c2d91480954e90469517c4b91c4052c6a59	2025-01-23T10:38:20Z	Eric Curtin	Treat hf.co/ prefix the same as hf:// (#11350)
M	examples/run/run.cpp

commit	955a6c2d91480954e90469517c4b91c4052c6a59	1971adf55e3ebbfab83771d6174d37b77c352c71	2025-01-23T15:14:28+08:00	amd-dwang	Vulkan-run-test: fix mmq_wg_denoms (#11343)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	1971adf55e3ebbfab83771d6174d37b77c352c71	5245729e3317064959faefc5e5cbc63f4e9cfbea	2025-01-23T01:07:50-06:00	Jeff Bolz	vulkan: sort shaders for more deterministic binary (#11315)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	5245729e3317064959faefc5e5cbc63f4e9cfbea	6152129d05870cb38162c422c6ba80434e021e9f	2025-01-23T01:01:17-06:00	Jeff Bolz	vulkan: fix diag_mask_inf (#11323)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/diag_mask_inf.comp

commit	6152129d05870cb38162c422c6ba80434e021e9f	16d3df7ab0bb9def78047eab4d9b15393997f495	2025-01-22T19:22:20+01:00	Diego Devesa	main : update README documentation for batch size (#11353)
M	examples/main/README.md

commit	16d3df7ab0bb9def78047eab4d9b15393997f495	12c2bdf2de34f747d13b270fc9d3b52490bf194f	2025-01-22T19:44:26+02:00	Georgi Gerganov	readme : add plugin links (#11355)
M	README.md

commit	12c2bdf2de34f747d13b270fc9d3b52490bf194f	c64d2becb13f2a7c0145b516a05f028d949a046b	2025-01-22T17:44:40+01:00	Diego Devesa	server : fix draft context not being released (#11354)
M	examples/server/server.cpp

commit	c64d2becb13f2a7c0145b516a05f028d949a046b	96f405393461062450692430e4916809bf71c3c4	2025-01-22T16:16:27Z	Olivier Chafik	`minja`: sync at https://github.com/google/minja/commit/0f5f7f2b3770eb682fbc11763266d45204173686 (#11352)
M	common/chat-template.hpp
M	common/minja.hpp

commit	96f405393461062450692430e4916809bf71c3c4	a94f3b2727e97eb6c904006eb786960c069282bc	2025-01-22T12:51:32+01:00	Jiří Podivín	Adding logprobs to /v1/completions (#11344)
M	examples/server/server.cpp

commit	a94f3b2727e97eb6c904006eb786960c069282bc	3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b	2025-01-22T09:51:44Z	Olivier Chafik	`common`: utils to split / join / repeat strings (from json converter) (#11342)
M	common/common.cpp
M	common/common.h
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h

commit	3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b	6171c9d25820ccf676b243c172868819d882848f	2025-01-22T15:35:48+08:00	tc-mb	llava : support Minicpm-omni (#11289)
A	examples/llava/README-minicpmo2.6.md
M	examples/llava/clip.cpp
M	examples/llava/llava.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/minicpmv-convert-image-encoder-to-gguf.py
M	examples/llava/minicpmv-surgery.py

commit	6171c9d25820ccf676b243c172868819d882848f	e28245f35f2faaf249dd352998b3693a8cc28c51	2025-01-21T13:18:51Z	Olivier Chafik	Add Jinja template support (#11016)
M	Makefile
M	common/CMakeLists.txt
M	common/arg.cpp
A	common/chat-template.hpp
M	common/common.cpp
M	common/common.h
A	common/minja.hpp
M	examples/main/main.cpp
M	examples/run/run.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp
M	examples/simple-chat/simple-chat.cpp
M	include/llama.h
A	scripts/get_hf_chat_template.py
M	src/CMakeLists.txt
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	tests/test-chat-template.cpp

commit	e28245f35f2faaf249dd352998b3693a8cc28c51	6da5bec81c34f3b8a8f1b367cf23ad016e83d332	2025-01-21T14:07:12+01:00	Xuan Son Nguyen	export-lora : fix tok_embd tensor (#11330)
M	examples/export-lora/export-lora.cpp

commit	6da5bec81c34f3b8a8f1b367cf23ad016e83d332	2e2f8f093cd4fb6bbb87ba84f6b9684fa082f3fa	2025-01-21T15:06:41+02:00	Radoslav Gerganov	rpc : better caching of the base buffer pointer (#11331)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	2e2f8f093cd4fb6bbb87ba84f6b9684fa082f3fa	2139667ec419cdd953987f4df2ace9da87bbda28	2025-01-21T09:32:35Z	Eric Curtin	linenoise.cpp refactoring (#11301)
M	examples/run/linenoise.cpp/linenoise.cpp
M	examples/run/linenoise.cpp/linenoise.h

commit	2139667ec419cdd953987f4df2ace9da87bbda28	80d0d6b4b7abca342fc990399e78af8d213eabaf	2025-01-21T08:48:13+02:00	Georgi Gerganov	metal : fix out-of-bounds write (#11314)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	80d0d6b4b7abca342fc990399e78af8d213eabaf	aea8ddd5165d525a449e2fc3839db77a71f4a318	2025-01-20T22:29:43+02:00	Georgi Gerganov	common : add -hfd option for the draft model (#11318)
M	common/arg.cpp
M	common/common.h
M	examples/server/server.cpp

commit	aea8ddd5165d525a449e2fc3839db77a71f4a318	9f7add1cde670ff744b791f5ed6649e86a0c586c	2025-01-20T10:38:32-06:00	Jeff Bolz	vulkan: fix coopmat2 validation failures (#11284)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9f7add1cde670ff744b791f5ed6649e86a0c586c	90d987b105db6016cb395f673b4d21e02129721e	2025-01-20T16:36:08+02:00	Georgi Gerganov	examples : fix add_special conditions (#11311)
M	examples/run/run.cpp
M	examples/simple-chat/simple-chat.cpp

commit	90d987b105db6016cb395f673b4d21e02129721e	a4251edd6fc16d168f517a7e4b0936212b296603	2025-01-20T09:02:43-05:00	Christopher Nielsen	mmap: add include for cerrno (#11296)
M	src/llama-mmap.cpp

commit	a4251edd6fc16d168f517a7e4b0936212b296603	ec7f3ac9ab33e46b136eb5ab6a76c4d81f57c7f1	2025-01-20T15:02:15+01:00	Michael Podvitskiy	cmake: fix shell command quoting in build-info script (#11309)
M	cmake/build-info.cmake

commit	ec7f3ac9ab33e46b136eb5ab6a76c4d81f57c7f1	ef6dada60ca710f4edfbb6fd9e1258685d8ea49d	2025-01-20T14:35:07+01:00	Xuan Son Nguyen	llama : add support for Deepseek-R1-Qwen distill model (#11310)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
A	models/ggml-vocab-deepseek-r1-qwen.gguf.inp
A	models/ggml-vocab-deepseek-r1-qwen.gguf.out
M	src/llama-chat.cpp
M	src/llama-vocab.cpp

commit	ef6dada60ca710f4edfbb6fd9e1258685d8ea49d	ae3c1db2f9c4beec0737c6a82d1f3791fd6fcdb2	2025-01-20T09:29:32+02:00	Georgi Gerganov	cont : fix whitespaces (#11305)
M	src/llama-model.cpp

commit	ae3c1db2f9c4beec0737c6a82d1f3791fd6fcdb2	92bc493917d43b83e592349e138b54c90b1c3ea7	2025-01-20T01:21:01-06:00	Kyle Bruene	llama : re-add LLM_ARCH_PHIMOE (#11305)
M	src/llama-model.cpp

commit	92bc493917d43b83e592349e138b54c90b1c3ea7	b9daaffe02d6a77d85f0420bce5dfe0e00daeff6	2025-01-19T20:22:30+02:00	Georgi Gerganov	tests : increase timeout when sanitizers are enabled (#11300)
M	.github/workflows/server.yml
M	examples/server/tests/utils.py

commit	b9daaffe02d6a77d85f0420bce5dfe0e00daeff6	99487b57d47e14dc342b7b89d238ca11c0345241	2025-01-19T18:12:09+02:00	Georgi Gerganov	simple-chat : fix BOS being added to each message (#11278)
M	examples/simple-chat/simple-chat.cpp

commit	99487b57d47e14dc342b7b89d238ca11c0345241	a1649cc13f89946322358f92ea268ae1b7b5096c	2025-01-19T14:33:34+01:00	Nicolò Scipione	SYCL: Introducing memory host pool (#11251)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	a1649cc13f89946322358f92ea268ae1b7b5096c	4dd34ff83165a483ebff7bd43621b28490fa1fd6	2025-01-18T14:42:31Z	Eric Curtin	Adding linenoise.cpp to llama-run (#11252)
M	.github/workflows/build.yml
M	examples/run/CMakeLists.txt
A	examples/run/linenoise.cpp/LICENSE
A	examples/run/linenoise.cpp/linenoise.cpp
A	examples/run/linenoise.cpp/linenoise.h
M	examples/run/run.cpp

commit	4dd34ff83165a483ebff7bd43621b28490fa1fd6	f30f099228f774209aa3010b78dfbe5d262e69aa	2025-01-18T16:18:15+02:00	Georgi Gerganov	cmake : add sanitizer flags for llama.cpp (#11279)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	ggml/src/gguf.cpp
M	src/unicode.cpp
M	tests/CMakeLists.txt
M	tests/test-gguf.cpp
M	tests/test-sampling.cpp

commit	f30f099228f774209aa3010b78dfbe5d262e69aa	f26c87417999209e7f4576b4f3ecf7a5b9c66a29	2025-01-18T14:12:05+01:00	Xuan Son Nguyen	server : implement cancellable request (#11285)
M	examples/server/httplib.h
M	examples/server/server.cpp
M	examples/server/tests/unit/test_completion.py
M	examples/server/tests/utils.py

commit	f26c87417999209e7f4576b4f3ecf7a5b9c66a29	6390a998bfc63241fde8509022b0768a71bf20bb	2025-01-18T13:18:32+02:00	Georgi Gerganov	scripts : restore hf.sh (#11288)
A	scripts/hf.sh

commit	6390a998bfc63241fde8509022b0768a71bf20bb	44e18ef93995f3040660750b527e5becf85899d0	2025-01-18T18:20:57+08:00	LostRuins Concedo	tts : add guide tokens support (#11186)
M	common/arg.cpp
M	common/common.h
M	examples/tts/tts.cpp

commit	44e18ef93995f3040660750b527e5becf85899d0	3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6	2025-01-18T02:26:50-06:00	Jeff Bolz	vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
M	tests/test-backend-ops.cpp

commit	3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6	667d72846c06b2cf4f7c8a4265e210991a49706b	2025-01-17T20:57:56+08:00	codezjx	llama.android: add field formatChat to control whether to parse special tokens when send message (#11270)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.android/llama/src/main/java/android/llama/cpp/LLamaAndroid.kt

commit	667d72846c06b2cf4f7c8a4265e210991a49706b	a133566d34a1dd3693c504786963bf1b7b7d8c0e	2025-01-17T10:57:09+02:00	Radoslav Gerganov	rpc : early register backend devices (#11262)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/llama-bench/llama-bench.cpp
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend-impl.h
M	include/llama.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama.cpp

commit	a133566d34a1dd3693c504786963bf1b7b7d8c0e	960ec65273a9554ff2510ba285a970289256ebfb	2025-01-17T09:28:00+02:00	Georgi Gerganov	vocab : fix double-eos check (#11273)
M	src/llama-vocab.cpp

commit	960ec65273a9554ff2510ba285a970289256ebfb	7a689c415e2aecea1a5ae438542afeaf69815d52	2025-01-17T02:12:01-05:00	David Renshaw	llama : fix deprecation message: vocabable -> vocab (#11269)
M	include/llama.h

commit	7a689c415e2aecea1a5ae438542afeaf69815d52	bd38ddea0181bc717de7cae66fd4323975c85656	2025-01-17T00:10:49Z	musoles	README : added kalavai to infrastructure list (#11216)
M	README.md

commit	bd38ddea0181bc717de7cae66fd4323975c85656	466300fe1416de2802b710215817db28d4496f41	2025-01-16T15:47:10-06:00	Jeff Bolz	vulkan: support copy from f32 to q4_0/q4_1/q5_0/q5_1/q8_0/iq4_nl (#11166)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/copy_from_quant.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/copy_to_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	466300fe1416de2802b710215817db28d4496f41	206bc53422521a67de5e2caba661e21d590d2bae	2025-01-16T15:23:49-06:00	Jeff Bolz	vulkan: optimize coopmat2 q4_k/q5_k dequant functions. (#11206)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp

commit	206bc53422521a67de5e2caba661e21d590d2bae	4dbc8b9cb71876e005724f4e8f73a3544646bcf5	2025-01-16T15:16:39-06:00	Jeff Bolz	vulkan: optimize coopmat2 q2_k dequant function (#11130)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp

commit	4dbc8b9cb71876e005724f4e8f73a3544646bcf5	9c8dcefe171ba70ed14f2a64d1433da12d0dd1c1	2025-01-17T02:10:38+08:00	RunningLeon	llama : add internlm3 support (#11233)
M	convert_hf_to_gguf.py

commit	9c8dcefe171ba70ed14f2a64d1433da12d0dd1c1	681149ced2582f48c24792403df1307fed5eb951	2025-01-16T16:43:38+01:00	Johannes Gäßler	CUDA: backwards pass for misc. ops, add tests (#11257)
M	ggml/include/ggml.h
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/cross-entropy-loss.cu
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/getrows.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-cuda/norm.cuh
M	ggml/src/ggml-cuda/out-prod.cu
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-cuda/softmax.cu
M	ggml/src/ggml-cuda/softmax.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	681149ced2582f48c24792403df1307fed5eb951	c67cc9837d48ea7f612b5666b90d189e63dfd7d3	2025-01-16T13:54:08+01:00	Xuan Son Nguyen	llama : add `llama_model_load_from_splits` (#11255)
M	include/llama.h
M	src/llama-model-loader.cpp
M	src/llama-model-loader.h
M	src/llama-quant.cpp
M	src/llama.cpp

commit	c67cc9837d48ea7f612b5666b90d189e63dfd7d3	adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5	2025-01-16T18:11:49+09:00	fj-y-saito	ggml: aarch64: implement SVE kernels for q4_K_q8_K vector dot (#11227)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c

commit	adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5	f11cfdfd7fe29436fce512d934c2ff6b94bd89d2	2025-01-15T19:50:13Z	Eve	vulkan: scale caching for k quants + misc fixes (#11081)
M	.gitignore
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp

commit	f11cfdfd7fe29436fce512d934c2ff6b94bd89d2	1d8504338ea27c7331998c11afdbd47ce5a9daac	2025-01-15T18:28:35+02:00	Georgi Gerganov	ci : use -no-cnv in gguf-split tests (#11254)
M	examples/gguf-split/tests.sh
M	examples/quantize/tests.sh
D	scripts/hf.sh
M	tests/test-lora-conversion-inference.sh

commit	1d8504338ea27c7331998c11afdbd47ce5a9daac	432df2d5f901a8ac93d1befad916144a0478bd9e	2025-01-15T22:17:42+09:00	Junil Kim	fix: ggml: fix vulkan-shaders-gen build (#10448)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-vulkan/CMakeLists.txt
A	ggml/src/ggml-vulkan/cmake/host-toolchain.cmake.in
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	432df2d5f901a8ac93d1befad916144a0478bd9e	0ccd7f3eb2debe477ffe3c44d5353cc388c9418d	2025-01-15T12:51:37+01:00	Johannes Gäßler	RoPE: fix back, CUDA support for back + noncont. (#11240)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-cuda/rope.cuh
M	ggml/src/ggml.c
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	0ccd7f3eb2debe477ffe3c44d5353cc388c9418d	f446c2cf6a56a750b67c967505e717a996d2f2fd	2025-01-15T05:44:38+01:00	Daniel Bevenius	examples : add embd_to_audio to tts-outetts.py [no ci] (#11235)
M	examples/tts/README.md
M	examples/tts/tts-outetts.py

commit	f446c2cf6a56a750b67c967505e717a996d2f2fd	b4d92a59a20eea400d8dd30844a339b76210daa0	2025-01-15T08:50:17+05:30	Akarshan Biswas	SYCL: Add gated linear attention kernel (#11175)
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-sycl/gla.cpp
A	ggml/src/ggml-sycl/gla.hpp

commit	b4d92a59a20eea400d8dd30844a339b76210daa0	bbf3e55e352d309573bdafee01a014b0a2492155	2025-01-14T15:42:23+01:00	Xuan Son Nguyen	ci : add -no-cnv for tests (#11238)
M	ci/run.sh

commit	bbf3e55e352d309573bdafee01a014b0a2492155	c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1	2025-01-14T12:54:58+02:00	Georgi Gerganov	vocab : add dummy tokens for "no_vocab" type (#11231)
M	src/llama-vocab.cpp

commit	c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1	091592d758cb55af7bfadd6c397f61db387aa8f3	2025-01-14T14:09:33+03:30	ebraminio	server : Improve code snippets direction between RTL text (#11221)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/main.js

commit	091592d758cb55af7bfadd6c397f61db387aa8f3	44d1e796d08641e7083fcbf37b33c79842a2f01e	2025-01-14T10:16:41Z	Olivier Chafik	Refactor test-chat-template.cpp (#11224)
M	tests/test-chat-template.cpp

commit	44d1e796d08641e7083fcbf37b33c79842a2f01e	a4f3f5d8e64b10fcf59913d487c1782dd0bc23e0	2025-01-14T10:39:42+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a4f3f5d8e64b10fcf59913d487c1782dd0bc23e0	48e1ae0e61b04c6a458ac207e84e86f5ce0abccd	2025-01-14T09:40:15+02:00	Georgi Gerganov	scripts : sync gguf (cont)
M	scripts/sync-ggml-am.sh

commit	48e1ae0e61b04c6a458ac207e84e86f5ce0abccd	d00a80e89dc6632dde7391e1e1ecbbbac088dd25	2025-01-14T09:36:58+02:00	Georgi Gerganov	scripts : sync gguf
M	scripts/sync-ggml.sh

commit	d00a80e89dc6632dde7391e1e1ecbbbac088dd25	504af20ee4eae72080a56d59d744f6774f7901ce	2025-01-14T09:19:58+02:00	Georgi Gerganov	scripts : sync opencl
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	504af20ee4eae72080a56d59d744f6774f7901ce	84a44815f704aaed8e8edec7a39e846a975c7ba9	2025-01-13T22:53:31+03:30	ebraminio	server : (UI) Improve messages bubble shape in RTL (#11220)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html

commit	84a44815f704aaed8e8edec7a39e846a975c7ba9	39509fb082895d1eae2486f8ad2cbf0e905346c4	2025-01-13T20:18:12+01:00	Xuan Son Nguyen	cli : auto activate conversation mode if chat template is available (#11214)
M	README.md
M	common/arg.cpp
M	common/common.h
M	examples/main/main.cpp

commit	39509fb082895d1eae2486f8ad2cbf0e905346c4	a29f0870d4846f52eda14ae28cea612ab66d903c	2025-01-13T16:45:53+01:00	Andreas Kieslinger	cuda : CUDA Graph Compute Function Refactor (precursor for performance improvements) (#11042)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	a29f0870d4846f52eda14ae28cea612ab66d903c	437e05f714cdd67757405221578d3f95f8228b63	2025-01-13T15:59:26+02:00	Georgi Gerganov	contrib : add naming guidelines (cont) (#11177)
M	CONTRIBUTING.md

commit	437e05f714cdd67757405221578d3f95f8228b63	ca001f6656c1c3d29ef479b3aa5d669453e63be5	2025-01-13T17:16:39+03:30	ebraminio	server : (UI) Support for RTL text as models input or output (#11208)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html

commit	ca001f6656c1c3d29ef479b3aa5d669453e63be5	00b4c3da6202e855087a4986bf19bb41b959e333	2025-01-13T15:08:44+02:00	Georgi Gerganov	contrib : add naming guidelines (cont) (#11177)
M	CONTRIBUTING.md

commit	00b4c3da6202e855087a4986bf19bb41b959e333	7426a26b2492fc546a4db6991e871ee605714093	2025-01-13T13:56:23+01:00	Xuan Son Nguyen	common : support tag-based --hf-repo like on ollama (#11195)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h

commit	7426a26b2492fc546a4db6991e871ee605714093	8f70fc3d1b1d3c17b61842330dd106d391cc1227	2025-01-13T14:46:36+02:00	Georgi Gerganov	contrib : add naming guidelines (#11177)
M	CONTRIBUTING.md

commit	8f70fc3d1b1d3c17b61842330dd106d391cc1227	1244cdcf14900dd199907b13f25d9c91a507f578	2025-01-13T13:38:20+01:00	Daniel Bevenius	llama : remove 'd' from bad special token log (#11212)
M	src/llama-vocab.cpp

commit	1244cdcf14900dd199907b13f25d9c91a507f578	924518e2e5726e81f3aeb2518fb85963a500e93a	2025-01-13T13:31:41+02:00	Radoslav Gerganov	ggml : do not define GGML_USE_CUDA when building with GGML_BACKEND_DL (#11211)
M	ggml/src/ggml-hip/CMakeLists.txt

commit	924518e2e5726e81f3aeb2518fb85963a500e93a	9a483999a6fda350772aaf7bc541f1cb246f8a29	2025-01-12T18:23:10Z	Eric Curtin	Reset color before we exit (#11205)
M	examples/run/run.cpp

commit	9a483999a6fda350772aaf7bc541f1cb246f8a29	08f10f69c38288e9e8bb1f933af63a3fc9013d40	2025-01-12T13:45:14+01:00	Xuan Son Nguyen	llama : fix chat template gguf key (#11201)
M	common/common.cpp
M	src/llama-arch.cpp

commit	08f10f69c38288e9e8bb1f933af63a3fc9013d40	afa8a9ec9b520137bbd1ca6838cda93ee39baf20	2025-01-12T12:15:53+02:00	Georgi Gerganov	llama : remove notion of CLS token (#11064)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	afa8a9ec9b520137bbd1ca6838cda93ee39baf20	c05e8c9934f94fde49bc1bc9dc51eed282605150	2025-01-12T11:32:42+02:00	Georgi Gerganov	llama : add `llama_vocab`, functions -> methods, naming (#11110)
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/speculative.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/llava-cli.cpp
M	examples/llava/llava.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/qwen2vl-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/retrieval/retrieval.cpp
M	examples/run/run.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/simple-chat/simple-chat.cpp
M	examples/simple/simple.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	examples/tokenize/tokenize.cpp
M	examples/tts/tts.cpp
M	include/llama-cpp.h
M	include/llama.h
M	src/llama-adapter.cpp
M	src/llama-adapter.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-context.cpp
M	src/llama-context.h
M	src/llama-grammar.cpp
M	src/llama-hparams.h
M	src/llama-kv-cache.cpp
M	src/llama-mmap.cpp
M	src/llama-model-loader.cpp
M	src/llama-model-loader.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama-sampling.cpp
M	src/llama-sampling.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp
M	tests/test-autorelease.cpp
M	tests/test-chat-template.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-spm.cpp
M	tests/test-tokenizer-random.py

commit	c05e8c9934f94fde49bc1bc9dc51eed282605150	2739a71e4b88474833b64aa974ca4515574fd3c4	2025-01-11T03:42:31-06:00	Vinesh Janarthanan	gguf-py: fixed local detection of gguf package (#11180)
M	gguf-py/README.md
M	gguf-py/gguf/scripts/gguf_convert_endian.py
M	gguf-py/gguf/scripts/gguf_dump.py
M	gguf-py/gguf/scripts/gguf_hash.py
M	gguf-py/gguf/scripts/gguf_new_metadata.py
M	gguf-py/gguf/scripts/gguf_set_metadata.py
M	gguf-py/pyproject.toml

commit	2739a71e4b88474833b64aa974ca4515574fd3c4	ba8a1f9c5b675459c55a83e3f97f10df3a66c788	2025-01-11T05:50:33+01:00	Daniel Bevenius	convert : sort print supported models [no ci] (#11179)
M	convert_hf_to_gguf.py

commit	ba8a1f9c5b675459c55a83e3f97f10df3a66c788	ff3fcabc727b2dd0c477d23a258217b27cc639fb	2025-01-10T13:16:16+01:00	Daniel Bevenius	examples : add README.md to tts example [no ci] (#11155)
A	examples/tts/README.md

commit	ff3fcabc727b2dd0c477d23a258217b27cc639fb	c3f9d25706ac84297067aeaa662c1f1af42ed443	2025-01-10T11:30:53+01:00	Daniel Bevenius	convert : add --print-supported-models option (#11172)
M	convert_hf_to_gguf.py

commit	c3f9d25706ac84297067aeaa662c1f1af42ed443	ee7136c6d1e0ba7633294dad137b1573048031ec	2025-01-10T06:39:33+01:00	0cc4m	Vulkan: Fix float16 use on devices without float16 support + fix subgroup_size_control validation error (#11161)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp

commit	ee7136c6d1e0ba7633294dad137b1573048031ec	c6860cc7346c90219475e4467bb8a288e0df975c	2025-01-10T09:58:08+08:00	Molly Sophia	llama: add support for QRWKV6 model architecture (#11001)
M	README.md
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/gla.cu
A	ggml/src/ggml-cuda/gla.cuh
M	ggml/src/ggml-cuda/wkv6.cu
M	ggml/src/ggml-sycl/wkv6.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-hparams.cpp
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-quant.cpp
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	c6860cc7346c90219475e4467bb8a288e0df975c	1204f9727005974587d6fc1dcd4d4f0ead87c856	2025-01-10T05:43:03+05:30	Akarshan Biswas	SYCL: Refactor ggml_sycl_compute_forward (#11121)
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/concat.hpp
M	ggml/src/ggml-sycl/conv.cpp
M	ggml/src/ggml-sycl/conv.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/element_wise.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/outprod.cpp
M	ggml/src/ggml-sycl/outprod.hpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/tsembd.hpp
M	ggml/src/ggml-sycl/wkv6.cpp
M	ggml/src/ggml-sycl/wkv6.hpp

commit	1204f9727005974587d6fc1dcd4d4f0ead87c856	8eceb888d7b7f5e93d20a4f85ca6511022b87040	2025-01-09T19:32:06+08:00	Tei Home	doc: add cuda guide for fedora (#11135)
M	docs/build.md
A	docs/cuda-fedora.md

commit	8eceb888d7b7f5e93d20a4f85ca6511022b87040	f8feb4b01af374ad2fce302fd5790529c615710b	2025-01-09T11:28:29+01:00	Daniel Bevenius	server : add tooltips to settings and themes btn (#11154)
M	examples/server/public/index.html.gz
M	examples/server/webui/index.html

commit	f8feb4b01af374ad2fce302fd5790529c615710b	be0e950c91cde2d8488ae32162b549d7023482f0	2025-01-09T11:21:41+01:00	Pierrick Hymbert	model: Add support for PhiMoE arch (#11003)
M	README.md
M	convert_hf_to_gguf.py
M	docs/development/HOWTO-add-model.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama.cpp

commit	be0e950c91cde2d8488ae32162b549d7023482f0	d9feae1c06321aac9662fd4b4249452dccaec553	2025-01-09T11:15:15+02:00	Georgi Gerganov	media : remove old img [no ci]
D	media/llama-leader.jpeg

commit	d9feae1c06321aac9662fd4b4249452dccaec553	8d59d911711b8f1ba9ec57c4b192ccd2628af033	2025-01-09T10:07:33+01:00	Xuan Son Nguyen	llama-chat : add phi 4 template (#11148)
M	src/llama-chat.cpp
M	src/llama-chat.h
M	tests/test-chat-template.cpp

commit	8d59d911711b8f1ba9ec57c4b192ccd2628af033	8a1d9c25fafbaf4182dd0b785dd6303ee40d55bc	2025-01-09T04:03:28+08:00	hydai	fix: add missing msg in static_assert (#11143)
M	ggml/src/ggml-cuda/concat.cu

commit	8a1d9c25fafbaf4182dd0b785dd6303ee40d55bc	1bf839b1e8b9d043306c65eddd9021fe4337733e	2025-01-08T12:54:58-06:00	Vinesh Janarthanan	gguf-py : move scripts directory (#11116)
M	gguf-py/README.md
R100	gguf-py/scripts/__init__.py	gguf-py/gguf/scripts/__init__.py
R100	gguf-py/scripts/gguf_convert_endian.py	gguf-py/gguf/scripts/gguf_convert_endian.py
R100	gguf-py/scripts/gguf_dump.py	gguf-py/gguf/scripts/gguf_dump.py
R100	gguf-py/scripts/gguf_hash.py	gguf-py/gguf/scripts/gguf_hash.py
R100	gguf-py/scripts/gguf_new_metadata.py	gguf-py/gguf/scripts/gguf_new_metadata.py
R100	gguf-py/scripts/gguf_set_metadata.py	gguf-py/gguf/scripts/gguf_set_metadata.py
M	gguf-py/pyproject.toml

commit	1bf839b1e8b9d043306c65eddd9021fe4337733e	f7cd13301c2a88f97073fd119072b4cc92c08df1	2025-01-08T18:47:05Z	Eric Curtin	Enhance user input handling for llama-run (#11138)
M	examples/run/run.cpp

commit	f7cd13301c2a88f97073fd119072b4cc92c08df1	4d2b3d88041705b20c30b3219838aa435e7ffbde	2025-01-08T16:09:20+01:00	Xuan Son Nguyen	ci : use actions from ggml-org (#11140)
M	.github/workflows/build.yml
M	.github/workflows/docker.yml

commit	4d2b3d88041705b20c30b3219838aa435e7ffbde	c07d437bbd417f42b122e767ad42b3298767dca0	2025-01-08T15:59:53+01:00	Xuan Son Nguyen	lora : improve compat with `mergekit-extract-lora` (#11131)
M	convert_lora_to_gguf.py
M	src/llama-adapter.cpp
M	src/llama-adapter.h
M	src/llama.cpp

commit	c07d437bbd417f42b122e767ad42b3298767dca0	99a3755a3c518119d0156766122f7b4b796ea576	2025-01-08T16:19:36+02:00	Georgi Gerganov	llama : avoid hardcoded QK_K (#11061)
M	src/llama-quant.cpp

commit	99a3755a3c518119d0156766122f7b4b796ea576	c792dcf4880461c2b5f3960584db241ac71a893a	2025-01-08T13:40:30+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	c792dcf4880461c2b5f3960584db241ac71a893a	80ccf5d725571035b454659e3c1b4b2b07b65e71	2025-01-05T09:50:37+02:00	Radoslav Gerganov	ggml : allow loading backend with env variable (ggml/1059)
M	ggml/src/ggml-backend-reg.cpp

commit	80ccf5d725571035b454659e3c1b4b2b07b65e71	a3c1232c3f475f0a77b9cc5225516ac31c567a06	2025-01-08T12:07:20+01:00	Xuan Son Nguyen	ci : pin dependency to specific version (#11137)
M	.github/workflows/docker.yml
M	.github/workflows/editorconfig.yml

commit	a3c1232c3f475f0a77b9cc5225516ac31c567a06	8cef75c743ba13ebbd6d380c531200c768a8b8aa	2025-01-08T12:55:36+02:00	Georgi Gerganov	arg : option to exclude arguments from specific examples (#11136)
M	common/arg.cpp
M	common/arg.h
M	examples/server/README.md

commit	8cef75c743ba13ebbd6d380c531200c768a8b8aa	0d52a69e4bf0d6181beec7853307bdcdeec9905b	2025-01-08T16:24:19+05:30	amritahs-ibm	llamafile : ppc64le MMA INT8 implementation (#10912)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	0d52a69e4bf0d6181beec7853307bdcdeec9905b	02f04301417e7fb44fa1025bc1b0aef866e2ca89	2025-01-08T11:29:34+02:00	Georgi Gerganov	ci : fix cmake option (#11125)
M	.github/workflows/build.yml

commit	02f04301417e7fb44fa1025bc1b0aef866e2ca89	bec2183f2c8d37cf1278c11d1adb9311e9eaa242	2025-01-08T09:18:13+01:00	Mathieu Baudier	Disable GL_KHR_cooperative_matrix Vulkan extension if not available. (#11117)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/test_coopmat_support.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	bec2183f2c8d37cf1278c11d1adb9311e9eaa242	53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f	2025-01-08T16:17:29+08:00	ag2s20150909	fix: Vulkan shader gen binary path when Cross-compiling (#11096)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f	017cc5f446863316d05522a87f25ec48713a9492	2025-01-07T18:01:58+01:00	Johannes Gäßler	GGUF: C++ refactor, backend support, misc fixes (#11030)
M	CODEOWNERS
M	common/common.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gguf-hash/gguf-hash.cpp
M	examples/gguf-split/gguf-split.cpp
M	examples/gguf/gguf.cpp
M	examples/llava/clip.cpp
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpp.h
M	ggml/include/ggml.h
A	ggml/include/gguf.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c
A	ggml/src/gguf.cpp
M	src/llama-impl.cpp
M	src/llama-model-loader.cpp
M	src/llama-quant.cpp
M	tests/test-gguf.cpp

commit	017cc5f446863316d05522a87f25ec48713a9492	a3d50bc022bedd6c7754c24749a1fef4d2d60c7c	2025-01-07T16:11:57+01:00	Diego Devesa	ggml-backend : only offload from host buffers (fix) (#11124)
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	a3d50bc022bedd6c7754c24749a1fef4d2d60c7c	a4dd490069a66ae56b42127048f06757fc4de4f7	2025-01-07T12:38:05+01:00	Diego Devesa	ggml-backend : only offload from host buffers (#11120)
M	ggml/src/ggml-backend.cpp

commit	a4dd490069a66ae56b42127048f06757fc4de4f7	c0d6f790d07aa78be15584ec394ac20739ade93b	2025-01-07T08:37:02+02:00	Radoslav Gerganov	rpc : code cleanup (#11107)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	c0d6f790d07aa78be15584ec394ac20739ade93b	dc7cef9f373f2a24b851f0df7a618c5209e593fa	2025-01-07T11:56:07+05:30	Akarshan Biswas	SYCL: Use get_multi_ptr instead of deprecated get_pointer in wkv6 (#11087)
M	ggml/src/ggml-sycl/wkv6.cpp

commit	dc7cef9f373f2a24b851f0df7a618c5209e593fa	ecebbd292d741ac084cf248146b2cfb17002aa1d	2025-01-06T22:45:28Z	Eric Curtin	llama-run : fix context size (#11094)
M	examples/run/run.cpp

commit	ecebbd292d741ac084cf248146b2cfb17002aa1d	96be8c32649378a23031630a48c440f3a5d0839b	2025-01-06T17:52:35+02:00	Georgi Gerganov	llama : remove unused headers (#11109)
M	src/llama.cpp

commit	96be8c32649378a23031630a48c440f3a5d0839b	e6e7c75d94adf4d39e846d30807c531ff22865e7	2025-01-06T16:34:49+01:00	Xuan Son Nguyen	github : add cmd line field to bug report (#11090)
M	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
M	.github/ISSUE_TEMPLATE/019-bug-misc.yml
M	CODEOWNERS

commit	e6e7c75d94adf4d39e846d30807c531ff22865e7	09186fabbe05236f2b9446ba6c643cb737540d10	2025-01-06T15:36:08+02:00	Georgi Gerganov	server : fix extra BOS in infill endpoint (#11106)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_infill.py

commit	09186fabbe05236f2b9446ba6c643cb737540d10	96a1dc27c3f09bf1ed83a26292d571795bcf27fa	2025-01-06T13:41:12+01:00	Xuan Son Nguyen	llama : remove check flash_attn with lora (#11104)
M	src/llama.cpp

commit	96a1dc27c3f09bf1ed83a26292d571795bcf27fa	6369f867a410416239d9f20ec27c2b1d6a9fee52	2025-01-06T12:21:46+01:00	Asghar Ghorbani	llama : prevent system info string accumulation across calls (#11101)
M	src/llama.cpp

commit	6369f867a410416239d9f20ec27c2b1d6a9fee52	47182dd03fe04a4ffda5d7f4c8a109ae0056cf56	2025-01-06T10:28:17+01:00	Daniel Bevenius	llama : rename missed batch params/vars to ubatch (#10059)
M	src/llama-kv-cache.cpp
M	src/llama.cpp

commit	47182dd03fe04a4ffda5d7f4c8a109ae0056cf56	3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14	2025-01-06T10:55:18+02:00	Georgi Gerganov	llama : update llama_model API names (#11063)
M	common/common.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/gritlm/gritlm.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/qwen2vl-cli.cpp
M	examples/passkey/passkey.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/run/run.cpp
M	examples/simple-chat/simple-chat.cpp
M	examples/simple/simple.cpp
M	examples/tokenize/tokenize.cpp
M	include/llama-cpp.h
M	include/llama.h
M	src/llama-model.cpp
M	src/llama.cpp
M	tests/test-autorelease.cpp
M	tests/test-model-load-cancel.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-spm.cpp

commit	3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14	ae2f606bb598b287f5fb69c9fdfc98b86598c6cc	2025-01-06T10:54:25+02:00	Georgi Gerganov	tokenize : escape the prompt (#11058)
M	examples/tokenize/tokenize.cpp

commit	ae2f606bb598b287f5fb69c9fdfc98b86598c6cc	727368c60f2ebf2d6a7473a4a9f80957ab063a8e	2025-01-06T10:52:38+02:00	Georgi Gerganov	mmap : fix fileno macro clash (#11076)
M	src/llama-mmap.cpp
M	src/llama-mmap.h

commit	727368c60f2ebf2d6a7473a4a9f80957ab063a8e	5047dd3546951dea3d65c02257d06c46c8662338	2025-01-06T10:52:15+02:00	Georgi Gerganov	llama : use LLAMA_TOKEN_NULL (#11062)
M	common/common.cpp
M	common/ngram-cache.cpp
M	common/ngram-cache.h
M	examples/batched/batched.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/main/main.cpp
M	examples/server/utils.hpp
M	include/llama.h
M	src/llama-model.cpp
M	src/llama-sampling.cpp
M	src/llama-vocab.cpp

commit	5047dd3546951dea3d65c02257d06c46c8662338	46e3556e01b824e52395fb050b29804b6cff2a7c	2025-01-06T10:52:01+02:00	Georgi Gerganov	llama : use _impl suffix instead of _internal (#11060)
M	src/llama-quant.cpp
M	src/llama.cpp

commit	46e3556e01b824e52395fb050b29804b6cff2a7c	b56f079e28fda692f11a8b59200ceb815b05d419	2025-01-06T02:33:52+01:00	Johannes Gäßler	CUDA: add BF16 support (#11093)
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmv.cu
M	ggml/src/ggml-cuda/vendors/cuda.h
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-cuda/vendors/musa.h

commit	b56f079e28fda692f11a8b59200ceb815b05d419	9394bbd484f802ce80d2858033583af3ef700d25	2025-01-04T21:09:59+01:00	0cc4m	Vulkan: Add device-specific blacklist for coopmat for the AMD proprietary driver (#11074)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	9394bbd484f802ce80d2858033583af3ef700d25	f922a9c542ee117550a168395c63ea79261f5c99	2025-01-04T21:06:11+01:00	fairydreaming	llama : Add support for DeepSeek V3 (#11049)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-chat.cpp
M	src/llama-chat.h
M	src/llama-hparams.h
M	src/llama-model.cpp
M	src/llama-model.h
M	src/llama-vocab.cpp
M	src/llama.cpp
M	src/unicode.cpp

commit	f922a9c542ee117550a168395c63ea79261f5c99	46be942214e295cd34660bbbd6b846155d1c36a0	2025-01-04T16:10:30Z	matt23654	[GGML][RPC] Support for models with non-512-aligned tensors over RPC. (#11047)
M	ggml/src/ggml-rpc/ggml-rpc.cpp

commit	46be942214e295cd34660bbbd6b846155d1c36a0	78c678517530d411b4263341cdb4dc28c9d117c8	2025-01-04T09:33:31-05:00	DAN™	llama : add support for the cohere2 model architecture (#10900)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama-arch.cpp
M	src/llama-arch.h
M	src/llama-model.cpp
M	src/llama.cpp

commit	78c678517530d411b4263341cdb4dc28c9d117c8	5e3b08d606b5b0caaea16541b504c3bba8f3ec1d	2025-01-04T10:54:01+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	5e3b08d606b5b0caaea16541b504c3bba8f3ec1d	db68c93b57bfdf6da1fbdae81080382d6998cbc9	2025-01-04T10:53:54+02:00	Georgi Gerganov	ggml : do not install metal source when embed library (ggml/1054)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-metal/CMakeLists.txt

commit	db68c93b57bfdf6da1fbdae81080382d6998cbc9	c31fc8b966817b2f0b277fd28e04a189e388972a	2024-12-19T03:50:12+01:00	Daniel Bevenius	ggml : improve inputs log sched_print_assignments (ggml/1053)
M	ggml/src/ggml-backend.cpp

commit	c31fc8b966817b2f0b277fd28e04a189e388972a	4b0c638b9a68f577cb2066b638c9f622d91ee661	2025-01-04T10:17:31+02:00	Gilad S.	fix: Vulkan shader gen binary path (#11037)
M	ggml/src/ggml-vulkan/CMakeLists.txt

commit	4b0c638b9a68f577cb2066b638c9f622d91ee661	e7da954eccdf39ee795a6135bdb86f0978902681	2025-01-03T20:13:18+08:00	Molly Sophia	common : disable KV cache shifting automatically for unsupported models (#11053)
M	common/common.cpp

commit	e7da954eccdf39ee795a6135bdb86f0978902681	f66f5829276650cd83a087ab2cfed1a760183ea1	2025-01-03T11:26:14+02:00	Georgi Gerganov	metal : avoid uint (#11019)
M	ggml/src/ggml-metal/ggml-metal.m

commit	f66f5829276650cd83a087ab2cfed1a760183ea1	2f0ee84b9b02d2a98742308026f060ebdc2423f1	2025-01-03T10:18:53+02:00	Georgi Gerganov	llama : refactor `src/llama.cpp` (#10902)
M	.github/workflows/build.yml
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/gguf-split/gguf-split.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	examples/tts/tts.cpp
M	include/llama-cpp.h
M	include/llama.h
M	src/CMakeLists.txt
A	src/llama-adapter.cpp
A	src/llama-adapter.h
A	src/llama-arch.cpp
A	src/llama-arch.h
A	src/llama-batch.cpp
A	src/llama-batch.h
A	src/llama-chat.cpp
A	src/llama-chat.h
A	src/llama-context.cpp
A	src/llama-context.h
A	src/llama-cparams.cpp
A	src/llama-cparams.h
M	src/llama-grammar.cpp
M	src/llama-grammar.h
A	src/llama-hparams.cpp
A	src/llama-hparams.h
A	src/llama-impl.cpp
M	src/llama-impl.h
A	src/llama-kv-cache.cpp
A	src/llama-kv-cache.h
A	src/llama-mmap.cpp
A	src/llama-mmap.h
A	src/llama-model-loader.cpp
A	src/llama-model-loader.h
A	src/llama-model.cpp
A	src/llama-model.h
A	src/llama-quant.cpp
A	src/llama-quant.h
M	src/llama-sampling.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	2f0ee84b9b02d2a98742308026f060ebdc2423f1	0da5d860266c6928b8c9408efbd264ae59fedda6	2025-01-02T18:06:12+01:00	Pierrick Hymbert	server: bench: minor fixes (#10765)
M	examples/server/bench/README.md
M	examples/server/bench/bench.py
M	examples/server/bench/script.js

commit	0da5d860266c6928b8c9408efbd264ae59fedda6	a45433ba209ee0b33d02c7dc4c31f29894ad83a6	2025-01-02T15:05:18+01:00	Xuan Son Nguyen	server : allow using LoRA adapters per-request (#10994)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/README.md
M	examples/server/tests/requirements.txt
M	examples/server/tests/unit/test_lora.py
M	examples/server/tests/unit/test_speculative.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp

commit	a45433ba209ee0b33d02c7dc4c31f29894ad83a6	0827b2c1da299805288abbd556d869318f2b121e	2025-01-01T23:14:54-08:00	Benson Wong	readme : add llama-swap to infrastructure section (#11032)
M	README.md

commit	0827b2c1da299805288abbd556d869318f2b121e	45095a61bfd164e87563a0dc0fbd7b0e9891590b	2024-12-31T19:53:33+05:30	Srihari-mcw	ggml : fixes for AVXVNNI instruction set with MSVC and Clang (#11027)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	45095a61bfd164e87563a0dc0fbd7b0e9891590b	5896c65232c7dc87d78426956b16f63fbf58dcf6	2024-12-31T15:22:01+01:00	Xuan Son Nguyen	server : clean up built-in template detection (#11026)
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp

commit	5896c65232c7dc87d78426956b16f63fbf58dcf6	bc7b1f86324279a3dabb705c04ad754a2b27df16	2024-12-31T12:34:13+01:00	Xuan Son Nguyen	server : add OAI compat for /v1/completions (#10974)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_completion.py
M	examples/server/utils.hpp

commit	bc7b1f86324279a3dabb705c04ad754a2b27df16	6e1531aca5ed17f078973b4700fcdadbda4a34a5	2024-12-31T19:04:48+08:00	ymcki	convert : fix Llama-3_1-Nemotron-51B rope settings (#11008)
M	convert_hf_to_gguf.py

commit	6e1531aca5ed17f078973b4700fcdadbda4a34a5	716bd6dec3e044e5c325386b5b0483392b24cefe	2024-12-31T11:46:06+11:00	Peter	common, examples, ggml : fix MSYS2 GCC compiler errors and warnings when building with LLAMA_CURL=ON and GGML_OPENCL=ON (#11013)
M	common/common.cpp
M	examples/run/run.cpp
M	ggml/src/ggml-opencl/ggml-opencl.cpp

commit	716bd6dec3e044e5c325386b5b0483392b24cefe	c250ecb3157f3bae0a45f44c3c953b5414d4c2f7	2024-12-30T11:27:11-06:00	Jeff Bolz	vulkan: optimize mul_mat for small values of N (#10991)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp
M	tests/test-backend-ops.cpp

commit	c250ecb3157f3bae0a45f44c3c953b5414d4c2f7	a813badbbdf0d38705f249df7a0c99af5cdee678	2024-12-30T20:35:13+08:00	ag2s20150909	android : fix llama_batch free (#11014)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp

commit	a813badbbdf0d38705f249df7a0c99af5cdee678	fdd21889123bec62b1db3b2fc22b5a4abab32174	2024-12-29T03:16:34-06:00	Jeff Bolz	vulkan: im2col and matmul optimizations for stable diffusion (#10942)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	tests/test-backend-ops.cpp

commit	fdd21889123bec62b1db3b2fc22b5a4abab32174	f865ea149d71ef883e3780fced8a20a1464eccf4	2024-12-29T02:35:11-06:00	Jeff Bolz	vulkan: Use push constant offset to handle misaligned descriptors (#10987)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/acc.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/add.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/clamp.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/concat.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/contig_copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/copy.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/cos.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/div.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/pad.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/repeat.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/scale.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/sin.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/square.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp

commit	f865ea149d71ef883e3780fced8a20a1464eccf4	16cdce7b68218959e0658e2f95b4572573d5008e	2024-12-28T10:09:19-05:00	Isaac McFadyen	server: added more docs for response_fields field (#10995)
M	examples/server/README.md

commit	16cdce7b68218959e0658e2f95b4572573d5008e	d79d8f39b4da6deca4aea8bf130c6034c482b320	2024-12-28T15:08:54Z	Alexey Parfenov	server : fix token duplication when streaming with stop strings (#10997)
M	examples/server/server.cpp

commit	d79d8f39b4da6deca4aea8bf130c6034c482b320	d283d02bf254a7f2991e1502066330cc0d4321a6	2024-12-26T10:54:44-05:00	Eve	vulkan: multi-row k quants (#10846)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp

commit	d283d02bf254a7f2991e1502066330cc0d4321a6	9ba399dfa7f115effc63d48e6860a94c9faa31b2	2024-12-27T00:59:11+11:00	Peter	examples, ggml : fix GCC compiler warnings (#10983)
M	examples/cvector-generator/mean.hpp
M	examples/cvector-generator/pca.hpp
M	examples/export-lora/export-lora.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9ba399dfa7f115effc63d48e6860a94c9faa31b2	2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d	2024-12-24T21:33:04+01:00	Reza Kakhki	server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967)
M	examples/server/CMakeLists.txt
M	examples/server/server.cpp
M	examples/server/tests/unit/test_embedding.py
M	examples/server/utils.hpp

commit	2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d	09fe2e76137dde850b13313f720e7ffa17efdefa	2024-12-24T18:54:49+01:00	Djip007	ggml : more perfo with llamafile tinyblas on x86_64 (#10714)
M	examples/server/tests/unit/test_completion.py
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.h
M	scripts/compare-llama-bench.py
M	scripts/hf.sh

commit	09fe2e76137dde850b13313f720e7ffa17efdefa	30caac3a68a54de8396b21e20ba972554c587230	2024-12-24T19:39:49+03:00	NeverLucky	server:  allow filtering llama server response fields (#10940)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_completion.py
M	examples/server/utils.hpp

commit	30caac3a68a54de8396b21e20ba972554c587230	60cfa728e27c28537657d4e627ed432508eb9537	2024-12-24T09:44:20+02:00	Georgi Gerganov	llama : the WPM vocabs use the CLS token as BOS (#10930)
M	src/llama-vocab.cpp
M	src/llama-vocab.h

commit	60cfa728e27c28537657d4e627ed432508eb9537	3327bb0f8dea381118f8e66c18ea14db56d3b942	2024-12-24T04:05:27+01:00	Diego Devesa	ggml : use wstring for backend search paths (#10960)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	3327bb0f8dea381118f8e66c18ea14db56d3b942	32d6ee6385b3fc908b283f509b845f757a6e7206	2024-12-24T04:05:17+01:00	Diego Devesa	ggml : fix arm enabled features check (#10961)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	32d6ee6385b3fc908b283f509b845f757a6e7206	14b699ecde8f1e9e251ebff9eca39ebc5603b83b	2024-12-23T20:25:52+01:00	Diego Devesa	ggml : fix const usage in SSE path (#10962)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	14b699ecde8f1e9e251ebff9eca39ebc5603b83b	485dc01214f266afff7004bc702498b491abc404	2024-12-23T12:52:25+01:00	Xuan Son Nguyen	server : fix missing model id in /model endpoint (#10957)
M	examples/server/server.cpp

commit	485dc01214f266afff7004bc702498b491abc404	86bf31cfe684849157f0875b4f0ebccac7034547	2024-12-23T12:02:44+01:00	Xuan Son Nguyen	server : add system_fingerprint to chat/completion (#10917)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/utils.hpp

commit	86bf31cfe684849157f0875b4f0ebccac7034547	b92a14a841fb4dfaf27b29d982ec8ba5289a3bff	2024-12-23T10:39:30+02:00	Radoslav Gerganov	rpc-server : add support for the SYCL backend (#10934)
M	examples/rpc/rpc-server.cpp

commit	b92a14a841fb4dfaf27b29d982ec8ba5289a3bff	6f0c9e034bb398915a6617ee4acc62adb87d387d	2024-12-23T08:35:44+08:00	Yun Dou	llama : support InfiniAI Megrez 3b (#10893)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	6f0c9e034bb398915a6617ee4acc62adb87d387d	dab76c92cc63072d9495ba87f2f3f3a4872d4f57	2024-12-23T08:22:33+08:00	ymcki	llama : support for Llama-3_1-Nemotron-51B (#10669)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	dab76c92cc63072d9495ba87f2f3f3a4872d4f57	7024d59e6a572730626cb11896829d115043a1b1	2024-12-23T00:21:40Z	Eric Curtin	llama-run : include temperature option (#10899)
M	examples/run/README.md
M	examples/run/run.cpp

commit	7024d59e6a572730626cb11896829d115043a1b1	7c0e28585843b366864b43b48f92425e2ea17df6	2024-12-22T16:20:11-08:00	yuri@FreeBSD	ggml : fix run-time on FreeBSD in get_executable_path() (#10948)
M	ggml/src/ggml-backend-reg.cpp

commit	7c0e28585843b366864b43b48f92425e2ea17df6	7ae33a616f44ecc081f3dcb589be20962d1d4a92	2024-12-22T21:22:58-01:00	Rudi Servo	devops : add docker-multi-stage builds (#10832)
A	.devops/cpu.Dockerfile
A	.devops/cuda.Dockerfile
D	.devops/full-cuda.Dockerfile
D	.devops/full-musa.Dockerfile
D	.devops/full-rocm.Dockerfile
D	.devops/full.Dockerfile
A	.devops/intel.Dockerfile
D	.devops/llama-cli-cuda.Dockerfile
D	.devops/llama-cli-intel.Dockerfile
D	.devops/llama-cli-musa.Dockerfile
D	.devops/llama-cli-rocm.Dockerfile
D	.devops/llama-cli-vulkan.Dockerfile
D	.devops/llama-cli.Dockerfile
D	.devops/llama-server-cuda.Dockerfile
D	.devops/llama-server-intel.Dockerfile
D	.devops/llama-server-musa.Dockerfile
D	.devops/llama-server-rocm.Dockerfile
D	.devops/llama-server-vulkan.Dockerfile
D	.devops/llama-server.Dockerfile
A	.devops/musa.Dockerfile
A	.devops/rocm.Dockerfile
A	.devops/vulkan.Dockerfile
M	.github/workflows/docker.yml

commit	7ae33a616f44ecc081f3dcb589be20962d1d4a92	ebdee9478ca7ba65497b9b96f7457698c6ee5115	2024-12-23T01:09:58+03:00	Billel Mokeddem	llama : add Falcon3 support (#10883)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama.cpp

commit	ebdee9478ca7ba65497b9b96f7457698c6ee5115	5cd85b5e008de2ec398d6596e240187d627561e3	2024-12-22T03:44:01-06:00	Jeff Bolz	vulkan: build fixes for 32b (#10927)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	5cd85b5e008de2ec398d6596e240187d627561e3	a91a41364b25705dbb81ae996bc35c3440c63b35	2024-12-21T10:10:18+02:00	Georgi Gerganov	convert : add BertForMaskedLM (#10919)
M	convert_hf_to_gguf.py

commit	a91a41364b25705dbb81ae996bc35c3440c63b35	e34c5af43f941f0ddb92466776339897295aca11	2024-12-21T01:04:45-06:00	Jeff Bolz	vulkan: optimize coopmat2 dequant functions (#10855)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp

commit	e34c5af43f941f0ddb92466776339897295aca11	eb5c3dc64bd967f2e23c87d9dec195f45468de60	2024-12-21T00:33:37+01:00	Adrien Gallouët	ggml-cpu: replace NEON asm with intrinsics in ggml_gemv_q4_0_4x8_q8_0() (#10874)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	eb5c3dc64bd967f2e23c87d9dec195f45468de60	0ca416c91aea4549d9c77e3efeca403e15aa6c75	2024-12-20T21:01:28+05:30	Akarshan Biswas	SYCL: Migrate away from deprecated ggml_tensor->backend (#10840)
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	0ca416c91aea4549d9c77e3efeca403e15aa6c75	21ae3b9be83820565d1a720999b7f63ce95b4920	2024-12-20T14:12:06+01:00	Xuan Son Nguyen	server : (UI) fix copy to clipboard function (#10916)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/main.js

commit	21ae3b9be83820565d1a720999b7f63ce95b4920	0a11f8b7b5c39fdf6e91ef9674bc68ff08681af7	2024-12-20T13:31:28+01:00	Diego Devesa	ggml : add test for SVE and disable when it fails (#10906)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	0a11f8b7b5c39fdf6e91ef9674bc68ff08681af7	d408bb9268a988c5a60a5746d3a6430386e7604d	2024-12-20T17:44:58+08:00	Molly Sophia	convert : fix RWKV v6 model conversion (#10913)
M	common/arg.cpp
M	convert_hf_to_gguf.py

commit	d408bb9268a988c5a60a5746d3a6430386e7604d	5cab3e4aaa892df4620b720f20a503a1bbbe7a52	2024-12-19T18:47:15+02:00	Georgi Gerganov	clip : disable GPU support (#10896)
M	examples/llava/clip.cpp

commit	5cab3e4aaa892df4620b720f20a503a1bbbe7a52	36319dec5d75a7dfe3e3de37b9ca2a76cd52b7b2	2024-12-19T17:42:13+02:00	Georgi Gerganov	llama : minor grammar refactor (#10897)
M	examples/gbnf-validator/gbnf-validator.cpp
M	src/llama-grammar.cpp
M	src/llama-grammar.h
M	tests/test-grammar-integration.cpp
M	tests/test-llama-grammar.cpp

commit	36319dec5d75a7dfe3e3de37b9ca2a76cd52b7b2	57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e	2024-12-19T17:35:15+02:00	Georgi Gerganov	tts : small QoL for easy model fetch (#10903)
M	common/arg.cpp

commit	57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e	a3c33b1dce2d4f25040b75f66629104bd1e40128	2024-12-19T15:40:08+01:00	Xuan Son Nguyen	server : fix logprobs, make it OAI-compatible (#10783)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_completion.py
M	examples/server/tests/unit/test_embedding.py
M	examples/server/utils.hpp

commit	a3c33b1dce2d4f25040b75f66629104bd1e40128	2fffc52b50992ac5bc64db19d33c39cbc06f52cf	2024-12-19T14:20:41+01:00	Adrien Gallouët	ggml: fix arm build with gcc (#10895)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	2fffc52b50992ac5bc64db19d33c39cbc06f52cf	7585edbdebd02861e0994dae67c9338731fb3fc5	2024-12-19T06:04:51-07:00	Sukriti Sharma	llama : fix Roberta embeddings (#10856)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	7585edbdebd02861e0994dae67c9338731fb3fc5	cd920d0ac38ec243605a5a57c50941140a193f9e	2024-12-19T10:37:12+01:00	fairydreaming	convert : Add support for Microsoft Phi-4 model  (#10817)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	cd920d0ac38ec243605a5a57c50941140a193f9e	7909e8588ddf70820adf1f325490eb3f67b32875	2024-12-19T08:53:58+01:00	Johannes Gäßler	tests: disable GGUF test for bad value size (#10886)
M	tests/test-gguf.cpp

commit	7909e8588ddf70820adf1f325490eb3f67b32875	9177484f589d770ffc4e655b9819124d6a22c1d9	2024-12-19T02:58:00Z	Eric Curtin	llama-run : improve progress bar (#10821)
M	README.md
M	examples/run/README.md
M	examples/run/run.cpp

commit	9177484f589d770ffc4e655b9819124d6a22c1d9	0bf2d10c5514ff61b99897a4a5054f846e384e1e	2024-12-18T23:21:42+01:00	Diego Devesa	ggml : fix arm build (#10890)
M	examples/llama.android/llama/build.gradle.kts
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	0bf2d10c5514ff61b99897a4a5054f846e384e1e	7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec	2024-12-18T19:27:21+02:00	Georgi Gerganov	tts : add OuteTTS support (#10784)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	examples/CMakeLists.txt
M	examples/llava/clip.cpp
A	examples/tts/CMakeLists.txt
A	examples/tts/convert_pt_to_hf.py
A	examples/tts/tts-outetts.py
A	examples/tts/tts.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	gguf-py/tests/test_quants.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec	152610eda91217ac409342cd976d05f5114ad39f	2024-12-18T04:00:07-10:00	Gaetan Bisson	server: avoid overwriting Authorization header (#10878)
M	examples/server/public/index.html.gz
M	examples/server/webui/src/main.js

commit	152610eda91217ac409342cd976d05f5114ad39f	0e70ba686e6c717a0aa41d88284e2a392c2bd0cd	2024-12-18T13:01:41+02:00	Georgi Gerganov	server : output embeddings for all tokens when pooling = none (#10861)
M	common/common.cpp
M	common/common.h
M	examples/gritlm/gritlm.cpp
M	examples/retrieval/retrieval.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_embedding.py
M	examples/server/tests/utils.py

commit	0e70ba686e6c717a0aa41d88284e2a392c2bd0cd	46828872c31b25df16169cbbf5c2225fa9cb0675	2024-12-18T11:05:29+02:00	Georgi Gerganov	server : add "tokens" output (#10853)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_completion.py

commit	46828872c31b25df16169cbbf5c2225fa9cb0675	6b064c92b4c0228e333193c167f2c98d2ec8d9bc	2024-12-18T09:55:09+01:00	Xuan Son Nguyen	server : (embeddings) using same format for "input" and "content" (#10872)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_embedding.py
M	examples/server/utils.hpp

commit	6b064c92b4c0228e333193c167f2c98d2ec8d9bc	4da69d1abd15263061aff94c10f205836a96a4bc	2024-12-18T00:35:00-08:00	redbeard	docs: Fix HIP (née hipBLAS) in README (#10880)
M	README.md

commit	4da69d1abd15263061aff94c10f205836a96a4bc	d62b532c52e0118323277eaa5f442e11ce6505ed	2024-12-18T01:36:46+01:00	Diego Devesa	Revert "llama : add Falcon3 support (#10864)" (#10876)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama.cpp

commit	d62b532c52e0118323277eaa5f442e11ce6505ed	081b29bd2a3d91e7772e3910ce223dd63b8d7d26	2024-12-17T17:24:22-05:00	DAN™	Use model->gguf_kv for loading the template instead of using the C API. (#10868)
M	src/llama.cpp

commit	081b29bd2a3d91e7772e3910ce223dd63b8d7d26	5437d4aaf5132c879acda0bb67f2f8f71da4c9fe	2024-12-17T19:09:35+01:00	Johannes Gäßler	tests: add tests for GGUF (#10830)
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c
M	tests/CMakeLists.txt
A	tests/test-gguf.cpp

commit	5437d4aaf5132c879acda0bb67f2f8f71da4c9fe	78f766768d94e9c8b30ce10ca76f568e710d84f7	2024-12-17T18:36:02+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	78f766768d94e9c8b30ce10ca76f568e710d84f7	8dd19a48129d578972ea3d98896edbbf492891a9	2024-12-17T18:34:32+02:00	Georgi Gerganov	cmake : fix "amd64" processor string (whisper/2638)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	8dd19a48129d578972ea3d98896edbbf492891a9	130d0c90bd26b25e3a713b17a61a5d4eb0a66405	2024-12-16T19:34:38+09:00	gn64	vulkan : fix soft_max.comp division by zero (whisper/2633)
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp

commit	130d0c90bd26b25e3a713b17a61a5d4eb0a66405	3919da8e335dbfd0741d239932a9b9e72061bf27	2024-12-14T03:23:08+01:00	Daniel Bevenius	ggml : remove return from ggml_gallocr_allocate_node (ggml/1048)
M	ggml/src/ggml-alloc.c

commit	3919da8e335dbfd0741d239932a9b9e72061bf27	0006f5a74a59945f22ff966e723c3d566b3ca8d0	2024-12-13T08:19:38+01:00	Daniel Bevenius	ggml : add check for grad_accs (ggml/1046)
M	ggml/src/ggml.c

commit	0006f5a74a59945f22ff966e723c3d566b3ca8d0	05c3a444b8b017b01b366b725ba22c740aae6b38	2024-12-17T18:35:42+02:00	Georgi Gerganov	ggml : update ggml_backend_cpu_device_supports_op (#10867)
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	tests/test-backend-ops.cpp

commit	05c3a444b8b017b01b366b725ba22c740aae6b38	382bc7f2e8ffd0b89f23e840d097e21f301197ba	2024-12-17T16:00:24Z	krystiancha	server : fill usage info in embeddings and rerank responses (#10852)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_embedding.py
M	examples/server/tests/unit/test_rerank.py
M	examples/server/utils.hpp

commit	382bc7f2e8ffd0b89f23e840d097e21f301197ba	4f51968aca049080dc77e26603aa0681ea77fe45	2024-12-17T19:24:56+04:00	Billel Mokeddem	llama : add Falcon3 support (#10864)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	src/llama.cpp

commit	4f51968aca049080dc77e26603aa0681ea77fe45	227d7c5a7f4cc7734fde8a4ef4382d613486d3c8	2024-12-17T17:47:20+08:00	Ruan	readme : update typos (#10863)
M	README.md

commit	227d7c5a7f4cc7734fde8a4ef4382d613486d3c8	7b1ec53f56bb72c49e4c8434157895f94d3709c2	2024-12-17T09:52:09+01:00	Xuan Son Nguyen	server : (UI) fix missing async generator on safari (#10857)
M	examples/server/public/index.html.gz
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
M	examples/server/webui/src/main.js

commit	7b1ec53f56bb72c49e4c8434157895f94d3709c2	160bc039c862c10b9938269a90ddb09d794a7b0d	2024-12-17T05:52:55Z	Eve	vulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809)
M	.github/workflows/build.yml
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	160bc039c862c10b9938269a90ddb09d794a7b0d	08ea539df211e46bb4d0dd275e541cb591d5ebc8	2024-12-17T05:00:46+08:00	Zhiyuan Li	rwkv6: add wkv6 support for Vulkan backend (#10829)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/wkv6.comp

commit	08ea539df211e46bb4d0dd275e541cb591d5ebc8	644fd71b44c4cdbfc6482fbf0353d289c3bc29e6	2024-12-16T12:31:45+02:00	Georgi Gerganov	unicode : improve naming style (#10838)
M	src/llama-vocab.cpp
M	src/unicode.cpp
M	src/unicode.h

commit	644fd71b44c4cdbfc6482fbf0353d289c3bc29e6	4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4	2024-12-16T12:31:14+02:00	Georgi Gerganov	sampling : refactor + optimize penalties sampler (#10803)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/batched/batched.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/public/index.html.gz
M	examples/server/public_legacy/index-new.html
M	examples/server/public_legacy/index.html
M	examples/server/server.cpp
M	examples/server/themes/buttons-top/index.html
M	examples/server/themes/wild/index.html
M	examples/server/webui/src/main.js
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4	a0974156f334acf8af5858d7ede5ab7d7490d415	2024-12-15T15:43:25-05:00	Bartowski	llava : Allow locally downloaded models for QwenVL (#10833)
M	examples/llava/qwen2_vl_surgery.py

commit	a0974156f334acf8af5858d7ede5ab7d7490d415	87cf323cef80f6aa530f047ab05b539ebc6b7e3c	2024-12-16T00:02:46+07:00	Valentin Mamedov	llama : add Deepseek MoE v1 & GigaChat models (#10827)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	87cf323cef80f6aa530f047ab05b539ebc6b7e3c	5478bbcd173e7027af7689493c7421719f5c43df	2024-12-15T18:44:47+02:00	Georgi Gerganov	scripts : change build path to "build-bench" for compare-commits.sh (#10836)
M	scripts/compare-commits.sh

commit	5478bbcd173e7027af7689493c7421719f5c43df	b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457	2024-12-15T05:55:54-06:00	Vinesh Janarthanan	server: (UI) add syntax highlighting and latex math rendering (#10808)
M	examples/server/CMakeLists.txt
D	examples/server/public/index.html
A	examples/server/public/index.html.gz
M	examples/server/server.cpp
M	examples/server/webui/index.html
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
A	examples/server/webui/public/demo-conversation.json
A	examples/server/webui/src/highlight-config.js
A	examples/server/webui/src/katex-gpt.js
M	examples/server/webui/src/main.js
D	examples/server/webui/src/styles.css
A	examples/server/webui/src/styles.scss
M	examples/server/webui/vite.config.js

commit	b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457	89d604f2c87af9db657d8a27a1528bc4b7579c29	2024-12-15T13:16:42+02:00	Georgi Gerganov	gguf-py : bump to v0.13.0
M	gguf-py/pyproject.toml

commit	89d604f2c87af9db657d8a27a1528bc4b7579c29	e52aba537a34d51a65cddec6bc6dafc9031edc63	2024-12-14T22:29:45Z	Michelle Tan	server: Fix `has_next_line` in JSON response (#10818)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_completion.py
M	examples/server/utils.hpp

commit	e52aba537a34d51a65cddec6bc6dafc9031edc63	ba1cb19cdd0d92e012e0f6e009e0620f854b6afd	2024-12-14T18:17:36Z	Evgeny Kurnevsky	nix: allow to override rocm gpu targets (#10794)
M	.devops/nix/package.nix

commit	ba1cb19cdd0d92e012e0f6e009e0620f854b6afd	56eea0781cbd2608ed8ff524955495569b9264be	2024-12-14T20:43:46+08:00	HimariO	llama : add Qwen2VL support + multimodal RoPE (#10361)
M	Makefile
M	README.md
M	convert_hf_to_gguf.py
M	examples/llava/CMakeLists.txt
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
A	examples/llava/qwen2_vl_surgery.py
A	examples/llava/qwen2vl-cli.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-kompute/ggml-kompute.cpp
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	include/llama.h
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-rope.cpp

commit	56eea0781cbd2608ed8ff524955495569b9264be	a76c56fa1a3d27467eb97468d8c3b2fe1243b61a	2024-12-13T23:21:49+01:00	cduk	Removes spurious \r in output that causes logging in journalctl to treat lines as binary and therefore hidden by default (#10771)
M	examples/server/server.cpp

commit	a76c56fa1a3d27467eb97468d8c3b2fe1243b61a	c27ac678dd393af0da9b8acf10266e760c8a0912	2024-12-13T12:23:52-08:00	lhez	Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
M	.github/workflows/build.yml
M	ggml/CMakeLists.txt
A	ggml/include/ggml-opencl.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
A	ggml/src/ggml-opencl/CMakeLists.txt
A	ggml/src/ggml-opencl/ggml-opencl.cpp
A	ggml/src/ggml-opencl/kernels/embed_kernel.py
A	ggml/src/ggml-opencl/kernels/ggml-opencl.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_cvt.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_gemv_noshuffle_general.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_mm.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_mul_mat_Ab_Bi_8x4.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_16.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_32.cl
A	ggml/src/ggml-opencl/kernels/ggml-opencl_transpose_32_16.cl

commit	c27ac678dd393af0da9b8acf10266e760c8a0912	11e07fd63bac1cb642380a7a3eac03fd8703e948	2024-12-13T18:34:25Z	Eric Curtin	Opt class for positional argument handling (#10508)
M	README.md
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
M	examples/run/CMakeLists.txt
M	examples/run/README.md
M	examples/run/run.cpp

commit	11e07fd63bac1cb642380a7a3eac03fd8703e948	4601a8bb6784d2ab8b4b605354b51979fbeea1d3	2024-12-13T18:23:50+01:00	Corentin REGAL	fix: graceful shutdown for Docker images (#10815)
M	.devops/tools.sh

commit	4601a8bb6784d2ab8b4b605354b51979fbeea1d3	9f35e44592a7646a5803620eb6a3f0ed5ac90553	2024-12-13T15:48:44+01:00	Jett Janiak	gguf-py : numpy 2 newbyteorder fix (#9772)
M	gguf-py/gguf/gguf_reader.py

commit	9f35e44592a7646a5803620eb6a3f0ed5ac90553	64ae0655114f84f11a724bc6878c6f8f4a55560b	2024-12-13T12:56:07Z	谢乃闻	Fix crash caused by ggml_backend_load_all when launching on Android Activity (#10812)
M	ggml/src/ggml-backend-reg.cpp

commit	64ae0655114f84f11a724bc6878c6f8f4a55560b	83ed24a97b500ccdb32b90b94e6f9621ad8db79e	2024-12-13T08:42:04Z	Eve	vulkan: small mul_mat_vec optimizations (#10665)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp

commit	83ed24a97b500ccdb32b90b94e6f9621ad8db79e	d583cd03f663701858ba152a334cbb467fabe342	2024-12-13T12:12:15+05:30	Akarshan Biswas	SYCL: Reduce most of the compiler warnings (#10748)
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/concat.cpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/element_wise.cpp
M	ggml/src/ggml-sycl/gemm.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/im2col.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-sycl/softmax.cpp
M	ggml/src/ggml-sycl/tsembd.cpp
M	ggml/src/ggml-sycl/wkv6.cpp

commit	d583cd03f663701858ba152a334cbb467fabe342	adffa6ffd59997da59f62b72d2b79fc37e085e84	2024-12-13T01:04:19+01:00	Karol Kontny	ggml : Fix compilation issues on ARM platform when building without fp16 (#10811)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	adffa6ffd59997da59f62b72d2b79fc37e085e84	274ec65af6e54039eb95cb44904af5c945dca1fa	2024-12-12T22:53:05+01:00	Xuan Son Nguyen	common : improve -ctv -ctk CLI arguments (#10806)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
M	examples/server/README.md

commit	274ec65af6e54039eb95cb44904af5c945dca1fa	8faa1d4dd42f6cb26088ce7f5bbca5996b921685	2024-12-12T20:52:28+01:00	Xuan Son Nguyen	contrib : add ngxson as codeowner (#10804)
M	CODEOWNERS

commit	8faa1d4dd42f6cb26088ce7f5bbca5996b921685	cb13ef85a444eb52a3f1b82dce198ceb25606583	2024-12-13T02:09:50+08:00	a3sh	CUDA: faster non-contiguous concat (#10760)
M	ggml/src/ggml-cuda/concat.cu

commit	cb13ef85a444eb52a3f1b82dce198ceb25606583	4064c0e3b6c27440f5d12b7caaf90b4088c28c61	2024-12-12T19:02:49+01:00	Diego Devesa	remove CMAKE_WINDOWS_EXPORT_ALL_SYMBOLS (#10797)
M	examples/CMakeLists.txt
M	examples/gguf-split/gguf-split.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/retrieval/retrieval.cpp
M	examples/tokenize/tokenize.cpp
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/amx.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-threading.h
M	src/CMakeLists.txt
M	src/llama.cpp
M	tests/CMakeLists.txt

commit	4064c0e3b6c27440f5d12b7caaf90b4088c28c61	dc5301d565b7d0b2c691f7df13099aab3997479c	2024-12-12T18:36:00+01:00	0cc4m	Vulkan: Use improved q4_k and q5_k dequant code in dequant shaders (#10798)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_k.comp

commit	dc5301d565b7d0b2c691f7df13099aab3997479c	9fdb1243049aa7e8211693f116daf2052d47507d	2024-12-12T18:35:37+01:00	0cc4m	Vulkan: Add VK_EXT_subgroup_size_control support to ensure full subgroups for coopmats (#10721)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	9fdb1243049aa7e8211693f116daf2052d47507d	5555c0c1f66d766c544c30699190dec0285bcbfc	2024-12-12T16:57:32+01:00	Xuan Son Nguyen	common : add missing env var for speculative (#10801)
M	common/arg.cpp

commit	5555c0c1f66d766c544c30699190dec0285bcbfc	973f328b1e92a6406030442dfd15b29449e89747	2024-12-11T22:40:40Z	CentricStorm	docs: update server streaming mode documentation (#9519)
M	examples/server/README.md

commit	973f328b1e92a6406030442dfd15b29449e89747	235f6e14bf0ed0211c51aeff14139038ae1000aa fb18934a97425c42c8b32a1baaa94f0080eb051d	2024-12-11T23:14:46+02:00	Georgi Gerganov	Merge pull request #10788 from ggerganov/gg/gguf-py-0.11.0
commit	fb18934a97425c42c8b32a1baaa94f0080eb051d	235f6e14bf0ed0211c51aeff14139038ae1000aa	2024-12-11T23:13:31+02:00	Georgi Gerganov	gguf-py : bump version to 0.11.0
M	gguf-py/pyproject.toml

commit	235f6e14bf0ed0211c51aeff14139038ae1000aa	1a31d0dc00ba946d448e16ecc915ce5e8355994e	2024-12-11T20:52:14+01:00	Xuan Son Nguyen	server : (UI) add tok/s, get rid of completion.js (#10786)
M	examples/server/public/index.html
M	examples/server/webui/index.html
M	examples/server/webui/package-lock.json
M	examples/server/webui/package.json
D	examples/server/webui/src/completion.js
M	examples/server/webui/src/main.js

commit	1a31d0dc00ba946d448e16ecc915ce5e8355994e	92f77a640f763c0af73554fb810a85a7d4c85e5e	2024-12-11T07:16:32-08:00	qingy1337	Update README.md (#10772)
M	examples/quantize/README.md

commit	92f77a640f763c0af73554fb810a85a7d4c85e5e	484d2f31aed34ff9f096e3961125762e81d9b7d6	2024-12-11T14:59:41+01:00	Xuan Son Nguyen	ci : pin nodejs to 22.11.0 (#10779)
M	.github/workflows/server.yml

commit	484d2f31aed34ff9f096e3961125762e81d9b7d6	4b4d92b0986e3b627b9a9ef4782973108bf47691	2024-12-11T22:48:04+09:00	kallewoof	bug-fix: snprintf prints NULL in place of the last character (#10419)
M	examples/server/utils.hpp
M	include/llama.h

commit	4b4d92b0986e3b627b9a9ef4782973108bf47691	43041d2eb32623d5b6ca734313327abe96f73146	2024-12-11T10:47:43Z	CentricStorm	docs: fix server documentation formatting (#10776)
M	examples/server/README.md

commit	43041d2eb32623d5b6ca734313327abe96f73146	b685daf3867c54e42a9db484d7b92619021d4510	2024-12-11T02:47:21+02:00	Gilad S.	ggml: load all backends from a user-provided search path (#10699)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-backend-reg.cpp

commit	b685daf3867c54e42a9db484d7b92619021d4510	dafae66cc242eb766797194d3c85c5e502625623	2024-12-10T14:23:17-06:00	Jeff Bolz	vulkan: request round-to-even for fp16 in im2col/rope_head (#10767)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	dafae66cc242eb766797194d3c85c5e502625623	ae4b922614d452477cf5d2fb8cad247c9c12596c	2024-12-10T19:33:23Z	Eve	vulkan: dynamic subgroup size for the remaining k quants (#10745)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp

commit	ae4b922614d452477cf5d2fb8cad247c9c12596c	750cb3e246f7e544124cf18cb0c5e0c8b7e38738	2024-12-10T12:23:50-05:00	Bartowski	imatrix : Add imatrix to --no-context-shift (#10766)
M	common/arg.cpp

commit	750cb3e246f7e544124cf18cb0c5e0c8b7e38738	a86ad841f103e471ac0fd7ee8852d1eb5015ce89	2024-12-10T18:23:24+01:00	Andreas Kieslinger	CUDA: rename macros to avoid conflicts with WinAPI (#10736)
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/convert.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/sum.cu

commit	a86ad841f103e471ac0fd7ee8852d1eb5015ce89	a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918	2024-12-10T17:22:34Z	Yüg	server : add flag to disable the web-ui (#10762) (#10751)
M	common/arg.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_basic.py
M	examples/server/tests/utils.py

commit	a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918	26a8406ba9198eb6fdd8329fa717555b4f77f05f	2024-12-10T11:22:20-06:00	Jeff Bolz	vulkan: disable spirv-opt for coopmat shaders (#10763)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	26a8406ba9198eb6fdd8329fa717555b4f77f05f	c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b6	2024-12-09T20:07:12+01:00	Johannes Gäßler	CUDA: fix shared memory access condition for mmv (#10740)
M	ggml/src/ggml-cuda/mmv.cu

commit	c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b6	3d98b4cb226c3140bd1ae6c65ed126b7d90332fa	2024-12-09T23:10:19+05:30	Srihari-mcw	Changes to CMakePresets.json to add ninja clang target on windows (#10668)
M	CMakePresets.json
A	cmake/x64-windows-llvm.cmake
M	docs/build.md

commit	3d98b4cb226c3140bd1ae6c65ed126b7d90332fa	1a05004743e00aca400833be625f0ec8cce176a7	2024-12-09T01:24:01-06:00	Jeff Bolz	vulkan: fix compile warnings (#10731)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	1a05004743e00aca400833be625f0ec8cce176a7	ce8784bdb153ff7794dde5a50b0ebfa51baa6171	2024-12-09T09:15:13+02:00	Borislav Stanimirov	cmake : simplify msvc charsets (#10672)
M	CMakeLists.txt

commit	ce8784bdb153ff7794dde5a50b0ebfa51baa6171	e52522b8694ae73abf12feb18d29168674aa1c1b	2024-12-08T23:04:29+01:00	Xuan Son Nguyen	server : fix format_infill (#10724)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_infill.py
M	examples/server/tests/utils.py

commit	e52522b8694ae73abf12feb18d29168674aa1c1b	06d70147e6480c021e493c442ae0f0d83ae366de	2024-12-08T20:38:51+01:00	Xuan Son Nguyen	server : bring back info of final chunk in stream mode (#10722)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_completion.py

commit	06d70147e6480c021e493c442ae0f0d83ae366de	43ed389a3f102517e6f7d5620d8e451e88afbf27	2024-12-08T19:19:19+01:00	stduhpf	Vulkan: fix NaN in tanh.comp with AMD proprietary driver on Windows (#10723)
M	ggml/src/ggml-vulkan/vulkan-shaders/tanh.comp

commit	43ed389a3f102517e6f7d5620d8e451e88afbf27	ecc93d0558fc3ecb8a5af69d2ece02fae4710ade	2024-12-08T12:14:54+01:00	Diego Devesa	llama : use cmake for swift build (#10525)
M	.github/workflows/build.yml
M	Package.swift
A	Sources/llama/llama.h
A	Sources/llama/module.modulemap
M	cmake/llama.pc.in
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj

commit	ecc93d0558fc3ecb8a5af69d2ece02fae4710ade	62e84d984875372f4b0fb89a67658e012ff0cc9f	2024-12-08T02:05:55-06:00	Jeff Bolz	vulkan: compile a test shader in cmake to check for coopmat2 support (#10713)
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
A	ggml/src/ggml-vulkan/vulkan-shaders/test_coopmat2_support.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	62e84d984875372f4b0fb89a67658e012ff0cc9f	3573fa8e7b7f0865638b52b4e9b4d2006f0558a2	2024-12-07T16:12:27-05:00	Robert Collins	llama : add 128k yarn context for Qwen (#10698)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py

commit	3573fa8e7b7f0865638b52b4e9b4d2006f0558a2	d9c3ba2b7749c00df477599aa141a98b4521aa2c	2024-12-07T20:21:09+01:00	Xuan Son Nguyen	server : (refactor) no more json in server_task input (#10691)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_basic.py
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/utils.py
M	examples/server/utils.hpp

commit	d9c3ba2b7749c00df477599aa141a98b4521aa2c	ce4a7b849388b67d45ad420bdd82d5efcd55647a	2024-12-07T18:38:15+02:00	Georgi Gerganov	ggml : disable iq4_nl interleave size 8 (#10709)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp

commit	ce4a7b849388b67d45ad420bdd82d5efcd55647a	19d8762ab61df8286367588a80b9c7db4cb568db	2024-12-07T18:02:05+02:00	Georgi Gerganov	server : various fixes (#10704)
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	19d8762ab61df8286367588a80b9c7db4cb568db	c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b	2024-12-07T13:37:50+01:00	Djip007	ggml : refactor online repacking (#10446)
M	Makefile
M	Package.swift
M	docs/build.md
M	examples/quantize/README.md
M	examples/quantize/quantize.cpp
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
D	ggml/src/ggml-aarch64.c
D	ggml/src/ggml-aarch64.h
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/amx.cpp
M	ggml/src/ggml-cpu/amx/amx.h
M	ggml/src/ggml-cpu/amx/common.h
M	ggml/src/ggml-cpu/amx/mmq.cpp
M	ggml/src/ggml-cpu/amx/mmq.h
R085	ggml/src/ggml-cpu/ggml-cpu-aarch64.c	ggml/src/ggml-cpu/ggml-cpu-aarch64.cpp
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
A	ggml/src/ggml-cpu/ggml-cpu-hbm.cpp
A	ggml/src/ggml-cpu/ggml-cpu-hbm.h
A	ggml/src/ggml-cpu/ggml-cpu-traits.cpp
A	ggml/src/ggml-cpu/ggml-cpu-traits.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama.cpp

commit	c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b	3df784b3050f657ea681f804187ce5bddb433e88	2024-12-07T11:52:44+02:00	Georgi Gerganov	server : fix free of spec context and batch (#10651)
M	common/speculative.cpp
M	examples/server/server.cpp

commit	3df784b3050f657ea681f804187ce5bddb433e88	86a1934978ce5daffc7e5b4251f6540ee5e7b47b	2024-12-07T10:24:15+01:00	0cc4m	Vulkan: VK_KHR_cooperative_matrix support to speed up prompt processing (#10597)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	86a1934978ce5daffc7e5b4251f6540ee5e7b47b	784a14aa496a66cc43e76014a1bf4333b4a2a55a	2024-12-07T01:55:01-06:00	Robert Ormandi	metal : Extend how Llama.cpp locates metal resources (#10676)
M	ggml/src/ggml-metal/ggml-metal.m

commit	784a14aa496a66cc43e76014a1bf4333b4a2a55a	c5ede3849fc021174862f9c0bf8273808d8f0d39	2024-12-07T00:02:14-07:00	Sukriti Sharma	convert : add support for Roberta embeddings (#10695)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
A	models/ggml-vocab-roberta-bpe.gguf.inp
A	models/ggml-vocab-roberta-bpe.gguf.out

commit	c5ede3849fc021174862f9c0bf8273808d8f0d39	f162d45a21b27f7613f14539f9a4932d6ff3ca48	2024-12-06T21:33:15+02:00	Georgi Gerganov	convert : add custom attention mapping
M	gguf-py/gguf/tensor_mapping.py

commit	f162d45a21b27f7613f14539f9a4932d6ff3ca48	6c5bc0625fae6909cb40def15bc4bb45db6f7f4d	2024-12-06T13:29:05+01:00	Xuan Son Nguyen	common : bring back --no-warmup to server (#10686)
M	common/arg.cpp

commit	6c5bc0625fae6909cb40def15bc4bb45db6f7f4d	7736837d62efed1dbebfe579472fca041eda12d6	2024-12-06T11:14:32+01:00	Xuan Son Nguyen	server : (refactoring) do not rely on JSON internally (#10643)
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/README.md
M	examples/server/tests/tests.sh
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_completion.py
M	examples/server/utils.hpp

commit	7736837d62efed1dbebfe579472fca041eda12d6	c9c6e01daedac542b174c235872569fce5385982	2024-12-05T23:36:41+02:00	Plamen Minev	fix(server) : not show alert when DONE is received (#10674)
M	examples/server/public_simplechat/simplechat.js

commit	c9c6e01daedac542b174c235872569fce5385982	6fe624783166e7355cec915de0094e63cd3558eb	2024-12-05T13:15:05-06:00	Jeff Bolz	vulkan: Add VK_NV_cooperative_matrix2 support for mul_mat and flash attention (#10206)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
A	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
A	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm_cm2.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	6fe624783166e7355cec915de0094e63cd3558eb	0cd182ebcc2c45907240e727e80e8fbf0f5fdee9	2024-12-05T19:30:59+01:00	Riccardo Orlando	llama : add Minerva 7B model support (#10673)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	0cd182ebcc2c45907240e727e80e8fbf0f5fdee9	a8cbab201dcf4c76c30b8028427494d71f02bb57	2024-12-05T13:27:42+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a8cbab201dcf4c76c30b8028427494d71f02bb57	c2082d93a82d66dca112098c63775d7a97e6d47b	2024-12-04T09:19:30+01:00	PAB	ggml: add `GGML_SET` Metal kernel + i32 CPU kernel (ggml/1037)
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	c2082d93a82d66dca112098c63775d7a97e6d47b	d405804be84cfdac936f28b3446ce8cb988408d8	2024-12-03T20:20:04+01:00	PAB	ggml : add `GGML_PAD_REFLECT_1D` operation (ggml/1034)
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	d405804be84cfdac936f28b3446ce8cb988408d8	f112d198cd9953b633ac662c2705d6e423438717	2024-12-05T08:47:55+01:00	Daniel Bevenius	py : update outdated copy-paste instructions [no ci] (#10667)
M	convert_hf_to_gguf_update.py

commit	f112d198cd9953b633ac662c2705d6e423438717	1da7b765692764a8b33b08da61cbee63812a7bd9	2024-12-05T03:49:20+05:30	aryantandon01	Update deprecation-warning.cpp (#10619)
M	examples/deprecation-warning/deprecation-warning.cpp

commit	1da7b765692764a8b33b08da61cbee63812a7bd9	59f4db10883a4f3e855cffbf2c3ab68430e95272	2024-12-04T22:38:20+02:00	Georgi Gerganov	server : fix speculative decoding with context shift (#10641)
M	examples/server/server.cpp
M	examples/server/tests/unit/test_speculative.py

commit	59f4db10883a4f3e855cffbf2c3ab68430e95272	2803540814bf0a4e44d0960ff6afda6bac971c17	2024-12-04T14:45:40+01:00	Diego Devesa	ggml : add predefined list of CPU backend variants to build (#10626)
M	.devops/full.Dockerfile
M	.devops/llama-cli.Dockerfile
M	.devops/llama-server.Dockerfile
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/cpu-feats-x86.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
D	scripts/build-cpu.sh

commit	2803540814bf0a4e44d0960ff6afda6bac971c17	253b7fde910731104670724391bfbcb94d97d0c3	2024-12-04T14:40:44+01:00	Diego Devesa	ggml-cpu : fix HWCAP2_I8MM value (#10646)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	253b7fde910731104670724391bfbcb94d97d0c3	8d0cfd554a9ae545ff94d27e04458f537b4e8c0e	2024-12-04T09:45:48Z	ltoniazzi	Fix HF repo commit to clone lora test models (#10649)
M	tests/test-lora-conversion-inference.sh

commit	8d0cfd554a9ae545ff94d27e04458f537b4e8c0e	2759916d86b70e7aceaed4d0b4e7ed126f0f9e51	2024-12-04T17:42:50+08:00	JFLFY2255	llama: Support MiniCPM-1B (with & w/o longrope) (#10559)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama.cpp

commit	2759916d86b70e7aceaed4d0b4e7ed126f0f9e51	40c6d79fb52f995f47507fedfeaae2ac05d9b35c	2024-12-04T01:28:59-06:00	Jeff Bolz	vulkan: Implement "fast divide" (mul+shift) for unary ops like copy (#10642)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.comp
M	tests/test-backend-ops.cpp

commit	40c6d79fb52f995f47507fedfeaae2ac05d9b35c	98036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3	2024-12-04T02:29:20+01:00	Nicolò Scipione	SYCL : Move to compile time oneMKL interface backend selection for NVIDIA backend (#10584)
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-sycl/outprod.cpp

commit	98036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3	cd2f37b304f8e88b9de8424b31078b97f9cf7c60	2024-12-04T09:22:50+08:00	Wang Ran (汪然)	fix typo of README.md (#10605)
M	grammars/README.md

commit	cd2f37b304f8e88b9de8424b31078b97f9cf7c60	da6aac91f150a3b0bcc26d3fd50288accb15f179	2024-12-04T02:41:37+02:00	Frankie Robertson	Avoid using __fp16 on ARM with old nvcc (#10616)
M	ggml/src/ggml-impl.h

commit	da6aac91f150a3b0bcc26d3fd50288accb15f179	01e6d9bb71eb71fe1f811f2fdef15753232cd0f2	2024-12-03T16:40:36-08:00	Benson Wong	Add docs for creating a static build (#10268) (#10630)
M	docs/build.md

commit	01e6d9bb71eb71fe1f811f2fdef15753232cd0f2	cc98896db858df7aa40d0e16a505883ef196a482	2024-12-04T08:26:37+08:00	piDack	clip : add sycl support (#10574)
M	examples/llava/clip.cpp

commit	cc98896db858df7aa40d0e16a505883ef196a482	91c36c269bca75b2d08119c653512cd20b4ea2ba	2024-12-03T13:29:54-06:00	Jeff Bolz	vulkan: optimize and reenable split_k (#10637)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_split_k_reduce.comp

commit	91c36c269bca75b2d08119c653512cd20b4ea2ba	1cd3df46bd49a0c1c78da8b68c956448a73b7476	2024-12-03T19:38:44+01:00	Xuan Son Nguyen	server : (web ui) Various improvements, now use vite as bundler (#10599)
M	.github/workflows/server.yml
M	.gitignore
M	Makefile
M	examples/server/CMakeLists.txt
M	examples/server/README.md
D	examples/server/deps.sh
D	examples/server/public/deps_daisyui.min.css
D	examples/server/public/deps_markdown-it.js
D	examples/server/public/deps_tailwindcss.js
D	examples/server/public/deps_vue.esm-browser.js
M	examples/server/public/index.html
M	examples/server/server.cpp
A	examples/server/webui/index.html
A	examples/server/webui/package-lock.json
A	examples/server/webui/package.json
A	examples/server/webui/postcss.config.js
R100	examples/server/public/completion.js	examples/server/webui/src/completion.js
A	examples/server/webui/src/main.js
A	examples/server/webui/src/styles.css
A	examples/server/webui/tailwind.config.js
A	examples/server/webui/vite.config.js

commit	1cd3df46bd49a0c1c78da8b68c956448a73b7476	c5054718575d37f43cc4e6f61ea7c4014ad2c0cf	2024-12-03T19:42:30+02:00	Georgi Gerganov	scripts : remove amx sync
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	c5054718575d37f43cc4e6f61ea7c4014ad2c0cf	e9e661bd59364e5d4fce035834b6cadcadf8c2ef	2024-12-03T19:40:25+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	e9e661bd59364e5d4fce035834b6cadcadf8c2ef	efb6ae963031709fc331e6e48cc4606ac8f9c3a7	2024-12-03T21:11:43+08:00	mahorozte	CUDA: remove unnecessary warp reduce in FA (ggml/1032)
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh

commit	efb6ae963031709fc331e6e48cc4606ac8f9c3a7	667d70d1704dfa6977505f5d01d4638669b90dce	2024-12-02T19:27:24+01:00	PAB	feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	667d70d1704dfa6977505f5d01d4638669b90dce	3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4	2024-11-28T09:25:06+01:00	PAB	metal : add `GGML_OP_CONV_TRANSPOSE_1D` kernels (ggml/1026)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4	82bca2257b3cec72676abb26011f1b99fcdab29d	2024-12-03T12:54:30+01:00	Xuan Son Nguyen	llama : add missing LLAMA_API for llama_chat_builtin_templates (#10636)
M	include/llama.h

commit	82bca2257b3cec72676abb26011f1b99fcdab29d	0115df2f65ac7c64dd0e5915c72ecc4a9343a130	2024-12-03T12:50:08+02:00	Nikolaos Pothitos	readme : add option, update default value, fix formatting (#10271)
M	docs/build.md
M	examples/infill/README.md
M	examples/main/README.md
M	examples/server/README.md

commit	0115df2f65ac7c64dd0e5915c72ecc4a9343a130	515d4e53727924e48774f45ecb15bdacbf851e13	2024-12-03T11:52:33+02:00	Georgi Gerganov	metal : small-batch mat-mul kernels (#10581)
M	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	515d4e53727924e48774f45ecb15bdacbf851e13	844e2e1feec887c803845a3b8762f3b15979b095	2024-12-03T11:21:43+02:00	Georgi Gerganov	github : minify link [no ci] (revert)
M	.github/pull_request_template.md

commit	844e2e1feec887c803845a3b8762f3b15979b095	70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878	2024-12-03T11:20:35+02:00	Georgi Gerganov	github : minify link [no ci]
M	.github/pull_request_template.md

commit	70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878	642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e	2024-12-03T11:20:00+02:00	Georgi Gerganov	server : fix default draft model parameters (#10586)
M	examples/server/server.cpp

commit	642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e	8648c521010620c2daccfa1d26015c668ba2c717	2024-12-02T22:10:19+01:00	Xuan Son Nguyen	llama : add enum for built-in chat templates (#10623)
M	common/arg.cpp
M	examples/server/README.md
M	include/llama.h
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	8648c521010620c2daccfa1d26015c668ba2c717	64ed2091b24b2f9747148fdf49a34ed5938762c3	2024-12-02T21:22:53+02:00	Georgi Gerganov	make : deprecate (#10514)
M	.github/workflows/build.yml
M	Makefile
M	docs/backend/BLIS.md
M	docs/build.md
D	examples/base-translate.sh
M	examples/convert-llama2c-to-ggml/README.md
M	examples/imatrix/README.md
M	examples/server/README.md
M	scripts/compare-commits.sh
D	scripts/pod-llama.sh
D	scripts/server-llm.sh

commit	64ed2091b24b2f9747148fdf49a34ed5938762c3	991f8aabeec89d801300bb179e52013fb0eb0584	2024-12-02T21:45:54+08:00	haopeng	server: Add "tokens per second" information in the backend (#10548)
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/utils.hpp

commit	991f8aabeec89d801300bb179e52013fb0eb0584	4cb003dd8d1f37523120a21e4b1a50a2adcb8c84	2024-12-02T12:34:11+05:30	Akarshan Biswas	SYCL: Fix and switch to GGML_LOG system instead of fprintf (#10579)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	4cb003dd8d1f37523120a21e4b1a50a2adcb8c84	917786f43d0f29b7c77a0c56767c0fa4df68b1c5	2024-12-02T08:53:27+02:00	Georgi Gerganov	contrib : refresh (#10593)
M	.github/pull_request_template.md
A	CODEOWNERS
M	CONTRIBUTING.md

commit	917786f43d0f29b7c77a0c56767c0fa4df68b1c5	5e1ed95583ca552a98d8528b73e1ff81249c2bf9	2024-12-01T22:09:49Z	Juk Armstrong	Add `mistral-v1`, `mistral-v3`, `mistral-v3-tekken` and `mistral-v7` chat template types (#10572)
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	5e1ed95583ca552a98d8528b73e1ff81249c2bf9	5c7a5aa0c32eb19ce03e178560797db5875d7692	2024-12-01T21:37:54+02:00	Georgi Gerganov	grammars : add English-only grammar (#10612)
A	grammars/english.gbnf

commit	5c7a5aa0c32eb19ce03e178560797db5875d7692	3420909dffa50e70660524797a1e715a717684d2	2024-12-01T10:11:42-08:00	Wang Qin	ci: add error handling for Python venv creation in run.sh (#10608)
M	ci/run.sh

commit	3420909dffa50e70660524797a1e715a717684d2	86dc11c5bcf34db2749d8bd8d4fa07a542c94f84	2024-12-01T16:12:41+01:00	Diego Devesa	ggml : automatic selection of best CPU backend (#10606)
M	.devops/llama-server.Dockerfile
M	CMakeLists.txt
M	Package.swift
M	ggml/CMakeLists.txt
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/amx/common.h
M	ggml/src/ggml-cpu/amx/mmq.cpp
A	ggml/src/ggml-cpu/cpu-feats-x86.cpp
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c
A	scripts/build-cpu.sh

commit	86dc11c5bcf34db2749d8bd8d4fa07a542c94f84	6acce3971098772a8aacb10fe8550b4119110581	2024-12-01T12:33:12+01:00	alek3y	server : bind to any port when specified (#10590)
M	examples/server/server.cpp

commit	6acce3971098772a8aacb10fe8550b4119110581	43957ef203b4c9ceaee42c176b3ef44ea4359c85	2024-12-01T11:25:17+02:00	Georgi Gerganov	readme : update the usage section with examples (#10596)
M	README.md

commit	43957ef203b4c9ceaee42c176b3ef44ea4359c85	0c39f44d70d058940fe2afe50cfc789e3e44d756	2024-11-30T19:19:44-08:00	Wang Qin	build: update Makefile comments for C++ version change (#10598)
M	Makefile

commit	0c39f44d70d058940fe2afe50cfc789e3e44d756	3e0ba0e604b1ac5b2cbca9a3f38f91f2be4ef1cd	2024-11-30T18:13:18+01:00	Adrien Gallouët	ggml-cpu: replace AArch64 NEON assembly with intrinsics in ggml_gemv_q4_0_4x4_q8_0() (#10567)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c

commit	3e0ba0e604b1ac5b2cbca9a3f38f91f2be4ef1cd	abadba05be52cccf6c0da49534e37f6062ce8ded	2024-11-30T10:09:21+02:00	Georgi Gerganov	readme : remove old badge
M	README.md

commit	abadba05be52cccf6c0da49534e37f6062ce8ded	0533e7fb3842a523f64dc533bd7bd7147ec2c63a	2024-11-30T09:47:07+02:00	Georgi Gerganov	readme : refresh (#10587)
M	README.md

commit	0533e7fb3842a523f64dc533bd7bd7147ec2c63a	7cc2d2c88908fc92b97b28acafb82f7d6e425b85	2024-11-30T07:00:02Z	Eve	vulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp

commit	7cc2d2c88908fc92b97b28acafb82f7d6e425b85	b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93	2024-11-29T21:54:58+01:00	Diego Devesa	ggml : move AMX to the CPU backend (#10570)
M	.clang-tidy
M	.github/workflows/build.yml
M	Makefile
M	Package.swift
M	common/CMakeLists.txt
M	common/common.cpp
M	examples/batched-bench/CMakeLists.txt
M	examples/batched/CMakeLists.txt
M	examples/convert-llama2c-to-ggml/CMakeLists.txt
M	examples/cvector-generator/CMakeLists.txt
M	examples/embedding/CMakeLists.txt
M	examples/eval-callback/CMakeLists.txt
M	examples/export-lora/CMakeLists.txt
M	examples/gbnf-validator/CMakeLists.txt
M	examples/gen-docs/CMakeLists.txt
M	examples/gguf-hash/CMakeLists.txt
M	examples/gguf-split/CMakeLists.txt
M	examples/gguf/CMakeLists.txt
M	examples/gritlm/CMakeLists.txt
M	examples/imatrix/CMakeLists.txt
M	examples/infill/CMakeLists.txt
M	examples/llama-bench/CMakeLists.txt
M	examples/llava/CMakeLists.txt
M	examples/lookahead/CMakeLists.txt
M	examples/lookup/CMakeLists.txt
M	examples/main-cmake-pkg/CMakeLists.txt
M	examples/main/CMakeLists.txt
M	examples/parallel/CMakeLists.txt
M	examples/passkey/CMakeLists.txt
M	examples/perplexity/CMakeLists.txt
M	examples/quantize-stats/CMakeLists.txt
M	examples/quantize/CMakeLists.txt
M	examples/retrieval/CMakeLists.txt
M	examples/run/CMakeLists.txt
M	examples/save-load-state/CMakeLists.txt
M	examples/server/CMakeLists.txt
M	examples/simple-chat/CMakeLists.txt
M	examples/simple/CMakeLists.txt
M	examples/speculative-simple/CMakeLists.txt
M	examples/speculative/CMakeLists.txt
M	examples/tokenize/CMakeLists.txt
M	ggml/CMakeLists.txt
D	ggml/include/ggml-amx.h
M	ggml/src/CMakeLists.txt
D	ggml/src/ggml-amx/CMakeLists.txt
D	ggml/src/ggml-amx/ggml-amx.cpp
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt
A	ggml/src/ggml-cpu/amx/amx.cpp
A	ggml/src/ggml-cpu/amx/amx.h
R077	ggml/src/ggml-amx/common.h	ggml/src/ggml-cpu/amx/common.h
R098	ggml/src/ggml-amx/mmq.cpp	ggml/src/ggml-cpu/amx/mmq.cpp
R072	ggml/src/ggml-amx/mmq.h	ggml/src/ggml-cpu/amx/mmq.h
M	ggml/src/ggml-cpu/ggml-cpu-impl.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
M	pocs/vdot/CMakeLists.txt
M	src/CMakeLists.txt
M	src/unicode.cpp
M	tests/test-sampling.cpp

commit	b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93	3a8e9af402f7893423bdab444aa16c5d9a2d429a	2024-11-29T21:48:56+01:00	Xuan Son Nguyen	server : add more test cases (#10569)
M	examples/server/tests/unit/test_basic.py
M	examples/server/tests/unit/test_chat_completion.py
M	examples/server/tests/unit/test_infill.py
M	examples/server/tests/unit/test_rerank.py
A	examples/server/tests/unit/test_speculative.py
M	examples/server/tests/utils.py

commit	3a8e9af402f7893423bdab444aa16c5d9a2d429a	a3a3048e7a0f9464d0d625a29257d8bce5da5090	2024-11-29T12:21:37-05:00	Robert Collins	imatrix : support combine-only (#10492)
M	examples/imatrix/imatrix.cpp

commit	a3a3048e7a0f9464d0d625a29257d8bce5da5090	f0678c5ff4cb8873d6ff48801475ff270db656fa	2024-11-29T17:45:08+01:00	Diego Devesa	cleanup UI link list (#10577)
M	README.md

commit	f0678c5ff4cb8873d6ff48801475ff270db656fa	4b3242bbea172ac0980378496fbc676d44c4f459	2024-11-29T16:25:39+02:00	Georgi Gerganov	ggml : fix I8MM Q4_1 scaling factor conversion (#10562)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c
M	tests/test-backend-ops.cpp

commit	4b3242bbea172ac0980378496fbc676d44c4f459	0f77aae5608f16780a49926b67be6d56ec4b09bd	2024-11-29T21:49:02+08:00	Shupei Fan	ggml-cpu: fix typo in gemv/gemm iq4_nl_4_4 (#10580)
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c

commit	0f77aae5608f16780a49926b67be6d56ec4b09bd	266b8519ee6d21e7ba2bf56f5629e20a181fee8b	2024-11-29T12:38:45Z	Alberto Cabrera Pérez	sycl : offload of get_rows set to 0 (#10432)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	266b8519ee6d21e7ba2bf56f5629e20a181fee8b	938f6087421889a3af7d0786c64406ced2be81b8	2024-11-29T09:49:43Z	Alberto Cabrera Pérez	sycl : Reroute permuted mul_mats through oneMKL (#10408)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	938f6087421889a3af7d0786c64406ced2be81b8	f095a649ec390e04dfab1b04e646ae8549dafaef	2024-11-29T14:46:55+08:00	Chenguang Li	CANN: RoPE operator optimization (#10563)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	f095a649ec390e04dfab1b04e646ae8549dafaef	678d7994f4da0af3d29046be99950ac999ee9762	2024-11-29T00:18:02-06:00	Jeff Bolz	vulkan: get the first command buffer submitted sooner (#10499)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	678d7994f4da0af3d29046be99950ac999ee9762	dc22344088a7ee81a1e4f096459b03a72f24ccdc	2024-11-29T08:09:46+08:00	Ting Lou	llava: return false instead of exit (#10546)
M	examples/llava/clip.cpp
M	examples/llava/llava.cpp

commit	dc22344088a7ee81a1e4f096459b03a72f24ccdc	4c0a95b1074907ce7efe6f5bb6ae3351c01429ab	2024-11-28T20:46:40+02:00	Georgi Gerganov	ggml : remove redundant copyright notice + update authors
M	AUTHORS
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c

commit	4c0a95b1074907ce7efe6f5bb6ae3351c01429ab	6c595676899013102fdb0aa4b06a49954300c94a	2024-11-28T20:45:07+02:00	Georgi Gerganov	llama : add missing model types
M	src/llama.cpp

commit	6c595676899013102fdb0aa4b06a49954300c94a	890719311b6535e572f15965c6d7ec4ac2537f60	2024-11-28T19:17:49+01:00	Xuan Son Nguyen	server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568)
M	examples/server/tests/requirements.txt
M	examples/server/tests/utils.py

commit	890719311b6535e572f15965c6d7ec4ac2537f60	7281cf13addfae9b64bb2be87e3b5b1914505d63	2024-11-28T18:15:25+01:00	Johannes Gäßler	common: fix warning message when no GPU found (#10564)
M	common/arg.cpp

commit	7281cf13addfae9b64bb2be87e3b5b1914505d63	e90688edd004fdb7063f463bd18408ba9ae008dd	2024-11-28T23:03:11+08:00	Random Fly	docs: fix outdated usage of llama-simple (#10565)
M	docs/android.md
M	examples/simple/README.md

commit	e90688edd004fdb7063f463bd18408ba9ae008dd	76b27d29c22af03172cf211a8a31025c7c828a57	2024-11-28T15:58:54+01:00	Diego Devesa	ci : fix tag name in cuda and hip releases (#10566)
M	.github/workflows/build.yml

commit	76b27d29c22af03172cf211a8a31025c7c828a57	eea986f215e1dc490654d012ccf2ab62fe8f606d	2024-11-28T14:56:37+02:00	Georgi Gerganov	ggml : fix row condition for i8mm kernels (#10561)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	eea986f215e1dc490654d012ccf2ab62fe8f606d	c202cef1686182a78f8f4e253ab8d0c0ffe2fcc8	2024-11-28T14:56:23+02:00	Georgi Gerganov	cmake : fix ARM feature detection (#10543)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	c202cef1686182a78f8f4e253ab8d0c0ffe2fcc8	2025fa67e94358deda4740a74fe9803916cb2f60	2024-11-28T20:52:03+08:00	Shupei Fan	ggml-cpu: support IQ4_NL_4_4 by runtime repack (#10541)
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml.c

commit	2025fa67e94358deda4740a74fe9803916cb2f60	c6bc73951ed52466392b1abda98c28ecbe522c7f	2024-11-28T12:51:38+01:00	Sergio López	kompute : improve backend to pass test_backend_ops (#10542)
M	ggml/src/ggml-kompute/CMakeLists.txt
M	ggml/src/ggml-kompute/ggml-kompute.cpp
M	ggml/src/ggml-kompute/kompute-shaders/common.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_f16.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_k.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q6_k.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n_pre.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_f16.comp
D	ggml/src/ggml-kompute/kompute-shaders/op_rope_f32.comp
A	ggml/src/ggml-kompute/kompute-shaders/op_rope_neox_f16.comp
A	ggml/src/ggml-kompute/kompute-shaders/op_rope_neox_f32.comp
A	ggml/src/ggml-kompute/kompute-shaders/op_rope_norm_f16.comp
A	ggml/src/ggml-kompute/kompute-shaders/op_rope_norm_f32.comp
M	ggml/src/ggml-kompute/kompute-shaders/op_softmax.comp
M	ggml/src/ggml-kompute/kompute-shaders/rope_common.comp

commit	c6bc73951ed52466392b1abda98c28ecbe522c7f	605fa66c509f9f117bd654cf0b9b3ea08bb86e80	2024-11-28T15:27:11+08:00	Ruixin Huang	CANN: Update cann.md to display correctly in CLion (#10538)
M	docs/backend/CANN.md

commit	605fa66c509f9f117bd654cf0b9b3ea08bb86e80	b7420131bf8ab3e067bc660439ab1ab18be7edbd	2024-11-28T15:25:24+08:00	leo-pony	CANN: Fix SOC_TYPE compile bug (#10519)
M	docs/backend/CANN.md
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/kernels/CMakeLists.txt
M	ggml/src/ggml-cann/kernels/dup.cpp
M	ggml/src/ggml-cann/kernels/get_row_q4_0.cpp
M	ggml/src/ggml-cann/kernels/quantize_f16_q8_0.cpp
M	ggml/src/ggml-cann/kernels/quantize_f32_q8_0.cpp
M	ggml/src/ggml-cann/kernels/quantize_float_to_q4_0.cpp

commit	b7420131bf8ab3e067bc660439ab1ab18be7edbd	9f912511bc9414fa7a3c521378b6388cd932b58d	2024-11-28T14:24:46+08:00	Chenguang Li	CANN: ROPE operator optimization (#10540)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	9f912511bc9414fa7a3c521378b6388cd932b58d	3ad5451f3b75809e3033e4e577b9f60bcaf6676a	2024-11-27T22:30:52+01:00	Xuan Son Nguyen	common : fix duplicated file name with hf_repo and hf_file (#10550)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/server/tests/utils.py

commit	3ad5451f3b75809e3033e4e577b9f60bcaf6676a	46c69e0e752ff16206347bb12f96ed69f4a01abf	2024-11-27T17:10:08+01:00	uvos	Add some minimal optimizations for CDNA (#10498)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/vendors/hip.h

commit	46c69e0e752ff16206347bb12f96ed69f4a01abf	9e2301f4a4ef1690bd99360c11de43fe830b1c8d	2024-11-27T11:03:25+01:00	Diego Devesa	ci : faster CUDA toolkit installation method and use ccache (#10537)
M	.github/workflows/build.yml

commit	9e2301f4a4ef1690bd99360c11de43fe830b1c8d	fee824a1a1e35b5c49d482f654613addade61764	2024-11-27T11:22:14+02:00	Georgi Gerganov	metal : fix group_norm support condition (#0)
M	ggml/src/ggml-metal/ggml-metal.m

commit	fee824a1a1e35b5c49d482f654613addade61764	9150f8fef95327474d39ccd6c6e30787e85f3529	2024-11-27T11:10:42+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	9150f8fef95327474d39ccd6c6e30787e85f3529	c31ed2abfce05c38a2a5189586bfae45a139a547	2024-11-26T15:50:26+02:00	Frankie Robertson	Do not include arm_neon.h when compiling CUDA code (ggml/1028)
M	ggml/src/ggml-impl.h

commit	c31ed2abfce05c38a2a5189586bfae45a139a547	5b3466bedfa84aa29c6871c7254467550186ecc6	2024-11-27T01:32:54-06:00	Jeff Bolz	vulkan: define all quant data structures in types.comp (#10440)
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp

commit	5b3466bedfa84aa29c6871c7254467550186ecc6	249a7902ec710c8d027b9cc0ed10219d2b4184f8	2024-11-27T01:30:27-06:00	Jeff Bolz	vulkan: Handle GPUs with less shared memory (#10468)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	249a7902ec710c8d027b9cc0ed10219d2b4184f8	71a64989a5d2e25c13507efada145f12cf358914	2024-11-27T01:21:59-06:00	Jeff Bolz	vulkan: further optimize q5_k mul_mat_vec (#10479)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp

commit	71a64989a5d2e25c13507efada145f12cf358914	4a57d362e1948ada50af997a92c3cbff9711e78b	2024-11-27T01:08:54-06:00	Jeff Bolz	vulkan: skip integer div/mod in get_offsets for batch_idx==0 (#10506)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp

commit	4a57d362e1948ada50af997a92c3cbff9711e78b	c9b00a70b080d5c0668608024afc3e0e2fed822f	2024-11-27T01:00:50-06:00	Jeff Bolz	vulkan: optimize Q2_K and Q3_K mul_mat_vec (#10459)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp

commit	c9b00a70b080d5c0668608024afc3e0e2fed822f	de5097351caffb3deaea3393633609df49ef41d0	2024-11-26T22:12:10+01:00	Diego Devesa	ci : fix cuda releases (#10532)
M	.github/workflows/build.yml

commit	de5097351caffb3deaea3393633609df49ef41d0	5a349f2809dc825960dfcfdf8f76b19cd0345be7	2024-11-26T12:55:29-08:00	Shane A	Add OLMo 2 model in docs (#10530)
M	README.md

commit	5a349f2809dc825960dfcfdf8f76b19cd0345be7	30ec39832165627dd6ed98938df63adfc6e6a21a	2024-11-26T21:13:54+01:00	Diego Devesa	ci : remove nix workflows (#10526)
D	.github/workflows/nix-ci-aarch64.yml
D	.github/workflows/nix-ci.yml
D	.github/workflows/nix-flake-update.yml
D	.github/workflows/nix-publish-flake.yml

commit	30ec39832165627dd6ed98938df63adfc6e6a21a	be0e350c8b69632b27d5fb41fa064fa256dd7fbf	2024-11-26T21:01:47+01:00	Diego Devesa	llama : disable warnings for 3rd party sha1 dependency (#10527)
M	examples/gguf-hash/CMakeLists.txt

commit	be0e350c8b69632b27d5fb41fa064fa256dd7fbf	249cd93da3df9c8fa78869b0522526d1625aca91	2024-11-26T19:27:28+01:00	Tristan Druyen	Fix HIP flag inconsistency & build docs (#10524)
M	Makefile
M	docs/build.md

commit	249cd93da3df9c8fa78869b0522526d1625aca91	904109ed0d97c9b656a5e8bf612925f739bb8166	2024-11-27T00:00:41+08:00	R0CKSTAR	mtgpu: Add MUSA_DOCKER_ARCH in Dockerfiles && update cmake and make (#10516)
M	.devops/full-musa.Dockerfile
M	.devops/llama-cli-musa.Dockerfile
M	.devops/llama-server-musa.Dockerfile
M	Makefile
M	ggml/src/ggml-musa/CMakeLists.txt

commit	904109ed0d97c9b656a5e8bf612925f739bb8166	45abe0f74ee281aea6e5283c1e738061256cfcae	2024-11-26T09:45:05-06:00	Jeff Bolz	vulkan: fix group_norm (#10496)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/group_norm.comp
M	tests/test-backend-ops.cpp

commit	45abe0f74ee281aea6e5283c1e738061256cfcae	0bbd2262a3263f37385297b30de37941836e57f7	2024-11-26T16:20:18+01:00	Xuan Son Nguyen	server : replace behave with pytest (#10416)
M	.devops/nix/python-scripts.nix
M	.github/workflows/server.yml
M	examples/server/tests/.gitignore
M	examples/server/tests/README.md
A	examples/server/tests/conftest.py
D	examples/server/tests/features/ctx_shift.feature
D	examples/server/tests/features/embeddings.feature
D	examples/server/tests/features/environment.py
D	examples/server/tests/features/infill.feature
D	examples/server/tests/features/issues.feature
D	examples/server/tests/features/lora.feature
D	examples/server/tests/features/parallel.feature
D	examples/server/tests/features/passkey.feature
D	examples/server/tests/features/rerank.feature
D	examples/server/tests/features/results.feature
D	examples/server/tests/features/security.feature
D	examples/server/tests/features/server.feature
D	examples/server/tests/features/slotsave.feature
D	examples/server/tests/features/steps/steps.py
D	examples/server/tests/features/wrong_usages.feature
M	examples/server/tests/requirements.txt
M	examples/server/tests/tests.sh
A	examples/server/tests/unit/test_basic.py
A	examples/server/tests/unit/test_chat_completion.py
A	examples/server/tests/unit/test_completion.py
A	examples/server/tests/unit/test_ctx_shift.py
A	examples/server/tests/unit/test_embedding.py
A	examples/server/tests/unit/test_infill.py
A	examples/server/tests/unit/test_lora.py
A	examples/server/tests/unit/test_rerank.py
A	examples/server/tests/unit/test_security.py
A	examples/server/tests/unit/test_slot_save.py
A	examples/server/tests/unit/test_tokenize.py
A	examples/server/tests/utils.py

commit	0bbd2262a3263f37385297b30de37941836e57f7	ab96610b1e58684bc5e8b810130c4cf6d8252e21	2024-11-26T21:43:47+08:00	Neo Zhang Jianyu	restore the condistion to build & update pacakge when merge (#10507)
M	.github/workflows/build.yml

commit	ab96610b1e58684bc5e8b810130c4cf6d8252e21	7db3846a94ce7683b3e8120abe427457edf840c9	2024-11-26T14:18:08+02:00	Georgi Gerganov	cmake : enable warnings in llama (#10474)
M	CMakeLists.txt
A	cmake/common.cmake
M	common/CMakeLists.txt
M	examples/CMakeLists.txt
M	examples/speculative-simple/speculative-simple.cpp
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt
M	src/CMakeLists.txt

commit	7db3846a94ce7683b3e8120abe427457edf840c9	c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2	2024-11-26T13:05:20+01:00	Diego Devesa	ci : publish the docker images created during scheduled runs (#10515)
M	.github/workflows/docker.yml

commit	c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2	25669aa92caaddff09f39b54a5173e5cb2680fa3	2024-11-26T13:05:07+01:00	Diego Devesa	ci : add ubuntu cuda build, build with one arch on windows (#10456)
M	.github/labeler.yml
M	.github/workflows/build.yml
M	.github/workflows/nix-ci.yml
M	.github/workflows/python-lint.yml

commit	25669aa92caaddff09f39b54a5173e5cb2680fa3	84e1c33cde9e0a7aafcda2d4f21ba51c300482d7	2024-11-26T12:37:05+01:00	Charles Xu	ggml-cpu: cmake add arm64 cpu feature check for macos (#10487)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	84e1c33cde9e0a7aafcda2d4f21ba51c300482d7	811872a59daefb25fc0c4326bcb6d8ae893c2f7c	2024-11-26T13:36:40+02:00	Georgi Gerganov	server : fix parallel speculative decoding (#10513)
M	examples/server/server.cpp

commit	811872a59daefb25fc0c4326bcb6d8ae893c2f7c	9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f	2024-11-26T12:29:38+02:00	Georgi Gerganov	speculative : simplify the implementation (#10504)
M	examples/speculative-simple/speculative-simple.cpp

commit	9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f	7066b4cce2898993e943ad6af5d8f1de5840c8e9	2024-11-26T18:08:37+08:00	Shanshan Shen	CANN: Improve the Inferencing Performance for Ascend NPU Device (#10454)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/common.h
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	7066b4cce2898993e943ad6af5d8f1de5840c8e9	0eb4e12beebabae46d37b78742f4c5d4dbe52dc1	2024-11-26T17:31:05+08:00	Chenguang Li	CANN: RoPE and CANCAT operator optimization (#10488)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/ggml-cann.cpp

commit	0eb4e12beebabae46d37b78742f4c5d4dbe52dc1	0cc63754b831d3a6c37bc5d721d12ce9540ffe76	2024-11-26T10:47:20+09:00	Junil Kim	vulkan: Fix a vulkan-shaders-gen arugment parsing error (#10484)
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	0cc63754b831d3a6c37bc5d721d12ce9540ffe76	50d5cecbda3b0d03344eed326287adc1f6c7f3ef	2024-11-25T16:56:24-05:00	Eric Curtin	Introduce llama-run (#10291)
M	CMakeLists.txt
M	Makefile
M	examples/CMakeLists.txt
A	examples/run/CMakeLists.txt
A	examples/run/README.md
A	examples/run/run.cpp
A	include/llama-cpp.h

commit	50d5cecbda3b0d03344eed326287adc1f6c7f3ef	9fd8c2687f5aa2f095ac6e12a376e1c0583888e8	2024-11-25T22:05:39+01:00	Diego Devesa	ci : build docker images only once daily (#10503)
M	.github/workflows/docker.yml

commit	9fd8c2687f5aa2f095ac6e12a376e1c0583888e8	47f931c8f9a26c072d71224bc8013cc66ea9e445	2024-11-25T22:28:27+02:00	Georgi Gerganov	server : add more information about error (#10455)
M	common/speculative.cpp

commit	47f931c8f9a26c072d71224bc8013cc66ea9e445	106964e3d266740f571b5aad7b57545b4a901ac9	2024-11-25T21:50:07+02:00	Georgi Gerganov	server : enable cache_prompt by default (#10501)
M	examples/server/README.md
M	examples/server/server.cpp

commit	106964e3d266740f571b5aad7b57545b4a901ac9	80acb7b430d826a7685326603a07342e9abc1b45	2024-11-25T21:49:31+02:00	Georgi Gerganov	metal : enable mat-vec kernels for bs <= 4 (#10491)
M	ggml/src/ggml-metal/ggml-metal.m

commit	80acb7b430d826a7685326603a07342e9abc1b45	10bce0450f0c4d80087e06312b9dbbab3e87f16b	2024-11-25T10:36:09-08:00	Shane A	Rename Olmo1124 to Olmo2 (#10500)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	10bce0450f0c4d80087e06312b9dbbab3e87f16b	1f922254f0c984a8fb9fbaa0c390d7ffae49aedb	2024-11-25T19:30:06+01:00	Diego Devesa	llama : accept a list of devices to use to offload a model (#10497)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp
M	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	ggml/src/ggml-backend-reg.cpp
M	include/llama.h
M	src/llama.cpp

commit	1f922254f0c984a8fb9fbaa0c390d7ffae49aedb	a9a678a6b2264e5895533217b0cf8f250534cc58	2024-11-25T19:18:37+01:00	Johannes Gäßler	Github: update issue templates [no ci] (#10489)
M	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
M	.github/ISSUE_TEMPLATE/011-bug-results.yml
M	.github/ISSUE_TEMPLATE/019-bug-misc.yml

commit	a9a678a6b2264e5895533217b0cf8f250534cc58	9ca2e677626fce759d5d95c407c03677b9c87a26	2024-11-25T08:11:55-08:00	brucepro	Add download chat feature to server chat (#10481)
M	examples/server/public/index.html

commit	9ca2e677626fce759d5d95c407c03677b9c87a26	5931c1f233c616083d64e41a228249d58e039aa5	2024-11-25T16:31:38+02:00	Georgi Gerganov	server : add speculative decoding support (#10455)
M	examples/server/server.cpp

commit	5931c1f233c616083d64e41a228249d58e039aa5	f6d12e7df8fe64384f1939976871252e6422a01e	2024-11-25T15:13:39+01:00	Diego Devesa	ggml : add support for dynamic loading of backends (#10469)
M	Makefile
M	Package.swift
M	common/common.cpp
M	examples/CMakeLists.txt
M	examples/eval-callback/CMakeLists.txt
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
M	examples/simple-chat/simple-chat.cpp
M	examples/simple/simple.cpp
M	ggml/CMakeLists.txt
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-amx/CMakeLists.txt
M	ggml/src/ggml-amx/ggml-amx.cpp
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-blas/CMakeLists.txt
M	ggml/src/ggml-blas/ggml-blas.cpp
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/ggml-cann.cpp
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-kompute/CMakeLists.txt
M	ggml/src/ggml-kompute/ggml-kompute.cpp
M	ggml/src/ggml-metal/CMakeLists.txt
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-musa/CMakeLists.txt
M	ggml/src/ggml-rpc/CMakeLists.txt
M	ggml/src/ggml-rpc/ggml-rpc.cpp
M	ggml/src/ggml-sycl/CMakeLists.txt
M	ggml/src/ggml-sycl/ggml-sycl.cpp
M	ggml/src/ggml-vulkan/CMakeLists.txt
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	pocs/CMakeLists.txt
M	src/llama.cpp
M	tests/CMakeLists.txt
M	tests/test-backend-ops.cpp

commit	f6d12e7df8fe64384f1939976871252e6422a01e	b756441104ca8384640d6df22ba4ea6dab7ad799	2024-11-25T15:17:32+02:00	Georgi Gerganov	tests : fix compile warning
M	tests/test-quantize-fns.cpp

commit	b756441104ca8384640d6df22ba4ea6dab7ad799	5a8987793f3e7c1fbfa6806bfcd17d578071b6c9	2024-11-25T15:08:04+02:00	Georgi Gerganov	metal : minor code formatting
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	5a8987793f3e7c1fbfa6806bfcd17d578071b6c9	d9d54e498d38ec99bbc0031022f9c92711e97bbc	2024-11-25T17:31:10+08:00	Neo Zhang Jianyu	[SYCL] Fix building Win package for oneAPI 2025.0 update (#10483)
M	.github/workflows/build.yml

commit	d9d54e498d38ec99bbc0031022f9c92711e97bbc	cce5a9007572c6e9fa522296b77571d2e5071357	2024-11-25T09:58:41+02:00	Georgi Gerganov	speculative : refactor and add a simpler example (#10362)
M	Makefile
M	common/CMakeLists.txt
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
A	common/speculative.cpp
A	common/speculative.h
M	examples/CMakeLists.txt
M	examples/batched/batched.cpp
M	examples/infill/infill.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
A	examples/speculative-simple/CMakeLists.txt
A	examples/speculative-simple/README.md
A	examples/speculative-simple/speculative-simple.cpp
M	examples/speculative/speculative.cpp
M	tests/test-arg-parser.cpp

commit	cce5a9007572c6e9fa522296b77571d2e5071357	dc39012cbaf8752fabecaeb60af78ccdd1dfb73b	2024-11-24T18:03:25+02:00	Georgi Gerganov	flake.lock: Update (#10470)
M	flake.lock

commit	dc39012cbaf8752fabecaeb60af78ccdd1dfb73b	9336db462c0c34bbe2055413fe4e16442626c38b	2024-11-24T16:10:26+01:00	Diego Devesa	llama : fix op mul check with command-r-plus (#10476)
M	src/llama.cpp

commit	9336db462c0c34bbe2055413fe4e16442626c38b	96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1	2024-11-24T02:02:34-07:00	Gabe Goodhart	convert : XLMRoberta Type Vocab Size (#10458)
M	convert_hf_to_gguf.py

commit	96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1	55ed008b2de01592659b9eba068ea01bb2f72160	2024-11-24T09:09:22+09:00	momonga	fix gguf-py:  Conversion error when multiple licenses are configured (#9807)
M	gguf-py/gguf/metadata.py

commit	55ed008b2de01592659b9eba068ea01bb2f72160	6dfcfef0787e9902df29f510b63621f60a09a50b	2024-11-23T14:41:12+01:00	Diego Devesa	ggml : do not use ARM features not included in the build (#10457)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	6dfcfef0787e9902df29f510b63621f60a09a50b	599b3e0cd40432cd1975a8906f3db70bbe53b627	2024-11-22T17:44:08+08:00	蕭澧邦	ci: Update oneAPI runtime dll packaging (#10428)
M	.github/workflows/build.yml

commit	599b3e0cd40432cd1975a8906f3db70bbe53b627	c18610b4ee29ca056bb4f2d375a4ad1b16f44ef7	2024-11-22T08:32:40+01:00	Johannes Gäßler	GitHub: ask for more info in issue templates (#10426)
D	.github/ISSUE_TEMPLATE/01-bug-low.yml
A	.github/ISSUE_TEMPLATE/010-bug-compilation.yml
A	.github/ISSUE_TEMPLATE/011-bug-results.yml
A	.github/ISSUE_TEMPLATE/019-bug-misc.yml
D	.github/ISSUE_TEMPLATE/02-bug-medium.yml
R097	.github/ISSUE_TEMPLATE/05-enhancement.yml	.github/ISSUE_TEMPLATE/020-enhancement.yml
D	.github/ISSUE_TEMPLATE/03-bug-high.yml
R097	.github/ISSUE_TEMPLATE/06-research.yml	.github/ISSUE_TEMPLATE/030-research.yml
D	.github/ISSUE_TEMPLATE/04-bug-critical.yml
R095	.github/ISSUE_TEMPLATE/07-refactor.yml	.github/ISSUE_TEMPLATE/040-refactor.yml

commit	c18610b4ee29ca056bb4f2d375a4ad1b16f44ef7	a5e47592b6171ae21f3eaa1aba6fb2b707875063	2024-11-22T14:07:20+08:00	leo-pony	CANN: Support Ascend310P to accelerate F32 and F16 Model (#10216)
M	ggml/src/ggml-cann/CMakeLists.txt
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/kernels/CMakeLists.txt
M	ggml/src/ggml-cann/kernels/dup.cpp
M	ggml/src/ggml-cann/kernels/get_row_f16.cpp
M	ggml/src/ggml-cann/kernels/get_row_f32.cpp
M	ggml/src/ggml-cann/kernels/get_row_q4_0.cpp

commit	a5e47592b6171ae21f3eaa1aba6fb2b707875063	1bb30bf28cb5a7adf111bc41c935bdaf128397e7	2024-11-21T18:18:50+01:00	Diego Devesa	cuda : optimize argmax (#10441)
M	ggml/src/ggml-cuda/argmax.cu
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/quantize.cu
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	1bb30bf28cb5a7adf111bc41c935bdaf128397e7	87a533be57e602f8ca469d14ad15ee851265b655	2024-11-21T10:22:47+02:00	Georgi Gerganov	llama : handle KV shift for recurrent models (#10402)
M	src/llama.cpp

commit	87a533be57e602f8ca469d14ad15ee851265b655	59b917282236eadfb82bf1f46a31eb119941da08	2024-11-21T09:22:11+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	59b917282236eadfb82bf1f46a31eb119941da08	02e4eaf22f229a114054b053a9eff61483653670	2024-11-20T13:25:08+01:00	slaren	ggml/sched : do not skip views in pre-assignments
M	ggml/src/ggml-backend.cpp

commit	02e4eaf22f229a114054b053a9eff61483653670	9abe9eeae98b11fa93b82632b264126a010225ff	2024-11-20T14:56:04+01:00	Johannes Gäßler	ggml-opt: fix data corruption (ggml/1022)
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-opt.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	9abe9eeae98b11fa93b82632b264126a010225ff	f95caa79546271722ada703da20ffb1cfcd21fed	2024-11-20T13:47:36-06:00	Jeff Bolz	vulkan: predicate max operation in soft_max shaders/soft_max (#10437)
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp

commit	f95caa79546271722ada703da20ffb1cfcd21fed	fab5d30ff6729ff6ff615c41e8c0215d6bc30393	2024-11-20T12:22:19-04:00	bandoti	cmake: add link dependencies to cmake find pkg (#10433)
M	cmake/llama-config.cmake.in

commit	fab5d30ff6729ff6ff615c41e8c0215d6bc30393	8fd4b7fa29c3061b2e02e897d818dfcbc593430a	2024-11-20T12:57:53+01:00	Diego Devesa	llama : add .clang-format file (#10415)
A	.clang-format
M	examples/llama-bench/llama-bench.cpp

commit	8fd4b7fa29c3061b2e02e897d818dfcbc593430a	1bacb9f62514b520bdf74ed6feb46c80508dad38	2024-11-20T01:40:18-06:00	Jeff Bolz	vulkan: copy iq4_nl LUT into shared memory (#10409)
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_nl.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	1bacb9f62514b520bdf74ed6feb46c80508dad38	ad21c9e1f14d82b8c15ae369a8839019e3d498b4	2024-11-20T01:11:00-06:00	Jeff Bolz	vulkan: further optimize mul_mat_vec using larger loads (#10387)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	ad21c9e1f14d82b8c15ae369a8839019e3d498b4	3952a221af54b8a6549bc2bd4a7363ef7ad3081e	2024-11-20T13:54:25+08:00	Neo Zhang Jianyu	update rel to 4040 (#10395)
M	docs/backend/SYCL.md

commit	3952a221af54b8a6549bc2bd4a7363ef7ad3081e	42ae10bbcd7b56f29a302c86796542a6dadf46c9	2024-11-19T23:18:17+01:00	Anthony Van de Gejuchte	Fix missing file renames in Makefile due to changes in commit ae8de6d50a (#10413)
M	Makefile

commit	42ae10bbcd7b56f29a302c86796542a6dadf46c9	9fe0fb062630728e3c21b5839e3bce87bff2440a	2024-11-20T04:10:31+08:00	haopeng	add cmake rvv support (#10411)
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	9fe0fb062630728e3c21b5839e3bce87bff2440a	611fabd7922050e1e99bd276d3544527cd46047b	2024-11-19T19:15:50+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	611fabd7922050e1e99bd276d3544527cd46047b	12b0ad953a59563ea8d973708760d747321d8432	2024-11-18T15:02:27+02:00	Plamen Minev	metal : fox offset integer overflows in im2col (ggml/1015)
M	ggml/src/ggml-metal/ggml-metal.metal

commit	12b0ad953a59563ea8d973708760d747321d8432	342397dc7edb311e0373205134d0d3a928b891b3	2024-11-18T10:02:49+01:00	PAB	metal : add `GGML_UNARY_OP_ELU` kernel (ggml/1018)
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	342397dc7edb311e0373205134d0d3a928b891b3	2a11b6b0946c1abab2ab150725610e5ee736b3af	2024-11-20T01:42:00+08:00	蕭澧邦	cmake: force MSVC compiler charset to utf-8 (#9989)
M	CMakeLists.txt

commit	2a11b6b0946c1abab2ab150725610e5ee736b3af	3ee6382d48b07b31e64983969c16019490e19740	2024-11-19T12:10:30-04:00	bandoti	Add required ggml-base and backend libs to cmake pkg (#10407)
M	cmake/llama-config.cmake.in
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt

commit	3ee6382d48b07b31e64983969c16019490e19740	8e752a777b272606f22cb741b03e062de4ddb8fe	2024-11-19T14:29:38+01:00	Diego Devesa	cuda : fix CUDA_FLAGS not being applied (#10403)
M	ggml/src/ggml-blas/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	8e752a777b272606f22cb741b03e062de4ddb8fe	a88ad007de3eb5d92cb538fd269ff94c4bf0c8d2	2024-11-19T13:29:26+02:00	Georgi Gerganov	llama : add check for KV cache shifts (#10401)
M	common/common.cpp
M	include/llama.h
M	src/llama.cpp

commit	a88ad007de3eb5d92cb538fd269ff94c4bf0c8d2	2a1507c1629975d9d20a503d6a14f44eff292c25	2024-11-19T01:04:08-08:00	Shane A	llama : add OLMo November 2024 support (#10394)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	2a1507c1629975d9d20a503d6a14f44eff292c25	b3e585988fc65d3a8083c6d94dfc0629f9ce226d	2024-11-19T09:02:23+01:00	Romain Biessy	sycl : Add option to set the SYCL architecture for all targets (#10266)
M	docs/backend/SYCL.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-sycl/CMakeLists.txt

commit	b3e585988fc65d3a8083c6d94dfc0629f9ce226d	557924f22237c76387a39c4db5abae154d57e754	2024-11-19T01:25:17-06:00	Jeff Bolz	vulkan: Optimize soft_max (#10301)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp
M	tests/test-backend-ops.cpp

commit	557924f22237c76387a39c4db5abae154d57e754	d3481e631661b5e9517f78908cdd58cee63c4903	2024-11-19T00:50:04Z	Alberto Cabrera Pérez	sycl: Revert MUL_MAT_OP support changes (#10385)
M	ggml/src/ggml-sycl/ggml-sycl.cpp

commit	d3481e631661b5e9517f78908cdd58cee63c4903	531cb1c233800e6acb021dc56d69595e314db072	2024-11-18T18:43:40+01:00	Diego Devesa	cuda : only use native when supported by cmake (#10389)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	531cb1c233800e6acb021dc56d69595e314db072	f139d2ea611c5604395c95160d3c53f7c4eaf220	2024-11-18T11:23:58-04:00	bandoti	Skip searching root path for cross-compile builds (#10383)
M	cmake/llama-config.cmake.in

commit	f139d2ea611c5604395c95160d3c53f7c4eaf220	2eb76b2a5e4ea395b971a419c95b473ab6f253e4	2024-11-18T08:28:42-06:00	Jeff Bolz	vulkan: remove use of null initializer (#10372)
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp

commit	2eb76b2a5e4ea395b971a419c95b473ab6f253e4	9b75f03cd2ec9cc482084049d87a0f08f9f01517	2024-11-18T16:08:20+02:00	Georgi Gerganov	flake.lock: Update (#10346)
M	flake.lock

commit	9b75f03cd2ec9cc482084049d87a0f08f9f01517	75207b3a887f91f813de1eb6e9fd135d3cb2b8c6	2024-11-18T11:02:43+01:00	0cc4m	Vulkan: Fix device info output format specifiers (#10366)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	75207b3a887f91f813de1eb6e9fd135d3cb2b8c6	76e9e58b7847112848aa1f40b65d1cbcd6d5f5a3	2024-11-18T00:21:53+01:00	Johannes Gäßler	docker: use GGML_NATIVE=OFF (#10368)
M	.devops/full-cuda.Dockerfile
M	.devops/full-musa.Dockerfile
M	.devops/llama-cli-cann.Dockerfile
M	.devops/llama-cli-cuda.Dockerfile
M	.devops/llama-cli-intel.Dockerfile
M	.devops/llama-cli-musa.Dockerfile
M	.devops/llama-cli-vulkan.Dockerfile
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-intel.Dockerfile
M	.devops/llama-server-musa.Dockerfile
M	.devops/llama-server-vulkan.Dockerfile

commit	76e9e58b7847112848aa1f40b65d1cbcd6d5f5a3	ce2e59ba107cf71ed566040ff20a15d1c58e09c2	2024-11-17T23:20:42+01:00	Johannes Gäßler	CUDA: fix MMV kernel being used for FP16 src1 (#10357)
M	ggml/src/ggml-cuda/ggml-cuda.cu

commit	ce2e59ba107cf71ed566040ff20a15d1c58e09c2	be5caccef945546ee9fd25a151330a88d785faf9	2024-11-17T12:59:38+01:00	Johannes Gäßler	CMake: fix typo in comment [no ci] (#10360)
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	be5caccef945546ee9fd25a151330a88d785faf9	20a780c7b64c38071fe70ad23e16e80c23c0147b	2024-11-17T12:25:45+01:00	Diego Devesa	llama : only use default buffer types for the KV cache (#10358)
M	ggml/src/ggml-backend.cpp
M	src/llama.cpp

commit	20a780c7b64c38071fe70ad23e16e80c23c0147b	cf32a9b93ad859ea592c31785b6bd3b4b2121463	2024-11-17T13:12:22+02:00	Georgi Gerganov	gitignore : ignore local run scripts [no ci]
M	.gitignore

commit	cf32a9b93ad859ea592c31785b6bd3b4b2121463	a43178299c2f74f14bcfc659bfd9fd32d931d1f4	2024-11-17T11:23:01+02:00	Georgi Gerganov	metal : refactor kernel args into structs (#10238)
M	Makefile
M	ggml/src/ggml-metal/CMakeLists.txt
A	ggml/src/ggml-metal/ggml-metal-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
M	ggml/src/ggml-metal/ggml-metal.metal

commit	a43178299c2f74f14bcfc659bfd9fd32d931d1f4	c3ea58aca406911eb4d409cdbfc76683393442b6	2024-11-17T21:39:22+13:00	FirstTimeEZ	ggml : fix undefined reference to 'getcpu' (#10354)
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	c3ea58aca406911eb4d409cdbfc76683393442b6	467576b6cc7d2b9220f55bc635aa51469cf26fb5	2024-11-17T09:09:55+01:00	Johannes Gäßler	CUDA: remove DMMV, consolidate F16 mult mat vec (#10318)
M	Makefile
M	docs/build.md
M	ggml/CMakeLists.txt
M	ggml/src/ggml-cuda/CMakeLists.txt
D	ggml/src/ggml-cuda/dmmv.cu
M	ggml/src/ggml-cuda/ggml-cuda.cu
A	ggml/src/ggml-cuda/mmv.cu
R055	ggml/src/ggml-cuda/dmmv.cuh	ggml/src/ggml-cuda/mmv.cuh
M	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-musa/CMakeLists.txt

commit	467576b6cc7d2b9220f55bc635aa51469cf26fb5	eda7e1d4f54711de1c9b40502d6c88bbc217da60	2024-11-17T09:06:34+01:00	Johannes Gäßler	CMake: default to -arch=native for CUDA build (#10320)
M	README.md
M	ggml/src/ggml-cuda/CMakeLists.txt

commit	eda7e1d4f54711de1c9b40502d6c88bbc217da60	24203e9dd7355a4a10bc32d959fd0148d37bf666	2024-11-17T07:31:17+01:00	Diego Devesa	ggml : fix possible buffer use after free in sched reserve (#9930)
M	ggml/src/ggml-backend.cpp

commit	24203e9dd7355a4a10bc32d959fd0148d37bf666	5d9e59979c2fd91c99d03c23e8df9c50c9d55a85	2024-11-16T23:40:39+02:00	Georgi Gerganov	ggml : inttypes.h -> cinttypes (#0)
M	ggml/src/ggml-opt.cpp
M	tests/test-opt.cpp
M	tests/test-quantize-perf.cpp

commit	5d9e59979c2fd91c99d03c23e8df9c50c9d55a85	a4200cafadebb7576a9a3905039858f5e73ce4cc	2024-11-16T21:38:01+02:00	Georgi Gerganov	ggml : adapt AMX to tensor->grad removal (#0)
M	ggml/src/ggml-amx/ggml-amx.cpp

commit	a4200cafadebb7576a9a3905039858f5e73ce4cc	84274a10c399d843cff39feb2b86dc8224f613d8	2024-11-16T21:35:31+02:00	Georgi Gerganov	make : add ggml-opt (#0)
M	Makefile

commit	84274a10c399d843cff39feb2b86dc8224f613d8	68fcb4759c0ca2874b59d9c1e6a35ceca1cc04ce	2024-11-16T21:34:03+02:00	Georgi Gerganov	tests : remove test-grad0
M	Makefile
M	tests/CMakeLists.txt
D	tests/test-grad0.cpp

commit	68fcb4759c0ca2874b59d9c1e6a35ceca1cc04ce	8a43e940ab0daaff198809bf9277289994ec62f5	2024-11-16T21:32:41+02:00	Georgi Gerganov	ggml : fix compile warnings (#0)
M	ggml/src/ggml.c

commit	8a43e940ab0daaff198809bf9277289994ec62f5	5c9a8b22b10132db620529435e3cfa49304b65cc	2024-11-16T22:17:59+02:00	Johannes Gäßler	ggml: new optimization interface (ggml/988)
M	ggml/CMakeLists.txt
M	ggml/include/ggml-backend.h
A	ggml/include/ggml-opt.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cuda/opt-step-adamw.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal/ggml-metal.m
A	ggml/src/ggml-opt.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp
M	tests/test-opt.cpp

commit	5c9a8b22b10132db620529435e3cfa49304b65cc	0fff7fd79818980763a601660f25b01a0cf4b87a	2024-11-16T22:16:04+02:00	Georgi Gerganov	scripts : update sync
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	0fff7fd79818980763a601660f25b01a0cf4b87a	4e54be0ec6cb5cd6ed56e52e927b80b2796ec844	2024-11-17T12:29:18+13:00	FirstTimeEZ	docs : vulkan build instructions to use git bash mingw64 (#10303)
M	docs/build.md

commit	4e54be0ec6cb5cd6ed56e52e927b80b2796ec844	db4cfd5dbc31c90f0d5c413a2e182d068b8ee308	2024-11-16T23:00:41+01:00	Johannes Gäßler	llama/ex: remove --logdir argument (#10339)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/README.md
M	include/llama.h
D	scripts/run-with-preset.py
M	src/llama.cpp

commit	db4cfd5dbc31c90f0d5c413a2e182d068b8ee308	8ee0d09ae6928d0501765cfc4e430b9236730caf	2024-11-16T17:58:56+02:00	Georgi Gerganov	llamafile : fix include path (#0)
M	ggml/src/ggml-cpu/llamafile/sgemm.cpp

commit	8ee0d09ae6928d0501765cfc4e430b9236730caf	bcdb7a23862b61aa307fc462fadfe1e2e653d010	2024-11-16T17:58:32+02:00	Georgi Gerganov	make : auto-determine dependencies (#0)
M	.gitignore
M	Makefile

commit	bcdb7a23862b61aa307fc462fadfe1e2e653d010	f245cc28d4eb900efad0bc740145f58d713c6e4f	2024-11-16T18:26:54+05:00	MaggotHATE	server: (web UI) Add samplers sequence customization (#10255)
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	f245cc28d4eb900efad0bc740145f58d713c6e4f	772703c8fffdd83d2e28f60119e83525f1189412	2024-11-16T10:32:50+02:00	Georgi Gerganov	scripts : fix missing key in compare-llama-bench.py (#10332)
M	scripts/compare-llama-bench.py

commit	772703c8fffdd83d2e28f60119e83525f1189412	dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c	2024-11-16T00:26:57-06:00	Jeff Bolz	vulkan: Optimize some mat-vec mul quant shaders (#10296)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp

commit	dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c	1e58ee1318429a3e97aa66f3034cdfd65ffc6c34	2024-11-16T14:59:33+13:00	FirstTimeEZ	vulkan : add cmake preset debug/release (#10306)
M	CMakePresets.json

commit	1e58ee1318429a3e97aa66f3034cdfd65ffc6c34	89e4caaaf081f4712af61a3e08cb67b406c02b80	2024-11-16T01:53:37+01:00	Dan Johansson	ggml : optimize Q4_0 into Q4_0_X_Y repack (#10324)
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c

commit	89e4caaaf081f4712af61a3e08cb67b406c02b80	74d73dc85cc2057446bf63cc37ff649ae7cebd80	2024-11-16T13:42:13+13:00	FirstTimeEZ	llama : save number of parameters and the size in llama_model (#10286)
M	src/llama.cpp

commit	74d73dc85cc2057446bf63cc37ff649ae7cebd80	4047be74da398acb8717a4d21b77b929ad7ed4f7	2024-11-16T02:57:00+05:30	Srihari-mcw	Make updates to fix issues with clang-cl builds while using AVX512 flags (#10314)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	4047be74da398acb8717a4d21b77b929ad7ed4f7	883d206fbd2c5b2b9b589a9328503b9005e146c9	2024-11-15T21:19:03+01:00	Johannes Gäßler	scripts: update compare-llama-bench.py (#10319)
M	scripts/compare-llama-bench.py

commit	883d206fbd2c5b2b9b589a9328503b9005e146c9	09ecbcb596ed8fa97d503d7440f0b3eff872e8f1	2024-11-15T20:20:54+01:00	slaren	ggml : fix some build issues
M	Makefile
M	ggml/src/ggml.c

commit	09ecbcb596ed8fa97d503d7440f0b3eff872e8f1	3225008973579cc6a784890c237e1bfc9de41819	2024-11-15T15:35:22+02:00	Georgi Gerganov	cmake : fix ppc64 check (whisper/0)
M	ggml/src/ggml-cpu/CMakeLists.txt

commit	3225008973579cc6a784890c237e1bfc9de41819	cbf5541a82952bcd7c4fceb55f5e332cafbf1720	2024-11-15T15:33:53+02:00	thewh1teagle	ggml : vulkan logs (whisper/2547)
M	ggml/src/ggml-vulkan/ggml-vulkan.cpp

commit	cbf5541a82952bcd7c4fceb55f5e332cafbf1720	18429220bdb344da1bc7df9bc580c7b41b3cd57b	2024-11-15T15:31:16+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	18429220bdb344da1bc7df9bc580c7b41b3cd57b	f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7	2024-11-15T11:47:58Z	Eve	AVX BF16 and single scale quant optimizations (#10212)
M	ggml/src/ggml-cpu/ggml-cpu-quants.c
M	ggml/src/ggml-cpu/ggml-cpu.c

commit	f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7	57f8355b29a8c7dfcd1fb6094758ad85644f8535	2024-11-15T19:47:25+08:00	R0CKSTAR	ci: build test musa with cmake (#10298)
M	.github/workflows/build.yml

commit	57f8355b29a8c7dfcd1fb6094758ad85644f8535	9901068ac78838745e604fffb4601d315a610456	2024-11-15T12:10:45+01:00	Romain Biessy	sycl: Update Intel docker images to use DPC++ 2025.0 (#10305)
M	.devops/llama-cli-intel.Dockerfile
M	.devops/llama-server-intel.Dockerfile

commit	9901068ac78838745e604fffb4601d315a610456	231f9360d94446cd083b6b116f63991b1328c484	2024-11-15T05:48:49-04:00	Xuan Son Nguyen	server : (web UI) add copy button for code block, fix api key (#10242)
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	231f9360d94446cd083b6b116f63991b1328c484	4802ad350b8e19cbc7a77269b4494c896f6e0896	2024-11-15T15:09:35+08:00	Chenguang Li	cann: dockerfile and doc adjustment (#10302)
M	.devops/llama-cli-cann.Dockerfile
M	docs/build.md

commit	4802ad350b8e19cbc7a77269b4494c896f6e0896	5a54af4d4f588f109f31e456483fdf77096399d9	2024-11-15T08:38:43+02:00	Georgi Gerganov	scripts : fix regex in sync [no ci]
M	scripts/sync-ggml-am.sh

commit	5a54af4d4f588f109f31e456483fdf77096399d9	1607a5e5b08f4e55f118af3d7de325949d8f1835	2024-11-15T04:09:12+01:00	Romain Biessy	sycl: Use syclcompat::dp4a (#10267)
M	.github/workflows/build.yml
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	1607a5e5b08f4e55f118af3d7de325949d8f1835	ae8de6d50a09d49545e0afab2e50cc4acfb280e2	2024-11-15T01:28:50+01:00	Charles Xu	backend cpu: add online flow for aarch64 Q4_0 GEMV/GEMM kernels (#9921)
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cpu.h
M	ggml/src/ggml-cpu/CMakeLists.txt
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.c
M	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
M	ggml/src/ggml-cpu/ggml-cpu.c
M	ggml/src/ggml-cpu/ggml-cpu.cpp
M	src/llama.cpp

commit	ae8de6d50a09d49545e0afab2e50cc4acfb280e2	4a8ccb37ad9c9027cbcfd5548c19cdffe48d5197	2024-11-14T18:04:35+01:00	Diego Devesa	ggml : build backends as libraries (#10256)
M	.devops/llama-cli-cuda.Dockerfile
M	.devops/llama-cli-musa.Dockerfile
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-musa.Dockerfile
M	.devops/nix/package.nix
M	.github/workflows/build.yml
M	.gitmodules
M	CMakeLists.txt
M	Makefile
M	Package.swift
M	cmake/llama-config.cmake.in
M	common/common.cpp
M	docs/build.md
M	examples/llama-bench/llama-bench.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	ggml/CMakeLists.txt
M	ggml/include/ggml-amx.h
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-blas.h
M	ggml/include/ggml-cann.h
M	ggml/include/ggml-cpu.h
M	ggml/include/ggml-cuda.h
M	ggml/include/ggml-kompute.h
M	ggml/include/ggml-metal.h
M	ggml/include/ggml-rpc.h
M	ggml/include/ggml-sycl.h
M	ggml/include/ggml-vulkan.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-aarch64.h
A	ggml/src/ggml-amx/CMakeLists.txt
M	ggml/src/ggml-amx/common.h
R098	ggml/src/ggml-amx.cpp	ggml/src/ggml-amx/ggml-amx.cpp
M	ggml/src/ggml-amx/mmq.cpp
A	ggml/src/ggml-backend-reg.cpp
M	ggml/src/ggml-backend.cpp
A	ggml/src/ggml-blas/CMakeLists.txt
R099	ggml/src/ggml-blas.cpp	ggml/src/ggml-blas/ggml-blas.cpp
A	ggml/src/ggml-cann/CMakeLists.txt
R100	ggml/src/ggml-cann.cpp	ggml/src/ggml-cann/ggml-cann.cpp
A	ggml/src/ggml-cpu/CMakeLists.txt
R100	ggml/cmake/FindSIMD.cmake	ggml/src/ggml-cpu/cmake/FindSIMD.cmake
A	ggml/src/ggml-cpu/ggml-cpu-aarch64.c
A	ggml/src/ggml-cpu/ggml-cpu-aarch64.h
R052	ggml/src/ggml-cpu-impl.h	ggml/src/ggml-cpu/ggml-cpu-impl.h
A	ggml/src/ggml-cpu/ggml-cpu-quants.c
A	ggml/src/ggml-cpu/ggml-cpu-quants.h
R099	ggml/src/ggml-cpu.c	ggml/src/ggml-cpu/ggml-cpu.c
A	ggml/src/ggml-cpu/ggml-cpu.cpp
R100	ggml/src/llamafile/sgemm.cpp	ggml/src/ggml-cpu/llamafile/sgemm.cpp
R100	ggml/src/llamafile/sgemm.h	ggml/src/ggml-cpu/llamafile/sgemm.h
A	ggml/src/ggml-cuda/CMakeLists.txt
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
R099	ggml/src/ggml-cuda.cu	ggml/src/ggml-cuda/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/sum.cu
A	ggml/src/ggml-hip/CMakeLists.txt
M	ggml/src/ggml-impl.h
A	ggml/src/ggml-kompute/CMakeLists.txt
R100	ggml/src/ggml-kompute.cpp	ggml/src/ggml-kompute/ggml-kompute.cpp
R100	ggml/src/kompute	ggml/src/ggml-kompute/kompute
R100	ggml/src/kompute-shaders/common.comp	ggml/src/ggml-kompute/kompute-shaders/common.comp
R100	ggml/src/kompute-shaders/op_add.comp	ggml/src/ggml-kompute/kompute-shaders/op_add.comp
R100	ggml/src/kompute-shaders/op_addrow.comp	ggml/src/ggml-kompute/kompute-shaders/op_addrow.comp
R100	ggml/src/kompute-shaders/op_cpy_f16_f16.comp	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f16_f16.comp
R100	ggml/src/kompute-shaders/op_cpy_f16_f32.comp	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f16_f32.comp
R100	ggml/src/kompute-shaders/op_cpy_f32_f16.comp	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f32_f16.comp
R100	ggml/src/kompute-shaders/op_cpy_f32_f32.comp	ggml/src/ggml-kompute/kompute-shaders/op_cpy_f32_f32.comp
R100	ggml/src/kompute-shaders/op_diagmask.comp	ggml/src/ggml-kompute/kompute-shaders/op_diagmask.comp
R100	ggml/src/kompute-shaders/op_gelu.comp	ggml/src/ggml-kompute/kompute-shaders/op_gelu.comp
R100	ggml/src/kompute-shaders/op_getrows.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows.comp
R100	ggml/src/kompute-shaders/op_getrows_f16.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows_f16.comp
R100	ggml/src/kompute-shaders/op_getrows_f32.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows_f32.comp
R100	ggml/src/kompute-shaders/op_getrows_q4_0.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q4_0.comp
R100	ggml/src/kompute-shaders/op_getrows_q4_1.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q4_1.comp
R100	ggml/src/kompute-shaders/op_getrows_q6_k.comp	ggml/src/ggml-kompute/kompute-shaders/op_getrows_q6_k.comp
R100	ggml/src/kompute-shaders/op_mul.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul.comp
R100	ggml/src/kompute-shaders/op_mul_mat_f16.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_f16.comp
R100	ggml/src/kompute-shaders/op_mul_mat_mat_f32.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_mat_f32.comp
R100	ggml/src/kompute-shaders/op_mul_mat_q4_0.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_0.comp
R100	ggml/src/kompute-shaders/op_mul_mat_q4_1.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_1.comp
R100	ggml/src/kompute-shaders/op_mul_mat_q4_k.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q4_k.comp
R100	ggml/src/kompute-shaders/op_mul_mat_q6_k.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q6_k.comp
R100	ggml/src/kompute-shaders/op_mul_mat_q8_0.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mat_q8_0.comp
R100	ggml/src/kompute-shaders/op_mul_mv_q_n.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n.comp
R100	ggml/src/kompute-shaders/op_mul_mv_q_n_pre.comp	ggml/src/ggml-kompute/kompute-shaders/op_mul_mv_q_n_pre.comp
R100	ggml/src/kompute-shaders/op_norm.comp	ggml/src/ggml-kompute/kompute-shaders/op_norm.comp
R100	ggml/src/kompute-shaders/op_relu.comp	ggml/src/ggml-kompute/kompute-shaders/op_relu.comp
R100	ggml/src/kompute-shaders/op_rmsnorm.comp	ggml/src/ggml-kompute/kompute-shaders/op_rmsnorm.comp
R100	ggml/src/kompute-shaders/op_rope_f16.comp	ggml/src/ggml-kompute/kompute-shaders/op_rope_f16.comp
R100	ggml/src/kompute-shaders/op_rope_f32.comp	ggml/src/ggml-kompute/kompute-shaders/op_rope_f32.comp
R100	ggml/src/kompute-shaders/op_scale.comp	ggml/src/ggml-kompute/kompute-shaders/op_scale.comp
R100	ggml/src/kompute-shaders/op_scale_8.comp	ggml/src/ggml-kompute/kompute-shaders/op_scale_8.comp
R100	ggml/src/kompute-shaders/op_silu.comp	ggml/src/ggml-kompute/kompute-shaders/op_silu.comp
R100	ggml/src/kompute-shaders/op_softmax.comp	ggml/src/ggml-kompute/kompute-shaders/op_softmax.comp
R100	ggml/src/kompute-shaders/rope_common.comp	ggml/src/ggml-kompute/kompute-shaders/rope_common.comp
A	ggml/src/ggml-metal/CMakeLists.txt
R099	ggml/src/ggml-metal.m	ggml/src/ggml-metal/ggml-metal.m
R099	ggml/src/ggml-metal.metal	ggml/src/ggml-metal/ggml-metal.metal
A	ggml/src/ggml-musa/CMakeLists.txt
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
A	ggml/src/ggml-rpc/CMakeLists.txt
R099	ggml/src/ggml-rpc.cpp	ggml/src/ggml-rpc/ggml-rpc.cpp
A	ggml/src/ggml-sycl/CMakeLists.txt
R100	ggml/src/ggml-sycl.cpp	ggml/src/ggml-sycl/ggml-sycl.cpp
A	ggml/src/ggml-threading.cpp
A	ggml/src/ggml-threading.h
A	ggml/src/ggml-vulkan/CMakeLists.txt
R100	ggml/src/ggml-vulkan.cpp	ggml/src/ggml-vulkan/ggml-vulkan.cpp
R100	ggml/src/vulkan-shaders/CMakeLists.txt	ggml/src/ggml-vulkan/vulkan-shaders/CMakeLists.txt
R100	ggml/src/vulkan-shaders/acc.comp	ggml/src/ggml-vulkan/vulkan-shaders/acc.comp
R100	ggml/src/vulkan-shaders/add.comp	ggml/src/ggml-vulkan/vulkan-shaders/add.comp
R100	ggml/src/vulkan-shaders/argsort.comp	ggml/src/ggml-vulkan/vulkan-shaders/argsort.comp
R100	ggml/src/vulkan-shaders/clamp.comp	ggml/src/ggml-vulkan/vulkan-shaders/clamp.comp
R100	ggml/src/vulkan-shaders/concat.comp	ggml/src/ggml-vulkan/vulkan-shaders/concat.comp
R100	ggml/src/vulkan-shaders/contig_copy.comp	ggml/src/ggml-vulkan/vulkan-shaders/contig_copy.comp
R100	ggml/src/vulkan-shaders/copy.comp	ggml/src/ggml-vulkan/vulkan-shaders/copy.comp
R100	ggml/src/vulkan-shaders/cos.comp	ggml/src/ggml-vulkan/vulkan-shaders/cos.comp
R100	ggml/src/vulkan-shaders/dequant_f32.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_f32.comp
R100	ggml/src/vulkan-shaders/dequant_funcs.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_funcs.comp
R100	ggml/src/vulkan-shaders/dequant_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_head.comp
R100	ggml/src/vulkan-shaders/dequant_iq4_nl.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_iq4_nl.comp
R100	ggml/src/vulkan-shaders/dequant_q2_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q2_k.comp
R100	ggml/src/vulkan-shaders/dequant_q3_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q3_k.comp
R100	ggml/src/vulkan-shaders/dequant_q4_0.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_0.comp
R100	ggml/src/vulkan-shaders/dequant_q4_1.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_1.comp
R100	ggml/src/vulkan-shaders/dequant_q4_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q4_k.comp
R100	ggml/src/vulkan-shaders/dequant_q5_0.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_0.comp
R100	ggml/src/vulkan-shaders/dequant_q5_1.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_1.comp
R100	ggml/src/vulkan-shaders/dequant_q5_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q5_k.comp
R100	ggml/src/vulkan-shaders/dequant_q6_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q6_k.comp
R100	ggml/src/vulkan-shaders/dequant_q8_0.comp	ggml/src/ggml-vulkan/vulkan-shaders/dequant_q8_0.comp
R100	ggml/src/vulkan-shaders/diag_mask_inf.comp	ggml/src/ggml-vulkan/vulkan-shaders/diag_mask_inf.comp
R100	ggml/src/vulkan-shaders/div.comp	ggml/src/ggml-vulkan/vulkan-shaders/div.comp
R100	ggml/src/vulkan-shaders/gelu.comp	ggml/src/ggml-vulkan/vulkan-shaders/gelu.comp
R100	ggml/src/vulkan-shaders/gelu_quick.comp	ggml/src/ggml-vulkan/vulkan-shaders/gelu_quick.comp
R100	ggml/src/vulkan-shaders/generic_binary_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_binary_head.comp
R100	ggml/src/vulkan-shaders/generic_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_head.comp
R100	ggml/src/vulkan-shaders/generic_unary_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/generic_unary_head.comp
R100	ggml/src/vulkan-shaders/get_rows.comp	ggml/src/ggml-vulkan/vulkan-shaders/get_rows.comp
R100	ggml/src/vulkan-shaders/get_rows_quant.comp	ggml/src/ggml-vulkan/vulkan-shaders/get_rows_quant.comp
R100	ggml/src/vulkan-shaders/group_norm.comp	ggml/src/ggml-vulkan/vulkan-shaders/group_norm.comp
R100	ggml/src/vulkan-shaders/im2col.comp	ggml/src/ggml-vulkan/vulkan-shaders/im2col.comp
R100	ggml/src/vulkan-shaders/leaky_relu.comp	ggml/src/ggml-vulkan/vulkan-shaders/leaky_relu.comp
R100	ggml/src/vulkan-shaders/mul.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul.comp
R100	ggml/src/vulkan-shaders/mul_mat_split_k_reduce.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_split_k_reduce.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_base.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_base.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_nc.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_nc.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_p021.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_p021.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_q2_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q2_k.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_q3_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q3_k.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_q4_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q4_k.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_q5_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q5_k.comp
R100	ggml/src/vulkan-shaders/mul_mat_vec_q6_k.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mat_vec_q6_k.comp
R100	ggml/src/vulkan-shaders/mul_mm.comp	ggml/src/ggml-vulkan/vulkan-shaders/mul_mm.comp
R100	ggml/src/vulkan-shaders/norm.comp	ggml/src/ggml-vulkan/vulkan-shaders/norm.comp
R100	ggml/src/vulkan-shaders/pad.comp	ggml/src/ggml-vulkan/vulkan-shaders/pad.comp
R100	ggml/src/vulkan-shaders/pool2d.comp	ggml/src/ggml-vulkan/vulkan-shaders/pool2d.comp
R100	ggml/src/vulkan-shaders/relu.comp	ggml/src/ggml-vulkan/vulkan-shaders/relu.comp
R100	ggml/src/vulkan-shaders/repeat.comp	ggml/src/ggml-vulkan/vulkan-shaders/repeat.comp
R100	ggml/src/vulkan-shaders/rms_norm.comp	ggml/src/ggml-vulkan/vulkan-shaders/rms_norm.comp
R100	ggml/src/vulkan-shaders/rope_head.comp	ggml/src/ggml-vulkan/vulkan-shaders/rope_head.comp
R100	ggml/src/vulkan-shaders/rope_neox.comp	ggml/src/ggml-vulkan/vulkan-shaders/rope_neox.comp
R100	ggml/src/vulkan-shaders/rope_norm.comp	ggml/src/ggml-vulkan/vulkan-shaders/rope_norm.comp
R100	ggml/src/vulkan-shaders/scale.comp	ggml/src/ggml-vulkan/vulkan-shaders/scale.comp
R100	ggml/src/vulkan-shaders/silu.comp	ggml/src/ggml-vulkan/vulkan-shaders/silu.comp
R100	ggml/src/vulkan-shaders/sin.comp	ggml/src/ggml-vulkan/vulkan-shaders/sin.comp
R100	ggml/src/vulkan-shaders/soft_max.comp	ggml/src/ggml-vulkan/vulkan-shaders/soft_max.comp
R100	ggml/src/vulkan-shaders/square.comp	ggml/src/ggml-vulkan/vulkan-shaders/square.comp
R100	ggml/src/vulkan-shaders/sum_rows.comp	ggml/src/ggml-vulkan/vulkan-shaders/sum_rows.comp
R100	ggml/src/vulkan-shaders/tanh.comp	ggml/src/ggml-vulkan/vulkan-shaders/tanh.comp
R100	ggml/src/vulkan-shaders/timestep_embedding.comp	ggml/src/ggml-vulkan/vulkan-shaders/timestep_embedding.comp
R100	ggml/src/vulkan-shaders/types.comp	ggml/src/ggml-vulkan/vulkan-shaders/types.comp
R100	ggml/src/vulkan-shaders/upscale.comp	ggml/src/ggml-vulkan/vulkan-shaders/upscale.comp
R100	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp	ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
M	ggml/src/ggml.c
M	pocs/vdot/vdot.cpp
M	src/CMakeLists.txt
M	src/llama.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	4a8ccb37ad9c9027cbcfd5548c19cdffe48d5197	2a82891a853db908679f7b24b04586e6f6393fe0	2024-11-14T13:00:15+01:00	Johannes Gäßler	CUDA: no -sm row for very small matrices (#10185)
M	ggml/src/ggml-cuda.cu

commit	2a82891a853db908679f7b24b04586e6f6393fe0	af148c9386da825a60c7038549c121c35ca56b50	2024-11-14T11:44:15+02:00	Georgi Gerganov	speculative : fix out-of-bounds access (#10289)
M	examples/speculative/speculative.cpp

commit	af148c9386da825a60c7038549c121c35ca56b50	66798e42fbe636f1cb6236e4bc30939d23ef7c25	2024-11-13T23:22:55-06:00	Jeff Bolz	vulkan: Optimize binary ops (#10270)
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/acc.comp
M	ggml/src/vulkan-shaders/add.comp
M	ggml/src/vulkan-shaders/concat.comp
M	ggml/src/vulkan-shaders/div.comp
M	ggml/src/vulkan-shaders/generic_binary_head.comp
M	ggml/src/vulkan-shaders/get_rows.comp
M	ggml/src/vulkan-shaders/get_rows_quant.comp
M	ggml/src/vulkan-shaders/mul.comp

commit	66798e42fbe636f1cb6236e4bc30939d23ef7c25	fb4a0ec0833c71cff5a1a367ba375447ce6106eb	2024-11-13T14:59:47-06:00	Jeff Bolz	vulkan: Use macros to make the mat mul pipeline creation more concise (#10259)
M	ggml/src/ggml-vulkan.cpp

commit	fb4a0ec0833c71cff5a1a367ba375447ce6106eb	5ea926dad7f62ebccff7b24784bd1e01a06d13ae	2024-11-13T20:00:35+02:00	Michael Podvitskiy	llama : propagate the results of `graph_compute` (#9525)
M	include/llama.h
M	src/llama.cpp

commit	5ea926dad7f62ebccff7b24784bd1e01a06d13ae	1ee9eea094fe5846c7d8d770aa7caa749d246b23	2024-11-13T18:11:54+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1ee9eea094fe5846c7d8d770aa7caa749d246b23	ff7fb670d0a62897c5662536aeb53422c549fbe8	2024-11-13T19:17:10+08:00	Small Grass Forest	docs : update bindings list (#10261)
M	README.md

commit	ff7fb670d0a62897c5662536aeb53422c549fbe8	0e712a5acbbdd1593e5aeb86d4f6b896a11b438c	2024-11-13T11:16:30Z	Alexey Parfenov	server : add missing docs (#10269)
M	examples/server/README.md

commit	0e712a5acbbdd1593e5aeb86d4f6b896a11b438c	a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d	2024-11-13T19:15:23+08:00	Jhen-Jie Hong	server : fix incorrect res in validate_model_chat_template (#10272)
M	examples/server/server.cpp

commit	a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d	2e82ffa4af29f87e7d3d6dff8060a2a79613b72f	2024-11-13T21:10:38+11:00	Brian	metadata: Detailed Dataset Authorship Metadata (#8875)
M	examples/convert_legacy_llama.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/metadata.py
M	gguf-py/tests/test_metadata.py

commit	2e82ffa4af29f87e7d3d6dff8060a2a79613b72f	80dd7ff22fd050fed58b552cc8001aaf968b7ebf	2024-11-13T09:40:57Z	Alberto Cabrera Pérez	sycl : Fixes to broken builds and test-backend-ops (#10257)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/outprod.cpp

commit	80dd7ff22fd050fed58b552cc8001aaf968b7ebf	54ef9cfc726a799e6f454ac22c4815d037716eda	2024-11-13T00:58:57-06:00	Jeff Bolz	vulkan: Optimize contiguous copies (#10254)
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/clamp.comp
A	ggml/src/vulkan-shaders/contig_copy.comp
M	ggml/src/vulkan-shaders/copy.comp
M	ggml/src/vulkan-shaders/cos.comp
M	ggml/src/vulkan-shaders/generic_unary_head.comp
M	ggml/src/vulkan-shaders/pad.comp
M	ggml/src/vulkan-shaders/repeat.comp
M	ggml/src/vulkan-shaders/scale.comp
M	ggml/src/vulkan-shaders/sin.comp
M	ggml/src/vulkan-shaders/square.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp
M	tests/test-backend-ops.cpp

commit	54ef9cfc726a799e6f454ac22c4815d037716eda	b0cefea58a20020754b7431e3c725625274372a5	2024-11-11T11:13:51-06:00	Jeff Bolz	vulkan: Throttle the number of shader compiles during the build step. (#10222)
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	b0cefea58a20020754b7431e3c725625274372a5	b141e5f6efbab3a00633df88c4f9425bfe8b78ab	2024-11-11T08:39:13+02:00	Georgi Gerganov	metal : more precise Q*K in FA vec kernel (#10247)
M	ggml/src/ggml-metal.metal

commit	b141e5f6efbab3a00633df88c4f9425bfe8b78ab	4b3a9212b602be3d4e2e3ca26efd796cef13c55e	2024-11-11T08:38:43+02:00	Georgi Gerganov	server : enable KV cache defrag by default (#10233)
M	common/common.h
M	examples/server/README.md

commit	4b3a9212b602be3d4e2e3ca26efd796cef13c55e	505f33274d60676320216b662a97672a76ec600e	2024-11-10T21:45:25+02:00	Georgi Gerganov	flake.lock: Update (#10243)
M	flake.lock

commit	505f33274d60676320216b662a97672a76ec600e	160687b3ed002eee83a04de83a9cd752f928ced1	2024-11-11T00:42:25+05:00	MaggotHATE	server : (web UI) Add back sampler settings (#10239)
M	examples/server/public/index.html

commit	160687b3ed002eee83a04de83a9cd752f928ced1	6423c65aa8be1b98f990cf207422505ac5a441a1	2024-11-10T05:37:56-06:00	Jeff Bolz	vulkan: Fix newly added tests for permuted mul_mat and 1D im2col (#10226)
M	ggml/src/ggml-vulkan.cpp

commit	6423c65aa8be1b98f990cf207422505ac5a441a1	39a334a9aaf2000f93a899d9f43d889e460640ee	2024-11-09T11:53:13+02:00	Georgi Gerganov	metal : reorder write loop in mul mat kernel + style (#10231)
M	ggml/src/ggml-metal.metal

commit	39a334a9aaf2000f93a899d9f43d889e460640ee	bb38cdd8baf37de1fadab3e867c6ba4ae452eff6	2024-11-09T11:53:02+02:00	Georgi Gerganov	metal : fix build and some more comments (#10229)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal

commit	bb38cdd8baf37de1fadab3e867c6ba4ae452eff6	f018acba22095b8995bf6c5ef815b16a3ce4cf1b	2024-11-09T11:52:45+02:00	Georgi Gerganov	metal : fix F32 accumulation in FA vec kernel (#10232)
M	ggml/src/ggml-metal.metal

commit	f018acba22095b8995bf6c5ef815b16a3ce4cf1b	46323fa9efd5e6c8aeef8d6eb6c332ee0d95eb13	2024-11-09T11:26:34+02:00	Georgi Gerganov	llama : fix Qwen model type strings
M	src/llama.cpp

commit	46323fa9efd5e6c8aeef8d6eb6c332ee0d95eb13	5b359bb1e3585de45bec79fd6c18934897662cdf	2024-11-09T11:21:49+02:00	Georgi Gerganov	metal : hide debug messages from normal log
M	ggml/src/ggml-metal.m

commit	5b359bb1e3585de45bec79fd6c18934897662cdf	e89213492d3e01705739789733f0f2d250b4c449	2024-11-09T15:35:46+08:00	SXX	ggml: fix zero division in ‘dne’ calculation in CUDA COUNT_EQUAL operator when ‘ne’ is small (#10213)
M	ggml/src/ggml-cuda/count-equal.cu

commit	e89213492d3e01705739789733f0f2d250b4c449	8fc393f246c550d2481e53323a47644a94e8d01f	2024-11-09T12:47:50+05:30	amritahs-ibm	ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
M	ggml/src/CMakeLists.txt
M	ggml/src/llamafile/sgemm.cpp

commit	8fc393f246c550d2481e53323a47644a94e8d01f	ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf	2024-11-09T15:06:54+08:00	haopeng	scripts : fix pattern and get n_tokens in one go (#10221)
M	examples/chat-persistent.sh

commit	ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf	695ad752b2631af84ba321177656705b30c6e401	2024-11-08T21:59:46+02:00	Georgi Gerganov	metal : opt-in compile flag for BF16 (#10218)
M	.github/workflows/build.yml
M	Makefile
M	ci/run.sh
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal

commit	695ad752b2631af84ba321177656705b30c6e401	841f27abdbbcecc9daac14dc540ba6202e4ffe40	2024-11-08T18:37:41+02:00	Georgi Gerganov	metal : improve clarity (minor) (#10171)
M	ggml/src/ggml-metal.metal

commit	841f27abdbbcecc9daac14dc540ba6202e4ffe40	d05b3127bd30515955aa4ee2bacdb68ebafe88f4	2024-11-08T13:47:22+02:00	Georgi Gerganov	metal : optimize FA kernels (#10171)
M	examples/llama-bench/llama-bench.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	d05b3127bd30515955aa4ee2bacdb68ebafe88f4	76c6e7f10551960e4ec9e14e0535b72081f1c7ad	2024-11-08T17:34:06+08:00	Jhen-Jie Hong	swift : exclude ggml-metal-embed.metal (#10211)
M	Package.swift

commit	76c6e7f10551960e4ec9e14e0535b72081f1c7ad	a71d81cf8c1afb26b166f897c94ee1581f9fac7d	2024-11-07T18:44:38-04:00	Xuan Son Nguyen	server : minor UI fix (#10207)
M	examples/server/public/index.html

commit	a71d81cf8c1afb26b166f897c94ee1581f9fac7d	eec4d71737b32f312e0082b671629a0368e1a20d	2024-11-07T17:31:10-04:00	Xuan Son Nguyen	server : revamp chat UI with vuejs and daisyui (#10175)
M	.editorconfig
M	Makefile
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/chat.mjs
M	examples/server/deps.sh
M	examples/server/public/completion.js
A	examples/server/public/deps_daisyui.min.css
A	examples/server/public/deps_markdown-it.js
A	examples/server/public/deps_tailwindcss.js
A	examples/server/public/deps_vue.esm-browser.js
M	examples/server/public/index.html
R100	examples/server/public/colorthemes.css	examples/server/public_legacy/colorthemes.css
A	examples/server/public_legacy/completion.js
R100	examples/server/public/favicon.ico	examples/server/public_legacy/favicon.ico
R100	examples/server/public/index-new.html	examples/server/public_legacy/index-new.html
A	examples/server/public_legacy/index.html
R100	examples/server/public/index.js	examples/server/public_legacy/index.js
R100	examples/server/public/json-schema-to-grammar.mjs	examples/server/public_legacy/json-schema-to-grammar.mjs
A	examples/server/public_legacy/loading.html
R100	examples/server/public/prompt-formats.js	examples/server/public_legacy/prompt-formats.js
R100	examples/server/public/style.css	examples/server/public_legacy/style.css
R100	examples/server/public/system-prompts.js	examples/server/public_legacy/system-prompts.js
R100	examples/server/public/theme-beeninorder.css	examples/server/public_legacy/theme-beeninorder.css
R100	examples/server/public/theme-ketivah.css	examples/server/public_legacy/theme-ketivah.css
R100	examples/server/public/theme-mangotango.css	examples/server/public_legacy/theme-mangotango.css
R100	examples/server/public/theme-playground.css	examples/server/public_legacy/theme-playground.css
R100	examples/server/public/theme-polarnight.css	examples/server/public_legacy/theme-polarnight.css
R100	examples/server/public/theme-snowstorm.css	examples/server/public_legacy/theme-snowstorm.css
M	examples/server/server.cpp
M	examples/server/tests/features/security.feature
M	grammars/README.md
M	tests/run-json-schema-to-grammar.mjs

commit	eec4d71737b32f312e0082b671629a0368e1a20d	3b08828674f561c78af182d47fc0636fc3ccd1e9	2024-11-07T23:11:36+02:00	Georgi Gerganov	scripts : add amx to sync-ggml.sh [no ci]
M	scripts/sync-ggml.sh

commit	3b08828674f561c78af182d47fc0636fc3ccd1e9	a2c6fd747c77fe183e2f556a4a2f1fb0a0be4c7b	2024-11-07T23:08:24+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a2c6fd747c77fe183e2f556a4a2f1fb0a0be4c7b	97404c4a0374cac45c8c34a32d13819de1dd023d	2024-11-07T23:07:55+02:00	Georgi Gerganov	scripts : sync update
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	97404c4a0374cac45c8c34a32d13819de1dd023d	60e17ce23c2740369af6304113a2dfa0454eaf26	2024-11-07T18:16:08+01:00	Diego Devesa	ggml : add ggml-cpu.h to the public headers (#10204)
M	ggml/CMakeLists.txt

commit	60e17ce23c2740369af6304113a2dfa0454eaf26	5107e8cea35be46a27cfc940e6841c0cf81c0525	2024-11-07T11:46:12-05:00	Faisal Zaghloul	Remove identical wte/etw logic for jais (#10203)
M	convert_hf_to_gguf.py

commit	5107e8cea35be46a27cfc940e6841c0cf81c0525	2319126a70b541f8670225a04a38202bbdccbedb	2024-11-07T08:20:25-07:00	wwoodsTM	DRY: Fixes clone functionality (#10192)
M	src/llama-sampling.cpp

commit	2319126a70b541f8670225a04a38202bbdccbedb	3bcd40b3c593d14261fb2abfabad3c0fb5b9e318	2024-11-07T02:02:08-06:00	snadampal	fix q4_0_8_8 format for corrupted tokens issue (#10198)
M	ggml/src/ggml-cpu.c

commit	3bcd40b3c593d14261fb2abfabad3c0fb5b9e318	5c333e014059122245c318e7ed4ec27d1085573c	2024-11-07T18:19:10+11:00	Zhiyuan Li	Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133)
M	docs/backend/SYCL.md
M	ggml/include/ggml.h
M	ggml/src/ggml-cpu.c
M	ggml/src/ggml-cuda.cu
D	ggml/src/ggml-cuda/rwkv-wkv.cuh
R093	ggml/src/ggml-cuda/rwkv-wkv.cu	ggml/src/ggml-cuda/wkv6.cu
A	ggml/src/ggml-cuda/wkv6.cuh
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/concat.cpp
A	ggml/src/ggml-sycl/element_wise.cpp
A	ggml/src/ggml-sycl/element_wise.hpp
A	ggml/src/ggml-sycl/outprod.cpp
A	ggml/src/ggml-sycl/outprod.hpp
M	ggml/src/ggml-sycl/presets.hpp
A	ggml/src/ggml-sycl/wkv6.cpp
A	ggml/src/ggml-sycl/wkv6.hpp
M	ggml/src/ggml.c
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	5c333e014059122245c318e7ed4ec27d1085573c	b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46	2024-11-06T19:53:51+02:00	Georgi Gerganov	metal : add BF16 support (#8439)
M	common/common.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46	94d8cb8be13b7c4d04eeca5a2b956b9148e6f222	2024-11-06T13:29:01+02:00	Georgi Gerganov	server : remove hack for extra parallel slot (#10187)
M	examples/server/server.cpp

commit	94d8cb8be13b7c4d04eeca5a2b956b9148e6f222	1dc04b2deed2d2f2ae3aff9b14ae29674dee1fb8	2024-11-06T12:10:07+01:00	Diego Devesa	metal : fix from ptr buffer name (#10189)
M	ggml/src/ggml-metal.m
M	src/llama.cpp

commit	1dc04b2deed2d2f2ae3aff9b14ae29674dee1fb8	a1eaf6a9600bb1608753420ba886a3b0a208ffc0	2024-11-06T11:20:10+02:00	Georgi Gerganov	ggml : adjust is_first_call init value (#10193)
M	ggml/src/ggml.c

commit	a1eaf6a9600bb1608753420ba886a3b0a208ffc0	b8deef0ec0af5febac1d2cfd9119ff330ed0b762	2024-11-06T10:24:23+02:00	Georgi Gerganov	metal : add quantized FA support (#10149)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal

commit	b8deef0ec0af5febac1d2cfd9119ff330ed0b762	a9e8a9a0306a8093eef93b0022d9f45510490072	2024-11-05T05:23:04-07:00	Gabe Goodhart	llama : add <|tool_call|> formatting to Granite template (#10177)
M	src/llama.cpp

commit	a9e8a9a0306a8093eef93b0022d9f45510490072	340736477651095a98a3b10e19b038ec62593a1d	2024-11-04T23:17:01+01:00	Diego Devesa	ggml : fix arch check in bf16_to_fp32 (#10164)
M	ggml/src/ggml.c

commit	340736477651095a98a3b10e19b038ec62593a1d	d5a409e57fe8bd24fef597ab8a31110d390a6392	2024-11-04T22:06:31Z	Eve	Q6_K AVX improvements (#10118)
M	.github/workflows/build.yml
M	ggml/src/ggml-quants.c

commit	d5a409e57fe8bd24fef597ab8a31110d390a6392	401558b7ba7a08175c153cd3607230f63c8a528e	2024-11-04T20:06:58+01:00	Diego Devesa	ggml : fix gelu tables initialization (#10172)
M	ggml/src/ggml-cpu.c

commit	401558b7ba7a08175c153cd3607230f63c8a528e	9e0ecfb697d297355e43c20559d29bcc71beb0c3	2024-11-04T17:34:08+01:00	Diego Devesa	ggml : fix q4xx mat mul, increase ggml_aligned_malloc alignment (#10167)
M	ggml/src/ggml-cpu.c
M	ggml/src/ggml.c

commit	9e0ecfb697d297355e43c20559d29bcc71beb0c3	6a066b9978533e2ab9890b7f4f8c0262d91798b3	2024-11-04T16:33:29+01:00	Xuan Son Nguyen	server : clarify /slots endpoint, add is_processing (#10162)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/steps/steps.py

commit	6a066b9978533e2ab9890b7f4f8c0262d91798b3	ea02c753ebf9342114cb173f10b3ffc2af1e7d04	2024-11-04T09:08:33-06:00	snadampal	fix build break on arm64 linux (#10166)
M	ggml/src/ggml-quants.c

commit	ea02c753ebf9342114cb173f10b3ffc2af1e7d04	05697f670b1ea28b80c39854832ea53527f75c55	2024-11-04T13:10:23+01:00	Diego Devesa	cuda : clear error after changing peer access (#10153)
M	ggml/src/ggml-cuda.cu

commit	05697f670b1ea28b80c39854832ea53527f75c55	f8e58135cff1c373df2934306f9c9da99673c2ed	2024-11-04T13:49:34+02:00	Georgi Gerganov	metal : simplify f16 and f32 dequant kernels (#0)
M	ggml/src/ggml-metal.metal

commit	f8e58135cff1c373df2934306f9c9da99673c2ed	329ed914c959c510d076fb06b43eeb3f7b804d6f	2024-11-04T13:43:32+02:00	Georgi Gerganov	metal : move dequantize templates to beginning of MSL source (#0)
M	ggml/src/ggml-metal.metal

commit	329ed914c959c510d076fb06b43eeb3f7b804d6f	ce027adfb3b131f0d2368294fc276bb0e342b3f6	2024-11-04T19:08:22+08:00	leo-pony	CANN: adjust backend registry refactor. (#10158)
M	ggml/src/ggml-cann.cpp

commit	ce027adfb3b131f0d2368294fc276bb0e342b3f6	284e5b0275cc1292096e72e808e41d17e8cdf019	2024-11-04T10:33:37+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	284e5b0275cc1292096e72e808e41d17e8cdf019	e2292aaa17cf8530b0d0d899909588c3a095799d	2024-11-02T05:09:12-04:00	Yuri Khrustalev	cmake : make it possible linking ggml as external lib (ggml/1003)
M	ggml/src/CMakeLists.txt

commit	e2292aaa17cf8530b0d0d899909588c3a095799d	9f409893519b4a6def46ef80cd6f5d05ac0fb157	2024-11-01T16:55:10+02:00	Plamen Minev	metal : fix minor string leaks (ggml/1004)
M	ggml/src/ggml-metal.m

commit	9f409893519b4a6def46ef80cd6f5d05ac0fb157	08828a6d7d0006a487c9655ba8ace0ebe35ecad1	2024-11-03T19:34:08+01:00	Diego Devesa	ggml : move CPU backend to a separate file (#10144)
M	Makefile
M	Package.swift
M	common/CMakeLists.txt
M	common/common.cpp
D	common/train.cpp
D	common/train.h
M	examples/CMakeLists.txt
D	examples/baby-llama/CMakeLists.txt
D	examples/baby-llama/baby-llama.cpp
M	examples/llava/clip.cpp
M	examples/rpc/rpc-server.cpp
M	ggml/include/ggml-backend.h
A	ggml/include/ggml-cpu.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-backend.cpp
A	ggml/src/ggml-cpu.c
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml.c
M	include/llama.h
M	pocs/vdot/q8dot.cpp
M	pocs/vdot/vdot.cpp
A	spm-headers/ggml-cpu.h
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-barrier.cpp
M	tests/test-grad0.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp
M	tests/test-rope.cpp

commit	08828a6d7d0006a487c9655ba8ace0ebe35ecad1	1839f69130151ceeac4d01c0ef8964e1fb43bba6	2024-11-03T15:18:40+02:00	Georgi Gerganov	metal : minor fixup in FA kernel (#10143)
M	ggml/src/ggml-metal.metal

commit	1839f69130151ceeac4d01c0ef8964e1fb43bba6	9830b6923b61f1e652a35afeac77aa5f886dad09	2024-11-03T15:14:15+02:00	Georgi Gerganov	flake.lock: Update (#10146)
M	flake.lock

commit	9830b6923b61f1e652a35afeac77aa5f886dad09	42cadc74bda60afafb45b71b1a39d150ede0ed4d	2024-11-02T23:35:31+01:00	Christian Köhnenkamp	Add apple arm to presets (#10134)
M	CMakePresets.json
A	cmake/arm64-apple-clang.cmake

commit	42cadc74bda60afafb45b71b1a39d150ede0ed4d	45950415ed985830c59bf42cf9c9216b20cf08ef	2024-11-02T16:34:56Z	sasha0552	server : fix slot selection by lru (#10126)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	45950415ed985830c59bf42cf9c9216b20cf08ef	1926d6e39d6f6358bc1a4c52316a560178be7233	2024-11-02T18:34:00+02:00	Georgi Gerganov	server : fix endpoint checks (#10135)
M	examples/server/server.cpp

commit	1926d6e39d6f6358bc1a4c52316a560178be7233	b634f8a26fef65210fd9fb2f87e83a2809535e89	2024-11-02T15:18:56+02:00	Georgi Gerganov	llama : adjust default context size + print warnings (#10136)
M	ci/run.sh
M	common/common.h
M	src/llama.cpp

commit	b634f8a26fef65210fd9fb2f87e83a2809535e89	7554aa4655f44b33a29068f2b18c5976fae45f9d	2024-11-02T13:08:53+01:00	Diego Devesa	simple-chat : only add bos on first prompt (#10129)
M	examples/simple-chat/simple-chat.cpp

commit	7554aa4655f44b33a29068f2b18c5976fae45f9d	a6744e43e80f4be6398fc7733a01642c846dce1d	2024-11-02T12:53:17+01:00	Xuan Son Nguyen	convert-lora : make `--base` optional (#10110)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py

commit	a6744e43e80f4be6398fc7733a01642c846dce1d	e991e3127ff71a29e61fe1de5dd1cbd2e1df1858	2024-11-01T23:50:59+01:00	Diego Devesa	llama : add simple-chat example (#10124)
M	Makefile
M	examples/CMakeLists.txt
A	examples/simple-chat/CMakeLists.txt
A	examples/simple-chat/README.md
A	examples/simple-chat/simple-chat.cpp
M	ggml/include/ggml.h

commit	e991e3127ff71a29e61fe1de5dd1cbd2e1df1858	418f5eef262cea07c2af4f45ee6a88d882221fcb	2024-11-01T23:48:26+01:00	Diego Devesa	llama : use smart pointers for ggml resources (#10117)
A	ggml/include/ggml-cpp.h
M	ggml/src/CMakeLists.txt
A	spm-headers/ggml-cpp.h
M	src/llama.cpp

commit	418f5eef262cea07c2af4f45ee6a88d882221fcb	ba6f62eb793d6617892d252f5c04d7685d908a38	2024-11-02T02:33:14+08:00	Shupei Fan	vulkan : improve ggml_vk_create_buffer error handling (#9898)
M	ggml/src/ggml-vulkan.cpp

commit	ba6f62eb793d6617892d252f5c04d7685d908a38	d865d1478cd4e403f82d793c2afcd0f943412f05	2024-11-01T17:31:51+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	d865d1478cd4e403f82d793c2afcd0f943412f05	1804adb0cfee4811eaf633741503d683a46e4c77	2024-11-01T13:33:14Z	sasha0552	server : fix smart selection of available slot (#10120)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	1804adb0cfee4811eaf633741503d683a46e4c77	815fe72adcea5ec79d358db6a4c479191f396b3c	2024-11-01T12:58:45+02:00	Georgi Gerganov	ggml : remove ggml_scratch (#10121)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	815fe72adcea5ec79d358db6a4c479191f396b3c	f221d56220899f38f0126e683b2432bc79d1e3f6	2024-11-01T10:28:24+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f221d56220899f38f0126e683b2432bc79d1e3f6	e597e50794f07ec8dc24b9efb18f94ec6386fda0	2024-11-01T10:23:05+02:00	Georgi Gerganov	ggml : alloc ggml_contexts on the heap (whisper/2525)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	e597e50794f07ec8dc24b9efb18f94ec6386fda0	85679d37f34f66783cc04664a06c405b28e8e035	2024-11-01T11:09:59+08:00	Zhenwei Jin	build: fix build error in Windows env with OneAPI setup (#10107)
M	ggml/src/CMakeLists.txt

commit	85679d37f34f66783cc04664a06c405b28e8e035	1e9f94994ef908d964cf81069f03d9d3668beb7d	2024-11-01T00:49:53+01:00	Diego Devesa	llama : improve output buffer type selection (#10098)
M	src/llama.cpp

commit	1e9f94994ef908d964cf81069f03d9d3668beb7d	c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7	2024-11-01T00:45:34+01:00	Diego Devesa	quantize : fix --keep-split (#10114)
M	src/llama.cpp

commit	c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7	ab3d71f97f5b2915a229099777af00d3eada1d24	2024-10-31T22:54:23+01:00	Diego Devesa	llama : fix buffer checks for mamba and rwk (#10111)
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml.c
M	src/llama.cpp

commit	ab3d71f97f5b2915a229099777af00d3eada1d24	0a683e8088d849626e7471f9e2ed381f7dbdf2e9	2024-11-01T02:50:39+08:00	Zhenwei Jin	loader:  refactor tensor weights storage (#9935)
M	src/llama.cpp

commit	0a683e8088d849626e7471f9e2ed381f7dbdf2e9	dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6	2024-10-31T06:02:35-07:00	Kevin Gibbons	server : include scheme when printing URL (#10106)
M	examples/server/server.cpp

commit	dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6	1329c0a75e6a7defc5c380eaf80d8e0f66d7da78	2024-10-31T11:40:59+01:00	Diego Devesa	ggml : check tensor name lengths in gguf files (#10100)
M	ggml/src/ggml.c
M	src/llama.cpp

commit	1329c0a75e6a7defc5c380eaf80d8e0f66d7da78	61408e7fad082dc44a11c8a9f1398da4837aad44	2024-10-31T10:09:52+01:00	Sergio López	kompute: add mul_mat_q4_k shader (#10097)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-kompute.cpp
M	ggml/src/kompute-shaders/common.comp
A	ggml/src/kompute-shaders/op_mul_mat_q4_k.comp

commit	61408e7fad082dc44a11c8a9f1398da4837aad44	b9e02e8184f5e6094a9e87eaf040becd404bfc90	2024-10-30T17:01:52+01:00	Sergio López	kompute: add backend registry / device interfaces (#10045)
M	ggml/include/ggml-kompute.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-kompute.cpp

commit	b9e02e8184f5e6094a9e87eaf040becd404bfc90	6763f713bb692910e9b2d9d1a82d6959cee2dcf3	2024-10-30T14:51:21+01:00	Diego Devesa	ggml : fix memory leaks when loading invalid gguf files (#10094)
M	ggml/src/ggml.c

commit	6763f713bb692910e9b2d9d1a82d6959cee2dcf3	79a2bc042dcacaad59306865208a8c8c3149e3ea	2024-10-31T01:22:39+13:00	Rich Dougherty	readme : more lora detail in main example readme (#10064)
M	examples/main/README.md

commit	79a2bc042dcacaad59306865208a8c8c3149e3ea	fc83a9e58479e4dd70054daa7afe5184c1bbe545	2024-10-31T01:22:21+13:00	Rich Dougherty	convert : more detailed convert lora usage docs (#10065)
M	convert_lora_to_gguf.py

commit	fc83a9e58479e4dd70054daa7afe5184c1bbe545	c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc	2024-10-30T15:00:40+08:00	xctan	ggml : add Q4_0_8_8 RISC-V GEMV and GEMM kernels (#10029)
M	ggml/src/ggml-aarch64.c

commit	c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc	8f275a7c4593aa34147595a90282cf950a853690	2024-10-30T02:01:23+01:00	Diego Devesa	llama : refactor model loader with backend registry (#10026)
M	examples/llama-bench/llama-bench.cpp
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-cuda.h
M	ggml/src/ggml-amx.cpp
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-kompute.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	include/llama.h
M	scripts/compare-llama-bench.py
M	src/llama.cpp

commit	8f275a7c4593aa34147595a90282cf950a853690	8d8ff715367480b856ad86ac3888e9742b13a6fa	2024-10-29T17:52:56+09:00	Changyeon Kim	ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763)
M	ggml/src/ggml-vulkan.cpp
A	ggml/src/vulkan-shaders/pool2d.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	8d8ff715367480b856ad86ac3888e9742b13a6fa	61715d5cc83a28181df6a641846e4f6a740f3c74	2024-10-29T10:42:05+02:00	Georgi Gerganov	llama : remove Tail-Free sampling (#10071)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/public/index-new.html
M	examples/server/public/index.html
M	examples/server/server.cpp
M	examples/server/themes/buttons-top/index.html
M	examples/server/themes/wild/index.html
M	examples/server/utils.hpp
M	include/llama.h
M	scripts/run-with-preset.py
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	61715d5cc83a28181df6a641846e4f6a740f3c74	07028f9d74d895da2ca4a1956624e3f07e04e620	2024-10-28T10:45:33-07:00	arch-btw	llama : Add IBM granite template (#10013)
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	07028f9d74d895da2ca4a1956624e3f07e04e620	524afeec9dad7d765ce91f5cf30c73703867cb47	2024-10-28T17:41:24+02:00	Georgi Gerganov	flake.lock: Update (#10063)
M	flake.lock

commit	524afeec9dad7d765ce91f5cf30c73703867cb47	8125e6cbfcf2b3b9066e4d923aca9295526730f5	2024-10-28T17:02:48+08:00	R0CKSTAR	musa: workaround for Guilty Lockup in cleaning src0 (#10042)
M	ggml/src/ggml-cuda.cu

commit	8125e6cbfcf2b3b9066e4d923aca9295526730f5	8841ce3f439de6e770f70319b7e08b6613197ea7	2024-10-28T08:49:32+02:00	Georgi Gerganov	server : don't overfill the batch during infill (#10018)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	8841ce3f439de6e770f70319b7e08b6613197ea7	cc2983d3753c94a630ca7257723914d4c4f6122b	2024-10-27T20:59:58+02:00	Georgi Gerganov	llama : switch KQ multiplication to F32 precision by default (#10015)
M	src/llama.cpp

commit	cc2983d3753c94a630ca7257723914d4c4f6122b	8c60a8a46261ffb92b6d23a78acfac2fcb6fe233	2024-10-26T10:34:08+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	8c60a8a46261ffb92b6d23a78acfac2fcb6fe233	9e4a2563eadf34e9432d248224d4f43e8495e8fe	2024-10-23T14:34:00-04:00	bssrdf	increase cuda_cpy block size (ggml/996)
M	ggml/src/ggml-cuda/cpy.cuh

commit	9e4a2563eadf34e9432d248224d4f43e8495e8fe	668750357e66bfa3d1504b65699f5a0dfe3cb7cb	2024-10-26T10:33:31+03:00	Georgi Gerganov	scripts : fix amx sync [no ci]
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	668750357e66bfa3d1504b65699f5a0dfe3cb7cb	ff252ea48e90e6552010fd74584334fb41bdd387	2024-10-25T22:26:15+03:00	Georgi Gerganov	metal : support permuted matrix multiplicaions (#10033)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal

commit	ff252ea48e90e6552010fd74584334fb41bdd387	d80fb71f8b8bf69ec095ba281f8248d136d21c76	2024-10-25T10:07:34-06:00	wwoodsTM	llama : add DRY sampler (#9702)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/public/index-new.html
M	examples/server/public/index.html
M	examples/server/public/style.css
M	examples/server/server.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	src/llama-sampling.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp
M	tests/test-sampling.cpp

commit	d80fb71f8b8bf69ec095ba281f8248d136d21c76	2f8bd2b90133cf37ae752015e1bfd738cc6d0112	2024-10-25T17:57:54+02:00	Michael Podvitskiy	llama: string_split fix (#10022)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp

commit	2f8bd2b90133cf37ae752015e1bfd738cc6d0112	bc5ba007b2c83ac95875e68724dabfc12159fc61	2024-10-25T12:57:41+05:30	Srihari-mcw	llamafile : extend sgemm.cpp support for Q5_0 models (#10010)
M	ggml/src/llamafile/sgemm.cpp

commit	bc5ba007b2c83ac95875e68724dabfc12159fc61	958367bf530d943a902afa1ce1c342476098576b	2024-10-25T10:13:46+03:00	Georgi Gerganov	server : check that the prompt fits in the slot's context (#10030)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	examples/server/server.cpp

commit	958367bf530d943a902afa1ce1c342476098576b	40f2555797f97314de749873cdc29dc102be66e2	2024-10-24T21:51:22+02:00	Xuan Son Nguyen	server : refactor slot input data, move tokenizer to HTTP thread (#10023)
M	examples/server/README.md
M	examples/server/server.cpp
A	examples/server/tests/features/infill.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp

commit	40f2555797f97314de749873cdc29dc102be66e2	167a515651a4b065a16225ffc69564c5674f3d0f	2024-10-24T21:23:33+03:00	Georgi Gerganov	ci : fix cmake flags for SYCL
M	ci/run.sh

commit	167a515651a4b065a16225ffc69564c5674f3d0f	c39665f589091903396a442a6ee56613303e0350	2024-10-24T14:40:23+02:00	Johannes Gäßler	CUDA: fix insufficient buffer clearing for MMQ (#10032)
M	ggml/src/ggml-cuda.cu

commit	c39665f589091903396a442a6ee56613303e0350	0a1c750c80147687df267114c81956757cc14382	2024-10-24T11:09:36+02:00	Johannes Gäßler	CUDA: fix MMQ for non-contiguous src0, add tests (#10021)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	0a1c750c80147687df267114c81956757cc14382	190a37d7977eb5bd6a729299bd1e371208c87149	2024-10-23T13:27:51-06:00	wwoodsTM	server : samplers accept the prompt correctly (#10019)
M	examples/server/server.cpp

commit	190a37d7977eb5bd6a729299bd1e371208c87149	2d3aba9ee8da9c026d54e8a912a1d64f56809be3	2024-10-23T17:23:55+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	2d3aba9ee8da9c026d54e8a912a1d64f56809be3	80273a306d07ed95059d6130389deacb3b2d7196	2024-10-23T17:16:56+03:00	Georgi Gerganov	llama.vim : bump generation time limit to 3s [no ci]
M	examples/llama.vim

commit	80273a306d07ed95059d6130389deacb3b2d7196	c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095	2024-10-18T09:24:44+02:00	Johannes Gäßler	CUDA: fix 1D im2col, add tests (ggml/993)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/im2col.cu
M	tests/test-backend-ops.cpp

commit	c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095	ac113a0feee0935b2018312f7bc8d7a646b117ed	2024-10-16T20:10:01+02:00	Daniel Bevenius	ggml : remove redundant set of contexts used field (ggml/978)
M	ggml/src/ggml.c

commit	ac113a0feee0935b2018312f7bc8d7a646b117ed	4c9388fb96ac2415fbb1239b7ba8346616606e2e	2024-10-23T07:09:26-04:00	Michael Coppola	llama.vim : add classic vim support (#9995)
M	examples/llama.vim

commit	4c9388fb96ac2415fbb1239b7ba8346616606e2e	873279b1592e433c4d9eb5065091cc98473c7bee	2024-10-23T19:33:45+09:00	Jun Hee Yoo	metal : add POOL2D and fix IM2COL (#9943)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	873279b1592e433c4d9eb5065091cc98473c7bee	c8c07d658a6cefc5a50cfdf6be7d726503612303	2024-10-20T00:22:59Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	c8c07d658a6cefc5a50cfdf6be7d726503612303	19d900a7565b8f6b0a708836a57d26966cb9efe2	2024-10-22T16:59:02+02:00	Xuan Son Nguyen	llama : fix empty batch causing llama_batch_allocr to crash (#9966)
M	src/llama.cpp

commit	19d900a7565b8f6b0a708836a57d26966cb9efe2	11d47057a51f3d9b9231e6b57d0ca36020c0ee99	2024-10-22T15:31:06+02:00	Daniel Bevenius	llama : rename batch to ubatch (#9950)
M	src/llama.cpp

commit	11d47057a51f3d9b9231e6b57d0ca36020c0ee99	c421ac072d46172ab18924e1e8be53680b54ed3b	2024-10-22T21:22:26+08:00	Molly Sophia	Rwkv chat template fix (#10001)
M	convert_hf_to_gguf.py
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	c421ac072d46172ab18924e1e8be53680b54ed3b	4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4	2024-10-22T13:08:41+02:00	Xuan Son Nguyen	lora : warn user if new token is added in the adapter (#9948)
M	convert_lora_to_gguf.py

commit	4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4	6b8447352df3d662b56280c8fc38d7f092885787	2024-10-22T18:33:37+08:00	Molly Sophia	llama : add chat template for RWKV-World + fix EOT (#9968)
M	README.md
M	convert_hf_to_gguf.py
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	6b8447352df3d662b56280c8fc38d7f092885787	674804a99617b4f90292b4080ecab450ea3d30ba	2024-10-22T16:16:01+08:00	leo-pony	[CANN] Adapt to dynamically loadable backends mechanism (#9970)
M	ggml/include/ggml-cann.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cann.cpp
M	src/llama.cpp

commit	674804a99617b4f90292b4080ecab450ea3d30ba	e94a138d644a9b34da61805f7aeb8af595c61b53	2024-10-22T09:40:02+02:00	Daniel Bevenius	arg : fix typo in embeddings argument help [no ci] (#9994)
M	common/arg.cpp
M	common/common.h

commit	e94a138d644a9b34da61805f7aeb8af595c61b53	e01c67affe450638162a1a457e2e57859ef6ebf0	2024-10-22T00:35:25+03:00	Georgi Gerganov	llama.vim : fix info text display [no ci] (#9787)
M	examples/llama.vim

commit	e01c67affe450638162a1a457e2e57859ef6ebf0	994cfb1acb9144bc95be0ab319175f30737cc92b	2024-10-21T22:52:22+03:00	Georgi Gerganov	llama.vim : move info to the right of screen [no ci] (#9787)
M	examples/llama.vim

commit	994cfb1acb9144bc95be0ab319175f30737cc92b	94008cc76075fb4a29ee371e7ac255378d1bce6c	2024-10-21T20:20:59+02:00	Asghar Ghorbani	readme : update UI list (#9972)
M	README.md

commit	94008cc76075fb4a29ee371e7ac255378d1bce6c	dbd5f2f5736aec6ff8fd63df3b351dae23c43e2f	2024-10-21T20:12:52+02:00	Daniel Bevenius	arg : fix attention non-causal arg value hint (#9985)
M	common/arg.cpp

commit	dbd5f2f5736aec6ff8fd63df3b351dae23c43e2f	f594bc80baf683818f29d8f5d6fb52daab99e572	2024-10-21T20:25:02+03:00	Georgi Gerganov	llama.vim : plugin for Neovim (#9787)
A	examples/llama.vim

commit	f594bc80baf683818f29d8f5d6fb52daab99e572	d5ebd79c76abd4887f0283cd6f6f9689122094d0	2024-10-21T16:20:46+03:00	Georgi Gerganov	ggml : add asserts for type conversion in fattn kernels (#9971)
M	common/common.cpp
M	ggml/src/ggml.c
M	src/llama.cpp

commit	d5ebd79c76abd4887f0283cd6f6f9689122094d0	55e47786e373c90fc7803e718e3e1dd6d53c3db6	2024-10-21T13:35:40+03:00	Radoslav Gerganov	rpc : pack only RPC structs (#9959)
M	ggml/src/ggml-rpc.cpp

commit	55e47786e373c90fc7803e718e3e1dd6d53c3db6	bc219750845a59166d79f0d4ee3da1993b369b8a	2024-10-21T09:46:40+03:00	Georgi Gerganov	llama : default sampling changes + greedy update (#9897)
M	common/sampling.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/save-load-state/save-load-state.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	bc219750845a59166d79f0d4ee3da1993b369b8a	1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31	2024-10-21T09:37:12+03:00	Georgi Gerganov	speculative : fix handling of some input params (#9963)
M	examples/speculative/speculative.cpp

commit	1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31	45f097645efb11b6d09a5b4adbbfd7c312ac0126	2024-10-21T14:26:09+08:00	Neo Zhang Jianyu	fix mul_mat_vec_q and *_vec_q error (#9939)
M	ggml/src/ggml-sycl/mmvq.cpp

commit	45f097645efb11b6d09a5b4adbbfd7c312ac0126	7cab2083c768dd92c20b105556c4165b59cd8a41	2024-10-20T18:25:41+02:00	Loïc Carrère	readme : update bindings list (#9951)
M	README.md

commit	7cab2083c768dd92c20b105556c4165b59cd8a41	cda0e4b648dde8fac162b3430b14a99597d3d74f	2024-10-20T12:01:34-04:00	icppWorld	readme : update infra list (#9942)
M	README.md

commit	cda0e4b648dde8fac162b3430b14a99597d3d74f	afd9909a6481402844aecefa8a8908afdd7f52f1	2024-10-18T23:18:01+02:00	Xuan Son Nguyen	llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745)
M	common/common.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/llava.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama.cpp

commit	afd9909a6481402844aecefa8a8908afdd7f52f1	87421a23e8c60e00a7b227d501e8aab2a1aff7ce	2024-10-18T14:33:58+03:00	Radoslav Gerganov	rpc : backend refactoring (#9912)
M	ggml/src/ggml-rpc.cpp

commit	87421a23e8c60e00a7b227d501e8aab2a1aff7ce	60ce97c9d809f4b040e90b597468b839df5728d0	2024-10-18T06:46:16+01:00	Ouadie EL FAROUKI	[SYCL] Add SYCL Backend registry, device and Event Interfaces (#9705)
M	examples/llama-bench/llama-bench.cpp
M	ggml/include/ggml-sycl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-sycl.cpp
M	src/llama.cpp

commit	60ce97c9d809f4b040e90b597468b839df5728d0	8901755ba328643c9ab071c20e1939ea52951a0e	2024-10-18T13:34:36+08:00	Ma Mingfei	add amx kernel for gemm (#8998)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml/CMakeLists.txt
A	ggml/include/ggml-amx.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
A	ggml/src/ggml-amx.cpp
A	ggml/src/ggml-amx/common.h
A	ggml/src/ggml-amx/mmq.cpp
A	ggml/src/ggml-amx/mmq.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml.c
M	src/llama.cpp

commit	8901755ba328643c9ab071c20e1939ea52951a0e	6f55bccbb8835d42147add4ee48807450f5ff535	2024-10-18T07:32:19+03:00	Georgi Gerganov	server : add n_indent parameter for line indentation requirement (#9929)
M	examples/server/README.md
M	examples/server/server.cpp

commit	6f55bccbb8835d42147add4ee48807450f5ff535	17bb9280807cfbb6611b853aa1ef05114bd9efe9	2024-10-18T01:41:51+02:00	Daniel Bevenius	llama : rename batch_all to batch (#8881)
M	src/llama.cpp

commit	17bb9280807cfbb6611b853aa1ef05114bd9efe9	9f45fc1e9950a496febc575cdd196cd5cad000cc	2024-10-17T23:43:05+03:00	Georgi Gerganov	readme : remove --memory-f32 references (#9925)
M	examples/main/README.md
M	scripts/run-with-preset.py

commit	9f45fc1e9950a496febc575cdd196cd5cad000cc	99bd4ac28c32cd17c0e337ff5601393b033dc5fc	2024-10-17T23:26:32+03:00	Georgi Gerganov	llama : change warning to debug log
M	src/llama.cpp

commit	99bd4ac28c32cd17c0e337ff5601393b033dc5fc	3752217ed5a6a11864682fbf009bcb36afffd6bc	2024-10-17T22:32:47+03:00	Georgi Gerganov	llama : infill sampling handle very long tokens (#9924)
M	include/llama.h
M	src/llama-sampling.cpp
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	3752217ed5a6a11864682fbf009bcb36afffd6bc	f010b77a372ffcfaf4338c670d6d3ecd89aa4eb6	2024-10-17T17:57:14+11:00	Tim Wang	readme : update bindings list (#9918)
M	README.md

commit	f010b77a372ffcfaf4338c670d6d3ecd89aa4eb6	21942002780352b4a54f4bd3e5eefa3bc7f14fe6	2024-10-17T02:46:58+02:00	Diego Devesa	vulkan : add backend registry / device interfaces (#9721)
M	ggml/include/ggml-vulkan.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-vulkan.cpp
M	src/llama.cpp

commit	21942002780352b4a54f4bd3e5eefa3bc7f14fe6	73afe681aa76e818733fc1f30de082c1d6910bcd	2024-10-17T02:34:22+03:00	Gilad S.	fix: allocating CPU buffer with size `0` (#9917)
M	ggml/src/ggml-backend.cpp

commit	73afe681aa76e818733fc1f30de082c1d6910bcd	9e041024481f6b249ab8918e18b9477f873b5a5e	2024-10-17T01:36:51+03:00	Gilad S.	fix: use `vm_allocate` to allocate CPU backend buffer on macOS (#9875)
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c

commit	9e041024481f6b249ab8918e18b9477f873b5a5e	dbf18e4de9e7aa496871f1555f9f0c8d84567108	2024-10-16T19:34:28+02:00	Daniel Bevenius	llama : suppress conversion from 'size_t' to 'int' (#9046)
M	src/llama-vocab.cpp

commit	dbf18e4de9e7aa496871f1555f9f0c8d84567108	66c2c93082289325199ae1f773f3b0ab2e399a47	2024-10-16T19:24:05+02:00	Daniel Bevenius	llava : fix typo in error message [no ci] (#9884)
M	examples/llava/llava.cpp

commit	66c2c93082289325199ae1f773f3b0ab2e399a47	10433e8b457c4cfd759cbb41fc55fc398db4a5da	2024-10-16T09:03:24-07:00	Joe Eli McIlvain	grammar : fix JSON Schema for string regex with top-level alt. (#9903)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	tests/test-json-schema-to-grammar.cpp

commit	10433e8b457c4cfd759cbb41fc55fc398db4a5da	1f66b699c48cb5ab3265ed72c48e8549b1674291	2024-10-16T18:10:21+08:00	Molly Sophia	llama : add tensor name for "result_norm" (#9907)
M	src/llama.cpp

commit	1f66b699c48cb5ab3265ed72c48e8549b1674291	0e41b300ed28f7fe185d938b2e3d56a0bf7411ed	2024-10-16T08:35:53Z	Alexey Parfenov	server : fix the disappearance of the end of the text (#9867)
M	examples/server/server.cpp

commit	0e41b300ed28f7fe185d938b2e3d56a0bf7411ed	cd60b88bf7ad7785fb6ac9864e360cf10e42faad	2024-10-16T11:28:14+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	cd60b88bf7ad7785fb6ac9864e360cf10e42faad	becfd387f6919d99ec34b76c2522f90ac250c489	2024-10-09T16:40:35+02:00	Daniel Bevenius	ggml-alloc : remove buffer_id from leaf_alloc (ggml/987)
M	ggml/src/ggml-alloc.c

commit	becfd387f6919d99ec34b76c2522f90ac250c489	755a9b2bf00fbae988e03a47e852b66eaddd113a	2024-10-16T08:51:46+08:00	leo-pony	[CANN] Fix cann compilation error (#9891)
M	ggml/src/ggml-cann.cpp

commit	755a9b2bf00fbae988e03a47e852b66eaddd113a	223c25a72fcc3f65cdfd7f5d57edd5b44b550e18	2024-10-15T16:35:33+03:00	Georgi Gerganov	llama : add infill sampler (#9896)
M	common/common.h
M	common/sampling.cpp
M	examples/main/main.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	src/llama-sampling.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	223c25a72fcc3f65cdfd7f5d57edd5b44b550e18	fbc98b748e7b075e327bcf13237057f647678049	2024-10-15T16:28:55+03:00	Georgi Gerganov	server : improve infill context reuse (#9894)
M	examples/server/README.md
M	examples/server/server.cpp

commit	fbc98b748e7b075e327bcf13237057f647678049	dcdd535302fc9702a4709be25f56540d65163a44	2024-10-15T15:54:55+05:00	MaggotHATE	sampling : add XTC sampler (#9742)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/main/README.md
M	examples/server/public/index-new.html
M	examples/server/public/index.html
M	examples/server/server.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	dcdd535302fc9702a4709be25f56540d65163a44	4c42f93b22146c83b763d8cbee5fafc512746649	2024-10-15T12:48:44+03:00	Georgi Gerganov	server : update preact (#9895)
M	examples/server/public/index.js

commit	4c42f93b22146c83b763d8cbee5fafc512746649	a89f75e1b7b90cb2d4d4c52ca53ef9e9b466aa45	2024-10-15T10:20:34+02:00	Michał Tuszyński	readme : update bindings list (#9889)
M	README.md

commit	a89f75e1b7b90cb2d4d4c52ca53ef9e9b466aa45	13dca2a54a394757d56fdd652b9f0df08f44ea22	2024-10-14T15:04:36+08:00	VoidIsVoid	server : handle "logprobs" field with false value (#9871)
M	examples/server/utils.hpp

commit	13dca2a54a394757d56fdd652b9f0df08f44ea22	d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4	2024-10-14T01:49:08+01:00	agray3	Vectorize load instructions in dmmv f16 CUDA kernel (#9816)
M	ggml/src/ggml-cuda/dmmv.cu

commit	d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4	c7181bd294757dd80a7904e3dd0fea2d0be914e7	2024-10-13T21:31:35+03:00	Georgi Gerganov	server : accept extra_context for the infill endpoint (#9874)
M	examples/server/README.md
M	examples/server/server.cpp
M	src/llama.cpp

commit	c7181bd294757dd80a7904e3dd0fea2d0be914e7	92be9f12164f18ce845a5bab60cefa5f7fec6836	2024-10-13T18:52:48+03:00	Georgi Gerganov	server : reuse cached context chunks (#9866)
M	common/arg.cpp
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	92be9f12164f18ce845a5bab60cefa5f7fec6836	edc265661cd707327297b6ec4d83423c43cb50a5	2024-10-13T06:11:26+03:00	Georgi Gerganov	flake.lock: Update (#9870)
M	flake.lock

commit	edc265661cd707327297b6ec4d83423c43cb50a5	1bde94dd024b632f98428f4bf2ce483295130779	2024-10-12T16:14:27+03:00	Georgi Gerganov	server : add option to time limit the generation phase (#9865)
M	examples/server/README.md
M	examples/server/server.cpp

commit	1bde94dd024b632f98428f4bf2ce483295130779	95c76e8e92ecc93f784b185eafae36a0e7ad2fa3	2024-10-12T16:06:31+03:00	Georgi Gerganov	server : remove self-extend features (#9860)
M	common/arg.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/ctx_shift.feature

commit	95c76e8e92ecc93f784b185eafae36a0e7ad2fa3	11ac9800aff532715a5bc7991062c68ba3472e6e	2024-10-12T14:51:54+03:00	Georgi Gerganov	server : remove legacy system_prompt feature (#9857)
M	common/arg.cpp
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp

commit	11ac9800aff532715a5bc7991062c68ba3472e6e	943d20b4111c746bcd9dbc7e4771de313b08b50c	2024-10-12T08:21:51+03:00	Georgi Gerganov	llama : improve infill support and special token detection (#9798)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	examples/infill/infill.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	943d20b4111c746bcd9dbc7e4771de313b08b50c	96776405a17034dcfd53d3ddf5d142d34bdbb657	2024-10-12T13:09:53+08:00	R0CKSTAR	musa : update doc (#9856)
M	README.md
M	docs/build.md

commit	96776405a17034dcfd53d3ddf5d142d34bdbb657	7eee341bee09957139789c2d828995953f0fc7ff	2024-10-11T15:34:45+02:00	Diego Devesa	ggml : move more prints to the ggml log system (#9839)
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-cuda.cu

commit	7eee341bee09957139789c2d828995953f0fc7ff	0e9f760eb12546704ef8fa72577bc1a3ffe1bc04	2024-10-10T22:57:42+02:00	Diego Devesa	common : use common_ prefix for common library functions (#9805)
M	common/arg.cpp
M	common/arg.h
M	common/common.cpp
M	common/common.h
M	common/log.cpp
M	common/log.h
M	common/ngram-cache.cpp
M	common/ngram-cache.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gen-docs/gen-docs.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-merge.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/speculative/speculative.cpp
M	examples/tokenize/tokenize.cpp
M	tests/test-arg-parser.cpp
M	tests/test-chat-template.cpp
M	tests/test-log.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-spm.cpp

commit	0e9f760eb12546704ef8fa72577bc1a3ffe1bc04	cf8e0a3bb9c0e93e371773b282054cdbbb231038	2024-10-10T20:14:55+02:00	Diego Devesa	rpc : add backend registry / device interfaces (#9812)
M	common/arg.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/rpc/rpc-server.cpp
M	ggml/include/ggml-rpc.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-rpc.cpp
M	include/llama.h
M	src/llama.cpp

commit	cf8e0a3bb9c0e93e371773b282054cdbbb231038	c7499c557cc1efafaf0a6bc12963c39826299703	2024-10-11T02:10:37+08:00	R0CKSTAR	musa: add docker image support (#9685)
A	.devops/full-musa.Dockerfile
A	.devops/llama-cli-musa.Dockerfile
A	.devops/llama-server-musa.Dockerfile
M	.github/workflows/docker.yml
M	docs/docker.md
M	ggml/src/CMakeLists.txt

commit	c7499c557cc1efafaf0a6bc12963c39826299703	c81f3bbb051f8b736e117dfc78c99d7c4e0450f6	2024-10-10T19:50:49+02:00	Diego Devesa	examples : do not use common library in simple example (#9803)
M	examples/simple/CMakeLists.txt
M	examples/simple/simple.cpp

commit	c81f3bbb051f8b736e117dfc78c99d7c4e0450f6	e7022064ab637ccb5f37867196f1802c4a453c91	2024-10-09T18:49:52+02:00	Diego Devesa	cmake : do not build common library by default when standalone (#9804)
M	CMakeLists.txt
M	examples/llama.android/llama/build.gradle.kts

commit	e7022064ab637ccb5f37867196f1802c4a453c91	3dc48fe75ad48f8856118520a267c96f74df8e90	2024-10-09T17:00:18+03:00	Georgi Gerganov	perplexity : fix integer overflow (#9783)
M	examples/perplexity/perplexity.cpp

commit	3dc48fe75ad48f8856118520a267c96f74df8e90	dca1d4b58a7f1acf1bd253be84e50d6367f492fd	2024-10-09T10:55:42+03:00	Georgi Gerganov	examples : remove llama.vim
D	examples/llama.vim

commit	dca1d4b58a7f1acf1bd253be84e50d6367f492fd	458367a90606448a9c0262b276947c9e536086e0	2024-10-08T14:21:43+02:00	Diego Devesa	ggml : fix BLAS with unsupported types (#9775)
M	examples/export-lora/export-lora.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	pocs/vdot/q8dot.cpp
M	pocs/vdot/vdot.cpp
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	458367a90606448a9c0262b276947c9e536086e0	fa42aa6d8902cc4eaf31866b3b3b7b61b69da930	2024-10-08T13:27:04+02:00	Xuan Son Nguyen	server : better security control for public deployments (#9776)
M	common/arg.cpp
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/security.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp
M	src/unicode-data.cpp

commit	fa42aa6d8902cc4eaf31866b3b3b7b61b69da930	6374743747b14db4eb73ce82ae449a2978bc3b47	2024-10-08T15:19:53+09:00	standby24x7	scripts : fix spelling typo in messages and comments (#9782)
M	scripts/debug-test.sh

commit	6374743747b14db4eb73ce82ae449a2978bc3b47	f1af42fa8c925096407c61ff0a3d5d5d669cc535	2024-10-07T21:55:08+02:00	Diego Devesa	ggml : add backend registry / device interfaces to BLAS backend (#9752)
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-blas.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas.cpp
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	f1af42fa8c925096407c61ff0a3d5d5d669cc535	6279dac039ddeb6d5ebd125a6274fd3c37a77ba8	2024-10-07T09:37:31-07:00	Andrew Minh Nguyen	Update building for Android (#9672)
M	docs/android.md
M	ggml/src/CMakeLists.txt

commit	6279dac039ddeb6d5ebd125a6274fd3c37a77ba8	d5ac8cf2f2e30459489e6721a17d15b92a0c42a6	2024-10-07T19:35:42+03:00	Georgi Gerganov	flake.lock: Update (#9753)
M	flake.lock

commit	d5ac8cf2f2e30459489e6721a17d15b92a0c42a6	96b69121033d2b6b951d1b6b1b43f8b4f97dac99	2024-10-07T18:27:51+03:00	Georgi Gerganov	ggml : add metal backend registry / device (#9713)
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-metal.m
M	src/llama.cpp

commit	96b69121033d2b6b951d1b6b1b43f8b4f97dac99	d5cb86844f26f600c48bf3643738ea68138f961d	2024-10-07T13:26:31+01:00	Paul Tsochantaris	metal : single allocation of encode_async block (#9747)
M	ggml/src/ggml-metal.m

commit	d5cb86844f26f600c48bf3643738ea68138f961d	f4b2dcdf4992ef11a854abc9b662624490e37b4c	2024-10-06T14:15:27+03:00	Georgi Gerganov	contrib : simplify + minor edits [no ci]
M	CONTRIBUTING.md

commit	f4b2dcdf4992ef11a854abc9b662624490e37b4c	b6d6c5289f1c9c677657c380591201ddb210b649	2024-10-06T13:49:41+03:00	Georgi Gerganov	readme : fix typo [no ci]
M	examples/main/README.md

commit	b6d6c5289f1c9c677657c380591201ddb210b649	b0915d5b51cbaa982ce9bbb9ce302bb9abdca0eb	2024-10-06T12:53:28+03:00	Georgi Gerganov	sync : llama.cpp
M	scripts/sync-ggml.last

commit	b0915d5b51cbaa982ce9bbb9ce302bb9abdca0eb	8c475b97b8ba7d678d4c9904b1161bd8811a9b44	2024-10-06T08:34:20+01:00	SRHMorris	vulkan : retry allocation with fallback flags (whisper/2451)
M	ggml/src/ggml-vulkan.cpp

commit	8c475b97b8ba7d678d4c9904b1161bd8811a9b44	58b16695e146628481c6b9b8a3b101c0c9bac00f	2024-10-05T15:55:04+03:00	Georgi Gerganov	rerank : use [SEP] token instead of [BOS] (#9737)
M	ci/run.sh
M	common/common.cpp
M	examples/server/server.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	58b16695e146628481c6b9b8a3b101c0c9bac00f	905f5485b279518d30b402565c23fb153f822c0d	2024-10-05T15:53:49+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	905f5485b279518d30b402565c23fb153f822c0d	71967c2a6d30da9f61580d3e2d4cb00e0223b6fa	2024-10-05T14:33:54+03:00	Georgi Gerganov	metal : zero-init buffer contexts (whisper/0)
M	ggml/src/ggml-metal.m

commit	71967c2a6d30da9f61580d3e2d4cb00e0223b6fa	17880771ad7dca16cdc969062f2a56f779662835	2024-10-05T01:29:35+07:00	Viet-Anh NGUYEN (Andrew)	Add Llama Assistant (#9744)
M	README.md

commit	17880771ad7dca16cdc969062f2a56f779662835	55951c018d7c107b6ef0a4c8561a6e68183d19d9	2024-10-04T18:50:25+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	55951c018d7c107b6ef0a4c8561a6e68183d19d9	ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee	2024-10-04T15:46:18+02:00	Daniel Bevenius	ggml : fix typo in example usage ggml_gallocr_new (ggml/984)
M	ggml/include/ggml-alloc.h

commit	ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee	f3fdcfaa79afa12047def3a8793d4a566e0532d4	2024-10-04T08:41:40+02:00	Diego Devesa	ggml : fixes after sync (ggml/983)
M	ggml/src/ggml-cuda.cu

commit	f3fdcfaa79afa12047def3a8793d4a566e0532d4	133c7b46b3482f7c126c0c4ba14265f684138306	2024-10-04T11:47:19+02:00	Xuan Son Nguyen	ci : fine-grant permission (#9710)
M	.github/workflows/build.yml
M	.github/workflows/close-issue.yml
M	.github/workflows/nix-ci-aarch64.yml
M	.github/workflows/nix-ci.yml

commit	133c7b46b3482f7c126c0c4ba14265f684138306	d5ed2b929d85bbd7dbeecb690880f07d9d7a6077	2024-10-04T10:54:44+02:00	Daniel Kleine	Fixed RNG seed docs (#9723)
M	common/arg.cpp
M	examples/server/README.md

commit	d5ed2b929d85bbd7dbeecb690880f07d9d7a6077	1bb8a64ebfcbe599dacb4fc8069731b6cba0b5d6	2024-10-03T21:18:19+03:00	Georgi Gerganov	metal : remove abort (skip) (ggml/0)
M	ggml/src/ggml-metal.m

commit	1bb8a64ebfcbe599dacb4fc8069731b6cba0b5d6	fabdc3bda396307565c4f3f4ecbc3a751a2eb6d3	2024-10-03T21:17:49+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	fabdc3bda396307565c4f3f4ecbc3a751a2eb6d3	eee39bdc96065b69242877fe8f1be05c885fc2aa	2024-10-03T17:29:59+02:00	Johannes Gäßler	ggml/ex: calculate accuracy in graph, adapt MNIST (ggml/980)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda.cu
A	ggml/src/ggml-cuda/argmax.cu
A	ggml/src/ggml-cuda/argmax.cuh
M	ggml/src/ggml-cuda/common.cuh
A	ggml/src/ggml-cuda/count-equal.cu
A	ggml/src/ggml-cuda/count-equal.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	eee39bdc96065b69242877fe8f1be05c885fc2aa	5d5ab1e5cca0d6d63701a1cb85dbe26cb57d2c4e	2024-10-02T15:32:39+02:00	Johannes Gäßler	ggml: refactor cross entropy loss CPU impl. (ggml/976)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml.c

commit	5d5ab1e5cca0d6d63701a1cb85dbe26cb57d2c4e	a7ad553513a5d70b4ceacd36f64705cf3654dc97	2024-10-03T11:01:46-07:00	Jack Mousseau	metal : fix compute pass descriptor autorelease crash (#9718)
M	ggml/src/ggml-metal.m

commit	a7ad553513a5d70b4ceacd36f64705cf3654dc97	d6fe7abf04e8ec5240dead6e2773ed1b7e7495d3	2024-10-03T17:39:18+02:00	Diego Devesa	ggml-backend : add device description to CPU backend (#9720)
M	ggml/src/ggml-backend.cpp

commit	d6fe7abf04e8ec5240dead6e2773ed1b7e7495d3	e3c355ba654d4164c1c09e5d0dcacecb8b214af8	2024-10-03T12:39:03-03:00	bandoti	ggml: unify backend logging mechanism (#9709)
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-cann.h
M	ggml/include/ggml-cuda.h
M	ggml/include/ggml-metal.h
M	ggml/include/ggml.h
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-metal.m
M	ggml/src/ggml.c
M	src/llama.cpp

commit	e3c355ba654d4164c1c09e5d0dcacecb8b214af8	841713e1e487bdb82fd106a52ad998c5f87b59e9	2024-10-03T10:22:15-04:00	compilade	convert : handle tokenizer merges format from transformers 4.45 (#9696)
M	gguf-py/gguf/vocab.py

commit	841713e1e487bdb82fd106a52ad998c5f87b59e9	5639971466ed74386a1811938022f0c333007b55	2024-10-03T13:00:52+03:00	Radoslav Gerganov	rpc : enable vulkan (#9714)
M	examples/rpc/rpc-server.cpp

commit	5639971466ed74386a1811938022f0c333007b55	c83ad6d01e7b89ec71080d97c7e5db7ac1f4fda6	2024-10-03T07:50:44+01:00	Ouadie EL FAROUKI	Fixed dequant precision issues in Q4_1 and Q5_1 (#9711)
M	ggml/src/ggml-sycl/dequantize.hpp

commit	c83ad6d01e7b89ec71080d97c7e5db7ac1f4fda6	a39ab216aa624308fda7fa84439c6b61dc98b87a	2024-10-03T01:49:47+02:00	Diego Devesa	ggml-backend : add device and backend reg interfaces (#9707)
M	.github/workflows/bench.yml.disabled
M	Makefile
M	Package.swift
M	ggml/include/ggml-backend.h
M	ggml/include/ggml-blas.h
M	ggml/include/ggml-cann.h
M	ggml/include/ggml-cuda.h
M	ggml/include/ggml-metal.h
M	ggml/include/ggml-rpc.h
M	ggml/include/ggml-sycl.h
M	ggml/include/ggml-vulkan.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend-impl.h
R077	ggml/src/ggml-backend.c	ggml/src/ggml-backend.cpp
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-kompute.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	a39ab216aa624308fda7fa84439c6b61dc98b87a	f536f4c4391bec74c432a924625c04e8c484d3ee	2024-10-02T15:49:55+02:00	Xuan Son Nguyen	llama : reduce compile time and binary size (#9712)
M	src/llama.cpp
M	src/unicode-data.cpp
M	src/unicode-data.h
M	src/unicode.cpp

commit	f536f4c4391bec74c432a924625c04e8c484d3ee	00b7317e636ffdc7dae59cb51dbd1cda357a3168	2024-10-02T13:57:18+01:00	Alberto Cabrera Pérez	[SYCL] Initial cmake support of SYCL for AMD GPUs (#9658)
M	docs/backend/SYCL.md
M	ggml/src/CMakeLists.txt

commit	00b7317e636ffdc7dae59cb51dbd1cda357a3168	76b37d1541a880b9645557c8715a343fd074cc5c	2024-10-02T13:49:16+03:00	Radoslav Gerganov	vulkan : do not use tensor->extra (#9407)
M	ggml/src/ggml-vulkan.cpp

commit	76b37d1541a880b9645557c8715a343fd074cc5c	148844fe97fff4c1563a3111bf238ba4dd22ef56	2024-10-02T15:21:57+08:00	Zhenwei Jin	gguf-split : improve --split and --merge logic (#9619)
M	examples/gguf-split/gguf-split.cpp

commit	148844fe97fff4c1563a3111bf238ba4dd22ef56	3f1ae2e32cde00c39b96be6d01c2997c29bae555	2024-10-02T10:14:44+03:00	Georgi Gerganov	examples : remove benchmark (#9704)
M	Makefile
M	examples/CMakeLists.txt
D	examples/benchmark/CMakeLists.txt
D	examples/benchmark/benchmark-matmult.cpp

commit	3f1ae2e32cde00c39b96be6d01c2997c29bae555	f1b8c4271125c2bfb9cfebd72a8b9e9f99061a30	2024-10-01T12:18:46-05:00	Paweł Wodnicki	Update README.md (#9591)
M	README.md

commit	f1b8c4271125c2bfb9cfebd72a8b9e9f99061a30	e98c1c188ebbeb55d0cd6389ad03f0cbf995b451	2024-10-01T16:09:42+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	e98c1c188ebbeb55d0cd6389ad03f0cbf995b451	cb00020504416606601f8cb35f55ee07b710b4b7	2024-09-30T09:55:23+02:00	Johannes Gäßler	test: fix OPT_STEP_ADAMW for test-backend-ops (ggml/974)
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	cb00020504416606601f8cb35f55ee07b710b4b7	6c5322481a75f1be54e58a000c3f78484d07f948	2024-09-30T09:14:09+02:00	Salvatore Mesoraca	vulkan : mul_mat: fix UB with small warps (ggml/952)
M	ggml/src/ggml-vulkan.cpp

commit	6c5322481a75f1be54e58a000c3f78484d07f948	7254cdf7e8d6312840509ca8d766358c687c6266	2024-09-30T10:11:41+03:00	Borislav Stanimirov	ggml : fix ggml_cast (ggml/973)
M	ggml/src/ggml.c

commit	7254cdf7e8d6312840509ca8d766358c687c6266	cad341d88924788b940997c55e7bef000c99e784	2024-09-29T23:18:02+02:00	Johannes Gäßler	ggml: fix gradient allocation logic (ggml/966)
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp
M	tests/test-grad0.cpp

commit	cad341d88924788b940997c55e7bef000c99e784	a90484c6d9db699bf739d0f33daf1c50cbdd45c9	2024-10-01T16:00:25+03:00	Georgi Gerganov	metal : reduce command encoding overhead (#9698)
M	examples/cvector-generator/pca.hpp
M	examples/llava/clip.cpp
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-metal.m
M	src/llama.cpp

commit	a90484c6d9db699bf739d0f33daf1c50cbdd45c9	1927378bcce20ba72b6c89d5977b854a4bcaeb5d	2024-10-01T11:42:01+03:00	Georgi Gerganov	llama : print correct model type for Llama 3.2 1B and 3B
M	src/llama.cpp

commit	1927378bcce20ba72b6c89d5977b854a4bcaeb5d	6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3	2024-10-01T02:31:36-04:00	compilade	convert : refactor rope_freqs generation (#9396)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py

commit	6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3	511636df0c90826b4dd1fc21ff260c19d69a3b5d	2024-09-30T21:57:12+03:00	serhii-nakon	Fix Docker ROCM builds, use AMDGPU_TARGETS instead of GPU_TARGETS (#9641)
M	.devops/full-rocm.Dockerfile
M	.devops/llama-cli-rocm.Dockerfile
M	.devops/llama-server-rocm.Dockerfile
M	.github/workflows/build.yml

commit	511636df0c90826b4dd1fc21ff260c19d69a3b5d	08a43d05b6ba74de97610ae519450ad9996475e0	2024-09-30T14:13:16-04:00	compilade	ci : reduce severity of unused Pyright ignore comments (#9697)
M	.github/workflows/python-type-check.yml
M	examples/llava/convert_image_encoder_to_gguf.py
M	pyrightconfig.json

commit	08a43d05b6ba74de97610ae519450ad9996475e0	ace4f4be37abed4801fbd54a94cf38a7ae462416	2024-09-30T17:03:47+02:00	vb	py : update transfomers version (#9694)
M	examples/server/tests/requirements.txt
M	requirements/requirements-convert_legacy_llama.txt

commit	ace4f4be37abed4801fbd54a94cf38a7ae462416	8277a817f18967581b02b2248989d773e8e99998	2024-09-30T17:48:49+03:00	Georgi Gerganov	flake.lock: Update (#9680)
M	flake.lock

commit	8277a817f18967581b02b2248989d773e8e99998	c919d5db39c8a7fcb64737f008e4b105ee0acd20	2024-09-30T13:53:42+05:30	Ruchira Hasaranga	console : utf-8 fix for windows stdin (#9690)
M	common/console.cpp

commit	c919d5db39c8a7fcb64737f008e4b105ee0acd20	d0b1d663e430354ab35853a6e1bce51cc8819376	2024-09-29T21:18:23+03:00	Georgi Gerganov	ggml : define missing HWCAP flags (#9684)
M	ggml/src/ggml.c

commit	d0b1d663e430354ab35853a6e1bce51cc8819376	aaa40999251f5d18309b3fddc5a7d576f5fdb4e1	2024-09-29T21:16:07+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	aaa40999251f5d18309b3fddc5a7d576f5fdb4e1	641002fba8d2a0c0269027e23d2ef58e90546028	2024-09-29T19:56:17+02:00	Johannes Gäßler	CUDA: remove bad assert (ggml/972)
M	ggml/src/ggml-cuda/im2col.cu

commit	641002fba8d2a0c0269027e23d2ef58e90546028	0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c	2024-09-29T11:50:17-05:00	Jeff Bolz	vulkan : multithread pipeline creation (ggml/963)
M	ggml/src/ggml-vulkan.cpp

commit	0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c	544f409b4bd8fc98a3e87820f0ac934e00402de7	2024-09-27T02:58:01-05:00	Jeff Bolz	vulkan : fix build for GGML_VULKAN_RUN_TESTS, add TFLOPS to log (ggml/961)
M	ggml/src/ggml-vulkan.cpp

commit	544f409b4bd8fc98a3e87820f0ac934e00402de7	6084bfb261b03f812de2255b05b6b5bb8d1c7171	2024-09-26T08:59:42+02:00	Salvatore Mesoraca	vulkan : argsort barriers must be under uniform control flow (ggml/951)
M	ggml/src/vulkan-shaders/argsort.comp

commit	6084bfb261b03f812de2255b05b6b5bb8d1c7171	faac0bae265449fd988c57bf894018edc36fbe1e	2024-09-24T13:23:59+03:00	Georgi Gerganov	ggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969)
M	ggml/include/ggml.h

commit	faac0bae265449fd988c57bf894018edc36fbe1e	f99d3f8367174f7aba73c07fd87de687d4a0ece1	2024-09-29T05:25:00-07:00	matiaslin	common : ensure llama_batch size does not exceed max size (#9668)
M	common/common.cpp

commit	f99d3f8367174f7aba73c07fd87de687d4a0ece1	589b48d41efb0e95133b77c335f4fb9779af9bfb	2024-09-29T12:02:06Z	nopperl	py : add model class for Chameleon conversion (#9683)
M	convert_hf_to_gguf.py

commit	589b48d41efb0e95133b77c335f4fb9779af9bfb	f4d2b8846a6b34419ff9e9491aee6cd95e444bfc	2024-09-29T14:38:18+03:00	Georgi Gerganov	contrib : add Resources section (#9675)
M	CONTRIBUTING.md
M	README.md

commit	f4d2b8846a6b34419ff9e9491aee6cd95e444bfc	1b2f992cd2cff0b69e5abe78bb8888d51ed19d67	2024-09-28T17:42:03+03:00	Georgi Gerganov	llama : add reranking support (#9510)
M	ci/run.sh
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	examples/embedding/embedding.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/embeddings.feature
A	examples/server/tests/features/rerank.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	1b2f992cd2cff0b69e5abe78bb8888d51ed19d67	739842703e32cd43443c45e0b4f6647cc4e6b3d6	2024-09-28T14:32:46+02:00	slaren	test-backend-ops : use flops for some performance tests (#9657)
M	tests/test-backend-ops.cpp

commit	739842703e32cd43443c45e0b4f6647cc4e6b3d6	6102037bbb55521880ae78a6ee6c2a0c00c901df	2024-09-28T15:13:21+03:00	Georgi Gerganov	llama : add comment about thread-safety [no ci] (#9449)
M	include/llama.h

commit	6102037bbb55521880ae78a6ee6c2a0c00c901df	9a913110cf471a8287ac06c43cbe307d3cf6df99	2024-09-28T20:10:58+08:00	Zhenwei Jin	vocab : refactor tokenizer to reduce init overhead (#9449)
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp
M	tests/test-tokenizer-0.cpp

commit	9a913110cf471a8287ac06c43cbe307d3cf6df99	43bcdd9703ec19af7d2a519640b5ed6f4aac3d53	2024-09-28T12:08:43Z	nopperl	llama : add support for Chameleon (#8543)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
A	models/ggml-vocab-chameleon.gguf.inp
A	models/ggml-vocab-chameleon.gguf.out
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	43bcdd9703ec19af7d2a519640b5ed6f4aac3d53	6a0f7794847244fb3b99a983e03137d7e832b585	2024-09-28T15:07:14+03:00	Aarni Koskela	readme : add tool (#9655)
M	README.md

commit	6a0f7794847244fb3b99a983e03137d7e832b585	89f9944981010d195e411a9fbfbb19959412f710	2024-09-28T14:06:16+02:00	Dan Johansson	ggml : add run-time detection of neon, i8mm and sve (#9331)
M	ggml/include/ggml.h
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
M	ggml/src/ggml.c

commit	89f9944981010d195e411a9fbfbb19959412f710	b5de3b74a595cbfefab7eeb5a567425c6a9690cf	2024-09-28T12:05:05+02:00	Markus Tavenrath	Enable use to the rebar feature to upload buffers to the device. (#9251)
M	ggml/src/ggml-vulkan.cpp

commit	b5de3b74a595cbfefab7eeb5a567425c6a9690cf	44f59b4301c51f071daa2e951301bb17c14acc9b	2024-09-27T20:57:51+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	44f59b4301c51f071daa2e951301bb17c14acc9b	95bc82fbc0df6d48cf66c857a4dda3d044f45ca2	2024-09-27T10:42:06+03:00	Borislav Stanimirov	cmake : add option for common library (#9661)
M	CMakeLists.txt

commit	95bc82fbc0df6d48cf66c857a4dda3d044f45ca2	7691654c68aa5316108f881136c59f815ccb6809	2024-09-26T17:38:31+08:00	Neo Zhang Jianyu	[SYCL] add missed dll file in package (#9577)
M	.github/workflows/build.yml

commit	7691654c68aa5316108f881136c59f815ccb6809	ea9c32be71b91b42ecc538bd902e93cbb5fb36cb	2024-09-26T09:27:40+08:00	R0CKSTAR	mtgpu: enable VMM (#9597)
M	ggml/src/ggml-cuda.cu

commit	ea9c32be71b91b42ecc538bd902e93cbb5fb36cb	1e436302188a704ac9ea044af03193648806f19c	2024-09-25T17:26:01+02:00	Xuan Son Nguyen	ci : fix docker build number and tag name (#9638)
M	.dockerignore
M	.github/workflows/docker.yml

commit	1e436302188a704ac9ea044af03193648806f19c	afbbfaa537a96f562c34df4542930fa951b40d9e	2024-09-25T15:12:20+02:00	Charles Xu	ggml : remove assert for AArch64 GEMV and GEMM Q4 kernels (#9217)
M	ggml/src/ggml-aarch64.c

commit	afbbfaa537a96f562c34df4542930fa951b40d9e	3d6bf6919f7b10726421779cd344f2da05421c68	2024-09-25T14:05:13+02:00	Xuan Son Nguyen	server : add more env vars, improve gen-docs (#9635)
M	common/arg.cpp
M	examples/gen-docs/gen-docs.cpp
M	examples/server/README.md
M	examples/server/server.cpp

commit	3d6bf6919f7b10726421779cd344f2da05421c68	904837e0cb2f5f01bf5d5901b7aa57a026860ae4	2024-09-25T01:06:52-06:00	Gabe Goodhart	llama : add IBM Granite MoE architecture (#9438)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	904837e0cb2f5f01bf5d5901b7aa57a026860ae4	70392f1f81470607ba3afef04aa56c9f65587664	2024-09-25T11:30:38+08:00	Dou Xinpeng	cann: fix crash when llama-bench is running on multiple cann devices (#9627)
M	ggml/src/ggml-cann/common.h

commit	70392f1f81470607ba3afef04aa56c9f65587664	bb5f8199754b5f055cf436711d14c58e7be28e12	2024-09-24T16:03:21+08:00	Eric Zhang	ggml : add AVX512DQ requirement for AVX512 builds (#9622)
M	ggml/src/CMakeLists.txt

commit	bb5f8199754b5f055cf436711d14c58e7be28e12	c038931615d2525d732943fa8661e29aa361b192	2024-09-24T11:01:18+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	c038931615d2525d732943fa8661e29aa361b192	31ac5834fe75c296476658a124c06c84772aa641	2024-09-20T21:50:16+03:00	Georgi Gerganov	examples : adapt to ggml.h changes (ggml/0)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	31ac5834fe75c296476658a124c06c84772aa641	cea1486ecf34a1c7e014a9e290eb458f5a11f876	2024-09-24T10:16:06+03:00	Georgi Gerganov	llama : keep track of all EOG tokens in the vocab (#9609)
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	cea1486ecf34a1c7e014a9e290eb458f5a11f876	0aa15011e315659640504731d1d05663837130fa	2024-09-24T10:15:35+03:00	Georgi Gerganov	log : add CONT level for continuing previous log entry (#9610)
M	common/log.cpp
M	common/log.h
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	ggml/include/ggml.h
M	src/llama-impl.h
M	src/llama.cpp

commit	0aa15011e315659640504731d1d05663837130fa	b0f27361f3539a81d983a8b045f3c61e682d9fc0	2024-09-23T23:04:39-07:00	StrangeBytesDev	server : add newline after chat example (#9616)
M	examples/server/server.cpp

commit	b0f27361f3539a81d983a8b045f3c61e682d9fc0	c087b6f11d3385f4293b6841ebfb755063479490	2024-09-24T09:03:17+03:00	Georgi Gerganov	sampling : avoid expensive softmax during greedy sampling (#9605)
M	common/sampling.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	c087b6f11d3385f4293b6841ebfb755063479490	116efee0eef09d8c3c4c60b52fa01b56ddeb432c	2024-09-23T21:18:48-07:00	Max Krasnyansky	threads: fix msvc build without openmp (#9615)
M	ggml/src/ggml.c

commit	116efee0eef09d8c3c4c60b52fa01b56ddeb432c	0b3bf966f47bf2ba88e5d4e3ed429602008c7e63	2024-09-24T03:14:24+03:00	Ivan	cuda: add q8_0->f32 cpy operation (#9571)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/cpy.cu
M	src/llama.cpp

commit	0b3bf966f47bf2ba88e5d4e3ed429602008c7e63	f0c7b5edf82aa200656fd88c11ae3a805d7130bf	2024-09-23T22:23:54+02:00	Xuan Son Nguyen	server : add --no-context-shift option (#9607)
M	common/arg.cpp
M	examples/server/README.md
M	examples/server/server.cpp
A	examples/server/tests/features/ctx_shift.feature
M	examples/server/tests/features/embeddings.feature
M	examples/server/tests/features/steps/steps.py

commit	f0c7b5edf82aa200656fd88c11ae3a805d7130bf	1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3	2024-09-23T11:42:43-07:00	Max Krasnyansky	threads: improve ggml_barrier scaling with large number of threads (#9598)
M	ggml/src/ggml.c

commit	1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3	f3979df762b75a2b1c0f622a2cd15d1bc60f037f	2024-09-23T23:58:17+08:00	Riceball LEE	readme : add programmable prompt engine language CLI (#9599)
M	README.md

commit	f3979df762b75a2b1c0f622a2cd15d1bc60f037f	1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59	2024-09-23T18:43:40+03:00	Georgi Gerganov	flake.lock: Update (#9586)
M	flake.lock

commit	1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59	37f8c7b4c97784496cfd91040d55fa22f50b1d57	2024-09-23T19:36:38+05:30	Srihari-mcw	ggml : AVX512 gemm for Q4_0_8_8 (#9532)
M	ggml/src/ggml-aarch64.c

commit	37f8c7b4c97784496cfd91040d55fa22f50b1d57	bf9c1013ac40e5f1bd8e60b6d8bf16e0e8401445	2024-09-23T11:28:02+03:00	Georgi Gerganov	perplexity : remove extra new lines after chunks (#9596)
M	examples/perplexity/perplexity.cpp

commit	bf9c1013ac40e5f1bd8e60b6d8bf16e0e8401445	e62e9789cda3bf5573a747e55ec2a7ee32908f56	2024-09-23T11:27:47+03:00	Georgi Gerganov	metal : use F32 prec for K*Q in vec FA (#9595)
M	ggml/src/ggml-metal.metal

commit	e62e9789cda3bf5573a747e55ec2a7ee32908f56	c35e586ea57221844442c65a1172498c54971cb0	2024-09-23T08:58:06+05:30	Akarshan Biswas	Revert "[SYCL] fallback mmvq (#9088)" (#9579)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/common.hpp

commit	c35e586ea57221844442c65a1172498c54971cb0	912c331d3dba3a079815844208dc36164baa8cc7	2024-09-22T22:55:49+08:00	R0CKSTAR	musa: enable building fat binaries, enable unified memory, and disable Flash Attention on QY1 (MTT S80) (#9526)
M	Makefile
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/vendors/musa.h

commit	912c331d3dba3a079815844208dc36164baa8cc7	a5b57b08ce1998f7046df75324e86b9e2561c7af	2024-09-22T21:26:50+08:00	Molly Sophia	Fix merge error in #9454 (#9589)
M	ggml/src/ggml-cuda.cu

commit	a5b57b08ce1998f7046df75324e86b9e2561c7af	ecd5d6b65be08927e62de1587d5fd22778cdc250	2024-09-22T09:34:52+02:00	Johannes Gäßler	CUDA: enable Gemma FA for HIP/Pascal (#9581)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/fattn.cu
M	tests/test-backend-ops.cpp

commit	ecd5d6b65be08927e62de1587d5fd22778cdc250	2a63caaa69fad6c2afddc47bae052cf2afb01529	2024-09-21T19:30:34-07:00	Shankar	llama: remove redundant loop when constructing ubatch (#9574)
M	src/llama.cpp

commit	2a63caaa69fad6c2afddc47bae052cf2afb01529	d09770cae71b416c032ec143dda530f7413c4038	2024-09-22T10:29:12+08:00	Molly Sophia	RWKV v6: RWKV_WKV op CUDA implementation (#9454)
M	ggml/src/ggml-cuda.cu
A	ggml/src/ggml-cuda/rwkv-wkv.cu
A	ggml/src/ggml-cuda/rwkv-wkv.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	tests/test-backend-ops.cpp

commit	d09770cae71b416c032ec143dda530f7413c4038	41f477879fd5ccc31211634292e8e293ec700e85	2024-09-21T14:24:23+02:00	slaren	ggml-alloc : fix list of allocated tensors with GGML_ALLOCATOR_DEBUG (#9573)
M	ggml/src/ggml-alloc.c

commit	41f477879fd5ccc31211634292e8e293ec700e85	e948a7da7af7f2dbfdcd695b3ba903ab12575f78	2024-09-21T01:41:07+01:00	agray3	Update CUDA graph on scale change plus clear nodes/params  (#9550)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/common.cuh

commit	e948a7da7af7f2dbfdcd695b3ba903ab12575f78	63351143b2ea5efe9f8b9c61f553af8a51f1deff	2024-09-21T08:39:41+08:00	Huang Qi	CI: Provide prebuilt windows binary for hip (#9467)
M	.github/workflows/build.yml

commit	63351143b2ea5efe9f8b9c61f553af8a51f1deff	d13edb17ed1ce3b961016cbdb616b1c8d161c026	2024-09-20T20:55:36+02:00	slaren	quantize : improve type name parsing (#9570)
M	examples/quantize/quantize.cpp

commit	d13edb17ed1ce3b961016cbdb616b1c8d161c026	27609c49b94766a136764ce7919c8a082bf71548	2024-09-20T20:12:52+03:00	Georgi Gerganov	ggml : fix builds (#0)
M	ggml/src/ggml-cuda/out-prod.cu
M	ggml/src/ggml-cuda/vendors/hip.h
M	ggml/src/ggml-sycl.cpp

commit	27609c49b94766a136764ce7919c8a082bf71548	43015353262de835215103475055b74045cb9f49	2024-09-20T19:13:02+03:00	Georgi Gerganov	ggml : fix trailing whitespace (#0)
M	ggml/src/ggml-backend.c

commit	43015353262de835215103475055b74045cb9f49	424c5d00a9b97dd5559635872db9b57f87c23b02	2024-09-20T19:06:59+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	424c5d00a9b97dd5559635872db9b57f87c23b02	a6809c6a2e8163cba296d4cc0c5cd4bbc8073638	2024-09-20T19:04:44+03:00	Johannes Gäßler	ggml/examples: add backend support for numerical optimization (ggml/949)
M	ggml/include/ggml-backend.h
M	ggml/include/ggml.h
M	ggml/src/ggml-backend-impl.h
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/binbcast.cuh
M	ggml/src/ggml-cuda/cross-entropy-loss.cu
M	ggml/src/ggml-cuda/cross-entropy-loss.cuh
A	ggml/src/ggml-cuda/opt-step-adamw.cu
A	ggml/src/ggml-cuda/opt-step-adamw.cuh
A	ggml/src/ggml-cuda/out-prod.cu
A	ggml/src/ggml-cuda/out-prod.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-kompute.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp
M	tests/test-grad0.cpp

commit	a6809c6a2e8163cba296d4cc0c5cd4bbc8073638	5cb12f68395a5ec00b357e408883ce124a11dcdb	2024-09-08T11:10:43+03:00	Georgi Gerganov	examples : add null threadpool args where needed (ggml/0)
M	ggml/src/ggml.c

commit	5cb12f68395a5ec00b357e408883ce124a11dcdb	d39e26741f9f02340651dbc640c9776e1a1128ef	2024-09-20T18:35:35+02:00	Johannes Gäßler	CUDA: fix sum.cu compilation for CUDA < 11.7 (#9562)
M	ggml/src/ggml-cuda/sum.cu

commit	d39e26741f9f02340651dbc640c9776e1a1128ef	722ec1eb51ed53be2ab1ef31c6a1da8261803c71	2024-09-20T11:46:56+03:00	Georgi Gerganov	examples : flush log upon ctrl+c (#9559)
M	examples/infill/infill.cpp
M	examples/main/main.cpp

commit	722ec1eb51ed53be2ab1ef31c6a1da8261803c71	6026da52d6942b253df835070619775d849d0258	2024-09-20T08:38:10+02:00	Sigbjørn Skjæret	perplexity : do not escape input data by default (#9548)
M	examples/perplexity/perplexity.cpp

commit	6026da52d6942b253df835070619775d849d0258	eca0fab44eb449ed34e17a9b651ae7398b494117	2024-09-19T12:44:53+03:00	Georgi Gerganov	server : clean-up completed tasks from waiting list (#9531)
M	examples/server/server.cpp

commit	eca0fab44eb449ed34e17a9b651ae7398b494117	64c6af3195c3cd4aa3328a1282d29cd2635c34c9	2024-09-19T09:58:14+02:00	Sigbjørn Skjæret	imatrix : disable prompt escape by default (#9543)
M	examples/imatrix/imatrix.cpp

commit	64c6af3195c3cd4aa3328a1282d29cd2635c34c9	0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1	2024-09-18T19:13:08+02:00	slaren	ggml : fix n_threads_cur initialization with one thread (#9538)
M	ggml/src/ggml.c

commit	0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1	6443ddd98576a9da904ef9f07df4e4398bb6a01a	2024-09-18T18:34:32+03:00	Georgi Gerganov	scripts : verify py deps at the start of compare (#9520)
M	scripts/compare-commits.sh
M	scripts/compare-llama-bench.py

commit	6443ddd98576a9da904ef9f07df4e4398bb6a01a	8a308354f6520df6bea851b435bd8054ee5617b4	2024-09-18T13:42:36+02:00	Daniel Bevenius	llama : use reserve/emplace_back in sampler_sample (#9534)
M	src/llama-sampling.cpp

commit	8a308354f6520df6bea851b435bd8054ee5617b4	f799155ab8279cfa668086ce584aa52ecc05f5e5	2024-09-18T01:50:34-05:00	Vinesh Janarthanan	server : match OAI structured output response (#9527)
M	examples/server/README.md
M	examples/server/utils.hpp
M	grammars/README.md

commit	f799155ab8279cfa668086ce584aa52ecc05f5e5	faf67b3de4688f47c3b1019c89df255df2fd59b4	2024-09-18T14:28:20+08:00	Eric Zhang	server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529)
M	examples/server/server.cpp

commit	faf67b3de4688f47c3b1019c89df255df2fd59b4	7be099fa817e9c53ffb4c3ed7d063e1cffcd675a	2024-09-18T08:30:31+08:00	Neo Zhang Jianyu	[SYCL]set context default value to avoid memory issue, update guide (#9476)
M	docs/backend/SYCL.md
M	examples/sycl/run-llama2.sh

commit	7be099fa817e9c53ffb4c3ed7d063e1cffcd675a	8b836ae731bbb2c5640bc47df5b0a78ffcb129cb	2024-09-17T22:41:38+02:00	Michael Podvitskiy	llama-bench: correct argument parsing error message (#9524)
M	examples/llama-bench/llama-bench.cpp

commit	8b836ae731bbb2c5640bc47df5b0a78ffcb129cb	8344ef58f8cdb8ebd6faf4463ca32ae91c374c81	2024-09-17T09:35:38-04:00	Bert Wagner	arg : add env variable for parallel (#9513)
M	common/arg.cpp
M	examples/server/README.md

commit	8344ef58f8cdb8ebd6faf4463ca32ae91c374c81	0226613853133c081b55bb892a41bb5eacc0bc94	2024-09-17T12:18:22+02:00	Michael Podvitskiy	llama : fix n_vocab init for 'no_vocab' case (#9511)
M	src/llama.cpp

commit	0226613853133c081b55bb892a41bb5eacc0bc94	503147a9f9d195d6a14e7c998df23b6eb61f2bae	2024-09-17T01:19:46-07:00	Max Krasnyansky	threadpool : skip polling for unused threads (#9461)
M	ggml/src/ggml.c
M	tests/CMakeLists.txt
A	tests/test-barrier.cpp

commit	503147a9f9d195d6a14e7c998df23b6eb61f2bae	0d2ec438330271d201c2e9224aca23d0d5c908bf	2024-09-17T02:51:15-04:00	Yuri Khrustalev	unicode : add <algorithm> (#9508)
M	src/unicode.cpp

commit	0d2ec438330271d201c2e9224aca23d0d5c908bf	37f3a3810e545be6ac835c726f97956c1403ea02	2024-09-17T00:44:58-06:00	Gabe Goodhart	llama : support IBM Granite architecture (#9412)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama.cpp

commit	37f3a3810e545be6ac835c726f97956c1403ea02	23e0d70bacaaca1429d365a44aa9e7434f17823b	2024-09-17T08:23:30+02:00	Michael Podvitskiy	llama : add llama_n_head() (#9512)
M	include/llama.h
M	src/llama.cpp

commit	23e0d70bacaaca1429d365a44aa9e7434f17823b	acb2c32c336ce60d765bb189563cc216e57e9fc2	2024-09-16T16:22:07+02:00	slaren	ggml : move common CPU backend impl to new header (#9509)
M	ggml/src/ggml-aarch64.c
A	ggml/src/ggml-cpu-impl.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-quants.c
M	ggml/src/ggml.c
M	ggml/src/llamafile/sgemm.cpp

commit	acb2c32c336ce60d765bb189563cc216e57e9fc2	a6a3a5c531c73aef85750a847d21e7d4671e723d	2024-09-16T13:07:13+02:00	Daniel Bevenius	llama : rename n_embed to n_embd in rwkv6_time_mix (#9504)
M	src/llama.cpp

commit	a6a3a5c531c73aef85750a847d21e7d4671e723d	d54c21df7e2669c6cd7492713479d1aeb5846883	2024-09-16T13:06:50+02:00	Michael Podvitskiy	ggml : link MATH_LIBRARY not by its full path (#9339)
M	ggml/src/CMakeLists.txt

commit	d54c21df7e2669c6cd7492713479d1aeb5846883	19514d632e5274bc0c27c2269e8f2ad88b526d62	2024-09-16T03:30:22-04:00	compilade	convert : identify missing model files (#9397)
M	convert_hf_to_gguf.py

commit	19514d632e5274bc0c27c2269e8f2ad88b526d62	5c3d0f1824714e9a97fc9b06e046eefcb6ecc721	2024-09-16T10:27:50+03:00	Georgi Gerganov	cmake : do not hide GGML options + rename option (#9465)
M	CMakeLists.txt
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt

commit	5c3d0f1824714e9a97fc9b06e046eefcb6ecc721	0aadac10c7dd704f8285ddf5a63d6f764cb340aa	2024-09-16T06:48:24Z	Eve	ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422)
M	ggml/src/ggml-quants.c
M	ggml/src/llamafile/sgemm.cpp

commit	0aadac10c7dd704f8285ddf5a63d6f764cb340aa	95ca85168b5b089b80a811b59528ce0a2f1bd1dd	2024-09-15T23:47:37-07:00	Shane A	llama : support OLMoE (#9462)
M	README.md
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	95ca85168b5b089b80a811b59528ce0a2f1bd1dd	441b72b91f818fe69497e5816f87969e90c73c43	2024-09-16T14:45:20+08:00	CarryFun	llama : support MiniCPM3 (#9322)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	src/llama.cpp

commit	441b72b91f818fe69497e5816f87969e90c73c43	c4965a64f72ac9434c21cf0e1c3421d13e889155	2024-09-16T01:20:01-05:00	Vinesh Janarthanan	main : option to disable context shift (#9484)
M	common/arg.cpp
M	common/common.h
M	examples/main/README.md
M	examples/main/main.cpp

commit	c4965a64f72ac9434c21cf0e1c3421d13e889155	90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164	2024-09-16T09:05:56+03:00	Georgi Gerganov	metal : handle zero-sized allocs (#9466)
M	ggml/src/ggml-metal.m

commit	90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164	6262d13e0b2da91f230129a93a996609a2f5a2f2	2024-09-16T05:14:23+03:00	Georgi Gerganov	flake.lock: Update (#9488)
M	flake.lock

commit	6262d13e0b2da91f230129a93a996609a2f5a2f2	e6deac31f7e62db43b6afbc3be814f764fd5a187	2024-09-15T20:46:12+03:00	Georgi Gerganov	common : reimplement logging (#9418)
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	Makefile
M	ci/run.sh
M	common/CMakeLists.txt
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
A	common/log.cpp
M	common/log.h
M	common/ngram-cache.cpp
M	common/sampling.cpp
M	common/train.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llava/clip.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/llava.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/bench/README.md
M	examples/server/bench/bench.py
M	examples/server/server.cpp
A	examples/server/tests/.gitignore
M	examples/server/tests/README.md
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	examples/tokenize/tokenize.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-metal.m
M	src/llama-impl.h
M	src/llama.cpp
M	tests/CMakeLists.txt
M	tests/test-arg-parser.cpp
A	tests/test-log.cpp

commit	e6deac31f7e62db43b6afbc3be814f764fd5a187	6988da94a261444859f78595899212eeedc5ff9d	2024-09-15T19:02:27+02:00	slaren	gguf-split : add basic checks (#9499)
M	examples/gguf-split/gguf-split.cpp

commit	6988da94a261444859f78595899212eeedc5ff9d	3c7989fd29a2db2b75e28fd708cc441febe99a82	2024-09-15T18:55:52+02:00	Michael Podvitskiy	cmake : correct order of sycl flags (#9497)
M	ggml/src/CMakeLists.txt

commit	3c7989fd29a2db2b75e28fd708cc441febe99a82	d6b37c881f056bd32b681dcd7658a37ea6ec3a1e	2024-09-15T00:48:25-07:00	Csaba Kecskemeti	py : add "LLaMAForCausalLM" conversion support (#9485)
M	convert_hf_to_gguf.py

commit	d6b37c881f056bd32b681dcd7658a37ea6ec3a1e	7596487bebd58eade3cd0133d42a9008aaaf9d09	2024-09-15T10:36:53+03:00	OSecret	readme : update tools list (#9475)
M	README.md

commit	7596487bebd58eade3cd0133d42a9008aaaf9d09	822b6322dea704110797a5671fc80ae39ee6ac97	2024-09-15T09:06:38+02:00	Michael Podvitskiy	cmake : try to fix sycl+intel build (#9487)
M	ggml/src/CMakeLists.txt

commit	822b6322dea704110797a5671fc80ae39ee6ac97	dcdcee3a744f39714503ee2b19c49b7c7b6209c9	2024-09-14T05:54:37-04:00	Yuri Khrustalev	ggml : ggml_type_name return "NONE" for invalid values (#9458)
M	ggml/src/ggml.c

commit	dcdcee3a744f39714503ee2b19c49b7c7b6209c9	1f4111e540bacec8d00ca9fd96417bf4c1339394	2024-09-14T17:36:44+08:00	VoidIsVoid	server: add data: [DONE] to /chat/completions stream response (#9459)
M	examples/server/server.cpp
M	examples/server/tests/features/steps/steps.py

commit	1f4111e540bacec8d00ca9fd96417bf4c1339394	befaf1197fa447f61714de041828852a270659d2	2024-09-14T10:55:05+03:00	Georgi Gerganov	cmake : use list(APPEND ...) instead of set() + dedup linker (#9463)
M	ggml/src/CMakeLists.txt

commit	befaf1197fa447f61714de041828852a270659d2	feff4aa8461da7c432d144c11da4802e41fef3cf	2024-09-14T09:50:12+02:00	Daniel Bevenius	llama : make cell_id const in inp_s_mask block (#9470)
M	src/llama.cpp

commit	feff4aa8461da7c432d144c11da4802e41fef3cf	0abc6a2c25272d5cf01384dda8ee8bfec4ba8745	2024-09-13T14:23:11+02:00	Xuan Son Nguyen	server : add loading html page while model is loading (#9468)
M	Makefile
M	examples/server/CMakeLists.txt
A	examples/server/public/loading.html
M	examples/server/server.cpp

commit	0abc6a2c25272d5cf01384dda8ee8bfec4ba8745	bd35cb0ae357185c173345f10dc89a4ff925fc25	2024-09-13T09:53:38+03:00	Georgi Gerganov	llama : llama_perf + option to disable timings during decode (#9355)
M	common/arg.cpp
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookup/lookup.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	src/llama.cpp

commit	bd35cb0ae357185c173345f10dc89a4ff925fc25	78203641fee3b1f82abaff0c7f667e1b4a286390	2024-09-13T04:54:49+03:00	Gilad S.	feat: remove a sampler from a chain (#9445)
M	include/llama.h
M	src/llama-sampling.cpp

commit	78203641fee3b1f82abaff0c7f667e1b4a286390	e6b7801bd189d102d901d3e72035611a25456ef1	2024-09-12T22:30:11+02:00	Mathijs Henquet	server : Add option to return token pieces in /tokenize endpoint (#9108)
M	.github/workflows/server.yml
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp

commit	e6b7801bd189d102d901d3e72035611a25456ef1	e665744317c77fc3483fc5224fe6d586b5166b33	2024-09-12T19:46:43+08:00	Dou Xinpeng	cann: Add host buffer type for Ascend NPU (#9406)
M	ggml/include/ggml-cann.h
M	ggml/src/ggml-cann.cpp
M	src/llama.cpp

commit	e665744317c77fc3483fc5224fe6d586b5166b33	d4c3c10fad1bd6adec72d2f1f236761a8d6a07f8	2024-09-12T19:34:22+08:00	fengerhu1	llava : fix the script error in MobileVLM README (#9054)
M	examples/llava/MobileVLM-README.md

commit	d4c3c10fad1bd6adec72d2f1f236761a8d6a07f8	2a825116b6f7f3a9b1726e5e0c3eb22f7768bd33	2024-09-12T13:33:57+02:00	Xuan Son Nguyen	lora : raise error if lm_head is ignored (#9103)
M	convert_lora_to_gguf.py

commit	2a825116b6f7f3a9b1726e5e0c3eb22f7768bd33	4dc4f5f14ae522494649d82ad06b031cf9501038	2024-09-12T13:30:01+02:00	Michael Podvitskiy	cmake : fix for builds without `GGML_CDEF_PUBLIC` (#9338)
M	CMakeLists.txt

commit	4dc4f5f14ae522494649d82ad06b031cf9501038	c837981bba7cf6839b69d32b25552ce685936b14	2024-09-12T19:28:43+08:00	Huang Qi	ci : update HIP SDK to 24.Q3 (ROCm 6.1) (#9329)
M	.github/workflows/build.yml

commit	c837981bba7cf6839b69d32b25552ce685936b14	3c26a1644dacfa6b5d58af550210524efd7b93fc	2024-09-12T20:28:20+09:00	daminho	py : add Phi-1.5/Phi-2 tokenizer (#9361)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py

commit	3c26a1644dacfa6b5d58af550210524efd7b93fc	ff76e18516dbe269b35ba1bb500524ed5e39225c	2024-09-12T04:27:45-07:00	Trivikram Kamat	ci : bump actions/checkout to v4 (#9377)
M	.github/workflows/build.yml

commit	ff76e18516dbe269b35ba1bb500524ed5e39225c	39f852f44039b058fdd0611ee127c6efa7ba4a04	2024-09-12T13:27:14+02:00	Michael Podvitskiy	cmake : fixed the order of linking libraries for llama-quantize (#9450)
M	examples/quantize/CMakeLists.txt

commit	39f852f44039b058fdd0611ee127c6efa7ba4a04	2b00fa799773cc75d53b841c03d21d7468a1e3a1	2024-09-12T19:25:16+08:00	Molly Sophia	py : add special tokens in hf_converter for RWKV v6 (#9428)
M	convert_hf_to_gguf.py

commit	2b00fa799773cc75d53b841c03d21d7468a1e3a1	d6a04f872dea8ade92527bb1488d4b0b90cc49f0	2024-09-12T16:24:31+05:00	Ahmad Tameem	riscv : modify Makefile and add a RISCV_VECT to print log info (#9442)
M	Makefile
M	common/common.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	src/llama.cpp

commit	d6a04f872dea8ade92527bb1488d4b0b90cc49f0	c9c8575a1a8a170329afca4c4df4c005806efb1d	2024-09-12T14:23:49+03:00	Georgi Gerganov	ggml : hide ggml_object, ggml_cgraph, ggml_hash_set (#9408)
M	examples/benchmark/benchmark-matmult.cpp
M	examples/cvector-generator/pca.hpp
M	examples/export-lora/export-lora.cpp
M	examples/llava/clip.cpp
M	examples/llava/llava.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-kompute.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	c9c8575a1a8a170329afca4c4df4c005806efb1d	df4b7945aeccae2a71348e5a9c1eab5241e3e0ef	2024-09-12T17:44:17+08:00	Neo Zhang Jianyu	enhance run script to be easy to change the parameters (#9448)
M	examples/sycl/run-llama2.sh

commit	df4b7945aeccae2a71348e5a9c1eab5241e3e0ef	449ccfb6f5f1bbd70e04f75a330d9d7c1af82187	2024-09-12T09:02:35+08:00	Xinpeng Dou	cann: Fix error when running a non-exist op (#9424)
M	ggml/src/ggml-cann.cpp

commit	449ccfb6f5f1bbd70e04f75a330d9d7c1af82187	1b28061400eb9832603c9f1dfbec4d339a8490a2	2024-09-11T20:29:53-04:00	Faisal Zaghloul	Add Jais to list of supported models (#9439)
M	README.md

commit	1b28061400eb9832603c9f1dfbec4d339a8490a2	8db003a19d7055b5bd248ce2afff9324e5b8da95	2024-09-11T17:52:13+02:00	slaren	llama : skip token bounds check when evaluating embeddings (#9437)
M	src/llama.cpp

commit	8db003a19d7055b5bd248ce2afff9324e5b8da95	0996c5597f680effacc046832bb807c14900e22d	2024-09-11T15:29:51+03:00	Pavel Zloi	py : support converting local models (#7547)
M	convert_hf_to_gguf_update.py

commit	0996c5597f680effacc046832bb807c14900e22d	5bb2c5dbd26b246d334f0087b3cbd800f2e65c54	2024-09-11T12:59:13+02:00	Xuan Son Nguyen	llava : correct args for minicpmv-cli (#9429)
M	examples/llava/minicpmv-cli.cpp

commit	5bb2c5dbd26b246d334f0087b3cbd800f2e65c54	67155ab7f5e47c01b62aa989eab30f517bf6dc67	2024-09-11T12:02:09+02:00	Xuan Son Nguyen	files : remove accidentally added `lora_test` submodule (#9430)
D	lora-tests

commit	67155ab7f5e47c01b62aa989eab30f517bf6dc67	5af118efdaf1098798a06b24fd8a557760e99631	2024-09-11T12:52:37+03:30	Farbod Bijary	feat: Implements retrying logic for downloading models using --model-url flag (#9255)
M	common/common.cpp
A	lora-tests

commit	5af118efdaf1098798a06b24fd8a557760e99631	d2b496bff4f353a6429f8e833448f071bd237ba7	2024-09-11T10:22:40+02:00	Johannes Gäßler	CUDA: fix --split-mode row race condition (#9413)
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh

commit	d2b496bff4f353a6429f8e833448f071bd237ba7	b34e02348064c2f0cef1f89b44d9bee4eb15b9e7	2024-09-11T10:03:54+03:00	Georgi Gerganov	batched-bench : remove unused code (#9305)
M	examples/batched-bench/batched-bench.cpp

commit	b34e02348064c2f0cef1f89b44d9bee4eb15b9e7	51b603863627c4074e77b7e556e18ece86bdf9a3	2024-09-11T09:46:55+08:00	R0CKSTAR	musa: remove Clang builtins mapping (#9421)
M	ggml/src/ggml-cuda/vendors/musa.h

commit	51b603863627c4074e77b7e556e18ece86bdf9a3	cb9c933eb2a0d2b514556bdcb934b56dfe5d6771	2024-09-11T01:53:42+01:00	Alberto Cabrera Pérez	sycl : update support conditions  (#9394)
M	ggml/src/ggml-sycl.cpp

commit	cb9c933eb2a0d2b514556bdcb934b56dfe5d6771	6cd4e034442f71718563e600070c2b6fc389e100	2024-09-11T01:46:59+03:00	Georgi Gerganov	flake.lock: Update (#9360)
M	flake.lock

commit	6cd4e034442f71718563e600070c2b6fc389e100	8d300bd35fbe23b35a4e1ece0cf0fe8f43331029	2024-09-10T22:41:29+02:00	Xuan Son Nguyen	arg : bring back missing ifdef (#9411)
M	common/arg.cpp
M	common/common.cpp

commit	8d300bd35fbe23b35a4e1ece0cf0fe8f43331029	49006c67b4c6cc2e7c75a875b4d6e161ebae287c	2024-09-10T22:40:59+02:00	matteo	enable --special arg for llama-server (#9419)
M	common/arg.cpp

commit	49006c67b4c6cc2e7c75a875b4d6e161ebae287c	00ba2ff78100e187ae17987bacd1c916211718b2	2024-09-10T18:04:25+02:00	slaren	llama : move random seed generation to the samplers (#9398)
M	common/arg.cpp
M	common/sampling.cpp
M	common/sampling.h
M	examples/embedding/embedding.cpp
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	include/llama.h
M	src/llama-sampling.cpp

commit	00ba2ff78100e187ae17987bacd1c916211718b2	83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1	2024-09-10T10:17:03+03:00	Georgi Gerganov	metal : fix compile warning with GGML_METAL_NDEBUG (#0)
M	ggml/src/ggml-metal.m

commit	83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1	0b4ac75772b744bb0a0d674927587621d1057884	2024-09-10T09:03:21+02:00	Daniel Bevenius	llama : update llm_build_copy_mask_state comment [no ci] (#9385)
M	src/llama.cpp

commit	0b4ac75772b744bb0a0d674927587621d1057884	fb3f2498156b3140e2050ec9c7bf61372f63ff56	2024-09-10T15:02:30+08:00	Molly Sophia	RWKV v6: Add time_mix_decay_w1/w2 in quant exclusion list (#9387)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	fb3f2498156b3140e2050ec9c7bf61372f63ff56	bfe76d4a17228bfd1565761f203123bc4914771b	2024-09-10T08:23:33+02:00	slaren	make : do not run llama-gen-docs when building (#9399)
M	Makefile

commit	bfe76d4a17228bfd1565761f203123bc4914771b	293bebe0773c907c0c866213856eeba41b035df1	2024-09-09T23:36:09+02:00	Xuan Son Nguyen	common : move arg parser code to `arg.cpp` (#9388)
M	Makefile
M	common/CMakeLists.txt
A	common/arg.cpp
A	common/arg.h
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/cvector-generator/pca.hpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/export-lora/export-lora.cpp
M	examples/gen-docs/gen-docs.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	tests/test-arg-parser.cpp

commit	293bebe0773c907c0c866213856eeba41b035df1	5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2	2024-09-09T18:40:10+03:00	Radoslav Gerganov	rpc : fix segfault with nkvo (#9389)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml.c

commit	5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2	5fb5e24811cb01d48b482c15a974bfbd9f433e1d	2024-09-09T21:07:18+05:30	Prashant Vithule	ggml : vector length agnostic SVE support (#9290)
M	ggml/src/ggml-quants.c

commit	5fb5e24811cb01d48b482c15a974bfbd9f433e1d	38ca6f644bd48301e9caa80f9913c22e70a8fd1b	2024-09-09T17:10:46+02:00	slaren	llama : minor sampling refactor (2) (#9386)
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/gritlm/gritlm.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/passkey/passkey.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	include/llama.h
M	src/llama-sampling.cpp
M	tests/test-sampling.cpp

commit	38ca6f644bd48301e9caa80f9913c22e70a8fd1b	8e6e2fbe1458ac91387266241262294a964d6b95	2024-09-09T15:51:37+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	8e6e2fbe1458ac91387266241262294a964d6b95	5ed087573e1f326cfa70e29c1895d074a7a1a00c	2024-09-09T14:22:53+02:00	Johannes Gäßler	CUDA: fix variable name conflict for Windows build (#9382)
M	ggml/src/ggml-cuda/sum.cu

commit	5ed087573e1f326cfa70e29c1895d074a7a1a00c	54f376d0b92c6ff6feb1fa2ef8ed2022348100ba	2024-09-09T14:21:38+03:00	Antonis Makropoulos	readme : add LLMUnity to UI projects (#9381)
M	README.md
M	examples/rpc/README.md

commit	54f376d0b92c6ff6feb1fa2ef8ed2022348100ba	b2e89a327457179a34eae4d7de0d412ed945679c	2024-09-09T11:04:39+03:00	Radoslav Gerganov	rpc : update README [no ci] (#9320)
M	examples/rpc/README.md

commit	b2e89a327457179a34eae4d7de0d412ed945679c	daa9623ab051a8162ae750b150b9522571b55f21	2024-09-09T09:02:45+02:00	Dan Johansson	Arm AArch64: Documentation updates (#9321)
M	docs/build.md
M	examples/quantize/README.md

commit	daa9623ab051a8162ae750b150b9522571b55f21	e079bffb6678e1b5ded21c719600bedd7175e726	2024-09-08T21:43:48+02:00	Markus Tavenrath	Overlap cmdbuffer creation and cmdbuffer execution in Vulkan backend by submitting smaller cmdbuffers early. (#9118)
M	ggml/src/ggml-vulkan.cpp

commit	e079bffb6678e1b5ded21c719600bedd7175e726	3f7ccfd649abc83d059b5462221ac14de4ede6b7	2024-09-08T22:01:02+03:00	Georgi Gerganov	cuda : fix FA Q src index (1 -> 0) (#9374)
M	ggml/src/ggml-cuda/fattn.cu

commit	3f7ccfd649abc83d059b5462221ac14de4ede6b7	a249843d89bd6373772eede26d7f2aa708b26600	2024-09-08T18:08:55+02:00	Xuan Son Nguyen	common : bring back missing args, add env var duplication check (#9375)
M	common/common.cpp
M	common/common.h
M	examples/infill/infill.cpp
M	tests/test-arg-parser.cpp

commit	a249843d89bd6373772eede26d7f2aa708b26600	19f4a7b296efda7c13a6b21d428b2286b5d1aa06	2024-09-08T16:44:42+02:00	slaren	common : restore --n-gpu-layers (#9371)
M	common/common.cpp

commit	19f4a7b296efda7c13a6b21d428b2286b5d1aa06	2a358fb0c4b6e917ac852aa17444cc94dd28a2a6	2024-09-08T15:52:07+02:00	slaren	llama : refactor samplers internal implementation (#9370)
M	src/llama-impl.h
M	src/llama-sampling.cpp
M	src/llama-sampling.h
M	tests/test-sampling.cpp

commit	2a358fb0c4b6e917ac852aa17444cc94dd28a2a6	eae597182cb61bbde0b26e7cec5999d28b9327fe	2024-09-08T19:05:29+08:00	Neo Zhang Jianyu	[SYCL] add check malloc result on device (#9346)
M	ggml/src/ggml-sycl.cpp

commit	eae597182cb61bbde0b26e7cec5999d28b9327fe	00b02bb249406ec0123757a67a5b714c3f33a699	2024-09-08T12:41:51+02:00	slaren	llama : sanitize tokens in the upper bound (#9359)
M	src/llama.cpp

commit	00b02bb249406ec0123757a67a5b714c3f33a699	a8768614558262b6762fc0feeddcc6f7ce4bc5fc	2024-09-08T12:12:17+02:00	Xuan Son Nguyen	imatrix : fix arg parser for imatrix (#9366)
M	common/common.cpp
M	examples/imatrix/imatrix.cpp

commit	a8768614558262b6762fc0feeddcc6f7ce4bc5fc	385decbd632f70db9f1fbd93dbb2b908853e135c	2024-09-08T09:57:57+03:00	Georgi Gerganov	metal : update support condition for im2col + fix warning (#0)
M	ggml/src/ggml-metal.m
M	tests/test-backend-ops.cpp

commit	385decbd632f70db9f1fbd93dbb2b908853e135c	60a3107ccd791d858e12a87e6024ce918d3bf595	2024-09-08T09:38:56+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	60a3107ccd791d858e12a87e6024ce918d3bf595	406c1a32a18807b9b5711aa2fa1859527106bc1d	2024-09-08T09:38:42+03:00	Georgi Gerganov	scripts : option to increase git patch context
M	scripts/sync-ggml-am.sh

commit	406c1a32a18807b9b5711aa2fa1859527106bc1d	9cb9260861e464e40d38764cfb021856786c7202	2024-09-06T14:34:25+02:00	Salvatore Mesoraca	vulkan: add dryrun support to sin and cos ops (ggml/947)
M	ggml/src/ggml-vulkan.cpp

commit	9cb9260861e464e40d38764cfb021856786c7202	202084d31d4247764fc6d6d40d2e2bda0c89a73a	2024-09-06T14:34:07+02:00	Salvatore Mesoraca	vulkan: correctly report support for OP_CONT (ggml/946)
M	ggml/src/ggml-vulkan.cpp

commit	202084d31d4247764fc6d6d40d2e2bda0c89a73a	dbbebcab339c7d63d3806e8f32574bb9aad9a694	2024-09-03T17:21:46+02:00	Johannes Gäßler	tests: add gradient tests for all backends (ggml/932)
M	ggml/include/ggml.h
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/cross-entropy-loss.cu
A	ggml/src/ggml-cuda/sum.cu
A	ggml/src/ggml-cuda/sum.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	dbbebcab339c7d63d3806e8f32574bb9aad9a694	ba1cf846edeb94fc567a9ab0f7ef705282e6d7d3	2024-08-31T14:35:42+02:00	Johannes Gäßler	ggml: fix ggml_graph_cpy undefined behavior (ggml/943)
M	ggml/include/ggml.h
M	ggml/src/ggml.c

commit	ba1cf846edeb94fc567a9ab0f7ef705282e6d7d3	d2d3200b385970cb2a4658fd9342a3b1212bdb46	2024-08-28T18:45:01+03:00	Georgi Gerganov	cann : fix doxy (ggml/0)
M	ggml/src/ggml-cann/Doxyfile

commit	d2d3200b385970cb2a4658fd9342a3b1212bdb46	51d964a4efdb0e8d43f5b85a775951185f6b641e	2024-08-09T20:21:56+08:00	Mengqing Cao	cann : add Ascend NPU support (whisper/2336)
M	ggml/src/ggml-cann/Doxyfile

commit	51d964a4efdb0e8d43f5b85a775951185f6b641e	efe6a83e3046a94cda38c8be5a7801eadc21d78d	2024-08-28T17:08:03+03:00	Georgi Gerganov	cuda : mark BF16 CONT as unsupported
M	ggml/src/ggml-cuda.cu

commit	efe6a83e3046a94cda38c8be5a7801eadc21d78d	fbb7fcffbcfc50009c275e75982b1603a6cb6b80	2024-08-28T10:23:02+02:00	Salvatore Mesoraca	ggml : fix cont with transposed tensors when one dimension is 1 (ggml/934)
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	fbb7fcffbcfc50009c275e75982b1603a6cb6b80	a5b5d9a1014248f385939e6739e9db9de7147e55	2024-09-07T22:51:00-07:00	Kevin Gibbons	llama : set attrs of mislabelled EOT/EOM tokens (#9348)
M	src/llama.cpp

commit	a5b5d9a1014248f385939e6739e9db9de7147e55	f12295b8a9336962bf02a359beb1be0d322b4be7	2024-09-08T00:33:50+03:00	Georgi Gerganov	llama.android : fix build (#9350)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.android/llama/src/main/java/android/llama/cpp/LLamaAndroid.kt

commit	f12295b8a9336962bf02a359beb1be0d322b4be7	faf69d4237c9ae4d7f572b4674d1002463e8acd3	2024-09-08T00:33:33+03:00	Georgi Gerganov	llama : fix empty ring buffer push (#9358)
M	common/sampling.cpp
M	src/llama-sampling.cpp

commit	faf69d4237c9ae4d7f572b4674d1002463e8acd3	e536426ded3fb4a8cd13626e53508cd92928d6c2	2024-09-08T00:33:13+03:00	Georgi Gerganov	llama : sanitize invalid tokens (#9357)
M	common/common.cpp
M	examples/server/tests/features/embeddings.feature
M	src/llama.cpp

commit	e536426ded3fb4a8cd13626e53508cd92928d6c2	1b9ae5189cd279c6b45e36d43e4f9ccae628d02f	2024-09-07T19:02:26Z	Eve	llamafile : disable sgemm for batch-size 1 (#9330)
M	ggml/src/llamafile/sgemm.cpp

commit	1b9ae5189cd279c6b45e36d43e4f9ccae628d02f	e32d0816edfd247784f6780b0bb9ae0bceef5e47	2024-09-07T20:43:51+02:00	Xuan Son Nguyen	common : refactor arg parser (#9308)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/export-lora/export-lora.cpp
A	examples/gen-docs/CMakeLists.txt
A	examples/gen-docs/gen-docs.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	tests/CMakeLists.txt
A	tests/test-arg-parser.cpp

commit	e32d0816edfd247784f6780b0bb9ae0bceef5e47	df270ef74596da8f1178f08991f4c51f18c9ee82	2024-09-07T20:23:07+02:00	slaren	ggml : always check bounds on get_rows operations (#9354)
M	ggml/src/ggml.c

commit	df270ef74596da8f1178f08991f4c51f18c9ee82	947538acb8617756a092042ff7e58db18dde05ec	2024-09-07T15:16:19+03:00	Georgi Gerganov	llama : refactor sampling v2 (#9294)
M	Makefile
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
D	common/grammar-parser.cpp
D	common/grammar-parser.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/gbnf-validator/gbnf-validator.cpp
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	include/llama.h
M	src/llama-grammar.cpp
M	src/llama-grammar.h
M	src/llama-impl.h
M	src/llama-sampling.cpp
M	src/llama-sampling.h
M	src/llama-vocab.h
M	src/llama.cpp
M	tests/test-grammar-integration.cpp
M	tests/test-grammar-parser.cpp
M	tests/test-json-schema-to-grammar.cpp
M	tests/test-llama-grammar.cpp
M	tests/test-sampling.cpp

commit	947538acb8617756a092042ff7e58db18dde05ec	6c89eb0b4749184f4d19e96ada5dcb8847129b9c	2024-09-07T12:01:34+02:00	Xuan Son Nguyen	ggml : fix missing `cpu_set_t` on emscripten (#9336)
M	ggml/src/ggml.c

commit	6c89eb0b4749184f4d19e96ada5dcb8847129b9c	9b2c24c0993487d3b34a873980e292da571481f3	2024-09-07T09:48:54+02:00	slaren	ci : disable rocm image creation (#9340)
M	.github/workflows/docker.yml

commit	9b2c24c0993487d3b34a873980e292da571481f3	134bc38ecf3e2c5460581badce289a1ffa680453	2024-09-06T23:21:29+02:00	Xuan Son Nguyen	server : simplify state machine for slot (#9283)
M	examples/server/server.cpp
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/passkey.feature
M	examples/server/tests/features/steps/steps.py

commit	134bc38ecf3e2c5460581badce289a1ffa680453	815b1fb20a53e439882171757825bacb1350de04	2024-09-07T00:03:01+03:00	Aarni Koskela	llama-bench : log benchmark progress (#9287)
M	examples/llama-bench/llama-bench.cpp

commit	815b1fb20a53e439882171757825bacb1350de04	409dc4f8bb5185786087f52259ee4626be93f54d	2024-09-06T18:59:58+03:00	Aarni Koskela	batched-bench : add `--output-format jsonl` option (#9293)
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/README.md
M	examples/batched-bench/batched-bench.cpp

commit	409dc4f8bb5185786087f52259ee4626be93f54d	4a1411b4f17b6569dc0a067e5914dcc0f738b370	2024-09-06T21:54:50+09:00	Changyeon Kim	ggml : fix build break for the vulkan-debug (#9265)
M	ggml/src/ggml-vulkan.cpp

commit	4a1411b4f17b6569dc0a067e5914dcc0f738b370	8ebe8ddebd68526757c631cd019de009697c63c2	2024-09-06T14:06:04+02:00	Xuan Son Nguyen	server : fix missing lock (#9334)
M	examples/server/server.cpp

commit	8ebe8ddebd68526757c631cd019de009697c63c2	9bc6db28d011d47a5f318dc4aebbe7927fac4629	2024-09-06T08:56:17+02:00	Markus Tavenrath	Improve Vulkan shader build system (#9239)
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	9bc6db28d011d47a5f318dc4aebbe7927fac4629	32b2ec88bc44b086f3807c739daf28a1613abde1	2024-09-05T21:48:47-04:00	compilade	ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
M	convert_hf_to_gguf.py
M	examples/quantize/quantize.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-common.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/quants.py
M	gguf-py/tests/test_quants.py
M	include/llama.h
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-quantize-fns.cpp

commit	32b2ec88bc44b086f3807c739daf28a1613abde1	1031771faaba28d07b4ec6a812cb21532efc8c31	2024-09-06T06:34:36+08:00	awatuna	Update build.yml (#9184)
M	.github/workflows/build.yml

commit	1031771faaba28d07b4ec6a812cb21532efc8c31	4db04784f96757d74f74c8c110c2a00d55e33514	2024-09-06T00:14:12+02:00	Michael Podvitskiy	CMake fix: host for msvc compiler can only be x86 or x64 (#8624)
M	CMakePresets.json

commit	4db04784f96757d74f74c8c110c2a00d55e33514	bdf314f38a2c90e18285f7d7067e8d736a14000a	2024-09-05T11:13:11+02:00	slaren	cuda : fix defrag with quantized KV (#9319)
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/cpy.cu

commit	bdf314f38a2c90e18285f7d7067e8d736a14000a	581c305186a0ff93f360346c57e21fe16e967bb7	2024-09-05T02:19:39+02:00	slaren	llama-bench : fix NUL terminators in CPU name (#9313)
M	examples/llama-bench/llama-bench.cpp

commit	581c305186a0ff93f360346c57e21fe16e967bb7	5910ea942772ab6cbc21d0ad2d1208750ba39e1d	2024-09-04T22:21:22+05:30	Srihari-mcw	ggml : AVX2 support for Q4_0_8_8 (#8713)
M	ggml/src/ggml-aarch64.c

commit	5910ea942772ab6cbc21d0ad2d1208750ba39e1d	c8671ae28214b29920b86c66a5d36fd6dd0db870	2024-09-04T16:26:33+01:00	Ouadie EL FAROUKI	[SYCL] Fix DMMV dequantization (#9279)
M	ggml/src/ggml-sycl/dmmv.cpp

commit	c8671ae28214b29920b86c66a5d36fd6dd0db870	82e3b03c11826d20a24ab66d60f4de58f48ddcdb	2024-09-04T19:45:28+08:00	杨朱 · Kiki	Fix broken links in docker.md (#9306)
M	docs/docker.md

commit	82e3b03c11826d20a24ab66d60f4de58f48ddcdb	9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee	2024-09-04T11:08:32+03:00	Radoslav Gerganov	rpc : make RPC servers come first in the device list (#9296)
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	src/llama.cpp

commit	9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee	7605ae7daf31c02211bcfec2f46635ef6ec4b98a	2024-09-04T02:45:40-04:00	Pascal Patry	readme : rename result_format to response_format (#9300)
M	grammars/README.md

commit	7605ae7daf31c02211bcfec2f46635ef6ec4b98a	8962422b1c6f9b8b15f5aeaea42600bcc2d44177	2024-09-04T02:36:43+03:00	Georgi Gerganov	flake.lock: Update (#9261)
M	flake.lock

commit	8962422b1c6f9b8b15f5aeaea42600bcc2d44177	b69a480af4db8ffd6cbb2efe7ed8132bc7d39073	2024-09-03T20:58:54+03:00	Aarni Koskela	llama-bench : add JSONL (NDJSON) output mode (#9288)
M	examples/llama-bench/README.md
M	examples/llama-bench/llama-bench.cpp

commit	b69a480af4db8ffd6cbb2efe7ed8132bc7d39073	48baa61eccdca9205daf8d620ba28055c2347b64	2024-09-03T10:00:36+03:00	Georgi Gerganov	readme : refactor API section + remove old hot topics
M	README.md

commit	48baa61eccdca9205daf8d620ba28055c2347b64	f1485161e58d562099dd050f8ac3a9ea9f4cd765	2024-09-02T22:08:38+02:00	Xuan Son Nguyen	server : test script : add timeout for all requests (#9282)
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/steps/steps.py

commit	f1485161e58d562099dd050f8ac3a9ea9f4cd765	048de848ee4baad4531fcd6239438f5d55be365c	2024-09-03T01:53:23+08:00	Zhenwei Jin	src: make tail invalid when kv cell is intersection for mamba (#9249)
M	src/llama.cpp

commit	048de848ee4baad4531fcd6239438f5d55be365c	f771d064a95d212ddadea452ad0cc1e42b2c3db3	2024-09-02T18:11:13+02:00	slaren	docker : fix missing binaries in full-cuda image (#9278)
M	.devops/full-cuda.Dockerfile

commit	f771d064a95d212ddadea452ad0cc1e42b2c3db3	6e7d133a5f9409dd257fad90d7f320721b07a1b2	2024-09-02T08:25:30-07:00	yuri@FreeBSD	ggml : add pthread includes on FreeBSD (#9258)
M	ggml/src/ggml.c

commit	6e7d133a5f9409dd257fad90d7f320721b07a1b2	b60074f1c26d8354053a952844ef3f7ebefd8803	2024-09-02T17:11:51+02:00	Xuan Son Nguyen	server : refactor multitask handling (#9274)
M	examples/server/server.cpp
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/features/wrong_usages.feature
M	examples/server/utils.hpp

commit	b60074f1c26d8354053a952844ef3f7ebefd8803	9c1ba557335c3cab46807e6478eb7d17a63361f1	2024-09-02T20:36:43+08:00	Guoliang Hua	llama-cli : remove duplicated log message (#9275)
M	examples/main/main.cpp

commit	9c1ba557335c3cab46807e6478eb7d17a63361f1	c6d4cb46559b359d2682cf2a002e7fe01bb7a767	2024-09-02T16:51:01+05:30	Tushar	build(nix): Package gguf-py (#5664)
M	.devops/nix/devshells.nix
M	.devops/nix/nixpkgs-instances.nix
A	.devops/nix/package-gguf-py.nix
M	.devops/nix/package.nix
A	.devops/nix/python-scripts.nix
M	.devops/nix/scope.nix
M	flake.nix
M	gguf-py/pyproject.toml
M	pyproject.toml

commit	c6d4cb46559b359d2682cf2a002e7fe01bb7a767	8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c	2024-09-02T11:52:04+03:00	Georgi Gerganov	llama : minor style
M	src/llama.cpp

commit	8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c	a47667cff41f5a198eb791974e0afcc1cddd3229	2024-09-01T22:38:17+08:00	Molly Sophia	llama : support RWKV v6 models (#8980)
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	a47667cff41f5a198eb791974e0afcc1cddd3229	ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e3	2024-08-22T17:19:14-04:00	Echo Nolan	nix: fix CUDA build - replace deprecated autoAddOpenGLRunpathHook
M	.devops/nix/package.nix

commit	ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e3	49271efbaf3f7a4ae52c4ca299b6d4e82598a97d	2024-08-31T13:50:35+05:30	Srihari-mcw	sgemm : improved Q4_0 and Q8_0 performance via 4xN and Mx4 gemm (#8908)
M	ggml/src/llamafile/sgemm.cpp

commit	49271efbaf3f7a4ae52c4ca299b6d4e82598a97d	0ab30f8d82fc7156b750c194d64a887e80cbfb82	2024-08-31T09:50:22+02:00	Daniel Bevenius	llama : fix typo in xcda_array_view comment [no ci] (#9132)
M	src/llama-vocab.cpp

commit	0ab30f8d82fc7156b750c194d64a887e80cbfb82	cddae4884c853b1a7ab420458236d666e2e34423	2024-08-31T03:08:10+09:00	Sutou Kouhei	llama : fix llama_split_mode enum values in main_gpu document (#9057)
M	include/llama.h

commit	cddae4884c853b1a7ab420458236d666e2e34423	7ea8d80d53364f2cdcd7bbc0f031106f529b1fe3	2024-08-30T20:10:01+08:00	蕭澧邦	Correct typo run_llama2.sh > run-llama2.sh (#9149)
M	docs/backend/SYCL.md

commit	7ea8d80d53364f2cdcd7bbc0f031106f529b1fe3	42c76d1358021ccdbe8ba89109c143dd7ae166df	2024-08-30T13:21:57+08:00	tc-mb	llava : the function "clip" should be int (#9237)
M	examples/llava/clip.cpp

commit	42c76d1358021ccdbe8ba89109c143dd7ae166df	9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b	2024-08-29T19:20:53-04:00	Faisal Zaghloul	Threadpool: take 2 (#8672)
M	common/common.cpp
M	common/common.h
M	examples/baby-llama/baby-llama.cpp
M	examples/benchmark/benchmark-matmult.cpp
M	examples/cvector-generator/cvector-generator.cpp
M	examples/export-lora/export-lora.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/llava-cli.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/main/main.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp
M	ggml/include/ggml-alloc.h
M	ggml/include/ggml-backend.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend.c
M	ggml/src/ggml.c
M	include/llama.h
M	src/llama.cpp
M	tests/test-rope.cpp

commit	9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b	1d1ccce67613674c75c9c7e3fa4c1e24e428ba48	2024-08-27T18:28:06+08:00	Jan Boon	server : fix crash when error handler dumps invalid utf-8 json (#9195)
M	examples/server/server.cpp

commit	1d1ccce67613674c75c9c7e3fa4c1e24e428ba48	9fe94ccac92693d4ae1bc283ff0574e8b3f4e765	2024-08-29T07:28:14+03:00	Georgi Gerganov	flake.lock: Update (#9162)
M	flake.lock

commit	9fe94ccac92693d4ae1bc283ff0574e8b3f4e765	66b039a5011522b6a61495eea2a9862601e169f7	2024-08-28T17:28:00+02:00	slaren	docker : build images only once (#9225)
M	.github/workflows/docker.yml

commit	66b039a5011522b6a61495eea2a9862601e169f7	20f1789dfb4e535d64ba2f523c64929e7891f428	2024-08-28T13:20:36+02:00	slaren	docker : update CUDA images (#9213)
M	.devops/full-cuda.Dockerfile
M	.devops/llama-cli-cuda.Dockerfile
M	.devops/llama-server-cuda.Dockerfile
M	docs/docker.md

commit	20f1789dfb4e535d64ba2f523c64929e7891f428	231cff5f6f1c050bcb448a8ac5857533b4c05dc7	2024-08-27T22:10:58+03:00	Georgi Gerganov	vulkan : fix build (#0)
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	231cff5f6f1c050bcb448a8ac5857533b4c05dc7	3246fe84d78c8ccccd4291132809236ef477e9ea	2024-08-27T22:01:45+03:00	Georgi Gerganov	sync : ggml
M	ggml/include/ggml-backend.h
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/binbcast.cuh
A	ggml/src/ggml-cuda/cross-entropy-loss.cu
A	ggml/src/ggml-cuda/cross-entropy-loss.cuh
M	ggml/src/ggml-cuda/sumrows.cu
M	ggml/src/ggml-cuda/sumrows.cuh
M	ggml/src/ggml-cuda/unary.cu
M	ggml/src/ggml-cuda/unary.cuh
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
A	ggml/src/vulkan-shaders/cos.comp
A	ggml/src/vulkan-shaders/sin.comp
M	scripts/sync-ggml.last
M	tests/test-backend-ops.cpp
M	tests/test-grad0.cpp

commit	3246fe84d78c8ccccd4291132809236ef477e9ea	78eb487bb0038eae95506d3d832b94c979185b09	2024-08-27T20:33:08+08:00	Xie Yanbo	Fix minicpm example directory (#9111)
M	examples/llava/README-minicpmv2.5.md

commit	78eb487bb0038eae95506d3d832b94c979185b09	a77feb5d71831c61e455541e8a655b9f0337ea8c	2024-08-27T06:09:23-04:00	compilade	llama : fix qs.n_attention_wv for DeepSeek-V2 (#9156)
M	src/llama.cpp

commit	a77feb5d71831c61e455541e8a655b9f0337ea8c	2e59d61c1b321431c597c1f12249273427d5640d	2024-08-27T11:07:01+02:00	Xuan Son Nguyen	server : add some missing env variables (#9116)
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-intel.Dockerfile
M	.devops/llama-server-rocm.Dockerfile
M	.devops/llama-server-vulkan.Dockerfile
M	.devops/llama-server.Dockerfile
M	common/common.cpp
M	examples/server/README.md

commit	2e59d61c1b321431c597c1f12249273427d5640d	75e1dbbaaba5d762223370f3dab9db24a7f53465	2024-08-27T14:58:22+08:00	CausalLM	llama : fix ChatGLM4 wrong shape (#9194)
M	src/llama.cpp

commit	75e1dbbaaba5d762223370f3dab9db24a7f53465	ad76569f8e78ab6ca921bda25cef25a157361719	2024-08-27T08:53:40+02:00	Carsten Kragelund Jørgensen	llama : fix llama3.1 rope_freqs not respecting custom head_dim (#9141)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	ad76569f8e78ab6ca921bda25cef25a157361719	7d787ed96c32be18603c158ab0276992cf0dc346	2024-08-26T22:58:50-07:00	arch-btw	common : Update stb_image.h to latest version (#9161)
M	.ecrc
M	common/stb_image.h

commit	7d787ed96c32be18603c158ab0276992cf0dc346	06658ad7c37f440502de2b9486ce43c47b4ec710	2024-08-26T19:44:43+02:00	slaren	ggml : do not crash when quantizing q4_x_x with an imatrix (#9192)
M	ggml/src/ggml-aarch64.c

commit	06658ad7c37f440502de2b9486ce43c47b4ec710	fc18425b6a8ad03847383ce2b69d52edfd49b0ff	2024-08-26T18:31:02+03:00	Georgi Gerganov	metal : separate scale and mask from QKT in FA kernel (#9189)
M	ggml/src/ggml-metal.metal

commit	fc18425b6a8ad03847383ce2b69d52edfd49b0ff	879275ac984235373dd44ed780d5e3a3883cb558	2024-08-26T17:55:36+03:00	Georgi Gerganov	ggml : add SSM Metal kernels (#8546)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	879275ac984235373dd44ed780d5e3a3883cb558	7a3df798fc43e1b366146b1ad99137a9e95c87dd	2024-08-26T16:30:25+03:00	Georgi Gerganov	tests : fix compile warnings for unreachable code (#9185)
M	tests/test-sampling.cpp

commit	7a3df798fc43e1b366146b1ad99137a9e95c87dd	e5edb210cd361689da41f032f1b36c45ff1bf9be	2024-08-26T12:19:39+03:00	Georgi Gerganov	ci : add VULKAN support to ggml-ci (#9055)
M	ci/run.sh

commit	e5edb210cd361689da41f032f1b36c45ff1bf9be	0c41e03ceba1aafaf469476a56347419d5785376	2024-08-26T12:16:57+03:00	Georgi Gerganov	server : update deps (#9183)
M	examples/server/public/index.js

commit	0c41e03ceba1aafaf469476a56347419d5785376	f12ceaca0c7b59def30b7a832a6904df7ed3f4f7	2024-08-26T11:08:59+02:00	slaren	metal : gemma2 flash attention support (#9159)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	f12ceaca0c7b59def30b7a832a6904df7ed3f4f7	436787f170329b3f549e6c2c46593d2af8482e7c	2024-08-26T11:03:30+02:00	slaren	ggml-ci : try to improve build time (#9160)
M	ci/run.sh

commit	436787f170329b3f549e6c2c46593d2af8482e7c	93bc3839f980ff14be86efe408b4cd7e89b26835	2024-08-25T23:09:53-07:00	Justine Tunney	llama : fix time complexity of string replacement (#9163)
M	common/common.cpp
M	examples/llava/clip.cpp
M	src/llama-impl.h

commit	93bc3839f980ff14be86efe408b4cd7e89b26835	f91fc5639be1e272194303ea26e1d4c226ec981b	2024-08-25T22:54:37Z	Herman Semenov	common: fixed not working find argument --n-gpu-layers-draft (#9175)
M	common/common.cpp

commit	f91fc5639be1e272194303ea26e1d4c226ec981b	e11bd856d538e44d24d8cad4b0381fba0984d162	2024-08-25T22:11:48+02:00	Johannes Gäßler	CUDA: fix Gemma 2 numerical issues for FA (#9166)
M	src/llama.cpp

commit	e11bd856d538e44d24d8cad4b0381fba0984d162	8f824ffe8ee1feadd14428f1dda1283fa3b933be	2024-08-24T21:34:59+02:00	Johannes Gäßler	CPU/CUDA: Gemma 2 FlashAttention support (#8542)
M	ggml/include/ggml.h
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn-vec-f16.cuh
M	ggml/src/ggml-cuda/fattn-vec-f32.cuh
M	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-metal.m
M	ggml/src/ggml.c
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	8f824ffe8ee1feadd14428f1dda1283fa3b933be	3ba780e2a8f0ffe13f571b27f0bbf2ca5a199efc	2024-08-24T07:22:45+01:00	João Dinis Ferreira	quantize : fix typo in usage help of `quantize.cpp` (#9145)
M	examples/quantize/quantize.cpp

commit	3ba780e2a8f0ffe13f571b27f0bbf2ca5a199efc	a07c32ea54850c989f0ef6989da5b955b77b7172	2024-08-23T12:58:53+02:00	Xuan Son Nguyen	lora : fix llama conversion script with ROPE_FREQS (#9117)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	tests/test-lora-conversion-inference.sh

commit	a07c32ea54850c989f0ef6989da5b955b77b7172	11b84eb4578864827afcf956db5b571003f18180	2024-08-23T15:27:17+08:00	piDack	llama : use F32 precision in GLM4 attention and no FA (#9130)
M	src/llama.cpp

commit	11b84eb4578864827afcf956db5b571003f18180	1731d4238f9e4f925a750810e7f5480827c66dcf	2024-08-22T19:39:47+05:30	Akarshan Biswas	[SYCL] Add a space to supress a cmake warning (#9133)
M	ggml/src/CMakeLists.txt

commit	1731d4238f9e4f925a750810e7f5480827c66dcf	a1631e53f6763e17da522ba219b030d8932900bd	2024-08-22T12:50:10+08:00	luoyu-intel	[SYCL] Add oneDNN primitive support (#9091)
M	CMakePresets.json
M	docs/backend/SYCL.md
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/common.hpp
A	ggml/src/ggml-sycl/gemm.hpp

commit	a1631e53f6763e17da522ba219b030d8932900bd	fc54ef0d1c138133a01933296d50a36a1ab64735	2024-08-21T17:58:11-04:00	compilade	llama : simplify Mamba with advanced batch splits (#8526)
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	include/llama.h
M	src/llama.cpp

commit	fc54ef0d1c138133a01933296d50a36a1ab64735	b40eb84895bf723c7b327a1e3bf6e0e2c41877f8	2024-08-21T11:04:34+02:00	Xuan Son Nguyen	server : support reading arguments from environment variables (#9105)
M	common/common.cpp
M	common/common.h
M	examples/server/README.md
M	examples/server/server.cpp

commit	b40eb84895bf723c7b327a1e3bf6e0e2c41877f8	f63f603c879c2232eaeded8c0aeba4244471d720	2024-08-21T12:06:36+04:00	Younes Belkada	llama : support for `falcon-mamba` architecture (#9074)
M	README.md
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama.cpp

commit	f63f603c879c2232eaeded8c0aeba4244471d720	8455340b874aa90d5f70104c99ed2778d9e31c36	2024-08-21T09:45:49+02:00	fairydreaming	llava : zero-initialize clip_ctx structure fields with aggregate initialization 908)
M	examples/llava/clip.cpp

commit	8455340b874aa90d5f70104c99ed2778d9e31c36	2f3c1466ff46a2413b0e363a5005c46538186ee6	2024-08-21T09:32:58+02:00	Daniel Bevenius	llama : std::move llm_bigram_bpe from work_queue (#9062)
M	src/llama-vocab.cpp

commit	2f3c1466ff46a2413b0e363a5005c46538186ee6	50addec9a532a6518146ab837a85504850627316	2024-08-21T04:00:00+09:00	Changyeon Kim	llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984)
M	examples/llava/clip.cpp
M	ggml/src/ggml-vulkan.cpp
A	ggml/src/vulkan-shaders/acc.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	50addec9a532a6518146ab837a85504850627316	4f8d19ff17faa601f456ee1db7d8b8a15fa3f90b	2024-08-20T23:50:17+08:00	Meng, Hengyu	[SYCL] fallback mmvq (#9088)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/common.hpp

commit	4f8d19ff17faa601f456ee1db7d8b8a15fa3f90b	90db8146d56d83a605f2c475eca39bcda29cf16d	2024-08-20T23:06:51+08:00	zhentaoyu	[SYCL] Fix SYCL `im2col` and `convert` Overflow with Large Dims (#9052)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/common.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/convert.hpp
M	ggml/src/ggml-sycl/dequantize.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
A	ggml/src/ggml-sycl/im2col.cpp
A	ggml/src/ggml-sycl/im2col.hpp
M	tests/test-backend-ops.cpp

commit	90db8146d56d83a605f2c475eca39bcda29cf16d	cfac111e2b3953cdb6b0126e67a2487687646971	2024-08-20T11:09:55+02:00	fairydreaming	tests : add missing comma in grammar integration tests (#9099)
M	tests/test-grammar-integration.cpp

commit	cfac111e2b3953cdb6b0126e67a2487687646971	1b6ff90ff8301d9fe2027be2bb9fea26177d775e	2024-08-19T16:46:38+08:00	wangshuai09	cann: add doc for cann backend (#8867)
A	.devops/llama-cli-cann.Dockerfile
M	README.md
A	docs/backend/CANN.md
M	docs/build.md

commit	1b6ff90ff8301d9fe2027be2bb9fea26177d775e	18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75	2024-08-19T10:11:45+03:00	Radoslav Gerganov	rpc : print error message when failed to connect endpoint (#9042)
M	ggml/src/ggml-rpc.cpp

commit	18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75	554b049068de24201d19dde2fa83e35389d4585d	2024-08-19T10:10:21+03:00	Radoslav Gerganov	rpc : prevent crashes on invalid input (#9040)
M	ggml/src/ggml-rpc.cpp

commit	554b049068de24201d19dde2fa83e35389d4585d	2339a0be1c8e31fcf4531427183b94f2ef019e56	2024-08-18T17:43:32+03:00	Georgi Gerganov	flake.lock: Update (#9068)
M	flake.lock

commit	2339a0be1c8e31fcf4531427183b94f2ef019e56	2fb9267887d24a431892ce4dccc75c7095b0d54d	2024-08-18T10:58:04+01:00	ltoniazzi	tests : add integration test for lora adapters (#8957)
M	.gitignore
A	tests/test-lora-conversion-inference.sh

commit	2fb9267887d24a431892ce4dccc75c7095b0d54d	8b3befc0e2ed8fb18b903735831496b8b0c80949	2024-08-17T06:34:21-07:00	Yoshi Suhara	Fix incorrect use of ctx_split for bias tensors (#9063)
M	src/llama.cpp

commit	8b3befc0e2ed8fb18b903735831496b8b0c80949	d565bb2fd5a2a58b9924a7a34e77a87c78c52137	2024-08-16T17:19:05+02:00	Xuan Son Nguyen	server : refactor middleware and /health endpoint (#9056)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/steps/steps.py

commit	d565bb2fd5a2a58b9924a7a34e77a87c78c52137	ee2984bdaf10c14d440ad873a049bcc09b786d9b	2024-08-16T21:34:41+08:00	tc-mb	llava : support MiniCPM-V-2.6 (#8967)
M	examples/llava/README-minicpmv2.5.md
A	examples/llava/README-minicpmv2.6.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/llava/minicpmv-cli.cpp
M	examples/llava/minicpmv-convert-image-encoder-to-gguf.py
M	examples/llava/minicpmv-surgery.py

commit	ee2984bdaf10c14d440ad873a049bcc09b786d9b	c8ddce85606d9fb6e30745b6e4fe103eecadc73f	2024-08-16T14:06:30+03:30	Farbod Bijary	py : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928)
M	convert_llama_ggml_to_gguf.py

commit	c8ddce85606d9fb6e30745b6e4fe103eecadc73f	23fd4535445e3e859ded2f02d6142b6e93b43890	2024-08-16T19:08:59+10:00	Aisuko	Fix inference example lacks required parameters (#9035)
M	examples/quantize/README.md

commit	23fd4535445e3e859ded2f02d6142b6e93b43890	c679e0cb5c378bfb63643c44a453345ba8b90126	2024-08-16T02:36:11-04:00	compilade	gguf-py : bump version from 0.9.1 to 0.10.0 (#9051)
M	gguf-py/pyproject.toml

commit	c679e0cb5c378bfb63643c44a453345ba8b90126	fb487bb5671b37267f35ff43fe8849ddccd925cd	2024-08-16T15:35:18+09:00	Minsoo Cheong	llama : add EXAONE model support (#9025)
M	README.md
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	fb487bb5671b37267f35ff43fe8849ddccd925cd	2a24c8caa6d10a7263ca317fa7cb64f0edc72aae	2024-08-16T14:23:12+08:00	Liu Jia	common : add support for cpu_get_num_physical_cores() on Windows (#8771)
M	common/common.cpp

commit	2a24c8caa6d10a7263ca317fa7cb64f0edc72aae	e3f6fd56b1ab3c426596217d786910d641ae6ce0	2024-08-15T19:23:33-07:00	Yoshi Suhara	Add Nemotron/Minitron GGUF Conversion & Inference Support (#8922)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	e3f6fd56b1ab3c426596217d786910d641ae6ce0	4b9afbbe9037f8a2d659097c0c7d9fce32c6494c	2024-08-16T04:22:55+02:00	Nico Bosshard	ggml : dynamic ggml_sched_max_splits based on graph_size (#9047)
M	ggml/src/ggml-backend.c

commit	4b9afbbe9037f8a2d659097c0c7d9fce32c6494c	37501d9c79ed5897db4b73ea7502211d25b3f763	2024-08-15T15:40:12+08:00	gtygo	retrieval : fix memory leak in retrieval query handling (#8955)
M	examples/retrieval/retrieval.cpp

commit	37501d9c79ed5897db4b73ea7502211d25b3f763	4af8420afba39de4968adf2695ce12fd42422a13	2024-08-15T15:28:05+08:00	Riceball LEE	server : fix duplicated n_predict key in the generation_settings (#8994)
M	examples/server/server.cpp

commit	4af8420afba39de4968adf2695ce12fd42422a13	6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c	2024-08-15T15:23:23+08:00	Zhenwei Jin	common : remove duplicate function llama_should_add_bos_token (#8778)
M	common/common.cpp
M	common/common.h
M	examples/cvector-generator/cvector-generator.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	examples/tokenize/tokenize.cpp
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c	d5492f0525fa533817a67e93a4bde9d71d81cf58	2024-08-15T10:17:12+03:00	Esko Toivonen	llama : add pre-tokenizer regexes for BLOOM and gpt3-finnish (#8850)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	d5492f0525fa533817a67e93a4bde9d71d81cf58	234b30676a97ce227b604c38beb9dcaca406dea9	2024-08-15T10:11:11+03:00	Georgi Gerganov	ci : disable bench workflow (#9010)
R098	.github/workflows/bench.yml	.github/workflows/bench.yml.disabled

commit	234b30676a97ce227b604c38beb9dcaca406dea9	5fd89a70ead34d1a17015ddecad05aaa2490ca46	2024-08-15T08:21:57+02:00	Jiří Podivín	server : init stop and error fields of the result struct (#9026)
M	examples/server/server.cpp

commit	5fd89a70ead34d1a17015ddecad05aaa2490ca46	98a532d474c73d3494a5353024cb6a4fbbabbb35	2024-08-14T18:32:53+02:00	0cc4m	Vulkan Optimizations and Fixes (#8959)
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/concat.comp
M	ggml/src/vulkan-shaders/mul_mat_vec.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_nc.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_p021.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_q2_k.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_q3_k.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_q4_k.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_q5_k.comp
M	ggml/src/vulkan-shaders/mul_mat_vec_q6_k.comp
M	ggml/src/vulkan-shaders/mul_mm.comp
A	ggml/src/vulkan-shaders/repeat.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	98a532d474c73d3494a5353024cb6a4fbbabbb35	43bdd3ce188cd247bda7c1bd1ad01fa64e566690	2024-08-14T02:51:02-04:00	compilade	server : fix segfault on long system prompt (#8987)
M	examples/server/server.cpp

commit	43bdd3ce188cd247bda7c1bd1ad01fa64e566690	06943a69f678fb32829ff06d9c18367b17d4b361	2024-08-14T09:14:49+03:00	Georgi Gerganov	cmake : remove unused option GGML_CURL (#9011)
M	ggml/CMakeLists.txt

commit	06943a69f678fb32829ff06d9c18367b17d4b361	828d6ff7d796f48b2c345f6be2805a3c531a089c	2024-08-13T21:13:15+02:00	Daniel Bevenius	ggml : move rope type enum to ggml.h (#8949)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	ggml/src/kompute-shaders/op_rope_f16.comp
M	ggml/src/kompute-shaders/op_rope_f32.comp
M	ggml/src/kompute-shaders/rope_common.comp
M	include/llama.h

commit	828d6ff7d796f48b2c345f6be2805a3c531a089c	fc4ca27b25464a11b3b86c9dbb5b6ed6065965c2	2024-08-13T11:41:14+02:00	Xuan Son Nguyen	export-lora : throw error if lora is quantized (#9002)
M	examples/export-lora/README.md
M	examples/export-lora/export-lora.cpp

commit	fc4ca27b25464a11b3b86c9dbb5b6ed6065965c2	1f67436c5ee6f4c99e71a8518bdfc214c27ce934	2024-08-12T13:28:23-03:00	Diogo Teles Sant'Anna	ci : fix github workflow vulnerable to script injection (#9008)
M	.github/workflows/bench.yml

commit	1f67436c5ee6f4c99e71a8518bdfc214c27ce934	0fd93cdef5e583aa980b3c0d693c0d207f0787a7	2024-08-12T19:17:03+03:00	Radoslav Gerganov	ci : enable RPC in all of the released builds (#9006)
M	.github/workflows/build.yml

commit	0fd93cdef5e583aa980b3c0d693c0d207f0787a7	84eb2f4fad28ceadd415a4e775320c983f4d9a7d	2024-08-12T17:13:59+02:00	Nico Bosshard	llama : model-based max number of graph nodes calculation (#8970)
M	src/llama.cpp

commit	84eb2f4fad28ceadd415a4e775320c983f4d9a7d	1262e7ed13ac197c944f15e1ddb083cb4f36cf65	2024-08-12T20:45:50+08:00	Frank Mai	docs: introduce gpustack and gguf-parser (#8873)
M	README.md

commit	1262e7ed13ac197c944f15e1ddb083cb4f36cf65	df5478fbea7e652cfad4ee7974ac3b624fd6c7f6	2024-08-12T13:36:41+01:00	DavidKorczynski	grammar-parser : fix possible null-deref (#9004)
M	common/grammar-parser.cpp

commit	df5478fbea7e652cfad4ee7974ac3b624fd6c7f6	2589292cde038ba876c041bcd7b3f0c81f3f11fe	2024-08-12T13:21:41+01:00	DavidKorczynski	ggml: fix div-by-zero (#9003)
M	ggml/src/ggml.c

commit	2589292cde038ba876c041bcd7b3f0c81f3f11fe	d3ae0ee8d75033921a076131d4d0fa1c6ec579a7	2024-08-12T17:46:03+08:00	Liu Jia	Fix a spelling mistake (#9001)
M	src/llama-sampling.cpp

commit	d3ae0ee8d75033921a076131d4d0fa1c6ec579a7	5ef07e25ac39e62297a67208c5bcced50835a2dd	2024-08-12T11:02:01+03:00	Georgi Gerganov	py : fix requirements check '==' -> '~=' (#8982)
M	.github/workflows/python-check-requirements.yml
M	examples/llava/requirements.txt

commit	5ef07e25ac39e62297a67208c5bcced50835a2dd	4134999e01f31256b15342b41c4de9e2477c4a6c	2024-08-12T10:21:50+03:00	Georgi Gerganov	server : handle models with missing EOS token (#8997)
M	examples/server/server.cpp

commit	4134999e01f31256b15342b41c4de9e2477c4a6c	8cd1bcfd3fc9f2b5cbafd7fb7581b3278acec25f	2024-08-11T14:45:41-04:00	compilade	gguf-py : Numpy dequantization for most types (#8939)
M	gguf-py/gguf/quants.py
A	gguf-py/tests/test_quants.py

commit	8cd1bcfd3fc9f2b5cbafd7fb7581b3278acec25f	a21c6fd45032a20180e026773582d21294c85619	2024-08-11T16:58:58+03:00	Georgi Gerganov	flake.lock: Update (#8979)
M	flake.lock

commit	a21c6fd45032a20180e026773582d21294c85619	33309f661a93c9c0ab65a79e5e7e30fa6162992e	2024-08-11T16:37:43+08:00	Neo Zhang	update guide (#8909)
M	docs/backend/SYCL.md

commit	33309f661a93c9c0ab65a79e5e7e30fa6162992e	7c5bfd57f83fd3630934cfa70892aa4022d3faf7	2024-08-11T10:35:26+02:00	fairydreaming	llama : check all graph nodes when searching for result_embd_pooled (#8956)
M	src/llama.cpp

commit	7c5bfd57f83fd3630934cfa70892aa4022d3faf7	6e02327e8b7837358e0406bf90a4632e18e27846	2024-08-11T10:09:09+02:00	Markus Tavenrath	Optimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943)
M	ggml/src/ggml-vulkan.cpp

commit	6e02327e8b7837358e0406bf90a4632e18e27846	7eb23840ed0f388e10c4bbc4d65802fdfb977b40	2024-08-10T15:42:10+02:00	slaren	metal : fix uninitialized abort_callback (#8968)
M	ggml/src/ggml-metal.m

commit	7eb23840ed0f388e10c4bbc4d65802fdfb977b40	7c3f55c10051c634546247387c5c359c9d499360	2024-08-10T13:04:40+02:00	Xuan Son Nguyen	llama : default n_swa for phi-3 (#8931)
M	src/llama.cpp

commit	7c3f55c10051c634546247387c5c359c9d499360	911b437f228e75aa3d235acec21bfddd23ecce2f	2024-08-10T11:43:26+02:00	fairydreaming	Add support for encoder-only T5 models (#8900)
M	common/common.cpp
M	convert_hf_to_gguf.py
M	examples/embedding/embedding.cpp
M	gguf-py/gguf/constants.py
M	include/llama.h
M	src/llama.cpp

commit	911b437f228e75aa3d235acec21bfddd23ecce2f	b72942fac998672a79a1ae3c03b340f7e629980b	2024-08-10T07:58:49+02:00	Matteo Mortari	gguf-py : fix double call to add_architecture() (#8952)
M	gguf-py/examples/writer.py

commit	b72942fac998672a79a1ae3c03b340f7e629980b	6afd1a99dc9792096d4567ab9fa1ad530c81c6cd	2024-08-09T23:03:21+03:00	Georgi Gerganov	Merge commit from fork
M	examples/rpc/README.md
M	examples/rpc/rpc-server.cpp
M	ggml/src/ggml-rpc.cpp
M	ggml/src/ggml.c

commit	6afd1a99dc9792096d4567ab9fa1ad530c81c6cd	272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a	2024-08-09T18:53:09+02:00	fairydreaming	llama : add support for lora adapters in T5 model (#8938)
M	src/llama.cpp

commit	272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a	45a55b91aa87958a75d691be64b070266d4fbb94	2024-08-09T18:24:30+03:00	Georgi Gerganov	make : fix llava obj file race (#8946)
M	Makefile

commit	45a55b91aa87958a75d691be64b070266d4fbb94	3071c0a5f218f107dabd13b73f6090af683ef5ec	2024-08-09T18:23:52+03:00	Georgi Gerganov	llama : better replace_all (cont) (#8926)
M	common/common.cpp
M	common/common.h
M	examples/export-lora/export-lora.cpp
M	examples/llava/clip.cpp
M	src/llama-impl.h
M	src/llama-vocab.cpp
M	src/llama.cpp

commit	3071c0a5f218f107dabd13b73f6090af683ef5ec	4305b57c80eff4f0df5f6acb60b292f03b8f0dd0	2024-08-09T18:33:53+08:00	tc-mb	llava : support MiniCPM-V-2.5 (#7599)
M	.gitignore
M	Makefile
M	examples/llava/CMakeLists.txt
A	examples/llava/README-minicpmv2.5.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/llava/llava.h
A	examples/llava/minicpmv-cli.cpp
A	examples/llava/minicpmv-convert-image-encoder-to-gguf.py
A	examples/llava/minicpmv-surgery.py
M	examples/llava/requirements.txt

commit	4305b57c80eff4f0df5f6acb60b292f03b8f0dd0	70c0ea35609a2ab87a358e25f4ffad1aad408992	2024-08-09T10:03:48+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	70c0ea35609a2ab87a358e25f4ffad1aad408992	5b2c04f4925e152c362b824f4b41eb2a081fa623	2024-07-16T03:21:09-04:00	Matt Stephenson	whisper : use vulkan as gpu backend when available (whisper/2302)
M	ggml/src/ggml-vulkan.cpp

commit	5b2c04f4925e152c362b824f4b41eb2a081fa623	6f6496bb0999d1bce5daff0cfc55ceb0dd13c888	2024-08-09T08:33:30+02:00	Daniel Bevenius	embedding : add --pooling option to README.md [no ci] (#8934)
M	examples/embedding/README.md

commit	6f6496bb0999d1bce5daff0cfc55ceb0dd13c888	daef3ab233fc02e4c53afd9b07366379876f00d1	2024-08-09T08:32:23+02:00	Daniel Bevenius	llama : fix typo in llama_tensor_get_type comment [no ci] (#8937)
M	src/llama.cpp

commit	daef3ab233fc02e4c53afd9b07366379876f00d1	345a686d8271a24db20d31789c0d4b9ed51dcb0c	2024-08-09T08:32:02+02:00	Mathieu Geli	server : add one level list nesting for embeddings (#8936)
M	examples/server/server.cpp

commit	345a686d8271a24db20d31789c0d4b9ed51dcb0c	3a14e00366399040a139c67dd5951177a8cb5695	2024-08-08T23:54:00-04:00	compilade	llama : reduce useless copies when saving session (#8916)
M	src/llama.cpp

commit	3a14e00366399040a139c67dd5951177a8cb5695	afd27f01fe832ece3d07ef03b7d34a9e80c4a895	2024-08-08T13:33:09-04:00	compilade	gguf-py : simplify support for quant types (#8838)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/lazy.py
M	gguf-py/gguf/quants.py

commit	afd27f01fe832ece3d07ef03b7d34a9e80c4a895	366d486c163ea883442313cff1a3b154ab93e168	2024-08-08T14:56:52+03:00	Georgi Gerganov	scripts : sync cann files (#0)
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	366d486c163ea883442313cff1a3b154ab93e168	e44a561ab090b11d3a6fe539b768404663e4c3d2	2024-08-08T14:40:12+03:00	Georgi Gerganov	scripts : fix sync filenames (#0)
M	scripts/sync-ggml-am.sh

commit	e44a561ab090b11d3a6fe539b768404663e4c3d2	f93d49ab1e2d1d698af8f17ead6d635405d4b289	2024-08-08T13:19:47+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f93d49ab1e2d1d698af8f17ead6d635405d4b289	5b33ea1ee72fadfa4f96d86dc614631739758cce	2024-08-07T10:00:56+03:00	Borislav Stanimirov	ggml : ignore more msvc warnings (ggml/906)
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml.c

commit	5b33ea1ee72fadfa4f96d86dc614631739758cce	85fca8deb6273b956bc9184bc9d70a07e1d50d07	2024-08-07T09:57:00+03:00	Georgi Gerganov	metal : fix struct name (ggml/912)
M	ggml/src/ggml-metal.m

commit	85fca8deb6273b956bc9184bc9d70a07e1d50d07	ebd541a5705b6f7a4ce67824d1c2d4fc790f1770	2024-08-07T02:55:49-04:00	Conrad Kramer	metal : add abort callback (ggml/905)
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-metal.m

commit	ebd541a5705b6f7a4ce67824d1c2d4fc790f1770	15fa07a5c564d3ed7e7eb64b73272cedb27e73ec	2024-08-08T04:44:51-04:00	Pablo Duboue	make : clean llamafile objects (#8923)
M	Makefile

commit	15fa07a5c564d3ed7e7eb64b73272cedb27e73ec	be55695eff44784a141a863f273661a6bce63dfc	2024-08-07T18:24:05+02:00	slaren	make : use C compiler to build metal embed object (#8899)
M	Makefile

commit	be55695eff44784a141a863f273661a6bce63dfc	0478174d5959b66096ae6609fcb0df14cab66b51	2024-08-07T13:29:02+02:00	slaren	ggml-backend : fix async copy from CPU (#8897)
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-cuda.cu

commit	0478174d5959b66096ae6609fcb0df14cab66b51	a8dbc6f753f296108121d50f78f67463403dd6fc	2024-08-07T11:25:36+01:00	Ouadie EL FAROUKI	[SYCL] Updated SYCL device filtering  (#8901)
M	examples/sycl/README.md
M	ggml/src/ggml-sycl/dpct/helper.hpp

commit	a8dbc6f753f296108121d50f78f67463403dd6fc	506122d854c5d05b4a3d45a294f14bd4c02d9868	2024-08-07T09:07:52+02:00	Johannes Gäßler	CUDA/HIP: fix tests/test-backend-ops (#8896)
M	ggml/src/ggml-cuda.cu

commit	506122d854c5d05b4a3d45a294f14bd4c02d9868	725e3d94379d5b619c027347308bccf2e0ead89f	2024-08-07T09:01:06+08:00	Zhenwei Jin	llama-bench : add support for getting cpu info on Windows (#8824)
M	examples/llama-bench/llama-bench.cpp

commit	725e3d94379d5b619c027347308bccf2e0ead89f	31958546c3e4695a8a24bb7ba3b79a8f76d05afe	2024-08-07T01:43:00+02:00	Daniel Bevenius	quantize : update usage comment in quantize.cpp (#8889)
M	examples/quantize/quantize.cpp

commit	31958546c3e4695a8a24bb7ba3b79a8f76d05afe	1e6f6554aa11fa10160a5fda689e736c3c34169f	2024-08-07T01:41:54+02:00	Nexes the Old	typo correction (#8891)
M	include/llama.h

commit	1e6f6554aa11fa10160a5fda689e736c3c34169f	641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5	2024-08-06T17:33:39+02:00	Xuan Son Nguyen	server : add lora hotswap endpoint (WIP) (#8857)
M	common/common.cpp
M	common/common.h
M	examples/export-lora/export-lora.cpp
M	examples/server/README.md
M	examples/server/server.cpp
A	examples/server/tests/features/lora.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt
M	gguf-py/gguf/metadata.py

commit	641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5	5f4dcb1e60bbfe936b45778dad177a5b9a09b066	2024-08-06T17:13:55+02:00	Johannes Gäßler	CUDA: fix padding logic for FP16/FP32 (#8884)
M	ggml/src/ggml-cuda.cu

commit	5f4dcb1e60bbfe936b45778dad177a5b9a09b066	db20f50cf4710c46e3a996919a26858cae8c80ed	2024-08-06T16:44:35+02:00	Daniel Bevenius	simple : update name of executable to llama-simple (#8885)
M	examples/simple/README.md

commit	db20f50cf4710c46e3a996919a26858cae8c80ed	efda90c93a62274ec0b0bfa80c4eee4bdb6966d0	2024-08-06T17:21:47+04:00	Jaeden Amero	cmake : Link vulkan-shaders-gen with pthreads (#8835)
M	ggml/src/vulkan-shaders/CMakeLists.txt

commit	efda90c93a62274ec0b0bfa80c4eee4bdb6966d0	0bf16de07b0692e7df26b9a633e232bbd66e0360	2024-08-06T16:32:03+05:00	MaggotHATE	[Vulkan] Fix compilation of `vulkan-shaders-gen` on w64devkit after `e31a4f6` (#8880)
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	0bf16de07b0692e7df26b9a633e232bbd66e0360	2d5dd7bb3fa382806cd3e0bfc7a1d92349bc0ccf	2024-08-06T11:48:01+03:00	Georgi Gerganov	contributing : add note about write access
M	CONTRIBUTING.md

commit	2d5dd7bb3fa382806cd3e0bfc7a1d92349bc0ccf	cdd1889de62a7140c8c016405ec917464bde8bd3	2024-08-06T15:26:46+08:00	Molly Sophia	ggml : add epsilon as a parameter for group_norm (#8818)
M	ggml/include/ggml.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cuda/norm.cu
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml.c
M	tests/test-backend-ops.cpp

commit	cdd1889de62a7140c8c016405ec917464bde8bd3	c21a896405de4cdf4207eb8130555ceaac0ab110	2024-08-06T02:20:54-05:00	Douglas Hanley	convert : add support for XLMRoberta embedding models (#8658)
M	convert_hf_to_gguf.py
M	src/llama-vocab.cpp

commit	c21a896405de4cdf4207eb8130555ceaac0ab110	d4ff847153e9cf7220d1b39aa21172069e6e8cea	2024-08-06T12:42:42+08:00	Mengqing Cao	[CANN]: Fix ggml_backend_cann_buffer_get_tensor (#8871)
M	ggml/src/ggml-cann.cpp

commit	d4ff847153e9cf7220d1b39aa21172069e6e8cea	0a4ce786814b123096d18aadca89cd352b9e590b	2024-08-06T09:09:12+08:00	Neo Zhang	[SYCL] correct cmd name (#8877)
M	examples/sycl/win-run-llama2.bat

commit	0a4ce786814b123096d18aadca89cd352b9e590b	bc0f887e159c0d78c28121e2c8b5c58094170875	2024-08-06T00:14:10+08:00	Liu Jia	common : Changed tuple to struct (TODO fix) (#8823)
M	common/common.cpp
M	common/common.h
M	examples/cvector-generator/cvector-generator.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp

commit	bc0f887e159c0d78c28121e2c8b5c58094170875	b42978e7e4d56eaaa93588414e804d9fbbc3cae2	2024-08-05T21:10:37+08:00	wangshuai09	cann: fix buffer_num and runtime speed slowly error (#8865)
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cann/kernels/quantize_float_to_q4_0.cpp

commit	b42978e7e4d56eaaa93588414e804d9fbbc3cae2	b9dfc25ca385a83bde9e9456c4d4fae15377bc7b	2024-08-05T13:45:01+01:00	Eric Curtin	readme : add ramalama to the availables UI (#8811)
M	README.md

commit	b9dfc25ca385a83bde9e9456c4d4fae15377bc7b	1ef14b30075da594cb24f0ab858a14bf1d8d1797	2024-08-05T05:43:40-07:00	Justine Tunney	ggml : fix overflows in elu function (#8866)
M	ggml/src/ggml.c

commit	1ef14b30075da594cb24f0ab858a14bf1d8d1797	d3f0c7166adfa952237e0f437a5344362d8256d4	2024-08-05T21:15:28+10:00	Brian	py: Add more authorship metadata from model card (#8810)
M	gguf-py/gguf/metadata.py

commit	d3f0c7166adfa952237e0f437a5344362d8256d4	e31a4f679779220312c165b0f5994c680a610e38	2024-08-05T09:38:01+02:00	fairydreaming	Stop the generation when <|eom_id|> token is encountered - needed for Llama 3.1 tool call support (#8858)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama-vocab.cpp
M	src/llama-vocab.h
M	src/llama.cpp

commit	e31a4f679779220312c165b0f5994c680a610e38	400ae6f65f0b55babd48d1e3ec7fd663a97fc8d0	2024-08-05T08:18:27+02:00	stduhpf	cmake: fix paths for vulkan shaders compilation on Windows (#8573)
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	400ae6f65f0b55babd48d1e3ec7fd663a97fc8d0	f1ea5146d741a0c9be6d8fbfab9323fea6c4a3f0	2024-08-05T01:54:10-04:00	BarfingLemurs	readme : update model list (#8851)
M	README.md

commit	f1ea5146d741a0c9be6d8fbfab9323fea6c4a3f0	064cdc265fb63590c7c8f04a609d36ef200d55a7	2024-08-05T08:53:39+03:00	Georgi Gerganov	llama : better replace_all (#8852)
M	src/llama.cpp

commit	064cdc265fb63590c7c8f04a609d36ef200d55a7	5587e57a76630651752031223cc7024cb32cf308	2024-08-05T07:52:55+02:00	0cc4m	vulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855)
M	ggml/src/vulkan-shaders/mul_mat_vec.comp
M	tests/test-backend-ops.cpp

commit	5587e57a76630651752031223cc7024cb32cf308	a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e	2024-08-04T19:13:25+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.last

commit	a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e	655858ace0cf2720e56eb01f84ad05e0c94ada3c	2024-08-04T17:28:08+02:00	0cc4m	vulkan : implement Stable Diffusion operators (ggml/904)
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/add.comp
M	ggml/src/vulkan-shaders/clamp.comp
A	ggml/src/vulkan-shaders/concat.comp
M	ggml/src/vulkan-shaders/copy.comp
M	ggml/src/vulkan-shaders/div.comp
M	ggml/src/vulkan-shaders/gelu.comp
A	ggml/src/vulkan-shaders/gelu_quick.comp
M	ggml/src/vulkan-shaders/generic_binary_head.comp
M	ggml/src/vulkan-shaders/generic_unary_head.comp
A	ggml/src/vulkan-shaders/group_norm.comp
A	ggml/src/vulkan-shaders/im2col.comp
A	ggml/src/vulkan-shaders/leaky_relu.comp
M	ggml/src/vulkan-shaders/mul.comp
M	ggml/src/vulkan-shaders/norm.comp
A	ggml/src/vulkan-shaders/pad.comp
M	ggml/src/vulkan-shaders/relu.comp
M	ggml/src/vulkan-shaders/rms_norm.comp
M	ggml/src/vulkan-shaders/scale.comp
M	ggml/src/vulkan-shaders/silu.comp
M	ggml/src/vulkan-shaders/soft_max.comp
M	ggml/src/vulkan-shaders/square.comp
M	ggml/src/vulkan-shaders/sum_rows.comp
A	ggml/src/vulkan-shaders/tanh.comp
A	ggml/src/vulkan-shaders/timestep_embedding.comp
M	ggml/src/vulkan-shaders/types.comp
A	ggml/src/vulkan-shaders/upscale.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	655858ace0cf2720e56eb01f84ad05e0c94ada3c	c02b0a8a4dee489b29073f25a27ed6e5628e86e1	2024-07-29T15:06:06+02:00	Daniel Bevenius	ggml : move c parameter comment to ggml_rope_ext (ggml/901)
M	ggml/include/ggml.h

commit	c02b0a8a4dee489b29073f25a27ed6e5628e86e1	0d6fb52be0c1b7e77eb855f3adc4952771c8ce4c	2024-08-05T12:22:30+08:00	wangshuai09	cann: support q4_0 model (#8822)
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cann/acl_tensor.cpp
M	ggml/src/ggml-cann/acl_tensor.h
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cann/kernels/CMakeLists.txt
M	ggml/src/ggml-cann/kernels/ascendc_kernels.h
A	ggml/src/ggml-cann/kernels/quantize_float_to_q4_0.cpp

commit	0d6fb52be0c1b7e77eb855f3adc4952771c8ce4c	978ba3d83d17b10fdf9807006048432b5b3769fc	2024-08-04T14:17:16-04:00	Brandon Squizzato	Install curl in runtime layer (#8693)
M	.devops/llama-server.Dockerfile

commit	978ba3d83d17b10fdf9807006048432b5b3769fc	ecf6b7f23e664afd7ff856ec39034240ce438daa	2024-08-04T18:16:23Z	ardfork	Server: Don't ignore llama.cpp params (#8754)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	ecf6b7f23e664afd7ff856ec39034240ce438daa	01aae2b4975b57a265ce8194928fd87f2d71027e	2024-08-04T03:55:03-07:00	Brian Cunnie	batched-bench : handle empty `-npl` (#8839)
M	examples/batched-bench/batched-bench.cpp

commit	01aae2b4975b57a265ce8194928fd87f2d71027e	4b77ea95f56a4c49bc995f08eac62a6416875ccc	2024-08-03T15:07:47+02:00	Daniel Bevenius	baby-llama : remove duplicate vector include
M	examples/baby-llama/baby-llama.cpp

commit	4b77ea95f56a4c49bc995f08eac62a6416875ccc	76614f352e94d25659306d9e97321f204e5de0d3	2024-08-04T05:53:20+03:00	Georgi Gerganov	flake.lock: Update (#8847)
M	flake.lock

commit	76614f352e94d25659306d9e97321f204e5de0d3	b72c20b85c1029d135022d39e9a20d4807c11893	2024-08-04T01:34:41+09:00	jdomke	ggml : reading the runtime sve config of the cpu (#8709)
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
M	ggml/src/ggml.c

commit	b72c20b85c1029d135022d39e9a20d4807c11893	e09a800f9a9b19c73aa78e03b4c4be8ed988f3e6	2024-08-02T21:11:39+02:00	Sigbjørn Skjæret	Fix conversion of unnormalized BF16->BF16 weights (#7843)
M	convert_hf_to_gguf.py
M	ggml/include/ggml.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml.c
M	gguf-py/gguf/quants.py

commit	e09a800f9a9b19c73aa78e03b4c4be8ed988f3e6	0fbbd884589d585c3b43cae8c16938ffffb863b9	2024-08-02T16:50:53+08:00	Mengqing Cao	cann: Fix ggml_cann_im2col for 1D im2col (#8819)
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	tests/test-backend-ops.cpp

commit	0fbbd884589d585c3b43cae8c16938ffffb863b9	afbb4c1322a747d2a7b4bf67c868148f8afcc6c8	2024-08-02T01:55:17+01:00	Ouadie EL FAROUKI	[SYCL] Fixing wrong VDR iq4nl value (#8812)
M	ggml/src/ggml-sycl/mmvq.cpp

commit	afbb4c1322a747d2a7b4bf67c868148f8afcc6c8	b7a08fd5e0e7c898c68d1743066ea495202d9608	2024-08-01T23:28:28+02:00	matteo	ggml-cuda: Adding support for unified memory (#8035)
M	docs/build.md
M	ggml/src/ggml-cuda.cu

commit	b7a08fd5e0e7c898c68d1743066ea495202d9608	7a11eb3a260915aee16101808f291a244e2facc7	2024-08-01T12:53:46-04:00	Alex O'Connell	Build: Only include execinfo.h on linux systems that support it (#8783)
M	ggml/src/ggml.c

commit	7a11eb3a260915aee16101808f291a244e2facc7	c8a0090922bad576623de4aae227717085249262	2024-08-01T15:26:22+02:00	slaren	cuda : fix dmmv cols requirement to 2*GGML_CUDA_DMMV_X (#8800)
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/dmmv.cu
M	ggml/src/ggml-cuda/dmmv.cuh
M	tests/test-backend-ops.cpp

commit	c8a0090922bad576623de4aae227717085249262	afbbcf3c04e3c6420cad3d72571478cd62ac176c	2024-08-01T10:39:05+08:00	wangshuai09	cann: support q8_0 for Ascend backend (#8805)
M	ggml/src/ggml-cann/aclnn_ops.cpp

commit	afbbcf3c04e3c6420cad3d72571478cd62ac176c	ed9d2854c9de4ae1f448334294e61167b04bec2a	2024-07-31T18:59:09-05:00	Igor Okulist	server : update llama-server embedding flag documentation (#8779)
M	common/common.cpp
M	examples/server/README.md

commit	ed9d2854c9de4ae1f448334294e61167b04bec2a	398ede5efeb07b9adf9fbda7ea63f630d476a792	2024-07-31T15:51:06-04:00	Clint Herron	Build: Fix potential race condition (#8781)
M	Makefile

commit	398ede5efeb07b9adf9fbda7ea63f630d476a792	44d28ddd5caaa5e9de573bdaaa5b5b2448a29ace	2024-07-31T11:12:10-04:00	pculliton	Adding Gemma 2 2B configs (#8784)
M	src/llama.cpp

commit	44d28ddd5caaa5e9de573bdaaa5b5b2448a29ace	268c5660062270a2c19a36fc655168aa287aaec2	2024-07-31T16:40:08+03:00	Borislav Stanimirov	cmake : fix use of external ggml (#8787)
M	CMakeLists.txt

commit	268c5660062270a2c19a36fc655168aa287aaec2	7e72aa74fd676a093eb9970e761085ec22734c71	2024-07-30T23:35:30+03:00	Someone	nix: cuda: rely on propagatedBuildInputs (#8772)
M	.devops/nix/package.nix

commit	7e72aa74fd676a093eb9970e761085ec22734c71	7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33	2024-07-31T00:57:03+10:00	Brian	py: add_array() will not add to kv store if value is an empty array (#8774)
M	gguf-py/gguf/gguf_writer.py

commit	7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33	140074bb8647df41840d6f32f4409fa8959bcf9f	2024-07-30T23:40:18+09:00	l3utterfly	added android implementation of ggml_print_backtrace_symbols (#8751)
M	ggml/src/ggml.c

commit	140074bb8647df41840d6f32f4409fa8959bcf9f	6e2b6000e5fe808954a7dcef8225b5b7f2c1b9e9	2024-07-30T15:58:57+03:00	Georgi Gerganov	flake.lock: Update (#8729)
M	flake.lock

commit	6e2b6000e5fe808954a7dcef8225b5b7f2c1b9e9	c887d8b01726b11ea03dbcaa9d44fa74422d0076	2024-07-30T18:37:35+08:00	wangshuai09	cann: update cmake (#8765)
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt

commit	c887d8b01726b11ea03dbcaa9d44fa74422d0076	75af08c475e285888f66556d0f459c533b7deb95	2024-07-30T14:56:51+08:00	zhentaoyu	[SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/presets.hpp
A	ggml/src/ggml-sycl/tsembd.cpp
A	ggml/src/ggml-sycl/tsembd.hpp

commit	75af08c475e285888f66556d0f459c533b7deb95	439b3fc75a8deb42899ac47a8f52aae75e0339fe	2024-07-30T00:38:34+08:00	CarterLi999	ggml: bugfix: fix the inactive elements is agnostic for risc-v vector (#8748)
M	ggml/src/ggml-quants.c

commit	439b3fc75a8deb42899ac47a8f52aae75e0339fe	0832de723695ab400316a6c49b9f712380e3a731	2024-07-29T20:56:12+08:00	R0CKSTAR	cuda : organize vendor-specific headers into vendors directory (#8746)
M	ggml/src/ggml-cuda/common.cuh
A	ggml/src/ggml-cuda/vendors/cuda.h
A	ggml/src/ggml-cuda/vendors/hip.h
A	ggml/src/ggml-cuda/vendors/musa.h

commit	0832de723695ab400316a6c49b9f712380e3a731	6eeaeba126ff701f3e8f79f246805b7023709972	2024-07-29T10:50:27+08:00	Meng, Hengyu	[SYCL] add conv support (#8688)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
A	ggml/src/ggml-sycl/conv.cpp
A	ggml/src/ggml-sycl/conv.hpp
M	ggml/src/ggml-sycl/presets.hpp

commit	6eeaeba126ff701f3e8f79f246805b7023709972	4730faca618ff9cee0780580145e3cbe86f24876	2024-07-28T22:32:44+02:00	Johannes Gäßler	cmake: use 1 more thread for non-ggml in CI (#8740)
M	.github/workflows/build.yml

commit	4730faca618ff9cee0780580145e3cbe86f24876	4c676c85e59ef8f771f3a129e6eb217552139231	2024-07-28T03:52:42-04:00	Austin	chore : Fix vulkan related compiler warnings, add help text, improve CLI options (#8477)
M	.gitignore
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	4c676c85e59ef8f771f3a129e6eb217552139231	e54c35e4fb5777c76316a50671640e6e144c9538	2024-07-28T00:42:05-04:00	compilade	llama : refactor session file management (#8699)
M	examples/save-load-state/save-load-state.cpp
M	include/llama.h
M	src/llama.cpp

commit	e54c35e4fb5777c76316a50671640e6e144c9538	5e2727fe0321c38d1664d26173c654fa1801dc5f	2024-07-28T07:41:25+08:00	R0CKSTAR	feat: Support Moore Threads GPU  (#8383)
M	Makefile
M	README.md
M	docs/build.md
M	ggml/CMakeLists.txt
M	ggml/include/ggml-cuda.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/common.cuh

commit	5e2727fe0321c38d1664d26173c654fa1801dc5f	56f20aa25d5f97248a204b473c99f4040900f0e5	2024-07-27T18:08:31+03:00	Georgi Gerganov	scripts : sync vulkan-shaders (#0)
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	56f20aa25d5f97248a204b473c99f4040900f0e5	345c8c0c87a97c1595f9c8b14833d531c8c7d8df	2024-07-27T17:19:35+03:00	Georgi Gerganov	scripts : sync ggml-aarch64 sources
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	345c8c0c87a97c1595f9c8b14833d531c8c7d8df	ae7985cd7beca3b849328d169a8d592469cd021f	2024-07-27T15:57:09+03:00	Georgi Gerganov	ggml : add missing semicolon (#0)
M	ggml/src/ggml-quants.c

commit	ae7985cd7beca3b849328d169a8d592469cd021f	a05ca9369716a8319014cd1fc365980d43f8aae9	2024-07-27T15:53:48+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a05ca9369716a8319014cd1fc365980d43f8aae9	9f77d899b7b0d56496f679e54b797da6199fed8e	2024-07-25T00:54:08-07:00	Mahesh Madhav	ggml : loop tiling optimizations for scalar path (ggml/898)
M	ggml/src/ggml-quants.c

commit	9f77d899b7b0d56496f679e54b797da6199fed8e	203b7f1531303a060730ec1d1e01920e70302398	2024-07-22T14:32:02+03:00	Ivan Filipov	ggml: add support for float16 input tensors in pooling operations (ggml/895)
M	ggml/src/ggml.c

commit	203b7f1531303a060730ec1d1e01920e70302398	d2b851bfa131478665315bc5c7c707506c14d703	2024-07-20T20:49:44+02:00	Tony Wasserka	vulkan : initialize vk_buffer_struct members to VK_NULL_HANDLE (ggml/893)
M	ggml/src/ggml-vulkan.cpp

commit	d2b851bfa131478665315bc5c7c707506c14d703	c12b6e8ee7d905e0f299caf311689189fb1b4ac5	2024-07-12T17:24:20+03:00	Borislav Stanimirov	cmake : only enable GGML_NATIVE and x86 flags if not crosscompiling (ggml/885)
M	ggml/CMakeLists.txt

commit	c12b6e8ee7d905e0f299caf311689189fb1b4ac5	b5e95468b1676e1e5c9d80d1eeeb26f542a38f42	2024-07-08T12:03:42+02:00	Daniel Bevenius	ggml : remove unnecessary UNUSED macro call (ggml/880)
M	ggml/src/ggml.c

commit	b5e95468b1676e1e5c9d80d1eeeb26f542a38f42	92090eca212650727e38b335c1d4accfbcc9b79c	2024-07-27T05:03:45-07:00	Jeffrey Morgan	llama : add support for llama 3.1 rope scaling factors (#8676)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	92090eca212650727e38b335c1d4accfbcc9b79c	9d03d085dd6cb275c078690bb64073b9b043e95f	2024-07-27T14:59:29+03:00	Georgi Gerganov	llama : add function for model-based max number of graph nodes (#8622)
M	src/llama.cpp

commit	9d03d085dd6cb275c078690bb64073b9b043e95f	bfb4c74981f0a40d757b450b596a9fe4ca983d26	2024-07-27T12:45:02+02:00	Daniel Bevenius	common : add --no-warmup option for main/llama-cli (#8712)
M	common/common.cpp

commit	bfb4c74981f0a40d757b450b596a9fe4ca983d26	2b1f616b208a4a21c4ee7a7eb85d822ff1d787af	2024-07-27T16:36:44+08:00	wangshuai09	cann: Fix Multi-NPU execution error (#8710)
M	ggml/src/ggml-cann.cpp

commit	2b1f616b208a4a21c4ee7a7eb85d822ff1d787af	01245f5b1629075543bc4478418c7d72a0b4b3c7	2024-07-27T04:41:55+02:00	slaren	ggml : reduce hash table reset cost (#8698)
M	Makefile
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/clip.cpp
M	examples/tokenize/tokenize.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-blas.cpp
M	ggml/src/ggml-cann.cpp
M	ggml/src/ggml-cann/aclnn_ops.cpp
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/argsort.cu
M	ggml/src/ggml-cuda/binbcast.cu
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-cuda/dmmv.cu
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/fattn-tile-f16.cu
M	ggml/src/ggml-cuda/fattn-tile-f32.cu
M	ggml/src/ggml-cuda/fattn.cu
M	ggml/src/ggml-cuda/getrows.cu
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/quantize.cu
M	ggml/src/ggml-cuda/rope.cu
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-kompute.cpp
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/rope.cpp
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/ggml.c
M	src/llama-grammar.cpp
M	src/llama-vocab.cpp
M	src/llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-sampling.cpp

commit	01245f5b1629075543bc4478418c7d72a0b4b3c7	01aec4a6310ab0160483196db0e726d78d4c94b6	2024-07-26T16:38:12+08:00	Judd	llama : fix order of parameters (#8706)
M	src/llama.cpp

commit	01aec4a6310ab0160483196db0e726d78d4c94b6	41cd47caab88c442edc50e90c8d8d0ac3e82768d	2024-07-25T18:10:16-04:00	Yaiko	server : add Speech Recognition & Synthesis to UI (#8679)
M	examples/server/public/index.html

commit	41cd47caab88c442edc50e90c8d8d0ac3e82768d	49ce0ab6d45402e8bb622bf86f86529f2b0ba552	2024-07-25T23:49:39+02:00	Xuan Son Nguyen	examples : export-lora : fix issue with quantized base models (#8687)
M	examples/export-lora/export-lora.cpp

commit	49ce0ab6d45402e8bb622bf86f86529f2b0ba552	4226a8d10e3904db3a1297919fe6c7f06beba6c0	2024-07-25T22:23:05+01:00	DavidKorczynski	ggml: handle ggml_init failure to fix NULL pointer deref (#8692)
M	ggml/src/ggml.c

commit	4226a8d10e3904db3a1297919fe6c7f06beba6c0	bf5a81df375f1c71e41462e1f48d57db359c9e80	2024-07-25T19:57:31+03:00	Georgi Gerganov	llama : fix build + fix fabs compile warnings (#8683)
M	src/llama-grammar.h
M	src/llama.cpp

commit	bf5a81df375f1c71e41462e1f48d57db359c9e80	88954f7fbd31aeb8c75140edee03e7a8ad5e2d9c	2024-07-25T18:01:00+02:00	Andreas (Andi) Kunar	ggml : fix build on Windows with Snapdragon X (#8531)
M	docs/build.md
M	ggml/src/ggml-aarch64.c

commit	88954f7fbd31aeb8c75140edee03e7a8ad5e2d9c	ed67bcb24f2d6ac0072cae72620b2bd971741b98	2024-07-25T18:57:44+03:00	Georgi Gerganov	tests : fix printfs (#8068)
M	tests/test-chat-template.cpp

commit	ed67bcb24f2d6ac0072cae72620b2bd971741b98	eddcb5238b2e09a37798b87cde1244017a194bcc	2024-07-25T11:45:18Z	Chen Xi	[SYCL] fix multi-gpu issue on sycl (#8554)
M	docs/backend/SYCL.md
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/dpct/helper.hpp
M	src/llama.cpp

commit	eddcb5238b2e09a37798b87cde1244017a194bcc	be6d7c079173d941b4f784500f9148f46cec2724	2024-07-25T12:37:42+03:00	Georgi Gerganov	ggml : add and use ggml_cpu_has_llamafile() (#8664)
M	ggml/include/ggml.h
M	ggml/src/ggml.c
M	src/llama.cpp

commit	be6d7c079173d941b4f784500f9148f46cec2724	4b0eff3df58d8d86e47348fb73d54da3194d416d	2024-07-25T10:39:04+02:00	Xuan Son Nguyen	examples : remove `finetune` and `train-text-from-scratch` (#8669)
M	.devops/nix/apps.nix
M	.devops/tools.sh
M	Makefile
M	examples/CMakeLists.txt
M	examples/deprecation-warning/README.md
M	examples/export-lora/README.md
D	examples/finetune/CMakeLists.txt
D	examples/finetune/README.md
D	examples/finetune/convert_finetune_checkpoint_to_gguf.py
D	examples/finetune/finetune.cpp
D	examples/finetune/finetune.sh
D	examples/train-text-from-scratch/CMakeLists.txt
D	examples/train-text-from-scratch/README.md
D	examples/train-text-from-scratch/convert_train_checkpoint_to_gguf.py
D	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	4b0eff3df58d8d86e47348fb73d54da3194d416d	8a4bad50a8ed24ed1e9df003521468dcc37320e8	2024-07-25T13:43:27+05:30	Ujjawal Panchal	docs : Quantum -> Quantized (#8666)
M	examples/imatrix/README.md
M	examples/server/README.md

commit	8a4bad50a8ed24ed1e9df003521468dcc37320e8	68504f0970db5a3602d176953690f503059906b1	2024-07-25T15:21:09+08:00	Fan Shupei	llama: use sliding window for phi3 (#8627)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	68504f0970db5a3602d176953690f503059906b1	f19bf99c015d3d745143e8bb4f056e0ea015ad40	2024-07-24T12:48:00-04:00	MorganRO8	readme : update games list (#8673)
M	README.md

commit	f19bf99c015d3d745143e8bb4f056e0ea015ad40	3a7ac5300a7e8ebbe4a3eb5aff9dba11ed76ea61	2024-07-24T14:36:00+01:00	Joe Todd	Build Llama SYCL Intel with static libs (#8668)
M	.devops/llama-cli-intel.Dockerfile
M	.devops/llama-server-intel.Dockerfile

commit	3a7ac5300a7e8ebbe4a3eb5aff9dba11ed76ea61	96952e7181929c6001b2bc69a33f240de731cc3a	2024-07-24T14:52:30+02:00	Thorsten Sommer	readme : update UI list [no ci] (#8505)
M	README.md

commit	96952e7181929c6001b2bc69a33f240de731cc3a	79167d9e49aef9caa98e13ee7ca067ec9f88b4b5	2024-07-24T13:48:46+02:00	Xuan Son Nguyen	llama : fix `llama_chat_format_single` for mistral (#8657)
M	common/common.cpp
M	examples/main/main.cpp
M	tests/test-chat-template.cpp

commit	79167d9e49aef9caa98e13ee7ca067ec9f88b4b5	b115105f05e3372bc75b2a486c1930c365fd2846	2024-07-24T11:55:26+01:00	Joe Todd	Re-add erroneously removed -fsycl from GGML_EXTRA_LIBS (#8667)
M	ggml/src/CMakeLists.txt

commit	b115105f05e3372bc75b2a486c1930c365fd2846	de280085e7917dbb7f5753de5842ff4455f82a81	2024-07-24T11:25:19+02:00	Xuan Son Nguyen	add llama_lora_adapter_clear (#8653)
M	include/llama.h
M	src/llama.cpp

commit	de280085e7917dbb7f5753de5842ff4455f82a81	b841d0740855c5af1344a81f261139a45a2b39ee	2024-07-23T23:48:37+02:00	Xuan Son Nguyen	examples : Fix `llama-export-lora` example (#8607)
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/export-lora/README.md
M	examples/export-lora/export-lora.cpp

commit	b841d0740855c5af1344a81f261139a45a2b39ee	64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e	2024-07-23T17:37:42+03:00	Vali Malinoiu	server : fix URL.parse in the UI (#8646)
M	examples/server/public/index-new.html
M	examples/server/public/index.html

commit	64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e	938943cdbf4dd79005a394d732bc226f9e34e0ff	2024-07-23T14:58:37+01:00	Joe Todd	sycl : Add support for non-release DPC++ & oneMKL (#8644)
M	ggml/src/CMakeLists.txt

commit	938943cdbf4dd79005a394d732bc226f9e34e0ff	751fcfc6c33ea5f43cadd4d976f8fb176871df5e	2024-07-23T13:10:17+03:00	Georgi Gerganov	llama : move vocab, grammar and sampling into separate files (#8508)
M	Makefile
M	Package.swift
M	common/sampling.cpp
M	examples/gbnf-validator/gbnf-validator.cpp
M	include/llama.h
M	src/CMakeLists.txt
A	src/llama-grammar.cpp
A	src/llama-grammar.h
A	src/llama-impl.h
A	src/llama-sampling.cpp
A	src/llama-sampling.h
A	src/llama-vocab.cpp
A	src/llama-vocab.h
M	src/llama.cpp
M	src/unicode.cpp
M	src/unicode.h
M	tests/test-grammar-integration.cpp
M	tests/test-llama-grammar.cpp

commit	751fcfc6c33ea5f43cadd4d976f8fb176871df5e	46e47417aa4f18c08738afd4d9a3e838e97ca03f	2024-07-23T10:56:49+02:00	0cc4m	Vulkan IQ4_NL Support (#8613)
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/dequant_funcs.comp
A	ggml/src/vulkan-shaders/dequant_iq4_nl.comp
M	ggml/src/vulkan-shaders/dequant_q4_0.comp
M	ggml/src/vulkan-shaders/mul_mm.comp
M	ggml/src/vulkan-shaders/types.comp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	46e47417aa4f18c08738afd4d9a3e838e97ca03f	e7e6487ba06634edf58dfdf9673bad9df41b445a	2024-07-23T10:50:40+02:00	Jeroen Mostert	Allow all RDNA2 archs to use sdot4 intrinsic (#8629)
M	ggml/src/ggml-cuda/common.cuh

commit	e7e6487ba06634edf58dfdf9673bad9df41b445a	063d99ad11f1295046610ce5b97e105849a4b573	2024-07-23T11:28:38+03:00	Georgi Gerganov	contrib : clarify PR squashing + module names (#8630)
M	CONTRIBUTING.md

commit	063d99ad11f1295046610ce5b97e105849a4b573	081fe431aa8fb6307145c4feb3eed4f48cab19f8	2024-07-23T07:43:28Z	luoyu-intel	[SYCL] fix scratch size of softmax (#8642)
M	ggml/src/ggml-sycl/softmax.cpp

commit	081fe431aa8fb6307145c4feb3eed4f48cab19f8	d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa	2024-07-23T00:43:43+08:00	Keke Han	llama : fix codeshell support (#8599)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama.cpp

commit	d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa	566daa5a5b38018b2727950bbd280239adb981b6	2024-07-22T10:43:01-04:00	Jason Stillerman	llama : add support for SmolLm pre-tokenizer (#8609)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama.cpp

commit	566daa5a5b38018b2727950bbd280239adb981b6	6f11a83e4e7700fdf353ed4a29599cb662c792f6	2024-07-22T15:44:53+02:00	Jiří Podivín	*.py: Stylistic adjustments for python (#8233)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	convert_llama_ggml_to_gguf.py

commit	6f11a83e4e7700fdf353ed4a29599cb662c792f6	e093dd238282a980d248db0786063f8174400f70	2024-07-22T13:33:22+03:00	Georgi Gerganov	llama : allow overrides for tokenizer flags (#8614)
M	src/llama.cpp

commit	e093dd238282a980d248db0786063f8174400f70	50e05353e88d50b644688caa91f5955e8bdb9eb9	2024-07-22T13:32:49+03:00	Georgi Gerganov	tests : re-enable tokenizer tests (#8611)
D	models/ggml-vocab-gpt2.gguf
D	models/ggml-vocab-stablelm.gguf
M	tests/CMakeLists.txt

commit	50e05353e88d50b644688caa91f5955e8bdb9eb9	628154492a0b2dcc954a3af99e5c267097568eae	2024-07-22T03:06:17-05:00	Douglas Hanley	llama : add Mistral Nemo inference support (#8604)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	628154492a0b2dcc954a3af99e5c267097568eae	04bab6b7da0ed2b0a57174a57784d602aabb6c10	2024-07-22T16:02:09+08:00	Jan Boon	server : update doc to clarify n_keep when there is bos token (#8619)
M	examples/server/README.md

commit	04bab6b7da0ed2b0a57174a57784d602aabb6c10	b7c11d36e605b35206901d0e21905f1b99508e33	2024-07-22T15:56:45+08:00	Mark Zhuang	ggml: fix compile error for RISC-V (#8623)
M	ggml/src/ggml-quants.c

commit	b7c11d36e605b35206901d0e21905f1b99508e33	45f2c19cc57286eead7b232ce8028273a817aa4d	2024-07-22T14:54:42+08:00	devojony	examples: fix android example cannot be generated continuously (#8621)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp

commit	45f2c19cc57286eead7b232ce8028273a817aa4d	22f281aa16f44d8f6ec2c180a0685ff27e04e714	2024-07-21T16:45:10+03:00	Georgi Gerganov	flake.lock: Update (#8610)
M	flake.lock

commit	22f281aa16f44d8f6ec2c180a0685ff27e04e714	328884f4219c0228673cf1870ac63987fb4f9fd0	2024-07-20T22:09:17-04:00	M-A	examples : Rewrite pydantic_models_to_grammar_examples.py (#8493)
M	examples/pydantic_models_to_grammar_examples.py

commit	328884f4219c0228673cf1870ac63987fb4f9fd0	c69c63039cd75f8f33f253ab7485d82a8b4cd403	2024-07-20T21:58:49-04:00	compilade	gguf-py : fix some metadata name extraction edge cases (#8591)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	gguf-py/gguf/metadata.py
M	gguf-py/gguf/utility.py
M	gguf-py/tests/test_metadata.py

commit	c69c63039cd75f8f33f253ab7485d82a8b4cd403	69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0	2024-07-20T21:53:01-04:00	compilade	convert_hf : fix Gemma v1 conversion (#8597)
M	convert_hf_to_gguf.py

commit	69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0	07283b1a90e1320aae4762c7e03c879043910252	2024-07-20T22:25:26+02:00	Johannes Gäßler	CUDA: MMQ code deduplication + iquant support (#8495)
M	.github/workflows/build.yml
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq1_s.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq2_s.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq2_xs.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq2_xxs.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq3_s.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq3_xxs.cu
M	ggml/src/ggml-cuda/vecdotq.cuh

commit	07283b1a90e1320aae4762c7e03c879043910252	940362224d20e35f13aa5fd34a0d937ae57bdf7d	2024-07-20T17:15:42+03:00	Georgi Gerganov	gguf : handle null name during init (#8587)
M	examples/gguf/gguf.cpp
M	ggml/src/ggml.c

commit	940362224d20e35f13aa5fd34a0d937ae57bdf7d	69b9945b44c3057ec17cb556994cd36060455d44	2024-07-20T09:43:51-04:00	Michael Coppola	llama : add support for Tekken pre-tokenizer (#8579)
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	include/llama.h
M	src/llama.cpp

commit	69b9945b44c3057ec17cb556994cd36060455d44	c3776cacabce2ee35f172fb72be7a519752125fa	2024-07-20T09:09:37-04:00	Huifeng Ou	llama.swiftui: fix end of generation bug (#8268)
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift

commit	c3776cacabce2ee35f172fb72be7a519752125fa	87e397d00bdcedd5cbf6dfda06a7b0f302462728	2024-07-20T17:35:25+10:00	Brian	gguf_dump.py: fix markddown kv array print (#8588)
M	gguf-py/scripts/gguf_dump.py

commit	87e397d00bdcedd5cbf6dfda06a7b0f302462728	57b1d4f9eb6f2c139b31ea79626d954b261e1051	2024-07-19T17:17:27+02:00	slaren	ggml : fix quant dot product with odd number of blocks (#8549)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal
M	ggml/src/ggml-quants.c
M	tests/test-backend-ops.cpp

commit	57b1d4f9eb6f2c139b31ea79626d954b261e1051	d19754553029296c46d40b2f7bd4e2c2f531a8c5	2024-07-20T00:04:38+10:00	Brian	convert-*.py: remove add_name from ChatGLMModel class (#8590)
M	convert_hf_to_gguf.py

commit	d19754553029296c46d40b2f7bd4e2c2f531a8c5	be0cfb41752551a4680ee7dfd29f2a05b50db442	2024-07-19T16:50:47+03:00	Georgi Gerganov	llama : bump max layers from 256 to 512 (#8530)
M	include/llama.h
M	src/llama.cpp

commit	be0cfb41752551a4680ee7dfd29f2a05b50db442	b57eb9ca4fb79f3163c6a69e154ff76157a4f716	2024-07-19T14:34:55+03:00	Georgi Gerganov	readme : fix server badge
M	README.md

commit	b57eb9ca4fb79f3163c6a69e154ff76157a4f716	f299aa98ecc19cbc574e9d698e03999e89de3d3d	2024-07-19T07:05:45-04:00	Clint Herron	ggml : add friendlier error message to fopen errors (#8575)
M	ggml/src/ggml.c

commit	f299aa98ecc19cbc574e9d698e03999e89de3d3d	3d0e4367d99087892e355ddbeebd232a0b2f40de	2024-07-19T17:44:41+08:00	Frank Mai	fix: typo of chatglm4 chat tmpl (#8586)
M	src/llama.cpp

commit	3d0e4367d99087892e355ddbeebd232a0b2f40de	a15ef8f8a08e12f9c5162c221e67779e71182073	2024-07-19T17:51:51+10:00	Brian	convert-*.py: add general.name kv override (#8571)
M	gguf-py/gguf/metadata.py

commit	a15ef8f8a08e12f9c5162c221e67779e71182073	705b7ecf60e667ced57c15d67aa86865e3cc7aa7	2024-07-18T23:48:47+02:00	Johannes Gäßler	CUDA: fix partial offloading for ne0 % 256 != 0 (#8572)
M	ggml/include/ggml-backend.h
M	ggml/src/ggml-alloc.c
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-cuda.cu

commit	705b7ecf60e667ced57c15d67aa86865e3cc7aa7	0d2c7321e9678e91b760ebe57f0d063856bb018b	2024-07-18T07:47:12-07:00	65a	cmake : install all ggml public headers (#8480)
M	ggml/CMakeLists.txt

commit	0d2c7321e9678e91b760ebe57f0d063856bb018b	672a6f101839a150180fc28891ebed379c8f2353	2024-07-18T18:43:49+08:00	Eric Zhang	server: use relative routes for static files in new UI (#8552)
M	examples/server/public/completion.js
M	examples/server/public/index-new.html
M	examples/server/public/index.html

commit	672a6f101839a150180fc28891ebed379c8f2353	3807c3de04cde853418033c95e96642876545f3e	2024-07-18T20:40:15+10:00	Brian	convert-*.py: GGUF Naming Convention Refactor and Metadata Override Refactor (#7499)
M	convert_hf_to_gguf.py
M	convert_lora_to_gguf.py
M	examples/convert_legacy_llama.py
M	gguf-py/README.md
M	gguf-py/gguf/__init__.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
A	gguf-py/gguf/metadata.py
A	gguf-py/gguf/utility.py
M	gguf-py/pyproject.toml
A	gguf-py/tests/__init__.py
D	gguf-py/tests/test_gguf.py
A	gguf-py/tests/test_metadata.py

commit	3807c3de04cde853418033c95e96642876545f3e	e02b597be3702174e7b47b44cd03e1da1553284b	2024-07-18T16:06:22+08:00	RunningLeon	server : respect `--special` cli arg (#8553)
M	examples/server/server.cpp

commit	e02b597be3702174e7b47b44cd03e1da1553284b	b3283448ce9a5098226afe1d8648ccc578511fe4	2024-07-17T23:35:44+02:00	Johannes Gäßler	lookup: fibonacci hashing, fix crashes (#8548)
M	common/ngram-cache.h
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp

commit	b3283448ce9a5098226afe1d8648ccc578511fe4	30f80ca0bcee58669ada7a94244eeccc8c4807cc	2024-07-17T20:21:55+02:00	Al Mochkin	build : Fix docker build warnings (#8535) (#8537)
M	.devops/full-cuda.Dockerfile
M	.devops/full-rocm.Dockerfile
M	.devops/full.Dockerfile
M	.devops/llama-cli-cuda.Dockerfile
M	.devops/llama-cli-intel.Dockerfile
M	.devops/llama-cli-rocm.Dockerfile
M	.devops/llama-cli-vulkan.Dockerfile
M	.devops/llama-cli.Dockerfile
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-intel.Dockerfile
M	.devops/llama-server-rocm.Dockerfile
M	.devops/llama-server-vulkan.Dockerfile
M	.devops/llama-server.Dockerfile

commit	30f80ca0bcee58669ada7a94244eeccc8c4807cc	1bdd8ae19f50bc6f108fa247e90688e5c60559fc	2024-07-18T00:57:06+10:00	Brian	CONTRIBUTING.md : remove mention of noci (#8541)
M	CONTRIBUTING.md

commit	1bdd8ae19f50bc6f108fa247e90688e5c60559fc	da3913d8f9475b0d4bcbeb4936c724af4eade092	2024-07-17T19:23:50+08:00	hipudding	[CANN] Add Ascend NPU backend (#6035)
M	CMakeLists.txt
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/clip.cpp
A	ggml/include/ggml-cann.h
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-backend.c
A	ggml/src/ggml-cann.cpp
A	ggml/src/ggml-cann/.clang-format
A	ggml/src/ggml-cann/Doxyfile
A	ggml/src/ggml-cann/acl_tensor.cpp
A	ggml/src/ggml-cann/acl_tensor.h
A	ggml/src/ggml-cann/aclnn_ops.cpp
A	ggml/src/ggml-cann/aclnn_ops.h
A	ggml/src/ggml-cann/common.h
A	ggml/src/ggml-cann/kernels/CMakeLists.txt
A	ggml/src/ggml-cann/kernels/ascendc_kernels.h
A	ggml/src/ggml-cann/kernels/dup.cpp
A	ggml/src/ggml-cann/kernels/get_row_f16.cpp
A	ggml/src/ggml-cann/kernels/get_row_f32.cpp
A	ggml/src/ggml-cann/kernels/get_row_q4_0.cpp
A	ggml/src/ggml-cann/kernels/get_row_q8_0.cpp
A	ggml/src/ggml-cann/kernels/quantize_f16_q8_0.cpp
A	ggml/src/ggml-cann/kernels/quantize_f32_q8_0.cpp
M	ggml/src/ggml.c
M	src/llama.cpp
M	tests/test-backend-ops.cpp

commit	da3913d8f9475b0d4bcbeb4936c724af4eade092	d65a8361fed8be97389776fb94217e937ec6b03c	2024-07-17T16:34:28+09:00	Masaya, Kato	batched: fix n_predict parameter (#8527)
M	examples/batched/batched.cpp

commit	d65a8361fed8be97389776fb94217e937ec6b03c	5e116e8dd51775f8f1c090570be148d5d7eea6c3	2024-07-17T10:32:59+03:00	Georgi Gerganov	llama : disable context-shift for DeepSeek v2 (#8501)
M	src/llama.cpp

commit	5e116e8dd51775f8f1c090570be148d5d7eea6c3	1666f92dcda14e002cbb08e1028f9fff341d73ad	2024-07-16T21:20:59+02:00	Johannes Gäßler	make/cmake: add missing force MMQ/cuBLAS for HIP (#8515)
M	Makefile
M	ggml/src/CMakeLists.txt

commit	1666f92dcda14e002cbb08e1028f9fff341d73ad	37b12f92ab696d70f9a65d7447ce721b094fb32e	2024-07-16T17:14:16+10:00	Brian	gguf-hash : update clib.json to point to original xxhash repo (#8491)
M	examples/gguf-hash/README.md
M	examples/gguf-hash/deps/xxhash/clib.json

commit	37b12f92ab696d70f9a65d7447ce721b094fb32e	0efec57787cb8d8d76b17cd3765e6521e22c1f19	2024-07-16T00:04:45-07:00	Steve Bonds	export-lora : handle help argument (#8497)
M	examples/export-lora/export-lora.cpp

commit	0efec57787cb8d8d76b17cd3765e6521e22c1f19	7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc	2024-07-16T10:00:30+03:00	Georgi Gerganov	llama : valign + remove unused ftype (#8502)
M	examples/quantize/quantize.cpp
M	include/llama.h
M	src/llama.cpp

commit	7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc	97bdd26eee11fe109dec00de75690ceef61c03f2	2024-07-15T23:13:10-04:00	compilade	convert_hf : faster lazy safetensors (#8482)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/lazy.py
M	gguf-py/gguf/tensor_mapping.py

commit	97bdd26eee11fe109dec00de75690ceef61c03f2	4db8f60fe79a391e82b0464013ada123baced96a	2024-07-15T20:50:47+02:00	Xuan Son Nguyen	Refactor lora adapter support (#8332)
M	common/common.cpp
M	convert_hf_to_gguf.py
A	convert_lora_to_gguf.py
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml.c
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/quants.py
M	include/llama.h
M	requirements.txt
A	requirements/requirements-convert_lora_to_gguf.txt
M	src/llama.cpp

commit	4db8f60fe79a391e82b0464013ada123baced96a	8fac431b0692e88cdc55250f29f8d4386be82c5d	2024-07-15T19:23:10+02:00	Xuan Son Nguyen	fix ci (#8494)
M	examples/server/README.md

commit	8fac431b0692e88cdc55250f29f8d4386be82c5d	f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8	2024-07-15T14:48:17+02:00	Daniel Bevenius	ggml : suppress unknown pragma 'GCC' on windows (#8460)
M	ggml/src/ggml-aarch64.c

commit	f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8	9104bc20edf47f74dc49379b7d61d0c6e85a4882	2024-07-15T08:04:56-04:00	M-A	server: update README.md with llama-server --help output [no ci] (#8472)
M	examples/server/README.md

commit	9104bc20edf47f74dc49379b7d61d0c6e85a4882	fc690b018e459012cd82c37f1343e9bb658987d1	2024-07-15T14:54:58+03:00	Georgi Gerganov	common : add --no-cont-batching arg (#6358)
M	common/common.cpp

commit	fc690b018e459012cd82c37f1343e9bb658987d1	16bdfa42acb09175e88cf97e9d9e4e48f616d120	2024-07-15T04:46:39-07:00	NikolaiLyssogor	docs: fix links in development docs [no ci] (#8481)
M	docs/development/HOWTO-add-model.md
M	docs/development/token_generation_performance_tips.md

commit	16bdfa42acb09175e88cf97e9d9e4e48f616d120	3dfda05956befb350745c5c2f7134d06adfe8724	2024-07-15T19:32:15+08:00	Meng, Hengyu	[SYCL] add concat through dim 1/2 (#8483)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
A	ggml/src/ggml-sycl/concat.cpp
A	ggml/src/ggml-sycl/concat.hpp

commit	3dfda05956befb350745c5c2f7134d06adfe8724	bda62d7999caa8c222b6c354ac1e7c7442508539	2024-07-15T14:10:39+03:00	Georgi Gerganov	llama : de-duplicate deepseek2 norm
M	src/llama.cpp

commit	bda62d7999caa8c222b6c354ac1e7c7442508539	090fca7a073efe9ad3dd2b9ac12491a4f20ac957	2024-07-15T09:38:52+02:00	0cc4m	Vulkan MMQ Fix (#8479)
M	ggml/src/ggml-vulkan.cpp
M	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	090fca7a073efe9ad3dd2b9ac12491a4f20ac957	aaab2419eaa17ab3aa38f4ba49c7eea406999e99	2024-07-14T19:51:21-04:00	compilade	pydantic : replace uses of __annotations__ with get_type_hints (#8474)
M	examples/pydantic_models_to_grammar.py
M	examples/pydantic_models_to_grammar_examples.py
M	requirements/requirements-pydantic.txt

commit	aaab2419eaa17ab3aa38f4ba49c7eea406999e99	73cf442e7bc9baca7b3e213b261551812f1676c9	2024-07-14T18:54:02+03:00	Georgi Gerganov	flake.lock: Update (#8475)
M	flake.lock

commit	73cf442e7bc9baca7b3e213b261551812f1676c9	e236528e7628a0e59751eee9addf21fc3c33d376	2024-07-14T14:05:09+03:00	Georgi Gerganov	llama : fix Gemma-2 Query scaling factors (#8473)
M	convert_hf_to_gguf.py
M	src/llama.cpp

commit	e236528e7628a0e59751eee9addf21fc3c33d376	fa79495bb4897953a75607addd9d2cdd2ec63222	2024-07-14T16:47:14+10:00	Brian	gguf_hash.py: Add sha256 (#8470)
M	gguf-py/scripts/gguf_hash.py

commit	fa79495bb4897953a75607addd9d2cdd2ec63222	17eb6aa8a992cda37ee65cf848d9289bd6cad860	2024-07-13T23:35:10-04:00	compilade	llama : fix pre-tokenization of non-special added tokens (#8228)
M	convert_hf_to_gguf.py
M	src/llama.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-random.py

commit	17eb6aa8a992cda37ee65cf848d9289bd6cad860	c917b67f06c42d8ca8391b9bc73f5fe62c83bf70	2024-07-13T13:12:39-03:00	bandoti	vulkan : cmake integration (#8119)
M	.devops/nix/package.nix
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	cmake/llama-config.cmake.in
M	docs/build.md
A	ggml/.gitignore
D	ggml/ggml_vk_generate_shaders.py
M	ggml/src/CMakeLists.txt
D	ggml/src/ggml-vulkan-shaders.hpp
A	ggml/src/vulkan-shaders/CMakeLists.txt
A	ggml/src/vulkan-shaders/vulkan-shaders-gen.cpp

commit	c917b67f06c42d8ca8391b9bc73f5fe62c83bf70	4e24cffd8cccd653634e24ee461c252bd77b1426	2024-07-13T18:32:33+03:00	Georgi Gerganov	metal : template-ify some of the kernels (#8447)
M	ggml/src/ggml-metal.m
M	ggml/src/ggml-metal.metal

commit	4e24cffd8cccd653634e24ee461c252bd77b1426	6af51c0d96e6268769fc05c98d5b1a5e832c0017	2024-07-12T14:48:15+03:00	Georgi Gerganov	server : handle content array in chat API (#8449)
M	examples/server/utils.hpp

commit	6af51c0d96e6268769fc05c98d5b1a5e832c0017	f53226245f421bd01b47cce43a47e791de82c636	2024-07-12T14:48:04+03:00	Georgi Gerganov	main : print error on empty input (#8456)
M	examples/main/main.cpp

commit	f53226245f421bd01b47cce43a47e791de82c636	c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b	2024-07-12T11:05:21+02:00	Daniel Bevenius	llama : suppress unary minus operator warning (#8448)
M	src/llama.cpp

commit	c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b	8a4441ea1a2564578134404f31158c318e9c0bf3	2024-07-12T03:14:12-05:00	Douglas Hanley	server : ensure batches are either all embed or all completion (#8420)
M	examples/server/server.cpp

commit	8a4441ea1a2564578134404f31158c318e9c0bf3	5aefbce27a66473d4b1263ba3f7bdd3d14245975	2024-07-12T04:08:19-04:00	Armen Kaleshian	docker : fix filename for convert-hf-to-gguf.py in tools.sh (#8441)
M	.devops/tools.sh

commit	5aefbce27a66473d4b1263ba3f7bdd3d14245975	71c1121d11f1437be9421fd0cbaa011b9ef49098	2024-07-12T10:06:33+02:00	Jiří Podivín	convert : remove fsep token from GPTRefactForCausalLM (#8237)
M	convert_hf_to_gguf.py

commit	71c1121d11f1437be9421fd0cbaa011b9ef49098	370b1f7e7a7514d9a63daf15f7b0f00319b7f908	2024-07-12T10:46:14+03:00	Georgi Gerganov	examples : sprintf -> snprintf (#8434)
M	examples/eval-callback/eval-callback.cpp
M	examples/gguf-hash/gguf-hash.cpp

commit	370b1f7e7a7514d9a63daf15f7b0f00319b7f908	b549a1bbefb2f1fbb8b558bac1f2ae7967e60964	2024-07-12T10:46:02+03:00	Georgi Gerganov	ggml : minor naming changes (#8433)
M	examples/quantize-stats/quantize-stats.cpp
M	ggml/include/ggml.h
M	ggml/src/ggml-aarch64.c
M	ggml/src/ggml-aarch64.h
M	ggml/src/ggml-quants.c
M	ggml/src/ggml-quants.h
M	ggml/src/ggml.c
M	tests/test-double-float.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	b549a1bbefb2f1fbb8b558bac1f2ae7967e60964	368645698ab648e390dcd7c00a2bf60efa654f57	2024-07-12T00:52:04Z	Chen Xi	[SYCL] fix the mul_mat_id ut issues (#8427)
M	ggml/src/ggml-backend.c
M	ggml/src/ggml-sycl.cpp
M	src/llama.cpp

commit	368645698ab648e390dcd7c00a2bf60efa654f57	b078c619aa4e97fe726d61b0b5499a2e19a418a4	2024-07-11T11:49:15-05:00	Nicholai Tukanov	ggml : add NVPL BLAS support (#8329) (#8425)
M	Makefile
M	ggml/src/ggml-blas.cpp

commit	b078c619aa4e97fe726d61b0b5499a2e19a418a4	808aba39161e5d7ca2ff24110b5aa14d2e536988	2024-07-11T17:53:42+02:00	Daniel Bevenius	cuda : suppress 'noreturn' warn in no_device_code (#8414)
M	ggml/src/ggml-cuda/common.cuh

commit	808aba39161e5d7ca2ff24110b5aa14d2e536988	a977c115448e40856fb9cbe3ceb6d8ce802553b0	2024-07-11T16:47:47+02:00	Johannes Gäßler	CUDA: optimize and refactor MMQ (#8416)
M	ggml/src/ggml-cuda/mma.cuh
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/quantize.cu
M	ggml/src/ggml-cuda/quantize.cuh
M	ggml/src/ggml-cuda/vecdotq.cuh

commit	a977c115448e40856fb9cbe3ceb6d8ce802553b0	9a55ffe6fbf7f19c865f8f277ca7cd585cc0b094	2024-07-11T11:20:40+03:00	Georgi Gerganov	gitignore : deprecated binaries
M	.gitignore

commit	9a55ffe6fbf7f19c865f8f277ca7cd585cc0b094	7a221b672e49dfae459b1af27210ba3f2b5419b6	2024-07-11T03:41:48-04:00	compilade	tokenize : add --no-parse-special option (#8423)
M	examples/tokenize/tokenize.cpp

commit	7a221b672e49dfae459b1af27210ba3f2b5419b6	278d0e18469aacf505be18ce790a63c7cc31be26	2024-07-11T10:21:30+03:00	Georgi Gerganov	llama : use F32 precision in Qwen2 attention and no FA (#8412)
M	src/llama.cpp

commit	278d0e18469aacf505be18ce790a63c7cc31be26	dd07a123b79f9bd9e8a4ba0447427b3083e9347a	2024-07-10T20:08:17-04:00	Clint Herron	Initialize default slot sampling parameters from the global context. (#8418)
M	examples/server/server.cpp

commit	dd07a123b79f9bd9e8a4ba0447427b3083e9347a	f4444d992c16b6b9442f4770c7c3a10b19a08343	2024-07-10T12:35:18-04:00	Clint Herron	Name Migration: Build the deprecation-warning 'main' binary every time (#8404)
M	Makefile

commit	f4444d992c16b6b9442f4770c7c3a10b19a08343	6b2a849d1f43d46b82d2f9c08c3275137b528784	2024-07-10T16:10:49+01:00	AidanBeltonS	[SYCL] Use multi_ptr to clean up deprecated warnings (#8256)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/mmq.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/softmax.cpp

commit	6b2a849d1f43d46b82d2f9c08c3275137b528784	0f1a39f3439825acf7e3a1663566d410be152170	2024-07-10T15:23:29+03:00	Georgi Gerganov	ggml : move sgemm sources to llamafile subfolder (#8394)
M	Makefile
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml.c
R100	ggml/src/sgemm.cpp	ggml/src/llamafile/sgemm.cpp
R100	ggml/src/sgemm.h	ggml/src/llamafile/sgemm.h

commit	0f1a39f3439825acf7e3a1663566d410be152170	83321c6958acf20747d288031174cc1bf8816e33	2024-07-10T07:14:51-05:00	Dibakar Gope	ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
M	Makefile
M	Package.swift
M	docs/build.md
M	examples/quantize/quantize.cpp
M	ggml/include/ggml.h
M	ggml/src/CMakeLists.txt
A	ggml/src/ggml-aarch64.c
A	ggml/src/ggml-aarch64.h
M	ggml/src/ggml-common.h
M	ggml/src/ggml-impl.h
M	ggml/src/ggml-quants.c
M	ggml/src/ggml.c
M	include/llama.h
M	src/llama.cpp

commit	83321c6958acf20747d288031174cc1bf8816e33	cc61948b1f97165b46990f4c2d9699bf9bb64443	2024-07-10T15:12:35+03:00	M. Yusuf Sarıgöz	gguf-py rel pipeline (#8410)
M	gguf-py/README.md
M	gguf-py/pyproject.toml

commit	cc61948b1f97165b46990f4c2d9699bf9bb64443	7a80710d93ee0f4e0d335d65984ae747e62c0337	2024-07-10T14:45:44+03:00	Borislav Stanimirov	llama : C++20 compatibility for u8 strings (#8408)
M	src/llama.cpp

commit	7a80710d93ee0f4e0d335d65984ae747e62c0337	a8be1e6f5995bec3b1d8474d48ce3a139553a8e1	2024-07-10T14:40:53+03:00	Borislav Stanimirov	msvc : silence codecvt c++17 deprecation warnings (#8395)
M	common/common.cpp
M	src/unicode.cpp

commit	a8be1e6f5995bec3b1d8474d48ce3a139553a8e1	e4dd31ff892627665d3c53c5d1a03c0d282d9d45	2024-07-10T13:38:58+02:00	fairydreaming	llama : add assert about missing llama_encode() call (#8400)
M	src/llama.cpp

commit	e4dd31ff892627665d3c53c5d1a03c0d282d9d45	8f0fad42b9589f9b11362c74ea5338c51e4c7e61	2024-07-10T19:26:40+08:00	RunningLeon	py : fix converter for internlm2 (#8321)
M	convert_hf_to_gguf.py

commit	8f0fad42b9589f9b11362c74ea5338c51e4c7e61	a59f8fdc85e1119d470d8766e29617962549d993	2024-07-10T19:19:10+08:00	laik	py : fix extra space in convert_hf_to_gguf.py (#8407)
M	convert_hf_to_gguf.py

commit	a59f8fdc85e1119d470d8766e29617962549d993	fd560fe680c72fd0a0af2bc8881add20ad919071	2024-07-09T18:26:40-04:00	Clint Herron	Server: Enable setting default sampling parameters via command-line (#8402)
M	examples/server/server.cpp

commit	fd560fe680c72fd0a0af2bc8881add20ad919071	e500d6135ac42c4a23baf6a9a1a934dc023e5c7d	2024-07-09T11:58:44-07:00	Andy Salerno	Update README.md to fix broken link to docs (#8399)
M	README.md

commit	e500d6135ac42c4a23baf6a9a1a934dc023e5c7d	a03e8dd99d3954e7547137936c5a2a3b348bdb7f	2024-07-09T11:54:43-04:00	Clint Herron	Deprecation warning to assist with migration to new binary names (#8283)
M	Makefile
A	examples/deprecation-warning/README.md
A	examples/deprecation-warning/deprecation-warning.cpp

commit	a03e8dd99d3954e7547137936c5a2a3b348bdb7f	5b0b8d8cfb5ddf2118f686ba6c30fab3f71b384b	2024-07-09T17:11:07+02:00	Johannes Gäßler	make/cmake: LLAMA_NO_CCACHE -> GGML_NO_CCACHE (#8392)
M	CMakeLists.txt
M	Makefile

commit	5b0b8d8cfb5ddf2118f686ba6c30fab3f71b384b	9925ca4087a34ab973b07bf06c0b770cb586830b	2024-07-09T15:03:15+01:00	Alberto Cabrera Pérez	sycl : Reenabled mmvq path for the SYCL Nvidia Backend (#8372)
M	ggml/src/ggml-sycl.cpp

commit	9925ca4087a34ab973b07bf06c0b770cb586830b	9beb2dda038e2107a39a95def94a4cf971e048ea	2024-07-09T11:38:00+03:00	Borislav Stanimirov	cmake : allow external ggml (#8370)
M	CMakeLists.txt

commit	9beb2dda038e2107a39a95def94a4cf971e048ea	7d0e23d72ef4540d0d4409cb63ae682c17d53926	2024-07-09T09:16:00+03:00	daghanerdonmez	readme : fix typo [no ci] (#8389)
M	grammars/README.md

commit	7d0e23d72ef4540d0d4409cb63ae682c17d53926	7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2	2024-07-09T01:04:49-04:00	compilade	gguf-py : do not use internal numpy types (#7472)
M	gguf-py/gguf/lazy.py

commit	7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2	a130eccef42b75a84da270411cefeed45c153e30	2024-07-09T01:36:38+03:00	Georgi Gerganov	flake.lock: Update (#8342)
M	flake.lock

commit	a130eccef42b75a84da270411cefeed45c153e30	c4dd11d1d3903e1922c06242e189f6310fc4d8c3	2024-07-08T21:35:17+01:00	Alberto Cabrera Pérez	labeler : updated sycl to match docs and code refactor (#8373)
M	.github/labeler.yml

commit	c4dd11d1d3903e1922c06242e189f6310fc4d8c3	2ec846d558f6385ea647f7b8e665eb249c1ebce7	2024-07-08T22:19:24+08:00	b4b4o	readme : fix web link error [no ci] (#8347)
M	README.md

commit	2ec846d558f6385ea647f7b8e665eb249c1ebce7	3f2d538b817112ad8429341c7e8657dcd660f4d3	2024-07-08T14:22:41+01:00	Alberto Cabrera Pérez	sycl : fix powf call in device code (#8368)
M	ggml/src/ggml-sycl/rope.cpp

commit	3f2d538b817112ad8429341c7e8657dcd660f4d3	2ee44c9a1865a928ccbbc16a2d7841d7513f31c1	2024-07-08T13:51:31+03:00	Georgi Gerganov	scripts : fix sync for sycl
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	2ee44c9a1865a928ccbbc16a2d7841d7513f31c1	6847d54c4f72f8bf6767b6feae7a95394654335e	2024-07-08T10:39:50+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	6847d54c4f72f8bf6767b6feae7a95394654335e	fde13b3bb9f569f07fd8af74696ee48a43d05131	2024-07-08T10:39:36+03:00	Georgi Gerganov	tests : fix whitespace (#0)
M	tests/test-backend-ops.cpp

commit	fde13b3bb9f569f07fd8af74696ee48a43d05131	470939d483d1c89b7292f78bac1fd27c42c171ce	2024-07-02T11:09:52-05:00	John Balis	feat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854)
M	ggml/src/ggml-cuda.cu
A	ggml/src/ggml-cuda/conv-transpose-1d.cu
A	ggml/src/ggml-cuda/conv-transpose-1d.cuh
M	tests/test-backend-ops.cpp

commit	470939d483d1c89b7292f78bac1fd27c42c171ce	6f0dbf6ab087bcd286fb78560099ca0458316735	2024-07-08T03:26:53-04:00	Kevin Wang	common : preallocate sampling token data vector (#8363)
M	common/sampling.cpp

commit	6f0dbf6ab087bcd286fb78560099ca0458316735	ffd00797d81ef7db1528b9e10adbdc333ade6495	2024-07-08T09:34:35+03:00	Georgi Gerganov	infill : assert prefix/suffix tokens + remove old space logic (#8351)
M	common/log.h
M	examples/infill/infill.cpp

commit	ffd00797d81ef7db1528b9e10adbdc333ade6495	04ce3a8b19256a155aea4d14eaa87edf274c93c3	2024-07-08T02:31:55-04:00	Kevin Wang	common : avoid unnecessary logits fetch (#8358)
M	common/sampling.cpp

commit	04ce3a8b19256a155aea4d14eaa87edf274c93c3	3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d	2024-07-08T13:57:19+08:00	toyer	readme : add supported glm models (#8360)
M	README.md

commit	3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d	a8db2a9ce64cd4417f6a312ab61858f17f0f8584	2024-07-07T15:04:39-04:00	compilade	py : type-check all Python scripts with Pyright (#8341)
M	.devops/nix/package.nix
A	.github/workflows/python-type-check.yml
M	convert_hf_to_gguf.py
M	convert_llama_ggml_to_gguf.py
M	examples/convert_legacy_llama.py
M	examples/finetune/convert_finetune_checkpoint_to_gguf.py
M	examples/json_schema_pydantic_example.py
M	examples/json_schema_to_grammar.py
M	examples/llava/convert_image_encoder_to_gguf.py
M	examples/llava/llava_surgery_v2.py
M	examples/pydantic_models_to_grammar.py
M	examples/pydantic_models_to_grammar_examples.py
M	examples/server/bench/bench.py
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt
M	examples/server_embd.py
M	examples/train-text-from-scratch/convert_train_checkpoint_to_gguf.py
M	ggml/ggml_vk_generate_shaders.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/lazy.py
M	gguf-py/scripts/__init__.py
M	gguf-py/scripts/gguf_hash.py
M	gguf-py/scripts/gguf_new_metadata.py
M	gguf-py/tests/test_gguf.py
M	pyrightconfig.json
A	requirements/requirements-all.txt
A	requirements/requirements-compare-llama-bench.txt
A	requirements/requirements-pydantic.txt
A	requirements/requirements-test-tokenizer-random.txt
M	scripts/check-requirements.sh
M	scripts/compare-llama-bench.py
M	scripts/gen-unicode-data.py
M	tests/test-tokenizer-random.py

commit	a8db2a9ce64cd4417f6a312ab61858f17f0f8584	4090ea5501c702cd858095c394ba068919c56cc8	2024-07-07T09:08:28-06:00	Denis Spasyuk	Update llama-cli documentation (#8315)
M	examples/main/README.md

commit	4090ea5501c702cd858095c394ba068919c56cc8	f1948f1e108157d5e7eb60fc8f24a10412e5d4ff	2024-07-07T15:59:14+01:00	Alex Tuddenham	ci : add checks for cmake,make and ctest in ci/run.sh (#8200)
M	ci/run.sh

commit	f1948f1e108157d5e7eb60fc8f24a10412e5d4ff	f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c	2024-07-07T06:21:37-07:00	Andy Tai	readme : update bindings list (#8222)
M	README.md

commit	f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c	905942abdba5ba0b28a1b0805e51e4f818c54bc9	2024-07-07T22:58:43+10:00	Brian	gguf-hash: model wide and per tensor hashing using xxhash and sha1 (#8048)
M	Makefile
M	examples/CMakeLists.txt
A	examples/gguf-hash/CMakeLists.txt
A	examples/gguf-hash/README.md
A	examples/gguf-hash/deps/rotate-bits/package.json
A	examples/gguf-hash/deps/rotate-bits/rotate-bits.h
A	examples/gguf-hash/deps/sha1/package.json
A	examples/gguf-hash/deps/sha1/sha1.c
A	examples/gguf-hash/deps/sha1/sha1.h
A	examples/gguf-hash/deps/sha256/package.json
A	examples/gguf-hash/deps/sha256/sha256.c
A	examples/gguf-hash/deps/sha256/sha256.h
A	examples/gguf-hash/deps/xxhash/clib.json
A	examples/gguf-hash/deps/xxhash/xxhash.c
A	examples/gguf-hash/deps/xxhash/xxhash.h
A	examples/gguf-hash/gguf-hash.cpp
A	gguf-py/scripts/gguf_hash.py

commit	905942abdba5ba0b28a1b0805e51e4f818c54bc9	b5040086d436e7345e4fa33a5b9558060c75603f	2024-07-07T20:52:10+08:00	toyer	llama : support glm3 and glm4 (#8031)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	b5040086d436e7345e4fa33a5b9558060c75603f	d39130a3985ce0747d7229a6b7ebebb6376b5abf	2024-07-07T14:59:02+03:00	Georgi Gerganov	llama : fix n_rot default (#8348)
M	src/llama.cpp

commit	d39130a3985ce0747d7229a6b7ebebb6376b5abf	b81ba1f96b06c691020429a2d2dfcbada899ca86	2024-07-07T07:23:38-04:00	compilade	py : use cpu-only torch in requirements.txt (#8335)
M	examples/llava/requirements.txt
M	requirements/requirements-convert_hf_to_gguf.txt
M	requirements/requirements-convert_hf_to_gguf_update.txt

commit	b81ba1f96b06c691020429a2d2dfcbada899ca86	210eb9ed0ac3979a93e37568d96447ec3e95ad05	2024-07-07T19:38:02+09:00	standby24x7	finetune: Rename command name in README.md (#8343)
M	examples/finetune/README.md

commit	210eb9ed0ac3979a93e37568d96447ec3e95ad05	cb4d86c4d723af87d3d7e3177e9485f200391384	2024-07-07T19:37:47+09:00	standby24x7	finetune: Rename an old command name in finetune.sh (#8344)
M	examples/finetune/finetune.sh

commit	cb4d86c4d723af87d3d7e3177e9485f200391384	86e7299ef5dff0f388922dc6fcbce009e99d8005	2024-07-07T11:10:38+02:00	Bjarke Viksøe	server: Retrieve prompt template in /props (#8337)
M	examples/server/README.md
M	examples/server/server.cpp

commit	86e7299ef5dff0f388922dc6fcbce009e99d8005	60d83a0149849e9217e4b8ae26e277a41aea906e	2024-07-06T15:32:04-05:00	Derrick T. Woolworth	added support for Authorization Bearer tokens when downloading model (#8307)
M	common/common.cpp
M	common/common.h

commit	60d83a0149849e9217e4b8ae26e277a41aea906e	87e25a1d1bd26eb06d1cab9e2ee4e14a7a0be33c	2024-07-06T19:01:23+02:00	Xuan Son Nguyen	update main readme (#8333)
M	README.md
M	docs/build.md

commit	87e25a1d1bd26eb06d1cab9e2ee4e14a7a0be33c	213701b51a17175d0d326b566efc03f30ec7fbe6	2024-07-06T09:22:16+02:00	Daniel Bevenius	llama : add early return for empty range (#8327)
M	src/llama.cpp

commit	213701b51a17175d0d326b566efc03f30ec7fbe6	be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d	2024-07-05T19:01:35+02:00	jaime-m-p	Detokenizer fixes (#8039)
M	common/common.cpp
M	common/common.h
M	examples/batched.swift/Sources/main.swift
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	include/llama.h
M	src/llama.cpp
M	src/unicode.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-spm.cpp
M	tests/test-tokenizer-random.py

commit	be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d	7ed03b8974269b6c48e55c4245d12fb3264a6cf5	2024-07-05T18:08:32+02:00	Xuan Son Nguyen	Reorganize documentation pages (#8325)
M	.gitignore
M	README.md
A	docs/android.md
R100	docs/BLIS.md	docs/backend/BLIS.md
R100	README-sycl.md	docs/backend/SYCL.md
A	docs/build.md
R099	docs/HOWTO-add-model.md	docs/development/HOWTO-add-model.md
R100	docs/debugging-tests.md	docs/development/debugging-tests.md
R100	docs/llama-star/idea-arch.key	docs/development/llama-star/idea-arch.key
R100	docs/llama-star/idea-arch.pdf	docs/development/llama-star/idea-arch.pdf
R100	docs/token_generation_performance_tips.md	docs/development/token_generation_performance_tips.md
A	docs/docker.md
A	docs/install.md
M	examples/quantize/README.md

commit	7ed03b8974269b6c48e55c4245d12fb3264a6cf5	1d894a790e62b10d066adcdd9c9feb559455b7d2	2024-07-05T17:32:09+03:00	Georgi Gerganov	llama : fix compile warning (#8304)
M	src/llama.cpp

commit	1d894a790e62b10d066adcdd9c9feb559455b7d2	1f3e1b66e21310ed78b964f72f19766549633f0e	2024-07-05T22:29:35+08:00	Natsu	cmake : add GGML_BUILD and GGML_SHARED macro definitions (#8281)
M	ggml/src/CMakeLists.txt

commit	1f3e1b66e21310ed78b964f72f19766549633f0e	148ec970b62c3c5ae0a8bfdaad2fc237aaae350d	2024-07-05T13:23:25+01:00	Ouadie EL FAROUKI	Enabled more data types for oneMKL gemm_batch (#8236)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/dpct/helper.hpp

commit	148ec970b62c3c5ae0a8bfdaad2fc237aaae350d	2cccbaa0086c62801f95405131a5b2faf3ba1de8	2024-07-05T10:15:36+03:00	Georgi Gerganov	convert : remove AWQ remnants (#8320)
M	convert_hf_to_gguf.py

commit	2cccbaa0086c62801f95405131a5b2faf3ba1de8	8e558309dc149dc1f9fd159185b0b9071527ffb5	2024-07-05T10:15:24+03:00	Georgi Gerganov	llama : minor indentation during tensor loading (#8304)
M	src/llama.cpp

commit	8e558309dc149dc1f9fd159185b0b9071527ffb5	0a423800ffe4e5da3d83527ef3473da88cd78146	2024-07-05T09:06:31+02:00	Johannes Gäßler	CUDA: MMQ support for iq4_nl, iq4_xs (#8278)
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/mmq.cu
M	ggml/src/ggml-cuda/mmq.cuh
M	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq4_nl.cu
A	ggml/src/ggml-cuda/template-instances/mmq-instance-iq4_xs.cu
M	ggml/src/ggml-cuda/vecdotq.cuh

commit	0a423800ffe4e5da3d83527ef3473da88cd78146	d12f781074b92589a72a36ffabb583933f7b9dc0	2024-07-05T07:06:09Z	Daniele	CUDA: revert part of the RDNA1 optimizations (#8309)
M	ggml/src/ggml-cuda/mmq.cuh

commit	d12f781074b92589a72a36ffabb583933f7b9dc0	bcefa03bc01a41aace2e200ee8e77827d6d39b4f	2024-07-05T02:05:56-05:00	Douglas Hanley	llama : streamline embeddings from "non-embedding" models (#8087)
M	common/common.cpp
M	common/common.h
M	include/llama.h
M	src/llama.cpp

commit	bcefa03bc01a41aace2e200ee8e77827d6d39b4f	5a7447c5692c9e3dde1161e8e69edb76d3d34714	2024-07-05T09:05:34+02:00	Johannes Gäßler	CUDA: fix MMQ stream-k rounding if ne00 % 128 != 0 (#8311)
M	ggml/src/ggml-cuda/mmq.cuh

commit	5a7447c5692c9e3dde1161e8e69edb76d3d34714	61ecafa3905a02a299b7ae889b5578cfeb8d79df	2024-07-05T02:58:41-04:00	Pieter Ouwerkerk	readme : fix minor typos [no ci] (#8314)
M	examples/server/README.md

commit	61ecafa3905a02a299b7ae889b5578cfeb8d79df	aa5898dc53afcf77f16222cd719e10b29049f95a	2024-07-05T08:14:24+02:00	Daniel Bevenius	passkey : add short intro to README.md [no-ci] (#8317)
M	examples/passkey/README.md

commit	aa5898dc53afcf77f16222cd719e10b29049f95a	6c05752c507f51b88348f16d9e2c8df49f66c028	2024-07-05T09:10:03+03:00	Georgi Gerganov	llama : prefer n_ over num_ prefix (#8308)
M	src/llama.cpp

commit	6c05752c507f51b88348f16d9e2c8df49f66c028	a9554e20b66546b0549aebe2e1034bc8afe9d809	2024-07-05T09:09:47+03:00	Georgi Gerganov	contributing : update guidelines (#8316)
M	CONTRIBUTING.md
M	README.md

commit	a9554e20b66546b0549aebe2e1034bc8afe9d809	e235b267a2539d043734ff340eff74107722eb57	2024-07-05T05:06:13Z	luoyu-intel	[SYCL] Fix WARP_SIZE=16 bug of Intel GPU (#8266)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/norm.cpp
M	ggml/src/ggml-sycl/presets.hpp
A	ggml/src/ggml-sycl/softmax.cpp
A	ggml/src/ggml-sycl/softmax.hpp

commit	e235b267a2539d043734ff340eff74107722eb57	f09b7cb609d80b8031803f89255991dc8b35db69	2024-07-05T07:53:33+03:00	Georgi Gerganov	py : switch to snake_case (#8305)
M	README.md
M	ci/run.sh
M	convert_hf_to_gguf.py
M	convert_hf_to_gguf_update.py
M	docs/HOWTO-add-model.md
R100	examples/convert-legacy-llama.py	examples/convert_legacy_llama.py
R100	examples/finetune/convert-finetune-checkpoint-to-gguf.py	examples/finetune/convert_finetune_checkpoint_to_gguf.py
R098	examples/json-schema-pydantic-example.py	examples/json_schema_pydantic_example.py
M	examples/llava/MobileVLM-README.md
M	examples/llava/README.md
R100	examples/llava/convert-image-encoder-to-gguf.py	examples/llava/convert_image_encoder_to_gguf.py
R100	examples/llava/llava-surgery.py	examples/llava/llava_surgery.py
R100	examples/llava/llava-surgery-v2.py	examples/llava/llava_surgery_v2.py
M	examples/llava/requirements.txt
R100	examples/pydantic-models-to-grammar-examples.py	examples/pydantic_models_to_grammar_examples.py
R100	examples/regex-to-grammar.py	examples/regex_to_grammar.py
R100	examples/server-embd.py	examples/server_embd.py
R100	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py	examples/train-text-from-scratch/convert_train_checkpoint_to_gguf.py
M	gguf-py/README.md
M	gguf-py/scripts/__init__.py
R100	gguf-py/scripts/gguf-convert-endian.py	gguf-py/scripts/gguf_convert_endian.py
R100	gguf-py/scripts/gguf-dump.py	gguf-py/scripts/gguf_dump.py
R100	gguf-py/scripts/gguf-new-metadata.py	gguf-py/scripts/gguf_new_metadata.py
R100	gguf-py/scripts/gguf-set-metadata.py	gguf-py/scripts/gguf_set_metadata.py
M	requirements.txt
M	requirements/requirements-convert_hf_to_gguf.txt
M	requirements/requirements-convert_hf_to_gguf_update.txt
R100	requirements/requirements-convert-legacy-llama.txt	requirements/requirements-convert_legacy_llama.txt
M	requirements/requirements-convert_llama_ggml_to_gguf.txt
M	scripts/check-requirements.sh
D	scripts/convert-gg.sh
M	scripts/pod-llama.sh

commit	f09b7cb609d80b8031803f89255991dc8b35db69	a38b884c6c4b0c256583acfaaabdf556c62fabea	2024-07-05T10:32:29+08:00	Neo Zhang Jianyu	rm get_work_group_size() by local cache for performance (#8286)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/norm.cpp

commit	a38b884c6c4b0c256583acfaaabdf556c62fabea	d7fd29fff16456ce9c3a23fd2d09a66256b05aff	2024-07-04T20:55:03+02:00	Xuan Son Nguyen	cli: add EOT when user hit Ctrl+C (#8296)
M	common/common.cpp
M	examples/main/main.cpp

commit	d7fd29fff16456ce9c3a23fd2d09a66256b05aff	6f63d646c1a06a6e09f721009a2676864ae04e31	2024-07-05T05:14:21+12:00	Icecream95	llama : add OpenELM support (#7359)
M	convert_hf_to_gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	6f63d646c1a06a6e09f721009a2676864ae04e31	51d2ebadbbf365b894f3888361df42dbacb12b7a	2024-07-04T18:38:58+02:00	Daniel Bevenius	tokenize : add --show-count (token) option (#8299)
M	examples/tokenize/tokenize.cpp

commit	51d2ebadbbf365b894f3888361df42dbacb12b7a	1e920018d38aee270a044cc48eaefe7c64cb8750	2024-07-04T20:54:35+05:30	ditsuke	build: Export hf-to-gguf as snakecase
M	CMakeLists.txt

commit	1e920018d38aee270a044cc48eaefe7c64cb8750	01a5f06550a866bd63717635e5e7e1ff4203b873	2024-07-03T01:02:56+05:30	ditsuke	doc: Add context for why we add an explicit pytorch source
M	pyproject.toml

commit	01a5f06550a866bd63717635e5e7e1ff4203b873	07786a61a2097306ee496f565f78796f1aa205e6	2024-07-02T15:48:13+05:30	ditsuke	chore: Remove rebase artifacts
M	convert_hf_to_gguf_update.py
D	convert_lora_to_ggml.py
D	convert_persimmon_to_gguf.py
M	pyproject.toml
M	requirements.txt
D	requirements/requirements-convert_lora_to_ggml.txt
D	requirements/requirements-convert_persimmon_to_gguf.txt

commit	07786a61a2097306ee496f565f78796f1aa205e6	de14e2ea2b542386dcb800226eb360be76f433fd	2024-07-02T15:35:43+05:30	ditsuke	chore: Fixup requirements and build
M	CMakeLists.txt
M	examples/llava/requirements.txt
M	pyproject.toml
M	requirements.txt
M	requirements/requirements-convert_lora_to_ggml.txt
M	requirements/requirements-convert_persimmon_to_gguf.txt

commit	de14e2ea2b542386dcb800226eb360be76f433fd	821922916f95cc3853fc7f58ea2f1e15a0ffa669	2024-07-02T15:18:13+05:30	ditsuke	chore: ignore all __pychache__
M	.gitignore

commit	821922916f95cc3853fc7f58ea2f1e15a0ffa669	b1c3f26e5e882fa46d7a6704d893b31a025e9000	2024-03-10T23:21:46+05:30	ditsuke	fix: Update script paths in CI scripts
M	ci/run.sh
M	requirements.txt
R100	requirements/requirements-convert-hf-to-gguf-update.txt	requirements/requirements-convert_hf_to_gguf.txt
R100	requirements/requirements-convert-hf-to-gguf.txt	requirements/requirements-convert_hf_to_gguf_update.txt
R100	requirements/requirements-convert-llama-ggml-to-gguf.txt	requirements/requirements-convert_llama_ggml_to_gguf.txt
A	requirements/requirements-convert_lora_to_ggml.txt
A	requirements/requirements-convert_persimmon_to_gguf.txt
M	scripts/check-requirements.sh

commit	b1c3f26e5e882fa46d7a6704d893b31a025e9000	b0a46993dfbf8b8127598f319d4dcfdd83824ba8	2024-02-29T01:47:15+05:30	ditsuke	fix: Actually include scripts in build
D	__init__.py
M	pyproject.toml

commit	b0a46993dfbf8b8127598f319d4dcfdd83824ba8	807b0c49ff7071094f97ebc3a0a8e2b9e274f503	2024-02-27T12:01:02+05:30	ditsuke	build(python): Package scripts with pip-0517 compliance
M	.gitignore
A	__init__.py
R100	convert-hf-to-gguf.py	convert_hf_to_gguf.py
R094	convert-hf-to-gguf-update.py	convert_hf_to_gguf_update.py
R100	convert-llama-ggml-to-gguf.py	convert_llama_ggml_to_gguf.py
A	convert_lora_to_ggml.py
A	convert_persimmon_to_gguf.py
A	poetry.lock
A	pyproject.toml

commit	807b0c49ff7071094f97ebc3a0a8e2b9e274f503	f8c4c0738d72d2162736edd72dd5db8b269adca1	2024-07-04T15:46:11+02:00	fairydreaming	Inference support for T5 and FLAN-T5 model families (#5763)
M	common/common.cpp
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	examples/batched/batched.cpp
M	examples/main/main.cpp
M	include/llama.h
M	models/ggml-vocab-bert-bge.gguf.inp
M	models/ggml-vocab-bert-bge.gguf.out
M	models/ggml-vocab-command-r.gguf.inp
M	models/ggml-vocab-command-r.gguf.out
M	models/ggml-vocab-deepseek-coder.gguf.inp
M	models/ggml-vocab-deepseek-coder.gguf.out
M	models/ggml-vocab-deepseek-llm.gguf.inp
M	models/ggml-vocab-deepseek-llm.gguf.out
M	models/ggml-vocab-falcon.gguf.inp
M	models/ggml-vocab-falcon.gguf.out
M	models/ggml-vocab-gpt-2.gguf.inp
M	models/ggml-vocab-gpt-2.gguf.out
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	models/ggml-vocab-llama-spm.gguf.inp
M	models/ggml-vocab-llama-spm.gguf.out
M	models/ggml-vocab-mpt.gguf.inp
M	models/ggml-vocab-mpt.gguf.out
M	models/ggml-vocab-phi-3.gguf.inp
M	models/ggml-vocab-phi-3.gguf.out
M	models/ggml-vocab-qwen2.gguf.inp
M	models/ggml-vocab-qwen2.gguf.out
M	models/ggml-vocab-refact.gguf.inp
M	models/ggml-vocab-refact.gguf.out
M	models/ggml-vocab-starcoder.gguf.inp
M	models/ggml-vocab-starcoder.gguf.out
M	src/llama.cpp

commit	f8c4c0738d72d2162736edd72dd5db8b269adca1	402d6feffa0572d1c7a957901b6d1702bd188484	2024-07-04T12:53:42+02:00	Daniel Bevenius	tests : add _CRT_SECURE_NO_WARNINGS for WIN32 (#8231)
M	CMakeLists.txt
M	src/CMakeLists.txt

commit	402d6feffa0572d1c7a957901b6d1702bd188484	20fc3804bfb727074bc270b6eacb60af8d0bf7d4	2024-07-04T12:50:57+02:00	Daniel Bevenius	llama : suppress unref var in Windows MSVC (#8150)
M	src/llama.cpp

commit	20fc3804bfb727074bc270b6eacb60af8d0bf7d4	f619024764e72261f14d7c31d892b8fb976603b4	2024-07-04T10:41:03+03:00	Georgi Gerganov	convert : fix gemma v1 tokenizer convert (#8248)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	models/ggml-vocab-bert-bge.gguf.inp
M	models/ggml-vocab-bert-bge.gguf.out
M	models/ggml-vocab-command-r.gguf.inp
M	models/ggml-vocab-command-r.gguf.out
M	models/ggml-vocab-deepseek-coder.gguf.inp
M	models/ggml-vocab-deepseek-coder.gguf.out
M	models/ggml-vocab-deepseek-llm.gguf.inp
M	models/ggml-vocab-deepseek-llm.gguf.out
M	models/ggml-vocab-falcon.gguf.inp
M	models/ggml-vocab-falcon.gguf.out
M	models/ggml-vocab-gpt-2.gguf.inp
M	models/ggml-vocab-gpt-2.gguf.out
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	models/ggml-vocab-llama-spm.gguf.inp
M	models/ggml-vocab-llama-spm.gguf.out
M	models/ggml-vocab-mpt.gguf.inp
M	models/ggml-vocab-mpt.gguf.out
M	models/ggml-vocab-phi-3.gguf.inp
M	models/ggml-vocab-phi-3.gguf.out
M	models/ggml-vocab-qwen2.gguf.inp
M	models/ggml-vocab-qwen2.gguf.out
M	models/ggml-vocab-refact.gguf.inp
M	models/ggml-vocab-refact.gguf.out
M	models/ggml-vocab-starcoder.gguf.inp
M	models/ggml-vocab-starcoder.gguf.out

commit	f619024764e72261f14d7c31d892b8fb976603b4	d23287f122c34ebef368742116d53a0ccb2041ee	2024-07-04T02:07:19+01:00	AidanBeltonS	[SYCL] Remove unneeded semicolons (#8280)
M	ggml/src/ggml-sycl/dpct/helper.hpp

commit	d23287f122c34ebef368742116d53a0ccb2041ee	5f2d4e60e202aabee10051e6615bb821e51787be	2024-07-03T23:02:58Z	Daniele	Define and optimize  RDNA1 (#8085)
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/mmq.cuh

commit	5f2d4e60e202aabee10051e6615bb821e51787be	916248af1f3c16abd7408de848e025da095c621c	2024-07-03T19:33:31+02:00	slaren	ppl : fix n_seq_max for perplexity (#8277)
M	examples/perplexity/perplexity.cpp

commit	916248af1f3c16abd7408de848e025da095c621c	f8d6a23804f3798ff2869da68c1223b618df09ec	2024-07-03T16:01:54+02:00	Xuan Son Nguyen	fix phi 3 conversion (#8262)
M	convert-hf-to-gguf.py

commit	f8d6a23804f3798ff2869da68c1223b618df09ec	fadde6713506d9e6c124f5680ab8c7abebe31837	2024-07-03T20:40:16+08:00	Judd	fix typo (#8267)
M	ggml/src/ggml.c

commit	fadde6713506d9e6c124f5680ab8c7abebe31837	a27152b602b369e76f85b7cb7b872a321b7218f7	2024-07-03T02:55:34+01:00	AidanBeltonS	Dequant improvements rebase (#8255)
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/convert.cpp
M	ggml/src/ggml-sycl/dequantize.hpp

commit	a27152b602b369e76f85b7cb7b872a321b7218f7	3e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e	2024-07-02T22:56:46+02:00	MistApproach	fix: add missing short command line argument -mli for multiline-input (#8261)
M	common/common.cpp

commit	3e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e	07a3fc0608a68c0c93a5fbfa9c58f4c9ec64cb81	2024-07-02T13:19:56-04:00	Clint Herron	Adding step to `clean` target to remove legacy binary names to reduce upgrade / migration confusion arising from #7809. (#8257)
M	Makefile

commit	07a3fc0608a68c0c93a5fbfa9c58f4c9ec64cb81	968967376dc2c018d29f897c4883d335bbf384fb	2024-07-02T12:18:10-04:00	Clint Herron	Removes multiple newlines at the end of files that is breaking the editorconfig step of CI. (#8258)
M	.github/ISSUE_TEMPLATE/config.yml
M	common/common.h
M	examples/embedding/README.md
M	examples/infill/infill.cpp
M	examples/lookup/README.md
M	examples/main-cmake-pkg/.gitignore
M	examples/main-cmake-pkg/CMakeLists.txt
M	examples/server-embd.py
M	examples/server/tests/features/passkey.feature
M	examples/server/themes/buttons-top/index.html
M	examples/server/themes/wild/index.html
M	examples/sycl/run-llama2.sh
M	examples/sycl/win-build-sycl.bat
M	examples/sycl/win-run-llama2.bat
M	ggml/include/ggml-metal.h
M	ggml/src/ggml-cuda/cpy.cu
M	ggml/src/ggml-metal.metal
M	ggml/src/ggml-quants.h
M	ggml/src/ggml-vulkan-shaders.hpp
M	scripts/pod-llama.sh
M	src/unicode-data.cpp
M	tests/test-rope.cpp

commit	968967376dc2c018d29f897c4883d335bbf384fb	023b8807e10bc3ade24a255f01c1ad2a01bb4228	2024-07-02T10:36:00-04:00	Faisal Zaghloul	Add `JAIS` model(s) (#8118)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	include/llama.h
M	src/llama.cpp

commit	023b8807e10bc3ade24a255f01c1ad2a01bb4228	0e0590adab9f367b15ae2bf090a6d24f9df47ff1	2024-07-02T08:40:49+02:00	Daniel Bevenius	convert-hf : print output file name when completed (#8181)
M	convert-hf-to-gguf.py

commit	0e0590adab9f367b15ae2bf090a6d24f9df47ff1	a9f3b102157ba992cfe058909b7f6e1906d2d647	2024-07-02T08:39:38+02:00	slaren	cuda : update supports_op for matrix multiplication (#8245)
M	ggml/src/ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	a9f3b102157ba992cfe058909b7f6e1906d2d647	d08c20eddedb24515a3212e2de66bdff41a26b8c	2024-07-02T04:50:07Z	luoyu-intel	[SYCL] Fix win build conflict of math library (#8230)
M	CMakePresets.json
M	ggml/src/CMakeLists.txt

commit	d08c20eddedb24515a3212e2de66bdff41a26b8c	5fac350b9cc49d0446fc291b9c4ad53666c77591	2024-07-02T02:16:00Z	luoyu-intel	[SYCL] Fix the sub group size of Intel (#8106)
M	ggml/src/CMakeLists.txt
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
M	ggml/src/ggml-sycl/common.hpp
M	ggml/src/ggml-sycl/dmmv.cpp
M	ggml/src/ggml-sycl/mmvq.cpp
A	ggml/src/ggml-sycl/norm.cpp
A	ggml/src/ggml-sycl/norm.hpp
M	ggml/src/ggml-sycl/presets.hpp

commit	5fac350b9cc49d0446fc291b9c4ad53666c77591	cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846	2024-07-02T01:07:23+02:00	Xuan Son Nguyen	Fix gemma2 tokenizer convert (#8244)
M	convert-hf-to-gguf.py

commit	cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846	dae57a1ebc1c9bd5693ab999e19d77c5506ae559	2024-07-01T20:39:06+02:00	Johannes Gäßler	CUDA: refactor and optimize IQ MMVQ (#8215)
M	ggml/src/ggml-common.h
M	ggml/src/ggml-cuda.cu
M	ggml/src/ggml-cuda/common.cuh
M	ggml/src/ggml-cuda/fattn-common.cuh
M	ggml/src/ggml-cuda/mmvq.cu
M	ggml/src/ggml-cuda/vecdotq.cuh
M	ggml/src/ggml-sycl/mmvq.cpp
M	ggml/src/ggml-sycl/vecdotq.hpp

commit	dae57a1ebc1c9bd5693ab999e19d77c5506ae559	49122a873f54615626d1b49a2a39013ed4be98d5	2024-07-01T19:13:22+02:00	Mateusz Charytoniuk	readme: add Paddler to the list of projects (#8239)
M	README.md

commit	49122a873f54615626d1b49a2a39013ed4be98d5	0ddeff10230b88f1fa9866bbe5fe0d71ba2323a0	2024-07-01T18:48:34+02:00	Xuan Son Nguyen	gemma2: add sliding window mask (#8227)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama.cpp

commit	0ddeff10230b88f1fa9866bbe5fe0d71ba2323a0	3840b6f593751a0ba636bfda73b630cd6c29d7b5	2024-07-01T14:48:16+02:00	Roni	readme : update tool list (#8209)
M	README.md

commit	3840b6f593751a0ba636bfda73b630cd6c29d7b5	257f8e41e24b5bbfc27d9e907189a3e0cdb650d4	2024-07-01T07:47:04-04:00	Michael Francis	nix : enable curl (#8043)
M	.devops/nix/package.nix

commit	257f8e41e24b5bbfc27d9e907189a3e0cdb650d4	694c59cb42d1ebd6a7d912ca65d3d7363e0f14c9	2024-07-01T14:46:18+03:00	Georgi Gerganov	nix : remove OpenCL remnants (#8235)
M	.devops/nix/package.nix

commit	694c59cb42d1ebd6a7d912ca65d3d7363e0f14c9	197fe6c1d7bec6718ce901f0141b2725240f298c	2024-07-01T11:40:58Z	iacore	Document BERT support. (#8205)
M	README.md

commit	197fe6c1d7bec6718ce901f0141b2725240f298c	d0a7145ba99ed3a8bc3145aa785b5c86ffe65020	2024-07-01T19:39:06+08:00	zhentaoyu	[SYCL] Update SYCL-Rope op and Refactor (#8157)
M	ggml/src/ggml-sycl.cpp
M	ggml/src/ggml-sycl/backend.hpp
A	ggml/src/ggml-sycl/rope.cpp
A	ggml/src/ggml-sycl/rope.hpp

commit	d0a7145ba99ed3a8bc3145aa785b5c86ffe65020	9ef07800622e4c371605f9419864d15667c3558f	2024-07-01T02:09:34+03:00	Georgi Gerganov	flake.lock: Update (#8218)
M	flake.lock

commit	9ef07800622e4c371605f9419864d15667c3558f	1c5eba6f8e628fb0a98afb27d8aaeb3b0e136451	2024-06-30T20:27:13+02:00	Xuan Son Nguyen	Fix new line issue with chat template, disable template when in-prefix/suffix is set (#8203)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	tests/test-chat-template.cpp

commit	1c5eba6f8e628fb0a98afb27d8aaeb3b0e136451	72272b83a3878e91251218c981b4c6ec16c33912	2024-06-29T20:44:08-07:00	Andrei	llama: Add attention and final logit soft-capping, update scaling factor to Gemma2 (#8197)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	src/llama.cpp

commit	72272b83a3878e91251218c981b4c6ec16c33912	8748d8ac6f172b99826ab18f01d9a3a165987d54	2024-06-29T00:14:20+02:00	Xuan Son Nguyen	fix code typo in llama-cli (#8198)
M	examples/main/main.cpp

commit	8748d8ac6f172b99826ab18f01d9a3a165987d54	26a39bbd6b0bbd66118bb68569f0276d7fe7df6c	2024-06-28T18:02:05+01:00	Olivier Chafik	json: attempt to skip slow tests when running under emulator (#8189)
M	.github/workflows/build.yml
M	tests/test-json-schema-to-grammar.cpp

commit	26a39bbd6b0bbd66118bb68569f0276d7fe7df6c	38373cfbab5397cc2ab5c3694a3dee12a9e58f45	2024-06-28T15:11:44+02:00	Xuan Son Nguyen	Add MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172)
M	src/llama.cpp
M	tests/test-chat-template.cpp

commit	38373cfbab5397cc2ab5c3694a3dee12a9e58f45	b851b3fba0a1b06a1129189bac300e07dd1648c8	2024-06-28T12:53:43+02:00	Sigbjørn Skjæret	Add SPM infill support (#8016)
M	common/common.cpp
M	common/common.h
M	examples/infill/README.md
M	examples/infill/infill.cpp
M	examples/server/README.md
M	examples/server/server.cpp

commit	b851b3fba0a1b06a1129189bac300e07dd1648c8	139cc621e90b4f61830515c3c124cf35b3d7a6dc	2024-06-28T12:37:45+02:00	slaren	cmake : allow user to override default options (#8178)
M	CMakeLists.txt

commit	139cc621e90b4f61830515c3c124cf35b3d7a6dc	e57dc62057d41211ac018056c19c02cd544694df	2024-06-28T09:26:45+01:00	Olivier Chafik	`json`: restore default additionalProperties to false, fix some pattern escapes (#8180)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	grammars/README.md
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	e57dc62057d41211ac018056c19c02cd544694df	a27aa50ab7e07fe46aae619076b6e31d5663e914	2024-06-28T00:00:43-04:00	pculliton	llama: Add support for Gemma2ForCausalLM (#8156)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	src/llama.cpp

commit	a27aa50ab7e07fe46aae619076b6e31d5663e914	cb0b06a8a613f7a2ccb7253b2a3c00fdd397ba1c	2024-06-28T02:19:11+02:00	Xuan Son Nguyen	Add missing items in makefile (#8177)
M	Makefile

commit	cb0b06a8a613f7a2ccb7253b2a3c00fdd397ba1c	558f44bf83d78242d4e5c4ab98d0be9125cb9780	2024-06-27T22:08:42+01:00	Olivier Chafik	`json`: update grammars/README w/ examples & note about additionalProperties (#8132)
M	grammars/README.md

commit	558f44bf83d78242d4e5c4ab98d0be9125cb9780	8172ee9da9921ca53d698c7438c2d792b3f3f2c8	2024-06-27T15:01:23-04:00	loonerin	CI: fix release build (Ubuntu+Mac) (#8170)
M	.github/workflows/build.yml

commit	8172ee9da9921ca53d698c7438c2d792b3f3f2c8	16791b8f0b4526aafbf5d0e5bbbd2e99c2253418	2024-06-27T20:04:39+02:00	slaren	cmake : fix deprecated option names not working (#8171)
M	CMakeLists.txt

commit	16791b8f0b4526aafbf5d0e5bbbd2e99c2253418	ab3679112d4c49a215a3d31550a7720b202e9015	2024-06-27T18:14:19+02:00	Xuan Son Nguyen	Add chatml fallback for cpp `llama_chat_apply_template` (#8160)
M	common/common.cpp
M	common/common.h

commit	ab3679112d4c49a215a3d31550a7720b202e9015	97877eb10bd8e7f8023420b5b5300bcbdadd62dc	2024-06-27T18:37:29+03:00	Georgi Gerganov	flake.lock: Update (#8071)
M	flake.lock

commit	97877eb10bd8e7f8023420b5b5300bcbdadd62dc	387952651a8fc493f8c85ea4c9774bd4a5694f87	2024-06-27T15:48:07+01:00	jukofyork	Control vector loading fixes (#8137)
M	common/common.cpp

commit	387952651a8fc493f8c85ea4c9774bd4a5694f87	6030c61281c8a7eb94eceb7396a608fac8b71555	2024-06-27T20:09:29+05:30	Raj Hammeer Singh Hada	Delete examples/llama.android/llama/CMakeLists.txt (#8165)
D	examples/llama.android/llama/CMakeLists.txt
M	examples/llama.android/llama/src/main/cpp/CMakeLists.txt

commit	6030c61281c8a7eb94eceb7396a608fac8b71555	85a267daaa1c6f8fd69160445bcb88717031d10c	2024-06-27T16:27:41+02:00	Sigbjørn Skjæret	Add Qwen2MoE 57B-A14B model identifier (#8158)
M	src/llama.cpp

commit	85a267daaa1c6f8fd69160445bcb88717031d10c	f675b20a3b7f878bf3be766b9a737e2c8321ff0d	2024-06-27T16:26:05+02:00	Johannes Gäßler	CUDA: fix MMQ stream-k for --split-mode row (#8167)
M	ggml/src/ggml-cuda/mmq.cuh

commit	f675b20a3b7f878bf3be766b9a737e2c8321ff0d	911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14	2024-06-27T11:58:54+03:00	kustaaya	Added support for Viking pre-tokenizer (#8135)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	include/llama.h
M	src/llama.cpp

commit	911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14	ac146628e47451c531a3c7e62e6a973a2bb467a0	2024-06-27T09:46:41+02:00	Sigbjørn Skjæret	llama : fix CodeLlama FIM token checks (#8144)
M	src/llama.cpp

commit	ac146628e47451c531a3c7e62e6a973a2bb467a0	9b31a40c6ddabe552875b811d7127aa039ca9703	2024-06-27T07:27:57+05:30	Raj Hammeer Singh Hada	Fix llama-android.cpp for error - "common/common.h not found" (#8145)
M	examples/llama.android/llama/src/main/cpp/llama-android.cpp

commit	9b31a40c6ddabe552875b811d7127aa039ca9703	c70d117c37cc7876e775d1e2722208a50c52edb3	2024-06-27T01:50:09+02:00	Daniel Bevenius	clip : suppress unused variable warnings (#8105)
M	examples/llava/clip.cpp

commit	c70d117c37cc7876e775d1e2722208a50c52edb3	ae5d0f4b899ff2842bfca561370c945ad8d4368b	2024-06-26T23:25:22+03:00	Georgi Gerganov	scripts : fix filename sync
M	scripts/sync-ggml-am.sh

commit	ae5d0f4b899ff2842bfca561370c945ad8d4368b	31ec3993f6e050322a249c07af79dbde66ea6ddc	2024-06-26T21:59:28+02:00	slaren	ci : publish new docker images only when the files change (#8142)
M	.github/workflows/build.yml
M	.github/workflows/docker.yml

commit	31ec3993f6e050322a249c07af79dbde66ea6ddc	c7ab7b612cbdce04499575e713076a026af4b9c5	2024-06-26T21:34:14+02:00	slaren	ggml : add GGML_CUDA_USE_GRAPHS option, restore GGML_CUDA_FORCE_CUBLAS (cmake) (#8140)
M	CMakeLists.txt
M	ggml/CMakeLists.txt
M	ggml/src/CMakeLists.txt

commit	c7ab7b612cbdce04499575e713076a026af4b9c5	f2d48fffde76d959fdb0da37316bdc09e5518eb1	2024-06-26T20:20:22+02:00	slaren	make : fix missing -O3 (#8143)
M	Makefile

commit	f2d48fffde76d959fdb0da37316bdc09e5518eb1	4713bf3093d58a3e12368ab2ab5fc3630f27803e	2024-06-26T19:39:19+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	4713bf3093d58a3e12368ab2ab5fc3630f27803e	0e814dfc42b4b57ad19598d239557b6a977ca16c	2024-06-26T19:36:44+03:00	Georgi Gerganov	authors : regen
M	AUTHORS

commit	0e814dfc42b4b57ad19598d239557b6a977ca16c	a95631ee97bb24861af6bdeec380270459631e8e	2024-06-26T19:32:07+03:00	Georgi Gerganov	devops : remove clblast + LLAMA_CUDA -> GGML_CUDA (#8139)
M	.devops/full-cuda.Dockerfile
M	.devops/full-rocm.Dockerfile
M	.devops/llama-cli-cuda.Dockerfile
M	.devops/llama-cli-intel.Dockerfile
M	.devops/llama-cli-rocm.Dockerfile
M	.devops/llama-cli-vulkan.Dockerfile
D	.devops/llama-cpp-clblast.srpm.spec
M	.devops/llama-cpp-cuda.srpm.spec
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-intel.Dockerfile
M	.devops/llama-server-rocm.Dockerfile
M	.devops/llama-server-vulkan.Dockerfile

commit	a95631ee97bb24861af6bdeec380270459631e8e	f3f65429c44bb195a9195bfdc19a30a79709db7b	2024-06-26T19:26:13+03:00	Georgi Gerganov	readme : update API notes
M	README.md

commit	f3f65429c44bb195a9195bfdc19a30a79709db7b	88540445615e77a0177fcca43aaa8e9d8eea6864	2024-06-26T18:33:02+03:00	Georgi Gerganov	llama : reorganize source code + improve CMake (#8006)
M	.devops/nix/package.nix
M	.github/labeler.yml
M	.github/workflows/bench.yml
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	.gitignore
M	.gitmodules
M	CMakeLists.txt
M	CMakePresets.json
M	Makefile
M	Package.swift
M	README-sycl.md
M	README.md
M	ci/run.sh
R100	scripts/build-info.cmake	cmake/build-info.cmake
A	cmake/git-vars.cmake
R073	scripts/LlamaConfig.cmake.in	cmake/llama-config.cmake.in
M	common/CMakeLists.txt
R086	scripts/gen-build-info-cpp.cmake	common/cmake/build-info-gen-cpp.cmake
M	docs/BLIS.md
M	examples/CMakeLists.txt
M	examples/imatrix/README.md
M	examples/llava/MobileVLM-README.md
M	examples/rpc/README.md
M	examples/server/CMakeLists.txt
M	examples/sycl/build.sh
M	examples/sycl/win-build-sycl.bat
A	ggml/CMakeLists.txt
R094	cmake/FindSIMD.cmake	ggml/cmake/FindSIMD.cmake
R100	ggml_vk_generate_shaders.py	ggml/ggml_vk_generate_shaders.py
R100	ggml-alloc.h	ggml/include/ggml-alloc.h
R100	ggml-backend.h	ggml/include/ggml-backend.h
R100	ggml-blas.h	ggml/include/ggml-blas.h
R100	ggml-cuda.h	ggml/include/ggml-cuda.h
R100	ggml-kompute.h	ggml/include/ggml-kompute.h
R100	ggml-metal.h	ggml/include/ggml-metal.h
R100	ggml-rpc.h	ggml/include/ggml-rpc.h
R095	ggml-sycl.h	ggml/include/ggml-sycl.h
R100	ggml-vulkan.h	ggml/include/ggml-vulkan.h
R100	ggml.h	ggml/include/ggml.h
A	ggml/src/CMakeLists.txt
R100	ggml-alloc.c	ggml/src/ggml-alloc.c
R100	ggml-backend-impl.h	ggml/src/ggml-backend-impl.h
R100	ggml-backend.c	ggml/src/ggml-backend.c
R100	ggml-blas.cpp	ggml/src/ggml-blas.cpp
R100	ggml-common.h	ggml/src/ggml-common.h
R100	ggml-cuda.cu	ggml/src/ggml-cuda.cu
R100	ggml-cuda/acc.cu	ggml/src/ggml-cuda/acc.cu
R100	ggml-cuda/acc.cuh	ggml/src/ggml-cuda/acc.cuh
R100	ggml-cuda/arange.cu	ggml/src/ggml-cuda/arange.cu
R100	ggml-cuda/arange.cuh	ggml/src/ggml-cuda/arange.cuh
R100	ggml-cuda/argsort.cu	ggml/src/ggml-cuda/argsort.cu
R100	ggml-cuda/argsort.cuh	ggml/src/ggml-cuda/argsort.cuh
R100	ggml-cuda/binbcast.cu	ggml/src/ggml-cuda/binbcast.cu
R100	ggml-cuda/binbcast.cuh	ggml/src/ggml-cuda/binbcast.cuh
R100	ggml-cuda/clamp.cu	ggml/src/ggml-cuda/clamp.cu
R100	ggml-cuda/clamp.cuh	ggml/src/ggml-cuda/clamp.cuh
R100	ggml-cuda/common.cuh	ggml/src/ggml-cuda/common.cuh
R100	ggml-cuda/concat.cu	ggml/src/ggml-cuda/concat.cu
R100	ggml-cuda/concat.cuh	ggml/src/ggml-cuda/concat.cuh
R100	ggml-cuda/convert.cu	ggml/src/ggml-cuda/convert.cu
R100	ggml-cuda/convert.cuh	ggml/src/ggml-cuda/convert.cuh
R100	ggml-cuda/cpy.cu	ggml/src/ggml-cuda/cpy.cu
R100	ggml-cuda/cpy.cuh	ggml/src/ggml-cuda/cpy.cuh
R100	ggml-cuda/dequantize.cuh	ggml/src/ggml-cuda/dequantize.cuh
R100	ggml-cuda/diagmask.cu	ggml/src/ggml-cuda/diagmask.cu
R100	ggml-cuda/diagmask.cuh	ggml/src/ggml-cuda/diagmask.cuh
R100	ggml-cuda/dmmv.cu	ggml/src/ggml-cuda/dmmv.cu
R100	ggml-cuda/dmmv.cuh	ggml/src/ggml-cuda/dmmv.cuh
R099	ggml-cuda/fattn-common.cuh	ggml/src/ggml-cuda/fattn-common.cuh
R100	ggml-cuda/fattn-tile-f16.cu	ggml/src/ggml-cuda/fattn-tile-f16.cu
R100	ggml-cuda/fattn-tile-f16.cuh	ggml/src/ggml-cuda/fattn-tile-f16.cuh
R100	ggml-cuda/fattn-tile-f32.cu	ggml/src/ggml-cuda/fattn-tile-f32.cu
R100	ggml-cuda/fattn-tile-f32.cuh	ggml/src/ggml-cuda/fattn-tile-f32.cuh
R100	ggml-cuda/fattn-vec-f16.cuh	ggml/src/ggml-cuda/fattn-vec-f16.cuh
R100	ggml-cuda/fattn-vec-f32.cuh	ggml/src/ggml-cuda/fattn-vec-f32.cuh
R100	ggml-cuda/fattn-wmma-f16.cuh	ggml/src/ggml-cuda/fattn-wmma-f16.cuh
R100	ggml-cuda/fattn.cu	ggml/src/ggml-cuda/fattn.cu
R100	ggml-cuda/fattn.cuh	ggml/src/ggml-cuda/fattn.cuh
R100	ggml-cuda/getrows.cu	ggml/src/ggml-cuda/getrows.cu
R100	ggml-cuda/getrows.cuh	ggml/src/ggml-cuda/getrows.cuh
R100	ggml-cuda/im2col.cu	ggml/src/ggml-cuda/im2col.cu
R100	ggml-cuda/im2col.cuh	ggml/src/ggml-cuda/im2col.cuh
R100	ggml-cuda/mma.cuh	ggml/src/ggml-cuda/mma.cuh
R100	ggml-cuda/mmq.cu	ggml/src/ggml-cuda/mmq.cu
R100	ggml-cuda/mmq.cuh	ggml/src/ggml-cuda/mmq.cuh
R100	ggml-cuda/mmvq.cu	ggml/src/ggml-cuda/mmvq.cu
R100	ggml-cuda/mmvq.cuh	ggml/src/ggml-cuda/mmvq.cuh
R100	ggml-cuda/norm.cu	ggml/src/ggml-cuda/norm.cu
R100	ggml-cuda/norm.cuh	ggml/src/ggml-cuda/norm.cuh
R100	ggml-cuda/pad.cu	ggml/src/ggml-cuda/pad.cu
R100	ggml-cuda/pad.cuh	ggml/src/ggml-cuda/pad.cuh
R100	ggml-cuda/pool2d.cu	ggml/src/ggml-cuda/pool2d.cu
R100	ggml-cuda/pool2d.cuh	ggml/src/ggml-cuda/pool2d.cuh
R100	ggml-cuda/quantize.cu	ggml/src/ggml-cuda/quantize.cu
R100	ggml-cuda/quantize.cuh	ggml/src/ggml-cuda/quantize.cuh
R100	ggml-cuda/rope.cu	ggml/src/ggml-cuda/rope.cu
R100	ggml-cuda/rope.cuh	ggml/src/ggml-cuda/rope.cuh
R100	ggml-cuda/scale.cu	ggml/src/ggml-cuda/scale.cu
R100	ggml-cuda/scale.cuh	ggml/src/ggml-cuda/scale.cuh
R100	ggml-cuda/softmax.cu	ggml/src/ggml-cuda/softmax.cu
R100	ggml-cuda/softmax.cuh	ggml/src/ggml-cuda/softmax.cuh
R100	ggml-cuda/sumrows.cu	ggml/src/ggml-cuda/sumrows.cu
R100	ggml-cuda/sumrows.cuh	ggml/src/ggml-cuda/sumrows.cuh
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs256-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs256-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q8_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs256-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs256-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-f16.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-f16.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_0.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_1.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_1.cu
R100	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q8_0.cu	ggml/src/ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q8_0.cu
R100	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb16.cu	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb16.cu
R100	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb32.cu	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb32.cu
R100	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb16.cu	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb16.cu
R100	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb32.cu	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb32.cu
R100	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb8.cu	ggml/src/ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb8.cu
R100	ggml-cuda/template-instances/generate_cu_files.py	ggml/src/ggml-cuda/template-instances/generate_cu_files.py
R100	ggml-cuda/template-instances/mmq-instance-q2_k.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q2_k.cu
R100	ggml-cuda/template-instances/mmq-instance-q3_k.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q3_k.cu
R100	ggml-cuda/template-instances/mmq-instance-q4_0.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q4_0.cu
R100	ggml-cuda/template-instances/mmq-instance-q4_1.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q4_1.cu
R100	ggml-cuda/template-instances/mmq-instance-q4_k.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q4_k.cu
R100	ggml-cuda/template-instances/mmq-instance-q5_0.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q5_0.cu
R100	ggml-cuda/template-instances/mmq-instance-q5_1.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q5_1.cu
R100	ggml-cuda/template-instances/mmq-instance-q5_k.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q5_k.cu
R100	ggml-cuda/template-instances/mmq-instance-q6_k.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q6_k.cu
R100	ggml-cuda/template-instances/mmq-instance-q8_0.cu	ggml/src/ggml-cuda/template-instances/mmq-instance-q8_0.cu
R100	ggml-cuda/tsembd.cu	ggml/src/ggml-cuda/tsembd.cu
R100	ggml-cuda/tsembd.cuh	ggml/src/ggml-cuda/tsembd.cuh
R100	ggml-cuda/unary.cu	ggml/src/ggml-cuda/unary.cu
R100	ggml-cuda/unary.cuh	ggml/src/ggml-cuda/unary.cuh
R100	ggml-cuda/upscale.cu	ggml/src/ggml-cuda/upscale.cu
R100	ggml-cuda/upscale.cuh	ggml/src/ggml-cuda/upscale.cuh
R100	ggml-cuda/vecdotq.cuh	ggml/src/ggml-cuda/vecdotq.cuh
R100	ggml-impl.h	ggml/src/ggml-impl.h
R100	ggml-kompute.cpp	ggml/src/ggml-kompute.cpp
R100	ggml-metal.m	ggml/src/ggml-metal.m
R100	ggml-metal.metal	ggml/src/ggml-metal.metal
R100	ggml-quants.c	ggml/src/ggml-quants.c
R100	ggml-quants.h	ggml/src/ggml-quants.h
R100	ggml-rpc.cpp	ggml/src/ggml-rpc.cpp
R099	ggml-sycl.cpp	ggml/src/ggml-sycl.cpp
R100	ggml-sycl/backend.hpp	ggml/src/ggml-sycl/backend.hpp
R100	ggml-sycl/common.cpp	ggml/src/ggml-sycl/common.cpp
R099	ggml-sycl/common.hpp	ggml/src/ggml-sycl/common.hpp
R100	ggml-sycl/convert.cpp	ggml/src/ggml-sycl/convert.cpp
R100	ggml-sycl/convert.hpp	ggml/src/ggml-sycl/convert.hpp
R100	ggml-sycl/dequantize.hpp	ggml/src/ggml-sycl/dequantize.hpp
R100	ggml-sycl/dmmv.cpp	ggml/src/ggml-sycl/dmmv.cpp
R100	ggml-sycl/dmmv.hpp	ggml/src/ggml-sycl/dmmv.hpp
R100	ggml-sycl/dpct/helper.hpp	ggml/src/ggml-sycl/dpct/helper.hpp
R100	ggml-sycl/mmq.cpp	ggml/src/ggml-sycl/mmq.cpp
R100	ggml-sycl/mmq.hpp	ggml/src/ggml-sycl/mmq.hpp
R100	ggml-sycl/mmvq.cpp	ggml/src/ggml-sycl/mmvq.cpp
R100	ggml-sycl/mmvq.hpp	ggml/src/ggml-sycl/mmvq.hpp
R096	ggml-sycl/presets.hpp	ggml/src/ggml-sycl/presets.hpp
R100	ggml-sycl/vecdotq.hpp	ggml/src/ggml-sycl/vecdotq.hpp
R100	ggml-vulkan-shaders.hpp	ggml/src/ggml-vulkan-shaders.hpp
R100	ggml-vulkan.cpp	ggml/src/ggml-vulkan.cpp
R100	ggml.c	ggml/src/ggml.c
R100	kompute	ggml/src/kompute
R100	kompute-shaders/common.comp	ggml/src/kompute-shaders/common.comp
R100	kompute-shaders/op_add.comp	ggml/src/kompute-shaders/op_add.comp
R100	kompute-shaders/op_addrow.comp	ggml/src/kompute-shaders/op_addrow.comp
R100	kompute-shaders/op_cpy_f16_f16.comp	ggml/src/kompute-shaders/op_cpy_f16_f16.comp
R100	kompute-shaders/op_cpy_f16_f32.comp	ggml/src/kompute-shaders/op_cpy_f16_f32.comp
R100	kompute-shaders/op_cpy_f32_f16.comp	ggml/src/kompute-shaders/op_cpy_f32_f16.comp
R100	kompute-shaders/op_cpy_f32_f32.comp	ggml/src/kompute-shaders/op_cpy_f32_f32.comp
R100	kompute-shaders/op_diagmask.comp	ggml/src/kompute-shaders/op_diagmask.comp
R100	kompute-shaders/op_gelu.comp	ggml/src/kompute-shaders/op_gelu.comp
R100	kompute-shaders/op_getrows.comp	ggml/src/kompute-shaders/op_getrows.comp
R100	kompute-shaders/op_getrows_f16.comp	ggml/src/kompute-shaders/op_getrows_f16.comp
R100	kompute-shaders/op_getrows_f32.comp	ggml/src/kompute-shaders/op_getrows_f32.comp
R100	kompute-shaders/op_getrows_q4_0.comp	ggml/src/kompute-shaders/op_getrows_q4_0.comp
R100	kompute-shaders/op_getrows_q4_1.comp	ggml/src/kompute-shaders/op_getrows_q4_1.comp
R100	kompute-shaders/op_getrows_q6_k.comp	ggml/src/kompute-shaders/op_getrows_q6_k.comp
R100	kompute-shaders/op_mul.comp	ggml/src/kompute-shaders/op_mul.comp
R100	kompute-shaders/op_mul_mat_f16.comp	ggml/src/kompute-shaders/op_mul_mat_f16.comp
R100	kompute-shaders/op_mul_mat_mat_f32.comp	ggml/src/kompute-shaders/op_mul_mat_mat_f32.comp
R100	kompute-shaders/op_mul_mat_q4_0.comp	ggml/src/kompute-shaders/op_mul_mat_q4_0.comp
R100	kompute-shaders/op_mul_mat_q4_1.comp	ggml/src/kompute-shaders/op_mul_mat_q4_1.comp
R100	kompute-shaders/op_mul_mat_q6_k.comp	ggml/src/kompute-shaders/op_mul_mat_q6_k.comp
R100	kompute-shaders/op_mul_mat_q8_0.comp	ggml/src/kompute-shaders/op_mul_mat_q8_0.comp
R100	kompute-shaders/op_mul_mv_q_n.comp	ggml/src/kompute-shaders/op_mul_mv_q_n.comp
R100	kompute-shaders/op_mul_mv_q_n_pre.comp	ggml/src/kompute-shaders/op_mul_mv_q_n_pre.comp
R100	kompute-shaders/op_norm.comp	ggml/src/kompute-shaders/op_norm.comp
R100	kompute-shaders/op_relu.comp	ggml/src/kompute-shaders/op_relu.comp
R100	kompute-shaders/op_rmsnorm.comp	ggml/src/kompute-shaders/op_rmsnorm.comp
R100	kompute-shaders/op_rope_f16.comp	ggml/src/kompute-shaders/op_rope_f16.comp
R100	kompute-shaders/op_rope_f32.comp	ggml/src/kompute-shaders/op_rope_f32.comp
R100	kompute-shaders/op_scale.comp	ggml/src/kompute-shaders/op_scale.comp
R100	kompute-shaders/op_scale_8.comp	ggml/src/kompute-shaders/op_scale_8.comp
R100	kompute-shaders/op_silu.comp	ggml/src/kompute-shaders/op_silu.comp
R100	kompute-shaders/op_softmax.comp	ggml/src/kompute-shaders/op_softmax.comp
R100	kompute-shaders/rope_common.comp	ggml/src/kompute-shaders/rope_common.comp
R100	sgemm.cpp	ggml/src/sgemm.cpp
R100	sgemm.h	ggml/src/sgemm.h
R100	vulkan-shaders/add.comp	ggml/src/vulkan-shaders/add.comp
R100	vulkan-shaders/argsort.comp	ggml/src/vulkan-shaders/argsort.comp
R100	vulkan-shaders/clamp.comp	ggml/src/vulkan-shaders/clamp.comp
R100	vulkan-shaders/copy.comp	ggml/src/vulkan-shaders/copy.comp
R100	vulkan-shaders/dequant_f32.comp	ggml/src/vulkan-shaders/dequant_f32.comp
R100	vulkan-shaders/dequant_funcs.comp	ggml/src/vulkan-shaders/dequant_funcs.comp
R100	vulkan-shaders/dequant_head.comp	ggml/src/vulkan-shaders/dequant_head.comp
R100	vulkan-shaders/dequant_q2_k.comp	ggml/src/vulkan-shaders/dequant_q2_k.comp
R100	vulkan-shaders/dequant_q3_k.comp	ggml/src/vulkan-shaders/dequant_q3_k.comp
R100	vulkan-shaders/dequant_q4_0.comp	ggml/src/vulkan-shaders/dequant_q4_0.comp
R100	vulkan-shaders/dequant_q4_1.comp	ggml/src/vulkan-shaders/dequant_q4_1.comp
R100	vulkan-shaders/dequant_q4_k.comp	ggml/src/vulkan-shaders/dequant_q4_k.comp
R100	vulkan-shaders/dequant_q5_0.comp	ggml/src/vulkan-shaders/dequant_q5_0.comp
R100	vulkan-shaders/dequant_q5_1.comp	ggml/src/vulkan-shaders/dequant_q5_1.comp
R100	vulkan-shaders/dequant_q5_k.comp	ggml/src/vulkan-shaders/dequant_q5_k.comp
R100	vulkan-shaders/dequant_q6_k.comp	ggml/src/vulkan-shaders/dequant_q6_k.comp
R100	vulkan-shaders/dequant_q8_0.comp	ggml/src/vulkan-shaders/dequant_q8_0.comp
R100	vulkan-shaders/diag_mask_inf.comp	ggml/src/vulkan-shaders/diag_mask_inf.comp
R100	vulkan-shaders/div.comp	ggml/src/vulkan-shaders/div.comp
R100	vulkan-shaders/gelu.comp	ggml/src/vulkan-shaders/gelu.comp
R100	vulkan-shaders/generic_binary_head.comp	ggml/src/vulkan-shaders/generic_binary_head.comp
R100	vulkan-shaders/generic_head.comp	ggml/src/vulkan-shaders/generic_head.comp
R100	vulkan-shaders/generic_unary_head.comp	ggml/src/vulkan-shaders/generic_unary_head.comp
R100	vulkan-shaders/get_rows.comp	ggml/src/vulkan-shaders/get_rows.comp
R100	vulkan-shaders/get_rows_quant.comp	ggml/src/vulkan-shaders/get_rows_quant.comp
R100	vulkan-shaders/mul.comp	ggml/src/vulkan-shaders/mul.comp
R100	vulkan-shaders/mul_mat_split_k_reduce.comp	ggml/src/vulkan-shaders/mul_mat_split_k_reduce.comp
R100	vulkan-shaders/mul_mat_vec.comp	ggml/src/vulkan-shaders/mul_mat_vec.comp
R100	vulkan-shaders/mul_mat_vec_base.comp	ggml/src/vulkan-shaders/mul_mat_vec_base.comp
R100	vulkan-shaders/mul_mat_vec_nc.comp	ggml/src/vulkan-shaders/mul_mat_vec_nc.comp
R100	vulkan-shaders/mul_mat_vec_p021.comp	ggml/src/vulkan-shaders/mul_mat_vec_p021.comp
R100	vulkan-shaders/mul_mat_vec_q2_k.comp	ggml/src/vulkan-shaders/mul_mat_vec_q2_k.comp
R100	vulkan-shaders/mul_mat_vec_q3_k.comp	ggml/src/vulkan-shaders/mul_mat_vec_q3_k.comp
R100	vulkan-shaders/mul_mat_vec_q4_k.comp	ggml/src/vulkan-shaders/mul_mat_vec_q4_k.comp
R100	vulkan-shaders/mul_mat_vec_q5_k.comp	ggml/src/vulkan-shaders/mul_mat_vec_q5_k.comp
R100	vulkan-shaders/mul_mat_vec_q6_k.comp	ggml/src/vulkan-shaders/mul_mat_vec_q6_k.comp
R100	vulkan-shaders/mul_mm.comp	ggml/src/vulkan-shaders/mul_mm.comp
R100	vulkan-shaders/norm.comp	ggml/src/vulkan-shaders/norm.comp
R100	vulkan-shaders/relu.comp	ggml/src/vulkan-shaders/relu.comp
R100	vulkan-shaders/rms_norm.comp	ggml/src/vulkan-shaders/rms_norm.comp
R100	vulkan-shaders/rope_head.comp	ggml/src/vulkan-shaders/rope_head.comp
R100	vulkan-shaders/rope_neox.comp	ggml/src/vulkan-shaders/rope_neox.comp
R100	vulkan-shaders/rope_norm.comp	ggml/src/vulkan-shaders/rope_norm.comp
R100	vulkan-shaders/scale.comp	ggml/src/vulkan-shaders/scale.comp
R100	vulkan-shaders/silu.comp	ggml/src/vulkan-shaders/silu.comp
R100	vulkan-shaders/soft_max.comp	ggml/src/vulkan-shaders/soft_max.comp
R100	vulkan-shaders/square.comp	ggml/src/vulkan-shaders/square.comp
R100	vulkan-shaders/sum_rows.comp	ggml/src/vulkan-shaders/sum_rows.comp
R100	vulkan-shaders/types.comp	ggml/src/vulkan-shaders/types.comp
R100	llama.h	include/llama.h
M	scripts/build-info.sh
M	scripts/compare-commits.sh
M	scripts/debug-test.sh
M	scripts/pod-llama.sh
M	scripts/server-llm.sh
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh
M	spm-headers/ggml-alloc.h
M	spm-headers/ggml-backend.h
A	spm-headers/ggml-metal.h
M	spm-headers/ggml.h
M	spm-headers/llama.h
A	src/CMakeLists.txt
R100	llama.cpp	src/llama.cpp
R100	unicode-data.cpp	src/unicode-data.cpp
R100	unicode-data.h	src/unicode-data.h
R100	unicode.cpp	src/unicode.cpp
R100	unicode.h	src/unicode.h
M	tests/test-backend-ops.cpp

commit	88540445615e77a0177fcca43aaa8e9d8eea6864	c8771ab5f89387cdd7d9a8a69280dac46b45e02f	2024-06-26T02:29:28-04:00	Isaac McFadyen	Clarify default MMQ for CUDA and LLAMA_CUDA_FORCE_MMQ flag (#8115)
M	README.md

commit	c8771ab5f89387cdd7d9a8a69280dac46b45e02f	494165f3b6c4cbcd793123cb57fb3e1f5477f1db	2024-06-26T08:28:02+02:00	Johannes Gäßler	CUDA: fix misaligned shared memory read (#8123)
M	ggml-cuda/mma.cuh

commit	494165f3b6c4cbcd793123cb57fb3e1f5477f1db	9b2f16f8055265c67e074025350736adc1ea0666	2024-06-26T14:27:46+08:00	Eddie-Wang	llama : extend llm_build_ffn() to support _scale tensors (#8103)
M	llama.cpp

commit	9b2f16f8055265c67e074025350736adc1ea0666	6777c544bdd8c5d9de3220d6e2557957bbbf2a4f	2024-06-26T01:46:35+01:00	Olivier Chafik	`json`: better support for "type" unions (e.g. nullable arrays w/ typed items) (#7863)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	6777c544bdd8c5d9de3220d6e2557957bbbf2a4f	163d50adaf8897d8b734d701ff332de6be63d484	2024-06-26T01:45:58+01:00	Olivier Chafik	`json`: fix additionalProperties, allow space after enum/const (#7840)
M	common/json-schema-to-grammar.cpp
M	examples/json-schema-pydantic-example.py
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	examples/server/tests/features/server.feature
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	163d50adaf8897d8b734d701ff332de6be63d484	6fcbf6823553efabe52ed83e3c2a3329aa3387d1	2024-06-25T21:47:40+01:00	jukofyork	fixes #7999 (adds control vectors to all `build_XXX()` functions in `llama.cpp` [needs testing] (#8060)
M	llama.cpp

commit	6fcbf6823553efabe52ed83e3c2a3329aa3387d1	e6bf007744eb06336a231ef39cf08146dd16d2ce	2024-06-25T21:14:35+02:00	fairydreaming	llama : implement Unigram tokenizer needed by T5 and FLAN-T5 model families (#5763)
M	llama.cpp
M	llama.h
M	unicode.cpp
M	unicode.h

commit	e6bf007744eb06336a231ef39cf08146dd16d2ce	84631fe1504de40427dc4b4cdac92fa7ebf65955	2024-06-25T21:07:28+02:00	Daniel Bevenius	llama : return nullptr from llama_grammar_init (#8093)
M	common/sampling.cpp
M	examples/gbnf-validator/gbnf-validator.cpp
M	llama.cpp
M	llama.h
M	tests/test-grammar-integration.cpp
M	tests/test-llama-grammar.cpp

commit	84631fe1504de40427dc4b4cdac92fa7ebf65955	dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17	2024-06-25T20:06:20+01:00	Olivier Chafik	`json`: support integer minimum, maximum, exclusiveMinimum, exclusiveMaximum (#7797)
M	common/json-schema-to-grammar.cpp
M	examples/json-schema-pydantic-example.py
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	tests/test-grammar-integration.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17	925c30956dd17723c3a25297bcd0a609aec60663	2024-06-25T19:20:06+02:00	slaren	disable docker CI on pull requests (#8110)
M	.github/workflows/docker.yml

commit	925c30956dd17723c3a25297bcd0a609aec60663	c8ad35955ad2c68db172dcd0e857423ab128518d	2024-06-25T08:13:27-07:00	joecryptotoo	Add healthchecks to llama-server containers (#8081)
M	.devops/llama-server-cuda.Dockerfile
M	.devops/llama-server-intel.Dockerfile
M	.devops/llama-server-rocm.Dockerfile
M	.devops/llama-server-vulkan.Dockerfile
M	.devops/llama-server.Dockerfile

commit	c8ad35955ad2c68db172dcd0e857423ab128518d	49c03c79cda17913b72260acdc8157b742cee41c	2024-06-25T22:03:25+10:00	Brian	Gguf dump start data offset via --data-offset and some extra refactor (#8054)
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/scripts/gguf-dump.py

commit	49c03c79cda17913b72260acdc8157b742cee41c	48e6b92cc378c937e59719f2c0f482bf76c9ca81	2024-06-25T13:59:54+02:00	Xuan Son Nguyen	cvector: better prompt handling, add "mean vector" method (#8069)
M	common/common.cpp
M	common/common.h
M	examples/cvector-generator/README.md
M	examples/cvector-generator/cvector-generator.cpp
A	examples/cvector-generator/mean.hpp
M	examples/cvector-generator/negative.txt
M	examples/cvector-generator/pca.hpp
M	examples/cvector-generator/positive.txt

commit	48e6b92cc378c937e59719f2c0f482bf76c9ca81	3791ad219323389106dc3fd80814eb5bbb7b80de	2024-06-25T13:56:49+02:00	Xuan Son Nguyen	Add chat template support for llama-cli (#8068)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	llama.cpp
M	tests/test-chat-template.cpp

commit	3791ad219323389106dc3fd80814eb5bbb7b80de	f702a90e245499283d6de0b287701c723cda2a87	2024-06-25T16:57:35+05:30	HanishKVC	SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
M	examples/server/public_simplechat/readme.md
M	examples/server/public_simplechat/simplechat.js
A	examples/server/public_simplechat/simplechat_screens.webp

commit	f702a90e245499283d6de0b287701c723cda2a87	083bacce14c1aaf9976aa40e8266cdc25ac749d3	2024-06-25T10:44:48+02:00	HatsuneMikuUwU33	Update control vector help (#8104)
M	common/common.cpp

commit	083bacce14c1aaf9976aa40e8266cdc25ac749d3	2df373ac40ea581ccca8a58c713f03ad9d4b658d	2024-06-25T10:19:20+08:00	Meng, Hengyu	[SYCL] Re-enabled mul_mat_batched_sycl (#8095)
M	ggml-sycl.cpp

commit	2df373ac40ea581ccca8a58c713f03ad9d4b658d	3b099bcd9cbf2434f90cbe40eba6fa2189ed1d02	2024-06-25T01:22:33+02:00	Johannes Gäßler	CUDA: fix matrix multiplication algorithm choice (#8102)
M	ggml-cuda.cu

commit	3b099bcd9cbf2434f90cbe40eba6fa2189ed1d02	a818f3028d1497a51cb2b8eb7d993ad58784940e	2024-06-24T22:15:33+02:00	Johannes Gäßler	CUDA: fix MMQ writeback for int8 tensor cores (#8100)
M	ggml-cuda/mmq.cuh

commit	a818f3028d1497a51cb2b8eb7d993ad58784940e	d62e4aaa02540c89be8b59426340b909d02bbc9e	2024-06-24T17:43:42+02:00	Johannes Gäßler	CUDA: use MMQ instead of cuBLAS by default (#8075)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/mmq.cu
M	ggml-cuda/mmq.cuh
M	ggml-cuda/mmvq.cuh

commit	d62e4aaa02540c89be8b59426340b909d02bbc9e	9a590c82262dd518137f85406e65e452fdf2aca3	2024-06-24T14:13:39+02:00	fairydreaming	gguf-py : fix tensor groups for encoder-decoder models in gguf-dump.py (#8090)
M	gguf-py/scripts/gguf-dump.py

commit	9a590c82262dd518137f85406e65e452fdf2aca3	52fc8705a0617452df08333e1161838726c322b4	2024-06-24T12:41:23+02:00	Johannes Gäßler	CUDA: optimize MMQ int8 tensor core performance (#8062)
M	ggml-cuda/common.cuh
M	ggml-cuda/mma.cuh
M	ggml-cuda/mmq.cuh

commit	52fc8705a0617452df08333e1161838726c322b4	8cb508d0d5c024e12692370d85237b45469a004b	2024-06-24T05:42:03-04:00	Christian Zhou-Zheng	Option to split during conversion (#6942)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py

commit	8cb508d0d5c024e12692370d85237b45469a004b	646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7	2024-06-24T07:36:11+02:00	slaren	disable publishing the full-rocm docker image (#8083)
M	.github/workflows/docker.yml

commit	646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7	de0d6a68ac99f307fe889c48e21124bc3b7ca29a	2024-06-24T13:30:24+08:00	Yann Follet	embedding : more cli arguments (#7458)
M	common/common.cpp
M	common/common.h
M	examples/embedding/README.md
M	examples/embedding/embedding.cpp

commit	de0d6a68ac99f307fe889c48e21124bc3b7ca29a	95f57bb5d5b18ef0beb2702a0d6c06e46804075c	2024-06-24T07:06:05+02:00	fairydreaming	gguf-py, convert-hf : model conversion support for T5 and FLAN-T5 model variants (#5763)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py

commit	95f57bb5d5b18ef0beb2702a0d6c06e46804075c	e112b610a1a75cb7fa8351e1a933e2e7a755a5ce	2024-06-24T03:07:59+02:00	slaren	ggml : remove ggml_task_type and GGML_PERF (#8017)
M	CMakeLists.txt
M	Makefile
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	sgemm.cpp
M	sgemm.h

commit	e112b610a1a75cb7fa8351e1a933e2e7a755a5ce	6a2f298bd784403c5c33eebb822217ec5d9b5590	2024-06-24T02:27:57+08:00	Eddie-Wang	llama : add support for BitnetForCausalLM (#7931)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	6a2f298bd784403c5c33eebb822217ec5d9b5590	11318d9aa1f668aa10407a5cb9614371af32f3ce	2024-06-23T18:03:08+03:00	Aarni Koskela	server : fix JSON-Scheme typo (#7975)
M	examples/server/public/index-new.html

commit	11318d9aa1f668aa10407a5cb9614371af32f3ce	b6b9a8e606da7764bd3649c2ea574979c85abd43	2024-06-23T15:39:45+02:00	Daniel Bevenius	Fix typo in llama_set_embeddings comment (#8077)
M	llama.h

commit	b6b9a8e606da7764bd3649c2ea574979c85abd43	45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc	2024-06-23T13:14:45+02:00	slaren	fix CI failures (#8066)
M	.github/workflows/server.yml
M	tests/test-backend-ops.cpp

commit	45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc	b5a5f34efadec8d8f0057b35cb04742abfeb2ef5	2024-06-23T10:21:25+02:00	0cc4m	Refactor Vulkan backend to allow multiple contexts (#7961)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	vulkan-shaders/mul_mat_vec.comp
M	vulkan-shaders/mul_mat_vec_q2_k.comp
M	vulkan-shaders/mul_mat_vec_q3_k.comp
M	vulkan-shaders/mul_mat_vec_q4_k.comp
M	vulkan-shaders/mul_mat_vec_q5_k.comp
M	vulkan-shaders/mul_mat_vec_q6_k.comp

commit	b5a5f34efadec8d8f0057b35cb04742abfeb2ef5	3e58b0ee355f78be41cf5211b68426761339bc3c	2024-06-22T14:28:18-04:00	Clint Herron	Removing extra blank lines that were breaking Lint. (#8067)
M	convert-hf-to-gguf.py

commit	3e58b0ee355f78be41cf5211b68426761339bc3c	adf480c3ab3abedc964c8ae381476257583ae134	2024-06-22T18:11:30+02:00	Xuan Son Nguyen	cvector: fix CI + correct help message (#8064)
M	.editorconfig
M	common/common.cpp
M	examples/cvector-generator/README.md
M	examples/cvector-generator/cvector-generator.cpp

commit	adf480c3ab3abedc964c8ae381476257583ae134	3aa184a8c7c553b5dfcc142d919f3db695df297a	2024-06-22T17:19:37+02:00	HatsuneMikuUwU33	cvector-generator: Moe Moe Fixie-Fixie for Lots of Formats~! ♡(ᐢ ᴥ ᐢ)♡ (#8052)
M	examples/cvector-generator/cvector-generator.cpp
M	examples/cvector-generator/negative.txt
M	examples/cvector-generator/positive.txt

commit	3aa184a8c7c553b5dfcc142d919f3db695df297a	5b48cd53a87928db0c6447f0c9dac4db5802102d	2024-06-22T09:37:41-04:00	0xspringtime	convert-hf : change assert to exception (#8015)
M	convert-hf-to-gguf.py

commit	5b48cd53a87928db0c6447f0c9dac4db5802102d	c5a8d4b749352645afd4c024f85d6eca2ca72c6d	2024-06-22T07:16:10-06:00	ddh0	Update llama-quantize ppl/file size output from LLaMA-v1 to Llama-3 values (#8058)
M	examples/quantize/quantize.cpp

commit	c5a8d4b749352645afd4c024f85d6eca2ca72c6d	557b653dc9ed91e8c313e87500e0050c775f81b6	2024-06-21T23:18:36-04:00	Clint Herron	JSON Schema to GBNF integration tests (#7790)
M	Makefile
M	tests/test-grammar-integration.cpp

commit	557b653dc9ed91e8c313e87500e0050c775f81b6	7d5e8777ae1d21af99d4f95be10db4870720da91	2024-06-21T16:28:20+08:00	k.h.lai	vulkan: detect multiple devices by deviceUUID instead of deviceID (#8022)
M	ggml-vulkan.cpp

commit	7d5e8777ae1d21af99d4f95be10db4870720da91	a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b	2024-06-21T05:57:36Z	Eve	ggml : AVX IQ quants (#7845)
M	ggml-quants.c

commit	a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b	80ea089d771f0c2d97afa8bead80ded412f600d7	2024-06-21T08:51:28+03:00	Georgi Gerganov	llama : optimize long word tokenization with WPM (#8034)
M	llama.cpp
M	unicode.cpp

commit	80ea089d771f0c2d97afa8bead80ded412f600d7	0e64591e8290037db6412665a56354b789a0597e	2024-06-21T00:38:22-05:00	Douglas Hanley	llama : allow pooled embeddings on any model (#7477)
M	common/common.cpp
M	examples/embedding/embedding.cpp
M	examples/gritlm/gritlm.cpp
M	examples/retrieval/retrieval.cpp
M	llama.cpp
M	llama.h

commit	0e64591e8290037db6412665a56354b789a0597e	b1ef562bc17fbf8ba436ddf2d89b78efd10d3e03	2024-06-21T14:30:58+09:00	Shuichi Tsutsumi	swiftui : enable stream updating (#7754)
M	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift

commit	b1ef562bc17fbf8ba436ddf2d89b78efd10d3e03	17b291a6a581c47f24f99bad926b42617894f99f	2024-06-20T21:01:15+01:00	Hamdoud Hakem	requirements : Bump torch and numpy for python3.12 (#8041)
M	requirements/requirements-convert-hf-to-gguf-update.txt
M	requirements/requirements-convert-hf-to-gguf.txt
M	requirements/requirements-convert-legacy-llama.txt

commit	17b291a6a581c47f24f99bad926b42617894f99f	abd894ad96a242043b8e197ec130d8649eead22e	2024-06-20T20:59:59+01:00	Hamdoud Hakem	convert-hf : Fix the encoding in the convert-hf-to-gguf-update.py (#8040)
M	convert-hf-to-gguf-update.py

commit	abd894ad96a242043b8e197ec130d8649eead22e	de391e4c803383bbea054b6edd016e78c024a74d	2024-06-20T16:40:13+02:00	Johannes Gäßler	common: fix warning (#8036)
M	common/common.cpp

commit	de391e4c803383bbea054b6edd016e78c024a74d	d50f8897a797a5a03f31228d1b5a7b8130ee1bc2	2024-06-20T13:19:05Z	luoyu-intel	[SYCL] Fix windows build and inference (#8003)
M	CMakeLists.txt
M	CMakePresets.json
M	README-sycl.md
M	examples/sycl/win-build-sycl.bat
M	ggml-sycl.cpp
M	ggml-sycl/dpct/helper.hpp
M	ggml.h

commit	d50f8897a797a5a03f31228d1b5a7b8130ee1bc2	2075a66a96cc1b04eabec7cf4b3051193d6f719e	2024-06-20T14:39:21+02:00	Johannes Gäßler	CUDA: stream-k decomposition for MMQ (#8018)
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/mmq.cu
M	ggml-cuda/mmq.cuh

commit	2075a66a96cc1b04eabec7cf4b3051193d6f719e	ba5899315283eb1df3902363daf79bdc5eefe426	2024-06-19T22:32:01-07:00	Michael de Gans	metal : fix `ggml_metal_supports_op` for BF16 (#8021)
M	ggml-metal.m

commit	ba5899315283eb1df3902363daf79bdc5eefe426	a7854743c5e6216a6178824a603aa9479728ddd5	2024-06-19T23:57:10Z	sasha0552	server : fix smart slot selection (#8020)
M	examples/server/server.cpp

commit	a7854743c5e6216a6178824a603aa9479728ddd5	9c77ec1d74874ee22bdef8f110e8e8d41389abf2	2024-06-19T13:10:42-07:00	Michael de Gans	un-ignore `build-info.cmake` and `build-info.sh` (#7996)
M	.gitignore

commit	9c77ec1d74874ee22bdef8f110e8e8d41389abf2	a04a953cab583f0229e7b4b506346e3e9a85c8d0	2024-06-19T15:04:15+02:00	slaren	ggml : synchronize threads using barriers (#7993)
M	.github/workflows/server.yml
M	ggml.c

commit	a04a953cab583f0229e7b4b506346e3e9a85c8d0	623494a478134432fd2d7ee40135770a3340674f	2024-06-19T13:04:36+03:00	Georgi Gerganov	codecov : remove (#8004)
M	.github/labeler.yml
D	.github/workflows/code-coverage.yml
D	codecov.yml

commit	623494a478134432fd2d7ee40135770a3340674f	37bef8943312d91183ff06d8f1214082a17344a5	2024-06-19T09:11:51+08:00	Meng, Hengyu	[SYCL] refactor (#6408)
M	ggml-sycl.cpp
M	ggml-sycl/backend.hpp
A	ggml-sycl/convert.cpp
A	ggml-sycl/convert.hpp
A	ggml-sycl/dequantize.hpp
A	ggml-sycl/dmmv.cpp
A	ggml-sycl/dmmv.hpp
A	ggml-sycl/mmq.cpp
A	ggml-sycl/mmq.hpp
A	ggml-sycl/mmvq.cpp
A	ggml-sycl/mmvq.hpp
M	ggml-sycl/presets.hpp
A	ggml-sycl/vecdotq.hpp

commit	37bef8943312d91183ff06d8f1214082a17344a5	91c188d6c296bd3384f2a02a83b71187aa3d18b3	2024-06-18T18:40:52+02:00	jaime-m-p	tokenizer : BPE fixes (#7530)
M	llama.cpp
M	scripts/gen-unicode-data.py
M	tests/test-tokenizer-random.py
M	unicode-data.cpp
M	unicode.cpp

commit	91c188d6c296bd3384f2a02a83b71187aa3d18b3	84f6de17f6a8602e7ff7f7c7bda36a73f510a2dd	2024-06-18T14:19:45+02:00	Sigbjørn Skjæret	Only use FIM middle token if it exists (#7648)
M	examples/infill/infill.cpp
M	examples/server/server.cpp

commit	84f6de17f6a8602e7ff7f7c7bda36a73f510a2dd	61665277afde2add00c0d387acb94ed5feb95917	2024-06-18T09:18:32-03:00	jojorne	Fix no gcc pragma on Windows (#7751)
M	sgemm.cpp

commit	61665277afde2add00c0d387acb94ed5feb95917	b96f9afb0d58b003ac8d1d0c94cd99393a3bc437	2024-06-18T14:00:14+02:00	Ulrich Drepper	Allow compiling with CUDA without CUDA runtime installed (#7989)
M	Makefile

commit	b96f9afb0d58b003ac8d1d0c94cd99393a3bc437	1193778105c9a81bd38f72c61aaafbaf85dc9c04	2024-06-18T15:11:40+08:00	Frank Mai	chore: clean useless beam search param (#7985)
M	common/common.h

commit	1193778105c9a81bd38f72c61aaafbaf85dc9c04	5326bcceeb7dd34f16d0fe61b134d1e074a8e65d	2024-06-17T23:57:41-07:00	Abheek Gulati	readme : update UI list (#7943)
M	README.md

commit	5326bcceeb7dd34f16d0fe61b134d1e074a8e65d	e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084	2024-06-18T09:50:45+03:00	Georgi Gerganov	ggml : sync
M	scripts/sync-ggml.last

commit	e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084	a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f	2024-06-18T09:37:20+03:00	Georgi Gerganov	whisper : use ggml_backend_sched (whisper/2239)
M	ggml-backend.c
M	ggml-backend.h

commit	a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f	5b6da187508f49a9fa9d95fa22ae804a0780d256	2024-06-17T22:08:46+03:00	Ștefan-Gabriel Muscalu	update: support Qwen2-57B-A14B (#7835)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	5b6da187508f49a9fa9d95fa22ae804a0780d256	7c26775adb579e92b59c82e8084c07a1d0f75e9c	2024-06-17T23:53:17+05:30	Srihari-mcw	Make updates to type cast based on compiler instead of OS (#7851)
M	ggml-impl.h

commit	7c26775adb579e92b59c82e8084c07a1d0f75e9c	b473e95084c286780165568cf0f385f21141d68d	2024-06-17T19:40:01+03:00	Georgi Gerganov	llama : disable FA if KV head size do not match (#7982)
M	llama.cpp

commit	b473e95084c286780165568cf0f385f21141d68d	99052cd227c7182fcf53343d2e7d33bfa180a9cf	2024-06-17T17:37:55+02:00	Bryan Honof	Add Nix and Flox install instructions (#7899)
M	README.md

commit	99052cd227c7182fcf53343d2e7d33bfa180a9cf	c637fcd34d135a9ff4f97d3a53ad03a910a4a31f	2024-06-17T16:51:42+02:00	slaren	sched : offload_op also requires supports_op (#7977)
M	ggml-backend.c

commit	c637fcd34d135a9ff4f97d3a53ad03a910a4a31f	6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79	2024-06-17T22:11:08+08:00	Frank Mai	fix: divide 0 exception in mamba (#7932)
M	llama.cpp

commit	6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79	21be9cab94e0b5b53cb6edeeebf8c8c799baad03	2024-06-17T16:10:15+02:00	Markus Tavenrath	Implement non-mapped async IO for CUDA on Windows.  (#7896)
M	llama.cpp

commit	21be9cab94e0b5b53cb6edeeebf8c8c799baad03	006167aaf6b6aaa4daa52961035f7460af19f469	2024-06-17T11:09:20+03:00	Georgi Gerganov	rpc : fix load/store misaligned addresses (#7948)
M	ggml-rpc.cpp

commit	006167aaf6b6aaa4daa52961035f7460af19f469	df68d4fa5dc929217d3e64d673e099d7a417b206	2024-06-17T15:25:20+10:00	Brian	gguf-dump.py: add --markdown dump output (#7853)
M	gguf-py/scripts/gguf-dump.py

commit	df68d4fa5dc929217d3e64d673e099d7a417b206	43b35e38ba371f9a7faa6dca4c5d1e8f698ffd87	2024-06-17T11:17:07+08:00	Neo Zhang	[SYCL] Update README-sycl.md for Chapter "Recommended release" and "News" (#7946)
M	README-sycl.md

commit	43b35e38ba371f9a7faa6dca4c5d1e8f698ffd87	19b7a836f6658e18e973af532a5cc6ad6b3a27f8	2024-06-16T15:23:04-07:00	Calvin Laurenson	Add support for sqrt on CUDA (#7953)
M	examples/cvector-generator/pca.hpp
M	ggml-cuda.cu
M	ggml-cuda/unary.cu
M	ggml-cuda/unary.cuh
M	tests/test-backend-ops.cpp

commit	19b7a836f6658e18e973af532a5cc6ad6b3a27f8	b5fcf8ef5c29df53cfff60e180b4992a3b2332a6	2024-06-11T17:39:01+03:00	Georgi Gerganov	cuda : fix bounds check for src0 rows in MMVQ kernel (whisper/2231)
M	ggml-cuda/mmvq.cu

commit	b5fcf8ef5c29df53cfff60e180b4992a3b2332a6	398105ff4373eea385ea8e8625cb417b2ae51134	2024-06-16T16:53:11+08:00	Hong Bo PENG	ggml : fix and optimize ppc64le (ggml/849)
M	ggml-quants.c

commit	398105ff4373eea385ea8e8625cb417b2ae51134	bc6c457fa35f6791e9a2bb61108e7d49e8fc98bd	2024-06-16T10:51:18+02:00	Daniel Bevenius	ggml : remove duplicate include of ggml-common.h (ggml/853)
M	ggml-quants.c

commit	bc6c457fa35f6791e9a2bb61108e7d49e8fc98bd	52399254b3bceda279b4ea9111a983e32310166e	2024-06-16T19:16:21+03:00	Georgi Gerganov	flake.lock: Update (#7951)
M	flake.lock

commit	52399254b3bceda279b4ea9111a983e32310166e	6fe1c627413725ddc1f9e323f6b13fe388c53e0a	2024-06-16T14:51:40+03:00	Georgi Gerganov	unicode : avoid char32_t (#7957)
M	llama.cpp
M	unicode.cpp
M	unicode.h

commit	6fe1c627413725ddc1f9e323f6b13fe388c53e0a	cddaf028adc738b5a7ecc60809cb78e0ba0f97c1	2024-06-16T13:51:18+02:00	hopkins385	readme : update UI list [no ci] (#7958)
M	README.md

commit	cddaf028adc738b5a7ecc60809cb78e0ba0f97c1	c8a82194a888f68f259e0d0fa96f3332ac7c5cb6	2024-06-16T14:50:12+03:00	Georgi Gerganov	ggml : fix handling of zero blocks in IQ quants (#7955)
M	ggml-quants.c

commit	c8a82194a888f68f259e0d0fa96f3332ac7c5cb6	7c7836d9d4062d6858e3fb337b135c417ccee6ce	2024-06-16T10:46:51+03:00	Georgi Gerganov	github : update pr template
M	.github/pull_request_template.md

commit	7c7836d9d4062d6858e3fb337b135c417ccee6ce	0c7b3595b9e5ad2355818e259f06b0dc3f0065b3	2024-06-16T07:17:31+02:00	0cc4m	Vulkan Shader Refactor, Memory Debugging Option (#7947)
M	CMakeLists.txt
M	Makefile
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py
A	vulkan-shaders/add.comp
A	vulkan-shaders/argsort.comp
A	vulkan-shaders/clamp.comp
A	vulkan-shaders/copy.comp
A	vulkan-shaders/dequant_f32.comp
A	vulkan-shaders/dequant_funcs.comp
A	vulkan-shaders/dequant_head.comp
A	vulkan-shaders/dequant_q2_k.comp
A	vulkan-shaders/dequant_q3_k.comp
A	vulkan-shaders/dequant_q4_0.comp
A	vulkan-shaders/dequant_q4_1.comp
A	vulkan-shaders/dequant_q4_k.comp
A	vulkan-shaders/dequant_q5_0.comp
A	vulkan-shaders/dequant_q5_1.comp
A	vulkan-shaders/dequant_q5_k.comp
A	vulkan-shaders/dequant_q6_k.comp
A	vulkan-shaders/dequant_q8_0.comp
A	vulkan-shaders/diag_mask_inf.comp
A	vulkan-shaders/div.comp
A	vulkan-shaders/gelu.comp
A	vulkan-shaders/generic_binary_head.comp
A	vulkan-shaders/generic_head.comp
A	vulkan-shaders/generic_unary_head.comp
A	vulkan-shaders/get_rows.comp
A	vulkan-shaders/get_rows_quant.comp
A	vulkan-shaders/mul.comp
A	vulkan-shaders/mul_mat_split_k_reduce.comp
A	vulkan-shaders/mul_mat_vec.comp
A	vulkan-shaders/mul_mat_vec_base.comp
A	vulkan-shaders/mul_mat_vec_nc.comp
A	vulkan-shaders/mul_mat_vec_p021.comp
A	vulkan-shaders/mul_mat_vec_q2_k.comp
A	vulkan-shaders/mul_mat_vec_q3_k.comp
A	vulkan-shaders/mul_mat_vec_q4_k.comp
A	vulkan-shaders/mul_mat_vec_q5_k.comp
A	vulkan-shaders/mul_mat_vec_q6_k.comp
A	vulkan-shaders/mul_mm.comp
A	vulkan-shaders/norm.comp
A	vulkan-shaders/relu.comp
A	vulkan-shaders/rms_norm.comp
A	vulkan-shaders/rope_head.comp
A	vulkan-shaders/rope_neox.comp
A	vulkan-shaders/rope_norm.comp
A	vulkan-shaders/scale.comp
A	vulkan-shaders/silu.comp
A	vulkan-shaders/soft_max.comp
A	vulkan-shaders/square.comp
A	vulkan-shaders/sum_rows.comp
A	vulkan-shaders/types.comp

commit	0c7b3595b9e5ad2355818e259f06b0dc3f0065b3	7b2f4a7d193ef2475259bbe7656fcccfab4b1217	2024-06-15T18:53:40+02:00	Xuan Son Nguyen	Add `cvector-generator` example (#7514)
M	.editorconfig
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
A	examples/cvector-generator/CMakeLists.txt
A	examples/cvector-generator/README.md
A	examples/cvector-generator/completions.txt
A	examples/cvector-generator/cvector-generator.cpp
A	examples/cvector-generator/negative.txt
A	examples/cvector-generator/pca.hpp
A	examples/cvector-generator/positive.txt

commit	7b2f4a7d193ef2475259bbe7656fcccfab4b1217	f8ec8877b75774fc6c47559d529dac423877bcad	2024-06-15T14:05:10+08:00	Meng, Hengyu	[SYCL] remove global variables (#7710)
M	CMakeLists.txt
M	ggml-sycl.cpp
M	ggml-sycl.h
A	ggml-sycl/backend.hpp
A	ggml-sycl/common.cpp
A	ggml-sycl/common.hpp
A	ggml-sycl/dpct/helper.hpp
A	ggml-sycl/presets.hpp
M	llama.cpp

commit	f8ec8877b75774fc6c47559d529dac423877bcad	76d66ee0be91e2bec93206e821ee1db8d023cff5	2024-06-14T20:28:34+03:00	olexiyb	ci : fix macos x86 build (#7940)
M	.github/workflows/build.yml

commit	76d66ee0be91e2bec93206e821ee1db8d023cff5	66ef1ceedf983773c8ceb4d925285d41d4e50e2a	2024-06-14T18:41:49+02:00	Johannes Gäßler	CUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921)
M	ggml-cuda.cu
M	ggml-cuda/argsort.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/mmq.cuh
M	ggml-cuda/softmax.cu
M	ggml-cuda/vecdotq.cuh

commit	66ef1ceedf983773c8ceb4d925285d41d4e50e2a	e65bbf606c61f49dc06c7ac060cd5ba7ae446025	2024-06-14T17:14:09+03:00	Georgi Gerganov	metal : utilize max shared memory for mul_mat_id (#7935)
M	ggml-metal.m

commit	e65bbf606c61f49dc06c7ac060cd5ba7ae446025	6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4	2024-06-14T16:47:41+03:00	Radoslav Gerganov	llama-bench : fix RPC indication (#7936)
M	examples/llama-bench/llama-bench.cpp

commit	6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4	41b9260f18eb7f325c952006ac46afc1d0d8ad2f	2024-06-14T12:20:04+02:00	Sigbjørn Skjæret	llama : more checks before assuming FIM tokens (#7644)
M	llama.cpp

commit	41b9260f18eb7f325c952006ac46afc1d0d8ad2f	172c8256840ffd882ab9992ecedbb587d9b21f15	2024-06-14T13:16:49+03:00	Elaine	convert : add Poro-34B-chat tokenizer support (#7713)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	172c8256840ffd882ab9992ecedbb587d9b21f15	a55eb1bf0fa2fd84147bdfd384391e029d988253	2024-06-13T15:18:44+03:00	Radoslav Gerganov	rpc : fix ggml_backend_rpc_supports_buft() (#7918)
M	ggml-rpc.cpp

commit	a55eb1bf0fa2fd84147bdfd384391e029d988253	f578b86b2123d0f92afbaa98a031df4d4464e582	2024-06-13T09:42:41+02:00	Galunid	readme : Remove outdated instructions from README.md (#7914) [no ci]
M	README.md

commit	f578b86b2123d0f92afbaa98a031df4d4464e582	1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7	2024-06-13T03:11:35+02:00	slaren	move BLAS to a separate backend (#6210)
M	CMakeLists.txt
M	Makefile
M	examples/llama-bench/llama-bench.cpp
M	ggml-alloc.c
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
A	ggml-blas.cpp
A	ggml-blas.h
M	ggml-cuda.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-rpc.cpp
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	llama.cpp

commit	1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7	963552903f51043ee947a8deeaaa7ec00bc3f1a4	2024-06-13T00:41:52+01:00	Olivier Chafik	`build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809)
M	.devops/cloud-v-pipeline
R088	.devops/main-cuda.Dockerfile	.devops/llama-cli-cuda.Dockerfile
R078	.devops/main-intel.Dockerfile	.devops/llama-cli-intel.Dockerfile
R094	.devops/main-rocm.Dockerfile	.devops/llama-cli-rocm.Dockerfile
R081	.devops/main-vulkan.Dockerfile	.devops/llama-cli-vulkan.Dockerfile
R072	.devops/main.Dockerfile	.devops/llama-cli.Dockerfile
M	.devops/llama-cpp-clblast.srpm.spec
M	.devops/llama-cpp-cuda.srpm.spec
M	.devops/llama-cpp.srpm.spec
R088	.devops/server-cuda.Dockerfile	.devops/llama-server-cuda.Dockerfile
R080	.devops/server-intel.Dockerfile	.devops/llama-server-intel.Dockerfile
R094	.devops/server-rocm.Dockerfile	.devops/llama-server-rocm.Dockerfile
R082	.devops/server-vulkan.Dockerfile	.devops/llama-server-vulkan.Dockerfile
R074	.devops/server.Dockerfile	.devops/llama-server.Dockerfile
M	.devops/nix/apps.nix
M	.devops/nix/package.nix
M	.devops/tools.sh
M	.dockerignore
M	.github/ISSUE_TEMPLATE/01-bug-low.yml
M	.github/ISSUE_TEMPLATE/02-bug-medium.yml
M	.github/ISSUE_TEMPLATE/03-bug-high.yml
M	.github/ISSUE_TEMPLATE/04-bug-critical.yml
M	.github/workflows/bench.yml
M	.github/workflows/build.yml
M	.github/workflows/docker.yml
M	.github/workflows/server.yml
M	.gitignore
M	Makefile
M	README-sycl.md
M	README.md
M	ci/run.sh
M	docs/HOWTO-add-model.md
M	docs/token_generation_performance_tips.md
M	examples/CMakeLists.txt
M	examples/Miku.sh
M	examples/baby-llama/CMakeLists.txt
M	examples/base-translate.sh
M	examples/batched-bench/CMakeLists.txt
M	examples/batched-bench/README.md
M	examples/batched.swift/Makefile
M	examples/batched.swift/Package.swift
M	examples/batched.swift/README.md
M	examples/batched/CMakeLists.txt
M	examples/batched/README.md
M	examples/benchmark/CMakeLists.txt
M	examples/chat-13B.sh
M	examples/chat-persistent.sh
M	examples/chat-vicuna.sh
M	examples/chat.sh
M	examples/convert-llama2c-to-ggml/CMakeLists.txt
M	examples/convert-llama2c-to-ggml/README.md
M	examples/embedding/CMakeLists.txt
M	examples/embedding/README.md
M	examples/eval-callback/CMakeLists.txt
M	examples/eval-callback/README.md
M	examples/export-lora/CMakeLists.txt
M	examples/export-lora/README.md
M	examples/finetune/CMakeLists.txt
M	examples/finetune/README.md
M	examples/finetune/finetune.sh
M	examples/gbnf-validator/CMakeLists.txt
M	examples/gbnf-validator/gbnf-validator.cpp
M	examples/gguf-split/CMakeLists.txt
M	examples/gguf-split/tests.sh
M	examples/gguf/CMakeLists.txt
M	examples/gritlm/CMakeLists.txt
M	examples/gritlm/README.md
M	examples/imatrix/CMakeLists.txt
M	examples/imatrix/README.md
M	examples/infill/CMakeLists.txt
M	examples/infill/README.md
M	examples/jeopardy/jeopardy.sh
M	examples/json-schema-pydantic-example.py
M	examples/json_schema_to_grammar.py
M	examples/llama-bench/README.md
M	examples/llava/CMakeLists.txt
M	examples/llava/MobileVLM-README.md
M	examples/llava/README.md
M	examples/llava/android/adb_run.sh
M	examples/lookahead/CMakeLists.txt
M	examples/lookup/CMakeLists.txt
M	examples/lookup/lookup-merge.cpp
M	examples/main-cmake-pkg/CMakeLists.txt
M	examples/main-cmake-pkg/README.md
M	examples/main/CMakeLists.txt
M	examples/main/README.md
M	examples/parallel/CMakeLists.txt
M	examples/passkey/CMakeLists.txt
M	examples/passkey/README.md
M	examples/perplexity/CMakeLists.txt
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/CMakeLists.txt
M	examples/quantize/CMakeLists.txt
M	examples/quantize/tests.sh
M	examples/reason-act.sh
M	examples/retrieval/CMakeLists.txt
M	examples/retrieval/README.md
M	examples/rpc/README.md
M	examples/save-load-state/CMakeLists.txt
M	examples/server-llama2-13B.sh
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/bench/README.md
M	examples/server/bench/bench.py
M	examples/server/public_simplechat/readme.md
M	examples/server/tests/README.md
M	examples/server/tests/features/steps/steps.py
M	examples/simple/CMakeLists.txt
M	examples/speculative/CMakeLists.txt
M	examples/sycl/CMakeLists.txt
M	examples/sycl/README.md
M	examples/sycl/run-llama2.sh
M	examples/tokenize/CMakeLists.txt
M	examples/train-text-from-scratch/CMakeLists.txt
M	examples/train-text-from-scratch/README.md
M	flake.nix
M	grammars/README.md
M	pocs/vdot/CMakeLists.txt
M	scripts/get-hellaswag.sh
M	scripts/get-wikitext-103.sh
M	scripts/get-wikitext-2.sh
M	scripts/get-winogrande.sh
M	scripts/hf.sh
M	scripts/pod-llama.sh
M	scripts/qnt-all.sh
M	scripts/run-all-ppl.sh
M	scripts/run-with-preset.py
M	scripts/server-llm.sh

commit	963552903f51043ee947a8deeaaa7ec00bc3f1a4	a9cae48003dfc4fe95b8f5c81682fc6e63425235	2024-06-12T17:41:51+02:00	Johannes Gäßler	CUDA: fix broken oob check for FA vec f32 kernel (#7904)
M	ggml-cuda/fattn-vec-f32.cuh

commit	a9cae48003dfc4fe95b8f5c81682fc6e63425235	bfaa676b0841617d4ef3596e63aca6be1a8eb1b5	2024-06-12T16:00:22+03:00	Georgi Gerganov	tests : add non-cont unary tests (#7857)
M	ggml-cuda.cu
M	ggml-cuda/unary.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	tests/test-backend-ops.cpp

commit	bfaa676b0841617d4ef3596e63aca6be1a8eb1b5	704a35b183748954013bd875bbbfdd9eaca14e62	2024-06-12T15:24:20+03:00	Georgi Gerganov	ggml : improve ggml_is_contiguous logic (#7856)
M	ggml.c

commit	704a35b183748954013bd875bbbfdd9eaca14e62	dcf752707d96eb305f546526c7bc5d01f0831130	2024-06-12T14:42:29+03:00	Georgi Gerganov	server : restore numeric prompts (#7883)
M	examples/server/server.cpp

commit	dcf752707d96eb305f546526c7bc5d01f0831130	f2b5764beb35583295e2475479c18f249b139b58	2024-06-12T17:05:35+08:00	Meng, Hengyu	update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894)
M	.devops/main-intel.Dockerfile
M	.devops/server-intel.Dockerfile

commit	f2b5764beb35583295e2475479c18f249b139b58	73bac2b11d7d3e20982fc9ee607625836387db8b	2024-06-12T03:18:16+02:00	Patrice Ferlet	Fix a typo and add Fedora 40 pacakge to install for Vulkan (#7794) [no ci]
M	README.md

commit	73bac2b11d7d3e20982fc9ee607625836387db8b	ef52d1d16afc695d798396cdd13594ea5e45a9dd	2024-06-12T03:26:05+08:00	k.h.lai	vulkan: select only one device for single gpu with multiple drivers (#7582)
M	ggml-vulkan.cpp

commit	ef52d1d16afc695d798396cdd13594ea5e45a9dd	14f83526cd27f638c856ea6eff08110b9860eb2a	2024-06-11T21:20:29+02:00	0cc4m	Update Vulkan RoPE implementation (#7818)
M	ggml-alloc.c
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	14f83526cd27f638c856ea6eff08110b9860eb2a	6fe42d073f0554eada93ac9d40574025aeedb703	2024-06-11T12:18:58-04:00	Deven Mistry	fix broken link in pr template (#7880) [no ci]
M	.github/pull_request_template.md

commit	6fe42d073f0554eada93ac9d40574025aeedb703	148995e5e57b313cce2672f75610db58c6327a51	2024-06-12T00:43:41+10:00	Brian	github: move PR template to .github/ root (#7868)
R100	.github/PULL_REQUEST_TEMPLATE/pull_request_template.md	.github/pull_request_template.md

commit	148995e5e57b313cce2672f75610db58c6327a51	4bfe50f741479c1df1c377260c3ff5702586719e	2024-06-11T14:45:40+02:00	Johannes Gäßler	llama-bench: more compact markdown tables (#7879)
M	examples/llama-bench/llama-bench.cpp

commit	4bfe50f741479c1df1c377260c3ff5702586719e	bdcb8f42221bc40c411150a009a3d3a30fa74722	2024-06-11T10:10:20+03:00	Georgi Gerganov	tests : check the Python version (#7872)
M	tests/test-json-schema-to-grammar.cpp

commit	bdcb8f42221bc40c411150a009a3d3a30fa74722	c2ce6c47e4f2d891bf29d8810832a3b310a8f205	2024-06-11T08:26:07+02:00	Johannes Gäßler	CUDA: int8 tensor cores for MMQ (q4_K, q5_K, q6_K) (#7860)
M	ggml-cuda/mma.cuh
M	ggml-cuda/mmq.cuh

commit	c2ce6c47e4f2d891bf29d8810832a3b310a8f205	b61eb9644d64e90123ac805436d95b94b3b4cc3f	2024-06-11T07:59:20+02:00	slaren	fix CUDA CI by using a windows-2019 image (#7861)
M	.github/workflows/build.yml

commit	b61eb9644d64e90123ac805436d95b94b3b4cc3f	396b18dfec2c56846e80362db70af09b9e1d70ba	2024-06-11T02:22:57+01:00	Olivier Chafik	json: refine constraint for whitespace to avoid runaways yet allow pretty print (#7866)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	grammars/json.gbnf
M	grammars/json_arr.gbnf
M	tests/test-json-schema-to-grammar.cpp

commit	396b18dfec2c56846e80362db70af09b9e1d70ba	864a99e7a01d9422d2f55618dbe62c8099a2175c	2024-06-11T01:00:30+01:00	Olivier Chafik	`json`: document schema conversion in GBNF readme, align manual grammar examples & converters (#7841)
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	grammars/README.md
M	grammars/json.gbnf
M	grammars/json_arr.gbnf
M	tests/test-json-schema-to-grammar.cpp

commit	864a99e7a01d9422d2f55618dbe62c8099a2175c	fd5ea0f897ecb3659d6c269ef6f3d833e865ead7	2024-06-10T18:32:10-04:00	Jared Van Bortel	cmake : fix CMake requirement for CUDA (#7821)
M	CMakeLists.txt

commit	fd5ea0f897ecb3659d6c269ef6f3d833e865ead7	c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40	2024-06-10T14:18:41+02:00	slaren	ci : try win-2019 on server windows test (#7854)
M	.github/workflows/server.yml

commit	c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40	d9da0e4986f121c727bdd9579a6688097b11602c	2024-06-10T15:00:15+03:00	Georgi Gerganov	examples : remove --instruct remnants (#7846)
M	README.md
D	examples/alpaca.sh
D	examples/gpt4all.sh
D	examples/llama2-13b.sh
D	examples/llama2.sh

commit	d9da0e4986f121c727bdd9579a6688097b11602c	1f0dabda8d5c131f9d4632aa41de74317cdd61fb	2024-06-10T14:59:55+03:00	Georgi Gerganov	server : improve "prompt" handling (#7847)
M	examples/server/server.cpp

commit	1f0dabda8d5c131f9d4632aa41de74317cdd61fb	af4ae502ddaeb03cd5861273ca2e9a5ae4551db7	2024-06-10T11:45:13+02:00	Johannes Gäßler	CUDA: use tensor cores for MMQ (#7676)
M	ggml-cuda/common.cuh
M	ggml-cuda/fattn-common.cuh
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-vec-f16.cuh
M	ggml-cuda/fattn-wmma-f16.cuh
A	ggml-cuda/mma.cuh
M	ggml-cuda/mmq.cuh

commit	af4ae502ddaeb03cd5861273ca2e9a5ae4551db7	10ceba354a3b152ff425e9fa97f9caaef99a46b1	2024-06-10T02:21:31-07:00	Ben Ashbaugh	use the correct SYCL context for host USM allocations (#7777)
M	ggml-sycl.cpp

commit	10ceba354a3b152ff425e9fa97f9caaef99a46b1	e95beeb1fc4621826ddd616776dbdf717366bf5c	2024-06-10T02:04:50+03:00	Georgi Gerganov	flake.lock: Update (#7838)
M	flake.lock

commit	e95beeb1fc4621826ddd616776dbdf717366bf5c	57bf62ce7cb75cca589943e2050d29bff4026e76	2024-06-09T20:19:35+03:00	Georgi Gerganov	imatrix : handle partial entries (#7833)
M	examples/imatrix/imatrix.cpp

commit	57bf62ce7cb75cca589943e2050d29bff4026e76	3e2ee443159724e2d3a0741f6b167e599ec088aa	2024-06-09T11:24:29-04:00	Nicolás Pérez	docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700)
A	.github/PULL_REQUEST_TEMPLATE/pull_request_template.md
A	CONTRIBUTING.md

commit	3e2ee443159724e2d3a0741f6b167e599ec088aa	42b53d192f4e3abf1b7c8e424628424504ea5dc5	2024-06-09T12:50:35+02:00	mgroeber9110	server: do not remove whitespace at the start of a completion chunk (#7830)
M	examples/server/public/index-new.html

commit	42b53d192f4e3abf1b7c8e424628424504ea5dc5	2decf57bc6e4a6b45176c3727d964a01161beecc	2024-06-09T09:42:25+02:00	Johannes Gäßler	CUDA: revise q8_1 data layout for mul_mat_q (#7824)
M	ggml-cuda.cu
M	ggml-cuda/mmq.cu
M	ggml-cuda/mmq.cuh
M	ggml-cuda/quantize.cu
M	ggml-cuda/quantize.cuh

commit	2decf57bc6e4a6b45176c3727d964a01161beecc	5795b941827fdec6c1662986de962badff456718	2024-06-09T06:39:25Z	sasha0552	convert-hf : set the model name based on cli arg, if present (#7693)
M	convert-hf-to-gguf.py

commit	5795b941827fdec6c1662986de962badff456718	ed9f2521185706481501a5e6d5315397b11802ff	2024-06-08T22:47:25-04:00	compilade	convert-hf : match model part name prefix and suffix (#7687)
M	convert-hf-to-gguf.py

commit	ed9f2521185706481501a5e6d5315397b11802ff	fe1e3917cfa0f9397a765cfd0aef880674d938d5	2024-06-08T22:34:29-04:00	compilade	gguf-py : decouple adding metadata from writing in GGUFWriter (#7827)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/scripts/gguf-new-metadata.py

commit	fe1e3917cfa0f9397a765cfd0aef880674d938d5	d4d915d351d1f1270d56184bdd46672893e8a5d8	2024-06-09T01:43:39+02:00	slaren	Revert "[SYCL] Update rpc-server.cpp to include SYCL backend (#7682)" (#7808)
M	examples/rpc/rpc-server.cpp

commit	d4d915d351d1f1270d56184bdd46672893e8a5d8	7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f	2024-06-08T20:21:08+01:00	Olivier Chafik	url: save -mu downloads to new cache location (#7826)
M	common/common.cpp
M	common/common.h

commit	7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f	da799b41891e34aac86ce4e173f9c4c0afd4fab3	2024-06-08T07:50:31Z	sasha0552	server : smart slot selection using Longest Common Prefix (#7728)
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	da799b41891e34aac86ce4e173f9c4c0afd4fab3	c00fad71e507ff386d42bd74846fe06d19dd63a4	2024-06-07T19:47:49+02:00	slaren	vulkan : reuse parent extra for views (#7806)
M	ggml-vulkan.cpp

commit	c00fad71e507ff386d42bd74846fe06d19dd63a4	27615f5ab21060d96953c9c1e223051ab2188f57	2024-06-07T08:56:01-04:00	Christian Zhou-Zheng	gguf-split : change binary multi-byte units to decimal (#7803)
M	examples/gguf-split/gguf-split.cpp

commit	27615f5ab21060d96953c9c1e223051ab2188f57	7027b27d765db95d4ac6b569d976e387a8715881	2024-06-07T05:15:07-07:00	intelmatt	cmake : fix BUILD_SHARED_LIBS=ON build (#7784)
M	common/CMakeLists.txt

commit	7027b27d765db95d4ac6b569d976e387a8715881	a5cabd76491f07494c5b8267f921c73f5e2bbfb4	2024-06-07T11:15:49+02:00	Johannes Gäßler	server: update cache_prompt documentation [no ci] (#7745)
M	examples/server/README.md

commit	a5cabd76491f07494c5b8267f921c73f5e2bbfb4	d5c938cd7716b9a2ace49a43a469dfbffcff4d28	2024-06-07T15:09:45+08:00	woodx	server : do not get prompt in infill mode (#7286)
M	examples/server/server.cpp

commit	d5c938cd7716b9a2ace49a43a469dfbffcff4d28	c9ee7118d5644dd3df70ea6878b36a9761616aab	2024-06-07T14:28:26+08:00	pengxin99	[SYCL] fix softmax r2r result wrong issue (#7811)
M	ggml-sycl.cpp

commit	c9ee7118d5644dd3df70ea6878b36a9761616aab	ee459f40f65810a810151b24eba5b8bd174ceffe	2024-06-07T08:01:29+02:00	slaren	check for nans in imatrix and quantize (#7807)
M	examples/imatrix/imatrix.cpp
M	llama.cpp

commit	ee459f40f65810a810151b24eba5b8bd174ceffe	f83351f9a62a6262f1fc3d08f320033089cddfb5	2024-06-06T19:19:59+03:00	Georgi Gerganov	server : fix --threads-http arg (#7801)
M	common/common.cpp
M	common/common.h

commit	f83351f9a62a6262f1fc3d08f320033089cddfb5	ad675e1c67a05b16e4e12abe30dbecfc808e7b7e	2024-06-06T16:30:58+03:00	Georgi Gerganov	imatrix : migrate to gpt_params (#7771)
M	common/common.cpp
M	common/common.h
M	examples/imatrix/README.md
M	examples/imatrix/imatrix.cpp
M	examples/server/server.cpp

commit	ad675e1c67a05b16e4e12abe30dbecfc808e7b7e	a143c04375828b1f72eb1a326115791b63e79345	2024-06-06T06:08:52-07:00	Clint Herron	Added support for . (any character) token in grammar engine. (#6467)
M	common/grammar-parser.cpp
M	llama.cpp
M	llama.h
M	tests/test-grammar-integration.cpp

commit	a143c04375828b1f72eb1a326115791b63e79345	55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6	2024-06-06T09:17:54-03:00	Mattheus Chediak	README minor fixes (#7798) [no ci]
M	README.md

commit	55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6	f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f	2024-06-06T10:07:06+01:00	Olivier Chafik	grammars: x{min,max} repetition operator (#6640)
M	common/grammar-parser.cpp
M	common/json-schema-to-grammar.cpp
M	examples/json_schema_to_grammar.py
M	examples/pydantic_models_to_grammar.py
M	examples/server/public/json-schema-to-grammar.mjs
M	grammars/README.md
M	tests/test-grammar-integration.cpp
M	tests/test-grammar-parser.cpp
M	tests/test-json-schema-to-grammar.cpp

commit	f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f	2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f	2024-06-06T09:22:41+02:00	Joan Fontanals	llama : add jina v2 base code (#7596)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f	d67caea0d6e6c303d31b01d0a010973e6c908dff	2024-06-06T07:19:49+02:00	slaren	docker : build only main and server in their images (#7782)
M	.devops/main-cuda.Dockerfile
M	.devops/main-rocm.Dockerfile
M	.devops/main.Dockerfile
M	.devops/server-cuda.Dockerfile
M	.devops/server.Dockerfile

commit	d67caea0d6e6c303d31b01d0a010973e6c908dff	7672adeec7a79ea271058c63106c142ba84f951a	2024-06-06T07:17:21+02:00	slaren	docker : add openmp lib (#7780)
M	.devops/full-cuda.Dockerfile
M	.devops/full.Dockerfile
M	.devops/main-cuda.Dockerfile
M	.devops/main-vulkan.Dockerfile
M	.devops/main.Dockerfile
M	.devops/server-cuda.Dockerfile
M	.devops/server.Dockerfile

commit	7672adeec7a79ea271058c63106c142ba84f951a	7d1a378b8fb266782d9248538a661405aad80768	2024-06-05T19:07:24+02:00	Galunid	Fix encoding in python scripts (#7733)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py

commit	7d1a378b8fb266782d9248538a661405aad80768	2b3389677a833cee0880226533a1768b1a9508d2	2024-06-05T16:53:00+02:00	Johannes Gäßler	CUDA: refactor mmq, dmmv, mmvq (#7716)
M	CMakeLists.txt
M	Makefile
M	ggml-common.h
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/dmmv.cu
M	ggml-cuda/mmq.cu
M	ggml-cuda/mmq.cuh
M	ggml-cuda/mmvq.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs256-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q8_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs256-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-f16.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_0.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_1.cu
M	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q8_0.cu
M	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb16.cu
M	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb32.cu
M	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb16.cu
M	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb32.cu
M	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb8.cu
M	ggml-cuda/template-instances/generate_cu_files.py
A	ggml-cuda/template-instances/mmq-instance-q2_k.cu
A	ggml-cuda/template-instances/mmq-instance-q3_k.cu
A	ggml-cuda/template-instances/mmq-instance-q4_0.cu
A	ggml-cuda/template-instances/mmq-instance-q4_1.cu
A	ggml-cuda/template-instances/mmq-instance-q4_k.cu
A	ggml-cuda/template-instances/mmq-instance-q5_0.cu
A	ggml-cuda/template-instances/mmq-instance-q5_1.cu
A	ggml-cuda/template-instances/mmq-instance-q5_k.cu
A	ggml-cuda/template-instances/mmq-instance-q6_k.cu
A	ggml-cuda/template-instances/mmq-instance-q8_0.cu
M	ggml-cuda/vecdotq.cuh

commit	2b3389677a833cee0880226533a1768b1a9508d2	9973e81c5ccf4f31b3980f5aa73f5cfea8699860	2024-06-05T11:29:20+03:00	Georgi Gerganov	ggml : refactor rope norm/neox (#7634)
M	examples/baby-llama/baby-llama.cpp
M	examples/convert-legacy-llama.py
M	examples/finetune/finetune.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda/rope.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	kompute-shaders/op_rope_f16.comp
M	kompute-shaders/op_rope_f32.comp
M	kompute-shaders/rope_common.comp
M	llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-grad0.cpp
M	tests/test-rope.cpp

commit	9973e81c5ccf4f31b3980f5aa73f5cfea8699860	c90dbe026b456a233f8f0fbe752212e6a0503ca2	2024-06-04T23:40:49-07:00	arch-btw	readme : remove -ins (#7759)
M	examples/main/README.md

commit	c90dbe026b456a233f8f0fbe752212e6a0503ca2	b90dc566c1c615289b05b50d61680f23744a21e7	2024-06-05T01:26:14+02:00	jaime-m-p	Fix per token atrributes bits (#7749)
M	llama.h

commit	b90dc566c1c615289b05b50d61680f23744a21e7	1442677f92e45a475be7b4d056e3633d1d6f813b	2024-06-04T21:06:49+01:00	agray3	Allow number of nodes in CUDA graph to change (#7738)
M	ggml-cuda.cu

commit	1442677f92e45a475be7b4d056e3633d1d6f813b	554c247caffed64465f372661f2826640cb10430	2024-06-04T21:23:39+03:00	Georgi Gerganov	common : refactor cli arg parsing (#7675)
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/README.md
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/README.md
M	examples/batched/batched.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/gguf-split/tests.sh
M	examples/gritlm/gritlm.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/README.md
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/tests.sh
M	examples/retrieval/retrieval.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/simple/README.md
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	scripts/run-with-preset.py

commit	554c247caffed64465f372661f2826640cb10430	0cd6bd3483fa66124b76a8a8ac794d9ee18c70c1	2024-06-04T21:23:20+03:00	Georgi Gerganov	ggml : remove OpenCL (#7735)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	README-sycl.md
M	README.md
M	common/common.cpp
M	examples/llama-bench/README.md
M	examples/llama-bench/llama-bench.cpp
M	examples/main-cmake-pkg/README.md
M	flake.nix
M	ggml-metal.h
D	ggml-opencl.cpp
D	ggml-opencl.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/LlamaConfig.cmake.in
M	scripts/compare-llama-bench.py
M	scripts/server-llm.sh
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	0cd6bd3483fa66124b76a8a8ac794d9ee18c70c1	5ca0944a153b65724d51b2f484139aa25ccb7a8b	2024-06-04T21:23:05+03:00	Georgi Gerganov	llama : remove beam search (#7736)
M	Makefile
M	examples/CMakeLists.txt
D	examples/beam-search/CMakeLists.txt
D	examples/beam-search/beam-search.cpp
M	llama.cpp
M	llama.h

commit	5ca0944a153b65724d51b2f484139aa25ccb7a8b	adc9ff384121f4d550d28638a646b336d051bf42	2024-06-04T19:43:01+03:00	Georgi Gerganov	readme : remove obsolete Zig instructions (#7471)
M	README.md

commit	adc9ff384121f4d550d28638a646b336d051bf42	987d743d6bc4cee4bde6820733ea33a2abc0afac	2024-06-04T14:32:42+02:00	slaren	llama-bench : allow using a different printer for stderr with -oe (#7722)
M	examples/llama-bench/llama-bench.cpp
M	scripts/compare-commits.sh

commit	987d743d6bc4cee4bde6820733ea33a2abc0afac	b226c1227bcf6412076ecf787421135fd2c42ef0	2024-06-04T12:09:15Z	Daniele	Improve hipBLAS support in CMake (#7696)
M	CMakeLists.txt

commit	b226c1227bcf6412076ecf787421135fd2c42ef0	3b38d48609280aa5f8ab7ea135a4351b2a5ee240	2024-06-04T19:21:26+08:00	zhouwg	refine .gitignore (#7688)
M	.gitignore

commit	3b38d48609280aa5f8ab7ea135a4351b2a5ee240	6d1616944d9efd342ed2a4fd318722adfc9febcd	2024-06-04T09:17:17+02:00	jaime-m-p	Per token attributes (#7685)
M	llama.cpp
M	llama.h
M	models/ggml-vocab-phi-3.gguf
M	tests/test-tokenizer-random.py

commit	6d1616944d9efd342ed2a4fd318722adfc9febcd	bde7cd3cd949c1a85d3a199498ac98e78039d46f	2024-06-04T10:01:09+03:00	Georgi Gerganov	ggml : prevent builds with -ffinite-math-only (#7726)
M	cmake/arm64-windows-llvm.cmake
M	ggml.c

commit	bde7cd3cd949c1a85d3a199498ac98e78039d46f	a5735e4426b19a3ebd0c653ad8ac01420458ee95	2024-06-03T20:03:26+03:00	Radoslav Gerganov	llama : offload to RPC in addition to other backends (#7640)
M	Makefile
M	ggml-alloc.c
M	ggml-backend.c
M	ggml-backend.h
M	ggml-rpc.cpp
M	llama.cpp

commit	a5735e4426b19a3ebd0c653ad8ac01420458ee95	0b832d53ba0ffcc759c8d62ede3772dd62321f8e	2024-06-04T00:14:15+09:00	Masaya, Kato	ggml : use OpenMP as a thread pool (#7606)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	ggml.c

commit	0b832d53ba0ffcc759c8d62ede3772dd62321f8e	3d7ebf63123b8652fb7bbecef7ba731202309901	2024-06-03T16:28:58+02:00	Johannes Gäßler	make: fix debug options not being applied to NVCC (#7714)
M	Makefile

commit	3d7ebf63123b8652fb7bbecef7ba731202309901	a10cda58d3199cd85305e0f03a8c6056714ae2e8	2024-06-03T10:59:14+02:00	0cc4m	Vulkan Mixture of Experts (MoE) support (#7628)
M	common/common.cpp
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py
M	llama.cpp

commit	a10cda58d3199cd85305e0f03a8c6056714ae2e8	6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4	2024-06-03T01:06:24-07:00	Andy Tai	cmake : add pkg-config spec file for llama.cpp (#7702)
M	CMakeLists.txt
A	cmake/llama.pc.in

commit	6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4	549279d8049d78620a2b081e26edb654f83c3bbd	2024-06-03T15:49:30+08:00	zhangkaihuo	llama : MiniCPM support tied embeddings (#7664)
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	549279d8049d78620a2b081e26edb654f83c3bbd	9e405b6e2ecb888e860f7b92720b4809e21b3915	2024-06-03T08:34:43+03:00	Georgi Gerganov	llama : avoid double token-to-piece cache (#7654)
M	llama.cpp

commit	9e405b6e2ecb888e860f7b92720b4809e21b3915	3413ae2193d0693f14bead02e5018f442cbf579b	2024-06-03T07:32:16+02:00	woachk	kompute : implement op_getrows_f32 (#6403)
M	CMakeLists.txt
M	ggml-kompute.cpp
A	kompute-shaders/op_getrows_f32.comp

commit	3413ae2193d0693f14bead02e5018f442cbf579b	1669810d7c2446af8425aa54ff6611bf6f14646c	2024-06-03T07:59:54+10:00	Dave Airlie	fix bug introduced in using calloc (#7701)
M	ggml-alloc.c

commit	1669810d7c2446af8425aa54ff6611bf6f14646c	7c4e5b7eae26581869e782015d9deca947c34997	2024-06-03T00:13:12+03:00	Georgi Gerganov	flake.lock: Update (#7686)
M	flake.lock

commit	7c4e5b7eae26581869e782015d9deca947c34997	9422c5e34bbd302493b77a8f6d546154a1f4fe82	2024-06-02T13:39:08-04:00	Austin	chore : add ignore rule for generated server themes (#7689)
M	.gitignore

commit	9422c5e34bbd302493b77a8f6d546154a1f4fe82	e141ce624af57bdffbaf57014a044eb1d9689230	2024-06-02T19:13:54+10:00	nickp27	[SYCL] Update rpc-server.cpp to include SYCL backend (#7682)
M	examples/rpc/rpc-server.cpp

commit	e141ce624af57bdffbaf57014a044eb1d9689230	2e666832e6ac78194edf030bd1c295e21bdb022c	2024-06-01T23:26:10+02:00	Johannes Gäßler	Fix FlashAttention debug test, FP32 assert (#7684)
M	ggml-cuda/fattn-vec-f32.cuh
M	tests/test-backend-ops.cpp

commit	2e666832e6ac78194edf030bd1c295e21bdb022c	2ac95c9d5678d05e253691fb1f26471675bff5ad	2024-06-01T21:31:48+02:00	Yazan Agha-Schrader	server : new UI (#7633)
M	Makefile
M	examples/server/CMakeLists.txt
A	examples/server/public/colorthemes.css
A	examples/server/public/index-new.html
M	examples/server/public/index.html
A	examples/server/public/prompt-formats.js
A	examples/server/public/style.css
A	examples/server/public/system-prompts.js
A	examples/server/public/theme-beeninorder.css
A	examples/server/public/theme-ketivah.css
A	examples/server/public/theme-mangotango.css
A	examples/server/public/theme-playground.css
A	examples/server/public/theme-polarnight.css
A	examples/server/public/theme-snowstorm.css
M	examples/server/server.cpp

commit	2ac95c9d5678d05e253691fb1f26471675bff5ad	750f60c03e4d3f53fa51910551ce87a3d508d2d7	2024-06-01T21:50:18+05:30	HanishKVC	SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
M	README.md
A	examples/server/public_simplechat/datautils.mjs
M	examples/server/public_simplechat/index.html
M	examples/server/public_simplechat/readme.md
M	examples/server/public_simplechat/simplechat.css
M	examples/server/public_simplechat/simplechat.js
A	examples/server/public_simplechat/ui.mjs

commit	750f60c03e4d3f53fa51910551ce87a3d508d2d7	9b596417af11c9ac44fcae0fcfbc6f3665089083	2024-06-01T15:47:04+02:00	Johannes Gäßler	CUDA: fix Pascal FA, deq. KV to FP16 for batch > 8 (#7681)
M	ggml-cuda/fattn-common.cuh
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-tile-f32.cu
M	ggml-cuda/fattn-vec-f16.cuh
M	ggml-cuda/fattn-vec-f32.cuh
M	ggml-cuda/fattn-wmma-f16.cuh
M	ggml-cuda/fattn.cu

commit	9b596417af11c9ac44fcae0fcfbc6f3665089083	a323ec60af14a33d560df98f2cc41b4112cb4f80	2024-06-01T08:44:14+02:00	Johannes Gäßler	CUDA: quantized KV support for FA vec (#7527)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu
M	ggml-cuda/fattn-common.cuh
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-tile-f32.cu
D	ggml-cuda/fattn-vec-f16.cu
M	ggml-cuda/fattn-vec-f16.cuh
D	ggml-cuda/fattn-vec-f32.cu
M	ggml-cuda/fattn-vec-f32.cuh
A	ggml-cuda/fattn-wmma-f16.cuh
M	ggml-cuda/fattn.cu
M	ggml-cuda/mmq.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-f16-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q4_1-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q5_1-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs128-q8_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs256-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f16-instance-hs64-f16-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-f16-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q4_1-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q5_1-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs128-q8_0-q8_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs256-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-f16.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q4_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_0.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q5_1.cu
A	ggml-cuda/template-instances/fattn-vec-f32-instance-hs64-f16-q8_0.cu
A	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb16.cu
A	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqfloat-cpb32.cu
A	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb16.cu
A	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb32.cu
A	ggml-cuda/template-instances/fattn-wmma-f16-instance-kqhalf-cpb8.cu
A	ggml-cuda/template-instances/generate_cu_files.py
M	ggml-cuda/vecdotq.cuh
M	ggml-metal.m
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	a323ec60af14a33d560df98f2cc41b4112cb4f80	0515ad93f48df63bbff204eddb0cac75e8585c65	2024-05-31T22:23:04+03:00	Georgi Gerganov	server : update js (#7670)
M	examples/server/public/index.js

commit	0515ad93f48df63bbff204eddb0cac75e8585c65	c8047d538f3addab40e3112be60bb92e70ce1a50	2024-05-31T17:42:33+02:00	Galunid	convert-hf : Handle NotImplementedError in convert-hf-to-gguf (#7660)
M	convert-hf-to-gguf.py

commit	c8047d538f3addab40e3112be60bb92e70ce1a50	30e238b246f8002cc6eb7cb79afe242243f1f66d	2024-05-31T16:26:21+02:00	Johannes Gäßler	scripts: update compare_llama_bench.py [no ci] (#7673)
M	scripts/compare-llama-bench.py

commit	30e238b246f8002cc6eb7cb79afe242243f1f66d	16926dff92d6d0efa8cbc0f44d30d63349532b38	2024-05-31T14:00:29Z	Daniele	Improve HIP compatibility (#7672)
M	Makefile

commit	16926dff92d6d0efa8cbc0f44d30d63349532b38	0c27e6f62eea80140daf152d7b6c154466614e5c	2024-05-31T15:04:58+03:00	Georgi Gerganov	readme : link homebrew discussion
M	README.md

commit	0c27e6f62eea80140daf152d7b6c154466614e5c	2e32f874e675f7bc5307cb7b4470ddbe090bab8f	2024-05-31T14:17:10+03:00	Georgi Gerganov	ggml : fix loongson compile warnings (#7537)
M	ggml-quants.c
M	ggml.c
M	tests/CMakeLists.txt

commit	2e32f874e675f7bc5307cb7b4470ddbe090bab8f	1af511fc22cba4959dd8bced5501df9e8af6ddf9	2024-05-31T10:24:41+02:00	Galunid	Somehow '**' got lost (#7663)
M	README.md

commit	1af511fc22cba4959dd8bced5501df9e8af6ddf9	0541f06296753dbc59a57379eb54cec865a4c9f9	2024-05-31T10:09:20+02:00	Galunid	Add convert.py removal to hot topics (#7662)
M	README.md

commit	0541f06296753dbc59a57379eb54cec865a4c9f9	9022c33646fbf78da35f40c3f98576cc08c40ddf	2024-05-30T16:57:16-07:00	Sertaç Özercan	[no ci] docs: add aikit to readme (#7650)
M	README.md

commit	9022c33646fbf78da35f40c3f98576cc08c40ddf	5921b8f089d3b7bda86aac5a66825df6a6c10603	2024-05-30T21:32:38+01:00	JohnnyB	Fixed painfully slow single process builds. (#7326)
M	.devops/full-cuda.Dockerfile
M	.devops/full-rocm.Dockerfile
M	.devops/full.Dockerfile
M	.devops/main-cuda.Dockerfile
M	.devops/main-rocm.Dockerfile
M	.devops/main.Dockerfile
M	.devops/server-cuda.Dockerfile
M	.devops/server-rocm.Dockerfile
M	.devops/server.Dockerfile

commit	5921b8f089d3b7bda86aac5a66825df6a6c10603	5dcdf946764fae49a8e2a90bf2f0960bde1c44e8	2024-05-30T19:01:41+03:00	Georgi Gerganov	llama : cache llama_token_to_piece (#7587)
M	llama.cpp
M	llama.h

commit	5dcdf946764fae49a8e2a90bf2f0960bde1c44e8	2e2340de1740b07f2418c04792607387d4dc1442	2024-05-30T17:07:39+02:00	Martin Delille	Fix conan badge display [no ci] (#7645)
M	README.md

commit	2e2340de1740b07f2418c04792607387d4dc1442	7846540bd291e52cd4eee53882315760e05239be	2024-05-30T16:58:15+02:00	Manuel	Add brew installation instruction to README [no ci] (#7616)
M	README.md

commit	7846540bd291e52cd4eee53882315760e05239be	e6157f94c8f835f7f774b98409078867472a34fe	2024-05-30T14:52:50+02:00	Martin Delille	readme : add Conan badge (#7638)
M	README.md

commit	e6157f94c8f835f7f774b98409078867472a34fe	9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20	2024-05-30T21:55:36+10:00	Brian	github: add contact links to issues and convert question into research [no ci] (#7612)
D	.github/ISSUE_TEMPLATE/06-question.yml
A	.github/ISSUE_TEMPLATE/06-research.yml
A	.github/ISSUE_TEMPLATE/config.yml

commit	9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20	59b0d077662fab430446b3119fa142f3291c45b2	2024-05-30T13:40:00+02:00	Galunid	Move convert.py to examples/convert-legacy-llama.py (#7430)
M	.devops/tools.sh
M	CMakeLists.txt
M	README.md
M	ci/run.sh
M	convert-hf-to-gguf.py
M	docs/HOWTO-add-model.md
R082	convert.py	examples/convert-legacy-llama.py
M	examples/llava/MobileVLM-README.md
M	examples/llava/README.md
M	examples/llava/requirements.txt
D	examples/make-ggml.py
M	gguf-py/gguf/vocab.py
M	requirements.txt
M	requirements/requirements-convert-hf-to-gguf-update.txt
M	requirements/requirements-convert-hf-to-gguf.txt
R100	requirements/requirements-convert.txt	requirements/requirements-convert-legacy-llama.txt
M	requirements/requirements-convert-llama-ggml-to-gguf.txt
M	scripts/check-requirements.sh
M	scripts/convert-gg.sh
M	scripts/pod-llama.sh

commit	59b0d077662fab430446b3119fa142f3291c45b2	d5c05821f3c3d6cabe8ac45776fe0ecb0da13eca	2024-05-30T07:32:55-04:00	Chris Elrod	faster avx512 exp implementation (#7551)
M	ggml.c

commit	d5c05821f3c3d6cabe8ac45776fe0ecb0da13eca	972b555ab935705f3437abd5909a5c46852811f6	2024-05-30T17:30:10+08:00	junchao-loongson	ggml : fix loongarch build (O2 issue) (#7636)
M	ggml-quants.c
M	ggml.c

commit	972b555ab935705f3437abd5909a5c46852811f6	3854c9d07f67de7f8cd6d86117bfaef47549b05a	2024-05-30T09:52:39+02:00	Johannes Gäßler	README: explain parallel build [no ci] (#7618)
M	README.md

commit	3854c9d07f67de7f8cd6d86117bfaef47549b05a	eb57fee51f7b4d78039f003249873c2eb46f12f6	2024-05-30T14:19:08+08:00	Meng, Hengyu	[SYCL] fix intel docker (#7630)
M	.devops/main-intel.Dockerfile
M	.devops/server-intel.Dockerfile
M	.github/workflows/docker.yml

commit	eb57fee51f7b4d78039f003249873c2eb46f12f6	55d62262a99cd8bc28a1492975791fe433c8cc0f	2024-05-30T02:10:40+02:00	Galunid	gguf-py : Add tokenizer.ggml.pre to gguf-new-metadata.py (#7627)
M	gguf-py/scripts/gguf-new-metadata.py

commit	55d62262a99cd8bc28a1492975791fe433c8cc0f	975ec63ff26cdf96156d1126d86f75a395fdc43a	2024-05-29T22:20:40+03:00	Georgi Gerganov	metal : remove invalid asserts (#7617)
M	ggml-kompute.cpp
M	ggml-metal.m

commit	975ec63ff26cdf96156d1126d86f75a395fdc43a	fb76ec31a9914b7761c1727303ab30380fd4f05c	2024-05-29T20:45:25+03:00	Georgi Gerganov	metal : add missing asserts (#7617)
M	ggml-kompute.cpp
M	ggml-metal.m

commit	fb76ec31a9914b7761c1727303ab30380fd4f05c	cce3dcffc5695bd24835f04e6080070a2a119873	2024-05-29T20:17:31+03:00	Georgi Gerganov	ggml : fix YARN + add tests + add asserts (#7617)
M	ggml-cuda.cu
M	ggml-cuda/norm.cu
M	ggml-cuda/rope.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml.c
M	ggml.h
M	ggml_vk_generate_shaders.py
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	cce3dcffc5695bd24835f04e6080070a2a119873	210d99173dc82aafb48f6e39d787c387951fe3a9	2024-05-29T15:38:26+03:00	Georgi Gerganov	cuda : non-cont concat support (#7610)
M	ggml-cuda/concat.cu
M	tests/test-backend-ops.cpp

commit	210d99173dc82aafb48f6e39d787c387951fe3a9	87bdf2a199acd62e19814d7a4d0500a04a7f09f3	2024-05-29T14:45:44+03:00	Radoslav Gerganov	llama-bench : add support for the RPC backend (#7435)
M	examples/llama-bench/llama-bench.cpp
M	ggml.c
M	ggml.h

commit	87bdf2a199acd62e19814d7a4d0500a04a7f09f3	00281b7be32462754618c42ed93f95743af46627	2024-05-29T13:36:39+02:00	slaren	ggml : use atomic_flag for critical section (#7598)
M	ggml.c

commit	00281b7be32462754618c42ed93f95743af46627	2ab977282b02ccd6783fbbaec393c96886cf33b1	2024-05-29T14:31:18+03:00	Georgi Gerganov	scripts : remove mpi remnants
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	2ab977282b02ccd6783fbbaec393c96886cf33b1	72de268bec49f67e2883880f573c55cea32de736	2024-05-29T14:29:52+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	72de268bec49f67e2883880f573c55cea32de736	0e8d8bfd6caf1d0a8cbdf9d3d5c06fbbb9dfced8	2024-05-26T18:35:23+03:00	Georgi Gerganov	ggml : restore ggml_rope_xpos_inplace (ggml/0)
M	ggml.c
M	ggml.h

commit	0e8d8bfd6caf1d0a8cbdf9d3d5c06fbbb9dfced8	504f0c340f6b5e04de682f6ddefdd3b81208df5d	2024-05-29T12:23:47+05:30	Akarshan Biswas	Add Arc A750 and Arch linux to readme-sycl.md as verified GPU model and Linux distro (#7605)
M	README-sycl.md

commit	504f0c340f6b5e04de682f6ddefdd3b81208df5d	b864b50ce5e2beefc8c2fd31733e4e1a978b7754	2024-05-29T10:09:31+08:00	zhouwg	ggml : fix typo in ggml.c (#7603)
M	ggml.c

commit	b864b50ce5e2beefc8c2fd31733e4e1a978b7754	02c1ecad07f0e2d2febe8196271bcc64bdc9c006	2024-05-29T07:00:24+08:00	Meng, Hengyu	[SYCL] Align GEMM dispatch (#7566)
M	CMakeLists.txt
M	README.md
M	ggml-sycl.cpp

commit	02c1ecad07f0e2d2febe8196271bcc64bdc9c006	6bd12ce409f949012935b7d1b15a21ffa473a565	2024-05-28T21:46:34+02:00	jaime-m-p	Tokenizer WPM fixes (#7500)
M	llama.cpp
M	tests/test-tokenizer-random.py

commit	6bd12ce409f949012935b7d1b15a21ffa473a565	5442939fcc5e6ae41abf40612a95fd71377e487e	2024-05-28T22:22:50+03:00	Georgi Gerganov	sycl : fix assert (#7563)
M	ggml-sycl.cpp

commit	5442939fcc5e6ae41abf40612a95fd71377e487e	56411a950f255b523a9edd684fd1632752474399	2024-05-28T20:49:49+02:00	Giuseppe Scrivano	llama : support small Granite models (#7481)
M	convert-hf-to-gguf.py
M	llama.cpp

commit	56411a950f255b523a9edd684fd1632752474399	2b737caae100cf0ac963206984332e422058f2b9	2024-05-29T01:25:08+08:00	k.h.lai	vulkan: properly initialize vulkan devices for LLAMA_SPLIT_MODE_NONE (#7552)
M	ggml-vulkan.cpp

commit	2b737caae100cf0ac963206984332e422058f2b9	ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970	2024-05-28T18:13:36+03:00	Radoslav Gerganov	rpc : resource management rework (#7562)
M	ggml-rpc.cpp

commit	ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970	edc29433fa08b4e5aeb67649a29fc7713af13d04	2024-05-28T17:07:05+02:00	fairydreaming	Add support for DeepseekV2ForCausalLM (#7519)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	edc29433fa08b4e5aeb67649a29fc7713af13d04	8b99e2aa66ba39e4e1114effea6ef7430881eca4	2024-05-28T15:04:09+03:00	Georgi Gerganov	tests : fix test-tokenizer-0.sh
M	tests/test-tokenizer-0.sh

commit	8b99e2aa66ba39e4e1114effea6ef7430881eca4	271ff3fc44a6ecfcea3ebc192e67567d578b7772	2024-05-28T13:55:35+03:00	Georgi Gerganov	llama : handle unknown utf8 bytes (#7588)
M	llama.cpp

commit	271ff3fc44a6ecfcea3ebc192e67567d578b7772	e2b065071c5fc8ac5697d12ca343551faee465cc	2024-05-28T20:27:27+10:00	Brian	github: add refactor to issue template (#7561)
M	.github/ISSUE_TEMPLATE/05-enhancement.yml
M	.github/ISSUE_TEMPLATE/06-question.yml
A	.github/ISSUE_TEMPLATE/07-refactor.yml

commit	e2b065071c5fc8ac5697d12ca343551faee465cc	0548a4187f2e53b8fc6d9ff0f4c71988f708ff42	2024-05-28T17:53:37+08:00	Neo Zhang	[SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436)
M	ggml-sycl.cpp

commit	0548a4187f2e53b8fc6d9ff0f4c71988f708ff42	9335b969e86a222e247adacedf814d8abfff8847	2024-05-28T11:04:19+03:00	Georgi Gerganov	ggml : generalize GGML_OP_CONCAT (#7563)
M	ggml-cuda/concat.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	9335b969e86a222e247adacedf814d8abfff8847	c41767154eb82aa3fe7568fc816c3402b78eae94	2024-05-28T06:55:51+02:00	mgroeber9110	server: do not remove whitespace at the start of a completion chunk (#7524)
M	examples/server/public/index.html

commit	c41767154eb82aa3fe7568fc816c3402b78eae94	74b239b3d5f067470d7ef5e26e2e059720572e32	2024-05-28T00:41:14-04:00	Nathan Epstein	Markdownish code block fix (#7571)
M	examples/server/public/index.html

commit	74b239b3d5f067470d7ef5e26e2e059720572e32	852aafb163d32d5bad63c10bc323a02c28fec59d	2024-05-28T11:48:16+09:00	Ikko Eltociear Ashimine	llava : update clip.h (#7580)
M	examples/llava/clip.h

commit	852aafb163d32d5bad63c10bc323a02c28fec59d	0136966dafb452601c23f30395878d5a65ddc559	2024-05-28T01:40:47+02:00	Djip007	update HIP_UMA #7399 (#7414)
M	ggml-cuda.cu
M	ggml-cuda/common.cuh

commit	0136966dafb452601c23f30395878d5a65ddc559	10b1e4587670feba2c7730a645accf8234873113	2024-05-27T18:40:12-05:00	kunnis	adding in x64 targets to cmake presets (#7574)
M	CMakePresets.json

commit	10b1e4587670feba2c7730a645accf8234873113	197c00681b80f9dea17d11a4436b6b8ef1be0ce8	2024-05-27T19:34:40+02:00	Johannes Gäßler	make: add --device-debug to NVCC debug flags (#7542)
M	Makefile

commit	197c00681b80f9dea17d11a4436b6b8ef1be0ce8	95f84d5ce8b449a9b16009434aca800df504a02e	2024-05-27T18:33:42+01:00	agray3	Allow multiple copy function pointers for CUDA graph kernel param updates (#7565)
M	ggml-cuda.cu

commit	95f84d5ce8b449a9b16009434aca800df504a02e	5487593bc7ee0b65b9d2e2985b4b61dc77043101	2024-05-27T17:34:51+01:00	AidanBeltonS	Fix q_xxs using mul_mat_q (#7459)
M	ggml-sycl.cpp

commit	5487593bc7ee0b65b9d2e2985b4b61dc77043101	1d8fca72ae9154eec0e1c0a75cfaac3c50f08e4a	2024-05-27T13:34:09+01:00	AidanBeltonS	Add freq factors (#7495)
M	ggml-sycl.cpp

commit	1d8fca72ae9154eec0e1c0a75cfaac3c50f08e4a	62bfef5194d5582486d62da3db59bf44981b7912	2024-05-27T12:10:19+03:00	Georgi Gerganov	metal : add GGML_OP_REPEAT kernels (#7557)
M	ggml-metal.m
M	ggml-metal.metal

commit	62bfef5194d5582486d62da3db59bf44981b7912	eaf6e031741ca2d3aafeff3e0f4dd7557a974d2b	2024-05-27T10:38:39+03:00	Georgi Gerganov	metal : disable FA kernel for HS=256 (#7556)
M	ggml-metal.m
M	ggml-metal.metal

commit	eaf6e031741ca2d3aafeff3e0f4dd7557a974d2b	d6ef0e77dd25f54fb5856af47e3926cf6f36c281	2024-05-27T09:24:13+03:00	Georgi Gerganov	llama : add comments about experimental flags (#7544)
M	llama.h

commit	d6ef0e77dd25f54fb5856af47e3926cf6f36c281	dff451cfa1f297348751ce6b538670e1ae9a7d5b	2024-05-27T10:54:30+10:00	Brian	github: add self sorted issue ticket forms (#7543)
A	.github/ISSUE_TEMPLATE/01-bug-low.yml
A	.github/ISSUE_TEMPLATE/02-bug-medium.yml
A	.github/ISSUE_TEMPLATE/03-bug-high.yml
A	.github/ISSUE_TEMPLATE/04-bug-critical.yml
A	.github/ISSUE_TEMPLATE/05-enhancement.yml
A	.github/ISSUE_TEMPLATE/06-question.yml
D	.github/ISSUE_TEMPLATE/bug.md
D	.github/ISSUE_TEMPLATE/enhancement.md

commit	dff451cfa1f297348751ce6b538670e1ae9a7d5b	d298382ad977ec89c8de7b57459b9d7965d2c272	2024-05-26T18:54:56+03:00	Georgi Gerganov	flake.lock: Update (#7540)
M	flake.lock

commit	d298382ad977ec89c8de7b57459b9d7965d2c272	32a28217f475119926c603341e8273b26932b56a	2024-05-27T00:10:17+10:00	Brian	main: replace --no-special with --special (#7534)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	32a28217f475119926c603341e8273b26932b56a	c429b33beb35f13934a4dfbe0c138d30b45e5d54	2024-05-26T16:02:34+02:00	Galunid	Fix aya-23 conversion scripts (#7539)
M	convert-hf-to-gguf.py

commit	c429b33beb35f13934a4dfbe0c138d30b45e5d54	9146d36fe7e3e911a07438c07efc1bae082f6390	2024-05-26T08:28:35-04:00	Bartowski	llama : add Smaug 70B support (#7402)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	9146d36fe7e3e911a07438c07efc1bae082f6390	b9adcbbf92fc7096bee23fe61496d25652ebf765	2024-05-26T15:09:42+03:00	Aarni Koskela	Readme: add akx/ggify to tools (#1484)
M	README.md

commit	b9adcbbf92fc7096bee23fe61496d25652ebf765	9588f196b1d7b21bdff013fcf958c249576b2619	2024-05-26T06:26:34+05:30	HanishKVC	SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
M	examples/server/public_simplechat/index.html
M	examples/server/public_simplechat/readme.md
M	examples/server/public_simplechat/simplechat.css
M	examples/server/public_simplechat/simplechat.js

commit	9588f196b1d7b21bdff013fcf958c249576b2619	3cbd23ed88c03a27e1eb6090ac4a8186ca9ac29a	2024-05-25T15:21:30+03:00	Georgi Gerganov	train : change default FA argument (#7528)
M	common/train.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	3cbd23ed88c03a27e1eb6090ac4a8186ca9ac29a	00c63907931bb08a0ed2b7e38cf44dd290143cb9	2024-05-25T19:30:42+10:00	Brian	labeler: added Apple Metal detector (+Kompute) (#7529)
M	.github/labeler.yml

commit	00c63907931bb08a0ed2b7e38cf44dd290143cb9	faa0e6979a11dcb731e9d778ad42ceaa0302015e	2024-05-25T05:04:03-04:00	Justine Tunney	main : don't print special tokens with --grammar (#6923)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	faa0e6979a11dcb731e9d778ad42ceaa0302015e	9791f402580838d7f8543ae7bc633ef265e436f0	2024-05-25T17:42:31+09:00	Masaya, Kato	ggml: aarch64: SVE kernels for q8_0_q8_0, q4_0_q8_0 vector dot (#7433)
M	CMakeLists.txt
M	common/common.cpp
M	ggml-impl.h
M	ggml-quants.c
M	ggml.c
M	ggml.h
M	llama.cpp

commit	9791f402580838d7f8543ae7bc633ef265e436f0	902184dd3a9d6685e752b19027a48423742531db	2024-05-25T04:11:33-04:00	Elton Kola	android : module (#7502)
M	examples/llama.android/app/build.gradle.kts
M	examples/llama.android/app/src/main/java/com/example/llama/MainViewModel.kt
M	examples/llama.android/build.gradle.kts
A	examples/llama.android/llama/.gitignore
R098	examples/llama.android/app/src/main/cpp/CMakeLists.txt	examples/llama.android/llama/CMakeLists.txt
A	examples/llama.android/llama/build.gradle.kts
A	examples/llama.android/llama/consumer-rules.pro
A	examples/llama.android/llama/proguard-rules.pro
A	examples/llama.android/llama/src/androidTest/java/android/llama/cpp/ExampleInstrumentedTest.kt
A	examples/llama.android/llama/src/main/AndroidManifest.xml
A	examples/llama.android/llama/src/main/cpp/CMakeLists.txt
R092	examples/llama.android/app/src/main/cpp/llama-android.cpp	examples/llama.android/llama/src/main/cpp/llama-android.cpp
R097	examples/llama.android/app/src/main/java/com/example/llama/Llm.kt	examples/llama.android/llama/src/main/java/android/llama/cpp/LLamaAndroid.kt
A	examples/llama.android/llama/src/test/java/android/llama/cpp/ExampleUnitTest.kt
M	examples/llama.android/settings.gradle.kts

commit	902184dd3a9d6685e752b19027a48423742531db	57684331fc2d685f7d1f5775af0b9e47d1829833	2024-05-25T05:30:59+02:00	Xuan Son Nguyen	fix missing slash in `fs_get_cache_directory()` (#7503)
M	common/common.cpp

commit	57684331fc2d685f7d1f5775af0b9e47d1829833	b83bab15a5d2a1e7807d09613a9b34309d86cfaa	2024-05-24T18:14:42-07:00	Mikko Juola	Make tokenize CLI tool have nicer command line arguments. (#6188)
M	examples/tokenize/tokenize.cpp

commit	b83bab15a5d2a1e7807d09613a9b34309d86cfaa	d041d2ceaaf50e058622d92921b3e680ffa4e9e7	2024-05-24T21:11:48-04:00	compilade	gguf-py : fix and simplify quantized shape round-trip (#7483)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/quants.py
M	gguf-py/scripts/gguf-new-metadata.py

commit	d041d2ceaaf50e058622d92921b3e680ffa4e9e7	27891f6db03de6e3fd5941983838c29bef253352	2024-05-24T18:59:06+03:00	Georgi Gerganov	flake.lock: Update (#7232)
M	flake.lock

commit	27891f6db03de6e3fd5941983838c29bef253352	fbca2f27fc7fa9aa4a8ad0357478fdb908472908	2024-05-24T23:47:56+10:00	Brian	docker.yml: disable light-intel and server-intel test (#7515)
M	.github/workflows/docker.yml

commit	fbca2f27fc7fa9aa4a8ad0357478fdb908472908	0df0aa8e43c3378975269a51f9b876c8692e70da	2024-05-24T14:31:13+02:00	fairydreaming	Add support for ArcticForCausalLM (#7020)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	0df0aa8e43c3378975269a51f9b876c8692e70da	74f33adf5f8b20b08fc5a6aa17ce081abe86ef2f	2024-05-24T10:06:56+08:00	Neo Zhang	add build shared lib in win release package (#7438)
M	examples/sycl/win-build-sycl.bat

commit	74f33adf5f8b20b08fc5a6aa17ce081abe86ef2f	1debe72737ea131cb52975da3d53ed3a835df3a6	2024-05-23T17:43:18+03:00	Georgi Gerganov	readme : remove trailing space (#7469)
M	README.md

commit	1debe72737ea131cb52975da3d53ed3a835df3a6	007489e895bad02e4e54758bf0bdf2d6a4cdb7c1	2024-05-23T17:17:43+03:00	Georgi Gerganov	ggml : silence UB sanitizer error during iq2_xxs quantization (#0)
M	ggml-quants.c

commit	007489e895bad02e4e54758bf0bdf2d6a4cdb7c1	8b94e799dfa482adf63419df4905dc79b37e179f	2024-05-23T16:15:15+02:00	Tristan Druyen	Fix phi3 chat template confusion with zephyr (#7449)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	8b94e799dfa482adf63419df4905dc79b37e179f	3015851c5ac7334fb544a23a70a284c117b87044	2024-05-23T18:00:13+05:30	Raj Hammeer Singh Hada	readme : add Bunny in supported models [no ci] (#7469)
M	README.md

commit	3015851c5ac7334fb544a23a70a284c117b87044	55ac3b7aeaf52f19786ed96e885d89521fc0f6c8	2024-05-23T14:29:26+02:00	Daniel Bevenius	llama : add getters for n_threads/n_threads_batch (#7464)
M	llama.cpp
M	llama.h

commit	55ac3b7aeaf52f19786ed96e885d89521fc0f6c8	dacfcebd6022175848e978f82811a244f1033038	2024-05-23T15:28:14+03:00	Georgi Gerganov	ci : use Pythia models instead of OpenLlama (#7470)
M	ci/run.sh
M	llama.cpp

commit	dacfcebd6022175848e978f82811a244f1033038	9b82476ee9e73065a759f8bcc4cf27ec7ab2ed8c	2024-05-23T15:12:43+03:00	Victor Nogueira	readme : add GPT-NeoX + Pythia to the list of supported models (#7491)
M	README.md

commit	9b82476ee9e73065a759f8bcc4cf27ec7ab2ed8c	a61a94e543e3c6877c087e80fca27a0313ce5fd5	2024-05-23T11:49:53+02:00	fairydreaming	Add missing inference support for GPTNeoXForCausalLM (Pythia and GPT-NeoX base models) (#7461)
M	convert-hf-to-gguf.py
M	llama.cpp

commit	a61a94e543e3c6877c087e80fca27a0313ce5fd5	152da28ae54139e3754189b9e6e1c28e11277502	2024-05-23T12:38:18+03:00	Georgi Gerganov	llama : rename n_ctx -> cache.size, less confusing (#0)
M	llama.cpp

commit	152da28ae54139e3754189b9e6e1c28e11277502	d48c88cbd563b6cf0ce972e2f56796896e240736	2024-05-23T17:40:43+10:00	Brian	labeler.yml: add embedding label detector [no ci] (#7482)
M	.github/labeler.yml

commit	d48c88cbd563b6cf0ce972e2f56796896e240736	e84b71c2c6da6e69c8f815168ea836f9716a325e	2024-05-23T10:00:44+03:00	Georgi Gerganov	ggml : remove ggml_flash_attn and ggml_flash_ff (#7463)
M	examples/finetune/finetune.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	ggml.h
M	tests/test-grad0.cpp

commit	e84b71c2c6da6e69c8f815168ea836f9716a325e	1b1e27cb49158123ef4902aa41eb368c9e76e6a1	2024-05-23T10:00:21+03:00	Georgi Gerganov	ggml : drop support for QK_K=64 (#7473)
M	CMakeLists.txt
M	Makefile
M	ci/run.sh
M	ggml-common.h
M	ggml-cuda/convert.cu
M	ggml-cuda/dmmv.cu
M	ggml-cuda/mmq.cu
M	ggml-cuda/vecdotq.cuh
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-opencl.cpp
M	ggml-quants.c
M	ggml-sycl.cpp
M	ggml.c
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	1b1e27cb49158123ef4902aa41eb368c9e76e6a1	fbf777d2b9c30e7569e3d1c149501c1e31d9b5b9	2024-05-23T08:59:59+02:00	0cc4m	Update vulkan rope implementation to support frequency factors (#7475)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	fbf777d2b9c30e7569e3d1c149501c1e31d9b5b9	cd93a28cb1446319af5e2f4b416174c3a8e43546	2024-05-23T09:43:24+03:00	Georgi Gerganov	main : minor (#7462)
M	examples/main/main.cpp

commit	cd93a28cb1446319af5e2f4b416174c3a8e43546	1e374365d170b7f692fd7753c145e21bc14486c8	2024-05-23T00:31:20+02:00	Johannes Gäßler	CUDA: fix FA out-of-bounds reads (#7479)
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-tile-f32.cu
M	ggml-cuda/fattn-vec-f16.cu
M	ggml-cuda/fattn-vec-f32.cu

commit	1e374365d170b7f692fd7753c145e21bc14486c8	197ff91462dd05bb9a3be03578114abf0c355536	2024-05-22T23:23:21+05:30	HanishKVC	SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
A	examples/server/public_simplechat/index.html
A	examples/server/public_simplechat/readme.md
A	examples/server/public_simplechat/simplechat.css
A	examples/server/public_simplechat/simplechat.js

commit	197ff91462dd05bb9a3be03578114abf0c355536	6ff13987ad1a9519bee13dd98b6a21cd98979aab	2024-05-22T20:05:38+03:00	Georgi Gerganov	build : remove zig (#7471)
D	.github/workflows/zig-build.yml
D	build.zig

commit	6ff13987ad1a9519bee13dd98b6a21cd98979aab	38c03478a37e460ecd3a21155b338a83bfed7f90	2024-05-22T20:04:20+03:00	Georgi Gerganov	common : normalize naming style (#7462)
M	build.zig
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	common/train.cpp
M	examples/batched/batched.cpp
M	examples/embedding/embedding.cpp
M	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	examples/retrieval/retrieval.cpp
M	examples/server/server.cpp

commit	38c03478a37e460ecd3a21155b338a83bfed7f90	b18532a4efeca8796fea8e36195c81cbfd596a4a	2024-05-22T17:58:25+02:00	Johannes Gäßler	CUDA: fix FA out-of-bounds writes (#7465)
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-tile-f32.cu
M	ggml-cuda/fattn-vec-f16.cu
M	ggml-cuda/fattn-vec-f32.cu

commit	b18532a4efeca8796fea8e36195c81cbfd596a4a	fcda1128bc5f8eb7e1811708fe9d9867b9aec815	2024-05-22T16:10:46+02:00	slaren	phi3 : duplicate rope factors in each layer (#7447)
M	examples/llama-bench/llama-bench.cpp
M	llama.cpp

commit	fcda1128bc5f8eb7e1811708fe9d9867b9aec815	03d8900ebe062355e26a562379daee5f17ea099f	2024-05-22T20:53:21+08:00	k.h.lai	vulkan: add workaround for iterator boundary check to fix clang-cl debug build (#7426)
M	CMakeLists.txt

commit	03d8900ebe062355e26a562379daee5f17ea099f	9b3d83318931aa98c487baaa977626931d059e6a	2024-05-22T07:08:18-04:00	Justine Tunney	llama : add missing model type names (#7445)
M	llama.cpp

commit	9b3d83318931aa98c487baaa977626931d059e6a	95fb0aefab568348da159efdd370e064d1b35f97	2024-05-22T12:36:37+03:00	Georgi Gerganov	cuda : fix compile warning (#7454)
M	ggml-cuda/fattn-tile-f32.cu

commit	95fb0aefab568348da159efdd370e064d1b35f97	3e5faa85032ec3106a2ad831bf412be9ff139f47	2024-05-22T10:24:29+02:00	Johannes Gäßler	CUDA: remove incorrect precision check (#7454)
M	ggml-cuda/fattn-tile-f32.cu

commit	3e5faa85032ec3106a2ad831bf412be9ff139f47	201cc11afa0a1950e1f632390b2ac6c937a0d8f0	2024-05-22T11:01:35+03:00	Georgi Gerganov	cuda : fix rope + add tests (#7452)
M	ggml-cuda/rope.cu
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	201cc11afa0a1950e1f632390b2ac6c937a0d8f0	6369bf04336ab60e5c892dd77a3246df91015147	2024-05-22T04:28:32+08:00	liuwei-git	llama : add phi3 128K model support (#7225)
M	convert-hf-to-gguf.py
M	examples/finetune/finetune.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda/rope.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	6369bf04336ab60e5c892dd77a3246df91015147	e402de364b643cb89ea9f43057733b5d36298670	2024-05-21T23:03:42+03:00	Georgi Gerganov	metal : handle F16 inf values, fix FA partial offload (#7434)
M	ggml-metal.metal

commit	e402de364b643cb89ea9f43057733b5d36298670	fcf6538ba6702c55eaec70da9a75c81d04900a72	2024-05-21T20:40:00+01:00	Olivier Chafik	`grammars`: fix resampling logic regression (#7424)
M	common/sampling.cpp
M	examples/main/main.cpp

commit	fcf6538ba6702c55eaec70da9a75c81d04900a72	c3f8d583560b4f261fa21c976793e538c60cd66c	2024-05-21T19:27:12+02:00	Johannes Gäßler	CUDA: fix unused warning in mmq.cu (#7442)
M	ggml-cuda/mmq.cu

commit	c3f8d583560b4f261fa21c976793e538c60cd66c	11474e756de3f56b760986e73086d40e787e52f8	2024-05-21T19:53:48+03:00	Georgi Gerganov	tests : test-tokenizer-0.sh print more info (#7402)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	tests/test-tokenizer-0.sh

commit	11474e756de3f56b760986e73086d40e787e52f8	d8ee90222791afff2ab666ded4cb6195fd94cced	2024-05-21T17:13:12+03:00	Amir	examples: cache hf model when --model not provided (#7353)
M	common/common.cpp
M	common/common.h
M	examples/main/README.md

commit	d8ee90222791afff2ab666ded4cb6195fd94cced	d7e852c1bc8e85bf62a6f1aede08cd2de723404a	2024-05-21T16:02:12+02:00	Johannes Gäßler	CUDA: deduplicate mmq code (#7397)
M	ggml-cuda/mmq.cu

commit	d7e852c1bc8e85bf62a6f1aede08cd2de723404a	917dc8cfa67a72fb7c8bf7392270da3bf4833af4	2024-05-21T14:39:48+02:00	jaime-m-p	Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425)
M	convert-hf-to-gguf.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/slotsave.feature
M	llama.cpp
M	tests/test-tokenizer-random.py

commit	917dc8cfa67a72fb7c8bf7392270da3bf4833af4	fabf30b4c4fca32e116009527180c252919ca922	2024-05-20T20:15:57+02:00	jaime-m-p	Tokenizer SPM fixes for phi-3 and llama-spm (#7375)
M	convert-hf-to-gguf.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/slotsave.feature
M	llama.cpp
M	tests/test-tokenizer-random.py

commit	fabf30b4c4fca32e116009527180c252919ca922	20385cebcc4bb3f6dd10f989573c11864d70d53d	2024-05-20T19:35:28+03:00	Georgi Gerganov	llama : remove Persimmon (#7408)
M	README.md
M	convert-hf-to-gguf.py
D	convert-persimmon-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp
M	requirements.txt
D	requirements/requirements-convert-persimmon-to-gguf.txt

commit	20385cebcc4bb3f6dd10f989573c11864d70d53d	db10f01310beea8a1ef7798651b9d692fd1149d0	2024-05-20T18:15:38+02:00	Johannes Gäßler	perplexity: update README FP16 results [no ci] (#7413)
M	examples/perplexity/README.md

commit	db10f01310beea8a1ef7798651b9d692fd1149d0	3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821	2024-05-20T16:36:55+03:00	Radoslav Gerganov	rpc : track allocated buffers (#7411)
M	ggml-rpc.cpp

commit	3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821	6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb	2024-05-20T15:10:03+03:00	Georgi Gerganov	server : fix temperature + disable some tests (#7409)
M	.github/workflows/server.yml
M	examples/server/tests/features/results.feature

commit	6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb	26cd4237bc499f7144d76f440aa775d749b170bb	2024-05-20T12:08:23+01:00	AidanBeltonS	[SYCL] Update SYCL upscale operation (#7321)
M	ggml-sycl.cpp

commit	26cd4237bc499f7144d76f440aa775d749b170bb	213e90ed73f8ac3cd3026dc3f086beae0d414f96	2024-05-20T17:55:34+08:00	Bingan	Update README.md (#7410)
M	README.md

commit	213e90ed73f8ac3cd3026dc3f086beae0d414f96	65c58207ece92ad213f4bfd0f91dcb2dfb664f5b	2024-05-20T07:33:21Z	Herman Semenov	ggml-opencl, llama: using reserve() if count already known (#7272)
M	ggml-opencl.cpp
M	llama.cpp

commit	65c58207ece92ad213f4bfd0f91dcb2dfb664f5b	1cc0155d04918cb3017afa472acea51b77483c4a	2024-05-20T15:19:21+08:00	junchao-loongson	ggml : add loongarch lsx and lasx support (#6454)
M	CMakeLists.txt
M	Makefile
M	ggml-impl.h
M	ggml-quants.c
M	ggml.c

commit	1cc0155d04918cb3017afa472acea51b77483c4a	e932094d58f513d5996c3efc9f6fed8238894c57	2024-05-20T10:16:41+03:00	Georgi Gerganov	server : tuning tests (#7388)
M	examples/server/tests/features/results.feature
M	examples/server/tests/features/steps/steps.py

commit	e932094d58f513d5996c3efc9f6fed8238894c57	2789baf480ba7dc9281b65f601f0918e58920f54	2024-05-20T08:56:05+03:00	Georgi Gerganov	server : return error on too large embedding input (#7389)
M	examples/server/server.cpp

commit	2789baf480ba7dc9281b65f601f0918e58920f54	33c8d50accd6dca73c9c4af00a05e24209c160fe	2024-05-20T08:55:09+03:00	Georgi Gerganov	tests : fix --keep_split -> --keep-split (#7374)
M	examples/quantize/tests.sh

commit	33c8d50accd6dca73c9c4af00a05e24209c160fe	d359f30921a9f62a0fd299c412ff3f270286fea6	2024-05-19T19:18:39-07:00	Srihari-mcw	Add provisions for windows support for BF16 code including CMake provision for enabling AVX512_BF16 (#7258)
M	CMakeLists.txt
M	ggml-impl.h
M	ggml.c
M	ggml.h
M	llama.cpp

commit	d359f30921a9f62a0fd299c412ff3f270286fea6	1ea2a0036e88172d6c8bf7e1a1989a03894dc955	2024-05-20T01:17:03+02:00	slaren	llama : remove MPI backend (#7395)
M	.devops/nix/package.nix
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	README.md
D	ggml-mpi.c
D	ggml-mpi.h
M	llama.cpp
M	scripts/LlamaConfig.cmake.in

commit	1ea2a0036e88172d6c8bf7e1a1989a03894dc955	f030ec1f7a72aa825b2104823946551b9ec5dfc1	2024-05-19T11:37:04-05:00	Fred Douglas	quantize : fix --keep-split check (#7374)
M	examples/quantize/quantize.cpp

commit	f030ec1f7a72aa825b2104823946551b9ec5dfc1	e4e6f67be6a8a697f5f89a28c98934e53c99c359	2024-05-19T17:19:53+02:00	0cc4m	Vulkan Embedding Fix (#7360)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	e4e6f67be6a8a697f5f89a28c98934e53c99c359	5ca49cbecda27ce0a7266658fc3b640bff3ed386	2024-05-19T17:08:46+02:00	slaren	ggml : fix another case of quants nans (#7387)
M	ggml-quants.c

commit	5ca49cbecda27ce0a7266658fc3b640bff3ed386	1b01f06db0cff5f5f600bb754fc39fde565ed56a	2024-05-19T16:46:13+02:00	Johannes Gäßler	ggml: implement quantized KV cache for FA (#7372)
M	ggml.c

commit	1b01f06db0cff5f5f600bb754fc39fde565ed56a	41858392e17abead21735309bf17cb55183d8c31	2024-05-19T16:26:02+02:00	Johannes Gäßler	server: add test for token probs (#7347)
M	examples/server/README.md
M	examples/server/tests/features/results.feature
M	examples/server/tests/features/steps/steps.py

commit	41858392e17abead21735309bf17cb55183d8c31	6aade19ee74b896c59929676629340b36be3e22c	2024-05-19T16:06:33+02:00	Johannes Gäßler	server: fix seed being reported back (#7382)
M	examples/server/server.cpp

commit	6aade19ee74b896c59929676629340b36be3e22c	ab33f7a338593f6cf1ae98b10b6f8684f63bd72c	2024-05-19T14:46:46+02:00	Anas Ahouzi	Add StableLM2 pre-tokenizer (#7349)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	ab33f7a338593f6cf1ae98b10b6f8684f63bd72c	e23b974f4cf9270d05062d446f406e3ff55d9451	2024-05-19T14:19:37+02:00	slaren	cuda : clear error after buffer allocation failure (#7376)
M	ggml-cuda.cu

commit	e23b974f4cf9270d05062d446f406e3ff55d9451	854d365abab7194b5013a523f72da19860c3c550	2024-05-19T20:51:03+10:00	Brian	labeler.yml: Use settings from ggerganov/llama.cpp [no ci] (#7363)
M	.github/workflows/labeler.yml

commit	854d365abab7194b5013a523f72da19860c3c550	f5bf761747988ee1832766f7d1433739aff810da	2024-05-19T11:01:01+03:00	Georgi Gerganov	cmake : update android comments (#7341)
M	examples/llama.android/app/src/main/cpp/CMakeLists.txt

commit	f5bf761747988ee1832766f7d1433739aff810da	059031b8c40e1f4ba60586842c5b1ed3ddf61842	2024-05-19T01:44:42+03:00	fraxy-v	Capture CUDA logging output (#7298)
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp

commit	059031b8c40e1f4ba60586842c5b1ed3ddf61842	511182eabb36f6ec9776e2b3c4d7e16d93d0ac0d	2024-05-18T18:55:54+03:00	Georgi Gerganov	ci : re-enable sanitizer runs (#7358)
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	CMakeLists.txt

commit	511182eabb36f6ec9776e2b3c4d7e16d93d0ac0d	133d99c59980139f5bb75922c8b5fca67d7ba9b8	2024-05-18T13:40:39+03:00	Georgi Gerganov	android : use "ci-android" branch for CI (#7341)
M	examples/llama.android/app/src/main/cpp/CMakeLists.txt
M	ggml.c

commit	133d99c59980139f5bb75922c8b5fca67d7ba9b8	cb42c294279bc4a0a4e926a7b5a5568049f12fa7	2024-05-18T12:36:25+02:00	Johannes Gäßler	CUDA: deduplicate FlashAttention code (#7352)
M	ggml-cuda/common.cuh
M	ggml-cuda/fattn-common.cuh
M	ggml-cuda/fattn-tile-f16.cu
M	ggml-cuda/fattn-tile-f32.cu
M	ggml-cuda/fattn-vec-f16.cu
M	ggml-cuda/fattn-vec-f32.cu
M	ggml-cuda/fattn.cu
M	ggml-cuda/softmax.cu

commit	cb42c294279bc4a0a4e926a7b5a5568049f12fa7	d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc	2024-05-18T11:10:47+02:00	Johannes Gäßler	server: correct --threads documentation [no ci] (#7362)
M	examples/server/README.md

commit	d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc	0f98acfac6cc561dc57586bfff778405e42b576b	2024-05-18T02:05:17-06:00	Engininja2	cuda : add half2 __shfl_xor() for ROCm 5.5 (#7263)
M	ggml-cuda/common.cuh

commit	0f98acfac6cc561dc57586bfff778405e42b576b	ca57e0f35e33f714b9a6c2c4482b87bfe059c819	2024-05-18T10:04:55+02:00	Steffen Röcker	llama : add support for larger Granite Code Models (20B, 34B) (#7324)
M	llama.cpp

commit	ca57e0f35e33f714b9a6c2c4482b87bfe059c819	c1b295eea5c49887a066559527a74e8b94fe9db0	2024-05-18T00:57:08-07:00	strawberrymelonpanda	perplexity : ndot progress and show stats with < 100 tasks (#7348)
M	examples/perplexity/perplexity.cpp

commit	c1b295eea5c49887a066559527a74e8b94fe9db0	de731963441ff128248259e1b99573d75264d210	2024-05-18T08:10:58+02:00	0cc4m	Update and fix Vulkan soft_max and argsort implementations (#7237)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	de731963441ff128248259e1b99573d75264d210	b49a13dd2fa9c94c2c19a8c248bb7fa45499f9a8	2024-05-18T16:04:23+10:00	Brian	github-actions-labeler: initial commit (#7330)
A	.github/labeler.yml
A	.github/workflows/labeler.yml

commit	b49a13dd2fa9c94c2c19a8c248bb7fa45499f9a8	05834841dcb4f922983ea976539c70472272df9a	2024-05-18T08:46:20+03:00	Georgi Gerganov	convert : fix set_vocab_sentencepiece (#6866)
M	convert-hf-to-gguf.py

commit	05834841dcb4f922983ea976539c70472272df9a	ef277de2add255a08b2b909ebfbf70364d1f4dc4	2024-05-18T02:39:54+02:00	slaren	ggml : fix quants nans when all the group weights are very close to zero (#7313)
M	ggml-quants.c
M	tests/test-backend-ops.cpp

commit	ef277de2add255a08b2b909ebfbf70364d1f4dc4	b43272afa29a64dcb8bcf26a96a05bac40792b92	2024-05-17T18:39:25-06:00	Engininja2	cmake : fix typo in AMDGPU_TARGETS (#7356)
M	CMakeLists.txt

commit	b43272afa29a64dcb8bcf26a96a05bac40792b92	0fc1e820a9900a3dd08ddd3c6abe6604c53b689b	2024-05-18T01:09:13+02:00	jaime-m-p	Unicode codepoint flags for custom regexs (#7245)
M	llama.cpp
M	scripts/gen-unicode-data.py
M	tests/test-tokenizer-random.py
M	unicode-data.cpp
M	unicode-data.h
M	unicode.cpp
M	unicode.h

commit	0fc1e820a9900a3dd08ddd3c6abe6604c53b689b	82ca83db3c8d45df559c03a4225b6eb34808a2db	2024-05-17T18:54:52+02:00	Johannes Gäßler	CUDA: faster large batch FA without tensor cores (#7314)
A	ggml-cuda/fattn-tile-f16.cu
A	ggml-cuda/fattn-tile-f16.cuh
A	ggml-cuda/fattn-tile-f32.cu
A	ggml-cuda/fattn-tile-f32.cuh
M	ggml-cuda/fattn-vec-f16.cu
M	ggml-cuda/fattn-vec-f32.cu
M	ggml-cuda/fattn.cu

commit	82ca83db3c8d45df559c03a4225b6eb34808a2db	f4bd8b3d260bb09491ba63c77ab7012b744362ef	2024-05-17T11:03:03-04:00	Gavin Zhao	ROCm: use native CMake HIP support (#5966)
M	.devops/nix/package.nix
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	README.md

commit	f4bd8b3d260bb09491ba63c77ab7012b744362ef	51e9d02599336e62948d29f1d6c05addeb921ac2	2024-05-17T17:25:44+03:00	Radoslav Gerganov	rpc : set SO_REUSEADDR for the server socket (#7320)
M	examples/rpc/rpc-server.cpp
M	ggml-rpc.cpp

commit	51e9d02599336e62948d29f1d6c05addeb921ac2	d273c1402b25086fd91aef2467ac13f2e49fa0ea	2024-05-17T22:40:14+10:00	Brian	Added a single test function script and fix debug-test.sh to be more robust (#7279)
M	docs/debugging-tests.md
M	scripts/debug-test.sh

commit	d273c1402b25086fd91aef2467ac13f2e49fa0ea	27b040691cbe45314147c2745e891a38e9c048d4	2024-05-17T15:11:45+03:00	Aarni Koskela	py : convert-hf-to-gguf-update improvements (#7340)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py

commit	27b040691cbe45314147c2745e891a38e9c048d4	29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba	2024-05-17T13:24:38+02:00	fairydreaming	llama : use n_embd_head_v when reshaping kqv (#7327)
M	llama.cpp

commit	29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba	359cbe3f46c90ce6f5151005e411b8fb74f8139e	2024-05-17T09:59:57+02:00	Johannes Gäßler	tokenization: add warning for double BOS (#7332)
M	llama.cpp

commit	359cbe3f46c90ce6f5151005e411b8fb74f8139e	e18bc6aaf3b547890609ed254ee5248e720e5840	2024-05-17T07:08:49Z	Herman Semenov	ggml-quants, llama : removed excess checks (#7274)
M	common/common.cpp
M	ggml-quants.c
M	llama.cpp

commit	e18bc6aaf3b547890609ed254ee5248e720e5840	ee94172d33399d2e814ca05c8a3ff8c523ebb093	2024-05-17T12:31:58+05:30	amd-lalithnc	convert : fix Qwen/Qwen-7b conversion (#7308)
M	convert-hf-to-gguf.py

commit	ee94172d33399d2e814ca05c8a3ff8c523ebb093	934266c0e0b2aa9781fdba2deb112c161ff038a9	2024-05-17T10:00:17+03:00	Radoslav Gerganov	server : add support for the RPC backend (#7305)
M	examples/server/server.cpp

commit	934266c0e0b2aa9781fdba2deb112c161ff038a9	9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642	2024-05-17T02:58:52-04:00	Justine Tunney	ggml : rewrite silu and softmax for cpu (#7154)
M	ggml.c

commit	9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642	24ecb58168dce81646c2ed425690a106591c8c6d	2024-05-17T02:11:03+02:00	Leon Knauer	[Server] Added --verbose option to README [no ci] (#7335)
M	examples/server/README.md

commit	24ecb58168dce81646c2ed425690a106591c8c6d	9afdffe70ebf3166d429b4434783bb0b7f97bdeb	2024-05-16T20:43:45+02:00	Pierrick Hymbert	Revert "server bench: fix bench not waiting for model load (#7284)" (#7334)
M	examples/server/bench/bench.py

commit	9afdffe70ebf3166d429b4434783bb0b7f97bdeb	3b3963c55c8332e33533c44b2aa882b0e45f8292	2024-05-15T16:04:40+03:00	Radoslav Gerganov	rpc : get available mem for the CPU backend
M	examples/rpc/rpc-server.cpp

commit	3b3963c55c8332e33533c44b2aa882b0e45f8292	dda64fc17c97820ea9489eb0cc9ae8b8fdce4926	2024-05-15T15:29:07+03:00	Radoslav Gerganov	rpc : add command line arg for specifying backend memory
M	examples/rpc/README.md
M	examples/rpc/rpc-server.cpp
M	ggml-rpc.cpp

commit	dda64fc17c97820ea9489eb0cc9ae8b8fdce4926	0350f5815218c483fb3026a86adc44a115481625	2024-05-16T02:15:23-04:00	Jared Van Bortel	convert : get general.name from model dir, not its parent (#5615)
M	convert.py

commit	0350f5815218c483fb3026a86adc44a115481625	ad52d5c259344888b06fd5acd3344c663dd0621d	2024-05-16T06:14:24Z	Herman Semenov	grammar, json, llama: replace push on emplace if it possible (#7273)
M	common/grammar-parser.cpp
M	common/json-schema-to-grammar.cpp
M	llama.cpp

commit	ad52d5c259344888b06fd5acd3344c663dd0621d	172b78210aae0e54d3668c5de14200efab9fac23	2024-05-16T07:38:43+02:00	Vaibhav Srivastav	doc: add references to hugging face GGUF-my-repo quantisation web tool. (#7288)
M	README.md
M	examples/quantize/README.md

commit	172b78210aae0e54d3668c5de14200efab9fac23	13ad16af1231ab2d245d35df3295bcfa23de1305	2024-05-15T22:36:43-07:00	Max Krasnyansky	ci: fix bin/Release path for windows-arm64 builds (#7317)
M	.github/workflows/build.yml

commit	13ad16af1231ab2d245d35df3295bcfa23de1305	8f7080bf48828b538bc9387c3d150bbd4fb4cf2d	2024-05-15T19:47:36-07:00	Max Krasnyansky	Add support for properly optimized Windows ARM64 builds with LLVM and MSVC (#7191)
M	.github/workflows/build.yml
M	CMakeLists.txt
A	CMakePresets.json
A	cmake/arm64-windows-llvm.cmake
A	cmake/arm64-windows-msvc.cmake
M	common/log.h
M	ggml-quants.c

commit	8f7080bf48828b538bc9387c3d150bbd4fb4cf2d	e1b40ac3b94824d761b5e26ea1bc5692706029d9	2024-05-15T23:41:03+02:00	Daniel Bevenius	readme : remove stray double quote (#7310)
M	README.md

commit	e1b40ac3b94824d761b5e26ea1bc5692706029d9	dc020985b8755dd6aa93a2f002f43c3ede808cce	2024-05-15T12:59:12-05:00	kunnis	ggml : use dynamic thread scheduling for matrix multiplication (#6915)
M	ggml.c

commit	dc020985b8755dd6aa93a2f002f43c3ede808cce	344f9126cc0d15891fde9472fe40b8572628ad7d	2024-05-15T14:44:49+01:00	agray3	Avoid unnecessarily disabling CUDA graphs (#7302)
M	ggml-cuda.cu

commit	344f9126cc0d15891fde9472fe40b8572628ad7d	9a17ab914b0aa7353389c656a3f2a0f086726868	2024-05-15T15:08:48+02:00	slaren	ggml : tag ggml_tensor::backend as deprecated (#7290)
M	examples/llava/llava.cpp
M	ggml-backend.c
M	ggml.c
M	ggml.h

commit	9a17ab914b0aa7353389c656a3f2a0f086726868	ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d	2024-05-15T13:26:30+01:00	AidanBeltonS	Add missing " (#7303)
M	ggml-sycl.cpp

commit	ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d	29499bb59383c2a8c5d557a90abb08b696cef7f6	2024-05-15T20:01:12+08:00	dm4	embedding : free the batch after execution (#7297)
M	examples/embedding/embedding.cpp

commit	29499bb59383c2a8c5d557a90abb08b696cef7f6	48aa8fd1f213a69b41569f809cc954f24dbc4366	2024-05-15T13:23:41+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	48aa8fd1f213a69b41569f809cc954f24dbc4366	583fd6b000ec9ad1b465b5c98524f4a0ae388077	2024-05-15T03:52:33-05:00	John Balis	ggml : add `ggml_upscale_ext` (ggml/814)
M	ggml-cuda/upscale.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	583fd6b000ec9ad1b465b5c98524f4a0ae388077	9f773486ab78d65f5cca3f7e31c862b7043bf721	2024-05-15T08:44:16+02:00	Johannes Gäßler	server bench: fix bench not waiting for model load (#7284)
M	examples/server/bench/bench.py

commit	9f773486ab78d65f5cca3f7e31c862b7043bf721	e8a7fd4fb06d82f663850c21fcf86c0fb98ad9b4	2024-05-14T19:14:38+03:00	Georgi Gerganov	script : sync ggml-rpc
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	e8a7fd4fb06d82f663850c21fcf86c0fb98ad9b4	a5e3fde8578d54b98d941344a4da150669af200d	2024-05-14T19:09:30+03:00	Georgi Gerganov	metal : support FA without mask + add asserts (#7278)
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	a5e3fde8578d54b98d941344a4da150669af200d	f308ea705974dff62a1fe5367d776ad9d5109239	2024-05-14T15:33:16+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f308ea705974dff62a1fe5367d776ad9d5109239	c3c88f296a72432edb697ac8026dbf2ec18f2b21	2024-05-13T11:01:07+03:00	Georgi Gerganov	metal : tune soft_max number of threads (whisper/0)
M	ggml-metal.m

commit	c3c88f296a72432edb697ac8026dbf2ec18f2b21	182adefcf36fc5f4263082ff032c0796fda65578	2024-05-12T20:36:31+03:00	Georgi Gerganov	ggml : try fix ppc64 (whisper/0)
M	ggml-quants.c
M	ggml.c

commit	182adefcf36fc5f4263082ff032c0796fda65578	0d26d8ccd8caebab75af697c0275f599075fdacf	2024-05-08T17:33:43+02:00	Przemysław Pawełczyk	ggml : expose SSE3 and SSSE3 for MSVC when AVX is available (whisper/2128)
M	ggml-impl.h

commit	0d26d8ccd8caebab75af697c0275f599075fdacf	4f0263633b40e94e8b69fd6e7e4395cfedfd5c12	2024-05-12T17:17:18+08:00	Hong Bo PENG	ggml : optimize for ppc64le using VSX intrinsics (ggml/784)
M	ggml-quants.c

commit	4f0263633b40e94e8b69fd6e7e4395cfedfd5c12	1265c670fd8e41e1947352c96c5179adda97fb2c	2024-05-14T10:11:24-04:00	Steve Grubb	server: free sampling contexts on exit (#7264)
M	examples/server/server.cpp

commit	1265c670fd8e41e1947352c96c5179adda97fb2c	5e31828d3e35c76ecfee665bc23771a4bec1d130	2024-05-14T23:10:39+10:00	Brian	Revert "move ndk code to a new library (#6951)" (#7282)
M	examples/llama.android/app/build.gradle.kts
R098	examples/llama.android/llama/CMakeLists.txt	examples/llama.android/app/src/main/cpp/CMakeLists.txt
R092	examples/llama.android/llama/src/main/cpp/llama-android.cpp	examples/llama.android/app/src/main/cpp/llama-android.cpp
R097	examples/llama.android/llama/src/main/java/android/llama/cpp/LLamaAndroid.kt	examples/llama.android/app/src/main/java/com/example/llama/Llm.kt
M	examples/llama.android/app/src/main/java/com/example/llama/MainViewModel.kt
M	examples/llama.android/build.gradle.kts
D	examples/llama.android/llama/.gitignore
D	examples/llama.android/llama/consumer-rules.pro
D	examples/llama.android/llama/proguard-rules.pro
D	examples/llama.android/llama/src/androidTest/java/android/llama/cpp/ExampleInstrumentedTest.kt
D	examples/llama.android/llama/src/main/AndroidManifest.xml
D	examples/llama.android/llama/src/main/cpp/CMakeLists.txt
D	examples/llama.android/llama/src/test/java/android/llama/cpp/ExampleUnitTest.kt
M	examples/llama.android/settings.gradle.kts

commit	5e31828d3e35c76ecfee665bc23771a4bec1d130	541600201e6480f54ae09e58d16b154d4b4b331d	2024-05-14T14:27:19+03:00	Radoslav Gerganov	ggml : add RPC backend (#6829)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
A	examples/rpc/CMakeLists.txt
A	examples/rpc/README.md
A	examples/rpc/rpc-server.cpp
A	ggml-rpc.cpp
A	ggml-rpc.h
M	llama.cpp
M	llama.h

commit	541600201e6480f54ae09e58d16b154d4b4b331d	efc8f767c8c8c749a245dd96ad4e2f37c164b54c	2024-05-14T09:33:42+02:00	slaren	llama : disable pipeline parallelism with nkvo (#7265)
M	llama.cpp

commit	efc8f767c8c8c749a245dd96ad4e2f37c164b54c	e0f556186b6e1f2b7032a1479edf5e89e2b1bd86	2024-05-14T03:30:30-04:00	Elton Kola	move ndk code to a new library (#6951)
M	examples/llama.android/app/build.gradle.kts
M	examples/llama.android/app/src/main/java/com/example/llama/MainViewModel.kt
M	examples/llama.android/build.gradle.kts
A	examples/llama.android/llama/.gitignore
R098	examples/llama.android/app/src/main/cpp/CMakeLists.txt	examples/llama.android/llama/CMakeLists.txt
A	examples/llama.android/llama/consumer-rules.pro
A	examples/llama.android/llama/proguard-rules.pro
A	examples/llama.android/llama/src/androidTest/java/android/llama/cpp/ExampleInstrumentedTest.kt
A	examples/llama.android/llama/src/main/AndroidManifest.xml
A	examples/llama.android/llama/src/main/cpp/CMakeLists.txt
R092	examples/llama.android/app/src/main/cpp/llama-android.cpp	examples/llama.android/llama/src/main/cpp/llama-android.cpp
R097	examples/llama.android/app/src/main/java/com/example/llama/Llm.kt	examples/llama.android/llama/src/main/java/android/llama/cpp/LLamaAndroid.kt
A	examples/llama.android/llama/src/test/java/android/llama/cpp/ExampleUnitTest.kt
M	examples/llama.android/settings.gradle.kts

commit	e0f556186b6e1f2b7032a1479edf5e89e2b1bd86	27f65d6267cf22a44c5ccefa7765d53a05bd1259	2024-05-13T22:25:56-07:00	Haggai Nuchi	Add left recursion check: quit early instead of going into an infinite loop (#7083)
M	llama.cpp
M	tests/test-grammar-integration.cpp

commit	27f65d6267cf22a44c5ccefa7765d53a05bd1259	ee52225067622babc277371511b8124884e1c797	2024-05-14T14:20:47+09:00	Ryuei	docs: Fix typo and update description for --embeddings flag (#7026)
M	examples/server/README.md

commit	ee52225067622babc277371511b8124884e1c797	614d3b914e1c3e02596f869649eb4f1d3b68614d	2024-05-13T14:10:51-04:00	compilade	convert-hf : support direct Q8_0 conversion (#7234)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/__init__.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/lazy.py
A	gguf-py/gguf/quants.py

commit	614d3b914e1c3e02596f869649eb4f1d3b68614d	30e70334f71b3bd115024affcf98cac3d79aaa95	2024-05-13T17:15:15+03:00	Georgi Gerganov	llama : less KV padding when FA is off (#7257)
M	llama.cpp

commit	30e70334f71b3bd115024affcf98cac3d79aaa95	1c570d8beeebad95872dc738ea542a4a0022f78a	2024-05-13T22:02:36+08:00	k.h.lai	llava-cli: fix base64 prompt (#7248)
M	examples/llava/llava-cli.cpp

commit	1c570d8beeebad95872dc738ea542a4a0022f78a	948f4ec7c5bff92b18e63303f2b2d1645bccd943	2024-05-13T13:03:27+02:00	Johannes Gäßler	perplexity: add BF16 vs. FP16 results (#7150)
M	examples/perplexity/README.md

commit	948f4ec7c5bff92b18e63303f2b2d1645bccd943	9aa672490c848e45eaa704a554e0f1f6df995fc8	2024-05-13T18:11:26+08:00	Neo Zhang	[SYCL] rm wait() (#7233)
M	ggml-sycl.cpp

commit	9aa672490c848e45eaa704a554e0f1f6df995fc8	b1f8af1886e8187db6bb2a9b87cfc1c0f175f629	2024-05-13T10:35:14+02:00	Joan Fontanals	llama : rename jina tokenizers to v2 (#7249)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp

commit	b1f8af1886e8187db6bb2a9b87cfc1c0f175f629	e586ee42595500c53938e937b6b6ad5353ad76dc	2024-05-13T12:56:47+10:00	Brian	convert.py: Outfile default name change and additional metadata support (#4858)
M	convert.py

commit	e586ee42595500c53938e937b6b6ad5353ad76dc	cbf75894d256f1861f6409565db599365de3d4b8	2024-05-12T19:40:08-07:00	Benjamin Findley	change default temperature of OAI compat API from 0 to 1 (#7226)
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp

commit	cbf75894d256f1861f6409565db599365de3d4b8	0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9	2024-05-13T08:04:29+08:00	Neo Zhang	[SYCL] Add oneapi runtime dll files to win release package (#7241)
M	.github/workflows/build.yml

commit	0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9	dc685be46622a8fabfd57cfa804237c8f15679b8	2024-05-13T08:02:55+08:00	Neo Zhang	[SYCL] update CI with oneapi 2024.1 (#7235)
M	.github/workflows/build.yml

commit	dc685be46622a8fabfd57cfa804237c8f15679b8	6f1b63606fc68a09d62d1d74dbd156c35219026d	2024-05-12T19:40:45+02:00	Johannes Gäßler	CUDA: add FP32 FlashAttention vector kernel (#7188)
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
A	ggml-cuda/fattn-common.cuh
A	ggml-cuda/fattn-vec-f16.cu
A	ggml-cuda/fattn-vec-f16.cuh
A	ggml-cuda/fattn-vec-f32.cu
A	ggml-cuda/fattn-vec-f32.cuh
M	ggml-cuda/fattn.cu
M	tests/test-backend-ops.cpp

commit	6f1b63606fc68a09d62d1d74dbd156c35219026d	b228aba91ac2cd9eb90e9d423ba1d0d20e0117e2	2024-05-12T18:30:23+03:00	Georgi Gerganov	cmake : fix version cmp (#7227)
M	CMakeLists.txt

commit	b228aba91ac2cd9eb90e9d423ba1d0d20e0117e2	7bd4ffb78062587e4012a1c24186223f09b1bc70	2024-05-12T02:29:33+02:00	slaren	remove convert-lora-to-ggml.py (#7204)
M	CMakeLists.txt
M	ci/run.sh
D	convert-lora-to-ggml.py
M	requirements.txt
D	requirements/requirements-convert-lora-to-ggml.txt

commit	7bd4ffb78062587e4012a1c24186223f09b1bc70	1622ac023f42e5e01c163321cd98c6596aa9402d	2024-05-11T21:36:20+03:00	Georgi Gerganov	metal : fix warnings (skipme) (#0)
M	ggml-metal.metal
M	scripts/sync-ggml.last

commit	1622ac023f42e5e01c163321cd98c6596aa9402d	6aeff24f8b91e145e92d17ec7ce3adc4ef60b8e9	2024-05-11T21:35:05+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	6aeff24f8b91e145e92d17ec7ce3adc4ef60b8e9	325756d28df7d018a7bac424e1b3bc8acb4ecf07	2024-05-11T16:57:53+03:00	Georgi Gerganov	metal : fix indent (ggml/0)
M	ggml-metal.m

commit	325756d28df7d018a7bac424e1b3bc8acb4ecf07	fed0108491a3a3cbec6c6480dc8667ffff9d7659	2024-05-11T16:25:50+03:00	Georgi Gerganov	ggml : resolve merge (ggml/0)
M	ggml.c

commit	fed0108491a3a3cbec6c6480dc8667ffff9d7659	72c177c1f6c16693eee319d4ebd4eaab5e630dd2	2024-05-11T12:26:35-05:00	Josh Ramer	Scripting & documenting debugging one test without anything else in the loop. (#7096)
A	docs/debugging-tests.md
A	scripts/debug-test.sh

commit	72c177c1f6c16693eee319d4ebd4eaab5e630dd2	5a419926b0c4efab0531401aea91522aaea9fd07	2024-05-11T17:28:10+02:00	Xuan Son Nguyen	fix system prompt handling (#7153)
M	examples/server/server.cpp

commit	5a419926b0c4efab0531401aea91522aaea9fd07	fae9d234b6606693704eca62fe4aefbb6c6abb45	2024-05-11T11:06:26-04:00	compilade	convert-hf : support bfloat16 conversion (#7158)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/__init__.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
A	gguf-py/gguf/lazy.py

commit	fae9d234b6606693704eca62fe4aefbb6c6abb45	f5ef34e428f3886544590ecb2d532e4d333c114c	2024-05-11T12:02:39+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f5ef34e428f3886544590ecb2d532e4d333c114c	ef0d5e3ec9f99003af3ff326384816c02850ea3f	2024-05-01T14:44:26-07:00	Justina Cho	feat: implemented sigmoid function (ggml/806)
M	ggml-cuda.cu
M	ggml-cuda/unary.cu
M	ggml-cuda/unary.cuh
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h

commit	ef0d5e3ec9f99003af3ff326384816c02850ea3f	3292733f95d4632a956890a438af5192e7031c12	2024-04-25T17:24:07+03:00	Borislav Stanimirov	build: fix and ignore msvc warnings (ggml/805)
M	ggml-backend.c
M	ggml-quants.c

commit	3292733f95d4632a956890a438af5192e7031c12	988631335a20d06497f58be0b8ba13adb4323a22	2024-05-11T10:18:35+02:00	CrispStrobe	convert : skip unaccessible HF repos (#7210)
M	convert-hf-to-gguf-update.py

commit	988631335a20d06497f58be0b8ba13adb4323a22	f99e1e456eaf69cc38c1982a2693ce41c0f897ef	2024-05-11T04:13:02-04:00	Steve Grubb	server : free llama_batch on exit (#7212)
M	examples/server/server.cpp

commit	f99e1e456eaf69cc38c1982a2693ce41c0f897ef	5ae3426b0b64672991563d4c28b2018b9f961467	2024-05-11T16:12:06+08:00	Haoxiang Fei	llama : lookup word in vocab before doing BPE merges (#7193)
M	llama.cpp
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	tests/CMakeLists.txt
M	tests/test-tokenizer-1-bpe.cpp

commit	5ae3426b0b64672991563d4c28b2018b9f961467	b83cc3f5b303ff30c52874b2d5864dc6385ebf9f	2024-05-11T10:11:28+02:00	Johannes Gäßler	server: fix reported top tokens for temperature 0 (#7203)
M	common/sampling.cpp
M	common/sampling.h
M	examples/server/server.cpp

commit	b83cc3f5b303ff30c52874b2d5864dc6385ebf9f	9cb317f77e53067f7a138cc89ef7657148eae8e6	2024-05-11T09:46:09+02:00	Joan Fontanals	llama : add Jina Embeddings architecture (#6826)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	examples/embedding/embedding.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	9cb317f77e53067f7a138cc89ef7657148eae8e6	e849648888a11de13aaaa4cb2eda3f5a9c7b444d	2024-05-11T10:32:41+03:00	Georgi Gerganov	ggml : full ALiBi support (#7192)
M	convert-hf-to-gguf.py
M	ggml-cuda.cu
D	ggml-cuda/alibi.cu
D	ggml-cuda/alibi.cuh
M	ggml-cuda/fattn.cu
M	ggml-cuda/softmax.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	e849648888a11de13aaaa4cb2eda3f5a9c7b444d	18e437665ce626dddbd79119aa7498493e7cb13b	2024-05-10T18:03:54+02:00	slaren	llama-bench : add pp+tg test type (#7199)
M	examples/llama-bench/README.md
M	examples/llama-bench/llama-bench.cpp
M	scripts/compare-llama-bench.py

commit	18e437665ce626dddbd79119aa7498493e7cb13b	8c660242d708d3913a2adc2b6e4a9ee9cf5e4ce7	2024-05-10T18:20:10+03:00	Georgi Gerganov	metal : fix flash attention kernel requirements (#7169)
M	ggml-metal.m

commit	8c660242d708d3913a2adc2b6e4a9ee9cf5e4ce7	25c6e82e7a1ad25a42b0894e87d9b5c557409516	2024-05-10T17:53:04+03:00	Georgi Gerganov	convert : print "ignore_merges" field
M	convert-hf-to-gguf-update.py

commit	25c6e82e7a1ad25a42b0894e87d9b5c557409516	4e3880978f8b1bf546dd4e6f3b524d6b8739c49c	2024-05-10T14:28:01+02:00	slaren	llama : use n_vocab to differentiate between mistral 7B and llama3 8B (#7200)
M	llama.cpp

commit	4e3880978f8b1bf546dd4e6f3b524d6b8739c49c	f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2	2024-05-10T07:01:08-04:00	Justine Tunney	Fix memory bug in grammar parser (#7194)
M	common/common.cpp
M	common/grammar-parser.cpp
M	examples/llava/llava-cli.cpp
M	examples/main/main.cpp

commit	f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2	d11afd665241c1b3910ab5f040d0216403019d87	2024-05-10T15:51:58+05:30	HanishKVC	Main+: optionally allow special tokens from user in interactive mode (#7097)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	d11afd665241c1b3910ab5f040d0216403019d87	8c570c9496212073079476651c7517c02581101f	2024-05-10T02:41:10-04:00	Andrei	llava : fix moondream support (#7163)
M	README.md
M	examples/llava/clip.cpp

commit	8c570c9496212073079476651c7517c02581101f	eaf4bd8b399a6ed4b834f91d22409d2a05c4d266	2024-05-10T01:32:15+01:00	Ouadie EL FAROUKI	Minor arithmetic improvement to mmvq wrapper kernel (#7172)
M	ggml-sycl.cpp

commit	eaf4bd8b399a6ed4b834f91d22409d2a05c4d266	befddd0f15de6efb15d7e7f5b527dfb671f4196f	2024-05-10T01:04:12+02:00	slaren	eval-callback : fix conversion to float (#7184)
M	examples/eval-callback/eval-callback.cpp

commit	befddd0f15de6efb15d7e7f5b527dfb671f4196f	d46dbc76f8770caec0175f1e57777173c70556a0	2024-05-09T20:39:54+02:00	0cc4m	Vulkan Bugfixes and Improvements (#7084)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	d46dbc76f8770caec0175f1e57777173c70556a0	0961d866044143eefec5b525e991611f73fd4f6e	2024-05-09T16:40:42+03:00	Georgi Gerganov	readme : add scheduled server workflow status badge
M	README.md

commit	0961d866044143eefec5b525e991611f73fd4f6e	43248e559472556f368988575d9fba906b3eb139	2024-05-09T22:32:40+09:00	l3utterfly	readme : add app (#6371)
M	README.md

commit	43248e559472556f368988575d9fba906b3eb139	a743d76a01f23038b2c85af1e9048ee836767b44	2024-05-09T15:30:44+02:00	jaime-m-p	llama3 custom regex split (#6965)
M	convert-hf-to-gguf-update.py
M	llama.cpp
M	scripts/gen-unicode-data.py
A	tests/test-tokenizer-random.py
M	unicode-data.cpp
M	unicode-data.h
M	unicode.cpp
M	unicode.h

commit	a743d76a01f23038b2c85af1e9048ee836767b44	f31ec120bc36c6270e4948e6a065a7c4cfa0c404	2024-05-09T14:32:02+02:00	Johannes Gäßler	CUDA: generalize FP16 fattn vec kernel (#7061)
M	ggml-cuda/common.cuh
M	ggml-cuda/fattn.cu
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	f31ec120bc36c6270e4948e6a065a7c4cfa0c404	fd9f92b154850014146f61717cd292a59a5cee5a	2024-05-09T14:13:05+02:00	Galunid	Add warning if token is invalid (#7173)
M	convert-hf-to-gguf-update.py

commit	fd9f92b154850014146f61717cd292a59a5cee5a	22842164bcae3251b81ad9e497a16ef66833cb9e	2024-05-09T13:03:29+02:00	Daniel Bevenius	llama : update llama_timings.n_p_eval setting (#7160)
M	llama.cpp

commit	22842164bcae3251b81ad9e497a16ef66833cb9e	47345248827f426038098d016ed11975021b4919	2024-05-09T12:56:00+02:00	Sigbjørn Skjæret	gguf-py : add special token modification capability (#7166)
M	gguf-py/scripts/gguf-new-metadata.py

commit	47345248827f426038098d016ed11975021b4919	07cd41d0965829463eff73eda3348aedbfd3a444	2024-05-09T17:34:37+08:00	Albert Jin	opencl : alignment size converted from bits to bytes (#7090)
M	ggml-opencl.cpp

commit	07cd41d0965829463eff73eda3348aedbfd3a444	4426e2987b566f09c7aa96ada9706cc778637620	2024-05-09T11:16:45+03:00	Ahmet Zeer	TypoFix (#7162)
M	examples/convert-llama2c-to-ggml/README.md

commit	4426e2987b566f09c7aa96ada9706cc778637620	f98eb31c517c95960df1d0abc48002787f145f3b	2024-05-08T19:55:32-04:00	Jared Van Bortel	cmake : fix typo (#7151)
M	CMakeLists.txt

commit	f98eb31c517c95960df1d0abc48002787f145f3b	bc4bba364fb96d908f2698e908648df5e6f55e02	2024-05-08T18:16:38-04:00	compilade	convert-hf : save memory with lazy evaluation (#7075)
M	convert-hf-to-gguf.py
M	convert.py
M	examples/server/tests/features/steps/steps.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	gguf-py/scripts/gguf-dump.py
M	gguf-py/scripts/gguf-new-metadata.py
A	pyrightconfig.json
M	requirements/requirements-convert-hf-to-gguf-update.txt
M	requirements/requirements-convert-hf-to-gguf.txt
M	requirements/requirements-convert.txt

commit	bc4bba364fb96d908f2698e908648df5e6f55e02	c12452c7aec8a02264afc00196a13caa591a13ac	2024-05-08T21:55:49+01:00	agray3	Introduction of CUDA Graphs to LLama.cpp (#6766)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu
M	ggml-cuda/clamp.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/convert.cu
M	ggml-cuda/cpy.cu
M	ggml-cuda/cpy.cuh
M	ggml-cuda/mmq.cu
M	ggml-cuda/mmvq.cu
M	ggml-cuda/scale.cu

commit	c12452c7aec8a02264afc00196a13caa591a13ac	9da243b36ac0b9d609adfaaa4c8f1cc8c592f737	2024-05-08T21:53:08+02:00	Johannes Gäßler	JSON: [key] -> .at(key), assert() -> GGML_ASSERT (#7143)
M	common/common.cpp
M	common/json-schema-to-grammar.h
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	tests/test-json-schema-to-grammar.cpp

commit	9da243b36ac0b9d609adfaaa4c8f1cc8c592f737	bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46	2024-05-08T22:14:39+03:00	Georgi Gerganov	Revert "llava : add support for moondream vision language model (#6899)"
M	README.md
M	examples/llava/clip.cpp

commit	bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46	26458af1d63c85195cd96cd1673051e332d06d30	2024-05-08T20:12:06+01:00	JohnnyB	server : add themes + favicon (#6848)
A	examples/server/public/favicon.ico
A	examples/server/themes/README.md
A	examples/server/themes/buttons-top/README.md
A	examples/server/themes/buttons-top/buttons_top.png
A	examples/server/themes/buttons-top/favicon.ico
A	examples/server/themes/buttons-top/index.html
A	examples/server/themes/wild/README.md
A	examples/server/themes/wild/favicon.ico
A	examples/server/themes/wild/index.html
A	examples/server/themes/wild/llama_cpp.png
A	examples/server/themes/wild/llamapattern.png
A	examples/server/themes/wild/wild.png

commit	26458af1d63c85195cd96cd1673051e332d06d30	83330d8cd6491e53e1aca4c5dfc47e039b3c04ff	2024-05-08T22:08:10+03:00	Gilad S	metal : use `vm_allocate` instead of `posix_memalign` on macOS (#7078)
M	ggml-metal.m

commit	83330d8cd6491e53e1aca4c5dfc47e039b3c04ff	465263d0cf1e8f8bc41948332dbd009d27a68590	2024-05-09T02:32:32+12:00	Dawid Potocki	main : add --conversation / -cnv flag (#7108)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	465263d0cf1e8f8bc41948332dbd009d27a68590	911b3900dded9a1cfe0f0e41b82c7a29baf3a217	2024-05-08T14:29:23Z	Eve	sgemm : AVX Q4_0 and Q8_0 (#6891)
M	sgemm.cpp

commit	911b3900dded9a1cfe0f0e41b82c7a29baf3a217	ad211edef5db1f1fb955874b7ca6a67bd0c88708	2024-05-08T14:27:58+02:00	Johan	server : add_special option for tokenize endpoint (#7059)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py

commit	ad211edef5db1f1fb955874b7ca6a67bd0c88708	229ffff872f8ad0d21c997d18ee7a23692ae60a0	2024-05-08T13:22:32+01:00	20kdc	convert.py : --vocab-only generates false but valid params (#7027)
M	convert.py

commit	229ffff872f8ad0d21c997d18ee7a23692ae60a0	1fd9c1741d864d01cd7ec6d67227b92d7bfabf22	2024-05-08T20:06:43+08:00	Ren Xuancheng	llama : add BPE pre-tokenization for Qwen2 (#7114)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h
A	models/ggml-vocab-qwen2.gguf
A	models/ggml-vocab-qwen2.gguf.inp
A	models/ggml-vocab-qwen2.gguf.out
M	tests/CMakeLists.txt

commit	1fd9c1741d864d01cd7ec6d67227b92d7bfabf22	4cd621c26de2095cd7c4464bdec5fe2e696ef3f3	2024-05-08T13:24:14+02:00	Xuan Son Nguyen	clean up json_value & server_log (#7142)
M	examples/server/utils.hpp

commit	4cd621c26de2095cd7c4464bdec5fe2e696ef3f3	7e0b6a7b3ba94ff624dc27c1e0e735fded8819b8	2024-05-08T06:43:23-04:00	DAN™	convert : add BPE pre-tokenization for DBRX (#7132)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	7e0b6a7b3ba94ff624dc27c1e0e735fded8819b8	acdce3cdef6fc2f0b7b5623231fd7762c0884d1c	2024-05-08T12:47:07+03:00	Georgi Gerganov	py : also print the normalizers
M	convert-hf-to-gguf-update.py

commit	acdce3cdef6fc2f0b7b5623231fd7762c0884d1c	3855416027cb25d9a708ffa5581cf503a87856a6	2024-05-08T18:54:39+10:00	Brian	compare-llama-bench.py: add missing basicConfig (#7138)
M	scripts/compare-llama-bench.py

commit	3855416027cb25d9a708ffa5581cf503a87856a6	c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1	2024-05-08T02:30:09-04:00	Justine Tunney	ggml : introduce bfloat16 support (#6412)
M	examples/finetune/finetune.cpp
M	examples/quantize/quantize.cpp
M	ggml-impl.h
M	ggml-metal.m
M	ggml-quants.c
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1	c780e75305dba1f67691a8dc0e8bc8425838a452	2024-05-08T09:14:50+03:00	Georgi Gerganov	metal : fix unused warning
M	ggml-metal.metal

commit	c780e75305dba1f67691a8dc0e8bc8425838a452	48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e	2024-05-07T21:26:43-03:00	Jeximo	Further tidy on Android instructions README.md (#7077)
M	README.md

commit	48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e	af0a5b616359809ce886ea433acedebb39b12969	2024-05-08T01:24:16+01:00	jukofyork	Fixed save_imatrix to match old behaviour for MoE (#7099)
M	examples/imatrix/imatrix.cpp

commit	af0a5b616359809ce886ea433acedebb39b12969	b6aa6702030320a3d5fbc2508307af0d7c947e40	2024-05-07T23:07:58+02:00	Johannes Gäßler	server: fix incorrectly reported token probabilities (#7125)
M	common/sampling.cpp
M	common/sampling.h
M	examples/server/README.md
M	examples/server/server.cpp

commit	b6aa6702030320a3d5fbc2508307af0d7c947e40	260b7c65296fba0568eeb1ff05244ea0be206b54	2024-05-07T19:39:43Z	nopperl	Fix OLMo HF to GGUF conversion (#6910)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	260b7c65296fba0568eeb1ff05244ea0be206b54	53d6c52e227dedef347b21e28febcfb9caeecdad	2024-05-07T13:44:29-05:00	Kyle Mistele	server : update readme with undocumented options (#7013)
M	examples/server/README.md

commit	53d6c52e227dedef347b21e28febcfb9caeecdad	3af34c1d1b0da47f85b95f60922abeded1cb5d33	2024-05-07T21:43:13+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	3af34c1d1b0da47f85b95f60922abeded1cb5d33	04976db7a819fcf8bfefbfc09a3344210b79dd27	2024-05-07T19:51:31+02:00	RhinoDevel	main : update log text (EOS to EOG) (#7104)
M	examples/main/main.cpp

commit	04976db7a819fcf8bfefbfc09a3344210b79dd27	947d3ad27d94f1addef76b5d64c314618f063933	2024-05-07T17:20:33+02:00	omahs	docs: fix typos (#7124)
M	docs/BLIS.md
M	docs/HOWTO-add-model.md
M	examples/llava/README.md
M	examples/main/README.md
M	examples/sycl/README.md
M	grammars/README.md

commit	947d3ad27d94f1addef76b5d64c314618f063933	858f6b73f6e57a62523d16a955d565254be889b4	2024-05-07T11:08:49+03:00	Georgi Gerganov	ci : add GG_BUILD_EXTRA_TESTS_0 env (#7098)
M	ci/run.sh

commit	858f6b73f6e57a62523d16a955d565254be889b4	b3a995b416e13ae3123a117a743e11d0ede0ca4c	2024-05-06T11:12:14-07:00	William Tambellini	Add an option to build without CUDA VMM (#7067)
M	CMakeLists.txt
M	ggml-cuda.cu

commit	b3a995b416e13ae3123a117a743e11d0ede0ca4c	bcdee0daa7c5e8e086b719e5eb4073b00df70e01	2024-05-06T18:36:06+03:00	Georgi Gerganov	flake.lock: Update (#7079)
M	flake.lock

commit	bcdee0daa7c5e8e086b719e5eb4073b00df70e01	628b299106d1e9476fdecb3cbe546bf5c60f1b89	2024-05-06T09:31:30+03:00	Georgi Gerganov	minor : fix trailing whitespace
M	README.md

commit	628b299106d1e9476fdecb3cbe546bf5c60f1b89	8f8acc8683a00ce40fa5a81161a079d2167126e6	2024-05-05T07:17:47-05:00	kunnis	Adding support for the --numa argument for llama-bench. (#7080)
M	examples/llama-bench/llama-bench.cpp

commit	8f8acc8683a00ce40fa5a81161a079d2167126e6	ca3632602091e959ed2ad4c09c67a7c790b10d31	2024-05-05T13:38:55+02:00	Sigbjørn Skjæret	Disable benchmark on forked repo (#7034)
M	.github/workflows/bench.yml

commit	ca3632602091e959ed2ad4c09c67a7c790b10d31	889bdd76866ea31a7625ec2dcea63ff469f3e981	2024-05-05T06:21:46+01:00	Lyle Dean	readme : add note that LLaMA 3 is not supported with convert.py (#7065)
M	README.md

commit	889bdd76866ea31a7625ec2dcea63ff469f3e981	6fbd43221167bf96112f899daf22c127b282cbcf	2024-05-05T01:19:30-04:00	DAN™	command-r : add BPE pre-tokenization (#7063)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h
A	models/ggml-vocab-command-r.gguf
A	models/ggml-vocab-command-r.gguf.inp
A	models/ggml-vocab-command-r.gguf.out
M	requirements/requirements-convert.txt
M	tests/CMakeLists.txt

commit	6fbd43221167bf96112f899daf22c127b282cbcf	842500144ee02c8b0a46d2cc43880f8d80998fa5	2024-05-05T15:07:48+10:00	Brian	py : logging and flake8 suppression refactoring (#7081)
M	.flake8
M	convert-hf-to-gguf-update.py
M	convert-lora-to-ggml.py
M	scripts/gen-unicode-data.py
M	tests/test-tokenizer-0.py

commit	842500144ee02c8b0a46d2cc43880f8d80998fa5	cf768b7e71cbcc9886c753ae963c2b68893d02e4	2024-05-04T18:56:22+02:00	Xuan Son Nguyen	gguf-split: add --no-tensor-first-split (#7072)
M	examples/gguf-split/gguf-split.cpp
M	examples/gguf-split/tests.sh
M	ggml.c

commit	cf768b7e71cbcc9886c753ae963c2b68893d02e4	fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c	2024-05-04T13:10:15-03:00	Jeximo	Tidy Android Instructions README.md (#7016)
M	README.md

commit	fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c	03fb8a002df2e96104f9e06de9c78d2a8ed91e92	2024-05-04T15:26:53+02:00	viric	Fix Linux /sys cpu path to guess number of cores (#7064)
M	common/common.cpp

commit	03fb8a002df2e96104f9e06de9c78d2a8ed91e92	92139b90af4841d7fd060b526bdd443b621770ff	2024-05-04T12:06:40+03:00	maor-ps	If first token generated from the server is the stop word the server will crash (#7038)
M	examples/server/server.cpp

commit	92139b90af4841d7fd060b526bdd443b621770ff	a2ac89d6efb41b535778bfeaecaae8fe295b6ed3	2024-05-04T08:32:32+03:00	Georgi Gerganov	tests : add test-tokenizer-0.sh + fix some tokenizers (#7036)
M	.flake8
M	Makefile
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h
M	models/ggml-vocab-bert-bge.gguf.inp
M	models/ggml-vocab-bert-bge.gguf.out
M	models/ggml-vocab-deepseek-coder.gguf.inp
M	models/ggml-vocab-deepseek-coder.gguf.out
M	models/ggml-vocab-deepseek-llm.gguf.inp
M	models/ggml-vocab-deepseek-llm.gguf.out
M	models/ggml-vocab-falcon.gguf.inp
M	models/ggml-vocab-falcon.gguf.out
M	models/ggml-vocab-gpt-2.gguf.inp
M	models/ggml-vocab-gpt-2.gguf.out
M	models/ggml-vocab-llama-bpe.gguf.inp
M	models/ggml-vocab-llama-bpe.gguf.out
M	models/ggml-vocab-llama-spm.gguf.inp
M	models/ggml-vocab-llama-spm.gguf.out
M	models/ggml-vocab-mpt.gguf.inp
M	models/ggml-vocab-mpt.gguf.out
M	models/ggml-vocab-phi-3.gguf
M	models/ggml-vocab-phi-3.gguf.inp
M	models/ggml-vocab-phi-3.gguf.out
M	models/ggml-vocab-refact.gguf
A	models/ggml-vocab-refact.gguf.inp
A	models/ggml-vocab-refact.gguf.out
M	models/ggml-vocab-starcoder.gguf.inp
M	models/ggml-vocab-starcoder.gguf.out
A	scripts/gen-unicode-data.py
M	tests/CMakeLists.txt
D	tests/test-tokenizer-0-bpe.py
D	tests/test-tokenizer-0-spm.py
M	tests/test-tokenizer-0.cpp
A	tests/test-tokenizer-0.py
A	tests/test-tokenizer-0.sh
M	unicode-data.cpp
M	unicode-data.h
M	unicode.cpp
M	unicode.h

commit	a2ac89d6efb41b535778bfeaecaae8fe295b6ed3	433def286e98751bf17db75dce53847d075c0be5	2024-05-04T05:36:41+10:00	Brian	convert.py : add python logging instead of print() (#6511)
M	.flake8
M	.github/workflows/python-lint.yml
M	.pre-commit-config.yaml
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-lora-to-ggml.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	ggml_vk_generate_shaders.py
M	gguf-py/examples/reader.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py
M	gguf-py/scripts/gguf-convert-endian.py
M	gguf-py/scripts/gguf-dump.py
M	gguf-py/scripts/gguf-set-metadata.py
M	scripts/compare-llama-bench.py
M	scripts/run-with-preset.py
M	scripts/verify-checksum-models.py
M	tests/test-tokenizer-0-bpe.py
M	tests/test-tokenizer-0-spm.py

commit	433def286e98751bf17db75dce53847d075c0be5	60325fa56f61c228464c9f065db3aa6a61f2156e	2024-05-03T15:24:30+02:00	Daniel Bevenius	llama : rename ctx to user_data in progress_callback (#7045)
M	llama.h

commit	60325fa56f61c228464c9f065db3aa6a61f2156e	6ecf3189e00a1e8e737a78b6d10e1d7006e050a2	2024-05-02T19:49:09-04:00	Bartowski	Remove .attention from skipped tensors to match more accurately (#7051)
M	convert-hf-to-gguf.py

commit	6ecf3189e00a1e8e737a78b6d10e1d7006e050a2	b0d943de179ad5dbd83d51f327fb566066f4ccda	2024-05-02T23:56:41+08:00	alwqx	chore: fix typo in llama.cpp (#7032)
M	llama.cpp

commit	b0d943de179ad5dbd83d51f327fb566066f4ccda	8d608a81b7bd170f700648f8214e6f3279d4d715	2024-05-01T17:31:30-04:00	Andrew Downing	Update LOG_IMPL and LOG_TEE_IMPL (#7029)
M	common/log.h

commit	8d608a81b7bd170f700648f8214e6f3279d4d715	3ea0d36000e2314baba7e9fc6a97f08670a6f7e4	2024-05-02T04:27:41+09:00	l3utterfly	main : fix off by one error for context shift (#6921)
M	examples/main/main.cpp

commit	3ea0d36000e2314baba7e9fc6a97f08670a6f7e4	1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed	2024-05-01T17:52:55+02:00	Johannes Gäßler	Server: add tests for batch size, different seeds (#6950)
M	examples/server/tests/features/results.feature
M	examples/server/tests/features/steps/steps.py

commit	1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed	c4ec9c0d3d67e6b33638e6dad86419e6fd5ffe01	2024-05-01T14:46:37+02:00	Johannes Gäßler	CUDA: CUDART < 11.7 workaround for __hmax, __hmax2 (#7019)
M	ggml-cuda/common.cuh
M	ggml-cuda/fattn.cu

commit	c4ec9c0d3d67e6b33638e6dad86419e6fd5ffe01	a8f9b076316e16aadd0791015b3bfd446fe1e904	2024-05-01T07:13:59+02:00	slaren	ci : exempt confirmed bugs from being tagged as stale (#7014)
M	.github/workflows/close-issue.yml

commit	a8f9b076316e16aadd0791015b3bfd446fe1e904	f364eb6fb5d46118a76fa045f487318de4c24961	2024-04-30T23:36:27+02:00	Johannes Gäßler	perplexity: more statistics, added documentation (#6936)
M	common/common.h
M	examples/perplexity/README.md
M	examples/perplexity/perplexity.cpp

commit	f364eb6fb5d46118a76fa045f487318de4c24961	77e15bec6217a39be59b9cc83d6b9afb6b0d8167	2024-04-30T08:14:02-07:00	Kevin Gibbons	switch to using localizedDescription (#7010)
M	ggml-metal.m

commit	77e15bec6217a39be59b9cc83d6b9afb6b0d8167	a68a1e7ed060ee5af2d638585d19e3510ddbf16c	2024-04-30T15:52:21+03:00	Georgi Gerganov	metal : remove deprecated error code (#7008)
M	ggml-metal.m

commit	a68a1e7ed060ee5af2d638585d19e3510ddbf16c	9c67c2773d4b706cf71d70ecf4aa180b62501960	2024-04-30T02:34:50-07:00	Kevin Gibbons	metal : log more info on error (#6987)
M	ggml-metal.m

commit	9c67c2773d4b706cf71d70ecf4aa180b62501960	952d03dbead16e4dbdd1d3458486340673cc2465	2024-04-30T12:16:08+03:00	Georgi Gerganov	ggml : add Flash Attention (#5021)
M	ci/run.sh
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/server/bench/bench.py
M	examples/server/server.cpp
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
A	ggml-cuda/fattn.cu
A	ggml-cuda/fattn.cuh
M	ggml-cuda/softmax.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	952d03dbead16e4dbdd1d3458486340673cc2465	8843a98c2ba97a25e93319a104f9ddfaf83ce4c4	2024-04-30T11:05:25+03:00	Georgi Gerganov	convert : use utf8 encoding (#7000)
M	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py

commit	8843a98c2ba97a25e93319a104f9ddfaf83ce4c4	b8c1476e44cc1f3a1811613f65251cf779067636	2024-04-30T00:52:50+01:00	Olivier Chafik	Improve usability of --model-url & related flags (#6930)
M	.gitignore
M	common/common.cpp
M	common/common.h
M	examples/main/README.md
M	examples/quantize-stats/quantize-stats.cpp
M	examples/server/server.cpp
M	examples/server/tests/features/embeddings.feature

commit	b8c1476e44cc1f3a1811613f65251cf779067636	5539e6fdd1b97e0c37c54d34df67f334fc344a26	2024-04-29T14:40:14-04:00	Clint Herron	Extending grammar integration tests (#6644)
M	tests/test-grammar-integration.cpp

commit	5539e6fdd1b97e0c37c54d34df67f334fc344a26	b8a7a5a90fd3187175d84227dad705ade395ba46	2024-04-29T19:56:59+02:00	Daniel Bevenius	main : fix typo in comment in main.cpp (#6985)
M	examples/main/main.cpp

commit	b8a7a5a90fd3187175d84227dad705ade395ba46	d2c898f746a527f09effb061829e68b2e1812a28	2024-04-29T17:02:45+01:00	Olivier Chafik	build(cmake): simplify instructions (`cmake -B build && cmake --build build ...`) (#6964)
M	.devops/main-intel.Dockerfile
M	.devops/main-vulkan.Dockerfile
M	.devops/server-intel.Dockerfile
M	.devops/server-vulkan.Dockerfile
M	.github/workflows/bench.yml
M	.github/workflows/server.yml
M	README-sycl.md
M	README.md
M	examples/main-cmake-pkg/README.md
M	examples/server/README.md

commit	d2c898f746a527f09effb061829e68b2e1812a28	544f1f10adeec3d5ed91c4d3bd3f903904ecea63	2024-04-29T18:36:39+03:00	Georgi Gerganov	ci : tmp disable gguf-split (#6983)
M	ci/run.sh

commit	544f1f10adeec3d5ed91c4d3bd3f903904ecea63	ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a	2024-04-29T17:55:02+03:00	Georgi Gerganov	ggml : fix __MSC_VER -> _MSC_VER (#6977)
M	ggml-impl.h

commit	ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a	24affa7db3c9db148854b0ab4fd63de8bca7d898	2024-04-29T07:34:24-07:00	cpumaxx	llava-cli : multiple images (#6969)
M	common/common.cpp
M	common/common.h
M	examples/llava/llava-cli.cpp

commit	24affa7db3c9db148854b0ab4fd63de8bca7d898	f4ab2a41476600a98067a9474ea8f9e6db41bcfa	2024-04-29T17:06:19+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	f4ab2a41476600a98067a9474ea8f9e6db41bcfa	3f167476b11efa7ab08f6cacdeb8cab0935c1249	2024-04-29T16:58:41+03:00	Georgi Gerganov	llama : fix BPE pre-tokenization (#6920)
M	.github/workflows/python-lint.yml
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
A	convert-hf-to-gguf-update.py
M	convert-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-persimmon-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp
M	llama.h
A	models/ggml-vocab-bert-bge.gguf
A	models/ggml-vocab-bert-bge.gguf.inp
A	models/ggml-vocab-bert-bge.gguf.out
A	models/ggml-vocab-deepseek-coder.gguf
A	models/ggml-vocab-deepseek-coder.gguf.inp
A	models/ggml-vocab-deepseek-coder.gguf.out
A	models/ggml-vocab-deepseek-llm.gguf
A	models/ggml-vocab-deepseek-llm.gguf.inp
A	models/ggml-vocab-deepseek-llm.gguf.out
M	models/ggml-vocab-falcon.gguf
A	models/ggml-vocab-falcon.gguf.inp
A	models/ggml-vocab-falcon.gguf.out
A	models/ggml-vocab-gpt-2.gguf
A	models/ggml-vocab-gpt-2.gguf.inp
A	models/ggml-vocab-gpt-2.gguf.out
A	models/ggml-vocab-llama-bpe.gguf
A	models/ggml-vocab-llama-bpe.gguf.inp
A	models/ggml-vocab-llama-bpe.gguf.out
R099	models/ggml-vocab-llama.gguf	models/ggml-vocab-llama-spm.gguf
A	models/ggml-vocab-llama-spm.gguf.inp
A	models/ggml-vocab-llama-spm.gguf.out
M	models/ggml-vocab-mpt.gguf
A	models/ggml-vocab-mpt.gguf.inp
A	models/ggml-vocab-mpt.gguf.out
A	models/ggml-vocab-phi-3.gguf
A	models/ggml-vocab-phi-3.gguf.inp
A	models/ggml-vocab-phi-3.gguf.out
R100	models/ggml-vocab-stablelm-3b-4e1t.gguf	models/ggml-vocab-stablelm.gguf
M	models/ggml-vocab-starcoder.gguf
A	models/ggml-vocab-starcoder.gguf.inp
A	models/ggml-vocab-starcoder.gguf.out
M	requirements.txt
A	requirements/requirements-convert-hf-to-gguf-update.txt
M	scripts/check-requirements.sh
M	tests/CMakeLists.txt
R059	tests/test-tokenizer-0-falcon.py	tests/test-tokenizer-0-bpe.py
D	tests/test-tokenizer-0-falcon.cpp
D	tests/test-tokenizer-0-llama.cpp
R086	tests/test-tokenizer-0-llama.py	tests/test-tokenizer-0-spm.py
A	tests/test-tokenizer-0.cpp
R098	tests/test-tokenizer-1-llama.cpp	tests/test-tokenizer-1-spm.cpp
M	unicode-data.cpp
M	unicode-data.h
M	unicode.cpp
M	unicode.h

commit	3f167476b11efa7ab08f6cacdeb8cab0935c1249	3055a4180557c6cbe29eacc8284c9e070ac10eab	2024-04-29T09:35:45-04:00	David Renshaw	sampling : use std::random_device{}() for default random seed (#6962)
M	common/sampling.cpp

commit	3055a4180557c6cbe29eacc8284c9e070ac10eab	577277ffd203b190c3dc2ab3e737946dc432132c	2024-04-29T09:34:41-04:00	Christian Zhou-Zheng	convert : fix conversion of some BERT embedding models (#6937)
M	convert-hf-to-gguf.py

commit	577277ffd203b190c3dc2ab3e737946dc432132c	ca7f29f568803bee4c92d1b3e41c7d721b0dc570	2024-04-29T15:08:20+02:00	Przemysław Pawełczyk	make : change GNU make default CXX from g++ to c++ (#6966)
M	Makefile

commit	ca7f29f568803bee4c92d1b3e41c7d721b0dc570	c4f708a93f1df5e35167f9313e000d381298be7f	2024-04-29T14:59:47+02:00	Przemysław Pawełczyk	ci : add building in MSYS2 environments (Windows) (#6967)
M	.github/workflows/build.yml

commit	c4f708a93f1df5e35167f9313e000d381298be7f	e00b4a8f816ebc45b98a46e5f5231359b9a017e0	2024-04-29T14:36:22+02:00	Johannes Gäßler	llama : fix typo LAMMAFILE -> LLAMAFILE (#6974)
M	llama.cpp

commit	e00b4a8f816ebc45b98a46e5f5231359b9a017e0	7bb36ccf91b8a2e92b182dd75624f1fd7cb205ac	2024-04-28T18:38:44-04:00	DAN™	Fix more int overflow during quant (PPL/CUDA). (#6563)
M	ggml-cuda/convert.cu
M	ggml-cuda/softmax.cu

commit	7bb36ccf91b8a2e92b182dd75624f1fd7cb205ac	ce023f6f2ff34fbe840e32e65d443d2fed7393de	2024-04-28T17:36:18+02:00	Xuan Son Nguyen	gguf : enforce that tensor names are unique (#6905)
M	ggml.c
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	ce023f6f2ff34fbe840e32e65d443d2fed7393de	6e472f58e40cd4acf6023e15c75a2700535c5f0b	2024-04-28T22:40:31+08:00	Neo Zhang	add device version in device list (#6959)
M	ggml-sycl.cpp

commit	6e472f58e40cd4acf6023e15c75a2700535c5f0b	4dba7e8114d84241c842b986e008af8b88d1a019	2024-04-28T00:18:27Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	4dba7e8114d84241c842b986e008af8b88d1a019	b7368332e24c5b2c8038bf8267f43632783fcc35	2024-04-27T21:02:06+02:00	mgroeber9110	Replace "alternative" boolean operator in conditional compilation directive (#6949)
M	common/log.h

commit	b7368332e24c5b2c8038bf8267f43632783fcc35	928e0b7013c862cf10701957b3d654aa70f11bd8	2024-04-27T17:50:48+02:00	Pierrick Hymbert	ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935)
M	.github/workflows/server.yml
M	examples/server/server.cpp

commit	928e0b7013c862cf10701957b3d654aa70f11bd8	0c4d489e29e53589bf13a801fe7c94b7b546d8f6	2024-04-26T19:08:30+01:00	agray3	Reset schedule earlier to allow overlap with ggml graph computation on device (#6933)
M	ggml-backend.c
M	llama.cpp

commit	0c4d489e29e53589bf13a801fe7c94b7b546d8f6	017e6999b5184234370b22a2f868e1be911e8d88	2024-04-26T20:06:33+02:00	Pierrick Hymbert	quantize: add imatrix and dataset metadata in GGUF (#6658)
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/imatrix/imatrix.cpp
M	examples/quantize/CMakeLists.txt
M	examples/quantize/quantize.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	017e6999b5184234370b22a2f868e1be911e8d88	e2764cd7ca1112d9303eba9e81c9935ee67352ff	2024-04-26T18:39:58+02:00	slaren	add basic tensor data validation function (#6884)
M	common/common.cpp
M	common/common.h
M	ggml-quants.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	e2764cd7ca1112d9303eba9e81c9935ee67352ff	4b1c3c98b442a4c84a788fff6323f6fa7e678a5b	2024-04-26T17:07:42+02:00	slaren	gguf : fix mismatch between alloc and free functions (#6929)
M	ggml.c

commit	4b1c3c98b442a4c84a788fff6323f6fa7e678a5b	bbe3c6e76157a5d806fdc155451f0ca8936248ee	2024-04-26T10:05:33-04:00	Justine Tunney	llamafile : use 64-bit integers in sgemm (#6928)
M	sgemm.cpp
M	sgemm.h

commit	bbe3c6e76157a5d806fdc155451f0ca8936248ee	7f5ff558eed0f732af8f25c2ab0645610bdec80c	2024-04-26T12:27:25+02:00	Pierrick Hymbert	ci: server: fix python installation (#6925)
M	.github/workflows/server.yml

commit	7f5ff558eed0f732af8f25c2ab0645610bdec80c	9e4e077ec50fde6049b128662c72d37a3c28e34b	2024-04-26T12:15:30+02:00	Pierrick Hymbert	server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638)
M	examples/server/server.cpp

commit	9e4e077ec50fde6049b128662c72d37a3c28e34b	83b72cb086ce46a33dececc86bfe4648b6120aa8	2024-04-26T11:11:51+02:00	Pierrick Hymbert	ci: server: fix python installation (#6922)
M	.github/workflows/server.yml

commit	83b72cb086ce46a33dececc86bfe4648b6120aa8	d4a9afc1009f0da88d04b2c5f672d81d5ae94675	2024-04-26T10:41:53+03:00	Georgi Gerganov	Merge pull request from GHSA-p5mv-gjc5-mwqv
M	ggml.c

commit	d4a9afc1009f0da88d04b2c5f672d81d5ae94675	7d641c26ac73956a54b204cabefe85c764823678	2024-04-26T09:27:49+02:00	Pierrick Hymbert	ci: server: fix python installation (#6918)
M	.github/workflows/server.yml

commit	7d641c26ac73956a54b204cabefe85c764823678	5790c8dac1a4f0aa80b4efee3b962d8c04c829e8	2024-04-26T09:26:59+02:00	Pierrick Hymbert	ci: fix concurrency for pull_request_target (#6917)
M	.github/workflows/bench.yml
M	.github/workflows/server.yml

commit	5790c8dac1a4f0aa80b4efee3b962d8c04c829e8	46e12c4692a37bdd31a0432fc5153d7d22bc7f72	2024-04-26T09:26:16+02:00	Pierrick Hymbert	bench: server add stop word for PHI-2 (#6916)
M	examples/server/bench/script.js

commit	46e12c4692a37bdd31a0432fc5153d7d22bc7f72	dba497e0c1eff27cf0e85d1d73c86fa08e1b5557	2024-04-25T12:38:31-07:00	vik	llava : add support for moondream vision language model (#6899)
M	README.md
M	examples/llava/clip.cpp

commit	dba497e0c1eff27cf0e85d1d73c86fa08e1b5557	fa0b4ad25208d5ec2df6b998ccb29b49b249e82c	2024-04-25T21:31:17+03:00	Georgi Gerganov	cmake : restore LLAMA_LLAMAFILE_DEFAULT
M	CMakeLists.txt
M	llama.cpp

commit	fa0b4ad25208d5ec2df6b998ccb29b49b249e82c	d6e1d44f16e5580cf47f13325ff49960bf13ca37	2024-04-25T18:59:51+03:00	Georgi Gerganov	cmake : remove obsolete ANDROID check
M	CMakeLists.txt

commit	d6e1d44f16e5580cf47f13325ff49960bf13ca37	853d06ffe26621176d60909a6e3f7c4cd067b305	2024-04-25T17:59:03+02:00	slaren	llama : synchronize before get/set session data (#6911)
M	llama.cpp

commit	853d06ffe26621176d60909a6e3f7c4cd067b305	3fe0596c1817a6114ffffb6dbfd6c36ca7815dc7	2024-04-25T17:06:27+03:00	Georgi Gerganov	ci : tmp disable slow tests
M	ci/run.sh

commit	3fe0596c1817a6114ffffb6dbfd6c36ca7815dc7	0ead1f1072fdc70720f92e008a294dc74a826b1d	2024-04-25T09:52:28-04:00	BarfingLemurs	readme : update model list (#6908)
M	README.md

commit	0ead1f1072fdc70720f92e008a294dc74a826b1d	51543729ff5b1361ebfb164875c93dff0850d5fe	2024-04-25T15:23:47+02:00	slaren	llama : check that all the tensor data is in the model file (#6885)
M	llama.cpp

commit	51543729ff5b1361ebfb164875c93dff0850d5fe	4ab99d8d4762869506bb675b36501fd7c2af00b2	2024-04-25T15:48:25+03:00	Georgi Gerganov	ggml : fix redefinition of vaddvq_f32 for 32-bit ARM (#6906)
M	ggml.c

commit	4ab99d8d4762869506bb675b36501fd7c2af00b2	54770413c484660d021dd51b5dbacab7880b8827	2024-04-25T14:38:14+02:00	Daniel Bevenius	clip : rename lerp function to avoid conflict (#6894)
M	examples/llava/clip.cpp

commit	54770413c484660d021dd51b5dbacab7880b8827	aa750c1ede6232c91de890a14a7731d6daa2bc8e	2024-04-25T15:12:28+03:00	Georgi Gerganov	ggml : fix MIN / MAX macros (#6904)
M	ggml-impl.h
M	ggml-quants.c

commit	aa750c1ede6232c91de890a14a7731d6daa2bc8e	1966eb2615242f224bf9ca939db8905ab6a174a0	2024-04-25T14:27:20+03:00	Georgi Gerganov	tests : minor bash stuff (#6902)
M	ci/run.sh
M	examples/gguf-split/tests.sh
R079	examples/quantize/test.sh	examples/quantize/tests.sh
M	examples/server/tests/tests.sh
M	llama.cpp

commit	1966eb2615242f224bf9ca939db8905ab6a174a0	784e11dea1f5ce9638851b2b0dddb107e2a609c8	2024-04-25T18:29:35+08:00	jiez	quantize : add '--keep-split' to quantize model into shards (#6688)
M	examples/quantize/quantize.cpp
A	examples/quantize/test.sh
M	llama.cpp
M	llama.h

commit	784e11dea1f5ce9638851b2b0dddb107e2a609c8	b4e4b8a9351d918a56831c73cf9f25c1837b80d1	2024-04-24T21:29:13+02:00	Johannes Gäßler	README: add graphic for matrix multiplication (#6881)
M	README.md
A	media/matmul.png
A	media/matmul.svg

commit	b4e4b8a9351d918a56831c73cf9f25c1837b80d1	3fe847b5747676ee1bf90371c46ed0bc66b57240	2024-04-24T08:10:07-05:00	Douglas Hanley	llama : add llama_get_pooling_type function (#6862)
M	common/common.h
M	llama.cpp
M	llama.h

commit	3fe847b5747676ee1bf90371c46ed0bc66b57240	37246b1031b1680c0dcaf20aef736d6b446203fa	2024-04-24T12:54:24+02:00	mgroeber9110	server : do not apply Markdown formatting in code sections (#6850)
M	examples/server/public/index.html

commit	37246b1031b1680c0dcaf20aef736d6b446203fa	28103f4832e301a9c84d44ff0df9d75d46ab6c76	2024-04-24T05:15:29-05:00	Kyle Mistele	common : revert showing control tokens by default for server (#6860)
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp

commit	28103f4832e301a9c84d44ff0df9d75d46ab6c76	c0d1b3e03e27634ac2871761f5033cf9324d472d	2024-04-24T11:08:36+02:00	Johannes Gäßler	Server: fix seed for multiple slots (#6835)
M	common/common.cpp
M	common/sampling.cpp
M	common/sampling.h
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/server/server.cpp
A	examples/server/tests/features/results.feature
M	examples/server/tests/features/steps/steps.py
M	llama.cpp
M	llama.h

commit	c0d1b3e03e27634ac2871761f5033cf9324d472d	abd3314064cd3c513f9eef34c3ba6c23a107442c	2024-04-24T12:00:07+03:00	Georgi Gerganov	ggml : move 32-bit arm compat in ggml-impl.h (#6865)
M	ggml-impl.h
M	ggml-quants.c

commit	abd3314064cd3c513f9eef34c3ba6c23a107442c	3fec68be4e9577fc53158366d3b3af039c17bb1f	2024-04-24T10:52:37+02:00	Tristan Druyen	llama : add phi 3 chat template (#6857)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	3fec68be4e9577fc53158366d3b3af039c17bb1f	c8297c6af5693555652c40b95974b95d49d2674d	2024-04-24T15:16:21+08:00	Junyang Lin	convert : add support of codeqwen due to tokenizer (#6707)
M	convert-hf-to-gguf.py

commit	c8297c6af5693555652c40b95974b95d49d2674d	4e96a812b3ce7322a29a3008db2ed73d9087b176	2024-04-24T15:00:37+08:00	liuwei-git	llama : add phi3 support (#6852)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	4e96a812b3ce7322a29a3008db2ed73d9087b176	192090bae47960f0d38d4967abe398a5d190057e	2024-04-23T02:53:18+02:00	Anas Ahouzi	[SYCL] Windows default build instructions without -DLLAMA_SYCL_F16 flag activated (#6767)
M	README-sycl.md

commit	192090bae47960f0d38d4967abe398a5d190057e	e931888d5024de814ce7119a18d6a959bfff3821	2024-04-22T15:00:36-04:00	Justine Tunney	llamafile : improve sgemm.cpp (#6796)
M	CMakeLists.txt
M	Makefile
M	ggml.c
M	sgemm.cpp

commit	e931888d5024de814ce7119a18d6a959bfff3821	8960fe86ae075c846c5df8848230d1904ba8877f	2024-04-23T00:05:06+10:00	Dave Airlie	ggml : fix calloc argument ordering. (#6820)
M	ggml-alloc.c
M	ggml-backend.c

commit	8960fe86ae075c846c5df8848230d1904ba8877f	c0956b09ba845a7cd787d5580d7c8b96e80f40f5	2024-04-22T15:41:11+03:00	Georgi Gerganov	llama : fix typo in <|im_end|> token text (#6745)
M	llama.cpp

commit	c0956b09ba845a7cd787d5580d7c8b96e80f40f5	e9b4a1bf68c18beff4e33f23ea62c1245b296915	2024-04-22T13:22:54+02:00	Pierrick Hymbert	ci: fix job are cancelling each other (#6781)
M	.github/workflows/bench.yml
M	.github/workflows/server.yml

commit	e9b4a1bf68c18beff4e33f23ea62c1245b296915	5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb	2024-04-21T00:17:47Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb	40f74e4d739e9250431cf339ae7588b28d8d0663	2024-04-21T18:48:53+01:00	Olivier Chafik	`build`: generate hex dump of server assets during build (#6661)
M	.gitignore
M	Makefile
M	build.zig
M	examples/server/CMakeLists.txt
D	examples/server/completion.js.hpp
M	examples/server/deps.sh
D	examples/server/index.html.hpp
D	examples/server/index.js.hpp
D	examples/server/json-schema-to-grammar.mjs.hpp
A	scripts/xxd.cmake

commit	40f74e4d739e9250431cf339ae7588b28d8d0663	b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888	2024-04-21T18:36:45+03:00	Georgi Gerganov	llama : add option to render special/control tokens (#6807)
M	Makefile
M	README.md
M	common/common.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	llama.cpp
M	llama.h

commit	b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888	7dbdba5690ca61b3ee8c92cfac8e7e251042e787	2024-04-21T16:47:57+03:00	Georgi Gerganov	ggml : fix ggml_backend_cpu_supports_op() for CPY (#0)
M	ggml-backend.c

commit	7dbdba5690ca61b3ee8c92cfac8e7e251042e787	c1386c936e9fbc38eb2816c711ab28f13355708e	2024-04-21T15:03:39+02:00	Wouter	llama : add llama-3 chat template (#6751)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	c1386c936e9fbc38eb2816c711ab28f13355708e	e8d35f47cb8cb4002fca02e18aaa1cb9fa21d6f1	2024-04-21T14:49:30+02:00	pmysl	gguf-py : add IQ1_M to GGML_QUANT_SIZES (#6761)
M	gguf-py/gguf/constants.py

commit	e8d35f47cb8cb4002fca02e18aaa1cb9fa21d6f1	2cca09d509c0e114acc16cb347c3cdd86e5f1b40	2024-04-21T20:35:40+08:00	Jan Boon	doc : add link to falcon (#6789)
M	README.md

commit	2cca09d509c0e114acc16cb347c3cdd86e5f1b40	89b0bf0d5dc123cc1053708f5f84b89e52cdc80b	2024-04-21T16:02:05+03:30	Mohammadreza Hendiani	readme : add Fedora instructions (#6783)
M	README.md

commit	89b0bf0d5dc123cc1053708f5f84b89e52cdc80b	b97bc3966e852adb626c90be64fd48282800f504	2024-04-21T08:19:04-04:00	Justine Tunney	llava : use logger in llava-cli (#6797)
M	examples/llava/clip.cpp
M	examples/llava/llava-cli.cpp
M	examples/llava/llava.cpp

commit	b97bc3966e852adb626c90be64fd48282800f504	b8109bc0139f15a5b321909f47510b89dca47ffc	2024-04-21T13:50:41+02:00	Pedro Cuenca	llama : support Llama 3 HF conversion (#6745)
M	convert-hf-to-gguf.py
M	convert.py
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/beam-search/beam-search.cpp
M	examples/infill/infill.cpp
M	examples/llama.android/app/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/llava-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	llama.h

commit	b8109bc0139f15a5b321909f47510b89dca47ffc	aed82f6837a3ea515f4d50201cfc77effc7d41b4	2024-04-21T00:29:50+08:00	Jan Boon	doc : server tests require llama to be built with curl enabled (#6788)
M	examples/server/tests/README.md

commit	aed82f6837a3ea515f4d50201cfc77effc7d41b4	0e4802b2ecbaab04b4f829fde4a3096ca19c84b5	2024-04-20T13:27:12+03:00	Georgi Gerganov	common : try to fix Android CI (#6780)
M	common/common.cpp

commit	0e4802b2ecbaab04b4f829fde4a3096ca19c84b5	637e9a86c220718d008b54842dfd294aa96d3b7a	2024-04-19T13:03:35-04:00	loonerin	ci: add ubuntu latest release and fix missing build number (mac & ubuntu) (#6748)
M	.github/workflows/build.yml

commit	637e9a86c220718d008b54842dfd294aa96d3b7a	9958c81b798a5872087b30b360e4674871f2479e	2024-04-19T13:19:01+02:00	Pierrick Hymbert	server: static: upstream upgrade (#6765)
M	examples/server/index.js.hpp
M	examples/server/public/index.js

commit	9958c81b798a5872087b30b360e4674871f2479e	8b1b1f4982d3e9b994308d05a1c8b9e45c23edb5	2024-04-19T09:35:54Z	nopperl	Implement the OLMo architecture (#6741)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	8b1b1f4982d3e9b994308d05a1c8b9e45c23edb5	bca40e98149c7b673558ddd7a3ebeffef789349d	2024-04-19T03:16:45-04:00	Austin	train : add general name (#6752)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	bca40e98149c7b673558ddd7a3ebeffef789349d	0d56246f4b9764158525d894b96606f6163c53a8	2024-04-19T09:16:31+08:00	Neo Zhang	fix wrong parameter in cmd in readme-sycl.md (#6755)
M	README-sycl.md

commit	0d56246f4b9764158525d894b96606f6163c53a8	03c0946d73c63ea73e1d85015b7088298443d438	2024-04-18T15:18:48+02:00	slaren	ggml : group all experts in a single ggml_mul_mat_id (#6505)
M	examples/imatrix/imatrix.cpp
M	ggml-cuda.cu
M	ggml-cuda/binbcast.cu
M	ggml-cuda/convert.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-sycl.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/compare-commits.sh
M	tests/test-backend-ops.cpp

commit	03c0946d73c63ea73e1d85015b7088298443d438	e11b2e6e1e18522ca7cf129600875a0f6fb9307d	2024-04-18T13:49:01+02:00	Sigbjørn Skjæret	convert : support models with multiple chat templates (#6588)
M	gguf-py/README.md
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	gguf-py/scripts/__init__.py
A	gguf-py/scripts/gguf-new-metadata.py

commit	e11b2e6e1e18522ca7cf129600875a0f6fb9307d	c71bfd736ee99a56e697697b39240f2ee06ed26d	2024-04-18T19:38:04+08:00	Ren Xuancheng	Qwen2 : assume tied weights if lm_head/output weights is missing (#6738)
M	llama.cpp

commit	c71bfd736ee99a56e697697b39240f2ee06ed26d	3b8f1ec4b18770531d0b1d792f3edf08254e4f0c	2024-04-18T09:04:47+02:00	slaren	llama : fix compatibility with old 2 expert models (#6735)
M	llama.cpp

commit	3b8f1ec4b18770531d0b1d792f3edf08254e4f0c	8dd1ec8b3ffbfa2d26e82e672cea89f5eeb2f141	2024-04-17T23:58:26+03:00	Georgi Gerganov	llamafile : tmp disable + build sgemm.o when needed (#6716)
M	CMakeLists.txt
M	Makefile

commit	8dd1ec8b3ffbfa2d26e82e672cea89f5eeb2f141	facb8b56f8fd3bb10a693bf0943ae9d69d0828ef	2024-04-17T14:47:50+02:00	Yaroslav	readme : add UI (#6724)
M	README.md

commit	facb8b56f8fd3bb10a693bf0943ae9d69d0828ef	532c1737a14bb4b99747e6f460874947df37e450	2024-04-17T04:51:07+08:00	Zheng.Deng	convert : fix autoawq gemma (#6704)
M	convert-hf-to-gguf.py

commit	532c1737a14bb4b99747e6f460874947df37e450	666867b799ddd9da7dfdc905ece291ecf286effa	2024-04-16T23:50:38+03:00	Georgi Gerganov	llama : make general.name optional (#6709)
M	llama.cpp

commit	666867b799ddd9da7dfdc905ece291ecf286effa	8cc91dc63c0df397d644a581b2cbeea74eb51ae0	2024-04-16T23:50:22+03:00	Georgi Gerganov	ggml : fix llamafile sgemm wdata offsets (#6710)
M	CMakeLists.txt
M	Makefile
M	ggml.c

commit	8cc91dc63c0df397d644a581b2cbeea74eb51ae0	dbceec87c0221ec952e69448df6a71f1372a7487	2024-04-16T14:55:30-04:00	Justine Tunney	ggml : add llamafile sgemm (#6414)
M	CMakeLists.txt
M	Makefile
M	Package.swift
M	build.zig
M	common/common.cpp
M	common/common.h
M	examples/llama-bench/llama-bench.cpp
M	ggml-impl.h
M	ggml-quants.c
M	ggml.c
A	sgemm.cpp
A	sgemm.h

commit	dbceec87c0221ec952e69448df6a71f1372a7487	f4dea7da1841a92d2788b0535063abf2f0e28461	2024-04-16T08:48:35-07:00	Ashish	llama : add StableLM2 12B (#6635)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	f4dea7da1841a92d2788b0535063abf2f0e28461	8a56075b07a8b571bf95a912ffdce4c928c2b414	2024-04-16T23:40:48+08:00	Shijie	llama : add qwen2moe (#6074)
M	convert-hf-to-gguf.py
M	ggml-metal.m
M	ggml-metal.metal
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	8a56075b07a8b571bf95a912ffdce4c928c2b414	58227ffdeb4fb89cacb0cffaadf76b1914324ad3	2024-04-16T08:34:06+02:00	Daniel Bevenius	gritlm : add --outdir option to hf.sh script (#6699)
M	examples/gritlm/README.md

commit	58227ffdeb4fb89cacb0cffaadf76b1914324ad3	4fbd8098e63670c6ae11a8adc350f5ba191cfda3	2024-04-16T09:28:33+03:00	Georgi Gerganov	perplexity : require positive --ctx-size arg (#6695)
M	examples/perplexity/perplexity.cpp

commit	4fbd8098e63670c6ae11a8adc350f5ba191cfda3	7593639ce335e8d7f89aa9a54d616951f273af60	2024-04-16T08:13:13+02:00	Daniel Bevenius	gguf : add special tokens metadata for FIM/Infill (#6689)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	7593639ce335e8d7f89aa9a54d616951f273af60	132f55795e51094954f1b1f647f97648be724a3a	2024-04-15T18:35:21+01:00	Olivier Chafik	`main`: add --json-schema / -j flag (#6659)
M	Makefile
M	build.zig
M	common/CMakeLists.txt
M	common/common.cpp
M	examples/main/README.md
M	examples/server/CMakeLists.txt
M	tests/CMakeLists.txt

commit	132f55795e51094954f1b1f647f97648be724a3a	3272896d79465fd2befef3425dac8e83933b7ea4	2024-04-15T08:56:55-04:00	compilade	llama : fix restoring the number of outputs from state files (#6687)
M	llama.cpp

commit	3272896d79465fd2befef3425dac8e83933b7ea4	7fc16a2c32650d46e79b382ecc6720f58c82f31b	2024-04-15T14:18:47+02:00	Pierrick Hymbert	server : revert "minor layout improvements" (#6684)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	7fc16a2c32650d46e79b382ecc6720f58c82f31b	17e98d4c96a583d420f12046bc92102381dbd28e	2024-04-15T05:14:46-05:00	Steven Prichard	swift : linux support (#6590)
M	Package.swift

commit	17e98d4c96a583d420f12046bc92102381dbd28e	1958f7e06ca2d2e3ab5698cc67513ba359144d8e	2024-04-15T17:12:26+08:00	Neo Zhang Jianyu	fix mul_mat_id() for new input, make the ut pass (#6682)
M	ggml-sycl.cpp

commit	1958f7e06ca2d2e3ab5698cc67513ba359144d8e	04fbc5f23e9708136ff03ebe194c7a7e965a7ca4	2024-04-14T15:24:15-04:00	David Renshaw	llama : add missing kv clear in llama_beam_search (#6664)
M	llama.cpp

commit	04fbc5f23e9708136ff03ebe194c7a7e965a7ca4	f184dd920852d6d372b754f871ee06cfe6f977ad	2024-04-15T00:16:34+08:00	Chao Jiang	Add Command R chat template (#6650)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	f184dd920852d6d372b754f871ee06cfe6f977ad	422c2aff1c9735853c9d8f5162104e41a364adc4	2024-04-14T16:55:30+03:00	Georgi Gerganov	flake.lock: Update (#6669)
M	flake.lock

commit	422c2aff1c9735853c9d8f5162104e41a364adc4	8800226d65d5c98cd34eede6a6c05c78405c52da	2024-04-14T07:14:19-04:00	Dave	Added support for GGML_OP_CLAMP in Metal (#6662)
M	ggml-metal.m
M	ggml-metal.metal

commit	8800226d65d5c98cd34eede6a6c05c78405c52da	e689fc4e912feb19085be6894f475a873759cbfe	2024-04-14T13:12:59+02:00	Sigbjørn Skjæret	Fix --split-max-size (#6655)
M	ci/run.sh
M	examples/gguf-split/README.md
M	examples/gguf-split/gguf-split.cpp
A	examples/gguf-split/tests.sh

commit	e689fc4e912feb19085be6894f475a873759cbfe	a4ec34e1cd68560e7ff16e21ddc6962b6abd3d1d	2024-04-14T20:12:36+09:00	Jaemin Son	[bug fix] convert github repository_owner to lowercase (#6673)
M	.github/workflows/docker.yml

commit	a4ec34e1cd68560e7ff16e21ddc6962b6abd3d1d	de17e3f7455dc7fd298cc61d86798533b9ca7a29	2024-04-14T04:40:18-04:00	James A Capozzoli	convert : enable the `--use-temp-file` cli flag (#6645)
M	convert-hf-to-gguf.py

commit	de17e3f7455dc7fd298cc61d86798533b9ca7a29	b5e7285baffb0da8a6619567b52d8e67de41291d	2024-04-14T10:42:29+08:00	Neo Zhang Jianyu	fix memcpy() crash, add missed cmd in guide, fix softmax (#6622)
M	README-sycl.md
M	examples/sycl/build.sh
M	examples/sycl/run-llama2.sh
M	ggml-sycl.cpp

commit	b5e7285baffb0da8a6619567b52d8e67de41291d	4bd0f93e4ab4fe6682e7d0241c1bdec1397e954a	2024-04-14T00:21:55+02:00	Johannes Gäßler	CUDA: fix matrix multiplication logic for tests (#6667)
M	ggml-cuda.cu

commit	4bd0f93e4ab4fe6682e7d0241c1bdec1397e954a	ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa	2024-04-13T11:33:52+02:00	Pierrick Hymbert	model: support arch `DbrxForCausalLM` (#6515)
M	README.md
M	convert-hf-to-gguf.py
M	examples/eval-callback/eval-callback.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	scripts/get-wikitext-2.sh

commit	ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa	fbbc030ba93561fac842af994c5c6c4c1147f13b	2024-04-12T19:43:38+01:00	Olivier Chafik	JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555)
M	common/json-schema-to-grammar.cpp
R073	examples/json-schema-to-grammar.py	examples/json_schema_to_grammar.py
M	examples/regex-to-grammar.py
M	examples/server/README.md
M	examples/server/json-schema-to-grammar.mjs.hpp
M	examples/server/public/json-schema-to-grammar.mjs
M	examples/server/server.cpp
M	examples/ts-type-to-grammar.sh
M	grammars/README.md
M	tests/test-json-schema-to-grammar.cpp

commit	fbbc030ba93561fac842af994c5c6c4c1147f13b	4cc120c7443cf9dab898736f3c3b45dc8f14672b	2024-04-12T18:13:20+02:00	slaren	metal : unify mul_mv_id kernels (#6556)
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	tests/test-backend-ops.cpp

commit	4cc120c7443cf9dab898736f3c3b45dc8f14672b	24ee66ed0d908d156bd0d1747b63a636a495cd7a	2024-04-12T14:11:46+02:00	Daniel Bevenius	infill : add download instructions for model (#6626)
M	examples/infill/README.md

commit	24ee66ed0d908d156bd0d1747b63a636a495cd7a	91c736015b66ba1d0b82cbae6313b6d5eaa61b68	2024-04-12T13:49:21+02:00	Pierrick Hymbert	server : coherent log output for KV cache full (#6637)
M	examples/server/server.cpp

commit	91c736015b66ba1d0b82cbae6313b6d5eaa61b68	5c4d767ac028c0f9c31cba3fceaf765c6097abfc	2024-04-12T18:45:06+08:00	jiez	llama : add gguf_remove_key + remove split meta during quantize (#6591)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	5c4d767ac028c0f9c31cba3fceaf765c6097abfc	ef21ce4ccb41164cb52997bd2210d92bc6a6c5d1	2024-04-12T10:52:36+02:00	Rene Leonhardt	chore: Fix markdown warnings (#6625)
M	README-sycl.md
M	README.md
M	SECURITY.md
M	examples/llava/MobileVLM-README.md
M	examples/llava/README.md
M	examples/main/README.md
M	examples/perplexity/README.md
M	examples/quantize/README.md

commit	ef21ce4ccb41164cb52997bd2210d92bc6a6c5d1	dee7f8d6928cc680cc969f7d93f98c3e24dcad41	2024-04-12T11:49:58+03:00	Georgi Gerganov	imatrix : remove invalid assert (#6632)
M	examples/imatrix/imatrix.cpp

commit	dee7f8d6928cc680cc969f7d93f98c3e24dcad41	81da18e71ccfc196d4516fbea5dc3a6a1f92dccb	2024-04-12T16:28:12+08:00	MasterYi1024	Correct free memory and total memory. (#6630)
M	llama.cpp

commit	81da18e71ccfc196d4516fbea5dc3a6a1f92dccb	9ed2737acc233716374860e6b2ea7399c4aae29e	2024-04-12T10:26:47+02:00	Pierrick Hymbert	eval-callback: use ggml_op_desc to pretty print unary operator name (#6631)
M	examples/eval-callback/eval-callback.cpp

commit	9ed2737acc233716374860e6b2ea7399c4aae29e	04a5ac211ef40936295980b7cdf0ba6e97093146	2024-04-12T11:15:05+03:00	Georgi Gerganov	ci : disable Metal for macOS-latest-cmake-x64 (#6628)
M	.github/workflows/build.yml

commit	04a5ac211ef40936295980b7cdf0ba6e97093146	f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7	2024-04-11T21:44:50-04:00	Clint Herron	Optimization: eliminate addition of redundant stacks when advancing grammar. (#6616)
M	llama.cpp

commit	f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7	a474f50ebb3e10be3371562f75f3f573f1a86b5f	2024-04-11T17:44:48-04:00	Clint Herron	As suggested by @slaren, disabling Metal for test to fix CI build on OSX from #6576 (#6619)
M	examples/eval-callback/CMakeLists.txt

commit	a474f50ebb3e10be3371562f75f3f573f1a86b5f	cbaadc92942c50aab599a9e4c163afc1f44f7c26	2024-04-11T21:56:29+02:00	Nikolas	Refactor Error Handling for CUDA (#6575)
M	Makefile

commit	cbaadc92942c50aab599a9e4c163afc1f44f7c26	1bbdaf6ecda6f0a360dfb307b256fcb6838c560b	2024-04-11T19:47:34+01:00	Olivier Chafik	grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609)
M	examples/gbnf-validator/gbnf-validator.cpp
M	llama.cpp
M	llama.h
M	tests/test-grammar-integration.cpp

commit	1bbdaf6ecda6f0a360dfb307b256fcb6838c560b	f4183afe6a22f356ee222a710686ae7f83dbd949	2024-04-11T19:52:21+02:00	Hugo Roussel	ci: download artifacts to release directory (#6612)
M	.github/workflows/build.yml

commit	f4183afe6a22f356ee222a710686ae7f83dbd949	b804b1ef77351d2a11be945462c6c251710476cb	2024-04-11T15:22:47+02:00	Daniel Bevenius	scripts : add --outdir option to hf.sh (#6600)
M	scripts/hf.sh

commit	b804b1ef77351d2a11be945462c6c251710476cb	8228b66dbc16290c5cbd70e80ab47c068e2569d8	2024-04-11T14:51:07+02:00	Pierrick Hymbert	eval-callback: Example how to use eval callback for debugging (#6576)
M	.github/workflows/build.yml
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
M	docs/HOWTO-add-model.md
M	examples/CMakeLists.txt
A	examples/eval-callback/CMakeLists.txt
A	examples/eval-callback/README.md
A	examples/eval-callback/eval-callback.cpp
M	examples/imatrix/imatrix.cpp
M	llama.cpp

commit	8228b66dbc16290c5cbd70e80ab47c068e2569d8	b3a96f27f065a828f08c5d89ff60aab5361188fe	2024-04-10T20:16:48+02:00	Daniel Bevenius	gguf : add option to not check tensor data (#6582)
M	examples/gguf/gguf.cpp

commit	b3a96f27f065a828f08c5d89ff60aab5361188fe	4f407a0a353dae4726c74cc33250b623a4911dd7	2024-04-10T19:18:25+02:00	Ralph Soika	minor layout improvements (#6572)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	4f407a0a353dae4726c74cc33250b623a4911dd7	65c64dc36f9bca5b3f100614cdd02bf12d6b3e49	2024-04-10T17:24:14+02:00	slaren	llama : add model types for mixtral (#6589)
M	llama.cpp

commit	65c64dc36f9bca5b3f100614cdd02bf12d6b3e49	67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f	2024-04-10T15:23:12+02:00	slaren	convert.py : add consolidated.safetensors for mixtral 8x22b (#6587)
M	convert.py

commit	67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f	29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e	2024-04-10T08:58:48+02:00	Pierrick Hymbert	docs : how to add a model (#6565)
M	README.md
A	docs/HOWTO-add-model.md

commit	29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e	b231b37b095f172b26b1300ca442a147ea048b64	2024-04-10T00:49:12-06:00	Artem Zinnatullin	readme : fix ROCm link (#6579)
M	README.md

commit	b231b37b095f172b26b1300ca442a147ea048b64	ba5e134e073ec6837078c874aba44a702944a676	2024-04-10T14:34:00+08:00	sjxx	readme : update UI list (#6560)
M	README.md

commit	ba5e134e073ec6837078c874aba44a702944a676	1b67731e184e27a465b8c5476061294a4af668ea	2024-04-10T00:23:02+02:00	Jiří Sejkora	readme: fix typo in amdgpu target name (#6573)
M	README.md

commit	1b67731e184e27a465b8c5476061294a4af668ea	c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3	2024-04-09T13:44:08-04:00	Jared Van Bortel	BERT tokenizer fixes (#6498)
M	common/common.cpp
M	common/common.h
M	convert-hf-to-gguf.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	examples/embedding/embedding.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llava/llava-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup-create.cpp
M	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp
M	examples/tokenize/tokenize.cpp
M	llama.cpp
M	llama.h

commit	c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3	400d5d722d7edf7de0cf24a18c42b183c65047d2	2024-04-09T20:29:06+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	400d5d722d7edf7de0cf24a18c42b183c65047d2	5dc9dd7152dedc6046b646855585bd070c91e8c8	2024-04-09T01:31:47-07:00	Ed Lee	server : detect search query to start webchat (#6554)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	5dc9dd7152dedc6046b646855585bd070c91e8c8	e11a8999b5690f810c2c99c14347f0834e68c524	2024-04-09T09:16:13+01:00	Carolinabanana	llama : add Command R Plus support (#6491)
M	convert-hf-to-gguf.py
M	ggml-cuda.cu
M	ggml-cuda/common.cuh
M	ggml-cuda/convert.cu
M	ggml-cuda/convert.cuh
M	ggml-cuda/dequantize.cuh
M	ggml-cuda/dmmv.cu
M	ggml-cuda/quantize.cu
M	ggml-cuda/quantize.cuh
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	e11a8999b5690f810c2c99c14347f0834e68c524	cc4a95426d17417d3c83f12bdb514fbe8abe2a88	2024-04-09T09:23:19+03:00	Georgi Gerganov	license : update copyright notice + add AUTHORS (#6405)
A	AUTHORS
M	LICENSE
A	scripts/gen-authors.sh
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	cc4a95426d17417d3c83f12bdb514fbe8abe2a88	cecd8d3c98b48f51aaa1d4c729e55bd319f6799c	2024-04-08T22:25:49+03:00	Georgi Gerganov	llama : fix attention layer count sanity check (#6550)
M	llama.cpp

commit	cecd8d3c98b48f51aaa1d4c729e55bd319f6799c	b73e564b16086845a8b4fffd26e22685d3e0c3db	2024-04-08T10:44:19-05:00	kunnis	Comment explaining a decision (#6531)
M	convert.py

commit	b73e564b16086845a8b4fffd26e22685d3e0c3db	e3c337d87ca650972105a51c6ce302dd236c07ad	2024-04-08T16:23:01+03:00	Georgi Gerganov	quantize : fix precedence of cli args (#6541)
M	llama.cpp

commit	e3c337d87ca650972105a51c6ce302dd236c07ad	beea6e1b16e783a0886e78dec01002a8c00db24d	2024-04-08T06:02:30-07:00	Rick G	llama : support negative ith in llama_get_ API (#6519)
M	common/sampling.h
M	llama.cpp
M	llama.h

commit	beea6e1b16e783a0886e78dec01002a8c00db24d	87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0	2024-04-08T20:43:30+08:00	Jan Boon	llama : save and restore kv cache for single seq id (#6341)
M	README.md
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
A	examples/server/tests/features/slotsave.feature
M	examples/server/tests/features/steps/steps.py
M	llama.cpp
M	llama.h

commit	87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0	d752327c3338d5b9634121d651c0105f2c933f9b	2024-04-08T13:56:01+05:30	Abhilash Majumder	remove row=1 cond (#6532)
M	ggml-sycl.cpp

commit	d752327c3338d5b9634121d651c0105f2c933f9b	855f54402e866ed19d8d675b56a81c844c64b325	2024-04-08T00:48:29-07:00	Firat	Adding KodiBot to UI list (#6535)
M	README.md

commit	855f54402e866ed19d8d675b56a81c844c64b325	b909236c0bf0b6e872af95df9490492ecec310ac	2024-04-07T19:52:19+01:00	Mark Fairbairn	Change Windows AMD example to release build to make inference much faster. (#6525)
M	README.md

commit	b909236c0bf0b6e872af95df9490492ecec310ac	e0717e751e12af13f4eedaae8bbbd608e40d7e54	2024-04-07T21:25:30+03:00	Georgi Gerganov	flake.lock: Update (#6517)
M	flake.lock

commit	e0717e751e12af13f4eedaae8bbbd608e40d7e54	c37247796b4d45bdbbc8259afffb80208ad8fe55	2024-04-07T13:33:59-04:00	DAN™	Add GritLM as supported models. (#6513)
M	README.md

commit	c37247796b4d45bdbbc8259afffb80208ad8fe55	f77261a7c525fa1fa47b18a3d78cd308ae41cafc	2024-04-07T17:05:51+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f77261a7c525fa1fa47b18a3d78cd308ae41cafc	43e8995e754b8e04642e92822055d193a3272b37	2024-04-04T14:49:24+02:00	Slava Primenko	ggml: bypass code incompatible with CUDA < 11.1 (whisper/2020)
M	ggml-cuda.cu

commit	43e8995e754b8e04642e92822055d193a3272b37	9472bce30800a581071478a839bf93abf404c893	2024-04-07T16:08:12+03:00	Georgi Gerganov	scripts : sync ggml-cuda folder
M	scripts/sync-ggml-am.sh

commit	9472bce30800a581071478a839bf93abf404c893	d4f220a5ccdc6308173c1a31fad21d7c3fbc96c1	2024-04-07T07:05:40-04:00	limitedAtonement	Run make to build the project (#6457)
M	README-sycl.md

commit	d4f220a5ccdc6308173c1a31fad21d7c3fbc96c1	54ea0698fbf87e36a5d68a98c95f6bdd0fb91557	2024-04-07T10:55:59+08:00	Neo Zhang Jianyu	support/fix OPs GGML_TYPE_IQ4_NL, GGML_TYPE_IQ4_XS, GGML_TYPE_IQ3_XXS, GGML_TYPE_IQ3_S, GGML_TYPE_IQ2_XXS, GGML_TYPE_IQ2_XS, GGML_TYPE_IQ2_S, GGML_TYPE_IQ1_S, GGML_TYPE_IQ1_M (#6521)
M	README-sycl.md
M	ggml-sycl.cpp

commit	54ea0698fbf87e36a5d68a98c95f6bdd0fb91557	b66aec675c1571a06b3570b858ae711246f96f84	2024-04-06T17:43:15+03:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	b66aec675c1571a06b3570b858ae711246f96f84	57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d	2024-04-03T22:57:20+02:00	Daniel Bevenius	backend : fix typo in scheduler documentation (ggml/781)
M	ggml-backend.h

commit	57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d	75cd4c77292034ecec587ecb401366f57338f7c0	2024-04-06T10:31:33-04:00	Clint Herron	Tests: Added integration tests for GBNF parser  (#6472)
M	Makefile
M	tests/CMakeLists.txt
A	tests/test-grammar-integration.cpp

commit	75cd4c77292034ecec587ecb401366f57338f7c0	a8bd14d55717754a1f48313a846a2b16fa998ad2	2024-04-06T05:40:47+02:00	Pierrick Hymbert	ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
M	.github/workflows/bench.yml
M	examples/server/bench/README.md
M	examples/server/bench/bench.py
M	examples/server/bench/script.js
M	examples/server/utils.hpp

commit	a8bd14d55717754a1f48313a846a2b16fa998ad2	d0f5deebf898f8186a10148a03a56909ba05fc0b	2024-04-06T05:41:38+11:00	Brian	gguf.py : add licence and version to gguf writer (#6504)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	d0f5deebf898f8186a10148a03a56909ba05fc0b	87e21bbacd830437ab653cf03b6f26d45c15395d	2024-04-05T11:39:43-07:00	Hoang Nguyen	readme : update UI list (#6503)
M	README.md

commit	87e21bbacd830437ab653cf03b6f26d45c15395d	1b496a745c315022df2d919374052e6004ced8d3	2024-04-06T01:34:53+07:00	Ting Sun	bench : make n_batch and n_ubatch configurable in Batched bench (#6500)
M	examples/batched-bench/README.md
M	examples/batched-bench/batched-bench.cpp

commit	1b496a745c315022df2d919374052e6004ced8d3	a307375c02cac45cff53cf2520330b43fecc7718	2024-04-05T14:35:06+01:00	Ouadie EL FAROUKI	[SYCL] Fixed minor bug when enabling FP16 for non intel targets (#6464)
M	ggml-sycl.cpp

commit	a307375c02cac45cff53cf2520330b43fecc7718	b660a5729e1e7508671d3d0515fd7efaeaeb85b9	2024-04-04T18:22:50+01:00	alexpinel	readme : add Dot to UI list (#6487)
M	README.md

commit	b660a5729e1e7508671d3d0515fd7efaeaeb85b9	0a1d889e27d6aaa3293dd2c692b849a9bcf4b474	2024-04-05T01:16:37+08:00	Jun Jie	readme : fix typo (#6481)
M	README.md

commit	0a1d889e27d6aaa3293dd2c692b849a9bcf4b474	7dda1b727ef1730783a6077136d28b83e70dd397	2024-04-04T17:31:22+01:00	Ed Lepedus	server: add cURL support to server Dockerfiles (#6474)
M	.devops/full-cuda.Dockerfile
M	.devops/full-rocm.Dockerfile
M	.devops/full.Dockerfile
M	.devops/server-cuda.Dockerfile
M	.devops/server-intel.Dockerfile
M	.devops/server-rocm.Dockerfile
M	.devops/server-vulkan.Dockerfile

commit	7dda1b727ef1730783a6077136d28b83e70dd397	c666ba26c39d5c07e07b4e1e411332f408e309ad	2024-04-05T01:30:53+09:00	Minsoo Cheong	ci: exempt master branch workflows from getting cancelled (#6486)
M	.github/workflows/bench.yml
M	.github/workflows/build.yml
M	.github/workflows/code-coverage.yml
M	.github/workflows/docker.yml
M	.github/workflows/editorconfig.yml
M	.github/workflows/nix-ci-aarch64.yml
M	.github/workflows/nix-ci.yml
M	.github/workflows/python-check-requirements.yml
M	.github/workflows/python-lint.yml
M	.github/workflows/server.yml
M	.github/workflows/zig-build.yml

commit	c666ba26c39d5c07e07b4e1e411332f408e309ad	2e66913e5f56209f4c949f98e431925b78e7e84d	2024-04-04T17:08:55+02:00	Ewout ter Hoeven	build CI: Name artifacts (#6482)
M	.github/workflows/build.yml

commit	2e66913e5f56209f4c949f98e431925b78e7e84d	8120efee1d9931b514aeb5a047209d576f23286c	2024-04-04T11:03:00-04:00	Shakhar Dasgupta	server: allow penalizing repetition of newlines on server webpage (#6431)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	8120efee1d9931b514aeb5a047209d576f23286c	a74401f0e5ebb15fa4d8b6619d1baa6ea9179123	2024-04-04T16:59:04+02:00	Pierrick Hymbert	ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478)
M	.github/workflows/bench.yml

commit	a74401f0e5ebb15fa4d8b6619d1baa6ea9179123	7a2c92637ae265654a68f62e6a7610b358255d3f	2024-04-04T10:30:02-04:00	limitedAtonement	Correct README link (#6458)
M	README-sycl.md

commit	7a2c92637ae265654a68f62e6a7610b358255d3f	4bcd6b959ca3991084ad1d8464caf2a734e29b1d	2024-04-04T11:57:58+02:00	Pierrick Hymbert	ci: bench: add more ftype, fix triggers and bot comment (#6466)
M	.github/workflows/bench.yml
M	examples/server/bench/bench.py
M	examples/server/bench/script.js

commit	4bcd6b959ca3991084ad1d8464caf2a734e29b1d	9b84ae1806cded4d6683c7b810925da5ead40607	2024-04-04T09:49:21+02:00	Daniel Bevenius	common: remove duplicate check for curl (#6471)
M	common/common.cpp

commit	9b84ae1806cded4d6683c7b810925da5ead40607	4399f13fb9462cd06f3f154d0aee738425000fea	2024-04-04T03:44:28-04:00	Clint Herron	examples : add GBNF validator program (#5948)
M	Makefile
A	examples/gbnf-validator/CMakeLists.txt
A	examples/gbnf-validator/gbnf-validator.cpp
M	llama.cpp
M	llama.h

commit	4399f13fb9462cd06f3f154d0aee738425000fea	1a43c7254ed5de91d09274b853db843c518f1b64	2024-04-04T09:34:58+03:00	Georgi Gerganov	server : remove obsolete --memory-f32 option
M	examples/server/README.md
M	examples/server/server.cpp

commit	1a43c7254ed5de91d09274b853db843c518f1b64	72d73af65132792a52433952ca4729b01c36cde2	2024-04-04T01:33:48-05:00	Xiao-Yong Jin	server : add option to disable KV offload (#6468)
M	examples/server/server.cpp

commit	72d73af65132792a52433952ca4729b01c36cde2	5fb1574c8112c757fc202fdae279da883f34e610	2024-04-04T02:32:53-04:00	Clint Herron	convert : fix for lint error complaining of bare except (#6470)
M	convert-hf-to-gguf.py

commit	5fb1574c8112c757fc202fdae279da883f34e610	60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640	2024-04-03T13:22:57-07:00	Fattire	A few small fixes to server's README docs (#6428)
M	examples/server/README.md

commit	60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640	bb43cf7e9d86d69ffd9c7f008f75db890a35b45a	2024-04-03T20:09:52+02:00	JH23X	server : handle exception on wrong type in request (#6452)
M	examples/server/utils.hpp

commit	bb43cf7e9d86d69ffd9c7f008f75db890a35b45a	9f62c0173d964972849251c8ad12fc356f5b7896	2024-04-04T02:05:10+08:00	bryanSwk	llama : add SEA-LION support (#6448)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	9f62c0173d964972849251c8ad12fc356f5b7896	5d4f12e4624bf4435ba26753814bedd4e9b62803	2024-04-03T20:01:13+02:00	Ewout ter Hoeven	ci : update checkout, setup-python and upload-artifact to latest (#6456)
M	.github/workflows/bench.yml
M	.github/workflows/build.yml
M	.github/workflows/code-coverage.yml
M	.github/workflows/docker.yml
M	.github/workflows/editorconfig.yml
M	.github/workflows/gguf-publish.yml
M	.github/workflows/python-check-requirements.yml
M	.github/workflows/python-lint.yml
M	.github/workflows/server.yml
M	.github/workflows/zig-build.yml

commit	5d4f12e4624bf4435ba26753814bedd4e9b62803	154d4ee39c38e231fb5c3910df14d2fc920fdf1b	2024-04-03T18:56:37+01:00	Ed Lepedus	server: add cURL support to `server.Dockerfile` (#6461)
M	.devops/server.Dockerfile

commit	154d4ee39c38e231fb5c3910df14d2fc920fdf1b	e69945d953b651674d6e6978022edf00c3a34d03	2024-04-03T18:53:37+01:00	Francisco Melo	readme : add feature-rich rust bindings (#6465)
M	README.md

commit	e69945d953b651674d6e6978022edf00c3a34d03	db214fa578e00b01e0884fc2725c9349608bdab5	2024-04-03T14:48:07-03:00	Joyce	security : create policy (#6354)
A	SECURITY.md

commit	db214fa578e00b01e0884fc2725c9349608bdab5	1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a	2024-04-03T21:12:52+05:30	Abhishek Gopinath K	Missing tokenizer.model error during gguf conversion (#6443)
M	convert-hf-to-gguf.py

commit	1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a	076b08649ecc3b0e1c0709c2a086a63eddd1bf32	2024-04-03T23:24:31+08:00	kaizau	Add OpenChat, Alpaca, Vicuna chat templates (#6397)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	076b08649ecc3b0e1c0709c2a086a63eddd1bf32	08a0c0206075556e82aca0feafad530dcc5f1426	2024-04-03T16:11:15+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	08a0c0206075556e82aca0feafad530dcc5f1426	52604860f93063ef98863921da697576af1c7665	2024-04-03T15:07:05+02:00	slaren	ggml : mul_mat_id use the same tensor for all the experts (#6387)
M	convert-hf-to-gguf.py
M	convert.py
M	examples/imatrix/imatrix.cpp
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-cuda/argsort.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	gguf-py/pyproject.toml
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	52604860f93063ef98863921da697576af1c7665	f87f7b898651339fe173ddf016ca826163e899d8	2024-04-03T10:34:40+08:00	Meng, Hengyu	[SYCL] Disable iqx on windows as WA (#6435)
M	ggml-common.h
M	ggml-sycl.cpp

commit	f87f7b898651339fe173ddf016ca826163e899d8	33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0	2024-04-01T19:05:57+03:00	Georgi Gerganov	flake.lock: Update (#6402)
M	flake.lock

commit	33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0	226e819371eec0f298d9075198394a07b23ecfa9	2024-04-01T13:30:43+02:00	Johannes Gäßler	compare-llama-bench.py: fix long hexsha args (#6424)
M	scripts/compare-llama-bench.py

commit	226e819371eec0f298d9075198394a07b23ecfa9	c50a82ce0f71558cbb8e555146ba124251504b38	2024-04-01T12:36:40+02:00	Pierrick Hymbert	ci: server: verify deps are coherent with the commit (#6409)
M	.github/workflows/server.yml

commit	c50a82ce0f71558cbb8e555146ba124251504b38	37e7854c104301c5b5323ccc40e07699f3a62c3e	2024-03-31T11:56:30+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	37e7854c104301c5b5323ccc40e07699f3a62c3e	c342d070c64a1ffe35d22c1b16b672e684a30297	2024-03-30T11:36:07+01:00	Pierrick Hymbert	ci: bench: fix Resource not accessible by integration on PR event (#6393)
M	.github/workflows/bench.yml

commit	c342d070c64a1ffe35d22c1b16b672e684a30297	f7fc5f6c6f3700da311de7fe93977c81798f02d3	2024-03-30T01:29:56+03:30	Mohammadreza Hendiani	Fedora build update (#6388)
M	.devops/llama-cpp-clblast.srpm.spec
M	.devops/llama-cpp-cuda.srpm.spec
M	.devops/llama-cpp.srpm.spec

commit	f7fc5f6c6f3700da311de7fe93977c81798f02d3	ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c	2024-03-29T22:34:44+01:00	Xuan Son Nguyen	split: allow --split-max-size option (#6343)
M	examples/gguf-split/gguf-split.cpp

commit	ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c	d48ccf3ad4fea5b9ede209c7f40be65371987bfe	2024-03-29T17:29:21+01:00	0cc4m	Vulkan k-quant mmq and ggml-backend offload functionality (#6155)
M	README.md
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml-vulkan.h
M	ggml.c
M	ggml_vk_generate_shaders.py
M	llama.cpp

commit	d48ccf3ad4fea5b9ede209c7f40be65371987bfe	069574775cea67d8a977904e4d534aff47a671f4	2024-03-29T17:45:46+02:00	Georgi Gerganov	sync : ggml (#6351)
M	ggml-alloc.c
M	ggml-cuda/common.cuh
M	ggml-cuda/dmmv.cu
M	ggml-cuda/dmmv.cuh
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	069574775cea67d8a977904e4d534aff47a671f4	cfde806eb95de06d84162bdee593dad33a1d2693	2024-03-29T21:37:03+08:00	hxer7963	[Model] Add support for xverse (#6301)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	cfde806eb95de06d84162bdee593dad33a1d2693	b910287954d4462fd3d48938336770e258459677	2024-03-29T14:34:28+02:00	Georgi Gerganov	ci : fix BGE wget (#6383)
M	ci/run.sh

commit	b910287954d4462fd3d48938336770e258459677	809398709041ee854fbbad9b344bcfdcd3712d59	2024-03-29T15:33:46+08:00	zhouwg	readme : add project (#6356)
M	README.md

commit	809398709041ee854fbbad9b344bcfdcd3712d59	057400a3fd457f4f214684eeb171444663b47a23	2024-03-29T03:27:42-04:00	Matt Clayton	cmake : add explicit metal version options (#6370)
M	CMakeLists.txt

commit	057400a3fd457f4f214684eeb171444663b47a23	b75c38166cf0c66793a32d5c3d6cb69929dd083d	2024-03-29T08:23:22+01:00	Daniel Bevenius	llama : remove redundant reshape in build_kv_store (#6369)
M	llama.cpp

commit	b75c38166cf0c66793a32d5c3d6cb69929dd083d	bfe7dafc9cf96b9a09ead347fed9a547930fc631	2024-03-29T08:15:00+01:00	Pedro Cuenca	convert : allow conversion of Mistral HF models (#6144)
M	convert-hf-to-gguf.py

commit	bfe7dafc9cf96b9a09ead347fed9a547930fc631	5106ef482c65ac60ac14da9a68c7b37bca4c6993	2024-03-28T22:56:03+02:00	Georgi Gerganov	readme : add notice for UI list
M	README.md

commit	5106ef482c65ac60ac14da9a68c7b37bca4c6993	be55134a535f7218c53f39211755b1c7550851b2	2024-03-28T16:01:47Z	Ouadie EL FAROUKI	[SYCL] Revisited & updated SYCL build documentation (#6141)
M	README-sycl.md

commit	be55134a535f7218c53f39211755b1c7550851b2	66ba56025602270152f5ba5234f3a80be3dee1c9	2024-03-28T11:44:36-04:00	Jared Van Bortel	convert : refactor vocab selection logic (#6355)
M	convert-hf-to-gguf.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	llama.h

commit	66ba56025602270152f5ba5234f3a80be3dee1c9	0308f5e3d7bf9879f818b1a4ae589ff36b242af5	2024-03-28T22:33:10+08:00	Ziang Wu	llava : fix MobileVLM (#6364)
M	examples/llava/MobileVLM-README.md
M	examples/llava/clip.cpp

commit	0308f5e3d7bf9879f818b1a4ae589ff36b242af5	28cb9a09c4d10a489be1238abe7a858dcd4d65f2	2024-03-28T08:05:54-04:00	compilade	llama : fix command-r inference when omitting outputs (#6367)
M	llama.cpp

commit	28cb9a09c4d10a489be1238abe7a858dcd4d65f2	cfc4d75df6399b36153ef739f2c1abee4c114bb8	2024-03-28T11:27:56+01:00	Pierrick Hymbert	ci: bench: fix master not schedule, fix commit status failed on external repo (#6365)
M	.github/workflows/bench.yml

commit	cfc4d75df6399b36153ef739f2c1abee4c114bb8	6902cb7f2e3479f364ee177118200fb7e4e9fc92	2024-03-28T16:51:06+08:00	Ting Sun	doc: fix outdated default value of batch size (#6336)
M	examples/main/README.md

commit	6902cb7f2e3479f364ee177118200fb7e4e9fc92	d2d8f389960a106b66313ff1621bdb1aaaaaa285	2024-03-28T16:50:48+08:00	Eric Zhang	server : stop gracefully on SIGTERM (#6348)
M	examples/server/server.cpp

commit	d2d8f389960a106b66313ff1621bdb1aaaaaa285	d39b308eaf0ac91c2e1f432bf66751193a470a56	2024-03-27T19:17:30+01:00	hutli	nix: removed unnessesary indentation
M	.devops/nix/package.nix

commit	d39b308eaf0ac91c2e1f432bf66751193a470a56	c87397664964e5a2a21de1877d504b23a2a35332	2024-03-27T19:14:28+01:00	hutli	nix: moved blas availability check to package inputs so it is still overridable
M	.devops/nix/package.nix

commit	c87397664964e5a2a21de1877d504b23a2a35332	dbb03e2b9c4fead73062926b6a134f28d3a3b46d	2024-03-27T18:10:08+01:00	hutli	using blas.meta.available to check host platform
M	.devops/nix/package.nix

commit	dbb03e2b9c4fead73062926b6a134f28d3a3b46d	e9f17dc3bf0da76c8b35130f9ca2fda5246c418e	2024-03-27T17:25:05+01:00	hutli	only using explicit blas if hostPlatform is allowed
M	.devops/nix/package.nix

commit	e9f17dc3bf0da76c8b35130f9ca2fda5246c418e	22a462cc1f69873f7d4c6d0201bd93478afa2ecb	2024-03-26T16:22:42Z	Someone Serge	nix: .#windows: proper cross-compilation set-up
M	flake.nix

commit	22a462cc1f69873f7d4c6d0201bd93478afa2ecb	f6a0f5c6422200764b7929064c39dcf4bb0e9cd6	2024-03-26T16:22:07Z	Someone Serge	nix: package: don't introduce the dependency on python
M	.devops/nix/package.nix

commit	f6a0f5c6422200764b7929064c39dcf4bb0e9cd6	d0e2f6416bd43eddb70137f6b96c7bc3d0246102	2024-02-15T14:25:04+01:00	hutli	nix: .#widnows: init
M	.devops/nix/package.nix
M	flake.nix

commit	d0e2f6416bd43eddb70137f6b96c7bc3d0246102	25f4a613c4ed6451162a87cb90be10d610b49f0f	2024-03-28T12:03:30+08:00	Ziang Wu	doc: fix typo in MobileVLM-README.md (#6181)
M	examples/llava/MobileVLM-README.md

commit	25f4a613c4ed6451162a87cb90be10d610b49f0f	a016026a3ac16d8c9b993a3573f19b9556d67de4	2024-03-28T08:55:24+08:00	Neo Zhang Jianyu	[SYCL] fix set main gpu crash (#6339)
M	ggml-sycl.cpp

commit	a016026a3ac16d8c9b993a3573f19b9556d67de4	53c7ec53d5eca26b2c0c648605543a5fa6c12817	2024-03-27T20:26:49+01:00	Pierrick Hymbert	server: continuous performance monitoring and PR comment (#6283)
A	.github/workflows/bench.yml
A	examples/server/bench/bench.py
A	examples/server/bench/prometheus.yml
A	examples/server/bench/requirements.txt
M	examples/server/tests/features/steps/steps.py

commit	53c7ec53d5eca26b2c0c648605543a5fa6c12817	e5b89a441af23a74b861b0bf8db3239139041876	2024-03-27T16:17:46Z	Someone Serge	nix: ci: dont test cuda and rocm (for now)
M	flake.nix

commit	e5b89a441af23a74b861b0bf8db3239139041876	3a0345970ed0353fa857df3c8a62a2b3318b1364	2024-03-27T15:07:50+01:00	slaren	ggml : fix bounds checking of zero size views (#6347)
M	ggml.c

commit	3a0345970ed0353fa857df3c8a62a2b3318b1364	1e13987fba5a536965ef942f2c86549d62cef50b	2024-03-27T15:02:49+02:00	Georgi Gerganov	make : whitespace
M	Makefile

commit	1e13987fba5a536965ef942f2c86549d62cef50b	e82f9e2b833d88cd2b30123ef57346c2cb8abd99	2024-03-27T12:15:44+01:00	howlger	embedding : show full embedding for single prompt (#6342)
M	examples/embedding/embedding.cpp

commit	e82f9e2b833d88cd2b30123ef57346c2cb8abd99	cbc83436197cde617cad696e665879c20df77daa	2024-03-27T08:16:40Z	AidanBeltonS	[SYCL] Fix batched impl for NVidia GPU (#6164)
M	ggml-sycl.cpp

commit	cbc83436197cde617cad696e665879c20df77daa	e562b9714b9b3e242361a7f74bbbeb00f6bd99ac	2024-03-27T08:44:27+01:00	Kawrakow	Make IQ1_M work for QK_K = 64 (#6327)
M	ggml-common.h
M	ggml-metal.metal
M	ggml-quants.c

commit	e562b9714b9b3e242361a7f74bbbeb00f6bd99ac	2ab4f00d25c0682a74472412d66454df211e4b0e	2024-03-27T08:23:10+01:00	Sigbjørn Skjæret	common : change --no-penalize-nl to --penalize-nl (#6334)
M	common/common.cpp

commit	2ab4f00d25c0682a74472412d66454df211e4b0e	1740d6dd4e00dedda87d6820b0e0d8e70dade340	2024-03-27T09:16:02+02:00	Georgi Gerganov	llama2c : open file as binary (#6332)
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	1740d6dd4e00dedda87d6820b0e0d8e70dade340	0642b22cd12af278d6e7e459b73411947c169381	2024-03-27T08:08:59+01:00	Mateusz Charytoniuk	readme : add php api bindings (#6326)
M	README.md

commit	0642b22cd12af278d6e7e459b73411947c169381	a4f569e8a316cbd33d2b4de94b694d111507475a	2024-03-27T13:55:29+08:00	Eric Zhang	server: public: use relative routes for static files (#6325)
M	examples/server/completion.js.hpp
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
M	examples/server/public/completion.js
M	examples/server/public/index.html

commit	a4f569e8a316cbd33d2b4de94b694d111507475a	32c8486e1f0297393cb22ac0a0d26a6b17ad4d54	2024-03-27T09:47:06+08:00	Neo Zhang Jianyu	[SYCL] fix no file in win rel (#6314)
M	.github/workflows/build.yml

commit	32c8486e1f0297393cb22ac0a0d26a6b17ad4d54	557410b8f06380560155ac7fcb8316d71ddc9837	2024-03-26T17:46:21-04:00	Jared Van Bortel	wpm : portable unicode tolower (#6305)
M	CMakeLists.txt
M	Makefile
M	Package.swift
M	build.zig
M	llama.cpp
A	unicode-data.cpp
A	unicode-data.h
M	unicode.cpp
M	unicode.h

commit	557410b8f06380560155ac7fcb8316d71ddc9837	55c1b2a3bbd470e9e2a3a0618b92cf64a885f806	2024-03-26T10:46:41-04:00	compilade	llama : greatly reduce output buffer memory usage (#6122)
M	README.md
M	examples/imatrix/imatrix.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp
M	ggml-cuda.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-opencl.cpp
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	55c1b2a3bbd470e9e2a3a0618b92cf64a885f806	e097633f63fdd26d492844f7eff056e4083fd9eb	2024-03-26T15:21:27+01:00	Kawrakow	IQ1_M: 1.75 bpw quantization (#6302)
M	examples/quantize/quantize.cpp
M	ggml-common.h
M	ggml-cuda.cu
M	ggml-cuda/convert.cu
M	ggml-cuda/mmvq.cu
M	ggml-cuda/vecdotq.cuh
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	e097633f63fdd26d492844f7eff056e4083fd9eb	d25b1c31b07c3675443a55a828dd58cfef5a241c	2024-03-26T13:32:19+01:00	Pedro Cuenca	convert-hf : fix exception in sentencepiece with added tokens (#6320)
M	convert-hf-to-gguf.py

commit	d25b1c31b07c3675443a55a828dd58cfef5a241c	deb7240100da99555b9ab9dc635021e591fceaf5	2024-03-26T13:09:30+01:00	Kawrakow	quantize : be able to override metadata by key (#6321)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	deb7240100da99555b9ab9dc635021e591fceaf5	3d032ece8e6973441273601ca2981130608e287d	2024-03-26T18:11:46+09:00	Minsoo Cheong	embedding : adjust `n_ubatch` value (#6296)
M	examples/embedding/embedding.cpp

commit	3d032ece8e6973441273601ca2981130608e287d	e190f1fca6f60d80944f9e8709d343a025c4d245	2024-03-26T16:47:43+08:00	Jan Boon	server : add `n_discard` parameter (#6300)
M	examples/server/server.cpp

commit	e190f1fca6f60d80944f9e8709d343a025c4d245	280345968dabc00d212d43e31145f5c9961a7604	2024-03-25T20:51:46-04:00	Joseph Stahl	nix: make `xcrun` visible in Nix sandbox for precompiling Metal shaders (#6118)
M	.devops/nix/package.nix
M	CMakeLists.txt

commit	280345968dabc00d212d43e31145f5c9961a7604	b06c16ef9f81d84da520232c125d4d8a1d273736	2024-03-26T01:16:01+01:00	slaren	cuda : rename build flag to LLAMA_CUDA (#6299)
M	.devops/full-cuda.Dockerfile
R081	.devops/llama-cpp-cublas.srpm.spec	.devops/llama-cpp-cuda.srpm.spec
M	.devops/main-cuda.Dockerfile
M	.devops/nix/package.nix
M	.devops/server-cuda.Dockerfile
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	README.md
M	ci/run.sh
M	common/common.cpp
M	docs/token_generation_performance_tips.md
M	examples/imatrix/README.md
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/MobileVLM-README.md
M	examples/llava/clip.cpp
M	examples/main-cmake-pkg/README.md
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	ggml-backend.c
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/LlamaConfig.cmake.in
M	scripts/compare-commits.sh
M	scripts/pod-llama.sh
M	scripts/server-llm.sh

commit	b06c16ef9f81d84da520232c125d4d8a1d273736	1f2fd4e727a707f85d58e0b56075c3e6334d18d8	2024-03-25T18:52:45+01:00	Christian Kögler	nix: fix blas support (#6281)
M	.devops/nix/package.nix

commit	1f2fd4e727a707f85d58e0b56075c3e6334d18d8	43139cc528909c3de8c144ed174e09a1f7912a80	2024-03-25T18:33:15+01:00	Kawrakow	tests : include IQ2_XXS and IQ2_XS in test-quantize-fns (#6303)
M	tests/test-quantize-fns.cpp

commit	43139cc528909c3de8c144ed174e09a1f7912a80	2f34b865b62b1d2b5eb8a27885e4de220deeacbd	2024-03-25T17:22:27+02:00	Georgi Gerganov	flake.lock: Update (#6266)
M	flake.lock

commit	2f34b865b62b1d2b5eb8a27885e4de220deeacbd	ae1f211ce2138448b47ebb148e25c58406845278	2024-03-25T15:43:22+01:00	slaren	cuda : fix LLAMA_CUDA_F16 build (#6298)
M	ggml-cuda/dmmv.cu

commit	ae1f211ce2138448b47ebb148e25c58406845278	ad3a0505e3b6cd777259ee35e61d428357ffc565	2024-03-25T13:50:23+01:00	slaren	cuda : refactor into multiple files (#6269)
M	.clang-tidy
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu
A	ggml-cuda/acc.cu
A	ggml-cuda/acc.cuh
A	ggml-cuda/alibi.cu
A	ggml-cuda/alibi.cuh
A	ggml-cuda/arange.cu
A	ggml-cuda/arange.cuh
A	ggml-cuda/argsort.cu
A	ggml-cuda/argsort.cuh
A	ggml-cuda/binbcast.cu
A	ggml-cuda/binbcast.cuh
A	ggml-cuda/clamp.cu
A	ggml-cuda/clamp.cuh
A	ggml-cuda/common.cuh
A	ggml-cuda/concat.cu
A	ggml-cuda/concat.cuh
A	ggml-cuda/convert.cu
A	ggml-cuda/convert.cuh
A	ggml-cuda/cpy.cu
A	ggml-cuda/cpy.cuh
A	ggml-cuda/dequantize.cuh
A	ggml-cuda/diagmask.cu
A	ggml-cuda/diagmask.cuh
A	ggml-cuda/dmmv.cu
A	ggml-cuda/dmmv.cuh
A	ggml-cuda/getrows.cu
A	ggml-cuda/getrows.cuh
A	ggml-cuda/im2col.cu
A	ggml-cuda/im2col.cuh
A	ggml-cuda/mmq.cu
A	ggml-cuda/mmq.cuh
A	ggml-cuda/mmvq.cu
A	ggml-cuda/mmvq.cuh
A	ggml-cuda/norm.cu
A	ggml-cuda/norm.cuh
A	ggml-cuda/pad.cu
A	ggml-cuda/pad.cuh
A	ggml-cuda/pool2d.cu
A	ggml-cuda/pool2d.cuh
A	ggml-cuda/quantize.cu
A	ggml-cuda/quantize.cuh
A	ggml-cuda/rope.cu
A	ggml-cuda/rope.cuh
A	ggml-cuda/scale.cu
A	ggml-cuda/scale.cuh
A	ggml-cuda/softmax.cu
A	ggml-cuda/softmax.cuh
A	ggml-cuda/sumrows.cu
A	ggml-cuda/sumrows.cuh
A	ggml-cuda/tsembd.cu
A	ggml-cuda/tsembd.cuh
A	ggml-cuda/unary.cu
A	ggml-cuda/unary.cuh
A	ggml-cuda/upscale.cu
A	ggml-cuda/upscale.cuh
A	ggml-cuda/vecdotq.cuh

commit	ad3a0505e3b6cd777259ee35e61d428357ffc565	95ad616cddda50273e955bfe192328acd9aa4896	2024-03-25T09:42:17+01:00	Xuan Son Nguyen	Server: clean up OAI params parsing function (#6284)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	95ad616cddda50273e955bfe192328acd9aa4896	64e7b47c6986221f2ff5c57c89dfc018bb0e9e6d	2024-03-25T15:52:41+08:00	Neo Zhang Jianyu	[SYCL] fix SYCL backend build on windows is break by LOG() error (#6290)
M	common/log.h
M	examples/sycl/win-build-sycl.bat

commit	64e7b47c6986221f2ff5c57c89dfc018bb0e9e6d	7733f0c76081b2a69b5f8b192db2db7c43629d58	2024-03-25T16:38:22+09:00	Minsoo Cheong	examples : add "retrieval" (#6193)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
M	common/log.h
M	examples/CMakeLists.txt
A	examples/retrieval/CMakeLists.txt
A	examples/retrieval/README.md
A	examples/retrieval/retrieval.cpp
D	retrieval

commit	7733f0c76081b2a69b5f8b192db2db7c43629d58	a32b77c4b2c1808654d0b952f26c37d73d2e746b	2024-03-25T01:39:56-04:00	Justine Tunney	ggml : support AVX512VNNI (#6280)
M	ggml-quants.c

commit	a32b77c4b2c1808654d0b952f26c37d73d2e746b	a0e584defd8c16e7a51ab895f595df0448d710d0	2024-03-24T14:45:56-07:00	Rick G	Fix heap corruption from wmode out-of-bound writes on windows (#6272)
M	ggml.c

commit	a0e584defd8c16e7a51ab895f595df0448d710d0	7aed0ffe6855e9cadcf413f288753af4566bfeb8	2024-03-24T16:18:45+02:00	Georgi Gerganov	imatrix : fix wname for mul_mat_id ops (#6271)
M	examples/imatrix/imatrix.cpp

commit	7aed0ffe6855e9cadcf413f288753af4566bfeb8	ea279d56091b90fbbe063b598f5229d95f58ef68	2024-03-24T14:21:17+01:00	Johannes Gäßler	Fixed lookup compilation issues on Windows (#6273)
M	common/ngram-cache.cpp

commit	ea279d56091b90fbbe063b598f5229d95f58ef68	586e7bc561be88e929a9afca7e67d8ead00c53bd	2024-03-24T09:57:06+01:00	Pierrick Hymbert	ci : close inactive issue, increase operations per run (#6270)
M	.github/workflows/close-issue.yml

commit	586e7bc561be88e929a9afca7e67d8ead00c53bd	ddf65685105a39a57b1e7f80c3aa502a6313af24	2024-03-24T17:54:07+09:00	Minsoo Cheong	sampling : deduplicated code for probability distribution access (#6240)
M	common/sampling.cpp
M	common/sampling.h
M	examples/speculative/speculative.cpp
A	retrieval

commit	ddf65685105a39a57b1e7f80c3aa502a6313af24	d03224ac9840351023ff8abcf4aa0542258a53df	2024-03-24T12:04:25+08:00	Meng, Hengyu	[SYCL] offload op (#6217)
M	ggml-sycl.cpp
M	ggml-sycl.h
M	ggml.c
M	llama.cpp

commit	d03224ac9840351023ff8abcf4aa0542258a53df	94d1b3b4119209efcdd08df0dceaecbd1fe7f85c	2024-03-24T09:44:01+08:00	Neo Zhang Jianyu	Support build win release for SYCL  (#6241)
M	.github/workflows/build.yml

commit	94d1b3b4119209efcdd08df0dceaecbd1fe7f85c	95562175f83a49755ff6fd3bad09409417c8e6f9	2024-03-23T18:48:02-04:00	Jared Van Bortel	use _wfopen instead of fopen on Windows (#6248)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	95562175f83a49755ff6fd3bad09409417c8e6f9	f482bb2e4920e544651fb832f2e0bcb4d2ff69ab	2024-03-23T21:35:23+02:00	Georgi Gerganov	gitignore : gguf-split
M	.gitignore

commit	f482bb2e4920e544651fb832f2e0bcb4d2ff69ab	1997577d5e121568ae39f538021733ccd4278c23	2024-03-23T18:07:00+01:00	Pierrick Hymbert	common: llama_load_model_from_url split support  (#6192)
M	.github/workflows/server.yml
M	common/common.cpp
M	common/common.h
M	examples/gguf-split/gguf-split.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	llama.cpp

commit	1997577d5e121568ae39f538021733ccd4278c23	476b0251b27fb64c575507024a671e639d675594	2024-03-23T18:00:38+01:00	Pierrick Hymbert	server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254)
M	examples/server/README.md

commit	476b0251b27fb64c575507024a671e639d675594	21cad01b6e6e1a96f99391f95e8ea8ae25c8288e	2024-03-23T17:41:53+01:00	Julius Arkenberg	llama : add grok-1 support (#6204)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	21cad01b6e6e1a96f99391f95e8ea8ae25c8288e	1b26aebe4de4f048ac99996efd8a2c9af150904d	2024-03-23T17:18:13+01:00	Pierrick Hymbert	split: add gguf-split in the make build target (#6262)
M	Makefile

commit	1b26aebe4de4f048ac99996efd8a2c9af150904d	50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652	2024-03-23T13:18:45+01:00	Pierrick Hymbert	server: flush stdout after logging in both text and json layout (#6253)
M	examples/server/utils.hpp

commit	50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652	56a00f0a2f48a85376f48b5ce77699df781631ae	2024-03-23T01:24:36+01:00	Johannes Gäßler	lookup: complement data from context with general text statistics (#5479)
M	.gitignore
M	Makefile
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
A	common/ngram-cache.cpp
A	common/ngram-cache.h
M	examples/lookup/CMakeLists.txt
A	examples/lookup/lookup-create.cpp
A	examples/lookup/lookup-merge.cpp
A	examples/lookup/lookup-stats.cpp
M	examples/lookup/lookup.cpp
A	scripts/get-wikitext-103.sh

commit	56a00f0a2f48a85376f48b5ce77699df781631ae	92397d87a45a09b5449d845a64856f177cd7a920	2024-03-22T21:10:39+02:00	Georgi Gerganov	common : default --hf-file to --model (#6234)
M	common/common.cpp

commit	92397d87a45a09b5449d845a64856f177cd7a920	1d0331c12a2f2a6296b471232bd4e66fbf06e6a1	2024-03-22T20:49:06+02:00	fraxy-v	convert-llama2c-to-ggml : enable conversion of GQA models (#6237)
M	.github/workflows/build.yml
M	examples/convert-llama2c-to-ggml/README.md
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	1d0331c12a2f2a6296b471232bd4e66fbf06e6a1	dba1af612926cbd4ebe2d876277af1e3305177e0	2024-03-22T19:47:14+01:00	Kawrakow	quantize: options for output and token embedding tensors qtype (#6239)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	dba1af612926cbd4ebe2d876277af1e3305177e0	ee804f6223777019cf921e0d99cc24669313ab98	2024-03-22T19:00:01+01:00	Pierrick Hymbert	llama_model_loader: support multiple split/shard GGUFs (#6187)
M	README.md
M	examples/gguf-split/gguf-split.cpp
M	llama.cpp
M	llama.h

commit	ee804f6223777019cf921e0d99cc24669313ab98	80bd33bc2c4be352697dc8473339f25e1085d117	2024-03-23T02:15:06+09:00	Minsoo Cheong	ci: apply concurrency limit for github workflows (#6243)
M	.github/workflows/build.yml
M	.github/workflows/code-coverage.yml
M	.github/workflows/docker.yml
M	.github/workflows/editorconfig.yml
M	.github/workflows/nix-ci-aarch64.yml
M	.github/workflows/nix-ci.yml
M	.github/workflows/python-check-requirements.yml
M	.github/workflows/python-lint.yml
M	.github/workflows/server.yml
M	.github/workflows/zig-build.yml

commit	80bd33bc2c4be352697dc8473339f25e1085d117	e80f06d2a194be62ab5b1cd7ef7c7a5b241dd4fb	2024-03-22T15:33:38+02:00	Georgi Gerganov	common : add HF arg helpers (#6234)
M	common/common.cpp
M	common/common.h

commit	e80f06d2a194be62ab5b1cd7ef7c7a5b241dd4fb	f77a8ffd3bbde77b7819823b0c006fd8c2d5cae4	2024-03-22T14:32:02+01:00	Nexesenex	llama : correction of the attn.v.weight quantization for IQ3_XS (#6209)
M	llama.cpp

commit	f77a8ffd3bbde77b7819823b0c006fd8c2d5cae4	72114edf068a9b2f54d3b09e9a198f611be397e8	2024-03-22T13:09:07Z	Olivier Chafik	tests : conditional python & node json schema tests (#6207)
M	.github/workflows/build.yml
M	tests/test-json-schema-to-grammar.cpp

commit	72114edf068a9b2f54d3b09e9a198f611be397e8	2f0e81e053b41ca28e73a841e7bdbf9820baaa57	2024-03-22T13:07:44Z	Olivier Chafik	json-schema-to-grammar : fix order of props + non-str const/enum (#6232)
M	common/json-schema-to-grammar.cpp
M	common/json-schema-to-grammar.h
M	examples/json-schema-to-grammar.py
M	examples/server/json-schema-to-grammar.mjs.hpp
M	examples/server/public/json-schema-to-grammar.mjs
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	tests/test-json-schema-to-grammar.cpp

commit	2f0e81e053b41ca28e73a841e7bdbf9820baaa57	29ab270e65975785cdca3243a3de71ccebc1252a	2024-03-22T14:05:31+01:00	slaren	cuda : add LLAMA_CUDA_NO_PEER_COPY to workaround broken ROCm p2p copy (#6208)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu

commit	29ab270e65975785cdca3243a3de71ccebc1252a	6b8bb3a31d260a01020497c5f01025c34222fcb9	2024-03-22T04:29:49-07:00	Xiaoyi Chen	readme : add RecurseChat to the list of UIs (#6219)
M	README.md

commit	6b8bb3a31d260a01020497c5f01025c34222fcb9	68e210b3543e0cc71268bee0920441747679ee13	2024-03-22T19:12:05+08:00	Jan Boon	server : fix n_keep always showing as 0 in response (#6211)
M	examples/server/server.cpp

commit	68e210b3543e0cc71268bee0920441747679ee13	b3e94f26bab8e3b5338b5902e5af5bb01894cb4a	2024-03-22T13:08:28+02:00	Georgi Gerganov	server : enable continuous batching by default (#6231)
M	common/common.h
M	examples/server/server.cpp

commit	b3e94f26bab8e3b5338b5902e5af5bb01894cb4a	b2075fd6a578f5685060df4baa90ae9e48e98c70	2024-03-22T11:35:53+02:00	Georgi Gerganov	metal : proper assert for mat-mat memory alignment (#6225)
M	README.md
M	ggml-metal.m
M	ggml-metal.metal

commit	b2075fd6a578f5685060df4baa90ae9e48e98c70	95d576b48ebf582b112d1c9cf4eed7142fa4e464	2024-03-22T08:53:43+01:00	Vaibhav Srivastav	ci : add CURL flag for the mac builds (#6214)
M	.github/workflows/build.yml

commit	95d576b48ebf582b112d1c9cf4eed7142fa4e464	59c17f02de8fdf7b084d6100b875b7e2bc07a83b	2024-03-22T09:36:03+02:00	Georgi Gerganov	metal : pad n_ctx by 32 (#6177)
M	common/common.cpp
M	examples/batched/batched.cpp
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	59c17f02de8fdf7b084d6100b875b7e2bc07a83b	fa046eafbc70bf97dcf39843af0323f19a8c9ac3	2024-03-22T15:19:37+08:00	Neo Zhang Jianyu	add blog link (#6222)
M	README-sycl.md

commit	fa046eafbc70bf97dcf39843af0323f19a8c9ac3	be07a03217376c53b1d95e5f658adbbbb2831555	2024-03-21T21:32:42-04:00	DAN™	Fix params underscore convert to dash. (#6203)
M	common/common.cpp

commit	be07a03217376c53b1d95e5f658adbbbb2831555	d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f	2024-03-22T06:41:24+08:00	Jan Boon	server : update readme doc from `slot_id` to `id_slot` (#6213)
M	examples/server/README.md

commit	d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f	f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359	2024-03-21T19:54:28+01:00	slaren	cuda : disable host register by default (#6206)
M	ggml-cuda.cu

commit	f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359	924ce1dce7fdf54894b462d03e7b608a6e574c32	2024-03-21T11:52:35-06:00	semidark	Corrected typo to wrong file (#6199)
M	README-sycl.md

commit	924ce1dce7fdf54894b462d03e7b608a6e574c32	03a8f8fafec2e21009be9fe7297d92e5d4538964	2024-03-21T16:20:05+02:00	Georgi Gerganov	tests : disable system() calls (#6198)
M	tests/test-json-schema-to-grammar.cpp

commit	03a8f8fafec2e21009be9fe7297d92e5d4538964	cfd3be76e37dab92c846d75a2421178f20db4a11	2024-03-21T13:59:53+01:00	slaren	cuda : fix LLAMA_CUDA_F16 build (#6197)
M	ggml-cuda.cu

commit	cfd3be76e37dab92c846d75a2421178f20db4a11	5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46	2024-03-21T13:59:38+01:00	Kawrakow	ggml : same IQ4_NL quantization for CPU/CUDA/Metal (#6196)
M	ggml-quants.c

commit	5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46	1943c0198125a0da1a200390e82cf461f9080d99	2024-03-21T11:50:43Z	Olivier Chafik	json-schema-to-grammar improvements (+ added to server) (#5978)
M	.gitignore
M	Makefile
M	build.zig
M	common/CMakeLists.txt
A	common/json-schema-to-grammar.cpp
A	common/json-schema-to-grammar.h
R100	examples/server/json.hpp	common/json.hpp
A	examples/json-schema-pydantic-example.py
M	examples/json-schema-to-grammar.py
A	examples/regex-to-grammar.py
M	examples/server/CMakeLists.txt
M	examples/server/chat.mjs
M	examples/server/completion.js.hpp
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
M	examples/server/json-schema-to-grammar.mjs.hpp
M	examples/server/public/index.html
M	examples/server/public/index.js
M	examples/server/public/json-schema-to-grammar.mjs
M	examples/server/server.cpp
M	examples/server/tests/features/security.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp
A	examples/ts-type-to-grammar.sh
M	tests/CMakeLists.txt
A	tests/run-json-schema-to-grammar.mjs
A	tests/test-json-schema-to-grammar.cpp

commit	1943c0198125a0da1a200390e82cf461f9080d99	5e43ba87429d85acbde97d16b2f48d9de992cc80	2024-03-21T10:30:40+01:00	Vaibhav Srivastav	ci : fix indentation error (#6195)
M	.github/workflows/build.yml

commit	5e43ba87429d85acbde97d16b2f48d9de992cc80	76aa30a26353f597e4fbe3cf776772ae812af89a	2024-03-21T10:13:12+01:00	Vaibhav Srivastav	build : add mac pre-build binaries (#6182)
M	.github/workflows/build.yml

commit	76aa30a26353f597e4fbe3cf776772ae812af89a	c5b8595e3f4f4ed319ef71c9c9d868d1b7a27626	2024-03-21T08:27:57+01:00	Kawrakow	Add ability to use Q5_0, Q5_1, and IQ4_NL for quantized K cache (#6183)
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal

commit	c5b8595e3f4f4ed319ef71c9c9d868d1b7a27626	42e21c68826f2e56b9592dccd9f3c43895b6890d	2024-03-21T06:10:52Z	AidanBeltonS	Add nvidia and amd backends (#6157)
M	ggml-sycl.cpp

commit	42e21c68826f2e56b9592dccd9f3c43895b6890d	1c51f98adcbad40e3c41f0a6ffadeb723190b417	2024-03-21T01:47:46+01:00	slaren	cuda : fix conflict with std::swap (#6186)
M	ggml-cuda.cu

commit	1c51f98adcbad40e3c41f0a6ffadeb723190b417	f9c7ba34476ffc4f13ae2cdb1aec493a16eb8d47	2024-03-20T21:03:26+01:00	slaren	cuda : print the returned error when CUDA initialization fails (#6185)
M	ggml-cuda.cu

commit	f9c7ba34476ffc4f13ae2cdb1aec493a16eb8d47	272935b281fee5c683e3d6d1eb580b84553cf503	2024-03-20T23:29:51+08:00	Ziang Wu	llava : update MobileVLM-README.md (#6180)
M	examples/llava/MobileVLM-README.md

commit	272935b281fee5c683e3d6d1eb580b84553cf503	ccf58aa3ec4d20b10162ba40898dc038ad4c3fad	2024-03-20T23:02:32+08:00	Ziang Wu	llava : add MobileVLM_V2 backup (#6175)
M	examples/llava/MobileVLM-README.md
M	examples/llava/clip.cpp
M	examples/llava/convert-image-encoder-to-gguf.py

commit	ccf58aa3ec4d20b10162ba40898dc038ad4c3fad	91f8ad167dcd24b54615b468d9dd764ebe1d37ad	2024-03-20T14:42:59+01:00	slaren	cuda : refactor to remove global resources (#6170)
M	ggml-cuda.cu

commit	91f8ad167dcd24b54615b468d9dd764ebe1d37ad	6b7e76d28cdf4361740054140708c71828453522	2024-03-20T13:30:36+01:00	Xuan Son Nguyen	Server: version bump for httplib and json (#6169)
M	examples/server/httplib.h
M	examples/server/json.hpp

commit	6b7e76d28cdf4361740054140708c71828453522	bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc	2024-03-20T14:17:34+02:00	Georgi Gerganov	gitignore : ignore curl-related files
M	.gitignore

commit	bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc	d795988d9e09f75412efe2134512914c42780ad5	2024-03-20T14:14:32+02:00	Georgi Gerganov	server : allow to override -ngl in tests (#6170)
M	examples/server/tests/features/steps/steps.py

commit	d795988d9e09f75412efe2134512914c42780ad5	f8c4e745e1e728204ab26dbadf52853545e6789c	2024-03-20T13:29:49+02:00	Georgi Gerganov	Revert "llava : add a MobileVLM_V2-1.7B backup (#6152)"
M	examples/llava/MobileVLM-README.md
M	examples/llava/clip.cpp
M	examples/llava/convert-image-encoder-to-gguf.py

commit	f8c4e745e1e728204ab26dbadf52853545e6789c	47cc7a7bf9793f81a6dfe7c2096c499403f64dd6	2024-03-20T19:20:37+08:00	Ziang Wu	llava : add a MobileVLM_V2-1.7B backup (#6152)
M	examples/llava/MobileVLM-README.md
M	examples/llava/clip.cpp
M	examples/llava/convert-image-encoder-to-gguf.py

commit	47cc7a7bf9793f81a6dfe7c2096c499403f64dd6	bd60d82d0cc8b6852ec535495a5042dbdf05de24	2024-03-20T16:32:34+05:30	Karthick	Server: Handle n_keep parameter in the request (#6174)
M	examples/server/utils.hpp

commit	bd60d82d0cc8b6852ec535495a5042dbdf05de24	6c0b287748327741b113d7d6018b68c63039b1c5	2024-03-20T01:33:49-04:00	Jared Van Bortel	server tests : more pythonic process management; fix bare `except:` (#6146)
M	examples/server/tests/features/environment.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt

commit	6c0b287748327741b113d7d6018b68c63039b1c5	d26e8b669dbf1f5f5a0afe4d2d885e86cf566302	2024-03-20T11:21:41+08:00	Neo Zhang Jianyu	update readme sycl for new update (#6151)
M	README-sycl.md
M	examples/sycl/win-run-llama2.bat

commit	d26e8b669dbf1f5f5a0afe4d2d885e86cf566302	d8b009a9456bf5284376149f3deb09300a37701a	2024-03-20T08:28:49+05:30	Abhilash Majumder	increase igpu cluster limit (#6159)
M	ggml-sycl.h

commit	d8b009a9456bf5284376149f3deb09300a37701a	d0d5de42e5a65865b5fddb6f5c785083539b74c3	2024-03-19T12:16:09-04:00	DAN™	Remove undeed header file. (#6158)
M	examples/gguf-split/gguf-split.cpp

commit	d0d5de42e5a65865b5fddb6f5c785083539b74c3	b80cf3b2d1dee0ad325f7a794fecc66befce7336	2024-03-19T12:05:44+01:00	Pierrick Hymbert	gguf-split: split and merge gguf per batch of tensors (#6135)
M	Makefile
M	examples/CMakeLists.txt
A	examples/gguf-split/CMakeLists.txt
A	examples/gguf-split/README.md
A	examples/gguf-split/gguf-split.cpp

commit	b80cf3b2d1dee0ad325f7a794fecc66befce7336	970a48060ab9a6cc67aa063870323781c2a7bd7d	2024-03-19T10:21:54+02:00	Georgi Gerganov	common : disable repeat penalties by default (#6127)
M	common/sampling.h

commit	970a48060ab9a6cc67aa063870323781c2a7bd7d	4c28b8252907561165827125d2d1a4bad6926ac6	2024-03-19T09:06:54+01:00	slaren	ci : exempt some labels from being tagged as stale (#6140)
M	.github/workflows/close-issue.yml

commit	4c28b8252907561165827125d2d1a4bad6926ac6	2d15886bb092c3b780c676b5cc57ff3337af9c83	2024-03-19T01:59:36-04:00	DAN™	common : print usage on '-h' and '--help' (#6145)
M	common/common.cpp

commit	2d15886bb092c3b780c676b5cc57ff3337af9c83	d199ca79f279e84ebe27caafe0aa59c461d88969	2024-03-17T06:37:44Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	d199ca79f279e84ebe27caafe0aa59c461d88969	104f5e0fc156d48476258295457cafeec2a2af10	2024-03-18T12:49:02-04:00	Jared Van Bortel	mpt : implement backwards compatiblity with duped output tensor (#6139)
M	llama.cpp

commit	104f5e0fc156d48476258295457cafeec2a2af10	5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c	2024-03-18T16:40:22+01:00	Felix	clip : fix memory leak (#6138)
M	examples/llava/clip.cpp

commit	5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c	ac9ee6a4ad740bc1ee484ede43e9f92b5af244c1	2024-03-18T16:33:44+01:00	slaren	backend : set max split inputs to GGML_MAX_SRC (#6137)
M	ggml-backend.c

commit	ac9ee6a4ad740bc1ee484ede43e9f92b5af244c1	4f6d1337ca5a409dc74aca8c479b7c34408a69c0	2024-03-18T13:45:38+02:00	Georgi Gerganov	ci : disable stale issue messages (#6126)
M	.github/workflows/close-issue.yml

commit	4f6d1337ca5a409dc74aca8c479b7c34408a69c0	2bf8d0f7c4cc1235755ad06961ca761e458c5e55	2024-03-18T13:45:27+02:00	Georgi Gerganov	ci : temporary disable sanitizer builds (#6128)
M	.github/workflows/build.yml
M	.github/workflows/server.yml

commit	2bf8d0f7c4cc1235755ad06961ca761e458c5e55	496bc79bc2b79bfd6124b8687a8dbd6a646e9b06	2024-03-18T11:03:04+01:00	slaren	backend : offload large batches to GPU (#6083)
M	examples/imatrix/imatrix.cpp
M	examples/llama-bench/llama-bench.cpp
M	ggml-alloc.c
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	llama.cpp

commit	496bc79bc2b79bfd6124b8687a8dbd6a646e9b06	9b03719ad712e2dc36c5c0c20f352bf3e4bda332	2024-03-18T04:27:44-04:00	DAN™	common : tidy-up argument parsing (#6105)
M	common/common.cpp

commit	9b03719ad712e2dc36c5c0c20f352bf3e4bda332	3a6efdd03c46c5ba08e43880d34260c02dd9999b	2024-03-18T09:17:00+01:00	Thérence	convert : add support for CamembertModel architecture (#6119)
M	convert-hf-to-gguf.py

commit	3a6efdd03c46c5ba08e43880d34260c02dd9999b	d01b3c4c32357567f3531d4e6ceffc5d23e87583	2024-03-18T09:04:41+01:00	Romain D	convert : use f32 outtype for bf16 tensors (#6106)
M	convert.py

commit	d01b3c4c32357567f3531d4e6ceffc5d23e87583	cd776c37c945bf58efc8fe44b370456680cb1b59	2024-03-17T19:12:37+01:00	Pierrick Hymbert	common: llama_load_model_from_url using --model-url (#6098)
M	.github/workflows/build.yml
M	.github/workflows/server.yml
M	CMakeLists.txt
M	Makefile
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/README.md
M	examples/server/tests/features/embeddings.feature
M	examples/server/tests/features/environment.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt

commit	cd776c37c945bf58efc8fe44b370456680cb1b59	dc0f6125487dcfbff913360f9d877bc0ccf6aa57	2024-03-17T19:51:57+02:00	Georgi Gerganov	ci : close all stale issues at once (#6115)
M	.github/workflows/close-issue.yml

commit	dc0f6125487dcfbff913360f9d877bc0ccf6aa57	c47cf414efafb8f60596edc7edb5a2d68065e992	2024-03-18T01:12:22+08:00	GainLee	ggml:fix finding transfer queue family index error (#6094)
M	ggml-vulkan.cpp

commit	c47cf414efafb8f60596edc7edb5a2d68065e992	b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2	2024-03-16T11:52:02-04:00	AmirAli Mirian	ggml : add AVX512F SIMD (#6088)
M	ggml.c

commit	b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2	dfbfdd60f90207404039c6578d709231496831d9	2024-03-16T16:46:29+01:00	Daniel Bevenius	gritlm : add initial README.md (#6086)
A	examples/gritlm/README.md

commit	dfbfdd60f90207404039c6578d709231496831d9	15961ec04dbd59d21d8984d42e4c0f7e7e7d320a	2024-03-16T16:42:08+01:00	Xuan Son Nguyen	readme : add wllama as a wasm binding (#6100)
M	README.md

commit	15961ec04dbd59d21d8984d42e4c0f7e7e7d320a	a56d09a4407f29c21e149b44fd5308f83aa1cb09	2024-03-16T11:39:15-04:00	DAN™	common : refactor nested if causing error C1061 on MSVC (#6101)
M	common/common.cpp

commit	a56d09a4407f29c21e149b44fd5308f83aa1cb09	d84c48505f60bcd358b82a751d40418c4d235643	2024-03-16T13:20:53+01:00	Pierrick Hymbert	ci : close inactive issue with workflow (#6053)
A	.github/workflows/close-issue.yml

commit	d84c48505f60bcd358b82a751d40418c4d235643	877b4d0c628cc70dddb5df72ed8fc14d126ca7e8	2024-03-15T22:14:16+01:00	slaren	llama : fix Baichuan2 13B (#6092)
M	llama.cpp

commit	877b4d0c628cc70dddb5df72ed8fc14d126ca7e8	12247f4c69a173b9482f68aaa174ec37fc909ccf	2024-03-15T13:43:02-07:00	Theia Vogel	llama : add support for control vectors (#5970)
M	common/common.cpp
M	common/common.h
M	llama.cpp
M	llama.h

commit	12247f4c69a173b9482f68aaa174ec37fc909ccf	4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc	2024-03-15T16:41:22-04:00	Andrew Canis	llama : add Command-R support (#6033)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc	3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae	2024-03-15T22:31:05+08:00	Ting Lou	llava : change API to pure C style for Rust FFI bindgen (#6079)
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/llava/llava.h

commit	3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae	46acb3676718b983157058aecf729a2064fc7d34	2024-03-15T13:24:03+01:00	slaren	cuda : disable unused cudaLaunchHostFunc code (#6078)
M	ggml-cuda.cu

commit	46acb3676718b983157058aecf729a2064fc7d34	131b0584096ee9df4d07cb28759dfea6efe6475f	2024-03-15T18:53:53+08:00	Neo Zhang Jianyu	fix set main gpu error (#6073)
M	examples/sycl/build.sh
M	examples/sycl/run-llama2.sh
M	ggml-sycl.cpp
M	ggml-sycl.h
M	llama.cpp

commit	131b0584096ee9df4d07cb28759dfea6efe6475f	753e36f650fa2a5869f89188d9ee745dc74cf14b	2024-03-15T11:36:50+02:00	Georgi Gerganov	make : ggml-metal.o depends on ggml.h
M	Makefile

commit	753e36f650fa2a5869f89188d9ee745dc74cf14b	7ce2c77f88e1ca66ec48417e56f91746bac018c2	2024-03-15T09:26:20Z	AidanBeltonS	[SYCL] Fix non-intel device selection (#6042)
M	ggml-sycl.cpp

commit	7ce2c77f88e1ca66ec48417e56f91746bac018c2	aab606a11fc0a9740a7f297521c3eef851dfb351	2024-03-15T02:46:51-06:00	Ondřej Čertík	gguf : add support for I64 and F64 arrays (#6062)
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py

commit	aab606a11fc0a9740a7f297521c3eef851dfb351	b0bc9f4a9da7c19f4779106ea83b23feca747566	2024-03-15T09:44:57+01:00	Xuan Son Nguyen	llama : add Orion chat template (#6066)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	b0bc9f4a9da7c19f4779106ea83b23feca747566	4755afd1cbd40d93c017e5b98c39796f52345314	2024-03-15T09:22:24+01:00	slaren	llama-bench : use random tokens to improve accuracy with mixtral (#6069)
M	examples/llama-bench/llama-bench.cpp

commit	4755afd1cbd40d93c017e5b98c39796f52345314	6e0438da3cc95b89cdbf55f45fa4e324d9076792	2024-03-14T22:58:41+02:00	Georgi Gerganov	llama : fix integer overflow during quantization (#6063)
M	llama.cpp

commit	6e0438da3cc95b89cdbf55f45fa4e324d9076792	727107707a73b3dc8a497cf9fc9405722c16dd2b	2024-03-14T14:29:32-04:00	Steve Grubb	gguf : fix resource leaks (#6061)
M	examples/gguf/gguf.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/clip.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	727107707a73b3dc8a497cf9fc9405722c16dd2b	69ff61397d2b7b550dcdda4a35b35128892408b0	2024-03-14T11:57:31-06:00	Ondřej Čertík	gguf-py : bump version to 0.8.0 (#6060)
M	gguf-py/pyproject.toml

commit	69ff61397d2b7b550dcdda4a35b35128892408b0	044ec4b2a567f649459ccd20af2f387c784faa51	2024-03-14T17:21:56+01:00	Michael Podvitskiy	llama : support models without vocabulary (#5798)
M	convert.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp
M	llama.h

commit	044ec4b2a567f649459ccd20af2f387c784faa51	77178eedc83d49f31bf757d8e12315d76460be78	2024-03-14T15:14:14+02:00	Georgi Gerganov	embedding : add EOS token if not present (#899)
M	examples/embedding/embedding.cpp

commit	77178eedc83d49f31bf757d8e12315d76460be78	15a333260ab637a040ed0864c206a2ceaf806bb8	2024-03-14T13:32:14+02:00	Georgi Gerganov	gguf-py : fix dtype check (#6045)
M	gguf-py/gguf/gguf_writer.py

commit	15a333260ab637a040ed0864c206a2ceaf806bb8	43241adf22e8231ffaf3827d2c9310cc0ffd5ac5	2024-03-14T04:18:23-07:00	Jian Liao	readme : improve readme for Llava-1.6 example (#6044)
M	examples/llava/README.md

commit	43241adf22e8231ffaf3827d2c9310cc0ffd5ac5	a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6	2024-03-14T12:15:39+01:00	Pierrick Hymbert	server: disable debug release type sanitizer, simplify trigger (#6047)
M	.github/workflows/server.yml
M	examples/server/tests/features/steps/steps.py

commit	a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6	2c4fb69246834503db7b78bcbedcef506bbc60c4	2024-03-14T13:13:06+02:00	Georgi Gerganov	llama : fix typo
M	llama.cpp

commit	2c4fb69246834503db7b78bcbedcef506bbc60c4	3ca23481dd309bd51cc31c73a4cc34f922cc372f	2024-03-14T11:56:48+01:00	Michael Podvitskiy	llama : optimize defrag moves + fix fragmentation calculation (#6037)
M	llama.cpp

commit	3ca23481dd309bd51cc31c73a4cc34f922cc372f	3fe8d7a17f84bd721cd4d8db35365da44b69f68b	2024-03-14T04:40:14-06:00	Ondřej Čertík	gguf-py : add support for I8, I16 and I32 (#6045)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_reader.py
M	gguf-py/gguf/gguf_writer.py

commit	3fe8d7a17f84bd721cd4d8db35365da44b69f68b	68265ebfc6a1bed022973ea0c3145be1450b7e70	2024-03-14T12:38:37+02:00	Georgi Gerganov	ggml : designate enum vals for integer types (#6050)
M	ggml.h

commit	68265ebfc6a1bed022973ea0c3145be1450b7e70	381da2d9f0940d7009e3e918bed36338c8ff2fbb	2024-03-14T12:37:20+02:00	Georgi Gerganov	embedding : print all resulting embeddings (#899)
M	examples/embedding/embedding.cpp

commit	381da2d9f0940d7009e3e918bed36338c8ff2fbb	0fd6c1f015f6cccf3b527f7dbd8386a434728126	2024-03-14T11:55:23+02:00	Georgi Gerganov	metal : build metallib + fix embed path (#6015)
M	.github/workflows/build.yml
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	ggml-metal.m
M	ggml-metal.metal

commit	0fd6c1f015f6cccf3b527f7dbd8386a434728126	19885d205e768579ab090d1e99281cae58c21b54	2024-03-14T10:12:29+02:00	Georgi Gerganov	embedding : print cosine similarity (#899)
M	common/common.cpp
M	common/common.h
M	examples/embedding/embedding.cpp
M	examples/gritlm/gritlm.cpp

commit	19885d205e768579ab090d1e99281cae58c21b54	76a936c8939c249a7c3e8e66dfefbab13eae194f	2024-03-14T02:34:40+08:00	Linwei Wang	readme : update details about running llama in Termux on Android (#6039)
M	README.md

commit	76a936c8939c249a7c3e8e66dfefbab13eae194f	463628372d5fe3a0c1e5864aa5fc57deb7387039	2024-03-13T20:33:56+02:00	Georgi Gerganov	readme : update API changes and hot topics
M	README.md

commit	463628372d5fe3a0c1e5864aa5fc57deb7387039	f30ea47a87ed4446ad55adb265755dc9102956a2	2024-03-13T14:10:40-04:00	Clint Herron	grammar : handle missing "root" node (#6004)
M	common/sampling.cpp

commit	f30ea47a87ed4446ad55adb265755dc9102956a2	d8fd0ccf6ac8b07791ffd1575eed436930854ae3	2024-03-13T18:54:21+01:00	slaren	llama : add pipeline parallelism support (#6017)
M	CMakeLists.txt
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/embedding/embedding.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	examples/server/tests/features/embeddings.feature
M	examples/server/tests/features/steps/steps.py
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	llama.cpp
M	llama.h

commit	d8fd0ccf6ac8b07791ffd1575eed436930854ae3	b3d978600f07f22e94f2e797f18a8b5f6df23c89	2024-03-13T14:58:30+01:00	slaren	test-backend-ops : skip CPU backend by default (#6028)
M	tests/test-backend-ops.cpp

commit	b3d978600f07f22e94f2e797f18a8b5f6df23c89	99b71c068f624521ad977e08e41589e2971fa1c7	2024-03-13T13:17:54Z	AidanBeltonS	Update get version (#6025)
M	ggml-sycl.cpp

commit	99b71c068f624521ad977e08e41589e2971fa1c7	306d34be7ad19e768975409fc80791a274ea0230	2024-03-13T11:39:11+01:00	Xuan Son Nguyen	Server: Use multi-task for embeddings endpoint (#6001)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	306d34be7ad19e768975409fc80791a274ea0230	8030da7afea2d89f997aeadbd14183d399a017b9	2024-03-12T16:55:19+01:00	slaren	ci : remove tidy-review (#6021)
D	.github/workflows/tidy-post.yml
D	.github/workflows/tidy-review.yml

commit	8030da7afea2d89f997aeadbd14183d399a017b9	184215e783dfad76aded2c68244c327a5c507df5	2024-03-12T14:27:20+02:00	Georgi Gerganov	ggml : reuse quantum structs across backends (#5943)
M	ggml-common.h
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml-sycl.cpp

commit	184215e783dfad76aded2c68244c327a5c507df5	48358b2e5b3983c41ba7e61a493e84d3901dc7b9	2024-03-12T13:49:55+02:00	Georgi Gerganov	ggml : fix UB in IQ2_S and IQ3_S (#6012)
M	ggml-quants.c

commit	48358b2e5b3983c41ba7e61a493e84d3901dc7b9	5cdb371731caa2c41fcca42d4d2d43f94f6883b4	2024-03-12T11:15:05+02:00	Georgi Gerganov	sycl : update IQ1_S kernels (WIP - not working!) (#5995)
M	ggml-sycl.cpp

commit	5cdb371731caa2c41fcca42d4d2d43f94f6883b4	44ca159faf4fbe1a7ace13a962845ba7cdfd95ec	2024-03-11T20:59:03+01:00	gliptic	grammar : fix unnecessarily retained pointer to rules (#6003)
M	llama.cpp

commit	44ca159faf4fbe1a7ace13a962845ba7cdfd95ec	05b06210c954491cf0f12034b0a62bd4d69ce78b	2024-03-11T16:53:15+01:00	Kawrakow	1.5 bit: we can do even better (#5999)
M	ggml-common.h
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml-quants.c

commit	05b06210c954491cf0f12034b0a62bd4d69ce78b	83796e62bc9f6caae6228168e359890f51e60fee	2024-03-11T17:49:47+02:00	Georgi Gerganov	llama : more consistent names of count variables (#5994)
M	README.md
M	common/common.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp
M	llama.h

commit	83796e62bc9f6caae6228168e359890f51e60fee	828defefb66fc8a25404f5de845897145bf34061	2024-03-11T17:47:47+02:00	Georgi Gerganov	llama : refactor unicode stuff (#5992)
M	CMakeLists.txt
M	Makefile
M	Package.swift
M	build.zig
M	llama.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-llama.cpp
A	unicode.cpp
M	unicode.h

commit	828defefb66fc8a25404f5de845897145bf34061	caa106d4e05a0ab94225c220b81f9e2cd522339b	2024-03-11T14:40:42+01:00	Jakub N	Update server docker image URLs (#5997)
M	examples/server/README.md

commit	caa106d4e05a0ab94225c220b81f9e2cd522339b	3202361c5b1ba15e695b31209567ef42c22c5c32	2024-03-11T10:56:41+01:00	Xuan Son Nguyen	Server: format error to json (#5961)
M	examples/server/README.md
M	examples/server/completion.js.hpp
M	examples/server/public/completion.js
M	examples/server/server.cpp
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp

commit	3202361c5b1ba15e695b31209567ef42c22c5c32	332bdfd7980718abf664bfa5460f2288a3314984	2024-03-11T10:28:51+01:00	Michael Podvitskiy	ggml, ci : Windows ARM runner and build fixes (#5979)
M	.github/workflows/build.yml
M	ggml-impl.h
M	ggml-quants.c
M	ggml.c
M	llama.cpp

commit	332bdfd7980718abf664bfa5460f2288a3314984	ecab1c75de68de7c41c254e2ae170d3b07bee6d4	2024-03-11T17:09:32+09:00	Minsoo Cheong	server : maintain chat completion id for streaming responses (#5988)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	ecab1c75de68de7c41c254e2ae170d3b07bee6d4	ee35600b9061b1ea0c4ea87fce6844297632b2a8	2024-03-11T10:00:08+02:00	Gilad S	cmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985)
M	CMakeLists.txt

commit	ee35600b9061b1ea0c4ea87fce6844297632b2a8	be858f620508385ad12d0e5e862010e666ca729c	2024-03-11T09:56:47+02:00	Georgi Gerganov	llama : fix F16/F32 downcast + improve names (#5980)
M	llama.cpp
M	llama.h

commit	be858f620508385ad12d0e5e862010e666ca729c	ef3ced26a3817d92890b97b83acaeb018ade02d0	2024-03-11T07:51:49+01:00	Kawrakow	Better 1.5 bit quantization  (#5971)
M	ggml-common.h
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h

commit	ef3ced26a3817d92890b97b83acaeb018ade02d0	3814a07392d2bdc22911652bc7c2f9bdb0ce042e	2024-03-11T10:27:56+05:30	Abhilash Majumder	[SYCL] Add q3_s and q1_s (#5886)
M	ggml-sycl.cpp

commit	3814a07392d2bdc22911652bc7c2f9bdb0ce042e	bb6d00bbf98476215596b9df3870b5504ef5a29a	2024-03-11T01:13:57Z	AidanBeltonS	[SYCL] Add support for SYCL Nvidia target (#5738)
M	CMakeLists.txt
M	README-sycl.md

commit	bb6d00bbf98476215596b9df3870b5504ef5a29a	7ab7b733bb48250b2df26c12b00256ef42c76932	2024-03-10T23:12:48+02:00	Georgi Gerganov	metal : move mm_id indices to shared mem (#5982)
M	ggml-metal.m
M	ggml-metal.metal

commit	7ab7b733bb48250b2df26c12b00256ef42c76932	d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a27	2024-03-11T04:03:17+08:00	Dean	android : fix utf8 decoding error (#5935)
M	examples/llama.android/app/src/main/cpp/llama-android.cpp
M	examples/llama.android/app/src/main/java/com/example/llama/Llm.kt

commit	d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a27	b838b53ad6de2e53f23ddf8f3ad5e6891cc3dd05	2024-03-10T20:58:26+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	b838b53ad6de2e53f23ddf8f3ad5e6891cc3dd05	df4dc3e7cb43162862f339525638ba4febcb6158	2024-03-10T20:10:46+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	df4dc3e7cb43162862f339525638ba4febcb6158	bf47a5eefc669fdba71af096942af999bc1167d4	2024-03-08T23:45:07+02:00	Georgi Gerganov	ggml : try fix 32-bit arm compat (whisper/1938)
M	ggml-quants.c

commit	bf47a5eefc669fdba71af096942af999bc1167d4	fa8a809a9119411bc9c3f00026550d0343f4d9b7	2024-03-10T20:09:24+02:00	Georgi Gerganov	ggml : remove __constant__ specifier for CUDA tables (#5940)
M	ggml-common.h

commit	fa8a809a9119411bc9c3f00026550d0343f4d9b7	bcebd7dbf62fd7b293d5ed089023e4e733269c71	2024-03-10T18:17:47+01:00	Pierrick Hymbert	server: ci: windows build and tests (#5968)
M	.github/workflows/server.yml
M	examples/server/tests/features/environment.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py

commit	bcebd7dbf62fd7b293d5ed089023e4e733269c71	2960eae847f8dbde23be6d170a61bcf44ebf32de	2024-03-10T11:56:30-04:00	DAN™	llama : add support for GritLM (#5959)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/gritlm/CMakeLists.txt
A	examples/gritlm/gritlm.cpp
M	llama.cpp
M	llama.h

commit	2960eae847f8dbde23be6d170a61bcf44ebf32de	c78541479cf835dd9eb568ccd9a2083198a7203d	2024-03-10T11:17:43-04:00	Clint Herron	grammar : verify parsed state (#5950)
M	common/grammar-parser.cpp

commit	c78541479cf835dd9eb568ccd9a2083198a7203d	621e86b331f8b0e71f79fd82a4ae1cd54c3e4396	2024-03-10T16:43:08+02:00	Georgi Gerganov	nix: update flake.lock (#5969)
M	flake.lock

commit	621e86b331f8b0e71f79fd82a4ae1cd54c3e4396	77d1ac7e00bf049b9f2bba1b5a310a78318c49c4	2024-03-09T23:41:49+01:00	Pierrick Hymbert	server: benchmark: chat/completions scenario and other llm servers comparison (#5941)
A	examples/server/bench/README.md
A	examples/server/bench/script.js
M	examples/server/server.cpp

commit	77d1ac7e00bf049b9f2bba1b5a310a78318c49c4	d894f352bf433157232dc8dc54eacd50014e898e	2024-03-09T22:04:00+02:00	Georgi Gerganov	server : print chat template info
M	examples/server/server.cpp

commit	d894f352bf433157232dc8dc54eacd50014e898e	098dbaab449f5309a54871ba7e5acef72ae696de	2024-03-09T19:55:54+01:00	slaren	perplexity : support using multiple sequences to allow larger batch sizes (#5946)
M	examples/perplexity/perplexity.cpp
M	llama.cpp

commit	098dbaab449f5309a54871ba7e5acef72ae696de	8380ecfb219c2e73cc706fcc83935b7c806cc7c3	2024-03-09T18:14:13+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	8380ecfb219c2e73cc706fcc83935b7c806cc7c3	58308a0ecce7cc261b802f4803c38d420063db21	2024-03-09T17:36:20+02:00	Georgi Gerganov	ggml : fix unnecessary f32 -> f16 -> f32 casts (mmla) (#5951)
M	ggml-quants.c

commit	58308a0ecce7cc261b802f4803c38d420063db21	5b09797321430f08caf0473143a962916ab2ea89	2024-03-09T17:34:15+02:00	Georgi Gerganov	server : fix metrics init (#5964)
M	examples/server/server.cpp

commit	5b09797321430f08caf0473143a962916ab2ea89	97c09585d65a95864773b4d25d66d0f708baf38d	2024-03-09T15:53:59+02:00	Georgi Gerganov	ggml : remove old quantization functions (#5942)
M	examples/benchmark/benchmark-matmult.cpp
M	examples/llava/clip.cpp
M	ggml-quants.c
M	ggml-quants.h
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	97c09585d65a95864773b4d25d66d0f708baf38d	fb215c3832236fec7380c4fb618bd7154cb196ef	2024-03-09T15:47:47+02:00	Georgi Gerganov	server : clarify some items in the readme (#5957)
M	examples/server/README.md

commit	fb215c3832236fec7380c4fb618bd7154cb196ef	2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89	2024-03-09T21:27:58+09:00	SeungWon Jeong	server : normalize embeddings (#5956)
M	common/common.cpp
M	common/common.h
M	examples/embedding/embedding.cpp
M	examples/server/server.cpp

commit	2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89	0db32beaf09d90b8959d3d0cc493ed1e45685353	2024-03-09T14:17:11+02:00	Georgi Gerganov	tests : gitignore ggml-common.h
M	tests/.gitignore

commit	0db32beaf09d90b8959d3d0cc493ed1e45685353	8a3012a4ad08112bb3dc3f1399afec4e93780c44	2024-03-09T11:16:53Z	Alexey Parfenov	server : fix passing prompt as tokens (#5955)
M	examples/server/server.cpp

commit	8a3012a4ad08112bb3dc3f1399afec4e93780c44	9674aaf35cb81478eb38c3f3ebde713ec72fbb79	2024-03-09T12:47:57+02:00	Georgi Gerganov	ggml : add ggml-common.h to deduplicate shared code (#5940)
M	CMakeLists.txt
M	Makefile
A	ggml-common.h
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml-sycl.cpp
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	9674aaf35cb81478eb38c3f3ebde713ec72fbb79	950ba1ab84db199f0bbdecdb2bb911f35261b321	2024-03-09T12:34:18+02:00	Georgi Gerganov	server : simplify logic for empty prompts (#5953)
M	examples/server/server.cpp

commit	950ba1ab84db199f0bbdecdb2bb911f35261b321	e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea	2024-03-09T11:27:53+01:00	Xuan Son Nguyen	Server: reorganize some http logic (#5939)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/security.feature
M	examples/server/tests/features/steps/steps.py

commit	e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea	fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352	2024-03-09T02:57:09-07:00	Gabe Goodhart	server : add SSL support (#5926)
M	Makefile
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/server.cpp

commit	fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352	c2101a2e909ac7c08976d414e64e96c90ee5fa9e	2024-03-09T10:30:04+01:00	Pierrick Hymbert	server: tests: add truncated prompt tests, better kv cache size (#5933)
M	examples/server/server.cpp
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py

commit	c2101a2e909ac7c08976d414e64e96c90ee5fa9e	515f7d0d4fce41c752fc253acf30707c3be2531e	2024-03-08T17:31:00-05:00	compilade	llama : support Mamba Selective State Space Models (#5328)
M	README.md
M	common/common.cpp
M	convert-hf-to-gguf.py
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	llama.h

commit	515f7d0d4fce41c752fc253acf30707c3be2531e	76e868821a94072fbc87cb1fcca291694319eae8	2024-03-08T10:53:37-05:00	compilade	llama : fix quantization of shared token_embd (#5944)
M	llama.cpp

commit	76e868821a94072fbc87cb1fcca291694319eae8	e457fb3540e0aaec47cfde0abf784c213f9216ee	2024-03-08T12:25:04+01:00	Pierrick Hymbert	server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
M	examples/server/server.cpp
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py

commit	e457fb3540e0aaec47cfde0abf784c213f9216ee	af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd	2024-03-08T02:41:50-08:00	Don Mahurin	llama : assume tied weights if lm_head/output weights is missing (#5824)
M	llama.cpp

commit	af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd	581ed5c4fe3a8909aaa8313633ac443f471ba755	2024-03-08T12:40:02+02:00	Georgi Gerganov	server : fix EOS token detection with disabled cache (#5938)
M	examples/server/server.cpp

commit	581ed5c4fe3a8909aaa8313633ac443f471ba755	6cdabe652695167263c8b447520987b11856f7ca	2024-03-08T04:35:04-05:00	UEXTM.com	log : fix MSVC compile errors (#5643)
M	common/log.h

commit	6cdabe652695167263c8b447520987b11856f7ca	89fb735fcfd21781a8194b211cf32824beb3f71f	2024-03-07T16:32:38+02:00	Georgi Gerganov	llama-bench : add embeddings option (#5924)
M	examples/llama-bench/llama-bench.cpp

commit	89fb735fcfd21781a8194b211cf32824beb3f71f	55a2a900ff4a02fc33708ac7858d595d289a3f2a	2024-03-07T19:14:49+08:00	Neo Zhang Jianyu	Revert "[SYCL] fix error when set main gpu to non-zero (#5901)" (#5918)
M	ggml-sycl.cpp
M	ggml-sycl.h
M	llama.cpp

commit	55a2a900ff4a02fc33708ac7858d595d289a3f2a	2002bc96bf2cbf5ab981a17d7e994d817c9801f5	2024-03-07T19:42:39+09:00	Minsoo Cheong	server : add `/v1/completions` endpoint (#5914)
M	examples/server/server.cpp

commit	2002bc96bf2cbf5ab981a17d7e994d817c9801f5	ceca1aef0738b57951cd12c603c3477e75312dec	2024-03-07T11:41:53+02:00	Georgi Gerganov	server : refactor (#5882)
M	.github/workflows/server.yml
M	Makefile
M	examples/server-embd.py
M	examples/server/CMakeLists.txt
M	examples/server/README.md
D	examples/server/oai.hpp
M	examples/server/server.cpp
A	examples/server/tests/features/embeddings.feature
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt
M	examples/server/utils.hpp
M	llama.cpp

commit	ceca1aef0738b57951cd12c603c3477e75312dec	e04e04f8fad549bb0b3ec1c91f0413aeb08baf29	2024-03-07T16:34:31+08:00	Neo Zhang Jianyu	[SYCL] fix error when set main gpu to non-zero (#5901)
M	ggml-sycl.cpp
M	ggml-sycl.h
M	llama.cpp

commit	e04e04f8fad549bb0b3ec1c91f0413aeb08baf29	e25fb4b18fcedb9bed6be4585cf842e9a669b28b	2024-03-06T15:42:23-05:00	Jared Van Bortel	ggml : use SYS_get_cpu if SYS_getcpu is not defined (#5906)
M	ggml.c

commit	e25fb4b18fcedb9bed6be4585cf842e9a669b28b	1e35d619a6fb0b9c5e3dc955345980ff056ddbaf	2024-03-06T07:35:07Z	bobqianic	ggml : use `uint8x16_t` return type for `ggml_vqtbl1q_u8` (#5894)
M	ggml-quants.c

commit	1e35d619a6fb0b9c5e3dc955345980ff056ddbaf	8ced9f7e3225adb8501e9821ed1bbd92e3a5c7ae	2024-03-06T09:12:25+02:00	Georgi Gerganov	convert : remove AWQ remnants (#5768)
M	convert.py

commit	8ced9f7e3225adb8501e9821ed1bbd92e3a5c7ae	652ca2bded3c818320d92c70d2b67f64bdbff5e5	2024-03-06T12:08:32+08:00	Neo Zhang Jianyu	add wait() to make code stable (#5895)
M	ci/run.sh
M	ggml-sycl.cpp

commit	652ca2bded3c818320d92c70d2b67f64bdbff5e5	bd836944f826f07e19b7edcf994a78728da49c1c	2024-03-05T22:27:29+01:00	slaren	compare-llama-bench.py : remove mul_mat_q (#5892)
M	scripts/compare-llama-bench.py

commit	bd836944f826f07e19b7edcf994a78728da49c1c	3de31677d36aa4f82d4d99898902d7bcf398e666	2024-03-05T11:56:37-05:00	Jared Van Bortel	quants : use MM256_SET_M128I consistently to fix gcc 7 build (#5889)
M	ggml-quants.c

commit	3de31677d36aa4f82d4d99898902d7bcf398e666	82cb31eb93fd19b74115e0f0133225d1dfdbfdbc	2024-03-05T17:33:08+01:00	ExtReMLapin	grammars : blacklists character control set (#5888)
M	grammars/json.gbnf
M	grammars/json_arr.gbnf

commit	82cb31eb93fd19b74115e0f0133225d1dfdbfdbc	b1a4e994fde929300d4aeb1deb8320c59cb6edec	2024-03-05T15:56:24+02:00	Georgi Gerganov	Revert "grammars : don't allow to output unescaped new line in string (#5885)"
M	grammars/json.gbnf
M	grammars/json_arr.gbnf

commit	b1a4e994fde929300d4aeb1deb8320c59cb6edec	61d1c88e155515dd03940913a5707ea84a8b119b	2024-03-05T14:44:29+01:00	ExtReMLapin	grammars : don't allow to output unescaped new line in string (#5885)
M	grammars/json.gbnf
M	grammars/json_arr.gbnf

commit	61d1c88e155515dd03940913a5707ea84a8b119b	21b08674331e1ea1b599f17c5ca91f0ed173be31	2024-03-05T13:33:42+01:00	0cc4m	Vulkan Improvements (#5835)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml-vulkan.h
M	ggml_vk_generate_shaders.py
M	llama.cpp

commit	21b08674331e1ea1b599f17c5ca91f0ed173be31	6a87ac3a52668e117d97bcea07b529c93188b303	2024-03-05T16:08:35+08:00	Neo Zhang Jianyu	[SYCL] fix mul_mat fault in CI/unit-test (#5862)
M	ggml-sycl.cpp

commit	6a87ac3a52668e117d97bcea07b529c93188b303	29eee404746e4696143a4f3a642660a4793a15d8	2024-03-05T15:12:23+09:00	Minsoo Cheong	fix editorconfig check break (#5879)
M	.devops/nix/package.nix

commit	29eee404746e4696143a4f3a642660a4793a15d8	1d41d6f7c2a666eb9c18a686a4684c4b03289bf3	2024-03-04T19:23:06-08:00	Jeffrey Quesnelle	fix speculative decoding build on windows (#5874)
M	examples/speculative/speculative.cpp

commit	1d41d6f7c2a666eb9c18a686a4684c4b03289bf3	29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957	2024-03-05T02:33:08+01:00	hutli	nix: static build (#5814)
M	.devops/nix/package.nix

commit	29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957	e0843afe1b37890b631bc7d3d2da2ed36c862b91	2024-03-04T22:31:20+02:00	Georgi Gerganov	llama : fix embeddings (#5796)
M	README.md
M	common/common.cpp
M	examples/embedding/embedding.cpp
A	examples/server-embd.py
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	e0843afe1b37890b631bc7d3d2da2ed36c862b91	a1c6d96ed8f906aa1cda439f7386b1171a22bf9f	2024-03-04T21:50:50+02:00	Georgi Gerganov	flake : fix
M	convert-hf-to-gguf.py

commit	a1c6d96ed8f906aa1cda439f7386b1171a22bf9f	efd8533ef8d0752cef7119eb5dbee412c4dba270	2024-03-04T20:53:27+02:00	Georgi Gerganov	ggml : fix unknown status (#0)
M	ggml.c

commit	efd8533ef8d0752cef7119eb5dbee412c4dba270	9fa262734733573fa629ffc97dfcb971fe3f4832	2024-03-04T11:06:39+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	9fa262734733573fa629ffc97dfcb971fe3f4832	fe52be11e35358d2fd249f19d7ef5b6f9c08b16b	2024-03-04T10:05:42+01:00	Michael Podvitskiy	ggml : introduce ggml_status (ggml/750)
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-opencl.cpp
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h

commit	fe52be11e35358d2fd249f19d7ef5b6f9c08b16b	6d341ab6c53cd51f2921d986d0090cc8b049b39a	2024-03-05T05:26:55+11:00	Dane Madsen	cmake : handle cases where git index is not found in .git (#5844)
M	common/CMakeLists.txt

commit	6d341ab6c53cd51f2921d986d0090cc8b049b39a	4ffcdce2ff877ebb683cd217ea38faf20faa5ffe	2024-03-05T03:24:00+09:00	Minsoo Cheong	speculative : implement stochastic speculative sampling (#5625)
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/speculative/README.md
M	examples/speculative/speculative.cpp

commit	4ffcdce2ff877ebb683cd217ea38faf20faa5ffe	a0fc62661f0fd2a9edd10ae5617345bbbf972f42	2024-03-04T12:22:08+01:00	Xuan Son Nguyen	add alias for chat template (#5858)
M	examples/server/server.cpp
M	llama.cpp

commit	a0fc62661f0fd2a9edd10ae5617345bbbf972f42	7d43c585dc174bb586775c22c15e5db9242b5b4b	2024-03-04T10:40:04+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	7d43c585dc174bb586775c22c15e5db9242b5b4b	82f3e668adafba647de703f835991e91a96b5ac4	2024-03-03T20:23:52+08:00	leejet	add some new ops, fix some operators and add batch operations to certain operators. (ggml/747)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	82f3e668adafba647de703f835991e91a96b5ac4	5a51cc1bb4592f0d71f9af89cd08b11a066ba447	2024-03-04T03:08:19-05:00	DAN™	common : use LLAMA_DEFAULT_SEED (#5855)
M	common/common.h

commit	5a51cc1bb4592f0d71f9af89cd08b11a066ba447	67be2ce1015d070b3b2cd488bcb041eefb61de72	2024-03-04T02:57:20-05:00	DAN™	main : support special tokens as reverse/anti prompt (#5847)
M	examples/main/main.cpp

commit	67be2ce1015d070b3b2cd488bcb041eefb61de72	231ae28f078c3148d097b301f2145f1e3e816cc1	2024-03-03T14:26:18+01:00	slaren	cuda : fix data race in soft max (#5853)
M	ggml-cuda.cu

commit	231ae28f078c3148d097b301f2145f1e3e816cc1	475df1d6cf817060028d3ff763cb8097d4ec40d6	2024-03-03T12:44:03+02:00	Georgi Gerganov	readme : add API changes section
M	README.md

commit	475df1d6cf817060028d3ff763cb8097d4ec40d6	87c2e8b2797860a06af3d6c06b8488a8ff1a09ab	2024-03-03T04:40:27-06:00	Douglas Hanley	llama : allow for user specified embedding pooling type (#5849)
M	common/common.cpp
M	common/common.h
M	convert-hf-to-gguf.py
M	llama.cpp
M	llama.h

commit	87c2e8b2797860a06af3d6c06b8488a8ff1a09ab	de9692a7d2db66e29e5cb373c6551acc49145ccd	2024-03-03T09:43:42+01:00	Nindaleth	gguf-dump : support i-quants (#5841)
M	gguf-py/gguf/constants.py

commit	de9692a7d2db66e29e5cb373c6551acc49145ccd	e6029348e86c3810d4435faee54ba822cb43e2ef	2024-03-03T03:41:55-05:00	compilade	llama : fix llama_copy_state_data with fragmented KV cache (#5840)
M	llama.cpp

commit	e6029348e86c3810d4435faee54ba822cb43e2ef	8ef969afcec1645d2d9c3ab1fc82263bba968989	2024-03-03T09:35:23+01:00	Pierrick Hymbert	ci : schedule slow server tests only on Release or on demand (#5839)
M	.github/workflows/server.yml

commit	8ef969afcec1645d2d9c3ab1fc82263bba968989	fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763	2024-03-03T08:48:36+01:00	Pierrick Hymbert	server : init http requests thread pool with --parallel if set (#5836)
M	examples/server/README.md
M	examples/server/server.cpp

commit	fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763	9731134296af3a6839cd682e51d9c2109a871de5	2024-03-03T06:11:31+02:00	Georgi Gerganov	flake.lock: Update (#5842)
M	flake.lock

commit	9731134296af3a6839cd682e51d9c2109a871de5	4a6e2d6142ab815c964924896891e9ab3e050632	2024-03-02T22:00:14+01:00	Pierrick Hymbert	server: tests: passkey challenge /  self-extend with context shift demo (#5832)
M	.github/workflows/server.yml
M	examples/server/server.cpp
M	examples/server/tests/README.md
M	examples/server/tests/features/environment.py
M	examples/server/tests/features/issues.feature
M	examples/server/tests/features/parallel.feature
A	examples/server/tests/features/passkey.feature
M	examples/server/tests/features/security.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/features/wrong_usages.feature
M	examples/server/tests/requirements.txt
M	examples/server/tests/tests.sh
M	examples/server/utils.hpp

commit	4a6e2d6142ab815c964924896891e9ab3e050632	494c87032613e31c0be99b2735e732871f2c4e4d	2024-03-02T20:52:25+01:00	Michael Podvitskiy	llama : add abort_callback to interrupt computation (#5409)
M	llama.cpp
M	llama.h

commit	494c87032613e31c0be99b2735e732871f2c4e4d	4d4d2366fc9c54d4a275065cfe9299c6cf7c5b78	2024-03-02T20:00:49+02:00	Georgi Gerganov	ggml : fix IQ3_S AVX implementation (#5834)
M	ggml-quants.c

commit	4d4d2366fc9c54d4a275065cfe9299c6cf7c5b78	c7a0ad8ec9ebb5ddb1c1c80c82f2ee041c525d47	2024-03-02T12:27:26-05:00	Jared Van Bortel	convert : automatically fall back to HfVocab if tokenizer.model doesn't exist (#5821)
M	README.md
M	convert-llama-ggml-to-gguf.py
M	convert.py
M	examples/infill/infill.cpp

commit	c7a0ad8ec9ebb5ddb1c1c80c82f2ee041c525d47	bbde6eb2561153aabbdfac5001c690fe00cad639	2024-03-02T12:21:47-05:00	Jared Van Bortel	convert-hf : make model class definitions self-contained (#5825)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/gguf_writer.py

commit	bbde6eb2561153aabbdfac5001c690fe00cad639	ef2cd694c4155fbf25bae61c5178c47eb3676dba	2024-03-02T17:00:51+02:00	Kawrakow	ggml : IQ3_S improvements (#5829)
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml-quants.c

commit	ef2cd694c4155fbf25bae61c5178c47eb3676dba	6c32d8c7ad8ba7b6ad2a162e929a21dd04fcdca0	2024-03-02T16:54:08+02:00	Georgi Gerganov	scripts : add pod-llama.sh
A	scripts/pod-llama.sh

commit	6c32d8c7ad8ba7b6ad2a162e929a21dd04fcdca0	802da0091ba646ecf02e1a8fae2da0b8e76409bd	2024-03-02T15:19:09+01:00	Xuan Son Nguyen	llama : refactor internal quantization functions (#5830)
M	llama.cpp

commit	802da0091ba646ecf02e1a8fae2da0b8e76409bd	715641391dda1ff9762dc5d99d9a30acce99f2c6	2024-03-02T08:42:56-05:00	compilade	llama : fix segfault from unknown model arch name (#5820)
M	llama.cpp

commit	715641391dda1ff9762dc5d99d9a30acce99f2c6	9bf297a02bfbd474e51912409a470dd797e2fe13	2024-03-02T19:49:30+08:00	Neo Zhang Jianyu	Support multiple GPUs (split mode) on SYCL backend (#5806)
M	README-sycl.md
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/sycl/ls-sycl-device.cpp
M	examples/sycl/run-llama2.sh
M	ggml-sycl.cpp
M	ggml-sycl.h
M	llama.cpp

commit	9bf297a02bfbd474e51912409a470dd797e2fe13	cb5e8f7fc4ee57d4bcccafbe04a82cededd35486	2024-03-02T00:11:06-05:00	crasm	workflows : remove nocleanup arg for check-requirements.sh (#5826)
M	.github/workflows/python-check-requirements.yml

commit	cb5e8f7fc4ee57d4bcccafbe04a82cededd35486	da3b9ba2b710c0f8b44398a0eb9e5a7ae2ad967a	2024-03-02T04:48:26+05:30	Tushar	build(nix): Introduce flake.formatter for `nix fmt` (#5687)
M	.devops/nix/sif.nix
M	flake.nix

commit	da3b9ba2b710c0f8b44398a0eb9e5a7ae2ad967a	c29af7e2252d288f2ea58a7d437c1cb7c0abf160	2024-03-01T22:51:12+01:00	nold	convert-hf-to-gguf : require einops for InternLM2ForCausalLM (#5792)
M	requirements/requirements-convert-hf-to-gguf.txt

commit	c29af7e2252d288f2ea58a7d437c1cb7c0abf160	38d16b142624bdd7c41d9955752b7f7b59c5e048	2024-03-02T01:00:46+05:30	Sourab Mangrulkar	llama : add StarCoder2 support (#5795)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	38d16b142624bdd7c41d9955752b7f7b59c5e048	c2224f003bf9cf558b1a3c57033563e11a4de9a5	2024-03-01T20:00:58+02:00	Georgi Gerganov	server : remove api_like_OAI.py proxy script (#5808)
M	README.md
M	examples/server/README.md
D	examples/server/api_like_OAI.py

commit	c2224f003bf9cf558b1a3c57033563e11a4de9a5	e7433867288d2f142cffe596f3751bda5d7ee2c7	2024-03-01T18:00:00+01:00	ddpasa	ggml-vulkan: fix VULKAN_CHECK_RESULTS flag, which was previously broken (#5813)
M	ggml-vulkan.cpp

commit	e7433867288d2f142cffe596f3751bda5d7ee2c7	f49a5356865ced0eca1df9f9d84631dfef71b9dc	2024-03-01T06:08:08-08:00	kunal-vaishnavi	gemma : fix bfloat16 -> float16 conversion issue (#5810)
M	convert-hf-to-gguf.py

commit	f49a5356865ced0eca1df9f9d84631dfef71b9dc	3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b6	2024-03-01T22:48:56+09:00	Miwa / Ensan	common : fix flag `--logits-all` to `--all-logits` (#5805)
M	common/common.cpp

commit	3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b6	9600d59e010c18f5872580a21734ea1bf1968d04	2024-03-01T12:39:06+01:00	Pierrick Hymbert	llama : cleanup unused mmq flags (#5772)
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/llama-bench/README.md
M	examples/llama-bench/llama-bench.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h
M	scripts/compare-llama-bench.py

commit	9600d59e010c18f5872580a21734ea1bf1968d04	5cb02b4a012bb16c6c699c0c62c05ffa653eee0f	2024-03-01T03:15:36-06:00	Douglas Hanley	unicode : switch to multimap based nfd_map (#5799)
M	llama.cpp
M	unicode.h

commit	5cb02b4a012bb16c6c699c0c62c05ffa653eee0f	6ea0f010ff6967034528d9e0b8330b9b0f0b7c13	2024-03-01T10:08:08+01:00	Pierrick Hymbert	server: allow to override threads server pool with --threads-http (#5794)
M	examples/server/README.md
M	examples/server/server.cpp

commit	6ea0f010ff6967034528d9e0b8330b9b0f0b7c13	f105471ef6aa4727afac8240da398590d7277f45	2024-03-01T08:54:53Z	Eve	ci : add Ubuntu 22 Vulkan CI run (#5789)
M	.github/workflows/build.yml

commit	f105471ef6aa4727afac8240da398590d7277f45	38d152160898b0173ffe4dc7df5daadcbd2eceb0	2024-03-01T09:59:43+02:00	Georgi Gerganov	server : fix newlines in help (#5785)
M	examples/server/server.cpp

commit	38d152160898b0173ffe4dc7df5daadcbd2eceb0	052051d8ae4639a1c3c61e7da3237bcc572469d4	2024-03-01T07:36:47Z	AidanBeltonS	[SYCL] Use batched mul_mat pathway (#5591)
M	ggml-sycl.cpp

commit	052051d8ae4639a1c3c61e7da3237bcc572469d4	d5ab29757ebc59a30f03e408294ec20628a6374e	2024-02-29T21:42:11+01:00	Xuan Son Nguyen	Server: normalize naming (#5779)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	d5ab29757ebc59a30f03e408294ec20628a6374e	87c91c07663b707e831c59ec373b5e665ff9d64a	2024-02-29T00:17:23-08:00	Marcus Dunn	llama : constified `llama_set_state_data`'s `src` (#5774)
M	llama.cpp
M	llama.h

commit	87c91c07663b707e831c59ec373b5e665ff9d64a	317709b2a81dbaf87850202686ec5bb2602a504e	2024-02-28T21:44:21+02:00	Georgi Gerganov	ci : reduce 3b ppl chunks to 1 to avoid timeout (#5771)
M	ci/run.sh

commit	317709b2a81dbaf87850202686ec5bb2602a504e	08c5ee87e4cceb603ecceac90734fcdade57311b	2024-02-28T19:33:37Z	Eve	make portability_enumeration_ext apple only (#5757)
M	ggml-vulkan.cpp

commit	08c5ee87e4cceb603ecceac90734fcdade57311b	78aacf36344df724cdca9f1e1af849b2d2519cb8	2024-02-28T18:43:38+02:00	Georgi Gerganov	llama : remove deprecated API (#5770)
M	llama.cpp
M	llama.h

commit	78aacf36344df724cdca9f1e1af849b2d2519cb8	8c0e8f4e73e275756ad69f9c99b26ead085ca9f0	2024-02-28T17:36:53+02:00	Georgi Gerganov	awq-py : remove (#5768)
D	awq-py/README.md
D	awq-py/awq/apply_awq.py
D	awq-py/requirements.txt

commit	8c0e8f4e73e275756ad69f9c99b26ead085ca9f0	2774b0c97427ee3ad3e2ee121354d078794e89d9	2024-02-28T11:17:32+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	2774b0c97427ee3ad3e2ee121354d078794e89d9	5f706718566e3a5147916dc381f3b99de0ffad47	2024-02-25T20:41:35+01:00	slaren	add google magika inference example (ggml/748)
M	ggml.c

commit	5f706718566e3a5147916dc381f3b99de0ffad47	a693bea1e6762a17b78b6ddf4611e54136941ea2	2024-02-24T11:27:36-05:00	UEXTM.com	Introduce backend GUIDs (ggml/743)
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-kompute.cpp
M	ggml-metal.m
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h

commit	a693bea1e6762a17b78b6ddf4611e54136941ea2	adcb12a9bad87bc96f2f158c95892b3d04aa7ffb	2024-02-28T09:55:37+01:00	Xuan Son Nguyen	server : hit Ctrl+C twice to exit (#5734)
M	examples/server/server.cpp

commit	adcb12a9bad87bc96f2f158c95892b3d04aa7ffb	177628bfd85565070916ad66a5ac4071ee0527d8	2024-02-28T03:52:56-05:00	compilade	llama : fix non-quantization of expert gating tensors (#5754)
M	llama.cpp

commit	177628bfd85565070916ad66a5ac4071ee0527d8	6c4416868df2e5455da7d20547f62bcf9735ba8e	2024-02-28T02:51:11-06:00	Douglas Hanley	llama : improve BERT tokenization (#5740)
M	llama.cpp
M	unicode.h

commit	6c4416868df2e5455da7d20547f62bcf9735ba8e	efc72253f7987ed7bdc8bde9d9fa5c7cac2f6292	2024-02-28T09:39:39+01:00	Daniel Bevenius	readme : add link to LLaVA 1.6 models (#5758)
M	README.md

commit	efc72253f7987ed7bdc8bde9d9fa5c7cac2f6292	7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af	2024-02-28T01:39:15-07:00	Jorge A	server : add "/chat/completions" alias for "/v1/...` (#5722)
M	examples/server/server.cpp
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/steps/steps.py

commit	7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af	cb49e0f8c906e5da49e9f6d64a57742a9a241c6a	2024-02-28T10:37:02+02:00	Kawrakow	ggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760)
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c

commit	cb49e0f8c906e5da49e9f6d64a57742a9a241c6a	0becb22ac05b6542bd9d5f2235691aa1d3d4d307	2024-02-27T19:16:49+02:00	Kawrakow	Attempt to fix android build (#5752)
M	ggml-quants.c

commit	0becb22ac05b6542bd9d5f2235691aa1d3d4d307	c24a2a6e6005e5d424301525a42ba45a4a362d30	2024-02-27T16:34:24+02:00	Kawrakow	IQ4_XS: a 4.25 bpw quantization (#5747)
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	c24a2a6e6005e5d424301525a42ba45a4a362d30	1f30b7a9f1b86baa455072d3182b9ebeee0cd845	2024-02-27T07:22:45-06:00	Engininja2	cuda : replace remaining shfl_xor with calls to warp_reduce functions (#5744)
M	ggml-cuda.cu

commit	1f30b7a9f1b86baa455072d3182b9ebeee0cd845	9d533a77d0c3850ce09d736bc1baa67fd6ad27b3	2024-02-27T06:50:18-06:00	Engininja2	ggml-quants : fix avx2 iq1_s vec_dot when compiled with gcc (#5742)
M	ggml-quants.c

commit	9d533a77d0c3850ce09d736bc1baa67fd6ad27b3	cbbd1efa06f8c09f9dff58ff9d9af509cc4c152b	2024-02-27T14:35:51+02:00	Georgi Gerganov	llama : fix defrag bugs + add parameter (#5735)
M	common/common.cpp
M	common/common.h
M	examples/passkey/passkey.cpp
M	llama.cpp
M	llama.h

commit	cbbd1efa06f8c09f9dff58ff9d9af509cc4c152b	b11a93df41921846a10628a7c306d5c82a549939	2024-02-27T10:03:06+08:00	le.chang	Makefile: use variables for cublas (#5689)
M	Makefile

commit	b11a93df41921846a10628a7c306d5c82a549939	a33e6a0d2a66104ea9a906bdbf8a94d050189d91	2024-02-26T23:15:48+01:00	Xuan Son Nguyen	fix server hangs on empty prompt (#5733)
M	examples/server/server.cpp

commit	a33e6a0d2a66104ea9a906bdbf8a94d050189d91	47bb7b48c7cec9d8f57d56812ce811ec130b89a3	2024-02-26T18:28:38+02:00	Kawrakow	Adding IQ2_S and IQ2_M to complete coverage of the 2-3 bit quantization range (#5721)
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp
M	tests/test-quantize-fns.cpp

commit	47bb7b48c7cec9d8f57d56812ce811ec130b89a3	c4d7f8178608440506e5489bae0109e4ca12e44a	2024-02-26T15:36:38+01:00	Johannes Gäßler	CUDA: fix DEBUG_CUDA_MALLOC (#5729)
M	ggml-cuda.cu

commit	c4d7f8178608440506e5489bae0109e4ca12e44a	e849078c6e09e72fdd2c95ba61f5fba9a7b2d9ef	2024-02-26T17:15:28+03:00	Artem	readme : update ui list (#5731)
M	README.md

commit	e849078c6e09e72fdd2c95ba61f5fba9a7b2d9ef	67fd33132fab93e6c2087bd6fa656a8a57419efa	2024-02-26T14:02:11Z	AidanBeltonS	[SYCL] Add support for soft_max ALiBi (#5639)
M	ggml-sycl.cpp
M	llama.cpp

commit	67fd33132fab93e6c2087bd6fa656a8a57419efa	4804215cb833841ffb15a710a16b77ca0a29eb4b	2024-02-26T14:02:12+02:00	Georgi Gerganov	unicode : reuse iterator (#5726)
M	unicode.h

commit	4804215cb833841ffb15a710a16b77ca0a29eb4b	8a533f0d9078396ebaee9ba213038a1322976dee	2024-02-26T11:41:34+01:00	Pierrick Hymbert	server: CI fix trailing space (#5728)
M	.github/workflows/server.yml

commit	8a533f0d9078396ebaee9ba213038a1322976dee	269de86ba073b5dc9ce687c11a3bc4d7d873b962	2024-02-26T09:56:10+01:00	Pierrick Hymbert	server: CI tests reduce build matrix (#5725)
M	.github/workflows/server.yml

commit	269de86ba073b5dc9ce687c11a3bc4d7d873b962	c39373398803c669056304090050fe3f44b41bf9	2024-02-26T08:30:17+02:00	Georgi Gerganov	llama : fix Gemma rope type (#5691)
M	llama.cpp

commit	c39373398803c669056304090050fe3f44b41bf9	e3965cf35aac00d4e24998c8a3d0093ae1d98bd3	2024-02-25T00:17:11Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	e3965cf35aac00d4e24998c8a3d0093ae1d98bd3	8b350356b28f782deab63d8b0e9ae103ceb25fcd	2024-02-25T22:48:33+01:00	Pierrick Hymbert	server: tests - slow inference causes timeout on the CI (#5715)
M	common/sampling.cpp
M	examples/server/tests/features/steps/steps.py

commit	8b350356b28f782deab63d8b0e9ae103ceb25fcd	bf08e00643fd529f748f0a858fd79f3061e3fa18	2024-02-25T21:46:29+01:00	Pierrick Hymbert	server: docs - refresh and tease a little bit more the http server (#5718)
M	README.md
M	examples/server/README.md

commit	bf08e00643fd529f748f0a858fd79f3061e3fa18	f7625019c51ca437a5840576d92362cfa710e4a2	2024-02-25T22:12:24+02:00	Georgi Gerganov	llama : refactor k-shift implementation + KV defragmentation (#5691)
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	examples/passkey/passkey.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	f7625019c51ca437a5840576d92362cfa710e4a2	abbabc5e51d0d4656b438aec10b7fae9479ef37d	2024-02-25T13:43:50-05:00	compilade	server : fix crash when system prompt is bigger than batch size (#5714)
M	examples/server/server.cpp

commit	abbabc5e51d0d4656b438aec10b7fae9479ef37d	f1a98c52546d009f742bdec2154c2a314ea950a6	2024-02-25T19:43:00+01:00	Radosław Gryta	ggml-quants : provide ggml_vqtbl1q_u8 for 64bit compatibility (#5711)
M	.github/workflows/build.yml
M	examples/llama.android/app/build.gradle.kts
M	ggml-quants.c

commit	f1a98c52546d009f742bdec2154c2a314ea950a6	7d548a1827f6fc6aece6db74c9d112da42c40d68	2024-02-26T00:46:49+08:00	kwin1412	make : fix nvcc version is empty (#5713)
M	Makefile

commit	7d548a1827f6fc6aece6db74c9d112da42c40d68	930b1780269a69948d106e2d1b838ab7661f679a	2024-02-25T10:57:34-05:00	Ashok Gelal	readme : add Msty to UI list (#5618)
M	README.md

commit	930b1780269a69948d106e2d1b838ab7661f679a	d52d7819b8ced70c642a88a59da8c78208dc58ec	2024-02-25T13:50:32+01:00	Pierrick Hymbert	server: logs - unified format and --log-format option (#5700)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/README.md
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/utils.hpp

commit	d52d7819b8ced70c642a88a59da8c78208dc58ec	12894088170f62e4cad4f8d6a3043c185b414bab	2024-02-25T13:49:43+01:00	Pierrick Hymbert	server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/tests/features/environment.py
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py
M	examples/server/tests/requirements.txt
M	examples/server/utils.hpp

commit	12894088170f62e4cad4f8d6a3043c185b414bab	ab336a9d5e5352ecdcdf4c12d2d54cf4ef82ce31	2024-02-25T11:53:11+01:00	Radosław Gryta	cmake : fix compilation for Android armeabi-v7a (#5702)
M	CMakeLists.txt

commit	ab336a9d5e5352ecdcdf4c12d2d54cf4ef82ce31	69917dfa55674c608360638bb4d6a12a315e2810	2024-02-25T12:09:09+02:00	Georgi Gerganov	code : normalize enum names (#5697)
M	common/common.cpp
M	common/common.h
M	common/train.cpp
M	examples/baby-llama/baby-llama.cpp
M	examples/finetune/finetune.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava.cpp
M	examples/server/server.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-opencl.cpp
M	ggml-sycl.cpp
M	ggml-vulkan.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp
M	tests/test-opt.cpp

commit	69917dfa55674c608360638bb4d6a12a315e2810	9e359a4f47c1b2dceb99e29706c9f7403d32ab5e	2024-02-25T10:54:04+01:00	Anas Ahouzi	py : fix StableLM conversion after config.json changes (#5703)
M	convert-hf-to-gguf.py

commit	9e359a4f47c1b2dceb99e29706c9f7403d32ab5e	4c4cb30736582cacb1a164a9d4bc8e17b1014be7	2024-02-24T19:16:04+01:00	Pierrick Hymbert	server: continue to update other slots on embedding concurrent request (#5699)
M	examples/server/server.cpp
M	examples/server/tests/features/issues.feature
M	examples/server/tests/features/parallel.feature
M	examples/server/tests/features/server.feature
M	examples/server/tests/features/steps/steps.py

commit	4c4cb30736582cacb1a164a9d4bc8e17b1014be7	525213d2f5da1eaf4b922b6b792cb52b2c613368	2024-02-24T16:23:52+02:00	Kawrakow	IQ3_S: a much better alternative to Q3_K (#5676)
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp
M	tests/test-quantize-fns.cpp

commit	525213d2f5da1eaf4b922b6b792cb52b2c613368	fd43d66f46ee3b5345fb8a74a252d86ccd34a409	2024-02-24T12:28:55+01:00	Pierrick Hymbert	server: init functional tests (#5566)
M	.github/ISSUE_TEMPLATE/bug.md
A	.github/workflows/server.yml
M	examples/server/README.md
M	examples/server/server.cpp
A	examples/server/tests/README.md
A	examples/server/tests/features/environment.py
A	examples/server/tests/features/issues.feature
A	examples/server/tests/features/parallel.feature
A	examples/server/tests/features/security.feature
A	examples/server/tests/features/server.feature
A	examples/server/tests/features/steps/steps.py
A	examples/server/tests/features/wrong_usages.feature
A	examples/server/tests/requirements.txt
A	examples/server/tests/tests.sh

commit	fd43d66f46ee3b5345fb8a74a252d86ccd34a409	54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea	2024-02-23T19:31:54Z	AlpinDale	server : add KV cache quantization options (#5684)
M	examples/server/server.cpp

commit	54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea	15499eb94227401bdc8875da6eb85c15d37068f7	2024-02-23T13:39:14-05:00	Jared Van Bortel	convert : fix missing ftype for gemma (#5690)
M	convert-hf-to-gguf.py

commit	15499eb94227401bdc8875da6eb85c15d37068f7	96633eeca1265ed03e57230de54032041c58f9cd	2024-02-22T17:05:23-05:00	Jared Van Bortel	mpt : do not duplicate token_embd.weight on disk (#5670)
M	convert-hf-to-gguf.py
M	llama.cpp

commit	96633eeca1265ed03e57230de54032041c58f9cd	847eedbdb2d1ebf14ef56eb507d4b4b975510908	2024-02-22T23:23:46+02:00	Georgi Gerganov	gemma : use more bits for the token_embd.weight tensor (#5650)
M	llama.cpp

commit	847eedbdb2d1ebf14ef56eb507d4b4b975510908	7e4f339c404dbe029d4a117c03b37a9bf646cf0e	2024-02-22T23:22:48+02:00	Georgi Gerganov	py : add Gemma conversion from HF models (#5647)
M	convert-hf-to-gguf.py
M	llama.cpp

commit	7e4f339c404dbe029d4a117c03b37a9bf646cf0e	334f76fa385ed81095165e5ae068756214893901	2024-02-22T23:21:39+02:00	Georgi Gerganov	ggml : always define ggml_fp16_t as uint16_t (#5666)
M	ggml-cuda.cu
M	ggml-impl.h
M	ggml-quants.c
M	ggml.c
M	ggml.h

commit	334f76fa385ed81095165e5ae068756214893901	efd56b1c2139d50b9b4381a212feb75d69598fda	2024-02-22T23:21:05+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	efd56b1c2139d50b9b4381a212feb75d69598fda	201294ae177b308fb3a99dc504dd6d27e8afa907	2024-02-22T18:31:40+02:00	Georgi Gerganov	ggml : 32-bit arm compat (whisper/1891)
M	ggml-quants.c

commit	201294ae177b308fb3a99dc504dd6d27e8afa907	5a9e2f60ba3d8362ba17c77ac3092906d49b813f	2024-02-22T19:44:10Z	Someone	nix: init singularity and docker images (#5056)
A	.devops/nix/docker.nix
M	.devops/nix/scope.nix
A	.devops/nix/sif.nix

commit	5a9e2f60ba3d8362ba17c77ac3092906d49b813f	373ee3fbbabc4c1508eed4f5c3795b23a20939a3	2024-02-22T20:13:25+02:00	Georgi Gerganov	py : minor fixes (#5668)
M	convert-hf-to-gguf.py

commit	373ee3fbbabc4c1508eed4f5c3795b23a20939a3	4cb4d8b22d4fda971621a68c570ce84d66897c37	2024-02-22T19:10:21+01:00	Xuan Son Nguyen	Add Gemma chat template (#5665)
M	llama.cpp
M	tests/test-chat-template.cpp

commit	4cb4d8b22d4fda971621a68c570ce84d66897c37	3a03541cedea474fa9d41214484cc3fbcf468a9e	2024-02-22T16:32:09Z	Someone	workflows: nix: hardcode cachix ids, build unconditionally (#5663)
M	.github/workflows/nix-ci-aarch64.yml
M	.github/workflows/nix-ci.yml

commit	3a03541cedea474fa9d41214484cc3fbcf468a9e	56d03d92be57f5880b9ed94542d87bb6effae31f	2024-02-22T13:54:03+02:00	Georgi Gerganov	minor : fix trailing whitespace (#5638)
M	llama.cpp

commit	56d03d92be57f5880b9ed94542d87bb6effae31f	a46f50747b2028f7f9c9883b26bfba12bf92556e	2024-02-22T10:35:54+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	a46f50747b2028f7f9c9883b26bfba12bf92556e	c5688c6250430d2b8e0259efcf26c16dfa4c1f46	2024-02-22T09:33:24+01:00	Xuan Son Nguyen	server : fallback to chatml, add AlphaMonarch chat template (#5628)
M	examples/server/server.cpp
M	llama.cpp
M	tests/test-chat-template.cpp

commit	c5688c6250430d2b8e0259efcf26c16dfa4c1f46	4ef245a92a968ba0f18a5adfd41e51980ce4fdf5	2024-02-22T08:27:32Z	Alexey Parfenov	server : clarify some params in the docs (#5640)
M	examples/server/README.md

commit	4ef245a92a968ba0f18a5adfd41e51980ce4fdf5	973053d8b0d04809836b3339a50f68d9c842de90	2024-02-22T18:15:13+10:00	Dat Quoc Nguyen	mpt : add optional bias tensors (#5638)
M	llama.cpp

commit	973053d8b0d04809836b3339a50f68d9c842de90	7c8bcc11dc61cf5930b70cd0168b84afcebe12a9	2024-02-22T00:42:09+01:00	slaren	llama : fix loading models with shared tok_embd and output (#5651)
M	llama.cpp

commit	7c8bcc11dc61cf5930b70cd0168b84afcebe12a9	7fe4678b0244ba7b03eae66ebeaa947e2770bb1a	2024-02-22T00:31:00+01:00	Xuan Son Nguyen	Add docs for llama_chat_apply_template (#5645)
M	examples/server/README.md
M	llama.h

commit	7fe4678b0244ba7b03eae66ebeaa947e2770bb1a	ba2135ccae7462470b3865c6e41d2e1d734eac05	2024-02-21T22:52:39+01:00	slaren	llama : fix session save/load with quantized KV (#5649)
M	llama.cpp

commit	ba2135ccae7462470b3865c6e41d2e1d734eac05	89febfed9322c8849520dc63c93ee4f5fd72556e	2024-02-21T22:18:23+01:00	slaren	gemma : allow offloading the output tensor (#5646)
M	llama.cpp

commit	89febfed9322c8849520dc63c93ee4f5fd72556e	5022cf242d689e15defd133f96c4345ad30c5d19	2024-02-21T10:33:54-05:00	Jared Van Bortel	examples : do not assume BOS when shifting context (#5622)
M	examples/main/main.cpp
M	examples/server/server.cpp

commit	5022cf242d689e15defd133f96c4345ad30c5d19	1ecea255ebb70750b52688393f37a63606b90e3f	2024-02-21T16:52:39+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	1ecea255ebb70750b52688393f37a63606b90e3f	a00a35cef93e057eace8351a667d14d152a91ebc	2024-02-21T15:47:48+01:00	Pierrick Hymbert	server: health: fix race condition on slots data using tasks queue (#5634)
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	a00a35cef93e057eace8351a667d14d152a91ebc	eccd7a26ddbff19e4b8805648f5f14c501957859	2024-02-21T15:39:10+01:00	Ettore Di Giacinto	readme : add LocalAI to the availables UI (#5629)
M	README.md

commit	eccd7a26ddbff19e4b8805648f5f14c501957859	c14f72db9c62d71d35eb1c141745c0bd0cb27b49	2024-02-21T16:17:10+02:00	Georgi Gerganov	sync : ggml (#5633)
M	ggml.c
M	scripts/sync-ggml.last

commit	c14f72db9c62d71d35eb1c141745c0bd0cb27b49	cc6cac08e38e32bf40bbe07e9e8f8f0130b5fd94	2024-02-21T15:39:54+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	cc6cac08e38e32bf40bbe07e9e8f8f0130b5fd94	580111d42b3b6ad0a390bfb267d6e3077506eb31	2024-02-21T14:36:57+01:00	Daniel Bevenius	llava : add --skip-unknown to 1.6 convert.py (#5632)
M	examples/llava/README.md
M	examples/llava/llava-surgery-v2.py

commit	580111d42b3b6ad0a390bfb267d6e3077506eb31	88c46cbdac05cebd936511b1d3c74112e721615f	2024-02-21T05:08:22-08:00	postmasters	llama : add `gemma` model (#5631)
M	README.md
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	88c46cbdac05cebd936511b1d3c74112e721615f	a14679cc30c785e75d38028bae6ec39c6209ddef	2024-02-21T17:52:06+08:00	Meng, Hengyu	[SYCL] conext add name (#5624)
M	ggml-sycl.cpp

commit	a14679cc30c785e75d38028bae6ec39c6209ddef	6560bed3f066c876682464762cad90f1e28e3f1b	2024-02-21T11:39:52+02:00	Kawrakow	IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590)
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	6560bed3f066c876682464762cad90f1e28e3f1b	06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df	2024-02-20T11:07:22-08:00	CJ Pais	server : support llava 1.6 (#5553)
M	Makefile
M	build.zig
M	examples/llava/llava.cpp
M	examples/llava/llava.h
M	examples/server/server.cpp

commit	06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df	4ed8e4fbef6a15afd993bfcd9ffa279841e18ef1	2024-02-20T20:06:17+01:00	slaren	make : fix debug build with CUDA (#5616)
M	Makefile

commit	4ed8e4fbef6a15afd993bfcd9ffa279841e18ef1	9c405c9f9a7cfd23511fd6b2de05dc72481119b4	2024-02-20T18:30:27+01:00	Daniel Bevenius	llava : add explicit instructions for llava-1.6 (#5611)
M	examples/llava/README.md

commit	9c405c9f9a7cfd23511fd6b2de05dc72481119b4	5207b3fbc500f89dfe528693e96540956dbaed96	2024-02-20T15:58:27+01:00	Xuan Son Nguyen	Server: use llama_chat_apply_template (#5593)
M	examples/server/oai.hpp
M	examples/server/server.cpp
M	examples/server/utils.hpp
M	llama.cpp

commit	5207b3fbc500f89dfe528693e96540956dbaed96	8dbbd75754d43ec7b4bbe42fb287cc2553fdf0e9	2024-02-20T21:00:23+11:00	Dane Madsen	readme : update UI list (#5605)
M	README.md

commit	8dbbd75754d43ec7b4bbe42fb287cc2553fdf0e9	c0a8c6db371cb3e4379900867b948879f5842201	2024-02-19T22:58:36-11:00	Haoxiang Fei	metal : add build system support for embedded metal library (#5604)
M	CMakeLists.txt
M	Makefile

commit	c0a8c6db371cb3e4379900867b948879f5842201	b9111bd209c7b11b0592450a6ed2e0ca545b2c84	2024-02-20T08:48:19+01:00	Pierrick Hymbert	server : health endpoint configurable failure on no slot (#5594)
M	examples/server/README.md
M	examples/server/server.cpp

commit	b9111bd209c7b11b0592450a6ed2e0ca545b2c84	633782b8d949f24b619e6c68ee37b5cc79167173	2024-02-20T07:01:25Z	AidanBeltonS	Update ggml_sycl_op_mul_mat_vec_q (#5502)
M	ggml-sycl.cpp

commit	633782b8d949f24b619e6c68ee37b5cc79167173	22f83f0c383e12106692b8afc224d61b8993a52c	2024-02-13T20:28:02Z	Mathijs de Bruin	nix: now that we can do so, allow MacOS to build Vulkan binaries
M	flake.nix

commit	22f83f0c383e12106692b8afc224d61b8993a52c	bb9dcd560a7e81265398b0d463c40f3e467daf19	2024-02-10T22:18:33+01:00	0cc4m	Enable Vulkan MacOS CI
M	.devops/nix/package.nix

commit	bb9dcd560a7e81265398b0d463c40f3e467daf19	f50db6ae0bdcb5f8593ca6ca46dfa03b177faa2f	2024-02-14T20:57:17+01:00	0cc4m	Refactor validation and enumeration platform checks into functions to clean up ggml_vk_instance_init()
M	ggml-vulkan.cpp

commit	f50db6ae0bdcb5f8593ca6ca46dfa03b177faa2f	d8c054517dc24f1316f3be12a98fff383e1e93e3	2024-02-10T22:14:52+01:00	0cc4m	Add check for VK_KHR_portability_enumeration for MoltenVK support
M	ggml-vulkan.cpp

commit	d8c054517dc24f1316f3be12a98fff383e1e93e3	42f664a3825dfde13a32c3577ab66d10c56f3aa6	2024-02-06T14:39:22Z	Mathijs de Bruin	Add preprocessor checks for Apple devices.
M	ggml-vulkan.cpp

commit	42f664a3825dfde13a32c3577ab66d10c56f3aa6	5dde5408978eda22242b87e22e306d1c2d1a5834	2024-02-03T18:00:11Z	Mathijs de Bruin	Resolve ErrorIncompatibleDriver with Vulkan on MacOS.
M	ggml-vulkan.cpp

commit	5dde5408978eda22242b87e22e306d1c2d1a5834	40c3a6c1e11040088b4a1ce0abc4651cb3011dd4	2024-02-03T17:56:46Z	Mathijs de Bruin	Allow for Vulkan build with Accelerate.
M	ggml.c

commit	40c3a6c1e11040088b4a1ce0abc4651cb3011dd4	f24ed14ee0ce28dfe98115c378b37da144912016	2024-02-19T23:40:26+01:00	slaren	cuda : ignore peer access already enabled errors (#5597)
M	ggml-cuda.cu

commit	f24ed14ee0ce28dfe98115c378b37da144912016	9d679f0fccd4030779ed3c7684a40122fe41806c	2024-02-19T15:54:12-05:00	Jared Van Bortel	make : pass CPPFLAGS directly to nvcc, not via -Xcompiler (#5598)
M	Makefile

commit	9d679f0fccd4030779ed3c7684a40122fe41806c	1387cf60f758efb218fa06b670182c38ff149b7b	2024-02-19T14:14:07Z	nopperl	examples : support minItems/maxItems in JSON grammar converter (#5039)
M	examples/json-schema-to-grammar.py

commit	1387cf60f758efb218fa06b670182c38ff149b7b	6fd413791a754598a54a366145960f2e27eec015	2024-02-19T15:23:17+02:00	Georgi Gerganov	llava : remove extra cont (#5587)
M	examples/llava/clip.cpp

commit	6fd413791a754598a54a366145960f2e27eec015	337c9cbd52918ae5fb9a9d9e25d7fae4e238c9f1	2024-02-19T14:02:36+01:00	slaren	llava : replace ggml_cpy with ggml_cont
M	examples/llava/clip.cpp

commit	337c9cbd52918ae5fb9a9d9e25d7fae4e238c9f1	a3145bdc305422973e25f0b066da6f469ed5dc45	2024-02-19T14:54:21+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	a3145bdc305422973e25f0b066da6f469ed5dc45	890559ab28e354052e16e770155ad007fd0856e8	2024-02-19T14:53:48+02:00	Georgi Gerganov	ggml-alloc : apply ggml/731
M	ggml-alloc.c

commit	890559ab28e354052e16e770155ad007fd0856e8	d0e3ce51f45bd6a646da1952d7e5d143a087db3e	2024-02-11T16:41:41+02:00	Didzis Gosko	metal : option to embed MSL source into compiled binary (whisper/1842)
M	ggml-metal.m

commit	d0e3ce51f45bd6a646da1952d7e5d143a087db3e	68a6b98b3c8af7e5baade3ee45fe1d2c7b9323a9	2024-02-19T14:45:41+02:00	Georgi Gerganov	ci : enable -Werror for CUDA builds (#5579)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu

commit	68a6b98b3c8af7e5baade3ee45fe1d2c7b9323a9	70d45af0efce9ed360e1858b827989d971dd9caf	2024-02-19T13:41:51+02:00	Georgi Gerganov	make : fix CUDA build (#5580)
M	Makefile

commit	70d45af0efce9ed360e1858b827989d971dd9caf	13e2c771aa4212cd5405cf310203848d50f7f859	2024-02-19T02:37:10-08:00	valiray	readme : fix typo in README-sycl.md (#5353)
M	README-sycl.md

commit	13e2c771aa4212cd5405cf310203848d50f7f859	f53119cec4f073b6d214195ecbe1fad3abdf2b34	2024-02-19T14:45:18+05:30	Abhilash Majumder	cmake : remove obsolete sycl compile flags (#5581)
M	CMakeLists.txt

commit	f53119cec4f073b6d214195ecbe1fad3abdf2b34	70847553963c85e86051d06df848236829f5f951	2024-02-19T10:34:10+02:00	Georgi Gerganov	minor : fix trailing whitespace (#5538)
M	llama.cpp

commit	70847553963c85e86051d06df848236829f5f951	4480542b2271ba1438f0daff8e5f3a74b1dc8609	2024-02-19T09:31:59+01:00	Daniel Bevenius	llava : avoid changing the original BakLLaVA model (#5577)
M	examples/llava/llava-surgery.py

commit	4480542b2271ba1438f0daff8e5f3a74b1dc8609	11b12de39bd787c0494da0cd405958fdfedc29c4	2024-02-19T03:25:38-05:00	NawafAlansari	baby-llama : allocate graphs in ggml_context (#5573)
M	examples/baby-llama/baby-llama.cpp

commit	11b12de39bd787c0494da0cd405958fdfedc29c4	3a9cb4ca6408c29423373dd6cd7aa78a58286c00	2024-02-19T09:23:37+01:00	Xuan Son Nguyen	llama : add llama_chat_apply_template() (#5538)
M	Makefile
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
A	tests/test-chat-template.cpp

commit	3a9cb4ca6408c29423373dd6cd7aa78a58286c00	769a716e30ba1da46f709df1c00727d6869d30e7	2024-02-19T09:04:45+01:00	slaren	cuda, metal : fix nans in soft_max (#5574)
M	ggml-cuda.cu
M	ggml-metal.metal

commit	769a716e30ba1da46f709df1c00727d6869d30e7	f0d1fafc029a056cd765bdae58dcaa12312e9879	2024-02-19T08:39:31+01:00	Mirko185	readme : update (#5572)
M	README.md

commit	f0d1fafc029a056cd765bdae58dcaa12312e9879	a0c2dad9d43456c677e205c6240a5f8afb0121ac	2024-02-18T23:38:32-08:00	bmwl	ggml : android and old glibc NUMA incompatibility bugfixes (#5557)
M	ggml.c

commit	a0c2dad9d43456c677e205c6240a5f8afb0121ac	14278f55d2e2c6a53022075c7f2719b71e1cd61d	2024-02-18T16:21:52-05:00	Jared Van Bortel	build : pass all warning flags to nvcc via -Xcompiler (#5570)
M	CMakeLists.txt
M	Makefile
M	scripts/get-flags.mk

commit	14278f55d2e2c6a53022075c7f2719b71e1cd61d	b1de96824bdbeb91ea458abcb3e5478690ad0727	2024-02-18T22:58:57+02:00	Georgi Gerganov	ggml : restore vec dot stride arg names (#5453)
M	ggml-quants.c

commit	b1de96824bdbeb91ea458abcb3e5478690ad0727	7ad554f90e735cf2a0f612ce44f9aa4fad6ae46a	2024-02-18T22:39:30+02:00	Georgi Gerganov	ci : fix wikitext url + compile warnings (#5569)
M	README.md
M	ci/run.sh
M	examples/perplexity/perplexity.cpp
M	ggml-quants.c
M	scripts/get-wikitext-2.sh

commit	7ad554f90e735cf2a0f612ce44f9aa4fad6ae46a	5ee99c32f5e47c8d32634eff9a47fb32a24c276b	2024-02-18T21:39:58+02:00	Georgi Gerganov	metal : fix unused warnings (#0)
M	ggml-metal.metal

commit	5ee99c32f5e47c8d32634eff9a47fb32a24c276b	c145f8a132b2fe1d1e65987faddbd9a40bef7a12	2024-02-18T11:11:16-08:00	Robey Holderith	common, server : surface min_keep as its own parameter (#5567)
M	common/common.cpp
M	common/sampling.cpp
M	common/sampling.h
M	examples/server/README.md
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	c145f8a132b2fe1d1e65987faddbd9a40bef7a12	689a091bbe0537ee9abff3e15a1d74f5f3561165	2024-02-18T18:39:57+01:00	Pierrick Hymbert	server : slots monitoring endpoint (#5550)
M	examples/server/README.md
M	examples/server/server.cpp

commit	689a091bbe0537ee9abff3e15a1d74f5f3561165	f3f28c5395cd25b371617981b341616dbdd31e85	2024-02-18T19:38:06+02:00	Georgi Gerganov	sampling : do not set min_keep to n_probs (#5564)
M	common/sampling.cpp

commit	f3f28c5395cd25b371617981b341616dbdd31e85	e75c6279d1c8e7abb82a331f5de7124eed402de2	2024-02-18T19:17:00+02:00	Georgi Gerganov	cmake : fix GGML_USE_SYCL typo (#5555)
M	CMakeLists.txt

commit	e75c6279d1c8e7abb82a331f5de7124eed402de2	36376abe05a12a8cb3af548a4af9b8d0e2e69597	2024-02-18T17:31:28+01:00	Pierrick Hymbert	server : enhanced health endpoint (#5548)
M	examples/server/README.md
M	examples/server/server.cpp

commit	36376abe05a12a8cb3af548a4af9b8d0e2e69597	66c1968f7a2e895675425e875b6589f1233a1b52	2024-02-18T17:30:09+01:00	Pierrick Hymbert	server : --n-predict option document and cap to max value (#5549)
M	examples/server/README.md
M	examples/server/server.cpp

commit	66c1968f7a2e895675425e875b6589f1233a1b52	1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e	2024-02-18T08:23:16-08:00	Daniel Hiltgen	server : graceful server shutdown (#5244)
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e	5d3de51f972055702a1859186fe7acb8f0b43dc4	2024-02-18T18:21:52+02:00	Georgi Gerganov	common : fix ub (#5530)
M	common/common.cpp

commit	5d3de51f972055702a1859186fe7acb8f0b43dc4	fc0c8d286a533363a9a663510b62af85ffad58b3	2024-02-18T16:20:12Z	Herman Semenov	ggml, common, examples, tests : fixed type arguments in printf (#5528)
M	common/common.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/perplexity/perplexity.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	tests/test-grammar-parser.cpp
M	tests/test-llama-grammar.cpp

commit	fc0c8d286a533363a9a663510b62af85ffad58b3	bd2d4e393b2b7d2a1b2e201058e26017c9728ead	2024-02-18T17:19:23+01:00	Daniel Bevenius	llava : update surgery script to not remove tensors (#5536)
M	examples/llava/README.md
M	examples/llava/llava-surgery.py

commit	bd2d4e393b2b7d2a1b2e201058e26017c9728ead	c8e0d7efeb7634ecc2e9832e879ab9fca4510e71	2024-02-18T18:16:55+02:00	Kawrakow	1.5 bit quantization (#5453)
M	examples/quantize/quantize.cpp
M	ggml-backend.c
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	c8e0d7efeb7634ecc2e9832e879ab9fca4510e71	8f1be0d42f23016cb6819dbae01126699c4bd9bc	2024-02-18T00:17:07Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	8f1be0d42f23016cb6819dbae01126699c4bd9bc	6e4e973b2615f8d390b1c4f4a7e05a119078bb0f	2024-02-17T23:04:16+02:00	Georgi Gerganov	ggml : add ALiBi support for ggml_soft_max_ext (#5488)
M	ggml-alloc.c
M	ggml-backend.c
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	6e4e973b2615f8d390b1c4f4a7e05a119078bb0f	d250c9d61d4d9f7346930814cc4aef3f3673dc3e	2024-02-17T16:03:14-05:00	Ananta Bastola	ci : add an option to fail on compile warning (#3952)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	ci/run.sh
M	examples/export-lora/export-lora.cpp
M	ggml-backend.c
M	ggml-metal.m
M	ggml.c

commit	d250c9d61d4d9f7346930814cc4aef3f3673dc3e	5bf2b94dd4fb74378b78604023b31512fec55f8f	2024-02-17T18:28:37+02:00	clibdev	gitignore : update for CLion IDE (#5544)
M	.gitignore

commit	5bf2b94dd4fb74378b78604023b31512fec55f8f	d2819d5577b35507be83d0c3f4d2d3c0ab1488ca	2024-02-16T19:05:56+02:00	Georgi Gerganov	cmake : fix VULKAN and ROCm builds (#5525)
M	CMakeLists.txt
M	ggml-vulkan.cpp

commit	d2819d5577b35507be83d0c3f4d2d3c0ab1488ca	4cb072769804c77ab466bc8351c76ede9d5ba49d	2024-02-16T15:14:40+02:00	Georgi Gerganov	scripts : add helpers script for bench comparing commits (#5521)
A	scripts/compare-commits.sh

commit	4cb072769804c77ab466bc8351c76ede9d5ba49d	65085c713e14f78cdda6abc275b1a5d8c2b8ca15	2024-02-16T12:43:23Z	Herman Semenov	llava : removed excess free(NULL) operation (#5531)
M	examples/llava/llava.cpp

commit	65085c713e14f78cdda6abc275b1a5d8c2b8ca15	6dcc02d2444c779c18d49c364c5d5c5728b6b484	2024-02-16T11:45:48Z	Herman Semenov	llama : minor fixed return int value (#5529)
M	llama.cpp

commit	6dcc02d2444c779c18d49c364c5d5c5728b6b484	5f5808ca7b7f23a1fa7a77241842bb84a0e55108	2024-02-16T11:33:25Z	Alexey Parfenov	server : add "samplers" param to control the samplers order (#5494)
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/server/README.md
M	examples/server/server.cpp

commit	5f5808ca7b7f23a1fa7a77241842bb84a0e55108	f486f6e1e5e9d01603d9325ab3e05f1edb362a95	2024-02-16T11:00:56+01:00	Rőczey Barnabás	server : fix system prompt cli (#5516)
M	examples/server/server.cpp

commit	f486f6e1e5e9d01603d9325ab3e05f1edb362a95	60ed04cf82dc91ade725dd7ad53f0ee81f76eccf	2024-02-16T01:31:07-08:00	bmwl	ggml : add numa options (#5377)
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/beam-search/beam-search.cpp
M	examples/embedding/embedding.cpp
M	examples/imatrix/imatrix.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llama.android/app/src/main/cpp/llama-android.cpp
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llava/llava-cli.cpp
M	examples/lookahead/lookahead.cpp
M	examples/lookup/lookup.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/passkey/passkey.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	examples/tokenize/tokenize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-autorelease.cpp
M	tests/test-model-load-cancel.cpp
M	tests/test-tokenizer-0-falcon.cpp
M	tests/test-tokenizer-0-llama.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-llama.cpp

commit	60ed04cf82dc91ade725dd7ad53f0ee81f76eccf	594845aab1c6775877f6d9545a51dc0f8d0b3d77	2024-02-16T10:24:39+01:00	Daniel Bevenius	llava : fix clip-model-is-vision flag in README.md (#5509)
M	examples/llava/README.md

commit	594845aab1c6775877f6d9545a51dc0f8d0b3d77	4524290e87b8e107cc2b56e1251751546f4b9051	2024-02-16T09:57:55+02:00	Georgi Gerganov	ci : fix BERT model download and convert
M	ci/run.sh

commit	4524290e87b8e107cc2b56e1251751546f4b9051	c06e45d72983d9ace7b1535f7e7ea258d212169e	2024-02-15T11:21:49-06:00	Douglas Hanley	Use correct type of pooling for embedding models (#5500)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp
M	llama.h

commit	c06e45d72983d9ace7b1535f7e7ea258d212169e	9060a1e9dfca6038906e819be5fa42217f49028c	2024-02-15T18:49:08+02:00	Georgi Gerganov	clip : fix wrong loop condition
M	examples/llava/clip.cpp

commit	9060a1e9dfca6038906e819be5fa42217f49028c	9350a1cf21b1492c69b20175b73a419b897d6a3a	2024-02-15T16:49:01+01:00	slaren	cuda : print message when initialization fails (#5512)
M	ggml-cuda.cu

commit	9350a1cf21b1492c69b20175b73a419b897d6a3a	73122473ffd73030146276dbb85da7c8021a3ee4	2024-02-15T15:41:15+02:00	Georgi Gerganov	scripts : add hf.sh helper script (#5501)
A	scripts/hf.sh

commit	73122473ffd73030146276dbb85da7c8021a3ee4	0d4177126b0556e202efb85bf3f768be81076400	2024-02-15T14:14:37+01:00	Michaël de Vries	fix(gguf-py): special tokens are no longer skipped when add_<token>_token is set to false (#5487)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py

commit	0d4177126b0556e202efb85bf3f768be81076400	7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f	2024-02-15T09:01:57+01:00	Elbios	llava : fix memory management bug (#5491)
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/server/server.cpp

commit	7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f	704359e29985a06a389337a2617b7f3fa8eff908	2024-02-15T08:59:18+01:00	John	llaba : hotfix for llava-1.6 image number (#5495)
M	examples/llava/llava.cpp

commit	704359e29985a06a389337a2617b7f3fa8eff908	594fca3fefe27b8e95cfb1656eb0e160ad15a793	2024-02-15T17:11:15+11:00	Neuman Vong	vulkan: Find optimal memory type but with fallback (#5381)
M	ggml-vulkan.cpp

commit	594fca3fefe27b8e95cfb1656eb0e160ad15a793	ccbb277f4642fc0d84c72dbc0d51ed2df418d6ce	2024-02-14T16:15:49+01:00	Rune	readme : fix typo (#5490)
M	README.md

commit	ccbb277f4642fc0d84c72dbc0d51ed2df418d6ce	8084d554406b767d36b3250b3b787462d5dd626f	2024-02-14T15:49:42+01:00	John	llava : update README.md (#5489)
M	examples/llava/README.md

commit	8084d554406b767d36b3250b3b787462d5dd626f	aa2341298924ac89778252015efcb792f2df1e20	2024-02-14T11:49:01+03:00	Michael Podvitskiy	cmake : ARM intrinsics detection for MSVC (#5401)
M	CMakeLists.txt

commit	aa2341298924ac89778252015efcb792f2df1e20	f5ca054855dea83f424003162f26de376e5643f6	2024-02-14T08:38:35+01:00	John	llava : support v1.6 (#5267)
M	convert.py
M	examples/llava/README.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/convert-image-encoder-to-gguf.py
M	examples/llava/llava-cli.cpp
A	examples/llava/llava-surgery-v2.py
M	examples/llava/llava.cpp
M	examples/llava/llava.h
M	examples/server/server.cpp

commit	f5ca054855dea83f424003162f26de376e5643f6	6c00a066928b0475b865a2e3e709e2166e02d548	2024-02-13T15:44:25-06:00	AT	Early return for zero size calls to get_tensor. (#5482)
M	ggml-backend.c

commit	6c00a066928b0475b865a2e3e709e2166e02d548	ea9c8e11436ad50719987fa23a289c74b7b40d40	2024-02-13T18:56:38+01:00	John	gguf : add python reader example (#5216)
M	examples/CMakeLists.txt
A	gguf-py/examples/reader.py

commit	ea9c8e11436ad50719987fa23a289c74b7b40d40	c4e6dd59e45ef7b14f7763fb073b517395dc176c	2024-02-13T12:03:53-05:00	Jared Van Bortel	llama : add support for Nomic Embed (#5468)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	c4e6dd59e45ef7b14f7763fb073b517395dc176c	037259be689353081e7bae3c1ab4ab18e7fbe8c9	2024-02-13T18:18:16+02:00	Aarni Koskela	llama : allow raw byte in SPM vocabs; don't crash on nl 404 (#5478)
M	llama.cpp

commit	037259be689353081e7bae3c1ab4ab18e7fbe8c9	263978904c7472db1865409a7ff1129599f6a40b	2024-02-13T15:24:50+02:00	Aarni Koskela	llama : make load error reporting more granular (#5477)
M	llama.cpp

commit	263978904c7472db1865409a7ff1129599f6a40b	cf45252a7cfcb998bade46a886e20477cecc538a	2024-02-13T14:15:42+01:00	Daniel Bevenius	finetune : rename feed-forward tensors (w1/w2/w3) (#4839)
M	examples/finetune/README.md
M	examples/finetune/finetune.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	cf45252a7cfcb998bade46a886e20477cecc538a	03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc	2024-02-13T15:14:22+02:00	Georgi Gerganov	tests : multi-thread the tokenizer tests (#5474)
M	llama.cpp
M	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-llama.cpp
M	unicode.h

commit	03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc	ad014bba97ef6ef6c3e2f78b2fc463e91ae94579	2024-02-13T06:06:58-06:00	Douglas Hanley	llama : support batched embeddings (#5466)
M	convert-hf-to-gguf.py
M	examples/embedding/embedding.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp
M	llama.h

commit	ad014bba97ef6ef6c3e2f78b2fc463e91ae94579	49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8	2024-02-13T12:38:37+01:00	Johannes Gäßler	make: add error message for bad CUDA version (#5444)
M	Makefile

commit	49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8	99b8b43d7b185a6483f28cf798a2d968b2e16ca7	2024-02-13T13:01:29+02:00	Georgi Gerganov	bert : add tests + fix quantization (#5475)
M	ci/run.sh
M	llama.cpp

commit	99b8b43d7b185a6483f28cf798a2d968b2e16ca7	895407f31b358e3d9335e847d13f033491ec8a5b	2024-02-13T11:20:24+02:00	Georgi Gerganov	tests : disable moe test (#5473)
M	tests/test-backend-ops.cpp

commit	895407f31b358e3d9335e847d13f033491ec8a5b	099afc6274c859ca67146e725839f2d97a5ef313	2024-02-13T09:07:57+02:00	Kawrakow	ggml-quants : fix compiler warnings (shadow variable) (#5472)
M	ggml-quants.c

commit	099afc6274c859ca67146e725839f2d97a5ef313	df334a11251b81fd0b6a0e51e7146e0ba9e973f2	2024-02-12T20:14:39+02:00	Georgi Gerganov	llama : fix quantization when tensors are missing (#5423)
M	llama.cpp

commit	df334a11251b81fd0b6a0e51e7146e0ba9e973f2	dbd8828eb03b9aa8d0af7e4c533d3c2f5b38aba6	2024-02-12T19:54:29+02:00	Georgi Gerganov	swift : package no longer use ggml dependency (#5465)
M	Package.swift
A	spm-headers/ggml-alloc.h
A	spm-headers/ggml-backend.h
A	spm-headers/ggml.h

commit	dbd8828eb03b9aa8d0af7e4c533d3c2f5b38aba6	43fe07c1a4f3a58612e1d9543f7c6b556710f5d0	2024-02-13T01:29:57+08:00	Lee	py : fix persimmon `n_rot` conversion (#5460)
M	convert-persimmon-to-gguf.py

commit	43fe07c1a4f3a58612e1d9543f7c6b556710f5d0	4a46d2b7923be83d6019251671ee63aa1fa0d6bc	2024-02-12T20:22:05+05:30	Abhilash Majumder	ggml-sycl: Replace 3d ops with macro  (#5458)
M	ggml-sycl.cpp

commit	4a46d2b7923be83d6019251671ee63aa1fa0d6bc	3b169441dfe8e420f88d1592708cc2a871daadb9	2024-02-12T09:38:44+01:00	Daniel Bevenius	llava : remove prog parameter from ArgumentParser (#5457)
M	.github/workflows/python-lint.yml
M	examples/llava/convert-image-encoder-to-gguf.py

commit	3b169441dfe8e420f88d1592708cc2a871daadb9	3bdc4cd0f595a6096cca4a64aa75ffa8a3503465	2024-02-12T09:16:06+02:00	Georgi Gerganov	sync : ggml (#5452)
M	examples/export-lora/export-lora.cpp
M	examples/finetune/finetune.cpp
M	examples/llava/clip.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/sync-ggml.last

commit	3bdc4cd0f595a6096cca4a64aa75ffa8a3503465	2891c8aa9af17f4ff636ff3868bc34ff72b56e25	2024-02-11T19:08:39+01:00	Johannes Gäßler	CUDA: mul_mat_vec_q tiling, refactor mul mat logic (#5434)
M	ggml-cuda.cu

commit	2891c8aa9af17f4ff636ff3868bc34ff72b56e25	97a336507ed9b971d72262bec7e2b8b7016a054a	2024-02-11T10:21:38-06:00	Douglas Hanley	Add support for BERT embedding models (#5423)
M	.flake8
M	convert-hf-to-gguf.py
M	examples/embedding/embedding.cpp
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	llama.h

commit	97a336507ed9b971d72262bec7e2b8b7016a054a	c88c74f967028ae3d5ebade40ae586d20a961abc	2024-02-11T00:17:31Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	c88c74f967028ae3d5ebade40ae586d20a961abc	a803333a4e6fc534c93afe90d741bc2388bdec87	2024-02-11T15:12:00+01:00	Sergio López	vulkan: only use M-sized matmul on Apple GPUs (#5412)
M	ggml-vulkan.cpp

commit	a803333a4e6fc534c93afe90d741bc2388bdec87	684780141a08200ec98eba3e982dbafd1d0b5000	2024-02-11T13:43:31Z	Alexey Parfenov	common : use enums for sampler types (#5418)
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h

commit	684780141a08200ec98eba3e982dbafd1d0b5000	85910c5b30f6e268321be8df044f5528a6efac52	2024-02-11T13:38:14Z	Alexey Parfenov	server : allow to specify tokens as strings in logit_bias (#5003)
M	examples/server/README.md
M	examples/server/server.cpp

commit	85910c5b30f6e268321be8df044f5528a6efac52	139b62a839825ef20084ed75ed624db7a5ad554a	2024-02-11T15:35:50+02:00	Georgi Gerganov	main : ctrl+C print timing in non-interactive mode (#3873)
M	examples/main/main.cpp

commit	139b62a839825ef20084ed75ed624db7a5ad554a	0f2411f154db46780d3aaa3a0664691b2170c83f	2024-02-11T15:33:43+02:00	Georgi Gerganov	common : fix compile warning
M	common/sampling.cpp

commit	0f2411f154db46780d3aaa3a0664691b2170c83f	a07d0fee1f05c5c1dc49948ae1a3293db017275f	2024-02-11T15:33:01+02:00	Georgi Gerganov	ggml : fix compile warnings (unused vars) (#4966)
M	ggml-quants.c

commit	a07d0fee1f05c5c1dc49948ae1a3293db017275f	e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04	2024-02-11T07:22:33-06:00	snadampal	ggml : add mmla kernels for quantized GEMM (#4966)
M	common/common.cpp
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	pocs/vdot/q8dot.cpp
M	pocs/vdot/vdot.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04	907e08c1109f498b01036367804cff3082c44524	2024-02-11T12:44:51+01:00	Johannes Gäßler	lookup: add print for drafting performance (#5450)
M	examples/lookup/lookup.cpp

commit	907e08c1109f498b01036367804cff3082c44524	f026f8120f97090d34a52b3dc023c82e0ede3f7d	2024-02-11T11:16:22+01:00	Xuan Son Nguyen	server : add llama2 chat template (#5425)
M	examples/server/oai.hpp
M	examples/server/server.cpp
M	examples/server/utils.hpp

commit	f026f8120f97090d34a52b3dc023c82e0ede3f7d	cd9aea63b577a83def84dbd6dcd90a6fa02af745	2024-02-10T02:53:28-08:00	Ian Bull	metal : use autoreleasepool to avoid memory leaks (#5437)
M	ggml-metal.m

commit	cd9aea63b577a83def84dbd6dcd90a6fa02af745	43b65f5eb85e8741aba573a8f65bb8efad245d31	2024-02-10T09:53:05+02:00	Georgi Gerganov	scripts : update sync scripts with new backends
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.sh

commit	43b65f5eb85e8741aba573a8f65bb8efad245d31	4633d93af08d890ecd00fa6e4f61d76f21cded4c	2024-02-10T09:30:36+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	4633d93af08d890ecd00fa6e4f61d76f21cded4c	4b7b38bef5addbd31f453871d79647fbae6bec8a	2024-02-09T10:42:27+01:00	Michael Podvitskiy	ggml : add abort_callback for cpu backend (ggml/725)
M	ggml-backend.c
M	ggml-backend.h
M	ggml.c
M	ggml.h

commit	4b7b38bef5addbd31f453871d79647fbae6bec8a	e00d2a62dd1441e3b089570ec06d05c18800d368	2024-02-10T05:30:19+11:00	Neuman Vong	vulkan: Set limit for task concurrency (#5427)
M	ggml_vk_generate_shaders.py

commit	e00d2a62dd1441e3b089570ec06d05c18800d368	7c777fcd5dd4af7079e33390cf6a19c328a2666f	2024-02-09T14:00:59+01:00	Daniel Bevenius	llava : add requirements.txt and update README.md (#5428)
M	examples/llava/README.md
M	examples/llava/llava-surgery.py
A	examples/llava/requirements.txt

commit	7c777fcd5dd4af7079e33390cf6a19c328a2666f	e5ca3937c685d6e012ac4db40555d6ec100ff03c	2024-02-09T02:49:49-08:00	Riley Stewart	server : fix prompt caching for repeated prompts (#5420)
M	examples/server/server.cpp

commit	e5ca3937c685d6e012ac4db40555d6ec100ff03c	e4124c24775f2cb5b3d7acc93bf9dc5471c172ef	2024-02-09T10:48:06Z	Paul Tsochantaris	llama : do not cap thread count when MoE on CPU (#5419)
M	llama.cpp

commit	e4124c24775f2cb5b3d7acc93bf9dc5471c172ef	b2f87cb64db47d799b6f3656855c9caf9792ab2a	2024-02-09T11:17:00+01:00	Marko Tasic	readme : add JavaScript/Wasm repo (#5415)
M	README.md

commit	b2f87cb64db47d799b6f3656855c9caf9792ab2a	44fbe34360dd760f9e68b4271f21533436397f84	2024-02-09T10:56:43+01:00	Michael Podvitskiy	ggml : fix `error C2078: too many initializers` for MSVC ARM64 (#5404)
M	ggml-quants.c

commit	44fbe34360dd760f9e68b4271f21533436397f84	8e6a9d2de0096af7120606c74ee2f26684e87b41	2024-02-09T06:52:33+01:00	0cc4m	Fix Vulkan crash on APUs with very little device memory (#5424)
M	ggml-vulkan.cpp

commit	8e6a9d2de0096af7120606c74ee2f26684e87b41	41f308f58edc2a04bcf9e245100b0a9b10e9a0fb	2024-02-08T21:56:40+01:00	Johannes Gäßler	CUDA: more warps for mmvq on NVIDIA (#5394)
M	ggml-cuda.cu

commit	41f308f58edc2a04bcf9e245100b0a9b10e9a0fb	6e99f2a04f1871d637dd77eb4d81de31a5510253	2024-02-08T21:33:03+01:00	slaren	llama : do not print "offloading layers" message in CPU-only builds (#5416)
M	llama.cpp

commit	6e99f2a04f1871d637dd77eb4d81de31a5510253	ff4ff05c5ff4311c05a8ce1f984c7d8def4f07a5	2024-02-08T22:39:10+05:30	Abhilash Majumder	Fix f16_sycl cpy call from Arc (#5411)
M	.github/workflows/build.yml
M	ggml-sycl.cpp

commit	ff4ff05c5ff4311c05a8ce1f984c7d8def4f07a5	b7b74cef36a93ae01e0b9af8986d131761742d0e	2024-02-08T15:20:03+01:00	Daniel Bevenius	llava : add missing .py, and fix paths in README.md (#5414)
M	examples/llava/README.md

commit	b7b74cef36a93ae01e0b9af8986d131761742d0e	4aa43fab569215a13495a7f1a0f8afc541b16d03	2024-02-08T11:36:54+01:00	Johannes Gäßler	fix trailing whitespace (#5407)
M	llama.cpp

commit	4aa43fab569215a13495a7f1a0f8afc541b16d03	a6e514a85f0fda38ff78ec91782877ea3d19ed98	2024-02-08T18:36:19+08:00	runfuture	llama : fix MiniCPM (#5392)
M	convert-hf-to-gguf.py
M	llama.cpp

commit	a6e514a85f0fda38ff78ec91782877ea3d19ed98	26d4efd11e48908e14e2ee9471a7fc4c57079a1d	2024-02-08T09:58:19+01:00	Daniel Bevenius	llava: fix typo/formatting in README.md (#5405)
M	examples/llava/README.md

commit	26d4efd11e48908e14e2ee9471a7fc4c57079a1d	8504d2d0da8cc7a1f2eee0e9e56949f960510b75	2024-02-08T09:46:30+01:00	Johannes Gäßler	sampling: fix top_k <= 0 (#5388)
M	common/sampling.cpp
M	llama.cpp
M	tests/test-sampling.cpp

commit	8504d2d0da8cc7a1f2eee0e9e56949f960510b75	c4fbb6717c684196bd13b72d21747557130914e8	2024-02-08T09:46:47+02:00	Georgi Gerganov	tests : .gitignore obj files
M	tests/.gitignore

commit	c4fbb6717c684196bd13b72d21747557130914e8	8c933b70c21e05b685d476d0a1f36b34cbda7365	2024-02-07T22:39:23+01:00	Michael Podvitskiy	CMAKE_OSX_ARCHITECTURES for MacOS cross compilation (#5393)
M	CMakeLists.txt

commit	8c933b70c21e05b685d476d0a1f36b34cbda7365	b906596bb775b17656c2e51d5ab1b347faab6860	2024-02-07T21:11:30Z	Ebey Abraham	fix typo in readme (#5399)
M	README.md

commit	b906596bb775b17656c2e51d5ab1b347faab6860	aa7ab99be29b633263803f2e185265734c2d9427	2024-02-07T19:44:52+01:00	Kamil Tomšík	Add Ava in the list of llama.cpp UIs (#4362)
M	README.md

commit	aa7ab99be29b633263803f2e185265734c2d9427	10afa6f1d11ebc9fcc1085f468170002cbf6e2b5	2024-02-07T12:40:26+01:00	Johannes Gäßler	CUDA: fixed mmvq kernel for bs 2,3,4 and -sm row (#5386)
M	ggml-cuda.cu

commit	10afa6f1d11ebc9fcc1085f468170002cbf6e2b5	0ef46da632c32faa1a538e5dc180994e8bbb46e1	2024-02-07T18:16:55+08:00	Neo Zhang Jianyu	[SYCL] update install make by w64devkit (#5297)
M	README-sycl.md

commit	0ef46da632c32faa1a538e5dc180994e8bbb46e1	ee1628bdfea8b0079fed0140ac2f00ef1b465b57	2024-02-07T02:17:25-06:00	Xiao-Yong Jin	llava-cli : always tokenize special tokens (#5382)
M	examples/llava/llava-cli.cpp

commit	ee1628bdfea8b0079fed0140ac2f00ef1b465b57	ed0bf32290ee5b30ffad5becd99cbecef74aedd7	2024-02-07T07:54:50+01:00	0cc4m	Basic Vulkan Multi-GPU implementation (#5321)
M	common/common.cpp
M	ggml-vulkan.cpp
M	ggml-vulkan.h
M	ggml.c
M	llama.cpp

commit	ed0bf32290ee5b30ffad5becd99cbecef74aedd7	9a697d842bc0cfce8268ebd2ba703ffc1c904f98	2024-02-07T06:21:30Z	Eve	readme : modernize (#5379)
M	README.md
D	SHA256SUMS

commit	9a697d842bc0cfce8268ebd2ba703ffc1c904f98	316c7faf7740fa98ea68f1445f4505810f706b9e	2024-02-06T22:16:48-08:00	Ben Williams	readme : update ui list (#5354)
M	README.md

commit	316c7faf7740fa98ea68f1445f4505810f706b9e	f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d	2024-02-07T14:15:56+08:00	runfuture	llama : add MiniCPM support (#5346)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d	f68664ac241a6b5c233d8f1051eef20929b06008	2024-02-07T01:15:19-05:00	Justin Parker	server : update `/props` with "total_slots" value (#5373)
M	examples/server/README.md
M	examples/server/server.cpp

commit	f68664ac241a6b5c233d8f1051eef20929b06008	213d1439fadefe182f69c5f7e8dd3b4b6572ebcb	2024-02-07T13:28:00+09:00	Sang-Kil Park	convert : fix TypeError on GPT-2 vocab.json (#5288)
M	convert.py

commit	213d1439fadefe182f69c5f7e8dd3b4b6572ebcb	17c97fb0620448b37516a3f53fea6c482b0a30a4	2024-02-06T18:08:38Z	Alexey Parfenov	server : remove model.json endpoint (#5371)
M	examples/server/completion.js.hpp
M	examples/server/public/completion.js
M	examples/server/server.cpp

commit	17c97fb0620448b37516a3f53fea6c482b0a30a4	b08f22c882a1443e6b97081f3ce718a4d1a741f8	2024-02-06T18:43:06+01:00	Johannes Gäßler	CUDA: mul_mat_vec_q max. batch size 8 -> 4 (#5370)
M	ggml-cuda.cu

commit	b08f22c882a1443e6b97081f3ce718a4d1a741f8	f57fadc009cbff741a1961cb7896c47d73978d2c	2024-02-06T19:00:16+02:00	Kawrakow	Update README.md (#5366)
M	README.md

commit	f57fadc009cbff741a1961cb7896c47d73978d2c	2e9c0bd6b301155ce749e162527fc55e9fb5b832	2024-02-06T17:28:02+02:00	Kawrakow	Slight quantization improvement for Q4_K and Q5_K (#5361)
M	ggml-quants.c

commit	2e9c0bd6b301155ce749e162527fc55e9fb5b832	2c516611f1d0f1e5e9754f8ea1cf97cb1b17bf2c	2024-02-06T09:06:48-05:00	BarfingLemurs	readme : add phi, orion 14b, internlm2, and yi-VL to readme (#5362)
M	README.md

commit	2c516611f1d0f1e5e9754f8ea1cf97cb1b17bf2c	8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be	2024-02-06T14:44:06+01:00	Johannes Gäßler	CUDA: mul_mat_vec_q for batch sizes > 1 (#5351)
M	ggml-cuda.cu

commit	8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be	31e790322133a4b1d0684527ea446e765e8a96cf	2024-02-06T04:20:59-05:00	Justin Parker	server : include total "num_slots" in props endpoint (#5349)
M	examples/server/server.cpp

commit	31e790322133a4b1d0684527ea446e765e8a96cf	4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb	2024-02-06T04:20:00-05:00	Michael Coppola	server : add `dynatemp_range` and `dynatemp_exponent` (#5352)
M	examples/server/README.md
M	examples/server/server.cpp

commit	4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb	906cff55c2848fda091d888a1585915ec0c9ea9e	2024-02-06T08:16:23Z	Niall Coates	server : various fixes for the prompt field in /completion (#5300)
M	examples/server/server.cpp

commit	906cff55c2848fda091d888a1585915ec0c9ea9e	098f6d737b65134cf220d12b9b706e8cfc5e4610	2024-02-06T07:47:22+02:00	Georgi Gerganov	py : handle byte tokens in `get_token_type` (#5341)
M	convert.py

commit	098f6d737b65134cf220d12b9b706e8cfc5e4610	78b00dda6c0d62c34f5371d47718defff6ed2b22	2024-02-05T19:33:00+01:00	Johannes Gäßler	make: Use ccache for faster compilation (#5318)
M	CMakeLists.txt
M	Makefile

commit	78b00dda6c0d62c34f5371d47718defff6ed2b22	c6b395535a6874d749ef47c33eacd466cb252cd5	2024-02-05T15:55:10+01:00	Johannes Gäßler	README: updated introduction (#5343)
M	README.md

commit	c6b395535a6874d749ef47c33eacd466cb252cd5	abb61944a5f64dec62c893ed0db10790169b672a	2024-02-05T14:09:47+02:00	Kawrakow	ggml : make use of ggml-quants.h possible in C++ code (#5338)
M	ggml-impl.h
M	ggml-quants.h

commit	abb61944a5f64dec62c893ed0db10790169b672a	89503dcb5f764a5cc7093db1f395f5121876a2cc	2024-02-05T06:13:57-05:00	Dr. Tom Murphy VII Ph.D	ggml : avoid duplicating function calls using MIN/MAX macros (#5325)
M	ggml.c

commit	89503dcb5f764a5cc7093db1f395f5121876a2cc	7e1ae372f36d98fa66b1d778c5862904b4d80c88	2024-02-05T12:32:27+02:00	Kawrakow	iq3_xxs: quards for the no-imatrix situation (#5334)
M	llama.cpp

commit	7e1ae372f36d98fa66b1d778c5862904b4d80c88	6fdfa2ecc684000a25a4ad91823bc82a6652b645	2024-02-05T17:04:06+08:00	Guoteng	py : fix internlm2-hf convert to gguf (#5305)
M	convert-hf-to-gguf.py

commit	6fdfa2ecc684000a25a4ad91823bc82a6652b645	a2d60c9158435ae9a6f14632f07f1acf7a3becef	2024-02-05T10:46:06+02:00	Kawrakow	iq2_xxs: tune quantization (#5320)
M	ggml-quants.c

commit	a2d60c9158435ae9a6f14632f07f1acf7a3becef	e6f81775323f6f4e4a30abf022a6028fa86b79ac	2024-02-05T08:10:22Z	Alexey Parfenov	server : allow to get default generation settings for completion (#5307)
M	examples/server/README.md
M	examples/server/server.cpp

commit	e6f81775323f6f4e4a30abf022a6028fa86b79ac	30679d438d5225b3aecf5cec6482cbc9f8f87ba5	2024-02-05T17:00:47+09:00	l3utterfly	common : add dynamic temperature parameters to main example cli (#5295)
M	common/common.cpp

commit	30679d438d5225b3aecf5cec6482cbc9f8f87ba5	4be04c8965578edc09194fab769b4b922b8444f5	2024-02-05T09:48:03+02:00	Georgi Gerganov	scripts : fix typos, cleanup (#5303)
M	scripts/server-llm.sh

commit	4be04c8965578edc09194fab769b4b922b8444f5	5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca	2024-02-05T10:43:57+03:00	Нияз Гарифзянов	scripts : add non-interactive server-llm.sh (#5303)
M	scripts/server-llm.sh

commit	5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca	4833ac209da6a427de64f97e8f403dcdc5de6bc3	2024-02-05T15:41:38+08:00	chiranko	readme : add CodeShell models to the supported models list (#5330)
M	README.md

commit	4833ac209da6a427de64f97e8f403dcdc5de6bc3	9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c	2024-02-05T07:08:24Z	AidanBeltonS	[SYCL] Fix cpy with dims of 3 (#5289)
M	ggml-sycl.cpp

commit	9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c	5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4	2024-02-04T00:17:24Z	github-actions[bot]	flake.lock: Update
M	flake.lock

commit	5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4	277fad30c60ef3559dc2d01b19d05e659d40a824	2024-02-04T10:39:58+02:00	Kawrakow	Adding some imatrix tools (#5302)
M	examples/imatrix/imatrix.cpp

commit	277fad30c60ef3559dc2d01b19d05e659d40a824	3c0d25c4756742ebf15ad44700fabc0700c638bd	2024-02-03T23:18:51-05:00	Welby Seely	cmake : use set() for LLAMA_WIN_VER (#5298)
M	CMakeLists.txt

commit	3c0d25c4756742ebf15ad44700fabc0700c638bd	3cc5ed353c07201d8d5b98b0a4713ab633da6d04	2024-02-03T20:15:13+01:00	Johannes Gäßler	make: add nvcc info print (#5310)
M	Makefile

commit	3cc5ed353c07201d8d5b98b0a4713ab633da6d04	60ecf099eddfe70fec797ef6790572e452054add	2024-02-03T20:14:59+01:00	Johannes Gäßler	make: fix nvcc optimization flags for host code (#5309)
M	Makefile

commit	60ecf099eddfe70fec797ef6790572e452054add	e920ed393d989ed35625ddaf182ebb52cda07fcd	2024-01-28T12:59:43+01:00	Martin Schwaighofer	add Vulkan support to Nix flake
M	.devops/nix/package.nix
M	flake.nix

commit	e920ed393d989ed35625ddaf182ebb52cda07fcd	52bb63c7082c859c3f1dfc527227e6a95b299c7c	2024-02-03T18:15:00+01:00	0cc4m	Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301)
M	CMakeLists.txt
M	Makefile
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	52bb63c7082c859c3f1dfc527227e6a95b299c7c	1ec3332ade60aeb1494ace2211cf1a966db6d770	2024-02-03T12:23:37+01:00	Michael Klimenko	refactor : switch to emplace_back to avoid extra object (#5291)
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	examples/server/server.cpp
M	tests/test-llama-grammar.cpp

commit	1ec3332ade60aeb1494ace2211cf1a966db6d770	6a66c5071a74a96c4f52cf1015a092acd18c3714	2024-02-03T06:22:06-05:00	Jared Van Bortel	YaRN : store rope scaling type as int32_t in memory (#5285)
M	common/common.h
M	llama.cpp
M	llama.h

commit	6a66c5071a74a96c4f52cf1015a092acd18c3714	a305dba8ff642e57f538f42010868fe0bc5262a1	2024-02-03T12:20:26+01:00	BADR	readme : add tenere in the ui tools list (#5284)
M	README.md

commit	a305dba8ff642e57f538f42010868fe0bc5262a1	191221178f51b6e81122c5bda0fd79620e547d07	2024-02-03T08:11:37Z	AidanBeltonS	Fix im2col with 32fp (#5286)
M	ggml-sycl.cpp

commit	191221178f51b6e81122c5bda0fd79620e547d07	e437b37fd0b2b97e6c6ff1045ec7f901faa6498a	2024-02-02T08:15:30-06:00	kalomaze	perplexity : fix KL divergence calculations on Windows (#5273)
M	examples/perplexity/perplexity.cpp

commit	e437b37fd0b2b97e6c6ff1045ec7f901faa6498a	2d40085c26794e29c434480b9e06738e89e5686f	2024-02-02T14:23:40+02:00	Georgi Gerganov	scripts : parse wtype in server-llm.sh (#5167)
M	scripts/server-llm.sh

commit	2d40085c26794e29c434480b9e06738e89e5686f	b05102fe8cfa9893851c6bf6efd15cdc20b6afa2	2024-02-02T14:39:09+03:00	Mirror Azure	py : add check for '.attn.masked_bias' layers to GPT2model (#5281)
M	convert-hf-to-gguf.py

commit	b05102fe8cfa9893851c6bf6efd15cdc20b6afa2	6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6	2024-02-02T08:39:48Z	AidanBeltonS	Tidy ggml-sycl (#5261)
M	ggml-sycl.cpp

commit	6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6	e805f0fa9951081ce0a86378a7aa52b6f636b82d	2024-02-02T08:56:31+01:00	Xuan Son Nguyen	docker : add build for SYCL, Vulkan + update readme (#5228)
M	.devops/main-intel.Dockerfile
A	.devops/main-vulkan.Dockerfile
M	.devops/server-intel.Dockerfile
A	.devops/server-vulkan.Dockerfile
M	README-sycl.md
M	README.md

commit	e805f0fa9951081ce0a86378a7aa52b6f636b82d	af3ba5d94627d337e32a95129e31a3064c459f6b	2024-02-02T15:54:14+08:00	Meng, Hengyu	[SYCL] get MAX_MEM_ALLOC from device property (#5270)
M	ggml-sycl.cpp

commit	af3ba5d94627d337e32a95129e31a3064c459f6b	e1e721094d8169636d55f68efe37f222cd3f0677	2024-02-02T15:53:27+08:00	Neo Zhang Jianyu	[SYCL] update guide of SYCL backend (#5254)
M	README-sycl.md
M	examples/llama-bench/README.md
M	examples/sycl/win-run-llama2.bat

commit	e1e721094d8169636d55f68efe37f222cd3f0677	128dcbd3c9c4b12f42b560a4430427d7b2828628	2024-02-01T23:20:13-08:00	Ian Bull	llama : fix memory leak in llama_batch_free (#5252)
M	llama.cpp

commit	128dcbd3c9c4b12f42b560a4430427d7b2828628	4d0924a8902010d31bd737b6f1f594943d120d0f	2024-02-02T03:48:53+08:00	Neo Zhang Jianyu	add --no-mmap in llama-bench (#5257)
M	README-sycl.md
M	examples/llama-bench/llama-bench.cpp
M	ggml-sycl.cpp
M	ggml-sycl.h

commit	4d0924a8902010d31bd737b6f1f594943d120d0f	8ca511cadee2c67f0bd8c7034a2513778ee9a1b7	2024-02-01T19:25:24+01:00	0cc4m	Vulkan Phi Fix for AMD Proprietary Drivers (#5260)
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	8ca511cadee2c67f0bd8c7034a2513778ee9a1b7	d71ac90985854b0905e1abba778e407e17f9f887	2024-02-01T18:30:17+01:00	slaren	cuda : fix LLAMA_CUDA_F16 (#5262)
M	ggml-cuda.cu

commit	d71ac90985854b0905e1abba778e407e17f9f887	ce32060198b7e2d6a13a9b8e1e1369e3c295ae2a	2024-02-02T02:18:53+11:00	Ali Nehzat	make : generate .a library for static linking (#5205)
M	Makefile

commit	ce32060198b7e2d6a13a9b8e1e1369e3c295ae2a	1cfb5372cf5707c8ec6dde7c874f4a44a6c4c915	2024-02-01T17:19:51+08:00	Guoteng	llama : support InternLM2 (#5184)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	1cfb5372cf5707c8ec6dde7c874f4a44a6c4c915	d3bac7d58408c602ec1f1e423695f1df8410bb03	2024-01-31T19:21:55Z	Eve	Fix broken Vulkan Cmake (properly) (#5230)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	d3bac7d58408c602ec1f1e423695f1df8410bb03	5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3	2024-01-31T18:47:10+02:00	Georgi Gerganov	llama : reorder build_orion() at correct place (#5118)
M	llama.cpp

commit	5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3	efb7bdbbd061d087c788598b97992c653f992ddd	2024-01-31T17:30:17+02:00	Georgi Gerganov	llama : remove LLAMA_MAX_DEVICES and LLAMA_SUPPORTS_GPU_OFFLOAD (#5240)
M	README.md
M	common/common.cpp
M	common/common.h
M	common/train.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	efb7bdbbd061d087c788598b97992c653f992ddd	15606309a05ccf7fadbaad5538cb7c32acb1e06b	2024-01-31T15:35:41+02:00	Georgi Gerganov	metal : add im2col F32 dst support (#5132)
M	ggml-metal.m
M	ggml-metal.metal

commit	15606309a05ccf7fadbaad5538cb7c32acb1e06b	b2b9f025e7821e78bd501d75d01838c26de07a57	2024-01-31T21:10:15+08:00	JidongZhang-THU	llava : add MobileVLM support (#5132)
M	examples/llava/MobileVLM-README.md
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	b2b9f025e7821e78bd501d75d01838c26de07a57	dabcc5b471348e4ae03ddacc41e19ad75fb2f041	2024-01-31T21:04:46+08:00	Neo Zhang Jianyu	format license text, restore apache license by legal suggestion (#5233)
M	examples/sycl/ls-sycl-device.cpp
M	ggml-sycl.cpp
M	ggml-sycl.h

commit	dabcc5b471348e4ae03ddacc41e19ad75fb2f041	f8e9140cb46eebaa867e1184a9946e4840eec772	2024-01-31T13:43:03+01:00	slaren	ggml : limit n_threads to the max n_tasks (#5238)
M	ggml.c

commit	f8e9140cb46eebaa867e1184a9946e4840eec772	d62520eb2cc1d7168a30edec6110e1daefbd959f	2024-01-31T11:44:19+01:00	0cc4m	Vulkan Fixes (#5223)
M	common/common.cpp
M	ggml-vulkan-shaders.hpp
M	ggml-vulkan.cpp
M	ggml_vk_generate_shaders.py

commit	d62520eb2cc1d7168a30edec6110e1daefbd959f	01684139c352561840ae55ec627ab58abc3e06ab	2024-01-31T11:04:21+08:00	Yiming Cui	Fix typos of IQ2_XXS and IQ3_XXS in llama.cpp (#5231)
M	llama.cpp

commit	01684139c352561840ae55ec627ab58abc3e06ab	e8dc55d0065d076d4c20f3c4bfca562701b4edfe	2024-01-31T10:38:07+08:00	Neo Zhang Jianyu	support SYCL backend windows build (#5208)
M	.github/workflows/build.yml
M	.github/workflows/editorconfig.yml
M	.gitignore
M	CMakeLists.txt
R058	README_sycl.md	README-sycl.md
M	README.md
A	examples/sycl/win-build-sycl.bat
A	examples/sycl/win-run-llama2.bat
A	scripts/install-oneapi.bat

commit	e8dc55d0065d076d4c20f3c4bfca562701b4edfe	e0085fdf7c758f0bc2746fc106fb29dd9df959de	2024-01-30T19:04:37-05:00	Jared Van Bortel	kompute : llama-bench support and ggml_cpu_has_kompute() (#5226)
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	e0085fdf7c758f0bc2746fc106fb29dd9df959de	e6f291d15844398f8326940fe5ad7f2e02b5aa56	2024-01-30T21:19:26+02:00	Georgi Gerganov	Revert "server : change deps.sh xxd files to string literals (#5221)"
M	examples/server/completion.js.hpp
M	examples/server/deps.sh
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
M	examples/server/json-schema-to-grammar.mjs.hpp

commit	e6f291d15844398f8326940fe5ad7f2e02b5aa56	4003be0e5feef320f3707786f22722b73cff9356	2024-01-30T20:17:30+02:00	Georgi Gerganov	server : fix context shift (#5195)
M	examples/server/chat.sh
M	examples/server/server.cpp

commit	4003be0e5feef320f3707786f22722b73cff9356	fea4fd4ba7f6b754ac795387b275e1a014a77bde	2024-01-30T12:15:05-06:00	JohnnyB	server : change deps.sh xxd files to string literals (#5221)
M	examples/server/completion.js.hpp
M	examples/server/deps.sh
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
M	examples/server/json-schema-to-grammar.mjs.hpp

commit	fea4fd4ba7f6b754ac795387b275e1a014a77bde	8f8ddfcfadc830b936318c3ea9fe2e8e3365aa85	2024-01-30T19:15:28+02:00	Kawrakow	ggml : fix IQ3_XXS on Metal (#5219)
M	ggml-metal.metal

commit	8f8ddfcfadc830b936318c3ea9fe2e8e3365aa85	6fb50ebbf036ac57a20fe8d8da31731a543582d5	2024-01-30T16:21:57+02:00	Georgi Gerganov	sync : ggml (#0)
M	ggml-cuda.cu
M	scripts/sync-ggml.last

commit	6fb50ebbf036ac57a20fe8d8da31731a543582d5	625a699b5456994bc32a8093d53818f60ceda6d1	2024-01-29T21:08:18+02:00	Georgi Gerganov	gguf : fix comparison (ggml/715)
M	ggml.c

commit	625a699b5456994bc32a8093d53818f60ceda6d1	a4b07c057a553b1ac253051efc3f040351e2eae1	2024-01-29T06:37:33-06:00	John Balis	`ggml_cuda_cpy` support for 4d tensors and float16->float32 upcasting (ggml/686)
M	ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	a4b07c057a553b1ac253051efc3f040351e2eae1	549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e	2024-01-29T14:00:10+02:00	Georgi Gerganov	gguf : add input validation, prevent integer overflows (ggml/709)
M	ggml.c

commit	549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e	5f14ee0b0cd06f1c4790e6123df4b38ace637e88	2024-01-29T13:29:46+02:00	Georgi Gerganov	ci : fix yolo URLs + fix metal capture (ggml/712)
M	ggml-metal.m

commit	5f14ee0b0cd06f1c4790e6123df4b38ace637e88	8e14e3ddb3744566aef7bc0fa734180e47ae6bdf	2024-01-29T01:22:23-08:00	Jack Mousseau	metal : add debug capture backend function (ggml/694)
M	ggml-metal.h
M	ggml-metal.m

commit	8e14e3ddb3744566aef7bc0fa734180e47ae6bdf	f4d7e5497485ce6ce0e322533930b7da4657dd2d	2024-01-30T15:15:07+02:00	Kawrakow	Faster AVX2 dot product for IQ2_XS (#5187)
M	ggml-quants.c

commit	f4d7e5497485ce6ce0e322533930b7da4657dd2d	2256f36b79a932a478d4dcdf02c1e5a60056e5f3	2024-01-30T15:14:12+02:00	Kawrakow	SOTA 3-bit quants  (#5196)
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	2256f36b79a932a478d4dcdf02c1e5a60056e5f3	7359016c7c0f65dc30cf79791212b06f15866450	2024-01-30T13:59:30+01:00	0cc4m	Vulkan Windows APU Memory Handling (#5199)
M	ggml-vulkan.cpp

commit	7359016c7c0f65dc30cf79791212b06f15866450	813416991ab0d1caa0d12f93ac4e8a24a2add0a3	2024-01-30T17:57:07+07:00	Vladimir Malyutin	quantize : fix typo (#5211)
M	examples/quantize/quantize.cpp

commit	813416991ab0d1caa0d12f93ac4e8a24a2add0a3	5589921ef84a4fb1c6d1c9c34d626a5a83033db6	2024-01-30T10:18:02+01:00	divinity76	main : allow empty --prompt-cache file (#5176)
M	examples/main/main.cpp

commit	5589921ef84a4fb1c6d1c9c34d626a5a83033db6	49f44b5c55d801e3d51ddcf409d866047d718905	2024-01-30T10:16:38+01:00	Romain Neutron	readme : minor (#5204)
M	README.md

commit	49f44b5c55d801e3d51ddcf409d866047d718905	6685cc41c237544623b4b5651eceb9c4280728cc	2024-01-30T11:14:44+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	6685cc41c237544623b4b5651eceb9c4280728cc	ceebbb5b21b971941b2533210b74bf359981006c	2024-01-30T17:11:46+08:00	Wu Jian Ping	server : improve README (#5209)
M	examples/server/README.md

commit	ceebbb5b21b971941b2533210b74bf359981006c	6daa69ee81851ab26ca8aefca1a4202941fc0262	2024-01-29T22:19:29Z	Paul Tsochantaris	ggml alloc: Fix for null dereference on alloc failure (#5200)
M	ggml-alloc.c

commit	6daa69ee81851ab26ca8aefca1a4202941fc0262	fbf1ddec69f7001cc707de17fa74d7200813bbac	2024-01-29T17:11:27-05:00	Jared Van Bortel	kompute : fix fallback to CPU (#5201)
M	llama.cpp

commit	fbf1ddec69f7001cc707de17fa74d7200813bbac	2aed77eb06a329f0d82bb1c467f4244904d4073f	2024-01-29T15:50:50-05:00	Jared Van Bortel	Nomic Vulkan backend (#4456)
M	.ecrc
M	.github/workflows/build.yml
A	.gitmodules
M	CMakeLists.txt
M	ggml-backend.c
A	ggml-kompute.cpp
A	ggml-kompute.h
A	kompute
A	kompute-shaders/common.comp
A	kompute-shaders/op_add.comp
A	kompute-shaders/op_addrow.comp
A	kompute-shaders/op_cpy_f16_f16.comp
A	kompute-shaders/op_cpy_f16_f32.comp
A	kompute-shaders/op_cpy_f32_f16.comp
A	kompute-shaders/op_cpy_f32_f32.comp
A	kompute-shaders/op_diagmask.comp
A	kompute-shaders/op_gelu.comp
A	kompute-shaders/op_getrows.comp
A	kompute-shaders/op_getrows_f16.comp
A	kompute-shaders/op_getrows_q4_0.comp
A	kompute-shaders/op_getrows_q4_1.comp
A	kompute-shaders/op_getrows_q6_k.comp
A	kompute-shaders/op_mul.comp
A	kompute-shaders/op_mul_mat_f16.comp
A	kompute-shaders/op_mul_mat_mat_f32.comp
A	kompute-shaders/op_mul_mat_q4_0.comp
A	kompute-shaders/op_mul_mat_q4_1.comp
A	kompute-shaders/op_mul_mat_q6_k.comp
A	kompute-shaders/op_mul_mat_q8_0.comp
A	kompute-shaders/op_mul_mv_q_n.comp
A	kompute-shaders/op_mul_mv_q_n_pre.comp
A	kompute-shaders/op_norm.comp
A	kompute-shaders/op_relu.comp
A	kompute-shaders/op_rmsnorm.comp
A	kompute-shaders/op_rope_f16.comp
A	kompute-shaders/op_rope_f32.comp
A	kompute-shaders/op_scale.comp
A	kompute-shaders/op_scale_8.comp
A	kompute-shaders/op_silu.comp
A	kompute-shaders/op_softmax.comp
A	kompute-shaders/rope_common.comp
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp
M	tests/test-c.c

commit	2aed77eb06a329f0d82bb1c467f4244904d4073f	c82d18e863fcde91b4b1109b1d0c73ea4470c405	2024-01-29T15:45:41+01:00	divinity76	fix typo "RLIMIT_MLOCK" (#5175)
M	llama.cpp

commit	c82d18e863fcde91b4b1109b1d0c73ea4470c405	14fef85e2d5361e6b4dd7a9ecf22bb817362997d	2024-01-29T21:48:10+08:00	Wu Jian Ping	server : embeddings compatibility for OpenAI (#5190)
M	examples/server/oai.hpp
M	examples/server/server.cpp

commit	14fef85e2d5361e6b4dd7a9ecf22bb817362997d	e76627bcce9f77adb6034cb127b7ec93d4287b69	2024-01-29T15:35:54+02:00	Georgi Gerganov	py : fix except (#5194)
M	convert.py

commit	e76627bcce9f77adb6034cb127b7ec93d4287b69	fbe7dfa53caff0a7e830b676e6e949917a5c71b4	2024-01-29T18:24:19+09:00	Sang-Kil Park	py : improve BPE tokenizer support (#5189)
M	convert.py

commit	fbe7dfa53caff0a7e830b676e6e949917a5c71b4	172ac82629815d038702b049070f4c8c02662da5	2024-01-29T09:05:13+01:00	slaren	ggml : add max buffer sizes to opencl and metal backends (#5181)
M	ggml-metal.m
M	ggml-opencl.cpp

commit	172ac82629815d038702b049070f4c8c02662da5	d2f650cb5b04ee2726663e79b47da5efe196ce00	2024-01-29T08:04:47Z	Eve	cmake : fix Vulkan build (#5182)
M	CMakeLists.txt

commit	d2f650cb5b04ee2726663e79b47da5efe196ce00	35dec26cc25a9ff7d8c3ed52326b94f772b911ce	2024-01-28T19:50:16Z	Paul Tsochantaris	metal : free metal objects (#5161)
M	ggml-metal.m

commit	35dec26cc25a9ff7d8c3ed52326b94f772b911ce	d460510c7222d43a458a17e01d4bbe72437cdd3c	2024-01-28T19:48:05+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	d460510c7222d43a458a17e01d4bbe72437cdd3c	2307523d322af762ae06648b29ec5a9eb1c73032	2024-01-28T18:44:58+02:00	Georgi Gerganov	ggml : minor type fix (int64_t -> size_t)
M	ggml.c

commit	2307523d322af762ae06648b29ec5a9eb1c73032	0f648573dde61c510560f68244f70ece7e60d8c1	2024-01-28T18:03:59+01:00	0cc4m	ggml : add Vulkan backend (#2059)
M	CMakeLists.txt
M	Makefile
M	examples/llama-bench/llama-bench.cpp
M	ggml-alloc.c
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-opencl.cpp
M	ggml-sycl.cpp
A	ggml-vulkan-shaders.hpp
A	ggml-vulkan.cpp
A	ggml-vulkan.h
M	ggml.c
M	ggml.h
A	ggml_vk_generate_shaders.py
M	llama.cpp
M	llama.h

commit	0f648573dde61c510560f68244f70ece7e60d8c1	b764b8f1d079ba44d912801ce6d29bd0d94d51cf	2024-01-28T21:26:23+05:30	Abhilash Majumder	ggml : add unified SYCL backend for Intel GPUs (#2690)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	README.md
A	README_sycl.md
M	ci/README.md
M	ci/run.sh
M	common/common.cpp
M	examples/CMakeLists.txt
M	examples/server/server.cpp
A	examples/sycl/CMakeLists.txt
A	examples/sycl/README.md
A	examples/sycl/build.sh
A	examples/sycl/ls-sycl-device.cpp
A	examples/sycl/run-llama2.sh
M	ggml-backend.c
A	ggml-sycl.cpp
A	ggml-sycl.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	b764b8f1d079ba44d912801ce6d29bd0d94d51cf	9241c3a2ace544aef708334e54bbdddb90208ee8	2024-01-28T16:54:54+02:00	Georgi Gerganov	flake.lock: Update (#5162)
M	flake.lock

commit	9241c3a2ace544aef708334e54bbdddb90208ee8	b2b2bf988c098851b4f3831f0cf38394bff75121	2024-01-28T09:59:49+01:00	Johannes Gäßler	Apply min_p to unsorted tokens (#5115)
M	llama.cpp

commit	b2b2bf988c098851b4f3831f0cf38394bff75121	af4980bfedfd8df43b9e4cd1442895e85fee37bc	2024-01-28T09:35:14+01:00	Johannes Gäßler	Tests for min_p, sampling queue (#5147)
M	llama.cpp
M	tests/test-sampling.cpp

commit	af4980bfedfd8df43b9e4cd1442895e85fee37bc	f2e69d28c01303ca9dc79907f89ef120a6ac4a92	2024-01-28T00:30:44-08:00	Marcus Dunn	readme : add link to rust bindings (#5148)
M	README.md

commit	f2e69d28c01303ca9dc79907f89ef120a6ac4a92	39baaf55a160909bb9428bd981014218761a20cb	2024-01-28T16:00:30+08:00	sharpHL	llama : add support for Orion-14B (#5118)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	39baaf55a160909bb9428bd981014218761a20cb	6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855	2024-01-28T01:55:31-06:00	Kyle Mistele	docker : add server-first container images (#5157)
A	.devops/server-cuda.Dockerfile
A	.devops/server-intel.Dockerfile
A	.devops/server-rocm.Dockerfile
A	.devops/server.Dockerfile
M	.github/workflows/docker.yml
M	README.md
M	examples/server/README.md

commit	6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855	753eafed0ebd07af6903771327a1786a7c02cf98	2024-01-27T16:09:18+01:00	John	llava : support for Yi-VL and fix for mobileVLM (#5093)
M	examples/llava/clip.cpp
M	examples/llava/llava-cli.cpp

commit	753eafed0ebd07af6903771327a1786a7c02cf98	e9764230054e01553bdead6f2bfd8e001869599d	2024-01-27T16:59:20+02:00	Georgi Gerganov	sync : ggml
M	examples/server/utils.hpp
M	scripts/sync-ggml.last

commit	e9764230054e01553bdead6f2bfd8e001869599d	35a2ee914308c85ab5cb576467381443ad23f0ac	2024-01-26T21:04:01+08:00	Judd	ggml : check ggml_add src1 type (ggml/708)
M	ggml.c

commit	35a2ee914308c85ab5cb576467381443ad23f0ac	ec903c034131848da9222536ff18da07ec0882a0	2024-01-27T15:25:55+01:00	Michael Klimenko	Remove unused data and add fixes (#5154)
M	common/sampling.cpp
M	examples/infill/infill.cpp
M	examples/llava/clip.cpp
M	examples/server/server.cpp
M	pocs/vdot/vdot.cpp
M	tests/test-backend-ops.cpp
M	tests/test-llama-grammar.cpp

commit	ec903c034131848da9222536ff18da07ec0882a0	a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd	2024-01-27T14:38:05+01:00	Maximilian Winter	server : add self-extend support (#5104)
M	examples/server/README.md
M	examples/server/server.cpp

commit	a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd	bbe7c56c9993af86aa2d84cbe1fd69e1b4300cea	2024-01-26T23:07:32+01:00	0cc4m	Add OpenCL add kernel (#5151)
M	ggml-opencl.cpp
M	ggml-opencl.h
M	ggml.c

commit	bbe7c56c9993af86aa2d84cbe1fd69e1b4300cea	62fead3ea0a30c8d424f4a8373fa14165c7c707f	2024-01-26T15:34:06-05:00	Jared Van Bortel	cmake : pass CPU architecture flags to nvcc (#5146)
M	CMakeLists.txt

commit	62fead3ea0a30c8d424f4a8373fa14165c7c707f	15b4538ff29b280a395a1406d711497d8eaa2564	2024-01-26T18:59:43+01:00	slaren	cuda : fix tensor size calculation for non-split buffer (#5145)
M	ggml-backend.c
M	ggml-cuda.cu

commit	15b4538ff29b280a395a1406d711497d8eaa2564	7032f4f6349c17a8352f9f93f7d2122f45469e59	2024-01-26T18:18:26+01:00	slaren	ggml-alloc : add 10% margin to the buffer sizes (#5149)
M	ggml-alloc.c

commit	7032f4f6349c17a8352f9f93f7d2122f45469e59	5f1925a8cef81eb9b372faaae34b0dd76d5361d4	2024-01-26T11:17:59-06:00	snadampal	ggml : update softmax n_task calculation (#5126)
M	ggml.c

commit	5f1925a8cef81eb9b372faaae34b0dd76d5361d4	3b7c914de25c6851396d7f9178249f1ed278120e	2024-01-26T17:09:44+02:00	Georgi Gerganov	scripts : move run-with-preset.py from root to scripts folder
R098	run_with_preset.py	scripts/run-with-preset.py

commit	3b7c914de25c6851396d7f9178249f1ed278120e	48c857aa10aea73210a4a72da3f1a6f99269e75d	2024-01-26T14:48:15+02:00	Georgi Gerganov	tests : gitignore test-c.o
M	tests/.gitignore

commit	48c857aa10aea73210a4a72da3f1a6f99269e75d	413e7b0559f922bd4de5e9eec548829d111651b1	2024-01-26T13:42:20+01:00	Xuan Son Nguyen	server : refactored the task processing logic (#5065)
M	Makefile
M	examples/server/CMakeLists.txt
A	examples/server/oai.hpp
M	examples/server/server.cpp
A	examples/server/utils.hpp

commit	413e7b0559f922bd4de5e9eec548829d111651b1	6dd3c28c9cd1ef74b49d79f47d668759346a3c6c	2024-01-26T07:18:00-05:00	crasm	ci : add model tests + script wrapper (#4586)
M	.github/workflows/build.yml
M	.gitignore
M	Makefile
M	ci/run.sh
A	scripts/ci-run.sh
A	tests/.gitignore
M	tests/CMakeLists.txt
A	tests/get-model.cpp
A	tests/get-model.h
M	tests/test-autorelease.cpp
A	tests/test-model-load-cancel.cpp

commit	6dd3c28c9cd1ef74b49d79f47d668759346a3c6c	38b431de232d1b736b5af19b8c7d72f7075a70bc	2024-01-26T12:16:07Z	Paul Tsochantaris	metal : remove unused `n_buffers` and `buffers` (#5129)
M	ggml-metal.m

commit	38b431de232d1b736b5af19b8c7d72f7075a70bc	aad0b01d7380a7cdfe0dd42307b18c7b6bac9575	2024-01-26T17:10:28+08:00	Riceball LEE	gguf : fix "general.alignment" type in gguf_reader.py (#5136)
M	gguf-py/gguf/gguf_reader.py

commit	aad0b01d7380a7cdfe0dd42307b18c7b6bac9575	1182cf4d4f6ee383b92695c2e3fe438086dcdba7	2024-01-26T10:52:33+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	1182cf4d4f6ee383b92695c2e3fe438086dcdba7	fe54033b69b83164cabb5f3ed92dc0ff7ea47605	2024-01-26T09:14:39+02:00	Kawrakow	Another bucket sort (#5109)
M	llama.cpp

commit	fe54033b69b83164cabb5f3ed92dc0ff7ea47605	5eaf9964fc797d4585c214db32a463d557f3ed33	2024-01-26T04:14:32+08:00	XiaotaoChen	readme : add MobileVLM 1.7B/3B to the supported models list (#5107)
M	README.md

commit	5eaf9964fc797d4585c214db32a463d557f3ed33	d292f4f2047963f558dd516f1baaa71793e9acf2	2024-01-26T05:06:22+09:00	l3utterfly	llama : dynamic temperature sampling (#4972)
M	common/sampling.cpp
M	common/sampling.h
M	llama.cpp
M	llama.h

commit	d292f4f2047963f558dd516f1baaa71793e9acf2	256d1bb0ddce6a0a21f5a7503019bdd5c1933cba	2024-01-25T14:51:24-05:00	Jared Van Bortel	examples : make pydantic scripts pass mypy and support py3.8 (#5099)
M	examples/pydantic-models-to-grammar-examples.py
M	examples/pydantic_models_to_grammar.py

commit	256d1bb0ddce6a0a21f5a7503019bdd5c1933cba	faa3526a1eba458120987ed8269e5616385a76f4	2024-01-25T12:05:51-05:00	Valentin Konovalov	android : use release cmake build type by default (#5123)
M	examples/llama.android/app/build.gradle.kts

commit	faa3526a1eba458120987ed8269e5616385a76f4	ddc5a5033f948dc7ab0a3a6ec2d914d13c274077	2024-01-25T17:58:53+02:00	Kawrakow	Fix Q3_K_XS for MoE models (#5113)
M	llama.cpp

commit	ddc5a5033f948dc7ab0a3a6ec2d914d13c274077	cd4fddb29f81d6a1f6d51a0c016bc6b486d68def	2024-01-25T11:26:17+02:00	Georgi Gerganov	metal : show compile log messages
M	ggml-metal.m

commit	cd4fddb29f81d6a1f6d51a0c016bc6b486d68def	c9b316c78fba31e65879a2ec91cbafd341b88cce	2024-01-24T16:18:15-06:00	Engininja2	cuda : fix 2-bit quants on amd hip (#5105)
M	ggml-cuda.cu

commit	c9b316c78fba31e65879a2ec91cbafd341b88cce	bf63d695b804b1c995c7ae4427a8a86936ea6d25	2024-01-22T16:44:10-07:00	Michael Hueschen	nix-shell: use addToSearchPath
M	.devops/nix/package.nix

commit	bf63d695b804b1c995c7ae4427a8a86936ea6d25	1387ea21178f9f154944013d4dd9764b54c69deb	2024-01-22T03:17:05-07:00	Michael Hueschen	nix: add cc to devShell LD_LIBRARY_PATH
M	.devops/nix/package.nix

commit	1387ea21178f9f154944013d4dd9764b54c69deb	26d607608d794efa56df3bdb6043a2f94c1d632c	2024-01-24T12:48:14+01:00	slaren	llama : pre-allocate input tensors in a separate buffer (#5100)
M	ggml-alloc.c
M	llama.cpp

commit	26d607608d794efa56df3bdb6043a2f94c1d632c	44879ee885f48ecf4675dd216b373dce0a6f3690	2024-01-23T15:50:56+02:00	Georgi Gerganov	metal : disable support for MUL_MAT F32 x F16
M	ggml-metal.m

commit	44879ee885f48ecf4675dd216b373dce0a6f3690	9ecdd12e95aee20d6dfaf5f5a0f0ce5ac1fb2747	2024-01-23T15:17:20+02:00	Kawrakow	Additional KL-divergence statistics (#5081)
M	examples/perplexity/perplexity.cpp

commit	9ecdd12e95aee20d6dfaf5f5a0f0ce5ac1fb2747	89758723c75ba594e401f6513751beeba7ca1d28	2024-01-23T13:31:56+01:00	Johannes Gäßler	CUDA: more info when no device code (#5088)
M	ggml-cuda.cu

commit	89758723c75ba594e401f6513751beeba7ca1d28	2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf	2024-01-23T14:12:57+02:00	Georgi Gerganov	minor : clean-up some warnings and style (#5094)
M	common/common.cpp
M	examples/llava/clip.cpp
M	examples/perplexity/perplexity.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf	125d03a5036a02a983c8e98c2cdc126e061afb8e	2024-01-23T08:11:39+01:00	Xuan Son Nguyen	devops : add intel oneapi dockerfile (#5068)
A	.devops/main-intel.Dockerfile
M	.github/workflows/docker.yml
M	CMakeLists.txt

commit	125d03a5036a02a983c8e98c2cdc126e061afb8e	011e8ec577fd135cbc02993d3ea9840c516d6a1c	2024-01-23T01:51:27-05:00	Michael Coppola	llama.vim : added api key support (#5090)
M	examples/llama.vim

commit	011e8ec577fd135cbc02993d3ea9840c516d6a1c	6f9939d119b2d004c264952eb510bd106455531e	2024-01-22T23:42:41+01:00	slaren	llama : fix not enough space in buffer with Qwen (#5086)
M	llama.cpp

commit	6f9939d119b2d004c264952eb510bd106455531e	780e24a22eb595b705cbe8284771e9ceff1c4dd2	2024-01-22T16:10:14+02:00	Kawrakow	KL-divergence (#5076)
M	common/common.cpp
M	common/common.h
M	examples/perplexity/perplexity.cpp

commit	780e24a22eb595b705cbe8284771e9ceff1c4dd2	3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea	2024-01-22T21:15:08+08:00	Reinforce-II	ggml : parallelize FP32 conversion when using BLAS (#5045)
M	ggml.c

commit	3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea	b2d80e105a59b54822edf7ce7f3ed5f317e96e21	2024-01-22T21:09:35+08:00	XiaotaoChen	llava : MobileVLM support (#4954)
M	CMakeLists.txt
A	examples/llava/MobileVLM-README.md
A	examples/llava/android/adb_run.sh
A	examples/llava/android/build_64.sh
M	examples/llava/clip.cpp
M	examples/llava/convert-image-encoder-to-gguf.py
M	ggml.c
M	ggml.h

commit	b2d80e105a59b54822edf7ce7f3ed5f317e96e21	28603cd2833cedd4434f398d847f87fc83546dbb	2024-01-21T03:41:37Z	Someone Serge	flake.nix: add a comment about flakes vs nix
M	flake.nix

commit	28603cd2833cedd4434f398d847f87fc83546dbb	5e97ec91ae3038720a5b15cde4c52d2a53ec2137	2024-01-21T03:29:38Z	Someone Serge	nix: add a comment on the many nixpkgs-with-cuda instances
M	.devops/nix/nixpkgs-instances.nix

commit	5e97ec91ae3038720a5b15cde4c52d2a53ec2137	7251870780e2d572dd6f239d7a0bfe438c82fa74	2024-01-21T03:15:13Z	Someone Serge	nix: add a comment about makeScope
M	.devops/nix/scope.nix

commit	7251870780e2d572dd6f239d7a0bfe438c82fa74	fe8b3c0d4b0d806e8b46660e24eaf4b90b8b385f	2024-01-13T17:45:01Z	Someone Serge	nix: refactor the cleanSource rules
M	.devops/nix/package.nix

commit	fe8b3c0d4b0d806e8b46660e24eaf4b90b8b385f	f4dd059259d0234913b9e9780e1662811744c09d	2024-01-13T17:38:32Z	Someone Serge	workflows: nix-ci: drop the redundant "paths" filter
M	.github/workflows/nix-ci.yml

commit	f4dd059259d0234913b9e9780e1662811744c09d	f7276f7500f7ea588836dd1fc6f126334c517878	2024-01-13T17:16:54Z	Someone Serge	workflows: nix-build-aarch64: rate limit
M	.github/workflows/nix-ci-aarch64.yml

commit	f7276f7500f7ea588836dd1fc6f126334c517878	15bceec2d73d4166340b46b27677c45ac1b4cdad	2024-01-13T17:10:19Z	Someone Serge	workflows: nix-ci: rebuild on flake.lock updates
M	.github/workflows/nix-ci.yml

commit	15bceec2d73d4166340b46b27677c45ac1b4cdad	d6bd4d46ddb6926087c11e0f6633ab1c81da58c3	2024-01-22T14:18:43+02:00	Kawrakow	imatrix : keep intermediate imatrix results (#5077)
M	examples/imatrix/imatrix.cpp

commit	d6bd4d46ddb6926087c11e0f6633ab1c81da58c3	152d9d05e097e35f1cac21262946d57faec7542a	2024-01-22T06:21:52-05:00	compilade	llama : support StableLM 2 1.6B (#5052)
M	.devops/nix/package.nix
M	convert-hf-to-gguf.py
M	llama.cpp

commit	152d9d05e097e35f1cac21262946d57faec7542a	66d575c45c5a370d668f9c3283cdf348e2329fa2	2024-01-22T12:11:01+01:00	Daniel Bevenius	finetune : print sample-start/include-sample-start (#5072)
M	examples/finetune/finetune.cpp

commit	66d575c45c5a370d668f9c3283cdf348e2329fa2	57744932c64266359ee905518de7e096c0295d8c	2024-01-22T12:43:33+02:00	Kawrakow	llama : add Q3_K_XS (#5060)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	57744932c64266359ee905518de7e096c0295d8c	3466c6ebcf668cac453f891b493ead19283347a8	2024-01-22T08:55:05Z	bobqianic	ci : fix Windows CI by updating Intel SDE version (#5053)
M	.github/workflows/build.yml

commit	3466c6ebcf668cac453f891b493ead19283347a8	504dc37be8446fb09b1ede70300250ad41be32a2	2024-01-22T15:33:19+08:00	Shijie	llama : add more qwen2 models (#5071)
M	llama.cpp

commit	504dc37be8446fb09b1ede70300250ad41be32a2	05490fad7f7f60ff2bed9ad05cd81b44e82ccde3	2024-01-21T22:37:13+01:00	iSma	Revert LLAMA_NATIVE to OFF in flake.nix (#5066)
M	.devops/nix/package.nix

commit	05490fad7f7f60ff2bed9ad05cd81b44e82ccde3	6c5629d4d2d15557c38a0e609b30c1a42abad80d	2024-01-22T00:28:14+08:00	kuronekosaiko	add safetensors support to convert-lora-to-ggml.py (#5062)
M	convert-lora-to-ggml.py

commit	6c5629d4d2d15557c38a0e609b30c1a42abad80d	7dcbe39d36b76389f6c5cd3b151928472b7e22ff	2024-01-21T15:17:35Z	bobqianic	add `#include <string>` to unicode.h (#5051)
M	unicode.h

commit	7dcbe39d36b76389f6c5cd3b151928472b7e22ff	726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5	2024-01-21T14:42:44+02:00	Kawrakow	Add ability to evauate multiple choice tasks  (#5047)
M	common/common.cpp
M	common/common.h
M	examples/perplexity/perplexity.cpp

commit	726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5	942c0107a7301434c0a5e7da46bc4cf2393aa556	2024-01-21T08:01:20+02:00	Kawrakow	Slightly faster imatrix (#5050)
M	examples/imatrix/imatrix.cpp

commit	942c0107a7301434c0a5e7da46bc4cf2393aa556	b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5	2024-01-21T05:17:27+02:00	Georgi Gerganov	flake.lock: Update (#5054)
M	flake.lock

commit	b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5	97c1549808d2742d37584a3c9df28154bdf34417	2024-01-20T18:14:18-05:00	Jared Van Bortel	convert : partially revert PR #4818 (#5041)
M	convert-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-lora-to-ggml.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	mypy.ini

commit	97c1549808d2742d37584a3c9df28154bdf34417	6df465a91d402370bcba6676b19fad85b06ce7e0	2024-01-20T10:08:08-05:00	Jared Van Bortel	perplexity : fix MSVC build after #5020 (#5043)
M	examples/perplexity/perplexity.cpp

commit	6df465a91d402370bcba6676b19fad85b06ce7e0	77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b	2024-01-20T16:05:49+01:00	slaren	llama : run all KQV ops on the CPU with no KV offload (#5049)
M	ggml-backend.c
M	llama.cpp

commit	77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b	48e2b1337257bb77573bf76cfffcff3a5efa8704	2024-01-20T08:11:31Z	Herman Semenov	cmake : add support for ccache (#5002)
M	CMakeLists.txt

commit	48e2b1337257bb77573bf76cfffcff3a5efa8704	cca894f16a5eade15afd07b015e4cb3d8658943f	2024-01-20T09:05:43+01:00	adel boussaken	Add a dart/flutter binding to README.md (#4882)
M	README.md

commit	cca894f16a5eade15afd07b015e4cb3d8658943f	381ee195721d8e747ee31a60c0751822b3072f02	2024-01-20T15:01:46+08:00	Kylin	cuda : fix compile error in jetson platform (#4975)
M	ggml-cuda.cu

commit	381ee195721d8e747ee31a60c0751822b3072f02	a5cacb22b2114fd9adf61c00cbb237384d86bced	2024-01-19T13:20:50-05:00	Uzo Nweke	finetune : fix ggml_allocr lifetimes (tmp workaround) (#5033)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	a5cacb22b2114fd9adf61c00cbb237384d86bced	9b75cb2b3ccbed3df2e14c1202168db3e5145095	2024-01-19T15:24:47+02:00	Georgi Gerganov	imatrix : add README.md
A	examples/imatrix/README.md

commit	9b75cb2b3ccbed3df2e14c1202168db3e5145095	de9a147df14e62f54f879d2d15e6c4793107f4fc	2024-01-19T19:53:13+08:00	Shijie	llama : support upcoming Qwen2 (#5037)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp

commit	de9a147df14e62f54f879d2d15e6c4793107f4fc	7051aacfac0057fa5fac9ea46c55bffc3892d810	2024-01-19T13:52:22+02:00	Georgi Gerganov	py : fix flake8 lint
M	convert-hf-to-gguf.py

commit	7051aacfac0057fa5fac9ea46c55bffc3892d810	2b3b999cacc7ad1207c32fbdf3479a19c06e1a34	2024-01-19T11:39:11+02:00	Kawrakow	winogrande: evaluate log-probs in parallel (#5036)
M	examples/perplexity/perplexity.cpp

commit	2b3b999cacc7ad1207c32fbdf3479a19c06e1a34	993fba81807e55d27b570945af8e416d535eced1	2024-01-19T17:07:27+08:00	chiranko	llama : add CodeShell support (#5016)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	993fba81807e55d27b570945af8e416d535eced1	8b20858e5e9c44b99b4b31ae9c40b8f20d01d94f	2024-01-19T11:02:39+02:00	Kawrakow	perplexity: avoid unnecessary alloocations and logit copies (#5035)
M	examples/perplexity/perplexity.cpp

commit	8b20858e5e9c44b99b4b31ae9c40b8f20d01d94f	57e2a7a52a819883f40dada8a2edc24ecf48186b	2024-01-19T10:45:06+02:00	Georgi Gerganov	perplexity : faster Winogrande via batching (#5024)
M	examples/perplexity/perplexity.cpp

commit	57e2a7a52a819883f40dada8a2edc24ecf48186b	9b6ea4263ab45e02ff905bf7a29dc143ca1facc3	2024-01-18T23:12:15+01:00	John	llama : fix falcon arch for tied output embeddings (#4978)
M	llama.cpp

commit	9b6ea4263ab45e02ff905bf7a29dc143ca1facc3	821f0a271e7c9ee737945245dd7abfa22cc9b5b0	2024-01-18T23:36:07+02:00	Georgi Gerganov	cmake : add ggml public headers (#5011)
M	CMakeLists.txt

commit	821f0a271e7c9ee737945245dd7abfa22cc9b5b0	96d7f56d2918ffde1995dbb32392571deb76d7fc	2024-01-18T21:33:05+01:00	Xuan Son Nguyen	server : defer tasks when "slot unavailable" (#5018)
M	examples/server/server.cpp

commit	96d7f56d2918ffde1995dbb32392571deb76d7fc	2d5419d08ab1131623e6a1d554607b7663435e87	2024-01-18T21:12:15+01:00	slaren	llama : fix mlock with no-mmap with Metal (#5025)
M	llama.cpp

commit	2d5419d08ab1131623e6a1d554607b7663435e87	d391ae9b4919e24624cc963d82162450848beaf4	2024-01-18T21:45:51+02:00	Georgi Gerganov	imatrix : fix assert for src0 non-cont check
M	examples/imatrix/imatrix.cpp

commit	d391ae9b4919e24624cc963d82162450848beaf4	e9240cdfa06a50c1b5dbafa367cb8cd698e65103	2024-01-18T20:49:00+02:00	Georgi Gerganov	perplexity : fix winogrande N tasks option
M	examples/perplexity/perplexity.cpp

commit	e9240cdfa06a50c1b5dbafa367cb8cd698e65103	b46757735d30f5c6ed4f20ebeccc684e02d4f3bf	2024-01-18T20:45:39+02:00	Georgi Gerganov	scripts : add get-winogrande.sh
M	scripts/get-hellaswag.sh
M	scripts/get-wikitext-2.sh
A	scripts/get-winogrande.sh

commit	b46757735d30f5c6ed4f20ebeccc684e02d4f3bf	3e945cc1e9c06d2001031360e4e303e9548fb02c	2024-01-18T12:20:59-05:00	David Sommers	convert.py : fix llama/llama2 conversion due to vocab_size=-1 (#5019)
M	convert.py

commit	3e945cc1e9c06d2001031360e4e303e9548fb02c	ad19812cda4062c9f154ef16315df41fbe6a770a	2024-01-18T19:18:21+02:00	Kawrakow	HellaSwag: speed up by parallelizing log-prob evaluation (#5020)
M	examples/perplexity/perplexity.cpp

commit	ad19812cda4062c9f154ef16315df41fbe6a770a	682986a08eb5cb04865d2e713449f17304d266d8	2024-01-18T15:33:01+02:00	Georgi Gerganov	perplexity : faster HellaSwag via batching (#5017)
M	examples/perplexity/perplexity.cpp

commit	682986a08eb5cb04865d2e713449f17304d266d8	dcad445d0c83ad49bca1b58cf9c139cfcebee5d4	2024-01-18T13:46:27+02:00	Kawrakow	Add Winogrande evaluation (#5015)
M	common/common.cpp
M	common/common.h
M	examples/perplexity/perplexity.cpp

commit	dcad445d0c83ad49bca1b58cf9c139cfcebee5d4	1e605f4102c7ea8dc0dff82f5eaa6a71973d549f	2024-01-18T11:44:49+02:00	Georgi Gerganov	scritps : add helper script to get hellaswag data in txt format
A	scripts/get-hellaswag.sh

commit	1e605f4102c7ea8dc0dff82f5eaa6a71973d549f	6b6916b215251e09bd57cdbf870dc8a73345edc2	2024-01-18T08:47:24Z	Paul Tsochantaris	metal : fix memory leak, dangling pointer and unused autorel (#5007)
M	ggml-metal.m

commit	6b6916b215251e09bd57cdbf870dc8a73345edc2	38566680cdfe982a495562332c25b9227de9cf8d	2024-01-17T20:54:50+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	38566680cdfe982a495562332c25b9227de9cf8d	ba69bbc84ced580fe4fdb0713ca2d95634325b7a	2024-01-17T18:54:56+02:00	Georgi Gerganov	ggml : add IQ2 to test-backend-ops + refactoring (#4990)
M	ci/run.sh
M	ggml-backend.c
M	ggml-cuda.cu
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	ba69bbc84ced580fe4fdb0713ca2d95634325b7a	44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6	2024-01-17T18:46:30+02:00	Georgi Gerganov	imatrix : offload to GPU support (#4957)
M	ci/run.sh
M	examples/imatrix/imatrix.cpp
M	ggml.c
M	ggml.h

commit	44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6	c918fe8dca8fa1c4602427e0a4b88e20046f6c34	2024-01-17T18:39:41+02:00	Georgi Gerganov	backend : add eval callback (#4935)
M	ggml-backend.c
M	ggml-backend.h
M	llama.cpp
M	llama.h

commit	c918fe8dca8fa1c4602427e0a4b88e20046f6c34	0f83e727af0a7cadf90b7ecc1f8e35de1d0880bc	2024-01-17T18:38:39+02:00	Georgi Gerganov	metal : create autorelease pool during library build (#4970)
M	.gitignore
M	Makefile
M	ci/run.sh
M	ggml-metal.m
M	tests/CMakeLists.txt
A	tests/test-autorelease.cpp

commit	0f83e727af0a7cadf90b7ecc1f8e35de1d0880bc	4f4bf35f46600441dec2f941e667291eeb9a18d8	2024-01-17T18:37:36+02:00	Georgi Gerganov	py : fix whitespace
M	convert.py

commit	4f4bf35f46600441dec2f941e667291eeb9a18d8	2b3a665d3917edf393761a24c4835447894df74a	2024-01-17T15:45:03+02:00	Georgi Gerganov	py : fix missing added_tokens_dict for SPM and BPE vocabs (#4971)
M	convert.py

commit	2b3a665d3917edf393761a24c4835447894df74a	75632936659772d5b2ce54b0b65319fecbaac2e6	2024-01-17T12:36:37+02:00	Kawrakow	llama : use Q4_K for attn_v for Q2_K_S when n_gqa >= 4 (#4996)
M	llama.cpp

commit	75632936659772d5b2ce54b0b65319fecbaac2e6	f46c0c1b0ea0bc67e24e4bf026a7e898c1af22a9	2024-01-17T08:07:24Z	Paul Tsochantaris	metal : remove unnecessary nil check (#4986)
M	ggml-metal.m

commit	f46c0c1b0ea0bc67e24e4bf026a7e898c1af22a9	5c999609013a30c06e6fd28be8db5c2074bcc196	2024-01-17T02:17:50-05:00	David Renshaw	llama : fix copy/paste error in llama_sampling_params comment (#4994)
M	common/sampling.h

commit	5c999609013a30c06e6fd28be8db5c2074bcc196	bee938da74c33f42242c3a1058ac0a0a6eeef531	2024-01-16T20:59:31+02:00	Georgi Gerganov	py : remove unnecessary hasattr (#4903)
M	convert-hf-to-gguf.py

commit	bee938da74c33f42242c3a1058ac0a0a6eeef531	cec8a4847062fbd76253e3b085683f39d91e80d3	2024-01-16T09:56:21-08:00	Philip Taron	nix: remove nixConfig from flake.nix (#4984)
M	flake.nix

commit	cec8a4847062fbd76253e3b085683f39d91e80d3	334a835a1ccc8106a5fa355683a965efb1bfa24b	2024-01-16T18:54:24+01:00	Daniel Bevenius	finetune : add training data file to log message (#4979)
M	examples/finetune/finetune.cpp

commit	334a835a1ccc8106a5fa355683a965efb1bfa24b	4feb4b33eeb1756e46084a4db9230b279af1a480	2024-01-16T19:51:26+02:00	Kawrakow	ggml : importance matrix support for legacy quants (#4969)
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	llama.cpp

commit	4feb4b33eeb1756e46084a4db9230b279af1a480	959ef0c0df725c013c7f712eaa7790b8e38a8e20	2024-01-16T18:41:42+01:00	Maximilian Winter	examples : add complete parallel function calling example (#4974)
M	examples/pydantic-models-to-grammar-examples.py

commit	959ef0c0df725c013c7f712eaa7790b8e38a8e20	c37b3474e61d609d43cccc3bde5d559e80e4f5d1	2024-01-16T19:34:54+02:00	Georgi Gerganov	perplexity : fix kv cache handling for hellaswag (#4981)
M	examples/perplexity/perplexity.cpp

commit	c37b3474e61d609d43cccc3bde5d559e80e4f5d1	158f8c9e21302114bac3c646f80ea85b52ffa0bd	2024-01-16T19:13:54+02:00	Georgi Gerganov	flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920)
M	flake.lock

commit	158f8c9e21302114bac3c646f80ea85b52ffa0bd	862f5e41ab1fdf12d6f59455aad3f5dd8258f805	2024-01-16T17:05:19Z	Paul Tsochantaris	metal : localized logic in `ggml_metal_graph_compute` (#4924)
M	ggml-metal.h
M	ggml-metal.m

commit	862f5e41ab1fdf12d6f59455aad3f5dd8258f805	3a48d558a69c88ac17efcaa5900cd9eb19596ac4	2024-01-17T00:47:34+11:00	Neuman Vong	android : introduce starter project example (#4926)
M	.github/workflows/build.yml
A	examples/llama.android/.gitignore
A	examples/llama.android/README.md
A	examples/llama.android/app/.gitignore
A	examples/llama.android/app/build.gradle.kts
A	examples/llama.android/app/proguard-rules.pro
A	examples/llama.android/app/src/main/AndroidManifest.xml
A	examples/llama.android/app/src/main/cpp/CMakeLists.txt
A	examples/llama.android/app/src/main/cpp/llama-android.cpp
A	examples/llama.android/app/src/main/java/com/example/llama/Downloadable.kt
A	examples/llama.android/app/src/main/java/com/example/llama/Llm.kt
A	examples/llama.android/app/src/main/java/com/example/llama/MainActivity.kt
A	examples/llama.android/app/src/main/java/com/example/llama/MainViewModel.kt
A	examples/llama.android/app/src/main/java/com/example/llama/ui/theme/Color.kt
A	examples/llama.android/app/src/main/java/com/example/llama/ui/theme/Theme.kt
A	examples/llama.android/app/src/main/java/com/example/llama/ui/theme/Type.kt
A	examples/llama.android/app/src/main/res/drawable/ic_launcher_background.xml
A	examples/llama.android/app/src/main/res/drawable/ic_launcher_foreground.xml
A	examples/llama.android/app/src/main/res/mipmap-anydpi/ic_launcher.xml
A	examples/llama.android/app/src/main/res/mipmap-anydpi/ic_launcher_round.xml
A	examples/llama.android/app/src/main/res/mipmap-hdpi/ic_launcher.webp
A	examples/llama.android/app/src/main/res/mipmap-hdpi/ic_launcher_round.webp
A	examples/llama.android/app/src/main/res/mipmap-mdpi/ic_launcher.webp
A	examples/llama.android/app/src/main/res/mipmap-mdpi/ic_launcher_round.webp
A	examples/llama.android/app/src/main/res/mipmap-xhdpi/ic_launcher.webp
A	examples/llama.android/app/src/main/res/mipmap-xhdpi/ic_launcher_round.webp
A	examples/llama.android/app/src/main/res/mipmap-xxhdpi/ic_launcher.webp
A	examples/llama.android/app/src/main/res/mipmap-xxhdpi/ic_launcher_round.webp
A	examples/llama.android/app/src/main/res/mipmap-xxxhdpi/ic_launcher.webp
A	examples/llama.android/app/src/main/res/mipmap-xxxhdpi/ic_launcher_round.webp
A	examples/llama.android/app/src/main/res/values/colors.xml
A	examples/llama.android/app/src/main/res/values/strings.xml
A	examples/llama.android/app/src/main/res/values/themes.xml
A	examples/llama.android/app/src/main/res/xml/backup_rules.xml
A	examples/llama.android/app/src/main/res/xml/data_extraction_rules.xml
A	examples/llama.android/build.gradle.kts
A	examples/llama.android/gradle.properties
A	examples/llama.android/gradle/wrapper/gradle-wrapper.jar
A	examples/llama.android/gradle/wrapper/gradle-wrapper.properties
A	examples/llama.android/gradlew
A	examples/llama.android/settings.gradle.kts

commit	3a48d558a69c88ac17efcaa5900cd9eb19596ac4	7c8d3abd1a17c28fc56b1a4814bc4b29f91d7454	2024-01-16T14:41:27+01:00	Alex Azarov	metal : replace loop of dispatch_async with dispatch_apply (#4934)
M	ggml-metal.m

commit	7c8d3abd1a17c28fc56b1a4814bc4b29f91d7454	122ed4840cc6d209df6043e027f9f8a03aee01da	2024-01-16T14:33:02+01:00	Alex Azarov	metal : log `recommendedMaxWorkingSetSize` on iOS 16+ (#4936)
M	ggml-metal.m

commit	122ed4840cc6d209df6043e027f9f8a03aee01da	a0b3ac8c48b66206b9c5921ce57bd5c0ea6557c3	2024-01-16T13:10:48+01:00	Maximilian Winter	examples : fix and improv docs for the grammar generator (#4909)
M	examples/pydantic_models_to_grammar.py

commit	a0b3ac8c48b66206b9c5921ce57bd5c0ea6557c3	d75c232e1da56f19ac4d2530dadbe0ab3a11fde5	2024-01-16T03:16:33-08:00	Justine Tunney	ggml : introduce GGML_CALL function annotation (#4850)
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h

commit	d75c232e1da56f19ac4d2530dadbe0ab3a11fde5	e0324285a569d0583cf2f4a07a2402221ee25f58	2024-01-16T12:14:19+01:00	Daniel Bevenius	finetune : use LLAMA_FILE_MAGIC_GGLA (#4961)
M	examples/finetune/finetune.cpp

commit	e0324285a569d0583cf2f4a07a2402221ee25f58	3e5ca7931c68152e4ec18d126e9c832dd84914c8	2024-01-16T12:04:32+01:00	stduhpf	speculative : threading options (#4959)
M	common/common.cpp
M	common/common.h
M	examples/speculative/speculative.cpp

commit	3e5ca7931c68152e4ec18d126e9c832dd84914c8	4483396751c79dea540808b9cb9238245d06da2b	2024-01-15T20:40:48+02:00	ngc92	pass cpu-architecture arguments only to host code (C;C++) (#4943)
M	CMakeLists.txt

commit	4483396751c79dea540808b9cb9238245d06da2b	d9aa4ffa6e0296d42f1f676dd85de97c8491eb73	2024-01-15T14:06:52+01:00	David Friehs	llama : apply classifier-free guidance to logits directly (#4951)
M	common/sampling.cpp
M	llama.cpp
M	llama.h

commit	d9aa4ffa6e0296d42f1f676dd85de97c8491eb73	ddb008d845cd50bb090bf051f570130524042936	2024-01-15T04:41:46-08:00	Victor Z. Peng	awq-py : fix typo in awq-py/README.md (#4947)
M	awq-py/README.md

commit	ddb008d845cd50bb090bf051f570130524042936	2faaef39799c97a53bec3898141478700da25757	2024-01-15T13:27:00+02:00	Georgi Gerganov	cuda : fix dequantize kernel names (#4938)
M	ggml-cuda.cu

commit	2faaef39799c97a53bec3898141478700da25757	4a3156de2fac9a8ee4279de7804d4e352dcfe121	2024-01-15T10:09:38+02:00	Kawrakow	llama : check for 256 divisibility for IQ2_XS, IQ2_XXS (#4950)
M	llama.cpp

commit	4a3156de2fac9a8ee4279de7804d4e352dcfe121	a836c8f534ab789b02da149fbdaf7735500bff74	2024-01-15T07:48:06+02:00	Kawrakow	CUDA: faster dequantize kernels for Q4_0 and Q4_1 (#4938)
M	ggml-cuda.cu

commit	a836c8f534ab789b02da149fbdaf7735500bff74	467a882fd2e5b6172897b49aa45aa29bd3f27685	2024-01-14T10:46:00-05:00	David Pflug	llama : fix missing quotes (#4937)
M	llama.cpp

commit	467a882fd2e5b6172897b49aa45aa29bd3f27685	bb0c1392479398f9aba86d9ec98db0b95ede6e6d	2024-01-14T16:21:12+02:00	Kawrakow	Add ability to use importance matrix for all k-quants (#4930)
M	examples/quantize/quantize.cpp
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c

commit	bb0c1392479398f9aba86d9ec98db0b95ede6e6d	9408cfdad6b1c090a7e1419d4434edc260b7e47e	2024-01-14T13:26:53+02:00	Georgi Gerganov	llama : check LLAMA_TRACE env for extra logging (#4929)
M	llama.cpp

commit	9408cfdad6b1c090a7e1419d4434edc260b7e47e	03c526749041c863b0cd842b26b8907e1ea0e0b1	2024-01-14T11:08:09+02:00	Georgi Gerganov	scripts : sync-ggml-am.sh option to skip commits
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.last

commit	03c526749041c863b0cd842b26b8907e1ea0e0b1	a128c38de862431f1aae9ccc40b792fbc1b8b682	2024-01-14T11:03:19+02:00	Georgi Gerganov	llama : use LLAMA_LOG_ macros for logging
M	llama.cpp

commit	a128c38de862431f1aae9ccc40b792fbc1b8b682	5f5fe1bd608fa2ed42af97b5f2ea31be6625fc48	2024-01-14T10:53:39+02:00	Kawrakow	Fix ffn_down quantization mix for MoE models (#4927)
M	llama.cpp

commit	5f5fe1bd608fa2ed42af97b5f2ea31be6625fc48	ac32902a87147f78d63c931aa8a23dee762660e7	2024-01-14T09:44:39+01:00	Alex Azarov	metal : correctly set SIMD support flags on iOS (#4923)
M	ggml-metal.m

commit	ac32902a87147f78d63c931aa8a23dee762660e7	147b17ac94a24d524e367cda26a9ff6245689f34	2024-01-14T00:41:44-08:00	Karthik Kumar Viswanathan	llama : support WinXP build with MinGW 8.1.0 (#3419)
M	CMakeLists.txt
M	llama.cpp

commit	147b17ac94a24d524e367cda26a9ff6245689f34	807179ec583dcb882f97d9704577c06beb2c5ec9	2024-01-14T09:45:56+02:00	Kawrakow	2-bit quantizations (#4897)
M	examples/benchmark/benchmark-matmult.cpp
M	examples/quantize/quantize.cpp
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	807179ec583dcb882f97d9704577c06beb2c5ec9	76484fbfd355df388f71d6edaa98e1692a74de7e	2024-01-14T09:44:30+02:00	Kawrakow	Make Q3_K_S be the same as olf Q3_K_L for Mixtral-8x7B (#4906)
M	llama.cpp

commit	76484fbfd355df388f71d6edaa98e1692a74de7e	c71d608ce7a1584bf5072f197919dd24f3a6163f	2024-01-14T00:14:46+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	c71d608ce7a1584bf5072f197919dd24f3a6163f	4be5ef556de830c5c4f6e45c05ef4427823fe607	2024-01-13T21:41:37+01:00	Johannes Gäßler	ggml: cache sin/cos for RoPE (#4908)
M	ggml.c

commit	4be5ef556de830c5c4f6e45c05ef4427823fe607	0ea069b87bd296c556824e57455433b6c0357340	2024-01-13T20:45:45+02:00	Georgi Gerganov	metal : remove old API (#4919)
M	Makefile
M	examples/CMakeLists.txt
D	examples/metal/CMakeLists.txt
D	examples/metal/metal.cpp
M	ggml-metal.h
M	ggml-metal.m
M	llama.cpp

commit	0ea069b87bd296c556824e57455433b6c0357340	f172de03f11465dc6c5a0fc3a22f8ec254c6832c	2024-01-13T19:31:26+02:00	Georgi Gerganov	server : fix prompt caching with system prompt (#4914)
M	examples/server/server.cpp

commit	f172de03f11465dc6c5a0fc3a22f8ec254c6832c	2d57de525541247132e354f561ff48775fba5d85	2024-01-13T18:47:38+02:00	Georgi Gerganov	llama : fix detokenization of non-special added-tokens (#4916)
M	llama.cpp

commit	2d57de525541247132e354f561ff48775fba5d85	df845cc982e7e2ea7b9900e29d55b15338faa78d	2024-01-13T18:46:37+02:00	Georgi Gerganov	metal : disable log for loaded kernels (#4794)
M	ggml-metal.m

commit	df845cc982e7e2ea7b9900e29d55b15338faa78d	6b48ed089377330cdb362970a51c1c89b6d857a8	2024-01-13T17:29:43+01:00	David Friehs	llama : minimize size used for state save/load (#4820)
M	examples/save-load-state/save-load-state.cpp
M	llama.cpp
M	llama.h

commit	6b48ed089377330cdb362970a51c1c89b6d857a8	722d33f34ec74c6f7046109f936d0928ffe171bc	2024-01-13T16:29:16Z	Someone	workflows: unbreak nix-build-aarch64, and split it out (#4915)
A	.github/workflows/nix-ci-aarch64.yml
M	.github/workflows/nix-ci.yml

commit	722d33f34ec74c6f7046109f936d0928ffe171bc	c30b1ef39aeba497a943416d2897d69fee055b96	2024-01-14T00:09:08+08:00	Yann Follet	main : add parameter --no-display-prompt (#4541)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	c30b1ef39aeba497a943416d2897d69fee055b96	b38b5e93ae31019e87f692b69d27124eae6aac02	2024-01-13T17:06:20+01:00	texmex76	gguf : fix potential infinite for-loop (#4600)
M	ggml.c

commit	b38b5e93ae31019e87f692b69d27124eae6aac02	7dc78764e2ff86512e6e31cb0fcb8087df4b4708	2024-01-13T18:03:45+02:00	Georgi Gerganov	metal : refactor kernel loading code (#4794)
M	ggml-metal.m

commit	7dc78764e2ff86512e6e31cb0fcb8087df4b4708	356327feb3f66980ab687040495d722696d98970	2024-01-13T15:52:53+01:00	Johannes Gäßler	compare-llama-bench: tweak output format (#4910)
M	scripts/compare-llama-bench.py

commit	356327feb3f66980ab687040495d722696d98970	ee8243adaa9a9f51ff449213383874e49efe368f	2024-01-13T09:20:46-05:00	Ziad Ben Hadj-Alouane	server : fix deadlock that occurs in multi-prompt scenarios (#4905)
M	examples/server/server.cpp

commit	ee8243adaa9a9f51ff449213383874e49efe368f	15ebe59210e7fd9817ff67f51fa1a5ee2d004294	2024-01-13T14:16:11Z	makomk	server : fix crash with multimodal models without BOS token (#4904)
M	examples/server/server.cpp

commit	15ebe59210e7fd9817ff67f51fa1a5ee2d004294	de473f5f8e19ba5e659cdf5af65fb9251dce16c5	2024-01-13T13:44:37+02:00	Georgi Gerganov	convert : update phi-2 to latest HF repo (#4903)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	de473f5f8e19ba5e659cdf5af65fb9251dce16c5	f238461236f4e0e18cac1a554af23c7deadc9b01	2024-01-12T22:02:43+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	f238461236f4e0e18cac1a554af23c7deadc9b01	fa5c1fb44a2724292da545d6b7cf2a1ac0e0b989	2024-01-12T14:02:30+02:00	Georgi Gerganov	ggml : fix 32-bit ARM compat for IQ2_XS (whisper/1758)
M	ggml-quants.c

commit	fa5c1fb44a2724292da545d6b7cf2a1ac0e0b989	52ee4540c0f2e11d52c839db6eb51d014ce060e1	2024-01-12T20:38:34+01:00	slaren	backend_sched : fix assignments
M	ggml-backend.c

commit	52ee4540c0f2e11d52c839db6eb51d014ce060e1	3fe81781e3bf98b8e44946240a19f3a6ad08a11a	2024-01-12T20:46:45+01:00	Maximilian Winter	examples : add pydantic models to GBNF grammar generator (#4883)
A	examples/pydantic-models-to-grammar-examples.py
A	examples/pydantic_models_to_grammar.py

commit	3fe81781e3bf98b8e44946240a19f3a6ad08a11a	e7e4df031b9e29d4b55a4e0b0295187f6b213db1	2024-01-12T20:38:54+01:00	Johannes Gäßler	CUDA: faster q8_0 -> f16 dequantization (#4895)
M	ggml-cuda.cu

commit	e7e4df031b9e29d4b55a4e0b0295187f6b213db1	584d674be622fbf1578694ada6e62eebedbfd377	2024-01-12T20:07:38+01:00	slaren	llama : ggml-backend integration (#4766)
M	common/common.cpp
M	common/common.h
M	examples/batched-bench/batched-bench.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/server/server.cpp
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-impl.h
M	ggml-metal.m
M	ggml-opencl.cpp
M	ggml-opencl.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-backend-ops.cpp

commit	584d674be622fbf1578694ada6e62eebedbfd377	930f907d3ece1eb5b0a1ec5e209983a66dcbfa68	2024-01-12T20:54:12+02:00	Georgi Gerganov	llama : remove redundant assert for StableLM (#4901)
M	llama.cpp

commit	930f907d3ece1eb5b0a1ec5e209983a66dcbfa68	e790eef21ce659f5c16d59f8a5c8dcf6cde0692a	2024-01-12T18:54:53+01:00	Daniel Bevenius	export-lora : use LLAMA_FILE_MAGIC_GGLA (#4894)
M	examples/export-lora/export-lora.cpp

commit	e790eef21ce659f5c16d59f8a5c8dcf6cde0692a	5537d9d36bfdb4379555431f574d3d78ce6e7955	2024-01-12T05:48:00-07:00	Zay	llama.swiftui : update models layout (#4826)
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
M	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift
M	examples/llama.swiftui/llama.swiftui/UI/DownloadButton.swift
A	examples/llama.swiftui/llama.swiftui/UI/InputButton.swift

commit	5537d9d36bfdb4379555431f574d3d78ce6e7955	1b280c9fffd682b6924010a4437f0275f2921fa9	2024-01-12T14:33:21+02:00	Georgi Gerganov	gitignore : imatrix
M	.gitignore

commit	1b280c9fffd682b6924010a4437f0275f2921fa9	3cabe80630c7eeb57713cd02249053a8cf6894fa	2024-01-12T12:30:41+01:00	Johannes Gäßler	CUDA: fix softmax compile for old CUDA versions (#4862)
M	ggml-cuda.cu

commit	3cabe80630c7eeb57713cd02249053a8cf6894fa	4315a94366708828f949f9db89d2a8d99b634459	2024-01-12T13:10:19+02:00	Georgi Gerganov	llama : fix typo "imp_embd" -> "inp_embd"
M	llama.cpp

commit	4315a94366708828f949f9db89d2a8d99b634459	2d00741e12c5db4a33dfccd1125f5de4adec9a5b	2024-01-12T12:05:32+01:00	howlger	common : streamline the formatting of help (#4890)
M	common/common.cpp

commit	2d00741e12c5db4a33dfccd1125f5de4adec9a5b	f445c0e68cf8e1faca0b2aa8dfb9d48231cec301	2024-01-12T13:03:38+02:00	Georgi Gerganov	py : fix lint (#4889)
M	convert-hf-to-gguf.py

commit	f445c0e68cf8e1faca0b2aa8dfb9d48231cec301	326b418b59b6d48d854c4461a2303e8ac0a311e6	2024-01-12T13:01:56+02:00	Georgi Gerganov	llama : fix llm_build_k_shift to use correct n_rot (#4889)
M	common/common.cpp
M	convert-hf-to-gguf.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	326b418b59b6d48d854c4461a2303e8ac0a311e6	1d118386fea031f01550f8cd47a5c86296e5333f	2024-01-12T06:59:57+01:00	Kawrakow	Importance Matrix calculation (#4861)
M	Makefile
M	examples/CMakeLists.txt
A	examples/imatrix/CMakeLists.txt
A	examples/imatrix/imatrix.cpp
M	ggml.c
M	ggml.h

commit	1d118386fea031f01550f8cd47a5c86296e5333f	7edefbd79cc6dea96640edc54c6b94b2b2496d8b	2024-01-11T23:23:49+02:00	Georgi Gerganov	server : fix infill when prompt is empty (#4833)
M	examples/server/server.cpp

commit	7edefbd79cc6dea96640edc54c6b94b2b2496d8b	3ca63b4538dfc78aaec88cd2c3e3f8417c1924e3	2024-01-11T22:46:26+02:00	Georgi Gerganov	main : better name for variable n_print (#4874)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	3ca63b4538dfc78aaec88cd2c3e3f8417c1924e3	b0377875488b33f7114138687d828da1de61775d	2024-01-11T22:43:05+02:00	Georgi Gerganov	main : disable token count by default (#4874)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp

commit	b0377875488b33f7114138687d828da1de61775d	469e75d0a35b08de549a4fd87f082ca7a8a539ba	2024-01-11T21:58:28+02:00	Georgi Gerganov	swift : track ggml release branch (#4867)
M	Package.swift

commit	469e75d0a35b08de549a4fd87f082ca7a8a539ba	49662cbed3e95f5976c070b85b9fd53fd577038d	2024-01-11T20:43:15+01:00	Kawrakow	llama : restore intended k-quants mixes for MoE models (#4872)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	49662cbed3e95f5976c070b85b9fd53fd577038d	3ba5b8ca8e6181a5c712c5b77595a29f1d3e2b97	2024-01-11T20:39:39+01:00	Kawrakow	ggml : SOTA 2-bit quants (add IQ2_XS) (#4856)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-quantize-fns.cpp

commit	3ba5b8ca8e6181a5c712c5b77595a29f1d3e2b97	4330bd83feb39683de4bd7a34cfcf672ff8ac3e4	2024-01-11T21:31:31+02:00	Georgi Gerganov	swift : pin ggml commit + remove ggml.h from spm-headers (#4878)
M	Package.swift
D	spm-headers/ggml.h

commit	4330bd83feb39683de4bd7a34cfcf672ff8ac3e4	27379455c38cb13f24de92dbd6fcdd04eeb1b9d9	2024-01-11T19:02:48+01:00	Laura	server : implement credentialed CORS (#4514)
M	examples/server/server.cpp

commit	27379455c38cb13f24de92dbd6fcdd04eeb1b9d9	eab67950068e4b125007d027232c47d2a5831cd0	2024-01-11T12:51:17-05:00	Michael Coppola	server : support for multiple api keys (#4864)
M	examples/server/README.md
M	examples/server/server.cpp

commit	eab67950068e4b125007d027232c47d2a5831cd0	d8d90aa343c22fe01429d3540e47ded87e9dcb9d	2024-01-11T12:41:39-05:00	Behnam M	server : add `LOG_INFO` when model is successfully loaded (#4881)
M	examples/server/server.cpp

commit	d8d90aa343c22fe01429d3540e47ded87e9dcb9d	43f76bf1c362c067fce46bb8dcda0b64af8a9533	2024-01-11T17:22:34Z	Someone	ci: nix-flake-update: new token with pr permissions (#4879)
M	.github/workflows/nix-flake-update.yml

commit	43f76bf1c362c067fce46bb8dcda0b64af8a9533	2f043328e3116724d15b915b5c6078e2df860a69	2024-01-11T16:14:52Z	pudepiedj	main : print total token count and tokens consumed so far (#4874)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	llama.cpp

commit	2f043328e3116724d15b915b5c6078e2df860a69	2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397	2024-01-11T09:33:26-05:00	Isaac McFadyen	server : fix typo in model name (#4876)
M	examples/server/server.cpp

commit	2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397	64802ec00d6383784a9dacf616095eaced16c3c3	2024-01-11T14:31:52Z	Paul Tsochantaris	metal : put encoder debug group behind a define (#4873)
M	ggml-metal.m

commit	64802ec00d6383784a9dacf616095eaced16c3c3	3267c2abc72e34608224408ace3c048831050f97	2024-01-11T09:39:08+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	3267c2abc72e34608224408ace3c048831050f97	f85a973aa139ae6f37e8b8e1966f1d278b5e0372	2024-01-11T09:34:59+02:00	Georgi Gerganov	metal : fix deprecation warning (ggml/690)
M	ggml-metal.m

commit	f85a973aa139ae6f37e8b8e1966f1d278b5e0372	5362e43962e84d61e20b91f34991d7ccaef4a7d5	2024-01-11T02:27:48-05:00	Timothy Cronin	ggml : remove ggml_cpy_inplace and ggml_cont_inplace (ggml/693)
M	ggml.c
M	ggml.h

commit	5362e43962e84d61e20b91f34991d7ccaef4a7d5	e739de790921e6abbc8c70398303cacd74913f61	2024-01-10T06:19:19-08:00	Jack Mousseau	metal : wrap each operation in debug group (ggml/690)
M	ggml-metal.m

commit	e739de790921e6abbc8c70398303cacd74913f61	c910e3c28a1caee8cb1398143d582dd9ab697e68	2024-01-10T21:13:42+08:00	leejet	ggml : change GGML_MAX_NAME at compile time (ggml/682)
M	ggml.h

commit	c910e3c28a1caee8cb1398143d582dd9ab697e68	f34432ca1e0b288129390c1db8296a82aaf1e632	2024-01-09T11:16:37-05:00	Halalaluyafail3	Fix execlp call (ggml/689)
M	ggml.c

commit	f34432ca1e0b288129390c1db8296a82aaf1e632	7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b	2024-01-05T16:00:00+01:00	Erik Scholz	fix : cuda order of synchronization when setting a buffer (ggml/679)
M	ggml-cuda.cu

commit	7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b	5c1980d8d4c4e0c0af77359f81cc44d90b3f250b	2024-01-11T02:12:05-05:00	Behnam M	server : update readme to document the new `/health` endpoint (#4866)
M	examples/server/README.md

commit	5c1980d8d4c4e0c0af77359f81cc44d90b3f250b	cd108e641dbdedd8c5641c4cec1762f751f38136	2024-01-11T09:10:34+02:00	Georgi Gerganov	server : fix build + rename enums (#4870)
M	examples/server/server.cpp

commit	cd108e641dbdedd8c5641c4cec1762f751f38136	57d016ba2d46a6e22517a31a75cebb48f9e234b6	2024-01-10T14:56:05-05:00	Behnam M	server : add a `/health` endpoint (#4860)
M	examples/server/server.cpp

commit	57d016ba2d46a6e22517a31a75cebb48f9e234b6	329ff615699d32f596d4ebf8baba654c30064e0d	2024-01-11T01:09:53+11:00	Brian	llama : add additional suffixes for model params (#4834)
M	llama.cpp

commit	329ff615699d32f596d4ebf8baba654c30064e0d	d34633d8db6c2e400355de4862cd699154ecc73f	2024-01-10T08:39:09-05:00	Austin	llama : recognize 1B phi models (#4847)
M	llama.cpp

commit	d34633d8db6c2e400355de4862cd699154ecc73f	4f56458d34cb13dcbf69aca650e9bf77d5497e6f	2024-01-10T14:37:09+01:00	John	clip : support more quantization types (#4846)
M	examples/llava/clip.cpp

commit	4f56458d34cb13dcbf69aca650e9bf77d5497e6f	6efb8eb30e7025b168f3fda3ff83b9b386428ad6	2024-01-10T01:04:33+01:00	Johannes Gäßler	Python script to compare commits with llama-bench (#4844)
A	scripts/compare-llama-bench.py

commit	6efb8eb30e7025b168f3fda3ff83b9b386428ad6	36e5a08b203542dca53cca4eaf172c5dc4bbc991	2024-01-09T13:46:46-05:00	Austin	convert.py : fix vanilla LLaMA model conversion (#4818)
M	convert.py

commit	36e5a08b203542dca53cca4eaf172c5dc4bbc991	4dccb38d9abab7f9f2d1f9a6977df4185d490132	2024-01-09T09:59:14-08:00	Justine Tunney	llava-cli : don't crash if --image flag is invalid (#4835)
M	examples/llava/llava-cli.cpp

commit	4dccb38d9abab7f9f2d1f9a6977df4185d490132	9a818f7c42761984ac99e08e613cc20634f8410e	2024-01-09T19:37:08+02:00	Georgi Gerganov	metal : improve dequantize precision to match CPU (#4836)
M	ggml-metal.metal

commit	9a818f7c42761984ac99e08e613cc20634f8410e	18adb4e9bb340b7b4565d8b6715b4449283e7641	2024-01-09T19:20:45+02:00	Georgi Gerganov	scripts : improve get-pg.sh (#4838)
M	scripts/get-pg.sh

commit	18adb4e9bb340b7b4565d8b6715b4449283e7641	d9653894dffbfd3a58616f31b0967b34faf6f611	2024-01-10T00:45:54+08:00	iohub	readme : add 3rd party collama reference to UI list (#4840)
M	README.md

commit	d9653894dffbfd3a58616f31b0967b34faf6f611	128de3585b0f58b1e562733448fc00109f23a95d	2024-01-09T16:23:05+02:00	Georgi Gerganov	scripts : script to get Paul Graham essays in txt format (#4838)
A	scripts/get-pg.sh

commit	128de3585b0f58b1e562733448fc00109f23a95d	8c5833031857c9e9ada61948bae894ab9c785f86	2024-01-09T05:02:05-05:00	Behnam M	server : update readme about token probs (#4777)
M	examples/server/README.md

commit	8c5833031857c9e9ada61948bae894ab9c785f86	18c2e1752c3b387689e9e73d7d8a1a3b1511ce23	2024-01-09T10:12:43+01:00	Zsapi	server : add api-key flag to documentation (#4832)
M	examples/server/README.md

commit	18c2e1752c3b387689e9e73d7d8a1a3b1511ce23	8f900abfc09851e281bc9027e0ab2f16bf079b29	2024-01-09T10:42:06+02:00	Georgi Gerganov	ggml : fix vld1q_s8_x4 32-bit compat (#4828)
M	ggml-quants.c

commit	8f900abfc09851e281bc9027e0ab2f16bf079b29	1fc2f265ff9377a37fd2c61eae9cd813a3491bea	2024-01-09T08:58:55+01:00	Johannes Gäßler	CUDA: faster softmax via shared memory + fp16 math (#4742)
M	ggml-cuda.cu
M	tests/test-backend-ops.cpp

commit	1fc2f265ff9377a37fd2c61eae9cd813a3491bea	a9a8c5de3d2028701c239d821b220214fcaefbf1	2024-01-08T20:05:53+01:00	howlger	common : fix the short form of `--grp-attn-w`, not `-gat` (#4825)
M	common/common.cpp

commit	a9a8c5de3d2028701c239d821b220214fcaefbf1	dd5ae06405c5565b99889bdb3f168f4351252cfb	2024-01-08T20:25:17+02:00	Georgi Gerganov	readme : add link to SOTA models
M	README.md

commit	dd5ae06405c5565b99889bdb3f168f4351252cfb	668b31fc7d86245435ad6574e0e1126e734049e2	2024-01-08T16:02:32+01:00	Kawrakow	SOTA 2-bit quants (#4773)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-quantize-fns.cpp

commit	668b31fc7d86245435ad6574e0e1126e734049e2	42ea63c5a3da01d4a94e906d8565868012c79f4f	2024-01-08T16:40:51+02:00	Georgi Gerganov	swift : exclude ggml-metal.metal from the package (#4822)
M	Package.swift

commit	42ea63c5a3da01d4a94e906d8565868012c79f4f	52531fdff88764282c1b233174721aab8347252d	2024-01-08T15:57:36+02:00	Georgi Gerganov	llama.swiftui : update readme
M	examples/llama.swiftui/README.md

commit	52531fdff88764282c1b233174721aab8347252d	b0034d93ce2949ce7d9c098ca02e56f66cd484e2	2024-01-08T11:18:32+02:00	Georgi Gerganov	main : add self-extend support (#4815)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	llama.h

commit	b0034d93ce2949ce7d9c098ca02e56f66cd484e2	b7e7982953f80a656e03feb5cfb17a17a173eb26	2024-01-08T11:14:04+02:00	Georgi Gerganov	examples : add passkey test (#3856)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
M	examples/batched/batched.cpp
A	examples/passkey/CMakeLists.txt
A	examples/passkey/README.md
A	examples/passkey/passkey.cpp
M	llama.cpp
M	llama.h

commit	b7e7982953f80a656e03feb5cfb17a17a173eb26	226460cc0d5b185bc6685fb76f418fd9418d7add	2024-01-07T21:24:11+01:00	Lars Grammel	readme : add lgrammel/modelfusion JS/TS client for llama.cpp (#4814)
M	README.md

commit	226460cc0d5b185bc6685fb76f418fd9418d7add	d5a410e8556191672465f7ff58682ea2474038b0	2024-01-07T17:59:01+01:00	slaren	llama-bench : add no-kv-offload parameter (#4812)
M	examples/llama-bench/llama-bench.cpp

commit	d5a410e8556191672465f7ff58682ea2474038b0	9dede37d812604897496dd9d276ae9fbe13d1042	2024-01-07T17:24:08+01:00	Johannes Gäßler	CUDA: fixed redundant value dequantization (#4809)
M	ggml-cuda.cu

commit	9dede37d812604897496dd9d276ae9fbe13d1042	3c36213df850a2353e95572b3636797c79b7c815	2024-01-07T14:29:36+02:00	Georgi Gerganov	llama : remove unused vars (#4796)
M	llama.cpp

commit	3c36213df850a2353e95572b3636797c79b7c815	72d8407b3696dd1293bd233b6db392be108bc377	2024-01-07T11:21:53+02:00	Georgi Gerganov	llama : remove redundant GQA check (#4796)
M	llama.cpp

commit	72d8407b3696dd1293bd233b6db392be108bc377	d117d4dc5dadb46831036bfa4d6e5e8c86babaf1	2024-01-07T09:20:50+01:00	Alex Azarov	llama.swiftui : use llama.cpp as SPM package (#4804)
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
D	examples/llama.swiftui/llama.cpp.swift/bridging-header.h
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
D	examples/llama.swiftui/llama.swiftui/Assets.xcassets/AccentColor.colorset/Contents.json
D	examples/llama.swiftui/llama.swiftui/Preview Content/Preview Assets.xcassets/Contents.json

commit	d117d4dc5dadb46831036bfa4d6e5e8c86babaf1	3418c03ecc149fd657527ebb06776239b60a3f3b	2024-01-07T09:50:31+02:00	Georgi Gerganov	llama : print tensor meta for debugging
M	llama.cpp

commit	3418c03ecc149fd657527ebb06776239b60a3f3b	63ee677efd92060b14894b984597c62e3742b8da	2024-01-07T08:46:55+01:00	Alex Azarov	llama.swiftui : add visionOS target (#4805)
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj

commit	63ee677efd92060b14894b984597c62e3742b8da	67984921a70a7e680a24494aeb7575a66e90685d	2024-01-07T01:52:42-05:00	Konstantin Zhuravlyov	ggml : use __builtin_amdgcn_sudot4 in __dp4a for gfx11 (#4787)
M	ggml-cuda.cu

commit	67984921a70a7e680a24494aeb7575a66e90685d	c75ca5d96f902564cbbbdd7f5cade80d53c288bb	2024-01-07T08:45:26+02:00	Georgi Gerganov	server : fix n_predict check (#4798)
M	examples/server/server.cpp

commit	c75ca5d96f902564cbbbdd7f5cade80d53c288bb	96e80dabc6e73ff68b09b68947b1fc25883c5094	2024-01-06T16:12:59+01:00	Daniel Illescas Romero	llama.swiftui : use correct pointer for llama_token_eos (#4797)
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift

commit	96e80dabc6e73ff68b09b68947b1fc25883c5094	eec22a1c6378d9a013943cbddb4330c0da621442	2024-01-06T11:40:24+02:00	Georgi Gerganov	examples : improve base-translate.sh script (#4783)
M	examples/base-translate.sh

commit	eec22a1c6378d9a013943cbddb4330c0da621442	be36bb946a6336238e92706464de6a30495fe825	2024-01-05T08:04:40-08:00	a-n-n-a-l-e-e	cmake : check for openblas64 (#4134)
M	CMakeLists.txt

commit	be36bb946a6336238e92706464de6a30495fe825	91d38876dfa10332359ac671b62353aeceb448d3	2024-01-06T01:02:44+09:00	Ikko Eltociear Ashimine	flake.nix : fix typo (#4700)
M	.devops/nix/package.nix

commit	91d38876dfa10332359ac671b62353aeceb448d3	d061bf9405cc5fd50792fb2dbdff9c9ea53d6bf9	2024-01-05T16:30:52+02:00	Georgi Gerganov	metal : switch back to default.metallib (ggml/681)
M	CMakeLists.txt
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
M	ggml-metal.m
M	scripts/sync-ggml.last

commit	d061bf9405cc5fd50792fb2dbdff9c9ea53d6bf9	1bf681f90ef4cf37b36e6d604d3e30fc57eda650	2024-01-05T15:36:04+02:00	Georgi Gerganov	ggml : fix q2_k bpw in comments (ggml/680)
M	ggml-quants.h

commit	1bf681f90ef4cf37b36e6d604d3e30fc57eda650	c1d7cb28d3fed97fbc95fc3c43f0c5e2113e546c	2024-01-03T08:39:43-05:00	Finn Voorhees	ggml : add error handling to graph_compute (whisper/1714)
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-metal.h
M	ggml-metal.m

commit	c1d7cb28d3fed97fbc95fc3c43f0c5e2113e546c	3681f22443d917e7328456b69c276d6927dafeec	2024-01-05T15:18:21+02:00	Georgi Gerganov	ggml : do not sched_yield when calling BLAS (#4761)
M	ggml.c

commit	3681f22443d917e7328456b69c276d6927dafeec	b3a7c20b5c035250257d2b62851c379b159c899a	2024-01-05T15:11:10+02:00	Georgi Gerganov	examples : add few-shot translation example (#4783)
A	examples/base-translate.sh

commit	b3a7c20b5c035250257d2b62851c379b159c899a	012cf349aec8ffb47c9def5dc018240fa3721e8b	2024-01-04T20:45:37+01:00	Daniel Bevenius	finetune : remove unused includes (#4756)
M	examples/finetune/finetune.cpp

commit	012cf349aec8ffb47c9def5dc018240fa3721e8b	a91928014fcf51fe297823fcff0788de4f14206e	2024-01-04T19:56:33+02:00	Georgi Gerganov	server : send token probs for "stream == false" (#4714)
M	examples/server/server.cpp

commit	a91928014fcf51fe297823fcff0788de4f14206e	3c0b585561d74a56977cf3a3844535ecc9e37972	2024-01-04T09:43:23+01:00	Johannes Gäßler	Print backend name on test-backend-ops failure (#4751)
M	tests/test-backend-ops.cpp

commit	3c0b585561d74a56977cf3a3844535ecc9e37972	e5804313a1edaf00726ed0b96ecced07accbf50c	2024-01-04T16:22:38+08:00	singularity	llama.swiftui : support loading custom model from file picker (#4767)
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift
A	examples/llama.swiftui/llama.swiftui/UI/LoadCustomButton.swift

commit	e5804313a1edaf00726ed0b96ecced07accbf50c	dc891b7f7a23158d54f9383790b92c79cc5906c1	2024-01-04T03:17:09-05:00	Michael Coppola	server : fix options in README.md (#4765)
M	examples/server/README.md

commit	dc891b7f7a23158d54f9383790b92c79cc5906c1	46cea79e1f32499bb24b9fab12123cd386e96728	2024-01-04T10:12:26+02:00	Georgi Gerganov	ggml : include stdlib.h before intrin.h (#4736)
M	ggml-impl.h

commit	46cea79e1f32499bb24b9fab12123cd386e96728	cb1e2818e0e12ec99f7236ec5d4f3ffd8bcc2f4a	2024-01-04T15:58:16+08:00	singularity	llama.swiftui : fix build of ggml.metallib (#4754)
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj

commit	cb1e2818e0e12ec99f7236ec5d4f3ffd8bcc2f4a	ece9a45e8ffb73ad461c792720c2fec28b0137bc	2024-01-03T18:53:40+01:00	Daniel Bevenius	train : fix typo in overlapping-samples help msg (#4758)
M	common/train.cpp

commit	ece9a45e8ffb73ad461c792720c2fec28b0137bc	7bed7eba359b0fa8e575345dc5467a46b4ba509f	2024-01-03T11:30:02-06:00	Ashraful Islam	swift : update Package.swift to use ggml as dependency (#4691)
M	Package.swift

commit	7bed7eba359b0fa8e575345dc5467a46b4ba509f	d55356d3baa58a6c3a9171cb67a67094b9aa9dff	2024-01-03T14:18:46+02:00	Georgi Gerganov	cuda : simplify expression
M	ggml-cuda.cu
M	scripts/sync-ggml.last

commit	d55356d3baa58a6c3a9171cb67a67094b9aa9dff	75e3fd85814c367b55aea11e7bb38cb7b82c6aa0	2024-01-03T13:01:44+02:00	Georgi Gerganov	cuda : mark I16 and I32 ops as unsupported
M	ggml-cuda.cu

commit	75e3fd85814c367b55aea11e7bb38cb7b82c6aa0	289313716ff7ccf6aee284f686a0fe8cbc7714af	2024-01-03T11:37:44+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	289313716ff7ccf6aee284f686a0fe8cbc7714af	ab62fc3e5520f5a143c36cb23c269f11aa4dafd6	2024-01-03T11:35:46+02:00	Georgi Gerganov	metal : add kernel_get_rows_i32
M	ggml-metal.m
M	ggml-metal.metal

commit	ab62fc3e5520f5a143c36cb23c269f11aa4dafd6	5f66ebca9c41a17385341da4b553a8eb5f07edee	2024-01-03T11:25:54+02:00	Georgi Gerganov	scripts : fix sync order + metal sed
M	scripts/sync-ggml-am.sh

commit	5f66ebca9c41a17385341da4b553a8eb5f07edee	f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099	2023-12-29T18:07:03+01:00	Guillaume Wenzek	ggml : extend ggml_get_rows, ggml_repeat, ggml_concat (ggml/639)
M	ggml.c
M	tests/test-backend-ops.cpp

commit	f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099	f3f62f0d835d559e80714bbeb05d03125574e3dd	2024-01-03T03:43:19-05:00	Justin Parker	server : throw an error when `slot unavailable` (#4741)
M	examples/server/public/completion.js

commit	f3f62f0d835d559e80714bbeb05d03125574e3dd	0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99	2024-01-02T21:07:47+02:00	Georgi Gerganov	metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725)
M	ggml-metal.m
M	ggml-metal.metal

commit	0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99	540938f8904707dd74cb3be18495f853b312e72f	2024-01-02T15:48:49Z	Phil H	server : add token counts to html footer (#4738)
M	examples/server/completion.js.hpp
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
M	examples/server/public/index.html

commit	540938f8904707dd74cb3be18495f853b312e72f	0040d42eeb237197054cc7790df5776eacfa608e	2024-01-02T16:26:45+02:00	Georgi Gerganov	llama : llama_model_desc print number of experts
M	llama.cpp

commit	0040d42eeb237197054cc7790df5776eacfa608e	83e633c27efdf0eb0ba54249e784b0ea760b1007	2024-01-02T06:15:16-08:00	Marcus Dunn	llama : replace all API facing `int`'s with `int32_t` (#4577)
M	llama.cpp
M	llama.h

commit	83e633c27efdf0eb0ba54249e784b0ea760b1007	32866c5edde402f42ff4233bb89dcfcede34fd22	2024-01-02T03:51:28-08:00	postmasters	llama : differentiate the KV dims in the attention (#4657)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	llama.cpp

commit	32866c5edde402f42ff4233bb89dcfcede34fd22	5d7002d4372ebf107cfaf46fcd90df27b204f330	2024-01-02T13:28:15+02:00	Georgi Gerganov	editorconfig : fix whitespace and indentation #4710
M	examples/server/server.cpp

commit	5d7002d4372ebf107cfaf46fcd90df27b204f330	26f3071d714f0b27ad7f021a46a66a1085480258	2024-01-02T04:38:15-06:00	minarchist	server : add --override-kv parameter (#4710)
M	examples/server/server.cpp

commit	26f3071d714f0b27ad7f021a46a66a1085480258	775ac8712a7b42cfead2585f42cec0dfd56644ab	2024-01-02T16:23:38+07:00	Nam D. Tran	py : re-enable mmap in convert hf (#4732)
M	awq-py/requirements.txt
M	convert-hf-to-gguf.py

commit	775ac8712a7b42cfead2585f42cec0dfd56644ab	58ba655af054715c0516ee270ad028ad9e74f357	2024-01-02T10:16:55+01:00	Daniel Bevenius	finetune: fix typo in README.md (#4733)
M	examples/finetune/README.md

commit	58ba655af054715c0516ee270ad028ad9e74f357	edd1ab7bc34c10a780ee7f9a4499f7689cdad36d	2024-01-02T10:57:44+02:00	Georgi Gerganov	metal : enable shader debugging (cmake option) (#4705)
M	CMakeLists.txt
M	ci/run.sh
M	ggml-metal.m
M	ggml-metal.metal
M	tests/test-backend-ops.cpp

commit	edd1ab7bc34c10a780ee7f9a4499f7689cdad36d	198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a	2023-12-31T17:42:22Z	Someone Serge	flake.lock: update
M	flake.lock

commit	198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a	d8361747317c5cb2e00e7fb3b59ff4dce5a176a5	2023-12-30T18:25:25Z	Someone Serge	flake.nix: suggest the binary caches
M	flake.nix

commit	d8361747317c5cb2e00e7fb3b59ff4dce5a176a5	06f2a5d1909a1385b1a16dab4ade68377e121bdd	2023-12-30T18:01:07Z	Someone Serge	workflows: nix-ci: add a qemu job for jetsons
M	.github/workflows/nix-ci.yml

commit	06f2a5d1909a1385b1a16dab4ade68377e121bdd	c5239944bab0ff71915df8f2dc7e42fc2c138ff6	2023-12-30T17:36:08Z	Someone Serge	workflows: nix-flakestry: drop tag filters
D	.github/workflows/nix-flakestry.yml
A	.github/workflows/nix-publish-flake.yml

commit	c5239944bab0ff71915df8f2dc7e42fc2c138ff6	1e9ae54cf24d27afe3900d1250634a2a33423db1	2023-12-30T16:38:36Z	Someone Serge	workflows: weekly `nix flake update`
A	.github/workflows/nix-flake-update.yml

commit	1e9ae54cf24d27afe3900d1250634a2a33423db1	7adedecbe39bd552bc14142f496246d55a43ac4e	2023-12-30T17:19:11Z	Someone Serge	workflows: nix-ci: add a job for eval
M	.github/workflows/nix-ci.yml

commit	7adedecbe39bd552bc14142f496246d55a43ac4e	356ea17e0f92bfbbf28a4f69261bed48eff68d9c	2023-12-26T19:17:26Z	Someone Serge	workflows: nix-ci: init; build flake outputs
M	.github/workflows/build.yml
A	.github/workflows/nix-ci.yml

commit	356ea17e0f92bfbbf28a4f69261bed48eff68d9c	a5c088d8c698299b973d2709153e5d95295606d9	2023-12-29T16:21:50Z	Someone Serge	flake.nix: expose checks
M	flake.nix

commit	a5c088d8c698299b973d2709153e5d95295606d9	1e3900ebacb3a0b385271389686403c97ad76d88	2023-12-26T23:34:40Z	Someone Serge	flake.nix: rocm not yet supported on aarch64, so hide the output
M	flake.nix

commit	1e3900ebacb3a0b385271389686403c97ad76d88	e39106c0554cbd0e9310e08fb3b2a577ea4b6273	2023-12-29T16:15:37Z	Someone Serge	flake.nix: expose full scope in legacyPackages
M	.devops/nix/jetson-support.nix
M	flake.nix

commit	e39106c0554cbd0e9310e08fb3b2a577ea4b6273	9fbda719de18a9400a064c28759c39d55d687d3e	2023-12-31T11:43:31+02:00	Georgi Gerganov	ggml : add ggml_vdotq_s32 alias (#4715)
M	ggml-quants.c

commit	9fbda719de18a9400a064c28759c39d55d687d3e	39d8bc71edcb8b6f99d46fa4216af7a15232e218	2023-12-30T23:24:42+02:00	Georgi Gerganov	clip : refactor + bug fixes (#4696)
M	examples/llava/clip.cpp
M	examples/llava/clip.h
M	examples/llava/llava.cpp
M	examples/server/server.cpp

commit	39d8bc71edcb8b6f99d46fa4216af7a15232e218	24a447e20af425fa44cf10feaa632b6bb596c80f	2023-12-30T13:52:01+01:00	Johannes Gäßler	CUDA: fixed tensor cores not being used on RDNA3 (#4697)
M	ggml-cuda.cu

commit	24a447e20af425fa44cf10feaa632b6bb596c80f	a20f3c7465d6d1b33767757c2760643b799a81bf	2023-12-30T15:07:48+07:00	automaticcat	ggml : add ggml_cpu_has_avx_vnni() (#4589)
M	README.md
M	common/common.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	a20f3c7465d6d1b33767757c2760643b799a81bf	0235b9b571f3cc7d2b8836409a5404b41ce1379c	2023-12-29T23:12:53+01:00	Johannes Gäßler	CUDA: fix tensor core logic for Pascal and HIP (#4682)
M	ggml-cuda.cu

commit	0235b9b571f3cc7d2b8836409a5404b41ce1379c	ce18d727a47f2473ca863a6f78bf3ad480008f72	2023-12-29T18:53:34+02:00	Georgi Gerganov	clip : use ggml_backend_buffer_is_host (#4205)
M	examples/llava/clip.cpp

commit	ce18d727a47f2473ca863a6f78bf3ad480008f72	91bb39cec7e4dfb9e2293509ef60298a67f0b1b7	2023-12-29T11:52:15-05:00	Steward Garcia	clip : enable gpu backend (#4205)
M	examples/llava/CMakeLists.txt
M	examples/llava/clip.cpp

commit	91bb39cec7e4dfb9e2293509ef60298a67f0b1b7	04ac0607e913ab91234dfb240e12a76509e30982	2023-12-30T00:31:19+08:00	hydai	cuda: fix vmm oom issue on NVIDIA AGX Orin (#4687)
M	ggml-cuda.cu

commit	04ac0607e913ab91234dfb240e12a76509e30982	68eccbdc5b56f2a2450f9a8463f9934388cafabf	2023-12-29T09:50:29-05:00	crasm	python : add check-requirements.sh and GitHub workflow (#4585)
M	.devops/full-cuda.Dockerfile
M	.devops/full-rocm.Dockerfile
M	.devops/full.Dockerfile
M	.devops/main-rocm.Dockerfile
A	.github/workflows/python-check-requirements.yml
M	convert-hf-to-gguf.py
M	convert-lora-to-ggml.py
M	convert-persimmon-to-gguf.py
D	requirements-hf-to-gguf.txt
M	requirements.txt
A	requirements/requirements-convert-hf-to-gguf.txt
A	requirements/requirements-convert-llama-ggml-to-gguf.txt
A	requirements/requirements-convert-lora-to-ggml.txt
A	requirements/requirements-convert-persimmon-to-gguf.txt
A	requirements/requirements-convert.txt
A	scripts/check-requirements.sh

commit	68eccbdc5b56f2a2450f9a8463f9934388cafabf	97bbca6e8522d18041fcde6c3d0907a52ce36446	2023-12-29T06:42:26-08:00	Philip Taron	flake.nix : rewrite (#4605)
A	.devops/nix/apps.nix
A	.devops/nix/devshells.nix
A	.devops/nix/jetson-support.nix
A	.devops/nix/nixpkgs-instances.nix
A	.devops/nix/package.nix
A	.devops/nix/scope.nix
A	.github/workflows/nix-flakestry.yml
M	flake.lock
M	flake.nix

commit	97bbca6e8522d18041fcde6c3d0907a52ce36446	4af4801566bc262a38fb77f51edf278ac323c2bd	2023-12-29T21:39:15+07:00	Cuong Trinh Manh	cmake : fix ld warning duplicate libraries libllama.a (#4671)
M	common/CMakeLists.txt
M	examples/llava/CMakeLists.txt
M	examples/server/CMakeLists.txt
M	tests/CMakeLists.txt

commit	4af4801566bc262a38fb77f51edf278ac323c2bd	db49ff8ed7f0bb201176703441cc02911b08ef2a	2023-12-29T06:38:38-08:00	Justine Tunney	llava-cli : refactor to use sampling library (#4669)
M	examples/llava/llava-cli.cpp

commit	db49ff8ed7f0bb201176703441cc02911b08ef2a	60f55e888c29cbd87c4238dd19e85d0eef87245d	2023-12-29T06:24:12-08:00	Justine Tunney	server : replace sleep with condition variables (#4673)
M	examples/server/server.cpp

commit	60f55e888c29cbd87c4238dd19e85d0eef87245d	b93edd22f55d3e5268263c3edcdae1818505c078	2023-12-29T22:22:44+08:00	SakuraUmi	server : fix OpenAI server sampling w.r.t. penalty. (#4675)
M	examples/server/server.cpp

commit	b93edd22f55d3e5268263c3edcdae1818505c078	82d6eab224862a7044069fb9211dc4b29124264b	2023-12-29T06:22:10-08:00	Karthik Sethuraman	server : allow to generate multimodal embeddings (#4681)
M	examples/server/README.md
M	examples/server/server.cpp

commit	82d6eab224862a7044069fb9211dc4b29124264b	afd997ab6011dfefe9e917425b04ef4d83614841	2023-12-29T15:18:20+01:00	andrijdavid	main-cmake-pkg : fix build issue (#4665)
M	examples/main-cmake-pkg/CMakeLists.txt

commit	afd997ab6011dfefe9e917425b04ef4d83614841	c8255f8a6b2a3b3ebc6cb340cc2487f39fc95ffc	2023-12-29T05:58:56-08:00	Peter Sugihara	llama.swiftui : fix infinite loop, ouput timings, buff UI (#4674)
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift
M	examples/llama.swiftui/llama.swiftui/UI/DownloadButton.swift

commit	c8255f8a6b2a3b3ebc6cb340cc2487f39fc95ffc	441f51dca004debf8b275f1bdc08e0f1af7fd8f8	2023-12-29T15:12:35+02:00	Georgi Gerganov	scripts : print list of sync commits
M	scripts/sync-ggml-am.sh
M	scripts/sync-ggml.last

commit	441f51dca004debf8b275f1bdc08e0f1af7fd8f8	38b3de4658292582a8941a2be5c77b40ce6ac0f2	2023-12-29T19:23:27+09:00	Tamotsu Takahashi	ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
M	ggml-opencl.h

commit	38b3de4658292582a8941a2be5c77b40ce6ac0f2	afc8c192919f04613a92d40391bff4c8cd99856b	2023-12-29T14:56:41+02:00	Georgi Gerganov	sync : ggml
M	scripts/sync-ggml.last

commit	afc8c192919f04613a92d40391bff4c8cd99856b	ca38b8d334baa724bd6c9402470931d26427466f	2023-12-29T03:32:31-05:00	bssrdf	ggml : fix some mul mat cases + add tests for src1 F16 (ggml/669)
M	ggml-backend.c
M	ggml-cuda.cu
M	ggml.c
M	tests/test-backend-ops.cpp

commit	ca38b8d334baa724bd6c9402470931d26427466f	65e5f6dadbba4b496bba27f573e473c66b446496	2023-12-29T14:41:36+02:00	Georgi Gerganov	scripts : do not sync commits from this repo
M	scripts/sync-ggml-am.sh

commit	65e5f6dadbba4b496bba27f573e473c66b446496	ea5497df5d138c83b2b0ca70aefdc4b1175c1001	2023-12-28T11:20:00-08:00	Justine Tunney	Fix OpenAI server sampling w.r.t. temp and seed (#4668)
M	examples/server/server.cpp

commit	ea5497df5d138c83b2b0ca70aefdc4b1175c1001	f6793491b5af6da75edad34d6f503ef86d31b09f	2023-12-28T09:03:57-05:00	manikbhandari	gpt2 : Add gpt2 architecture integration (#4555)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
A	models/ggml-vocab-gpt2.gguf
M	tests/CMakeLists.txt

commit	f6793491b5af6da75edad34d6f503ef86d31b09f	879b690a9e1eb1ab0a29b58236fc76978fb4d902	2023-12-27T22:39:45+07:00	Nam D. Tran	llama : add AWQ for llama, llama2, mpt, and mistral models (#4593)
A	awq-py/README.md
A	awq-py/awq/apply_awq.py
A	awq-py/requirements.txt
M	convert-hf-to-gguf.py
M	convert.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	879b690a9e1eb1ab0a29b58236fc76978fb4d902	b47879b0dda43f2d26415e88b6840295817e552a	2023-12-27T15:16:55+01:00	Daniel Bevenius	finetune : fix output formatting in print_params (#4653)
M	examples/finetune/finetune.cpp

commit	b47879b0dda43f2d26415e88b6840295817e552a	951010fa53a0ffe81b7d2e87c4349e0d3cb3d19d	2023-12-27T11:15:31+02:00	Georgi Gerganov	scripts : add sync-ggml-am.sh
A	scripts/sync-ggml-am.sh
A	scripts/sync-ggml.last

commit	951010fa53a0ffe81b7d2e87c4349e0d3cb3d19d	f56d6077d0c37e6606ac0a4fa3169de70593acfe	2023-12-27T11:02:13+02:00	Georgi Gerganov	ggml : fix dot product for ARM (#4630)
M	ggml-quants.c

commit	f56d6077d0c37e6606ac0a4fa3169de70593acfe	dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a	2023-12-27T17:37:25+09:00	wonjun Jang	Add byte token type when tokenizer.model is not exists (#4641)
M	convert.py

commit	dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a	de8e496437c59e7d1cc84109e3e49a3478aee25a	2023-12-26T21:23:59+01:00	slaren	cuda : fix vmm pool with multi GPU (#4620)
M	ggml-cuda.cu
M	ggml.c
M	llama.cpp

commit	de8e496437c59e7d1cc84109e3e49a3478aee25a	77465dad48d7c945c367ab46b6f2ea98ae9b7b15	2023-12-26T05:42:08-05:00	WillCorticesAI	Update comment for AdamW implementation reference. (#4604)
M	ggml.c

commit	77465dad48d7c945c367ab46b6f2ea98ae9b7b15	a206137f927daef1752753cf5e281220b449a468	2023-12-26T18:38:36+08:00	FantasyGmm	Fix new CUDA10 compilation errors (#4635)
M	ggml-cuda.cu

commit	a206137f927daef1752753cf5e281220b449a468	b9f47952ffae4e0d3420905526003c23333f6c98	2023-12-25T16:09:53Z	Paul Tsochantaris	Adding Emeltal reference to UI list (#4629)
M	README.md

commit	b9f47952ffae4e0d3420905526003c23333f6c98	753be377b69bda2d65a7e089f2b7f0c53ef3495e	2023-12-24T21:01:12+01:00	slaren	simplify bug issue template (#4623)
M	.github/ISSUE_TEMPLATE/bug.md

commit	753be377b69bda2d65a7e089f2b7f0c53ef3495e	5bf3953d7e9831ea22b0bc017ce97409b801ccf1	2023-12-24T22:35:49+09:00	Shintarou Okada	llama : add PLaMo model (#3557)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp

commit	5bf3953d7e9831ea22b0bc017ce97409b801ccf1	708e179e8562c2604240df95a2241dea17fd808b	2023-12-24T14:34:22+01:00	slaren	cuda : improve cuda pool efficiency using virtual memory (#4606)
M	CMakeLists.txt
M	Makefile
M	ggml-backend.c
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-grad0.cpp

commit	708e179e8562c2604240df95a2241dea17fd808b	925e5584a058afb612f9c20bc472c130f5d0f891	2023-12-23T16:10:51+01:00	slaren	fallback to CPU buffer if host buffer alloc fails (#4610)
M	ggml-cuda.cu
M	llama.cpp

commit	925e5584a058afb612f9c20bc472c130f5d0f891	6123979952385847d8348e295d77d6e01da8aa84	2023-12-23T11:35:55+02:00	Samuel Maynard	ci(docker): fix tags in "Build and push docker image (tagged)" (#4603)
M	.github/workflows/docker.yml

commit	6123979952385847d8348e295d77d6e01da8aa84	b9ec82d262cb20d7f0a8a1157bfa9aace40e2625	2023-12-23T09:31:49Z	Alexey Parfenov	server : allow to specify custom prompt for penalty calculation (#3727)
M	common/sampling.cpp
M	common/sampling.h
M	examples/server/README.md
M	examples/server/server.cpp

commit	b9ec82d262cb20d7f0a8a1157bfa9aace40e2625	e0a4002273907b2c414b6b5442d99e08bfe2df35	2023-12-23T03:27:07-06:00	kalomaze	grammar : check the full vocab only if necessary (opt) (#4306)
M	common/sampling.cpp

commit	e0a4002273907b2c414b6b5442d99e08bfe2df35	7082d24cec35e9ce9147535a2224dfc67ee0a78c	2023-12-23T09:16:33+01:00	Johannes Gäßler	CUDA: fixed row rounding for 0 tensor splits (#4594)
M	ggml-cuda.cu

commit	7082d24cec35e9ce9147535a2224dfc67ee0a78c	ba661751322a7c201fd3bef71af077c5aebfaa2a	2023-12-22T17:05:56+01:00	LeonEricsson	lookup : add prompt lookup decoding example (#4484)
M	.gitignore
M	Makefile
M	common/common.h
M	examples/CMakeLists.txt
A	examples/lookup/CMakeLists.txt
A	examples/lookup/README.md
A	examples/lookup/lookup.cpp

commit	ba661751322a7c201fd3bef71af077c5aebfaa2a	a55876955b1a83464171de8d578d3ab062a7b62d	2023-12-22T17:53:43+02:00	Georgi Gerganov	sync : ggml (fix im2col) (#4591)
M	ggml-alloc.c
M	ggml-cuda.cu

commit	a55876955b1a83464171de8d578d3ab062a7b62d	6724ef16573ec7ecce620be56cbbff145856b2fb	2023-12-22T23:11:12+08:00	FantasyGmm	cuda : fix jetson compile error (#4560)
M	Makefile
M	README.md
M	ggml-cuda.cu
M	ggml-quants.c

commit	6724ef16573ec7ecce620be56cbbff145856b2fb	48b7ff193e64c97ab174280ba0eb8d14b47c49ba	2023-12-22T15:34:05+02:00	Henrik Forstén	Fix CudaMemcpy direction (#4599)
M	ggml-cuda.cu

commit	48b7ff193e64c97ab174280ba0eb8d14b47c49ba	48b24b170e3b4f9dc28200306840cb07d1c123df	2023-12-22T12:12:53+01:00	slaren	llama : fix platforms without mmap (#4578)
M	ggml-cuda.cu
M	ggml.c
M	llama.cpp

commit	48b24b170e3b4f9dc28200306840cb07d1c123df	28cb35a0ecb9852adc3494aa51dde60141939d64	2023-12-22T09:26:49Z	Herman Semenov	ggml : add comment about backward GGML_OP_DIAG_MASK_INF (#4203)
M	ggml.c

commit	28cb35a0ecb9852adc3494aa51dde60141939d64	f31b98489824a86c937fa62ccf5dfd4bb0327b86	2023-12-22T09:03:25+01:00	Michael Kesper	make : add LLAMA_HIP_UMA option (#4587)
M	Makefile
M	README.md

commit	f31b98489824a86c937fa62ccf5dfd4bb0327b86	2bb98279c5a087d62949972b35cf63ff974ffe6a	2023-12-21T23:56:34-07:00	rhuddleston	ci : tag docker image with build number (#4584)
M	.github/workflows/docker.yml

commit	2bb98279c5a087d62949972b35cf63ff974ffe6a	0137ef88ea9f8fd837a065700814329d24adeec3	2023-12-22T08:49:54+02:00	Deins	readme : add zig bindings (#4581)
M	README.md

commit	0137ef88ea9f8fd837a065700814329d24adeec3	c7e9701f86564088350209d2f9d71c96ea00527f	2023-12-22T06:47:01Z	bobqianic	ggml : extend `enum ggml_log_level` with `GGML_LOG_LEVEL_DEBUG` (#4579)
M	ggml.h

commit	c7e9701f86564088350209d2f9d71c96ea00527f	afefa319f1f59b002dfa0d1ef407a2c74bd9770b	2023-12-22T01:19:36-05:00	crasm	llama : add ability to cancel model loading (#4462)
M	llama.cpp
M	llama.h

commit	afefa319f1f59b002dfa0d1ef407a2c74bd9770b	769a7bc85eaa44e3d7eadf39abfeff7bb0b9cc2f	2023-12-21T23:20:49+02:00	Georgi Gerganov	ggml : change ggml_scale to take a float instead of tensor (#4573)
M	examples/baby-llama/baby-llama.cpp
M	examples/export-lora/export-lora.cpp
M	examples/finetune/finetune.cpp
M	examples/llava/clip.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-backend-ops.cpp
M	tests/test-grad0.cpp

commit	769a7bc85eaa44e3d7eadf39abfeff7bb0b9cc2f	32259b2dade6f6856739bf7ba0a4ff7b474dc760	2023-12-21T23:20:36+02:00	Georgi Gerganov	gguf-py : fix broken link
M	gguf-py/README.md

commit	32259b2dade6f6856739bf7ba0a4ff7b474dc760	4a5f9d629ecfd0a53afdddbaf54a4fa02d9a9ce9	2023-12-21T23:07:58+02:00	Georgi Gerganov	gguf : simplify example dependencies
M	Makefile
M	examples/gguf/CMakeLists.txt
M	examples/gguf/gguf.cpp

commit	4a5f9d629ecfd0a53afdddbaf54a4fa02d9a9ce9	d232aca5a73b290e218a2e48b91023d5e994203f	2023-12-21T22:36:26+02:00	Samuel Maynard	ci : add `jlumbroso/free-disk-space` to docker workflow (#4150)
M	.github/workflows/docker.yml

commit	d232aca5a73b290e218a2e48b91023d5e994203f	31f27758faf4a4bd08101a57c7ec3a473f771f86	2023-12-21T21:07:46+01:00	slaren	llama : initial ggml-backend integration (#4520)
M	Makefile
M	ggml-alloc.c
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp

commit	31f27758faf4a4bd08101a57c7ec3a473f771f86	56fa50819f7a3ca2128f63b81c17c08a4454479e	2023-12-21T11:57:48-08:00	Marcus Dunn	llama : allow getting n_batch from llama_context in c api (#4540)
M	llama.cpp
M	llama.h

commit	56fa50819f7a3ca2128f63b81c17c08a4454479e	0f630fbc924aaabeea6eaf466bb4b47d13015c3e	2023-12-21T14:55:02-05:00	Finn Voorhees	metal : fix `ggml_metal_log` vargs (#4373)
commit	0f630fbc924aaabeea6eaf466bb4b47d13015c3e	562cf222b5129e40b312877e928eac3a02e4ec33	2023-12-21T13:45:32-06:00	Erik Garrison	cuda : ROCm AMD Unified Memory Architecture (UMA) handling (#4449)
M	CMakeLists.txt
M	README.md
M	ggml-cuda.cu

commit	562cf222b5129e40b312877e928eac3a02e4ec33	8fe03ffddaaa0ab5d48feaafe398151c9f22d4f6	2023-12-21T20:13:25+01:00	arlo-phoenix	ggml-cuda: Fix HIP build by adding define for __trap (#4569)
M	ggml-cuda.cu

commit	8fe03ffddaaa0ab5d48feaafe398151c9f22d4f6	9154494808dc865475c59022c29060b4947a803b	2023-12-21T12:55:34-05:00	Jared Van Bortel	common : remove incorrect --model-draft default (#4568)
M	common/common.cpp

commit	9154494808dc865475c59022c29060b4947a803b	c083718c895b7c8c7fb2a4660643fb78d0c64dfd	2023-12-21T18:42:59+01:00	Johannes Gäßler	CUDA: mul_mat_id always on GPU for batches >= 32 (#4553)
M	ggml-cuda.cu

commit	c083718c895b7c8c7fb2a4660643fb78d0c64dfd	880e352277fc017df4d5794f0c21c44e1eae2b84	2023-12-21T19:27:14+02:00	Georgi Gerganov	readme : update coding guidelines
M	README.md

commit	880e352277fc017df4d5794f0c21c44e1eae2b84	66f35a2f48e1965a13835a523e677223dbf148be	2023-12-21T18:07:34+01:00	howlger	py : open merges file as 'utf-8' (#4566)
M	gguf-py/gguf/vocab.py

commit	66f35a2f48e1965a13835a523e677223dbf148be	139882392258671ffe5acdfcadc0bc08572d6eef	2023-12-21T17:06:44Z	bobqianic	cuda : better error message for ggml_get_rows (#4561)
M	ggml-cuda.cu

commit	139882392258671ffe5acdfcadc0bc08572d6eef	d3223afdad0ed2821a8ddf739c291cd410c92a11	2023-12-21T18:02:30+01:00	slaren	cuda : replace asserts in wrong architecture checks with __trap (#4556)
M	ggml-cuda.cu

commit	d3223afdad0ed2821a8ddf739c291cd410c92a11	1d7a1912cea2227f9a1a449758ed622c560542f9	2023-12-21T17:34:17+01:00	Johannes Gäßler	llama : disable per-tensor info prints on model load (#4562)
M	llama.cpp

commit	1d7a1912cea2227f9a1a449758ed622c560542f9	799fc2268989482054944c902874cca76337580f	2023-12-21T01:59:27-08:00	LoganDark	Fix access violation in ggml_cuda_free_data if tensor->extra is NULL (#4554)
M	ggml-cuda.cu

commit	799fc2268989482054944c902874cca76337580f	328b83de23b33240e28f4e74900d1d06726f5eb1	2023-12-20T15:41:22+01:00	Johannes Gäßler	CUDA: Faster Mixtral prompt processing (#4538)
M	ggml-cuda.cu

commit	328b83de23b33240e28f4e74900d1d06726f5eb1	a7aee47b98e45539d491071b25778b833b77e387	2023-12-19T16:17:01Z	Eric Sommerlade	ggml : fixed check for _MSC_VER (#4535)
M	ggml.h

commit	a7aee47b98e45539d491071b25778b833b77e387	0e18b2e7d0b5c0a509ea40098def234b8d4a938a	2023-12-18T22:33:45+01:00	arlo-phoenix	ggml-cuda: Fix HIP build (#4528)
M	ggml-cuda.cu

commit	0e18b2e7d0b5c0a509ea40098def234b8d4a938a	6ff39b129d0281d045f83d515e51b7197b44b253	2023-12-18T20:17:43+02:00	Georgi Gerganov	llama.swiftui : add tinyllama 1.1B F16
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift

commit	6ff39b129d0281d045f83d515e51b7197b44b253	b9e74f9bca5fdf7d0a22ed25e7a9626335fdfa48	2023-12-18T20:05:12+02:00	Georgi Gerganov	llama.swiftui : add more models
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift

commit	b9e74f9bca5fdf7d0a22ed25e7a9626335fdfa48	3c04bf6da89eaf4c7d317e0518f0687dfcbf2de7	2023-12-18T17:27:47Z	Ebey Abraham	llama : add phi-2 + fix NeoX rope + ggml_mul_mat_set_prec (#4490)
M	convert-hf-to-gguf.py
M	ggml-cuda.cu
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	3c04bf6da89eaf4c7d317e0518f0687dfcbf2de7	2994f0c5a2e8c96955b422dedc93ec2595d16b82	2023-12-18T05:14:58-08:00	hankcs	llama : fix try_override for bool_value which always return true (#4519)
M	llama.cpp

commit	2994f0c5a2e8c96955b422dedc93ec2595d16b82	b1306c439490c7fa4ec33594500d980d1e9e15e6	2023-12-17T19:39:02-05:00	Jared Van Bortel	decode : fix logits_valid for legacy API (#4516)
M	llama.cpp

commit	b1306c439490c7fa4ec33594500d980d1e9e15e6	800a489e4a8be199122259a995b1ee9dd7fae320	2023-12-17T20:16:23+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	800a489e4a8be199122259a995b1ee9dd7fae320	f7f468a97dceec2f8fe8b1ed7a2091083446ebc7	2023-12-17T19:38:41+02:00	Georgi Gerganov	llama.swiftui : add bench functionality (#4483)
M	.editorconfig
M	examples/llama.swiftui/.gitignore
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
M	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
M	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift
M	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift
A	examples/llama.swiftui/llama.swiftui/UI/DownloadButton.swift
M	llama.cpp

commit	f7f468a97dceec2f8fe8b1ed7a2091083446ebc7	919c40660fd27157b391b5832d2a577d5afef4cb	2023-12-17T10:45:46-05:00	Jared Van Bortel	gguf-py : fail fast on nonsensical special token IDs (#4489)
M	gguf-py/gguf/vocab.py

commit	919c40660fd27157b391b5832d2a577d5afef4cb	45668633fdb522a925c3dafc1ecf426f539efb27	2023-12-17T12:23:33-03:00	Matheus Gabriel Alves Silva	build : Check the ROCm installation location (#4485)
M	Makefile

commit	45668633fdb522a925c3dafc1ecf426f539efb27	0ffc92d2d23a789625f018840469af045be1e3c0	2023-12-17T16:05:56+01:00	slaren	finetune : keep allocs alive until all allocations are done (#4486)
M	examples/finetune/finetune.cpp

commit	0ffc92d2d23a789625f018840469af045be1e3c0	8edd2b40fdbcafbf630f2cf29306b29d5cb48c42	2023-12-17T17:02:16+02:00	olexiyb	server : disable llm logs if SERVER_VERBOSE is off (#3792)
M	examples/server/server.cpp

commit	8edd2b40fdbcafbf630f2cf29306b29d5cb48c42	eb16dae7e70ca97396190698b29c0f9ee3388e88	2023-12-17T15:57:56+01:00	AdithyanI	server : fix grammar being ignored (#4494)
M	examples/server/server.cpp

commit	eb16dae7e70ca97396190698b29c0f9ee3388e88	62bd52b7bf90819e75f427a95a484cd5eee0b3c7	2023-12-17T14:56:09Z	Alexey Parfenov	server : fix possible ambiguity in content type charset (#4501)
M	examples/server/server.cpp

commit	62bd52b7bf90819e75f427a95a484cd5eee0b3c7	5daa5f54fdcd2b5228add1a4c43a1897b2168f35	2023-12-17T15:54:37+01:00	mzcu	server : allow requests larger than 8K (#4500)
M	examples/server/server.cpp

commit	5daa5f54fdcd2b5228add1a4c43a1897b2168f35	c6c4fc081c1df1c60a9bfe3e6a3fd086f1a29ec7	2023-12-17T18:57:33+08:00	Bach Le	Link to cublas dynamically on Windows even with LLAMA_STATIC (#4506)
M	CMakeLists.txt

commit	c6c4fc081c1df1c60a9bfe3e6a3fd086f1a29ec7	8a5be3bd5885d79ad84aadf32bb8c1a67bd43c19	2023-12-16T18:58:46+01:00	slaren	lora : add support for non-llama models (#3333)
M	convert-lora-to-ggml.py
M	llama.cpp
M	llama.h

commit	8a5be3bd5885d79ad84aadf32bb8c1a67bd43c19	88ae8952b65cbf32eb1f5703681ea592e510e570	2023-12-15T22:16:15-05:00	Jared Van Bortel	llama : sanity checks for access to logits (#4274)
M	llama.cpp

commit	88ae8952b65cbf32eb1f5703681ea592e510e570	ee4725a686643669a8587142fa068cbf29de3ce2	2023-12-15T13:49:01+02:00	ShadovvBeast	server : add optional API Key Authentication example (#4441)
M	examples/server/public/completion.js
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	ee4725a686643669a8587142fa068cbf29de3ce2	6744dbe924a317e3e2a5a2a4a2037061b2223449	2023-12-15T12:45:50+01:00	slaren	ggml : group mul_mat_id rows by matrix (cpu only) (#4480)
M	ggml.c

commit	6744dbe924a317e3e2a5a2a4a2037061b2223449	cafcd4f89500b8afef722cdb08088eceb8a22572	2023-12-14T20:05:21+01:00	slaren	ggml : use ggml_row_size where possible (#4472)
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp
M	tests/test-quantize-perf.cpp

commit	cafcd4f89500b8afef722cdb08088eceb8a22572	c50e40016394f124b97ce39da48148b1f6c01833	2023-12-14T16:52:08+01:00	slaren	ggml : remove n_dims from ggml_tensor (#4469)
M	common/train.cpp
M	examples/baby-llama/baby-llama.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/finetune/finetune.cpp
M	examples/gguf/gguf.cpp
M	examples/llava/clip.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	c50e40016394f124b97ce39da48148b1f6c01833	20a68a7030ee06e8eb7eb8e24ae4ac52dc17803f	2023-12-14T21:44:49+09:00	wonjun Jang	py : add protobuf dependency (#4466)
M	requirements.txt

commit	20a68a7030ee06e8eb7eb8e24ae4ac52dc17803f	55e87c3749cb4985c3b316984d40e00e4df4a5d0	2023-12-14T20:13:33+08:00	LostRuins	ggml : add ggml_row_size() (fixes llama out of space) (#4461)
M	examples/benchmark/benchmark-matmult.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	55e87c3749cb4985c3b316984d40e00e4df4a5d0	873637afc7924f435ac44c067630a28e82eefa7b	2023-12-14T10:35:29+02:00	Georgi Gerganov	ggml : fix OpenCL broadcast requirement for ggml_mul (close #4453)
M	ggml.c

commit	873637afc7924f435ac44c067630a28e82eefa7b	0353a1840134b24b07ab61fd4490192f28c4db6b	2023-12-14T17:09:34+09:00	wonjun Jang	convert : support loading vocab from fast tokenizer config (#3633)
M	convert.py
M	requirements.txt

commit	0353a1840134b24b07ab61fd4490192f28c4db6b	948ff137ec37f1ec74c02905917fa0afc9b97514	2023-12-14T02:38:49-05:00	BarfingLemurs	readme : update supported model list (#4457)
M	README.md

commit	948ff137ec37f1ec74c02905917fa0afc9b97514	4d98d9a65665eee3838cef936641f640e3f5b649	2023-12-13T23:57:15+04:00	shibe2	server : fix handling of characters that span multiple tokens when streaming (#4446)
M	examples/server/server.cpp

commit	4d98d9a65665eee3838cef936641f640e3f5b649	70f806b821f603cafb6f634c93a6729dc21bb354	2023-12-13T21:54:54+02:00	Georgi Gerganov	sync : ggml (SD ops, tests, kernels) (#4444)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	tests/test-backend-ops.cpp

commit	70f806b821f603cafb6f634c93a6729dc21bb354	9fb13f95840c722ad419f390dc8a9c86080a3700	2023-12-13T12:10:10-05:00	Jared Van Bortel	build : detect host compiler and cuda compiler separately (#4414)
M	.editorconfig
M	CMakeLists.txt
M	Makefile
A	scripts/get-flags.mk

commit	9fb13f95840c722ad419f390dc8a9c86080a3700	113f9942fc73a262c85e9dcf7c2ea7336250bba0	2023-12-13T20:50:14+08:00	Siwen Yu	common : add `--version` option to show build info in CLI (#4433)
M	common/common.cpp

commit	113f9942fc73a262c85e9dcf7c2ea7336250bba0	799a1cb13b0b1b560ab0ceff485caed68faa8f1f	2023-12-13T14:05:38+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	799a1cb13b0b1b560ab0ceff485caed68faa8f1f	fecac45658a99eddc4d6e36ba0310ca8f87a77f0	2023-12-13T13:04:25+01:00	slaren	llama : add Mixtral support (#4406)
M	Makefile
M	convert-hf-to-gguf.py
M	convert.py
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/tensor_mapping.py
M	gguf-py/pyproject.toml
M	llama.cpp
M	tests/test-backend-ops.cpp

commit	fecac45658a99eddc4d6e36ba0310ca8f87a77f0	9494d7c4774ab745490b5a19570ff7747a194143	2023-12-12T04:12:35-06:00	kalomaze	server : tweak default sampling parameters (#4367)
M	examples/server/public/index.html

commit	9494d7c4774ab745490b5a19570ff7747a194143	6138963fb232cbae70c9d181db0ba125708f473d	2023-12-12T01:53:36-08:00	Richard Kiss	english : use `typos` to fix comments and logs (#4354)
M	common/log.h
M	convert.py
M	examples/llava/clip.cpp
M	examples/llava/convert-image-encoder-to-gguf.py
M	examples/lookahead/README.md
M	examples/server/json.hpp
M	examples/server/public/completion.js
M	examples/server/public/index.html
M	examples/speculative/README.md
M	examples/speculative/speculative.cpp
M	ggml-alloc.h
M	ggml-quants.c
M	ggml.c
M	gguf-py/README.md
M	llama.cpp
M	tests/test-grad0.cpp
M	tests/test-quantize-perf.cpp

commit	6138963fb232cbae70c9d181db0ba125708f473d	6391817cd19a4507c6c941a1fd08756268662b2d	2023-12-12T04:27:26-05:00	Jared Van Bortel	build : target Windows 8 for standard mingw-w64 (#4405)
M	CMakeLists.txt
M	Makefile

commit	6391817cd19a4507c6c941a1fd08756268662b2d	d9d4cfef64ea416dd66632173787d03ffb180cc7	2023-12-12T04:25:57-05:00	crasm	llama : document logits_all deprecation (#4418)
M	llama.h

commit	d9d4cfef64ea416dd66632173787d03ffb180cc7	41a11aaf99feff4901e4c8dc48ad00766c5da4e9	2023-12-12T11:25:29+02:00	Vladimir Zorin	server : fix local model name in server (#4420)
M	examples/server/server.cpp

commit	41a11aaf99feff4901e4c8dc48ad00766c5da4e9	8a7b2fa528f130631a5f43648481596ab320ed5a	2023-12-12T18:24:32+09:00	Taikono-Himazin	ggml : increased GGML_MAX_PARAMS to allow finetuning of 70b models (#4424)
M	ggml.h

commit	8a7b2fa528f130631a5f43648481596ab320ed5a	e18f7345a300920e234f732077bda660cc6cda9c	2023-12-11T06:27:38+08:00	Yueh-Po Peng	Update README.md (#4388)
M	examples/server/README.md

commit	e18f7345a300920e234f732077bda660cc6cda9c	fe680e3d1080a765e5d3150ffd7bab189742898d	2023-12-09T16:29:27-05:00	Xiang (Kevin) Li	grammar : revert the replacement of llama_token_to_piece with id_to_token (#4396)
M	llama.cpp

commit	fe680e3d1080a765e5d3150ffd7bab189742898d	bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56	2023-12-07T22:26:54+02:00	Georgi Gerganov	sync : ggml (new ops, tests, backend, etc.) (#4359)
M	.github/workflows/build.yml
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-impl.h
M	ggml-metal.h
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	scripts/sync-ggml.sh
M	tests/CMakeLists.txt
A	tests/test-backend-ops.cpp

commit	bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56	81bc9214a389362010f7a57f4cbc30e5f83a2d28	2023-12-07T13:03:17+02:00	Georgi Gerganov	llama : per-layer KV cache + quantum K cache (#4309)
M	README.md
M	common/common.cpp
M	common/common.h
M	examples/llama-bench/llama-bench.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/server/server.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	llama.cpp
M	llama.h

commit	81bc9214a389362010f7a57f4cbc30e5f83a2d28	05cd6e5036d72d0930de4d8f6be7bce09e8dda24	2023-12-07T02:25:22-08:00	Hongyu Ouyang	train : fix #4227 (double free in examples/train-text-from-scratch/train-text-from-scratch.cpp) (#4351)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	05cd6e5036d72d0930de4d8f6be7bce09e8dda24	caa9249217c5fd524b900add5ddcbeaa20cbcb12	2023-12-06T20:21:59+02:00	Georgi Gerganov	server : recognize cache_prompt parameter in OAI API (#4347)
M	examples/server/server.cpp

commit	caa9249217c5fd524b900add5ddcbeaa20cbcb12	da5eaef1f34d0a1f584cd4a092e7691ea46a9d91	2023-12-06T10:41:03+02:00	Georgi Gerganov	common : fix compile warning
M	common/sampling.cpp

commit	da5eaef1f34d0a1f584cd4a092e7691ea46a9d91	5f6e0c0dff1e7a89331e6b25eca9a9fd71324069	2023-12-06T09:08:17+01:00	stduhpf	speculative : support `--color` (#4343)
M	examples/speculative/speculative.cpp

commit	5f6e0c0dff1e7a89331e6b25eca9a9fd71324069	5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502	2023-12-05T10:55:12-10:00	Marcus Dunn	grammar : pre-computed pieces + reserve mem + less string copies (#4330)
M	llama.cpp

commit	5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502	52c8bc3cf312e1caf02d37bfb9d9d865cbe33594	2023-12-05T10:19:18-07:00	Kerfuffle	llama : allow overriding GGUF metadata when loading model (#4092)
M	common/common.cpp
M	common/common.h
M	llama.cpp
M	llama.h

commit	52c8bc3cf312e1caf02d37bfb9d9d865cbe33594	e4b76bbe316ee50fb17d9ac29e654c0edf830eba	2023-12-05T15:05:51+05:00	MaggotHATE	sampling : custom samplers order (#4285)
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/main/main.cpp

commit	e4b76bbe316ee50fb17d9ac29e654c0edf830eba	23b5e12eb5a76489b4c3ee22213a081da68b1809	2023-12-04T23:29:46-08:00	kchro3	swift : revert compiler checks for swift package (#4332)
M	Package.swift

commit	23b5e12eb5a76489b4c3ee22213a081da68b1809	d208995c6da66f252d4054c1c5a90eb8ccb7a2f7	2023-12-04T17:04:21+01:00	Daniel Bevenius	simple : update error message for KV cache check (#4324)
M	examples/simple/simple.cpp

commit	d208995c6da66f252d4054c1c5a90eb8ccb7a2f7	5c9f90cba1cc6b0a2a7d19ee5dcb73cad6331d30	2023-12-05T01:03:49+09:00	Miwa / Ensan	swift : fix concatenation method to avoid invalid UTF8 stringfication (#4325)
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift

commit	5c9f90cba1cc6b0a2a7d19ee5dcb73cad6331d30	4fa44e84adb4c78e1885694cc3513982d4af2b08	2023-12-04T22:43:45+09:00	Miwa / Ensan	swift : fix prompt tokenization logic (#4321)
M	examples/batched.swift/Sources/main.swift
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift

commit	4fa44e84adb4c78e1885694cc3513982d4af2b08	fbbc42827b2949b95bcde23ce47bb47d006c895d	2023-12-04T16:57:35+09:00	Ikko Eltociear Ashimine	grammar-parser : fix typo (#4318)
M	common/grammar-parser.cpp

commit	fbbc42827b2949b95bcde23ce47bb47d006c895d	adf3de4f69ff7e44131222f05f9c7447ac0be3cb	2023-12-03T15:56:35+02:00	Georgi Gerganov	ggml : reuse ggml_get_n_tasks() in ggml_graph_plan() (#4308)
M	ggml.c

commit	adf3de4f69ff7e44131222f05f9c7447ac0be3cb	33e171d1e9fc4903f9314b490d77fb8d58331b63	2023-12-03T15:56:22+02:00	Georgi Gerganov	ggml : fix soft max out-of-bounds access (#4307)
M	ggml.c

commit	33e171d1e9fc4903f9314b490d77fb8d58331b63	6949b50df56ee58a2d76d45487942cb211c08629	2023-12-03T01:10:43-08:00	Ed Lee	server : fix OpenAI API `stop` field to be optional (#4299)
M	examples/server/server.cpp

commit	6949b50df56ee58a2d76d45487942cb211c08629	d7b800b8bc490a221acbd83c575206a907f2f6e2	2023-12-03T10:03:25+01:00	Rickard Edén	py : add grammar to oai like api (#4294)
M	examples/server/api_like_OAI.py

commit	d7b800b8bc490a221acbd83c575206a907f2f6e2	5a7d3125e7c24f223659b7f0b7aa7736986e92c0	2023-12-03T10:58:16+02:00	Georgi Gerganov	llama : pad KV cache size (#4280)
M	ggml-metal.m
M	llama.cpp

commit	5a7d3125e7c24f223659b7f0b7aa7736986e92c0	d5a1cbde60531d02ac74da27ea355182e3a4d516	2023-12-01T20:39:12+02:00	Georgi Gerganov	llama : avoid using "optional" keyword (#4283)
M	llama.cpp

commit	d5a1cbde60531d02ac74da27ea355182e3a4d516	b220222a64ce760bfbec9c770f11db3ec6a6abb6	2023-12-01T20:35:03+02:00	Georgi Gerganov	llama : support optional tensors (#4283)
M	examples/server/server.cpp
M	llama.cpp

commit	b220222a64ce760bfbec9c770f11db3ec6a6abb6	511f52c334e37033f9c9de07b98fca4abc9470bd	2023-12-02T03:19:45+09:00	Miwa / Ensan	swift : fix token_to_piece implementation (#4278)
M	examples/batched.swift/Sources/main.swift
M	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift

commit	511f52c334e37033f9c9de07b98fca4abc9470bd	03562f3a86d6706eea9f4fc09b532946c191b34e	2023-12-01T13:18:35-05:00	Jared Van Bortel	build : enable libstdc++ assertions for debug builds (#4275)
M	CMakeLists.txt
M	Makefile

commit	03562f3a86d6706eea9f4fc09b532946c191b34e	37c746d687d877bc11803e96b4dc5f378b83c0a0	2023-12-02T02:17:06+08:00	CausalLM	llama : support attention bias on LLaMA architecture (#4283)
M	llama.cpp

commit	37c746d687d877bc11803e96b4dc5f378b83c0a0	880f57973b8e0091d0f9f50eb5ab4cd4e31582ca	2023-12-02T02:16:31+08:00	Shijie	llama : add Qwen support (#4281)
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/tensor_mapping.py
M	llama.cpp
A	prompts/chat-with-qwen.txt

commit	880f57973b8e0091d0f9f50eb5ab4cd4e31582ca	8d6d9f033b8101f929e445cf45b39e1557ca7934	2023-12-01T18:42:11+02:00	Georgi Gerganov	llama : fix integer overflow during quantization (#4284)
M	llama.cpp

commit	8d6d9f033b8101f929e445cf45b39e1557ca7934	ef47ec18da469423c276b683dd9b5741cee7023e	2023-12-01T10:41:56+01:00	Daniel Bevenius	py : add requirements file for convert-hf-to-gguf.py (#4277)
A	requirements-hf-to-gguf.txt

commit	ef47ec18da469423c276b683dd9b5741cee7023e	1d144112c0fbbb4ecc07dbcf4f05a380148bd6de	2023-12-01T10:51:24+02:00	Georgi Gerganov	ggml : add ggml_soft_max_ext (#4256)
M	examples/batched-bench/batched-bench.cpp
M	ggml-alloc.c
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	llama.cpp

commit	1d144112c0fbbb4ecc07dbcf4f05a380148bd6de	f43f09366dfd018e4568e23a232aaa8c4f7cfc78	2023-11-30T17:25:49-05:00	Ziad Ben Hadj-Alouane	server : add --log-disable to disable logging to file (#4260)
M	examples/server/server.cpp

commit	f43f09366dfd018e4568e23a232aaa8c4f7cfc78	d2809a3ba2780e00fce5a6149a7eda09f1c0e906	2023-11-30T17:25:04-05:00	Ziad Ben Hadj-Alouane	server : add single-client multi-prompt support (#4232)
M	examples/server/server.cpp

commit	d2809a3ba2780e00fce5a6149a7eda09f1c0e906	15f5d96037e597523b721aa39c874d69de2acf85	2023-11-30T17:23:44-05:00	WillCorticesAI	make : fix Apple clang determination bug (#4272)
M	Makefile

commit	15f5d96037e597523b721aa39c874d69de2acf85	33c9892af58b7b161f2a532935dcccff8c8048c6	2023-11-30T17:23:08-05:00	Jared Van Bortel	build : fix build info generation and cleanup Makefile (#3920)
M	.gitignore
M	Makefile
M	common/CMakeLists.txt
M	ggml-opencl.cpp
M	llama.cpp

commit	33c9892af58b7b161f2a532935dcccff8c8048c6	8efa0f6ebed53c9453e6721da86fb294e5015909	2023-11-30T23:11:14+01:00	John	llava : ShareGPT4V compatibility (vision encoder only loading) (#4172)
M	examples/llava/convert-image-encoder-to-gguf.py

commit	8efa0f6ebed53c9453e6721da86fb294e5015909	524907aa768a26cbf83d8e2eb30547e2ee1d1b1a	2023-11-30T13:56:19-08:00	Andrew Godfrey	main : pass LOG_TEE callback to llama.cpp log (#4033)
M	examples/main/main.cpp

commit	524907aa768a26cbf83d8e2eb30547e2ee1d1b1a	3bd2c7ce1b752973cf937482a0333e85d1681e2b	2023-12-01T05:49:21+08:00	vodkaslime	readme : fix (#4135)
M	README.md

commit	3bd2c7ce1b752973cf937482a0333e85d1681e2b	bde629bb53b85886ee0fe83524c1efe2689bc618	2023-11-30T22:46:01+01:00	Juraj Bednar	docker : add finetune option (#4211)
M	.devops/tools.sh

commit	bde629bb53b85886ee0fe83524c1efe2689bc618	f7f9e06212d44530b3200033286049dbdf84b3d3	2023-12-01T06:45:17+09:00	Miwa / Ensan	batched.swift : update README.md (#4214)
M	examples/batched.swift/README.md

commit	f7f9e06212d44530b3200033286049dbdf84b3d3	74daabae6927b99e7333d6126dee35193c418457	2023-11-30T13:44:11-08:00	Li Tan	cmake : fix the metal file foder path (#4217)
M	CMakeLists.txt

commit	74daabae6927b99e7333d6126dee35193c418457	b18c66ca6eee4fe0465cff5042daf05005dc9ab2	2023-11-30T22:43:32+01:00	Dawid Wysocki	readme : fix typo (#4253)
M	README.md

commit	b18c66ca6eee4fe0465cff5042daf05005dc9ab2	f4d973cecb7368c985720ba9100ae6abba14806d	2023-11-30T22:43:08+01:00	Daniel Bevenius	llama : fix alignment of general.name in print meta (#4254)
M	llama.cpp

commit	f4d973cecb7368c985720ba9100ae6abba14806d	954e22858c5cea1dc03e9172d3879402af2b5990	2023-11-30T22:42:23+01:00	slaren	convert.py : fix llama/llama2 conversion due to vocab_size=-1 (#4258)
M	convert.py

commit	954e22858c5cea1dc03e9172d3879402af2b5990	e2bd725f4b39bc5c6234858d158e01248f5ab5bd	2023-11-30T22:40:23+01:00	tarcey	llama : fix typical sampling (#4261)
M	llama.cpp

commit	e2bd725f4b39bc5c6234858d158e01248f5ab5bd	1f5cd83275fabb43f2ae92c30033b384a3eb37b4	2023-11-30T20:50:40Z	rhjdvsgsgks	py : fix oai proxy (#3972)
M	examples/server/api_like_OAI.py

commit	1f5cd83275fabb43f2ae92c30033b384a3eb37b4	4fea3420ee3918d125d74c94d962a6ea82875351	2023-11-29T11:00:17+02:00	Georgi Gerganov	examples : add readme files
A	examples/lookahead/README.md
A	examples/speculative/README.md

commit	4fea3420ee3918d125d74c94d962a6ea82875351	64e64aa2557d97490b2fe1262b313e2f4a1607e3	2023-11-28T23:16:34-08:00	Peter Sugihara	readme : add FreeChat (#4248)
M	README.md

commit	64e64aa2557d97490b2fe1262b313e2f4a1607e3	8406b0924bf323f37d536dee8b8165c1f3d9d11d	2023-11-28T04:51:11-05:00	Jared Van Bortel	ggml : restore abort() in GGML_ASSERT (#4242)
M	ggml.h

commit	8406b0924bf323f37d536dee8b8165c1f3d9d11d	b38a16dfcff88d547f78f52d1bea31b84a05aff7	2023-11-28T10:32:03+02:00	Georgi Gerganov	ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240)
M	ggml.c
M	llama.cpp

commit	b38a16dfcff88d547f78f52d1bea31b84a05aff7	0dab8cd7cca7e1bc3550dcb4797b9062cdbb1ebd	2023-11-27T15:25:42-04:00	bandoti	cmake : fix issue with version info not getting baked into LlamaConfig.cmake (#3970)
M	CMakeLists.txt
M	common/CMakeLists.txt
M	scripts/build-info.cmake
A	scripts/gen-build-info-cpp.cmake

commit	0dab8cd7cca7e1bc3550dcb4797b9062cdbb1ebd	bb03290c17540768a16000a2b01ee4f22440aba1	2023-11-28T01:39:42+08:00	Kasumi	readme : add Amica to UI list (#4230)
M	README.md

commit	bb03290c17540768a16000a2b01ee4f22440aba1	f3b269813f6147c5b5cda082e6b45cf04a932e0d	2023-11-27T09:56:52-05:00	Bailey Chittle	examples : iOS example with swift ui (#4159)
M	.github/workflows/build.yml
A	examples/llama.swiftui/.gitignore
A	examples/llama.swiftui/README.md
A	examples/llama.swiftui/llama.cpp.swift/LibLlama.swift
A	examples/llama.swiftui/llama.cpp.swift/bridging-header.h
A	examples/llama.swiftui/llama.swiftui.xcodeproj/project.pbxproj
A	examples/llama.swiftui/llama.swiftui.xcodeproj/project.xcworkspace/contents.xcworkspacedata
A	examples/llama.swiftui/llama.swiftui.xcodeproj/project.xcworkspace/xcshareddata/IDEWorkspaceChecks.plist
A	examples/llama.swiftui/llama.swiftui/Assets.xcassets/AccentColor.colorset/Contents.json
A	examples/llama.swiftui/llama.swiftui/Assets.xcassets/AppIcon.appiconset/Contents.json
A	examples/llama.swiftui/llama.swiftui/Assets.xcassets/Contents.json
A	examples/llama.swiftui/llama.swiftui/Models/LlamaState.swift
A	examples/llama.swiftui/llama.swiftui/Preview Content/Preview Assets.xcassets/Contents.json
A	examples/llama.swiftui/llama.swiftui/Resources/models/.gitignore
A	examples/llama.swiftui/llama.swiftui/UI/ContentView.swift
A	examples/llama.swiftui/llama.swiftui/llama_swiftuiApp.swift

commit	f3b269813f6147c5b5cda082e6b45cf04a932e0d	3e73d31d9cc0232882ce61c64742aff3ecfec416	2023-11-26T22:58:43-05:00	Jared Van Bortel	ggml : fix -Warray-bounds warning with gcc (#4231)
M	ggml.c

commit	3e73d31d9cc0232882ce61c64742aff3ecfec416	9656026b53236ed7328458269c4c798dd50ac8d1	2023-11-26T21:51:46+02:00	Georgi Gerganov	lookahead : support `-n -1` infinite generation
M	examples/lookahead/lookahead.cpp

commit	9656026b53236ed7328458269c4c798dd50ac8d1	922754a8d60080e956891f6cee1fb03aa48d57c6	2023-11-26T20:42:51+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	922754a8d60080e956891f6cee1fb03aa48d57c6	22da05536ff4ad963080773bef1fb839fdab95d3	2023-11-26T20:33:07+02:00	Georgi Gerganov	lookahead : add example for lookahead decoding (#4207)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/lookahead/CMakeLists.txt
A	examples/lookahead/lookahead.cpp

commit	22da05536ff4ad963080773bef1fb839fdab95d3	1ddb52ec38f9931925a587f45a23b1c37152c028	2023-11-26T02:30:02-06:00	Xiao-Yong Jin	metal : fix yarn (#4220)
M	ggml-metal.m

commit	1ddb52ec38f9931925a587f45a23b1c37152c028	f837c3a992b2b6146936cb120871a8cf9d0e3857	2023-11-25T22:45:02+01:00	Galunid	scripts : Use mmap in torch load (#4202)
M	convert-hf-to-gguf.py

commit	f837c3a992b2b6146936cb120871a8cf9d0e3857	3014b5415d08e3dff961da6eea835b9760a701b8	2023-11-25T08:58:23-08:00	Marcus Dunn	llama : grammar `reserve` space in `decode_utf8` (#4210)
M	llama.cpp

commit	3014b5415d08e3dff961da6eea835b9760a701b8	04814e718edb13bdf8cca861dc2e5ab4e1995c30	2023-11-25T10:47:07-05:00	crasm	Update docs for yarn_ext_factor <0.0 as unspecified instead of NaN (#4189)
M	convert.py
M	llama.h

commit	04814e718edb13bdf8cca861dc2e5ab4e1995c30	af19d3573481d409b3c4e55494810eb1f65a9aae	2023-11-25T12:02:13+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	af19d3573481d409b3c4e55494810eb1f65a9aae	e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb	2023-11-25T11:29:06+02:00	Georgi Gerganov	server : OAI API compatibility (#4198)
M	examples/server/README.md
M	examples/server/server.cpp

commit	e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb	8a052c131ed3525313cdb84e5ae4e2b6cf8d2e24	2023-11-24T18:10:01+01:00	slaren	llama : set metal log callback correctly (#4204)
M	llama.cpp

commit	8a052c131ed3525313cdb84e5ae4e2b6cf8d2e24	189d68446e7ef21e8f3af3c0a3d91c35a39aec89	2023-11-24T18:04:31+01:00	slaren	ggml-cuda : support stablelm rope (#4156)
M	ggml-cuda.cu
M	llama.cpp

commit	189d68446e7ef21e8f3af3c0a3d91c35a39aec89	2568a4bf548d7392e9c78c008b33b4c11d53fe95	2023-11-24T15:02:49+01:00	Galunid	convert : fix tensors using grad in some models (#4173)
M	convert-hf-to-gguf.py

commit	2568a4bf548d7392e9c78c008b33b4c11d53fe95	b35f3d0def3efde92ed465d92a267430d957e87d	2023-11-24T18:25:10+09:00	eastriver	main.swift : fix eos checking (#4197)
M	examples/batched.swift/Sources/main.swift

commit	b35f3d0def3efde92ed465d92a267430d957e87d	55978ce09b69d3987d17d08d92d8cc27193e0773	2023-11-24T16:52:39+09:00	Aaryaman Vasishta	readme : use PATH for Windows ROCm (#4195)
M	README.md

commit	55978ce09b69d3987d17d08d92d8cc27193e0773	6b0a7420d03b9d13cb0e9439a01ce8476d8bf093	2023-11-23T13:56:53-08:00	Haohui Mai	Fix incorrect format strings and uninitialized variables. (#4133)
M	examples/server/server.cpp
M	ggml-cuda.cu

commit	6b0a7420d03b9d13cb0e9439a01ce8476d8bf093	d103d935c0e75769a6a597f7a64cab72c6cc3e79	2023-11-23T19:07:56+02:00	Georgi Gerganov	llama : KV cache view API + better KV cache management (#4170)
M	common/common.cpp
M	common/common.h
M	examples/parallel/parallel.cpp
M	llama.cpp
M	llama.h

commit	d103d935c0e75769a6a597f7a64cab72c6cc3e79	9d5949f04b1f8b76184818abbd99938c2020803f	2023-11-23T13:51:22+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	9d5949f04b1f8b76184818abbd99938c2020803f	ff8238f71d56245f4a6dbea693f4ebd81263464d	2023-11-23T12:34:20+01:00	Daniel Bevenius	examples : fix typo in parallel example doc comment (#4181)
M	examples/parallel/parallel.cpp

commit	ff8238f71d56245f4a6dbea693f4ebd81263464d	8e672efe632bb6a7333964a255c4b96f018b9a65	2023-11-23T11:35:04+02:00	Georgi Gerganov	docs : add llama-star arch idea
A	docs/llama-star/idea-arch.key
A	docs/llama-star/idea-arch.pdf

commit	8e672efe632bb6a7333964a255c4b96f018b9a65	0b871f1a04ef60e114bbe43004fd9c21114e802d	2023-11-21T16:22:30+01:00	Galunid	stablelm : simplify + speedup generation (#4153)
M	llama.cpp

commit	0b871f1a04ef60e114bbe43004fd9c21114e802d	dfc7cd48b1cc31d759c093e917a18c0efe03d0e8	2023-11-20T19:30:00+01:00	Galunid	finetune - update readme to mention llama support only (#4148)
M	examples/finetune/README.md

commit	dfc7cd48b1cc31d759c093e917a18c0efe03d0e8	881800d1f083c39431cef288347082be516d1c80	2023-11-21T00:02:46+09:00	Aaryaman Vasishta	readme : update ROCm Windows instructions (#4122)
M	README.md

commit	881800d1f083c39431cef288347082be516d1c80	f23c0359a32871947169a044eb1dc4dbffd0f405	2023-11-21T00:26:59+10:30	Seb C	main : Add ChatML functionality to main example (#4046)
M	common/common.cpp
M	common/common.h
M	examples/infill/infill.cpp
M	examples/main/main.cpp

commit	f23c0359a32871947169a044eb1dc4dbffd0f405	40a34fe8d034bd484efd79ccbb95059ca6308dcb	2023-11-20T11:35:47+01:00	Galunid	ci : add flake8 to github actions (python linting) (#4129)
A	.github/workflows/python-lint.yml
M	convert-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	gguf-py/gguf/gguf_writer.py
M	tests/test-tokenizer-0-falcon.py
M	tests/test-tokenizer-0-llama.py

commit	40a34fe8d034bd484efd79ccbb95059ca6308dcb	dae06c06e5c6232ae2be4d567dd5101e1e96c814	2023-11-20T03:50:04-06:00	Branden Butler	speculative : fix prompt tokenization in speculative example (#4025)
M	examples/speculative/speculative.cpp

commit	dae06c06e5c6232ae2be4d567dd5101e1e96c814	05e8301e4593e2a67b4bae24f093dd12ce5cc7c2	2023-11-19T19:16:07+02:00	Georgi Gerganov	Revert "finetune : add --n-gpu-layers flag info to --help (#4128)"
M	examples/finetune/finetune.cpp

commit	05e8301e4593e2a67b4bae24f093dd12ce5cc7c2	936c79b2275a8f15f3512e63de615c676904d650	2023-11-19T11:56:38-05:00	Clark Saben	finetune : add --n-gpu-layers flag info to --help (#4128)
M	examples/finetune/finetune.cpp

commit	936c79b2275a8f15f3512e63de615c676904d650	262005ad9ded375e9c544a02c18ef6254fe185a2	2023-11-19T11:54:10-05:00	SoftwareRenderer	server : relay error messages (#4131)
M	examples/server/public/completion.js
M	examples/server/server.cpp

commit	262005ad9ded375e9c544a02c18ef6254fe185a2	35985acffaab1eb4ffcbc22c86063bc630f24a89	2023-11-19T08:52:57-08:00	kchro3	common : comma should be semicolon (#4137)
M	common/common.cpp

commit	35985acffaab1eb4ffcbc22c86063bc630f24a89	e937066420b79a757bf80e9836eb12b88420a218	2023-11-19T18:50:49+02:00	Georgi Gerganov	gitignore : tokenize
M	.gitignore

commit	e937066420b79a757bf80e9836eb12b88420a218	28a2e6e7d476717881be6eb9e2d3331342cec57b	2023-11-19T11:10:52+01:00	slaren	gguf-py : export chat templates (#4125)
M	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	llama.cpp

commit	28a2e6e7d476717881be6eb9e2d3331342cec57b	0b5c3b04572a05f80163a365070fb377a837ac27	2023-11-18T14:48:17-07:00	Kerfuffle	tokenize example: Respect normal add BOS token behavior (#4126)
M	Makefile
M	examples/tokenize/tokenize.cpp

commit	0b5c3b04572a05f80163a365070fb377a837ac27	2923f17f6fec049a71186636c3c4d96408856194	2023-11-18T21:08:33+01:00	Galunid	scripts : Remove missed baichuan convert script (#4127)
D	convert-baichuan-hf-to-gguf.py

commit	2923f17f6fec049a71186636c3c4d96408856194	bbecf3f415797f812893947998bda4f866fa900e	2023-11-18T08:11:18-07:00	Kerfuffle	Clean up ggml-cuda.cu warnings when compiling with clang (for ROCM) (#4124)
M	ggml-cuda.cu

commit	bbecf3f415797f812893947998bda4f866fa900e	8e9361089dd31ae9ae59452a8ee409fd51a16371	2023-11-17T20:39:11+01:00	slaren	llama : increase max nodes (#4115)
M	llama.cpp

commit	8e9361089dd31ae9ae59452a8ee409fd51a16371	5ad387e994dde77a47ec547a4a65f7611dc325f4	2023-11-17T17:11:23+01:00	Roger Meier	build : support ppc64le build for make and CMake (#3963)
M	CMakeLists.txt
M	Makefile
M	ggml-quants.c

commit	5ad387e994dde77a47ec547a4a65f7611dc325f4	2fa02b4b3d86182381311c98b75065ee1b7c2930	2023-11-17T18:01:38+02:00	Georgi Gerganov	tokenize : fix trailing whitespace
M	examples/tokenize/tokenize.cpp

commit	2fa02b4b3d86182381311c98b75065ee1b7c2930	2ab0707acbf3a3ca9e5bc5959c7920c22eba2257	2023-11-17T17:36:44+02:00	zakkor	examples : add tokenize (#4039)
M	examples/CMakeLists.txt
A	examples/tokenize/CMakeLists.txt
A	examples/tokenize/tokenize.cpp

commit	2ab0707acbf3a3ca9e5bc5959c7920c22eba2257	11173c92d6eaa2bd1308c2389f44f838480836ac	2023-11-17T07:32:34-08:00	Don Mahurin	convert : use 'model' value if it exists. This allows karpathy/tinyllamas to load (#4089)
M	convert.py

commit	11173c92d6eaa2bd1308c2389f44f838480836ac	9e87ef60e18d69338c5efea314aa7e718bf2040a	2023-11-17T16:24:30+01:00	John	py : Falcon HF compatibility (#4104)
M	convert-hf-to-gguf.py

commit	9e87ef60e18d69338c5efea314aa7e718bf2040a	c7cce1246e248124117ae5bc058923e3ade95f11	2023-11-17T16:24:07+01:00	Jannis Schönleber	common : improve yaml log escaping (#4080)
M	common/common.cpp

commit	c7cce1246e248124117ae5bc058923e3ade95f11	f7d5e975424ff0eea55ca5a9181ac8e15553c1fc	2023-11-17T10:22:56-05:00	Huawei Lin	llava : fix compilation warning that fread return value is not used (#4069)
M	examples/llava/llava.cpp

commit	f7d5e975424ff0eea55ca5a9181ac8e15553c1fc	ba4cf5c0bf37a729d29e899dadf14541cddd23d4	2023-11-17T16:20:53+01:00	Jiří Podivín	py : remove superfluous import statements (#4076)
M	convert-baichuan-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	examples/finetune/convert-finetune-checkpoint-to-gguf.py
M	tests/test-tokenizer-0-falcon.py
M	tests/test-tokenizer-0-llama.py

commit	ba4cf5c0bf37a729d29e899dadf14541cddd23d4	e85bb1a8e736228a1f0d965777de5f77f22834b8	2023-11-17T16:19:16+01:00	Jiří Podivín	train : move number of gpu layers argument parsing to common/train.cpp (#4074)
M	common/train.cpp
M	examples/finetune/finetune.cpp

commit	e85bb1a8e736228a1f0d965777de5f77f22834b8	3e916a07ac093045d88ef0c4fa78647ae0efc010	2023-11-17T16:17:37+01:00	slaren	llama : add functions to get the model's metadata (#4013)
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	3e916a07ac093045d88ef0c4fa78647ae0efc010	947f64f1630bb8b0b363a3bb5e29e11425312d57	2023-11-17T14:48:19Z	gwjr	finetune : speed-up ggml_compute_forward_out_prod_f32 via BLAS (#4079)
M	ggml.c

commit	947f64f1630bb8b0b363a3bb5e29e11425312d57	b83e149ec6264d078e6a47412e7347bf5c2bfcc9	2023-11-17T02:23:11-08:00	Andrew Godfrey	finetune : zero the loraB initial vectors (#4082)
M	examples/finetune/finetune.cpp

commit	b83e149ec6264d078e6a47412e7347bf5c2bfcc9	4f447a48339977073a1af4f33ae873465ff64994	2023-11-17T00:01:15-08:00	Andrew Godfrey	cuda : get_row_rounding F32 (#4095)
M	ggml-cuda.cu

commit	4f447a48339977073a1af4f33ae873465ff64994	91f6499393d2d999331fbfdba47a7f8b9f913f0d	2023-11-17T10:00:15+02:00	Georgi Gerganov	llama : fix data units (#4101)
M	ggml-cuda.cu
M	ggml-metal.m
M	llama.cpp

commit	91f6499393d2d999331fbfdba47a7f8b9f913f0d	8da46278e1a57107591653275f8e03a281de94f0	2023-11-16T19:14:37-07:00	Kerfuffle	Respect tokenizer.ggml.add_bos_token value when tokenizing (#4040)
M	common/common.cpp
M	common/common.h
M	examples/infill/infill.cpp
M	examples/llava/llava-cli.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
M	gguf-py/scripts/gguf-dump.py
M	llama.cpp
M	llama.h

commit	8da46278e1a57107591653275f8e03a281de94f0	a6fc554e268634494f33b0de76f9dde650dd292f	2023-11-16T16:01:48+01:00	texmex76	gguf : fix potential infinite loops while parsing (#4100)
M	ggml.c

commit	a6fc554e268634494f33b0de76f9dde650dd292f	1cf2850d52bb027aa215e039ed9a0c61beeef8d3	2023-11-15T11:34:47-05:00	Jared Van Bortel	llama : restore prefix space in llama tokenizer (#4081)
M	llama.cpp

commit	1cf2850d52bb027aa215e039ed9a0c61beeef8d3	6bb4908a17150b49373b5f977685b2e180a04f6f	2023-11-15T13:58:13+01:00	slaren	ggml-cuda : increase max graph size (#4084)
M	ggml-cuda.cu

commit	6bb4908a17150b49373b5f977685b2e180a04f6f	36eed0c42c5b0bf74af81fb9243d262014f9382f	2023-11-14T09:34:41-08:00	Michael Potter	Fix MacOS Sonoma model quantization (#4052)
M	CMakeLists.txt
M	Makefile
M	ggml-quants.c

commit	36eed0c42c5b0bf74af81fb9243d262014f9382f	b46d12f86d56bef3dc8b596dfb3d22f3b08102be	2023-11-14T11:17:12+01:00	Galunid	stablelm : StableLM support (#3586)
M	README.md
M	convert-hf-to-gguf.py
M	gguf-py/gguf/constants.py
M	llama.cpp
A	models/ggml-vocab-stablelm-3b-4e1t.gguf
M	tests/CMakeLists.txt

commit	b46d12f86d56bef3dc8b596dfb3d22f3b08102be	bd90eca237b498dd106d315dcb9ad3e6fae3906f	2023-11-13T17:03:40-08:00	afrideva	convert.py: also look for plain model.safetensors  (#4043)
M	convert.py

commit	bd90eca237b498dd106d315dcb9ad3e6fae3906f	3d68f364f15778dc326f5024f2e5af1ad6dfddef	2023-11-13T18:20:52+03:00	M. Yusuf Sarıgöz	llava : fix regression for square images in #3613 (#4056)
M	examples/llava/clip.cpp

commit	3d68f364f15778dc326f5024f2e5af1ad6dfddef	c049b37d7baf558944501705b91ac89b26ee3e41	2023-11-13T16:55:52+02:00	Georgi Gerganov	ggml : sync (im2col, GPU conv, 32-bit arm compat) (#4060)
M	ggml-cuda.cu
M	ggml-impl.h
M	ggml-metal.h
M	ggml-metal.m
M	ggml-metal.metal
M	ggml-quants.c
M	ggml.c
M	ggml.h

commit	c049b37d7baf558944501705b91ac89b26ee3e41	4760e7cc0b68570d58f55e8dda469805d1759d0d	2023-11-13T14:18:08+02:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	4760e7cc0b68570d58f55e8dda469805d1759d0d	bb50a792ec2a49944470c82694fa364345e95170	2023-11-13T14:16:23+02:00	Georgi Gerganov	sync : ggml (backend v2) (#3912)
M	common/train.cpp
M	common/train.h
M	examples/benchmark/benchmark-matmult.cpp
M	examples/export-lora/export-lora.cpp
M	examples/finetune/finetune.cpp
M	examples/llava/clip.cpp
M	examples/metal/metal.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml-alloc.h
A	ggml-backend-impl.h
M	ggml-backend.c
M	ggml-backend.h
M	ggml-cuda.cu
M	ggml-impl.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/sync-ggml.sh
M	tests/test-grad0.cpp
M	tests/test-opt.cpp

commit	bb50a792ec2a49944470c82694fa364345e95170	21fd874c8d2a14dea2d56724e4357c0824aee6a8	2023-11-13T01:58:15-07:00	Kerfuffle	Add ReLU and SQR CUDA ops to (partially) fix Persimmon offloading (#4041)
M	ggml-cuda.cu
M	llama.cpp

commit	21fd874c8d2a14dea2d56724e4357c0824aee6a8	532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd	2023-11-12T16:39:37-07:00	Kerfuffle	gguf-py: gguf_writer: Use bytearray to build metadata (#4051)
M	gguf-py/gguf/gguf_writer.py
M	gguf-py/pyproject.toml

commit	532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd	e86fc56f7521ca4b18d1d9939e82abd40c2f1c01	2023-11-11T22:04:58-08:00	Richard Kiss	Fix some documentation typos/grammar mistakes (#4032)
M	README.md
M	docs/token_generation_performance_tips.md
M	examples/main/README.md
M	examples/parallel/README.md
M	grammars/README.md

commit	e86fc56f7521ca4b18d1d9939e82abd40c2f1c01	d96ca7ded77df764db797b68b4a29e34c5b56285	2023-11-11T18:35:31+03:00	M. Yusuf Sarıgöz	Fix gguf-convert-endian script (#4037)
M	gguf-py/pyproject.toml
M	gguf-py/scripts/gguf-convert-endian.py

commit	d96ca7ded77df764db797b68b4a29e34c5b56285	34b0a082074b073eb14c2bd93c0c070e20ddcd16	2023-11-11T05:48:21Z	Alexey Parfenov	server : fix crash when prompt exceeds context size (#3996)
M	examples/server/server.cpp

commit	34b0a082074b073eb14c2bd93c0c070e20ddcd16	4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf	2023-11-10T22:04:50-07:00	Kerfuffle	gguf-py: Refactor and allow reading/modifying existing GGUF files (#3981)
M	convert-baichuan-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-persimmon-to-gguf.py
M	convert.py
M	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py
M	gguf-py/README.md
A	gguf-py/examples/writer.py
M	gguf-py/gguf/__init__.py
A	gguf-py/gguf/constants.py
M	gguf-py/gguf/gguf.py
A	gguf-py/gguf/gguf_reader.py
A	gguf-py/gguf/gguf_writer.py
A	gguf-py/gguf/tensor_mapping.py
A	gguf-py/gguf/vocab.py
M	gguf-py/pyproject.toml
A	gguf-py/scripts/__init__.py
A	gguf-py/scripts/gguf-convert-endian.py
A	gguf-py/scripts/gguf-dump.py
A	gguf-py/scripts/gguf-set-metadata.py
M	gguf-py/tests/test_gguf.py

commit	4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf	df9d1293defe783f42bc83af732d3c670552c541	2023-11-11T06:49:33+08:00	Jhen-Jie Hong	server : allow continue edit on completion mode (#3950)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	df9d1293defe783f42bc83af732d3c670552c541	a75fa576abba9d37f463580c379e4bbf1e1ad03c	2023-11-10T14:24:54+01:00	Galunid	Unbreak persimmon after #3837 (#4010)
M	llama.cpp

commit	a75fa576abba9d37f463580c379e4bbf1e1ad03c	57ad015dc3011b046ed5a23186c86ea55f987c54	2023-11-09T11:09:29+01:00	Galunid	scripts: Generalize convert scripts (#3838)
D	convert-bloom-hf-to-gguf.py
D	convert-falcon-hf-to-gguf.py
D	convert-gptneox-hf-to-gguf.py
A	convert-hf-to-gguf.py
D	convert-mpt-hf-to-gguf.py
D	convert-refact-hf-to-gguf.py
D	convert-starcoder-hf-to-gguf.py
M	convert.py
M	mypy.ini

commit	57ad015dc3011b046ed5a23186c86ea55f987c54	875fb42871a0f5a88fbe31a0b5edd697b84038e4	2023-11-09T04:00:34+02:00	Mihai	server : add min_p param (#3877)
M	examples/server/README.md
M	examples/server/index.html.hpp
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	875fb42871a0f5a88fbe31a0b5edd697b84038e4	0a7c980b6f94a049cb804573df2d8092a34df8e4	2023-11-08T13:15:14+01:00	slaren	ggml-alloc : fix backend assignments of views (#3982)
M	ggml-alloc.c

commit	0a7c980b6f94a049cb804573df2d8092a34df8e4	413503d4b92500d82b002d03c580a71a54747138	2023-11-07T12:43:04-05:00	Jared Van Bortel	gguf : track writer state, free unneeded tensors, cleanup (#3871)
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml

commit	413503d4b92500d82b002d03c580a71a54747138	e9c1cecb9d7d743d30b4a29ecd56a411437def0a	2023-11-07T19:25:32+02:00	Georgi Gerganov	make : do not add linker flags when compiling static llava lib (#3977)
M	Makefile

commit	e9c1cecb9d7d743d30b4a29ecd56a411437def0a	54b4df8886103b436a4bb3b60f4d84824f9e8868	2023-11-07T09:04:51+01:00	xaedes	ggml : fix backward rope after YaRN (#3974)
M	examples/finetune/finetune.cpp
M	ggml.c
M	ggml.h

commit	54b4df8886103b436a4bb3b60f4d84824f9e8868	46876d2a2c92e60579dc732cdb8cbd243b06f317	2023-11-06T23:43:59-08:00	Matthew Tejo	Use params when loading models in llava-cli (#3976)
M	examples/llava/llava-cli.cpp

commit	46876d2a2c92e60579dc732cdb8cbd243b06f317	381efbf480959bb6d1e247a8b0c2328f22e350f8	2023-11-06T22:49:08-08:00	Meng Zhang	cuda : supports running on CPU for GGML_USE_CUBLAS=ON build (#3946)
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp

commit	381efbf480959bb6d1e247a8b0c2328f22e350f8	2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede	2023-11-06T22:36:23+01:00	Damian Stewart	llava : expose as a shared library for downstream projects (#3613)
M	.gitignore
M	Makefile
M	common/CMakeLists.txt
A	common/base64.hpp
M	examples/llava/CMakeLists.txt
M	examples/llava/README.md
M	examples/llava/clip.cpp
M	examples/llava/clip.h
A	examples/llava/llava-cli.cpp
D	examples/llava/llava-utils.h
M	examples/llava/llava.cpp
A	examples/llava/llava.h
M	examples/server/CMakeLists.txt

commit	2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede	d9ccce2e339ca0396560d18b8637f2c848d72a08	2023-11-05T18:45:16+01:00	slaren	ggml-cuda : fix f16 mul mat (#3961)
M	common/common.cpp
M	ggml-cuda.cu

commit	d9ccce2e339ca0396560d18b8637f2c848d72a08	bb60fd0bf6bb270744d86dd45b3a95af01b7de45	2023-11-05T10:06:06-07:00	Kerfuffle	Allow common process_escapes to handle \x sequences (#3928)
M	common/common.cpp

commit	bb60fd0bf6bb270744d86dd45b3a95af01b7de45	132d25b8a62ea084447e0014a0112c1b371fb3f8	2023-11-05T23:15:27+07:00	Thái Hoàng Tâm	server : fix typo for --alias shortcut from -m to -a (#3958)
M	examples/server/README.md

commit	132d25b8a62ea084447e0014a0112c1b371fb3f8	3d48f42efcd05381221654376e9f6f69d76af739	2023-11-05T10:08:57-05:00	Jared Van Bortel	cuda : fix disabling device with --tensor-split 1,0 (#3951)
M	ggml-cuda.cu

commit	3d48f42efcd05381221654376e9f6f69d76af739	c41ea36eaa3548776de4cb3d5d49b925cd3fc0f2	2023-11-05T04:40:08-08:00	Meng Zhang	llama : mark LLM_ARCH_STARCODER as full offload supported (#3945)
M	llama.cpp

commit	c41ea36eaa3548776de4cb3d5d49b925cd3fc0f2	a7fac013cf1cc7bbc0160a226aa2412e9f22e78a	2023-11-05T08:03:09Z	Eve	cmake : MSVC instruction detection (fixed up #809) (#3923)
M	CMakeLists.txt
A	cmake/FindSIMD.cmake

commit	a7fac013cf1cc7bbc0160a226aa2412e9f22e78a	48ade94538fa509465d71023e49d07aab0ec8cd5	2023-11-05T07:46:44Z	Eve	ci : use intel sde when ci cpu doesn't support avx512 (#3949)
M	.github/workflows/build.yml

commit	48ade94538fa509465d71023e49d07aab0ec8cd5	f28af0d81aa1010afa5de74cf627dcb04bea3157	2023-11-05T08:12:13+01:00	slaren	cuda : revert CUDA pool stuff (#3944)
M	ggml-cuda.cu

commit	f28af0d81aa1010afa5de74cf627dcb04bea3157	d9b33fe95bd257b36c84ee5769cc048230067d6f	2023-11-04T16:20:34-06:00	Kerfuffle	gguf-py: Support 01.AI Yi models (#3943)
M	gguf-py/gguf/gguf.py

commit	d9b33fe95bd257b36c84ee5769cc048230067d6f	5ba37461711095c0284233dbd14f0d9010cdbf56	2023-11-03T12:18:18-07:00	Peter Sugihara	metal : round up to 16 to fix MTLDebugComputeCommandEncoder assertion (#3938)
M	ggml-metal.m

commit	5ba37461711095c0284233dbd14f0d9010cdbf56	abb77e7319aabc0b5cfb7c22da690a692489b6b7	2023-11-03T13:00:31-05:00	Xiao-Yong Jin	ggml-metal: fix yarn rope (#3937)
M	ggml-metal.m

commit	abb77e7319aabc0b5cfb7c22da690a692489b6b7	8f961abdc4e134c83bf8c2ad618ab256b4cae0f9	2023-11-03T12:13:09+01:00	slaren	ggml-cuda : move row numbers to x grid dim in mmv kernels (#3921)
M	ggml-cuda.cu

commit	8f961abdc4e134c83bf8c2ad618ab256b4cae0f9	05816027d649f977468fc804cdb54e99eac246d1	2023-11-03T09:41:17+02:00	Georgi Gerganov	speculative : change default p_accept to 0.5 + CLI args (#3919)
M	common/common.cpp
M	common/common.h
M	examples/speculative/speculative.cpp

commit	05816027d649f977468fc804cdb54e99eac246d1	3fdbe6b66b7b5c6ad3b2f245cbad1517c27ff776	2023-11-03T09:24:00+02:00	Georgi Gerganov	common : YAYF (yet another YARN fix) (#3925)
M	common/common.h
M	llama.h

commit	3fdbe6b66b7b5c6ad3b2f245cbad1517c27ff776	629f917cd6b96ba1274c49a8aab163b1b189229d	2023-11-03T02:31:58-04:00	cebtenzzre	llama : change yarn_ext_factor placeholder to -1 (#3922)
M	llama.cpp

commit	629f917cd6b96ba1274c49a8aab163b1b189229d	51b2fc11f7f605fff49725a4540e9a6ef7b51b70	2023-11-02T13:58:22-06:00	Kerfuffle	cuda : add ROCM aliases for CUDA pool stuff (#3918)
M	ggml-cuda.cu

commit	51b2fc11f7f605fff49725a4540e9a6ef7b51b70	224e7d5b14cbabab7ae45c64db2cfde979c8455d	2023-11-02T15:40:31-04:00	Andrei	cmake : fix relative path to git submodule index (#3915)
M	common/CMakeLists.txt

commit	224e7d5b14cbabab7ae45c64db2cfde979c8455d	c7743fe1c1cbda5a886362aa371480360580fdf0	2023-11-02T20:44:12+02:00	Georgi Gerganov	readme : add notice about #3912
M	README.md

commit	c7743fe1c1cbda5a886362aa371480360580fdf0	d6069051de7165a4e06662c89257f5d2905bb156	2023-11-02T20:32:11+02:00	Georgi Gerganov	cuda : fix const ptrs warning causing ROCm build issues (#3913)
M	ggml-cuda.cu

commit	d6069051de7165a4e06662c89257f5d2905bb156	4ff1046d75e64f0e556d8dcd930ea25c23eb8b18	2023-11-02T18:10:39+01:00	Oleksii Maryshchenko	cuda : use CUDA memory pool with async memory allocation/deallocation when available (#3903)
M	ggml-cuda.cu

commit	4ff1046d75e64f0e556d8dcd930ea25c23eb8b18	21958bb393a654591ed26f339791b752d58f5c8b	2023-11-02T16:22:30+02:00	Georgi Gerganov	gguf : print error for GGUFv1 files (#3908)
M	ggml.c

commit	21958bb393a654591ed26f339791b752d58f5c8b	2756c4fbffab097736d5116007872d86456a544a	2023-11-02T13:10:33+01:00	slaren	cmake : disable LLAMA_NATIVE by default (#3906)
M	CMakeLists.txt

commit	2756c4fbffab097736d5116007872d86456a544a	1efae9b7dca2a5cc5aa21c1997b538022964ea19	2023-11-02T11:20:21+02:00	Georgi Gerganov	gguf : remove special-case code for GGUFv1 (#3901)
M	ggml.c
M	models/ggml-vocab-llama.gguf

commit	1efae9b7dca2a5cc5aa21c1997b538022964ea19	b12fa0d1c13596869c512f49a526b979c94787cc	2023-11-02T09:54:18+02:00	Georgi Gerganov	llm : prevent from 1-D tensors being GPU split (#3697)
M	llama.cpp

commit	b12fa0d1c13596869c512f49a526b979c94787cc	4d719a6d4e74b9a98e75f826f865f3153717d54b	2023-11-02T02:50:16-04:00	cebtenzzre	build : link against build info instead of compiling against it (#3879)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	build.zig
M	common/CMakeLists.txt
A	common/build-info.cpp.in
M	common/common.cpp
M	common/common.h
M	examples/benchmark/CMakeLists.txt
M	examples/benchmark/benchmark-matmult.cpp
M	examples/embedding/CMakeLists.txt
M	examples/embedding/embedding.cpp
M	examples/infill/CMakeLists.txt
M	examples/infill/infill.cpp
M	examples/llama-bench/CMakeLists.txt
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/CMakeLists.txt
M	examples/main/CMakeLists.txt
M	examples/main/main.cpp
M	examples/parallel/CMakeLists.txt
M	examples/parallel/parallel.cpp
M	examples/perplexity/CMakeLists.txt
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/CMakeLists.txt
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/CMakeLists.txt
M	examples/quantize/quantize.cpp
M	examples/save-load-state/CMakeLists.txt
M	examples/save-load-state/save-load-state.cpp
M	examples/server/CMakeLists.txt
M	examples/server/server.cpp
M	examples/speculative/CMakeLists.txt
M	examples/speculative/speculative.cpp
M	scripts/build-info.cmake
D	scripts/build-info.h.in
M	scripts/build-info.sh

commit	4d719a6d4e74b9a98e75f826f865f3153717d54b	183b3fac6c28e65d23ac0230c1dd6fb84bf0154d	2023-11-02T08:35:10+02:00	Georgi Gerganov	cuda : check if this fixes Pascal card regression (#3882)
M	ggml-cuda.cu

commit	183b3fac6c28e65d23ac0230c1dd6fb84bf0154d	2fffa0d61fa10e4b466e78cabcc6a4e16717b580	2023-11-02T08:33:37+02:00	Georgi Gerganov	metal : fix build errors and kernel sig after #2268 (#3898)
M	ggml-metal.m
M	ggml-metal.metal

commit	2fffa0d61fa10e4b466e78cabcc6a4e16717b580	0eb332a10f3f14a3746c391bf80ff5e7bdf29d5d	2023-11-02T01:49:44-04:00	cebtenzzre	cuda : fix RoPE after #2268 (#3897)
M	ggml-cuda.cu

commit	0eb332a10f3f14a3746c391bf80ff5e7bdf29d5d	d02e98cde035d91ed8032ab943d1d504fe9da394	2023-11-01T19:29:14-04:00	cebtenzzre	llama : fix llama_context_default_params after #2268 (#3893)
M	llama.cpp

commit	d02e98cde035d91ed8032ab943d1d504fe9da394	898aeca90a9bb992f506234cf3b8b7f7fa28a1df	2023-11-01T23:10:09+01:00	slaren	ggml-cuda : compute ptrs for cublasGemmBatchedEx in a kernel (#3891)
M	ggml-cuda.cu

commit	898aeca90a9bb992f506234cf3b8b7f7fa28a1df	c43c2da8afacaddfe51c09b21dbd9922cd0ea46b	2023-11-01T18:04:33-04:00	cebtenzzre	llama : implement YaRN RoPE scaling (#2268)
M	common/common.cpp
M	common/common.h
M	convert-baichuan-hf-to-gguf.py
M	convert.py
M	examples/finetune/finetune.cpp
M	examples/server/server.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	gguf-py/gguf/gguf.py
M	llama.cpp
M	llama.h

commit	c43c2da8afacaddfe51c09b21dbd9922cd0ea46b	523e49b11174368cd73460fa5eae7b39d856f300	2023-11-01T23:08:30+02:00	Georgi Gerganov	llm : fix llm_build_kqv taking unused tensor (benign, #3837)
M	llama.cpp

commit	523e49b11174368cd73460fa5eae7b39d856f300	e16b9fa4baa8a09c6619b116159830e898050942	2023-11-01T23:00:50+02:00	Georgi Gerganov	llm : fix falcon norm after refactoring (#3837)
M	llama.cpp

commit	e16b9fa4baa8a09c6619b116159830e898050942	ff8f9a88da0018972dfdf6fe64b5c8992caabd9c	2023-11-01T21:25:00+02:00	Georgi Gerganov	metal : multi-simd softmax (#3710)
M	ggml-metal.m
M	ggml-metal.metal

commit	ff8f9a88da0018972dfdf6fe64b5c8992caabd9c	50337961a678fce4081554b24e56e86b67660163	2023-11-01T21:15:55+02:00	Georgi Gerganov	common : minor (#3715)
M	common/common.cpp

commit	50337961a678fce4081554b24e56e86b67660163	0e40806c1cb3bdf9955ed807ffbe212be85b4c67	2023-11-01T20:11:02+02:00	Georgi Gerganov	llm : add llm_build_context (#3881)
M	llama.cpp

commit	0e40806c1cb3bdf9955ed807ffbe212be85b4c67	a2758d08e44ce3624d233af4d23c6843e2e735b5	2023-11-01T14:42:01-03:00	bandoti	common : allow caller to handle help/argument exceptions (#3715)
M	common/common.cpp
M	common/common.h

commit	a2758d08e44ce3624d233af4d23c6843e2e735b5	e75dfdd31b6a3dfa0627ba4ac3bb4b36e9db588e	2023-11-01T15:18:27+01:00	staviq	log : make generating separate log files optional (#3787)
M	common/log.h

commit	e75dfdd31b6a3dfa0627ba4ac3bb4b36e9db588e	9a3b4f6c86503c9cfc049d4d0fdeafef12806f5e	2023-11-01T21:40:43+08:00	l3utterfly	sampling : null grammar field after reset (#3885)
M	common/sampling.cpp

commit	9a3b4f6c86503c9cfc049d4d0fdeafef12806f5e	73bdcb395ef9a997d9c02950c7cd4249546162cd	2023-11-01T13:50:45+02:00	Georgi Gerganov	ggml : fix UNUSED macro (#3762)
M	ggml-quants.c

commit	73bdcb395ef9a997d9c02950c7cd4249546162cd	f0e209324a7f663225791897877bf610f1af152d	2023-11-01T04:49:04-07:00	Andrew Godfrey	finetune : add -ngl parameter (#3762)
M	common/train.cpp
M	common/train.h
M	examples/finetune/finetune.cpp
A	examples/finetune/finetune.sh
M	ggml-cuda.cu
M	ggml-quants.c
M	ggml.c
M	llama.cpp

commit	f0e209324a7f663225791897877bf610f1af152d	ca190bca8e844d171020d6147687e71472d71734	2023-11-01T11:29:07+02:00	Georgi Gerganov	scripts : add server-llm.sh (#3868)
A	scripts/server-llm.sh

commit	ca190bca8e844d171020d6147687e71472d71734	71e3718abdb2771b50c9606d3a7569623a0b0afe	2023-11-01T09:28:28Z	Adrian Hesketh	server : re-enable completion and embedded at the same time (#3876)
M	.gitignore
M	examples/server/server.cpp

commit	71e3718abdb2771b50c9606d3a7569623a0b0afe	238657db2364cfb728c694470a4a81702afea760	2023-11-01T08:04:02+02:00	Georgi Gerganov	llama : refactor graph build code (#3837)
M	ggml-metal.m
M	ggml.h
M	llama.cpp

commit	238657db2364cfb728c694470a4a81702afea760	07178c98e1b61a5e2af39d347add12e7eb9e08e1	2023-10-31T14:44:49-05:00	kalomaze	samplers : Min-P sampler implementation [alternative to Top P/Top K] (#3841)
M	common/common.cpp
M	common/sampling.cpp
M	common/sampling.h
M	examples/main/README.md
M	llama.cpp
M	llama.h

commit	07178c98e1b61a5e2af39d347add12e7eb9e08e1	207b51900e15cc7f89763a3bb1c565fe11cbb45d	2023-10-31T18:24:03+01:00	Tungsten842	flake.nix: fix for rocm 5.7 (#3853)
M	flake.lock
M	flake.nix

commit	207b51900e15cc7f89763a3bb1c565fe11cbb45d	6e08281e588bbba1a5d180290a94a43f167f3a1a	2023-10-30T19:19:15+02:00	Georgi Gerganov	ggml : move FP16 <-> FP32 code to ggml-impl.h (#3861)
A	ggml-impl.h
M	ggml-quants.c
M	ggml-quants.h
M	ggml.c
M	llama.cpp
M	tests/test-double-float.cpp
M	tests/test-quantize-fns.cpp

commit	6e08281e588bbba1a5d180290a94a43f167f3a1a	2046eb4345e62c4575b3cdc0115a51db89f3fb70	2023-10-29T11:31:40-06:00	Kerfuffle	Extend llama_kv_cache_seq_rm to allow matching any sequence (#3843)
M	common/common.cpp
M	examples/batched-bench/batched-bench.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	2046eb4345e62c4575b3cdc0115a51db89f3fb70	71a09da301705b9c5ad4ca3cf3fbd966dd3f1ec5	2023-10-29T12:33:47-04:00	cebtenzzre	make : remove unnecessary dependency on build-info.h (#3842)
M	Makefile

commit	71a09da301705b9c5ad4ca3cf3fbd966dd3f1ec5	d69d777c02b9ac405a95f3cbfba219a990caefff	2023-10-29T18:32:51+02:00	Georgi Gerganov	llama : fix kv shift bug (#3835)
M	llama.cpp

commit	d69d777c02b9ac405a95f3cbfba219a990caefff	ff3bad83e29e3009010cbc923bebd769055eaa7f	2023-10-29T18:32:28+02:00	Georgi Gerganov	ggml : quantization refactoring (#3833)
M	CMakeLists.txt
M	Makefile
M	Package.swift
M	build.zig
M	examples/quantize/quantize.cpp
R071	k_quants.c	ggml-quants.c
R063	k_quants.h	ggml-quants.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	ff3bad83e29e3009010cbc923bebd769055eaa7f	82a6646e0221216c41edcdf99f5a44bb051391f5	2023-10-28T16:41:07+02:00	Erik Scholz	flake : update flake.lock for newer transformers version + provide extra dev shell (#3797)
M	flake.lock
M	flake.nix

commit	82a6646e0221216c41edcdf99f5a44bb051391f5	ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1	2023-10-28T15:43:01+03:00	Aarni Koskela	metal : try cwd for ggml-metal.metal if bundle lookup fails (#3793)
M	ggml-metal.m

commit	ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1	8a2f2fea2914aaa3f4b2f82800c7de15f15bdb09	2023-10-28T15:25:33+03:00	Georgi Gerganov	issues : change label from bug to bug-unconfirmed (#3748)
M	.github/ISSUE_TEMPLATE/bug.md

commit	8a2f2fea2914aaa3f4b2f82800c7de15f15bdb09	bd6d9e205982b34e0ba2c3b22bbf31a1ef1a1bb5	2023-10-28T15:25:15+03:00	Georgi Gerganov	convert : ignore tokens if their IDs are within [0, vocab_size) (#3831)
M	convert.py

commit	bd6d9e205982b34e0ba2c3b22bbf31a1ef1a1bb5	ee1a0ec9cb367ba41d138134795cbbbe93d2bf1c	2023-10-28T05:54:24-06:00	Kerfuffle	llama : allow quantizing k-quants to fall back when tensor size incompatible (#3747)
M	llama.cpp

commit	ee1a0ec9cb367ba41d138134795cbbbe93d2bf1c	177461104b454163473dced2a5038f4e016cdb7e	2023-10-28T14:23:11+03:00	Georgi Gerganov	llama : add option for greedy sampling with probs (#3813)
M	common/common.cpp
M	common/sampling.cpp
M	examples/speculative/speculative.cpp
M	llama.h

commit	177461104b454163473dced2a5038f4e016cdb7e	fdee152e4eebb78c191df0b074857111d7f2aba7	2023-10-28T12:16:33+02:00	Henk Poley	common : print that one line of the syntax help *also* to standard output (#3823)
M	common/common.cpp

commit	fdee152e4eebb78c191df0b074857111d7f2aba7	41aee4df821854f37d90a45281f03b6db8d27de2	2023-10-28T12:06:08+03:00	Georgi Gerganov	starcoder : add GPU offloading (#3827)
M	llama.cpp

commit	41aee4df821854f37d90a45281f03b6db8d27de2	6d459cbfbe5a011dfca94f9550527a504b6f9aa1	2023-10-27T15:40:07-06:00	Kerfuffle	speculative : ensure draft and target model vocab matches (#3812)
M	examples/speculative/speculative.cpp

commit	6d459cbfbe5a011dfca94f9550527a504b6f9aa1	c8d6a1f34ab6f1b6bd468d256e535a61f98f114c	2023-10-27T17:33:53-04:00	cebtenzzre	llama : correctly report GGUFv3 format (#3818)
M	llama.cpp

commit	c8d6a1f34ab6f1b6bd468d256e535a61f98f114c	2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f	2023-10-27T16:37:41+02:00	Thibault Terrasson	simple : fix batch handling (#3803)
M	examples/simple/simple.cpp

commit	2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f	34b2a5e1ee4fe6295fb4420eb91131d743694c65	2023-10-27T17:01:23+03:00	Georgi Gerganov	cuda : improve text-generation and batched decoding performance (#3776)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu
M	llama.cpp
M	llama.h

commit	34b2a5e1ee4fe6295fb4420eb91131d743694c65	6961c4bd0b5176e10ab03b35394f1e9eab761792	2023-10-26T22:53:37+03:00	Georgi Gerganov	server : do not release slot on image input (#3798)
M	examples/server/server.cpp

commit	6961c4bd0b5176e10ab03b35394f1e9eab761792	cc448774866e6479c750bd7c135cd8f92cedee67	2023-10-25T10:26:27+03:00	Georgi Gerganov	batched-bench : print params at start
M	examples/batched-bench/batched-bench.cpp
M	ggml-cuda.cu

commit	cc448774866e6479c750bd7c135cd8f92cedee67	ad939626577cd25b462e8026cc543efb71528472	2023-10-25T10:09:16+03:00	Georgi Gerganov	log : disable pid in log filenames
M	common/log.h

commit	ad939626577cd25b462e8026cc543efb71528472	1717521cdb976a2219888b0e5cba36e210eee9df	2023-10-24T16:10:43-04:00	cebtenzzre	server : add parameter -tb N, --threads-batch N (#3584) (#3768)
M	examples/server/server.cpp

commit	1717521cdb976a2219888b0e5cba36e210eee9df	b2f7e04bd312eaf97eee0523aa09d950d585626b	2023-10-24T23:08:20+03:00	Georgi Gerganov	server : do not block system prompt update (#3767)
M	examples/server/server.cpp

commit	b2f7e04bd312eaf97eee0523aa09d950d585626b	abd21fc99f1d35e2081e4c01dc09c71a86bf3c5a	2023-10-24T21:51:20+03:00	Georgi Gerganov	sync : ggml (conv ops + cuda MSVC fixes) (#3765)
M	ggml-cuda.cu
M	ggml.c
M	ggml.h

commit	abd21fc99f1d35e2081e4c01dc09c71a86bf3c5a	2b4ea35e56792064598e922e46d081e02bc96b94	2023-10-25T01:48:45+08:00	John Smith	cmake : add missed dependencies (#3763)
M	examples/main-cmake-pkg/CMakeLists.txt

commit	2b4ea35e56792064598e922e46d081e02bc96b94	daab3d7f45832e10773c99f3484b0d5b14d86c0c	2023-10-24T16:48:37+03:00	Georgi Gerganov	cuda : add batched cuBLAS GEMM for faster attention (#3749)
M	CMakeLists.txt
M	examples/batched/batched.cpp
M	ggml-cuda.cu
M	ggml.c

commit	daab3d7f45832e10773c99f3484b0d5b14d86c0c	469c9addef75893e6be12edda852d12e840bf064	2023-10-24T09:17:17+02:00	Galunid	Add more tokenizer tests (#3742)
A	models/ggml-vocab-baichuan.gguf
A	models/ggml-vocab-gpt-neox.gguf
A	models/ggml-vocab-refact.gguf
A	models/ggml-vocab-starcoder.gguf
M	tests/CMakeLists.txt
M	tests/test-tokenizer-1-bpe.cpp

commit	469c9addef75893e6be12edda852d12e840bf064	e3932593d46c30145301a13097895f9376cba509	2023-10-24T09:46:50+03:00	Georgi Gerganov	metal : handle ggml_scale for n%4 != 0 (close #3754)
M	ggml-metal.m
M	ggml-metal.metal

commit	e3932593d46c30145301a13097895f9376cba509	9d02956443e5c1ded29b7b5ed8a21bc01ba6f563	2023-10-23T23:46:05+03:00	Georgi Gerganov	Revert "make : add optional CUDA_NATIVE_ARCH (#2482)"
M	Makefile

commit	9d02956443e5c1ded29b7b5ed8a21bc01ba6f563	69a6735087c3634963c642fd69f0851ac479cd78	2023-10-23T22:57:16+03:00	M. Yusuf Sarıgöz	issues : separate bug and enhancement template + no default title (#3748)
R096	.github/ISSUE_TEMPLATE/custom.md	.github/ISSUE_TEMPLATE/bug.md
A	.github/ISSUE_TEMPLATE/enhancement.md

commit	69a6735087c3634963c642fd69f0851ac479cd78	5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce	2023-10-23T21:46:00+02:00	Galunid	Update special token handling in conversion scripts for gpt2 derived tokenizers (#3746)
M	convert-bloom-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-mpt-hf-to-gguf.py
M	convert-refact-hf-to-gguf.py
M	convert-starcoder-hf-to-gguf.py

commit	5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce	6336701c9378c23c85d1c0e464b663ca2bbb8e60	2023-10-23T12:40:03-07:00	Marcus Dunn	llama : remove token functions with `context` args in favor of `model` (#3720)
M	common/common.cpp
M	common/sampling.cpp
M	common/train.cpp
M	examples/batched/batched.cpp
M	examples/beam-search/beam-search.cpp
M	examples/infill/infill.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/llava/llava-utils.h
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	llama.h

commit	6336701c9378c23c85d1c0e464b663ca2bbb8e60	96981f37b1e3f450d9e63e571514217bf60f0a7f	2023-10-23T17:47:03+02:00	Galunid	Fix baichuan convert script not detecing model (#3739)
M	convert-baichuan-hf-to-gguf.py

commit	96981f37b1e3f450d9e63e571514217bf60f0a7f	438c2ca83045a00ef244093d27e9ed41a8cb4ea9	2023-10-22T15:56:53-04:00	Alex	make : add optional CUDA_NATIVE_ARCH (#2482)
M	Makefile

commit	438c2ca83045a00ef244093d27e9ed41a8cb4ea9	9e70cc03229df19ca2d28ce23cc817198f897278	2023-10-22T22:53:08+03:00	Georgi Gerganov	server : parallel decoding and multimodal (#3677)
M	.gitignore
M	Makefile
M	build.zig
M	examples/llava/CMakeLists.txt
M	examples/llava/clip.cpp
M	examples/server/CMakeLists.txt
M	examples/server/README.md
M	examples/server/api_like_OAI.py
M	examples/server/chat.mjs
M	examples/server/index.html.hpp
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	9e70cc03229df19ca2d28ce23cc817198f897278	5a42a5f8e8a86da9ac88008d748cf232a83aa0e1	2023-10-22T21:21:42+02:00	goerch	Add test for MPT tokenization (#3728)
M	convert-mpt-hf-to-gguf.py
M	llama.cpp
A	models/ggml-vocab-mpt.gguf
M	tests/CMakeLists.txt

commit	5a42a5f8e8a86da9ac88008d748cf232a83aa0e1	a5e7dbd6141128bfa3c40a19c2945a181df625d3	2023-10-23T05:16:43+11:00	Ian Scrivener	readme : remove unsupported node.js library (#3703)
M	README.md

commit	a5e7dbd6141128bfa3c40a19c2945a181df625d3	d3956aea53369455008159cc405ed4c496976692	2023-10-22T12:14:56-06:00	Kerfuffle	llama : validate special token ids are in range when loading GGUF model (#3635)
M	convert-baichuan-hf-to-gguf.py
M	convert-bloom-hf-to-gguf.py
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-ggml-to-gguf.py
M	convert-mpt-hf-to-gguf.py
M	convert-refact-hf-to-gguf.py
M	convert-starcoder-hf-to-gguf.py
M	convert.py
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	d3956aea53369455008159cc405ed4c496976692	22c69a27945e7acf9690dd3210d316f22182751c	2023-10-22T20:09:51+02:00	vvhg1	main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
M	common/common.cpp
M	examples/main/main.cpp

commit	22c69a27945e7acf9690dd3210d316f22182751c	465219b9143ac01db0990bbcb0a081ef72ec2008	2023-10-22T08:37:20+03:00	Georgi Gerganov	batched : add len CLI argument
M	examples/batched/batched.cpp

commit	465219b9143ac01db0990bbcb0a081ef72ec2008	d1031cf49c3b958b915fd558e23453471c29ac33	2023-10-12T16:01:23+04:00	shibe2	CLBlast: Add outer loops over src0 for broadcasting in mulmat
M	ggml-opencl.cpp

commit	d1031cf49c3b958b915fd558e23453471c29ac33	8cf19d60dc93809db8e51fedc811595eed9134c5	2023-10-20T21:07:23+03:00	Georgi Gerganov	sampling : refactor init to use llama_sampling_params (#3696)
M	Makefile
M	README.md
M	common/common.cpp
M	common/common.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/CMakeLists.txt
D	examples/embd-input/.gitignore
D	examples/embd-input/CMakeLists.txt
D	examples/embd-input/README.md
D	examples/embd-input/embd-input-lib.cpp
D	examples/embd-input/embd-input-test.cpp
D	examples/embd-input/embd-input.h
D	examples/embd-input/embd_input.py
D	examples/embd-input/llava.py
D	examples/embd-input/minigpt4.py
D	examples/embd-input/panda_gpt.py
D	examples/gptneox-wip/cmpnct_gpt2bpe.hpp
D	examples/gptneox-wip/falcon-main.cpp
D	examples/gptneox-wip/gptneox-main.cpp
M	examples/infill/CMakeLists.txt
M	examples/infill/infill.cpp
M	examples/llava/llava-utils.h
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	llama.h
M	tests/test-sampling.cpp

commit	8cf19d60dc93809db8e51fedc811595eed9134c5	a0edf73bda31c7c4e649e6f07c6fd30a729929cd	2023-10-20T06:19:40-05:00	Qin Yue Chen	gguf : support big endian platform (#3552)
M	convert-baichuan-hf-to-gguf.py
M	convert.py
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	ggml.c
M	ggml.h
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml
M	k_quants.c
M	tests/test-double-float.cpp

commit	a0edf73bda31c7c4e649e6f07c6fd30a729929cd	f439e506e8ae8b01df2ae2156380f8156d7553e3	2023-10-20T13:06:10+03:00	Georgi Gerganov	server : fix uninitialized sampling context (close #3685)
M	examples/server/server.cpp

commit	f439e506e8ae8b01df2ae2156380f8156d7553e3	e78f3ef24af4ca74e77e725644b41ae8ca3b10a5	2023-10-20T10:02:12Z	Herman Semenov	ggml : fix rope + llama minor optimizations (#3560)
M	common/grammar-parser.cpp
M	common/train.cpp
M	ggml.c
M	llama.cpp

commit	e78f3ef24af4ca74e77e725644b41ae8ca3b10a5	f3b25e40438b3c8383caabf4e7b89863145a9f0e	2023-10-20T01:32:08-04:00	cebtenzzre	convert : restore compat with old Falcon models (#3680)
M	convert-falcon-hf-to-gguf.py

commit	f3b25e40438b3c8383caabf4e7b89863145a9f0e	60abea9798f47b918a9f38c66edfd88c526d20f6	2023-10-19T19:40:41+03:00	M. Yusuf Sarıgöz	multimodal : add BakLLaVA conversion support (#3682)
M	examples/llava/llava-surgery.py

commit	60abea9798f47b918a9f38c66edfd88c526d20f6	004797f6ac135383f8c1d1f5bd415ddee2f79318	2023-10-19T16:59:11+03:00	M. Yusuf Sarıgöz	llava : avoid segfault in case of non-existent mmproj file (#3674)
M	examples/llava/clip.cpp

commit	004797f6ac135383f8c1d1f5bd415ddee2f79318	4e82b2ea3fa6482915d147bc9f46e70b9ada7700	2023-10-18T21:44:43+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	4e82b2ea3fa6482915d147bc9f46e70b9ada7700	0e89203b517c95ec6675eda75d200a60d1e8921d	2023-10-18T18:49:40+03:00	Georgi Gerganov	speculative : bug fixes
M	examples/speculative/speculative.cpp

commit	0e89203b517c95ec6675eda75d200a60d1e8921d	c67fe68e417f766970fb1feaf2e66458aa24116a	2023-10-18T16:21:57+03:00	Georgi Gerganov	speculative : add tree-based sampling example (#3624)
M	Makefile
M	common/common.cpp
M	common/common.h
M	common/log.h
M	common/sampling.cpp
M	common/sampling.h
M	examples/batched-bench/batched-bench.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/batched/batched.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/infill/infill.cpp
M	examples/llava/llava-utils.h
M	examples/llava/llava.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	llama.h
A	prompts/assistant.txt

commit	c67fe68e417f766970fb1feaf2e66458aa24116a	1117d06607d2d885640ac501f05f0aae5494e2c5	2023-10-18T07:21:48-05:00	Jhen-Jie Hong	metal : implement q5_0 and q5_1 kernels (#3648)
M	ggml-metal.m
M	ggml-metal.metal

commit	1117d06607d2d885640ac501f05f0aae5494e2c5	cb33f43a2a9f5a5a5f8d290dd97c625d9ba97a2f	2023-10-18T16:09:22+04:00	shibe2	opencl : fix element-wise multiplication (#3656)
M	ggml-opencl.cpp

commit	cb33f43a2a9f5a5a5f8d290dd97c625d9ba97a2f	e1675d133c31e1c8de2f06be7164e12c0ba6cf2c	2023-10-17T22:24:50+02:00	slaren	fix embeddings when using CUDA (#3657)
M	llama.cpp

commit	e1675d133c31e1c8de2f06be7164e12c0ba6cf2c	8402566a7c436bfbde8e7b0461faee50298106a0	2023-10-17T22:34:26+03:00	Georgi Gerganov	llama : avoid fprintf in favor of LLAMA_LOG (#3538)
M	examples/main/main.cpp
M	llama.cpp

commit	8402566a7c436bfbde8e7b0461faee50298106a0	40e5ce054f4c4fa555e4510ea5f760bb29185332	2023-10-17T14:13:21-04:00	BarfingLemurs	readme : update hot-topics & models, detail windows release in usage (#3615)
M	README.md

commit	40e5ce054f4c4fa555e4510ea5f760bb29185332	a5e8c1d8c71f01d98ae2ec63a57c118664f9764d	2023-10-11T21:30:06+04:00	shibe2	CLBlast: Fix temporary buffer size for f16 conversion (wsize)
M	ggml-opencl.cpp

commit	a5e8c1d8c71f01d98ae2ec63a57c118664f9764d	e74c705e15cd228ad696c4a3cdea6d6fb4ff434c	2023-10-17T19:00:58+02:00	slaren	train-text-from-scratch : fix assert failure in ggml-alloc (#3618)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	e74c705e15cd228ad696c4a3cdea6d6fb4ff434c	3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd	2023-10-17T19:52:53+03:00	Georgi Gerganov	editorconfig : remove trailing spaces
M	examples/server/README.md

commit	3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd	1142013da40e98946a109b141dd858f0ed996051	2023-10-17T18:51:02+02:00	coezbek	server : documentation of JSON return value of /completion endpoint (#3632)
M	examples/server/README.md

commit	1142013da40e98946a109b141dd858f0ed996051	5fe268a4d9ce09f3a6c77239af583d3a8e49d54c	2023-10-17T19:12:46+03:00	Georgi Gerganov	save-load-state : fix example + add ci test (#3655)
M	ci/run.sh
M	examples/save-load-state/save-load-state.cpp

commit	5fe268a4d9ce09f3a6c77239af583d3a8e49d54c	1a159553f921a9209fed8c714494e57b3649f232	2023-10-17T23:52:33+08:00	ldwang	readme : add Aquila2 links (#3610)
M	README.md

commit	1a159553f921a9209fed8c714494e57b3649f232	281ef73c258cc1eebec8a64264240432d5878c4b	2023-10-17T17:11:01+02:00	staviq	tokenizer : special token handling (#3538)
M	common/common.cpp
M	common/common.h
M	common/train.cpp
M	examples/batched.swift/Sources/main.swift
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	281ef73c258cc1eebec8a64264240432d5878c4b	940efa95fec0b8a98c226a889d2ad839dfeeae0d	2023-10-17T09:19:28+03:00	Georgi Gerganov	k-quants : fix quantization ranges (#3646)
M	k_quants.c

commit	940efa95fec0b8a98c226a889d2ad839dfeeae0d	11bff290458f12f020b588792707f76ec658a27a	2023-10-16T23:58:00+03:00	Georgi Gerganov	llava : fix tokenization to not add bos between image embeddings and user prompt (#3645)
M	examples/llava/llava-utils.h
M	examples/llava/llava.cpp

commit	11bff290458f12f020b588792707f76ec658a27a	11dc1091f64b24ca6d643acc6d0051117ba60161	2023-10-15T02:32:06-04:00	cebtenzzre	MPT : support GQA for replit-code-v1.5 (#3627)
M	convert-mpt-hf-to-gguf.py
M	llama.cpp

commit	11dc1091f64b24ca6d643acc6d0051117ba60161	2a4bcbacead886996f175f33479d1d874a3e577f	2023-10-14T13:52:44+03:00	M. Yusuf Sarıgöz	Honor -ngl option for Cuda offloading in llava (#3621)
M	examples/llava/llava.cpp

commit	2a4bcbacead886996f175f33479d1d874a3e577f	424b6381c4daeed62e6600e0402e72f39845b58d	2023-10-13T12:33:16+02:00	Daniel Bevenius	llama : remove n_threads from llama_decode_internal (#3614)
M	llama.cpp

commit	424b6381c4daeed62e6600e0402e72f39845b58d	1e0e873c373c33989beb6bc64d83cd572ab7fe2b	2023-10-13T12:23:10+02:00	slaren	ggml : add context enumeration functions (#3605)
M	examples/finetune/finetune.cpp
M	ggml.c
M	ggml.h

commit	1e0e873c373c33989beb6bc64d83cd572ab7fe2b	370359e5baf619f3a8d461023143d1494b1e8fde	2023-10-12T23:59:47+04:00	shibe2	CLBlast: Fix matrix-vector multiplication (#3544)
M	ggml-opencl.cpp

commit	370359e5baf619f3a8d461023143d1494b1e8fde	9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee	2023-10-12T18:23:18+03:00	M. Yusuf Sarıgöz	examples: support LLaVA v1.5 (multimodal model) (#3436)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
A	common/stb_image.h
M	examples/CMakeLists.txt
A	examples/llava/CMakeLists.txt
A	examples/llava/README.md
A	examples/llava/clip.cpp
A	examples/llava/clip.h
A	examples/llava/convert-image-encoder-to-gguf.py
A	examples/llava/llava-surgery.py
A	examples/llava/llava-utils.h
A	examples/llava/llava.cpp
M	ggml.c

commit	9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee	d28e572c0270eb72649dbcc3a347e36c05c2934a	2023-10-12T22:36:16+09:00	uint256_t	docs : fix typo GOMP_CPU_AFFINITY (#3597)
M	docs/BLIS.md

commit	d28e572c0270eb72649dbcc3a347e36c05c2934a	f3040beaab5228b1a9dfe5675a200379478f7204	2023-10-12T14:31:05+03:00	Georgi Gerganov	cmake : fix add_compile_options on macOS
M	CMakeLists.txt

commit	f3040beaab5228b1a9dfe5675a200379478f7204	1a8c8795d64b04df96c28f29faac2d6e256f53bc	2023-10-12T22:10:50+11:00	Ian Scrivener	typo : it is `--n-gpu-layers` not `--gpu-layers` (#3592)
M	README.md

commit	1a8c8795d64b04df96c28f29faac2d6e256f53bc	b016596d903641f8825cd94bb6742e1de0c21017	2023-10-12T13:44:56+03:00	Georgi Gerganov	ci : check if there is enough VRAM (#3596)
M	ci/run.sh

commit	b016596d903641f8825cd94bb6742e1de0c21017	6b3ae4da92485f979a0f45774fcf68597634db0b	2023-10-12T15:51:53+09:00	Aarni Koskela	server : add completion mode (no chat) (#3582)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	6b3ae4da92485f979a0f45774fcf68597634db0b	57dd55e2c742bfc50e0f5c6fb95c14118cff44f6	2023-10-12T09:35:19+03:00	Georgi Gerganov	prompts : add mnemonics.txt
A	prompts/mnemonics.txt

commit	57dd55e2c742bfc50e0f5c6fb95c14118cff44f6	b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13	2023-10-12T09:29:04+03:00	Georgi Gerganov	server : fix kv cache management (#3588)
M	examples/server/server.cpp

commit	b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13	a8bdd65525ae86dea905e9866ad369b53e30ac14	2023-10-11T23:55:08+03:00	Georgi Gerganov	main : fix session loading bug (#3400)
M	examples/main/main.cpp

commit	a8bdd65525ae86dea905e9866ad369b53e30ac14	70c29da118cdb02bfcbd0376c32b5b2236e48e48	2023-10-11T15:42:22-04:00	Michael Coppola	server : add parameter -tb N, --threads-batch N (#3584)
M	examples/server/server.cpp

commit	70c29da118cdb02bfcbd0376c32b5b2236e48e48	8c70a5ff25964f0a81e20d142a2f5ac5baff22fc	2023-10-11T13:35:46-06:00	Kerfuffle	common : fix mirostat state when using multiple sequences (#3543)
M	Makefile
M	build.zig
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
A	common/sampling.cpp
A	common/sampling.h
M	examples/embd-input/embd-input-lib.cpp
M	examples/infill/infill.cpp
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp

commit	8c70a5ff25964f0a81e20d142a2f5ac5baff22fc	24ba3d829e31a6eda3fa1723f692608c2fa3adda	2023-10-11T21:25:33+03:00	Georgi Gerganov	batched : add bench tool (#3545)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/batched-bench/CMakeLists.txt
A	examples/batched-bench/README.md
A	examples/batched-bench/batched-bench.cpp
M	examples/batched/batched.cpp

commit	24ba3d829e31a6eda3fa1723f692608c2fa3adda	9f6ede19f3cfa50d4a51a5babb056c3f8a450b80	2023-10-11T04:14:05-07:00	Zane Shannon	examples : add batched.swift + improve CI for swift (#3562)
M	.github/workflows/build.yml
M	Makefile
A	examples/batched.swift/.gitignore
A	examples/batched.swift/Makefile
A	examples/batched.swift/Package.swift
A	examples/batched.swift/README.md
A	examples/batched.swift/Sources/main.swift

commit	9f6ede19f3cfa50d4a51a5babb056c3f8a450b80	233fc1c69f6f415f35363e18a755f9610e89161b	2023-10-11T01:02:49+02:00	Galunid	Add MPT model to supported models in README.md (#3574)
M	README.md

commit	233fc1c69f6f415f35363e18a755f9610e89161b	c5b49360d0d9e49f32e05a9116e90bd0b39a282d	2023-10-10T18:59:52+02:00	goerch	Minor improvements in GPT2 tokenizer (#3567)
M	llama.cpp
M	tests/test-tokenizer-0-falcon.cpp
M	tests/test-tokenizer-0-falcon.py
M	tests/test-tokenizer-0-llama.cpp
M	tests/test-tokenizer-0-llama.py

commit	c5b49360d0d9e49f32e05a9116e90bd0b39a282d	02d2875deff28599c6c2c6e1886fab002ffe43b1	2023-10-11T00:28:50+08:00	Xingchen Song(宋星辰)	readme : add bloom (#3570)
M	README.md

commit	02d2875deff28599c6c2c6e1886fab002ffe43b1	0aa6595ae02f97f2e5ffd74bf57a8b21ac83b272	2023-10-10T22:48:21+08:00	Xingchen Song(宋星辰)	llm : add bloom models (#3553)
A	convert-bloom-hf-to-gguf.py
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	0aa6595ae02f97f2e5ffd74bf57a8b21ac83b272	f5f9121de140eff558f13b5c5e78a3a3b6b94377	2023-10-10T06:31:13-05:00	Jhen-Jie Hong	swift : improvements and fixes (#3564)
M	Package.swift

commit	f5f9121de140eff558f13b5c5e78a3a3b6b94377	11ea5c7d96f2c28e1c99659e08ec0a44574056e2	2023-10-10T09:50:23+02:00	Jan Ploski	llm : add MPT support (#3417)
A	convert-mpt-hf-to-gguf.py
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml.c
M	llama.cpp

commit	11ea5c7d96f2c28e1c99659e08ec0a44574056e2	95bd60a0a69f57e9a2ff1269667ea484a1a9bb40	2023-10-10T09:31:21+02:00	vvhg1	infill. : fix tokenization (#3508)
M	examples/infill/infill.cpp
M	examples/server/server.cpp

commit	95bd60a0a69f57e9a2ff1269667ea484a1a9bb40	fcca0a700487999d52a525c96d6661e9f6a8703a	2023-10-09T14:44:58+02:00	slaren	ggml-alloc : fix assert in debug builds (#3555)
M	ggml-alloc.c

commit	fcca0a700487999d52a525c96d6661e9f6a8703a	dcc09d25961c5d0626bc148e558ee841141748f7	2023-10-09T14:32:17+03:00	Georgi Gerganov	refact : fix convert script + zero out KV cache to avoid nans (#3523)
M	convert-refact-hf-to-gguf.py
M	examples/parallel/parallel.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	llama.cpp

commit	dcc09d25961c5d0626bc148e558ee841141748f7	db3abcc114d5d1790ba814aa1a80ac673d4ccc3e	2023-10-09T14:28:27+03:00	Georgi Gerganov	metal : do not use mul_mm kernels when ne00 < 64 (#3542)
M	ggml-metal.m

commit	db3abcc114d5d1790ba814aa1a80ac673d4ccc3e	eee42c670e6fa6df9cf17e7ffc319f74cbd81354	2023-10-08T20:19:14+03:00	Georgi Gerganov	sync : ggml (ggml-backend) (#3548)
M	CMakeLists.txt
M	Makefile
M	build.zig
M	ggml-alloc.c
M	ggml-alloc.h
A	ggml-backend.c
A	ggml-backend.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp
M	scripts/sync-ggml.sh

commit	eee42c670e6fa6df9cf17e7ffc319f74cbd81354	8e6716a102e390e930594d51302730184dac83cc	2023-10-08T10:59:20-03:00	Matheus C. França	ci : add Zig CI/CD and fix build (#2996)
A	.github/workflows/zig-build.yml
M	build.zig

commit	8e6716a102e390e930594d51302730184dac83cc	9c38d181d40b9d27f8f42152c18e7c70bfffcf37	2023-10-08T03:55:58-07:00	Ryder Wishart	api_like_OAI.py : compat with Microsoft Guidance (#2746)
M	examples/server/api_like_OAI.py

commit	9c38d181d40b9d27f8f42152c18e7c70bfffcf37	a1202a31ed8c35705bd09fe91c3e7410c619bd70	2023-10-08T06:52:57-04:00	arcrank	api_like_OAI.py : simplify function (#2796)
M	examples/server/api_like_OAI.py

commit	a1202a31ed8c35705bd09fe91c3e7410c619bd70	94e502dfb79430870b42b8e8ee132b4aaa93e4a8	2023-10-08T12:21:19+02:00	Johannes Rudolph	k-quants : fix comments about block sizing (#3499)
M	k_quants.h

commit	94e502dfb79430870b42b8e8ee132b4aaa93e4a8	7d8b24932fe788a4cda76459a0c5df3e0073cb98	2023-10-08T11:24:50+03:00	Georgi Gerganov	ci : enable on obj-c changes + fix metal build (#3540)
M	.github/workflows/build.yml
M	ggml-metal.m

commit	7d8b24932fe788a4cda76459a0c5df3e0073cb98	b0ec5218c3d24755786b80ecce9cf4ffc07583f8	2023-10-08T16:24:01+08:00	Luo Tian	zig : fix build by introducing train.cpp (#3539)
M	build.zig

commit	b0ec5218c3d24755786b80ecce9cf4ffc07583f8	63d3b06a4318329f92b078e8aa0be7ab6e9f871f	2023-10-08T10:01:53+03:00	Georgi Gerganov	metal : support MTLGPUFamily < Apple7, formatting, style (#3524)
M	ggml-metal.m
M	ggml-metal.metal

commit	63d3b06a4318329f92b078e8aa0be7ab6e9f871f	a16e89cec83b4bd5f6af8f1ce1400f94c12356f9	2023-10-07T23:22:17-06:00	Kerfuffle	llama : fix missing break in Persimmon arch case statements (#3535)
M	llama.cpp

commit	a16e89cec83b4bd5f6af8f1ce1400f94c12356f9	4d0383321184aadf91968d9e3c6a45286ed2473b	2023-10-07T15:31:41-06:00	Kerfuffle	Fix trying to strip newline from empty prompt and cfg prompt file content (#3534)
M	common/common.cpp

commit	4d0383321184aadf91968d9e3c6a45286ed2473b	c47066d833c6c112e0d23342aa62c3250dd33c81	2023-10-07T22:14:10+03:00	M. Yusuf Sarıgöz	gguf.py : fix CI for publishing GGUF package (#3532)
M	.github/workflows/gguf-publish.yml
M	gguf-py/README.md
M	gguf-py/pyproject.toml

commit	c47066d833c6c112e0d23342aa62c3250dd33c81	f1782c68de13b64bb5283fc2038f584e47be9fd2	2023-10-07T02:56:15-07:00	Tom C	py : change version of numpy requirement to 1.24.4 (#3515)
M	requirements.txt

commit	f1782c68de13b64bb5283fc2038f584e47be9fd2	c26765a0a148b47e5b541df32438c3ad2a0a8314	2023-10-07T04:41:52-04:00	cebtenzzre	quantize : fail fast on write errors (#3521)
M	llama.cpp

commit	c26765a0a148b47e5b541df32438c3ad2a0a8314	0e797c2fc571b866090f7d60ac7d39d8533593f2	2023-10-07T03:40:27-05:00	Jhen-Jie Hong	metal : support default.metallib load & reuse code for swift package (#3522)
M	.gitignore
M	Package.swift
M	ggml-metal.m

commit	0e797c2fc571b866090f7d60ac7d39d8533593f2	3a716b4dae545c3db307594fbc509a95d3e21b6e	2023-10-07T00:12:43-07:00	Phillip Kravtsov	llm : support Adept Persimmon 8B (#3410)
A	convert-persimmon-to-gguf.py
M	ggml-metal.m
M	ggml-metal.metal
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	3a716b4dae545c3db307594fbc509a95d3e21b6e	1faaae8c2bdc4a21302e367e0754c3fe74a8113e	2023-10-07T06:57:01+02:00	goerch	Fix for #3454 (#3455)
M	llama.cpp

commit	1faaae8c2bdc4a21302e367e0754c3fe74a8113e	cb13d73a720c42d1958bff79b6869d77b26b8cea	2023-10-06T15:13:36-04:00	BarfingLemurs	readme : update models, cuda + ppl instructions (#3510)
M	README.md

commit	cb13d73a720c42d1958bff79b6869d77b26b8cea	9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788	2023-10-06T21:39:33+03:00	Mihai	server : docs fix default values and add n_probs (#3506)
M	examples/server/README.md

commit	9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788	0c731ca4039ccff86ffab90eaae4ca98037c4496	2023-10-06T10:10:13-06:00	Kerfuffle	kv cache slot search improvements (#3493)
M	llama.cpp

commit	0c731ca4039ccff86ffab90eaae4ca98037c4496	a8777ad84e00cda0399e827cdf971e2c3fab1da2	2023-10-06T16:35:55+03:00	Georgi Gerganov	prompts : fix editorconfig checks after #3416
M	prompts/parallel-questions.txt

commit	a8777ad84e00cda0399e827cdf971e2c3fab1da2	97af49fa395df77e4c18af0e1655b2fee67c9686	2023-10-06T14:16:38+01:00	pudepiedj	parallel : add option to load external prompt file (#3416)
M	common/common.cpp
M	common/common.h
M	examples/jeopardy/README.md
M	examples/parallel/parallel.cpp
M	llama.cpp
A	prompts/LLM-questions.txt
A	prompts/parallel-questions.txt

commit	97af49fa395df77e4c18af0e1655b2fee67c9686	16820a5a0d885113f21021ce934f0b0027b9d69a	2023-10-06T07:44:24-05:00	Jhen-Jie Hong	server : reuse llama_sample_token common util (#3494)
M	common/common.cpp
M	examples/server/server.cpp

commit	16820a5a0d885113f21021ce934f0b0027b9d69a	04b2f4386eda0264287156104cbf9d1b87895422	2023-10-06T18:47:59+08:00	l3utterfly	llama : correct hparams comparison (#3446)
M	llama.cpp

commit	04b2f4386eda0264287156104cbf9d1b87895422	48edda30ee545fdac2e7a33d505382888f748bbf	2023-10-06T05:36:43-05:00	Jhen-Jie Hong	ci : fix xcodebuild destinations (#3491)
M	.github/workflows/build.yml

commit	48edda30ee545fdac2e7a33d505382888f748bbf	45eba9369fbcbd7f677eba9a2d3e4ffcfdc81824	2023-10-05T15:00:34-04:00	cebtenzzre	convert : update Falcon script for new HF config (#3448)
M	convert-falcon-hf-to-gguf.py

commit	45eba9369fbcbd7f677eba9a2d3e4ffcfdc81824	acec9eaaa93315711c11d15afa8d245d164b7cff	2023-10-06T01:16:39+08:00	Kenvix ⭐	build : use std::make_tuple() for compatibility with older GCC versions (#3488)
M	common/common.cpp
M	examples/server/server.cpp

commit	acec9eaaa93315711c11d15afa8d245d164b7cff	e2583cbc29cd7d6d1403f338842c07dfc0467e6c	2023-10-05T18:17:29+02:00	staviq	common : process escape sequences in reverse prompts (#3461)
M	common/common.cpp

commit	e2583cbc29cd7d6d1403f338842c07dfc0467e6c	e8b8d32e8663ffc55a02c9721af3a5190382cbb0	2023-10-05T15:57:03+04:00	shibe2	CLBlast: Fix handling of on-device tensor data
M	ggml-opencl.cpp

commit	e8b8d32e8663ffc55a02c9721af3a5190382cbb0	8f3a642ec1d878b2d0a0d15e3a4277f522790d4c	2023-10-05T09:02:55-05:00	Jhen-Jie Hong	server : fix incorrect num_tokens_predicted (#3480)
M	examples/server/server.cpp

commit	8f3a642ec1d878b2d0a0d15e3a4277f522790d4c	0745384449fe8d89d6d99c93153569079e853247	2023-10-05T09:00:07-05:00	Jhen-Jie Hong	swift : disable ACCELERATE_NEW_LAPACK (#3481)
M	Package.swift

commit	0745384449fe8d89d6d99c93153569079e853247	019ba1dcd0c7775a5ac0f7442634a330eb0173cc	2023-10-05T08:56:21-05:00	Jhen-Jie Hong	ci : add swift build via xcodebuild (#3482)
M	.github/workflows/build.yml

commit	019ba1dcd0c7775a5ac0f7442634a330eb0173cc	beabc8cfb0145b48aad68fefc573d316fe9c3a8a	2023-10-04T08:20:28-06:00	Kerfuffle	convert : fix Baichuan2 models by using vocab size in config.json (#3299)
M	convert-baichuan-hf-to-gguf.py

commit	beabc8cfb0145b48aad68fefc573d316fe9c3a8a	0d152b37fecd5a4838330d47bb034cebf1681779	2023-10-04T16:50:44+03:00	Georgi Gerganov	readme : add project status link
M	README.md

commit	0d152b37fecd5a4838330d47bb034cebf1681779	f8c90cdbaa729e64493164c1aba7ea80da7b716f	2023-10-04T16:25:41+03:00	Georgi Gerganov	ggml : fix build after #3329
M	ggml.c

commit	f8c90cdbaa729e64493164c1aba7ea80da7b716f	f93af02488179b9c52d0d391b08ae4c4d891b8d3	2023-10-04T06:23:39-07:00	ds5t5	llm : add Refact model (#3329)
A	convert-refact-hf-to-gguf.py
M	ggml.c
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	f93af02488179b9c52d0d391b08ae4c4d891b8d3	f72f8f22c9cb60465b2e79df2767e4ba9604e576	2023-10-04T15:29:58+03:00	Georgi Gerganov	sync : ggml (conv 1d + 2d updates, UB fixes) (#3468)
M	ggml.c
M	ggml.h
M	k_quants.c
M	tests/test-grad0.cpp
M	tests/test-opt.cpp
M	tests/test-quantize-perf.cpp

commit	f72f8f22c9cb60465b2e79df2767e4ba9604e576	79f34abddb72ac5ddbf118f3d87520b611a10a7d	2023-10-04T00:33:13-06:00	Merrick Christensen	finetune : readme fix typo (#3465)
M	examples/finetune/README.md

commit	79f34abddb72ac5ddbf118f3d87520b611a10a7d	8186242b6d67cf87ae179fb1a62f52fdf0e5c5eb	2023-10-03T23:38:19+05:00	Tameem	ggml : add RISC-V Vector Support for K-Quants and improved the existing intrinsics (#3453)
M	ggml.c
M	k_quants.c

commit	8186242b6d67cf87ae179fb1a62f52fdf0e5c5eb	ac2219fef34eb5b713c286c34c6e4162c39c8f3b	2023-10-03T20:16:15+02:00	h-h-h-h	main : consistent prefix/suffix coloring (#3425)
M	examples/main/main.cpp

commit	ac2219fef34eb5b713c286c34c6e4162c39c8f3b	48be797ffbd80b062f55778e09e97180eb25d2ab	2023-10-03T21:04:01+03:00	Georgi Gerganov	llama : fix session saving/loading (#3400)
M	examples/chat-persistent.sh
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/server/server.cpp
M	examples/speculative/speculative.cpp
M	llama.cpp
M	llama.h

commit	48be797ffbd80b062f55778e09e97180eb25d2ab	f56e1baec361b5381e32ee6b6e56e4f00e002dfe	2023-10-03T10:09:28-07:00	Alex Klinkhamer	llama : expose model's rope_freq_scale in the API (#3418)
M	llama.cpp
M	llama.h

commit	f56e1baec361b5381e32ee6b6e56e4f00e002dfe	017efe899d8fa76118aef88e963210d48da01172	2023-10-04T00:55:21+08:00	Jiahao Li	metal : alibi for arbitrary number of heads (#3426)
M	ggml-metal.m
M	ggml-metal.metal

commit	017efe899d8fa76118aef88e963210d48da01172	ff5a3f0c09dfa0a8e0bf76d1748df5c6dee0e8ff	2023-10-03T16:53:15Z	Eve	cmake : make LLAMA_NATIVE flag actually use the instructions supported by the processor (#3273)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	flake.nix

commit	ff5a3f0c09dfa0a8e0bf76d1748df5c6dee0e8ff	1c84003c08027f5d3a4cb876f51d6b6224a34d0e	2023-10-03T09:16:26+02:00	goerch	Work on the BPE tokenizer (#3252)
M	.gitignore
M	Makefile
M	common/common.cpp
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-starcoder-hf-to-gguf.py
M	convert.py
M	llama.cpp
A	models/ggml-vocab-aquila.gguf
A	models/ggml-vocab-falcon.gguf
M	tests/CMakeLists.txt
M	tests/test-tokenizer-0-falcon.cpp
A	tests/test-tokenizer-1-bpe.cpp
M	tests/test-tokenizer-1-llama.cpp
A	unicode.h

commit	1c84003c08027f5d3a4cb876f51d6b6224a34d0e	e78f0b0d0572168f328dd0e2ed3175a53fe52acc	2023-10-02T18:07:24-04:00	cebtenzzre	convert : fix vocab size when not defined in hparams (#3421)
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-starcoder-hf-to-gguf.py

commit	e78f0b0d0572168f328dd0e2ed3175a53fe52acc	665018c749101e81c816675198e731e47d6b1dbe	2023-10-02T15:38:43-04:00	cebtenzzre	cmake : increase minimum version for add_link_options (#3444)
M	CMakeLists.txt

commit	665018c749101e81c816675198e731e47d6b1dbe	29a404a951fb0b3f9c3b6ab8c4c9c76ac50d2bb3	2023-10-02T23:26:15+04:00	shibe2	CLBlast: Add broadcast support for matrix multiplication (#3402)
M	ggml-opencl.cpp
M	ggml.c

commit	29a404a951fb0b3f9c3b6ab8c4c9c76ac50d2bb3	0fe321031a5c670ab5fb5f49d69c4c91d783c93f	2023-10-02T15:20:28-04:00	cebtenzzre	gguf : add BERT, MPT, and GPT-J arch info (#3408)
M	gguf-py/gguf/gguf.py

commit	0fe321031a5c670ab5fb5f49d69c4c91d783c93f	9476b012260a2fb6c67976582d64484ce7406ed9	2023-10-02T14:58:46-04:00	cebtenzzre	gguf : general usability improvements (#3409)
M	convert.py
M	examples/finetune/convert-finetune-checkpoint-to-gguf.py
M	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml

commit	9476b012260a2fb6c67976582d64484ce7406ed9	a03ce38455544121c5c00cf845def1443acd6ac8	2023-10-02T09:16:50-04:00	cebtenzzre	cmake : make CUDA flags more similar to the Makefile (#3420)
M	CMakeLists.txt

commit	a03ce38455544121c5c00cf845def1443acd6ac8	a84767698495d72e44044f1f6db1c1cc721bfd15	2023-10-02T15:15:45+02:00	xaedes	finetune : fix #3404 (#3437)
M	examples/finetune/finetune.cpp

commit	a84767698495d72e44044f1f6db1c1cc721bfd15	095231dfd32679e32300f8ffaf1770b693ea64b0	2023-10-02T03:49:59-07:00	Adrian	metal : set log callback before initializing (#3427)
M	llama.cpp

commit	095231dfd32679e32300f8ffaf1770b693ea64b0	ea55295a745c084f588be20710f5a1a12abb1109	2023-10-02T06:51:49-03:00	bandoti	cmake : fix transient definitions in find pkg (#3411)
M	CMakeLists.txt
M	examples/main-cmake-pkg/CMakeLists.txt
M	scripts/LlamaConfig.cmake.in

commit	ea55295a745c084f588be20710f5a1a12abb1109	c97f01c362ac102c6994edb80008f8608539553a	2023-10-02T04:53:53-04:00	Kevin Ji	docker : ignore Git files (#3314)
M	.dockerignore

commit	c97f01c362ac102c6994edb80008f8608539553a	f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0	2023-10-02T09:42:02+02:00	vvhg1	infill : add new example + extend server API (#3296)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
A	examples/infill/CMakeLists.txt
A	examples/infill/README.md
A	examples/infill/infill.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0	40e07a60f9ce06e79f3ccd4c903eba300fb31b5e	2023-09-30T18:12:57+02:00	slaren	ggml-cuda : perform cublas mat mul of quantized types as f16 (#3412)
M	ggml-cuda.cu

commit	40e07a60f9ce06e79f3ccd4c903eba300fb31b5e	bc34dd4f5b5a7c10ae3ed85a265ce6f2ed2fab79	2023-09-29T18:42:32+02:00	slaren	llama.cpp : add documentation about rope_freq_base and scale values (#3401)
M	README.md
M	llama.h

commit	bc34dd4f5b5a7c10ae3ed85a265ce6f2ed2fab79	2777a84be429401a2b7d33c2b6a4ada1f0776f1b	2023-09-29T19:05:18+03:00	Georgi Gerganov	train : fix KQ_pos allocation (#3392)
M	examples/finetune/finetune.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	2777a84be429401a2b7d33c2b6a4ada1f0776f1b	0a4a4a098261ddd26480371eaccfe90d1bf6488a	2023-09-29T09:48:45-04:00	Cebtenzzre	llama : quantize up to 31% faster on Linux and Windows with mmap (#3206)
M	llama.cpp

commit	0a4a4a098261ddd26480371eaccfe90d1bf6488a	569550df20c1ede59ff195a6b6e900957ad84d16	2023-09-29T08:50:35-04:00	BarfingLemurs	readme : update hot topics + model links (#3399)
M	README.md

commit	569550df20c1ede59ff195a6b6e900957ad84d16	c71bf2c45c5140203184f50b259828107658e900	2023-09-29T07:15:57-04:00	Andrew Duffy	readme : add link to grammars app (#3388)
M	README.md

commit	c71bf2c45c5140203184f50b259828107658e900	bc39553c901a91cfcb757863586250838c83eeab	2023-09-29T13:25:13+08:00	Jhen-Jie Hong	swift : fix build on xcode 15 (#3387)
M	Package.swift

commit	bc39553c901a91cfcb757863586250838c83eeab	0ccfc62a96a6b59a8faa14d1b350493f4cd51ae2	2023-09-28T17:41:44-04:00	Cebtenzzre	build : enable more non-default compiler warnings (#3200)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	common/common.cpp
M	common/log.h
M	examples/baby-llama/baby-llama.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
M	examples/quantize/quantize.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	pocs/vdot/q8dot.cpp
M	tests/test-grad0.cpp
M	tests/test-opt.cpp

commit	0ccfc62a96a6b59a8faa14d1b350493f4cd51ae2	7f1a0fe709ea1a861da2f3759f58a28bf8953c12	2023-09-28T13:06:18-07:00	Hua Jiang	ggml_tensor: update the structure comments. (#3283)
M	ggml.h

commit	7f1a0fe709ea1a861da2f3759f58a28bf8953c12	16bc66d9479edd5ee12ec734973554d4493c5dfa	2023-09-29T03:51:52+08:00	Qu Zongfu	ggml : release the requested thread pool resource (#3292)
M	ggml.c

commit	16bc66d9479edd5ee12ec734973554d4493c5dfa	0512d66670de3f650c579519833c085014b0f200	2023-09-28T21:42:38+02:00	slaren	llama.cpp : split llama_context_params into model and context params (#3301)
M	common/common.cpp
M	common/common.h
M	common/train.cpp
M	examples/batched/batched.cpp
M	examples/beam-search/beam-search.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embd-input/embd-input-test.cpp
M	examples/embedding/embedding.cpp
M	examples/finetune/finetune.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	llama.cpp
M	llama.h
M	tests/test-tokenizer-0-falcon.cpp
M	tests/test-tokenizer-0-llama.cpp
M	tests/test-tokenizer-1-llama.cpp

commit	0512d66670de3f650c579519833c085014b0f200	0e76a8992c8200237bbc6471a53fb8796b3872f7	2023-09-28T19:31:04Z	Eve	ci : multithreaded builds (#3311)
M	.github/workflows/build.yml

commit	0e76a8992c8200237bbc6471a53fb8796b3872f7	2db94d98eda56982d80238840b0652b4137a2a84	2023-09-28T20:40:11+02:00	xaedes	train : finetune LORA (#2632)
M	.gitignore
M	Makefile
M	common/CMakeLists.txt
M	common/common.cpp
M	common/common.h
A	common/train.cpp
A	common/train.h
M	examples/CMakeLists.txt
M	examples/baby-llama/baby-llama.cpp
A	examples/export-lora/CMakeLists.txt
A	examples/export-lora/README.md
A	examples/export-lora/export-lora.cpp
A	examples/finetune/CMakeLists.txt
A	examples/finetune/README.md
A	examples/finetune/convert-finetune-checkpoint-to-gguf.py
A	examples/finetune/finetune.cpp
M	examples/server/server.cpp
M	examples/train-text-from-scratch/README.md
M	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-grad0.cpp

commit	2db94d98eda56982d80238840b0652b4137a2a84	ecf90b1a5114034bc0939b3968f549fe4d63cf6d	2023-09-28T14:30:31-04:00	Cebtenzzre	gguf : basic type checking in gguf_get_* (#3346)
M	ggml.c
M	ggml.h

commit	ecf90b1a5114034bc0939b3968f549fe4d63cf6d	2619109ad57d7a75388a9cce51e5da645410d92e	2023-09-28T14:30:15-04:00	Cebtenzzre	gguf : make token scores and types optional (#3347)
M	convert-falcon-hf-to-gguf.py
M	convert-starcoder-hf-to-gguf.py
M	llama.cpp

commit	2619109ad57d7a75388a9cce51e5da645410d92e	ec893798b7a2a803466cc8f063051499ec3d96f7	2023-09-28T19:36:36+03:00	Georgi Gerganov	ci : disable freeBSD builds due to lack of VMs (#3381)
M	.github/workflows/build.yml

commit	ec893798b7a2a803466cc8f063051499ec3d96f7	45855b3f1c7bdd0320aa632334d0b3e8965c26c4	2023-09-28T19:04:36+03:00	Georgi Gerganov	llama : custom attention mask + parallel decoding + no context swaps (#3228)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
M	examples/baby-llama/baby-llama.cpp
A	examples/batched/CMakeLists.txt
A	examples/batched/README.md
A	examples/batched/batched.cpp
M	examples/beam-search/beam-search.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
A	examples/parallel/CMakeLists.txt
A	examples/parallel/README.md
A	examples/parallel/parallel.cpp
M	examples/perplexity/perplexity.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
A	examples/simple/README.md
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
M	tests/test-grad0.cpp
A	tests/test-rope.cpp

commit	45855b3f1c7bdd0320aa632334d0b3e8965c26c4	4aea3b846ec151cc6d08f93a8889eae13b286b06	2023-09-28T09:11:32-04:00	Kevin Ji	docs : mark code as Bash (#3375)
M	docs/BLIS.md

commit	4aea3b846ec151cc6d08f93a8889eae13b286b06	da0400344be12074e67dcabc565140289cf7efaa	2023-09-28T14:13:37+02:00	Pierre Alexandre SCHEMBRI	readme : add Mistral AI release 0.1 (#3362)
M	README.md

commit	da0400344be12074e67dcabc565140289cf7efaa	e519621010cac02c6fec0f8f3b16cda0591042c0	2023-09-28T12:08:28+02:00	slaren	ggml-cuda : perform cublas fp16 matrix multiplication as fp16 (#3370)
M	ggml-cuda.cu

commit	e519621010cac02c6fec0f8f3b16cda0591042c0	ac43576124a75c2de6e333ac31a3444ff9eb9458	2023-09-28T02:45:20+08:00	Zhang Peiyuan	convert : remove bug in convert.py permute function (#3364)
M	convert.py

commit	ac43576124a75c2de6e333ac31a3444ff9eb9458	20c7e1e804690f3db58bd33eb56f8c6aa4735c63	2023-09-27T10:25:12-06:00	Richard Roberson	make-ggml.py : compatibility with more models and GGUF (#3290)
M	examples/make-ggml.py

commit	20c7e1e804690f3db58bd33eb56f8c6aa4735c63	dc6897404e141c74cbbf8030ecfebd74e1815411	2023-09-27T12:18:07-04:00	Cebtenzzre	gguf : fix a few general keys (#3341)
M	examples/gptneox-wip/falcon-main.cpp
M	examples/gptneox-wip/gptneox-main.cpp
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	dc6897404e141c74cbbf8030ecfebd74e1815411	527e57cfd8a9a26bf622c0510c21c2508a24be26	2023-09-27T17:48:33+02:00	Rickard Hallerbäck	metal : reusing llama.cpp logging (#3152)
M	examples/llama-bench/llama-bench.cpp
M	ggml-metal.h
M	ggml-metal.m
M	ggml.h
M	llama.cpp
M	llama.h

commit	527e57cfd8a9a26bf622c0510c21c2508a24be26	ffe88a36a913e5792aa383f0726bdbcf632e7191	2023-09-27T11:34:32-04:00	Jag Chadha	build : add ACCELERATE_NEW_LAPACK to fix warning on macOS Sonoma (#3342)
M	CMakeLists.txt
M	Makefile
M	Package.swift

commit	ffe88a36a913e5792aa383f0726bdbcf632e7191	99115f3fa654b593099c6719ad30e3f54ce231e1	2023-09-27T11:30:36-04:00	BarfingLemurs	readme : add some recent perplexity and bpw measurements to READMES, link for k-quants (#3340)
M	README.md
M	examples/perplexity/README.md
M	examples/quantize/README.md

commit	99115f3fa654b593099c6719ad30e3f54ce231e1	1726f9626f21f102d8e01df06c23a7f94add7990	2023-09-25T18:45:33-04:00	DAN™	cmake : fix build-info.h on MSVC (#3309)
M	CMakeLists.txt
M	scripts/build-info.cmake

commit	1726f9626f21f102d8e01df06c23a7f94add7990	a98b1633d5a94d0aa84c7c16e1f8df5ac21fc850	2023-09-26T02:24:52+08:00	2f38b454	docs: Fix typo CLBlast_DIR var. (#3330)
M	README.md

commit	a98b1633d5a94d0aa84c7c16e1f8df5ac21fc850	c091cdfb24621710c617ea85c92fcd347d0bf340	2023-09-25T13:48:30+02:00	Erik Scholz	nix : add cuda, use a symlinked toolkit for cmake (#3202)
M	flake.nix

commit	c091cdfb24621710c617ea85c92fcd347d0bf340	51a7cf5c6e490b2f51c82daa76c4ca4f8d845826	2023-09-23T21:48:24+02:00	slaren	llama-bench : add README (#3317)
A	examples/llama-bench/README.md

commit	51a7cf5c6e490b2f51c82daa76c4ca4f8d845826	bedb92b603886768ad51e629f81eda15ff6b86f5	2023-09-23T05:28:50-04:00	Cebtenzzre	examples : fix RoPE defaults to match PR #3240 (#3315)
M	common/common.h

commit	bedb92b603886768ad51e629f81eda15ff6b86f5	bc9d3e3971e5607a10ff4c24e39568ce1ac87271	2023-09-22T23:52:23-04:00	Kevin Ji	scripts : use `/usr/bin/env` in shebang (#3313)
M	scripts/verify-checksum-models.py

commit	bc9d3e3971e5607a10ff4c24e39568ce1ac87271	36b904e20003017f50108ae68359ef87a192dae2	2023-09-21T13:00:24-06:00	Lee Drake	Update README.md (#3289)
M	README.md

commit	36b904e20003017f50108ae68359ef87a192dae2	324f3403d54ae4499a1d68623161015f7419fb76	2023-09-21T22:10:26+04:00	shibe2	ggml-opencl.cpp: Make private functions static (#3300)
M	ggml-opencl.cpp

commit	324f3403d54ae4499a1d68623161015f7419fb76	f56c418ab0a635c020bcb5bf44b8f00cb3c9e514	2023-09-21T21:08:20+12:00	Edward Taylor	zig : fix for updated c lib (#3259)
M	build.zig

commit	f56c418ab0a635c020bcb5bf44b8f00cb3c9e514	8185710a80531e9ee0c0cb99d3a9c9af1019ab67	2023-09-21T17:57:40+09:00	yuiseki	embedding : update README.md (#3224)
M	examples/embedding/README.md

commit	8185710a80531e9ee0c0cb99d3a9c9af1019ab67	7eb41179edc56083ef4eb2df7967ac9ff38b34fb	2023-09-21T10:43:53+02:00	Johannes Gäßler	CUDA: use only 1 thread if fully offloaded (#2915)
M	llama.cpp

commit	7eb41179edc56083ef4eb2df7967ac9ff38b34fb	a5661d7e71d15b8dfc81bc0510ba912ebe85dfa3	2023-09-20T20:48:22+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	a5661d7e71d15b8dfc81bc0510ba912ebe85dfa3	65c2c1c5ab7c5089dbc6d10bc49b9c58f0164317	2023-09-20T12:12:47-04:00	Cebtenzzre	llama : allow gguf RoPE keys to be overridden with defaults (#3240)
M	common/common.cpp
M	examples/server/server.cpp
M	llama.cpp

commit	65c2c1c5ab7c5089dbc6d10bc49b9c58f0164317	80834daecf4b9021770361a6d5e1b9c7a60e6854	2023-09-20T12:06:08-04:00	Cebtenzzre	benchmark-matmult : do not use integer abs() on a float (#3277)
M	examples/benchmark/benchmark-matmult.cpp

commit	80834daecf4b9021770361a6d5e1b9c7a60e6854	a40f2b656fab364ce0aff98dbefe9bd9c3721cc9	2023-09-20T22:48:22+09:00	kang	flake : Restore default package's buildInputs (#3262)
M	flake.nix

commit	a40f2b656fab364ce0aff98dbefe9bd9c3721cc9	d119c04c159d015a93567df7e73e0e45a22d0f1d	2023-09-20T15:06:36+03:00	Alon	CI: FreeBSD fix (#3258)
M	.github/workflows/build.yml

commit	d119c04c159d015a93567df7e73e0e45a22d0f1d	8781013ef654270cbead3e0011e33a6d690fb168	2023-09-20T10:02:39+03:00	Georgi Gerganov	examples : fix benchmark-matmult (#1554)
M	examples/benchmark/benchmark-matmult.cpp

commit	8781013ef654270cbead3e0011e33a6d690fb168	7ddf185537b712ea0ccbc5f222ee92bed654914e	2023-09-18T10:03:53-04:00	Cebtenzzre	make : restore build-info.h dependency for several targets (#3205)
M	Makefile
M	common/common.h
M	examples/benchmark/benchmark-matmult.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	examples/save-load-state/save-load-state.cpp

commit	7ddf185537b712ea0ccbc5f222ee92bed654914e	ee66942d7ef7c259528158f9a3bd1c314984d32f	2023-09-18T02:21:47+02:00	Erik Scholz	ci : switch cudatoolkit install on windows to networked (#3236)
M	.github/workflows/build.yml

commit	ee66942d7ef7c259528158f9a3bd1c314984d32f	111163e2463171891680feed94371eb9becd9817	2023-09-17T23:35:20+02:00	Johannes Gäßler	CUDA: fix peer access logic (#3231)
M	ggml-cuda.cu

commit	111163e2463171891680feed94371eb9becd9817	8b428c9bc84be6887d904600d1298b28baffd552	2023-09-17T16:37:53+02:00	Johannes Gäßler	CUDA: enable peer access between devices (#2470)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu

commit	8b428c9bc84be6887d904600d1298b28baffd552	578d8c8f5cb72f354bc115ba230ee5b2d803eee7	2023-09-17T14:33:28+02:00	slaren	llama.cpp : show model size and BPW on load (#3223)
M	llama.cpp

commit	578d8c8f5cb72f354bc115ba230ee5b2d803eee7	b541b4f0b1d4d9871c831e47cd5ff661039d6101	2023-09-17T14:16:22+02:00	Johannes Gäßler	CUDA: fix scratch malloced on non-main device (#3220)
M	ggml-cuda.cu

commit	b541b4f0b1d4d9871c831e47cd5ff661039d6101	5dbc2b3213126a31d3be4ade8ca042cb93019682	2023-09-16T19:35:25+02:00	IsaacDynamo	Enable BUILD_SHARED_LIBS=ON on all Windows builds (#3215)
M	.github/workflows/build.yml

commit	5dbc2b3213126a31d3be4ade8ca042cb93019682	b08e75baea294e366628b898e85c0bd359b58115	2023-09-16T17:55:43+03:00	Vlad	Enable build with CUDA 11.0 (make) (#3132)
M	Makefile
M	ggml-cuda.cu

commit	b08e75baea294e366628b898e85c0bd359b58115	e6616cf0db2b63189fc34d0076f654af9adecdf8	2023-09-16T13:41:33+02:00	goerch	Fixing the last deviations from sentencepiece indicated by test-tokenizer-1 (#3170)
M	common/common.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp
M	llama.h
M	tests/test-tokenizer-0-llama.cpp
M	tests/test-tokenizer-1-llama.cpp

commit	e6616cf0db2b63189fc34d0076f654af9adecdf8	3aefaab9e59335ebb07d5205dbc8633efd680e58	2023-09-15T16:59:49-04:00	Cebtenzzre	examples : add compiler version and target to build info (#2998)
M	Makefile
M	common/common.h
M	examples/beam-search/CMakeLists.txt
M	examples/beam-search/beam-search.cpp
M	examples/benchmark/CMakeLists.txt
M	examples/benchmark/benchmark-matmult.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embd-input/embd-input.h
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/CMakeLists.txt
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/CMakeLists.txt
M	examples/quantize/quantize.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/simple/CMakeLists.txt
M	examples/simple/simple.cpp
M	scripts/build-info.cmake
M	scripts/build-info.h.in
M	scripts/build-info.sh

commit	3aefaab9e59335ebb07d5205dbc8633efd680e58	69eb67e28275cd2d57693405f768754a7b2245ad	2023-09-15T15:38:27-04:00	Cebtenzzre	check C++ code with -Wmissing-declarations (#3184)
M	CMakeLists.txt
M	Makefile
M	common/common.cpp
M	common/console.cpp
M	common/grammar-parser.cpp
M	examples/baby-llama/baby-llama.cpp
M	examples/beam-search/beam-search.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/gguf/gguf.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h
M	pocs/vdot/vdot.cpp
M	tests/test-opt.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp
M	tests/test-sampling.cpp
M	tests/test-tokenizer-1-llama.cpp

commit	69eb67e28275cd2d57693405f768754a7b2245ad	4fe09dfe665c58a753dc9eb638dd4dca1cd35488	2023-09-15T15:18:15-04:00	Cebtenzzre	fix build numbers by setting fetch-depth=0 (#3197)
M	.github/workflows/build.yml

commit	4fe09dfe665c58a753dc9eb638dd4dca1cd35488	80291a1d02a07f7f66666fb576c5b1e75aa48b46	2023-09-16T03:02:13+08:00	Meng Zhang	llama : add support for StarCoder model architectures (#3187)
A	convert-starcoder-hf-to-gguf.py
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	80291a1d02a07f7f66666fb576c5b1e75aa48b46	c6f1491da032238241e01021c8c58d7b540a043f	2023-09-15T14:02:01-04:00	Cebtenzzre	common : do not use GNU zero-length __VA_ARGS__ extension (#3195)
M	common/common.h

commit	c6f1491da032238241e01021c8c58d7b540a043f	e3d87a6c36eadd84d58763143c6d56a0c771ca40	2023-09-15T20:17:24+03:00	Georgi Gerganov	metal : fix bug in soft_max kernels (out-of-bounds access) (#3194)
M	ggml-metal.metal

commit	e3d87a6c36eadd84d58763143c6d56a0c771ca40	8c00b7a6ff38e27fa1e471452b8a480913772c2a	2023-09-15T12:29:02-04:00	Cebtenzzre	convert : make ftype optional in simple scripts (#3185)
M	convert-baichuan-hf-to-gguf.py
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py

commit	8c00b7a6ff38e27fa1e471452b8a480913772c2a	7e50d34be68aae2cc766203703dd188e910e033a	2023-09-15T19:06:03+03:00	Georgi Gerganov	sync : ggml (Metal F32 support + reduce ggml-alloc size) (#3192)
M	examples/llama-bench/llama-bench.cpp
M	ggml-alloc.c
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h

commit	7e50d34be68aae2cc766203703dd188e910e033a	235f7c193b02dacfb56319e41a28684b3a2c6db0	2023-09-15T06:24:30-06:00	Engininja2	cmake : fix building shared libs for clang (rocm) on windows (#3176)
M	CMakeLists.txt

commit	235f7c193b02dacfb56319e41a28684b3a2c6db0	a51b68765799e75e17c7622f376bfbeb66f1bd70	2023-09-15T10:10:22+02:00	Evgeny Kurnevsky	flake : use pkg-config instead of pkgconfig (#3188)
M	flake.nix

commit	a51b68765799e75e17c7622f376bfbeb66f1bd70	76164fe2e65c058e9ee2c3afd0ad6b182ca57e25	2023-09-15T11:09:24+03:00	Georgi Gerganov	metal : relax conditions on fast matrix multiplication kernel (#3168)
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	llama.cpp

commit	76164fe2e65c058e9ee2c3afd0ad6b182ca57e25	c2ab6fe661af9834ca6dd75f14e2439938cc22ac	2023-09-15T04:07:40-04:00	Andrei	cmake : fix llama.h location when built outside of root directory (#3179)
M	CMakeLists.txt

commit	c2ab6fe661af9834ca6dd75f14e2439938cc22ac	2d770505a89a99ce78a5950cf14fc06d3176ffa4	2023-09-15T13:06:56+05:00	Ali Tariq	ci : Cloud-V for RISC-V builds (#3160)
A	.devops/cloud-v-pipeline

commit	2d770505a89a99ce78a5950cf14fc06d3176ffa4	98311c427739e3b06527c3ce6b5c021ab6692740	2023-09-15T03:28:45-04:00	Roland	llama : remove mtest (#3177)
M	common/common.cpp
M	common/common.h
M	examples/main/README.md
M	examples/main/main.cpp
M	run_with_preset.py

commit	98311c427739e3b06527c3ce6b5c021ab6692740	feea179e9f9921e96e8fb1b8855d4a8f83682455	2023-09-14T21:09:53-04:00	Cebtenzzre	llama : make quantize example up to 2.7x faster (#3115)
M	llama.cpp

commit	feea179e9f9921e96e8fb1b8855d4a8f83682455	769266a543f68377a1d904ec2a8c27b38a4025ab	2023-09-14T13:54:47-05:00	jneem	flake : allow $out/include to already exist (#3175)
M	flake.nix

commit	769266a543f68377a1d904ec2a8c27b38a4025ab	cf8238e7f43cb82a36426af392037e85cd2a3df6	2023-09-14T13:38:16-04:00	Andrei	cmake : compile ggml-rocm with -fpic when building shared library (#3158)
M	CMakeLists.txt

commit	cf8238e7f43cb82a36426af392037e85cd2a3df6	4b8560e72a936b5d536ebd1e7a5dd579984769f3	2023-09-14T19:25:00+02:00	Asbjørn Olling	flake : include llama.h in nix output (#3159)
M	flake.nix

commit	4b8560e72a936b5d536ebd1e7a5dd579984769f3	83a53b753a9499a2a3535c93975b430cb2c828a9	2023-09-14T13:22:47-04:00	Cebtenzzre	make : fix clang++ detection, move some definitions to CPPFLAGS (#3155)
M	Makefile

commit	83a53b753a9499a2a3535c93975b430cb2c828a9	5c872dbca2c7979b1f6dafc97db0774b8bbf9372	2023-09-14T20:21:25+03:00	Alon	CI: add FreeBSD & simplify CUDA windows (#3053)
M	.github/workflows/build.yml
M	.github/workflows/gguf-publish.yml

commit	5c872dbca2c7979b1f6dafc97db0774b8bbf9372	990a5e226a1a0ac858abe3aa7e5f3b000d4fa665	2023-09-14T10:19:42-07:00	akawrykow	falcon : use stated vocab size (#2914)
M	convert-falcon-hf-to-gguf.py

commit	990a5e226a1a0ac858abe3aa7e5f3b000d4fa665	980ab41afba96106cd29cdf3aa6f948c251cb71f	2023-09-14T14:04:40-03:00	bandoti	cmake : add relocatable Llama package (#2960)
M	CMakeLists.txt
A	examples/main-cmake-pkg/.gitignore
A	examples/main-cmake-pkg/CMakeLists.txt
A	examples/main-cmake-pkg/README.md
A	scripts/LlamaConfig.cmake.in

commit	980ab41afba96106cd29cdf3aa6f948c251cb71f	e394084166baac09e8ee9a08a4686f907f7e5291	2023-09-14T09:47:00-07:00	dylan	docker : add gpu image CI builds (#3103)
M	.github/workflows/docker.yml
M	README.md

commit	e394084166baac09e8ee9a08a4686f907f7e5291	4c8643dd6ea1a163bc5979cb69c1e7ab0975bc93	2023-09-14T10:32:26-06:00	Kerfuffle	gguf-py : support identity operation in TensorNameMap (#3095)
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml

commit	4c8643dd6ea1a163bc5979cb69c1e7ab0975bc93	35f73049af6c676a106a5a990a819ae0bc3fcd7d	2023-09-15T00:32:10+08:00	jameswu2014	feature : support Baichuan serial models (#3009)
A	convert-baichuan-hf-to-gguf.py
M	gguf-py/gguf/gguf.py
M	llama.cpp
A	prompts/chat-with-baichuan.txt

commit	35f73049af6c676a106a5a990a819ae0bc3fcd7d	71ca2fad7d6c0ef95ef9944fb3a1a843e481f314	2023-09-14T09:14:44-07:00	Leng Yue	speculative : add heuristic algorithm (#3006)
M	examples/speculative/speculative.cpp

commit	71ca2fad7d6c0ef95ef9944fb3a1a843e481f314	1b6c650d16048d6427dd502a9627e72837265844	2023-09-13T15:19:44+02:00	goerch	whisper : tokenizer fix + re-enable tokenizer test for LLaMa (#3096)
M	Makefile
M	llama.cpp
M	tests/CMakeLists.txt
M	tests/test-tokenizer-0-llama.cpp
A	tests/test-tokenizer-1-llama.cpp
D	tests/test-tokenizer-1.cpp

commit	1b6c650d16048d6427dd502a9627e72837265844	0a5eebb45d5697127b84418576dc479c400c4b3d	2023-09-13T06:08:52-07:00	Tristan Ross	cmake : add a compiler flag check for FP16 format (#3086)
M	CMakeLists.txt

commit	0a5eebb45d5697127b84418576dc479c400c4b3d	84e723653ca99d51a74b454984acf2c077468561	2023-09-13T11:20:24+02:00	Johannes Gäßler	CUDA: mul_mat_q RDNA2 tunings (#2910)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu

commit	84e723653ca99d51a74b454984acf2c077468561	b52b29ab9d601bb298050bcd2261169bc917ba2c	2023-09-13T08:50:46+02:00	FK	speculative: add --n-gpu-layers-draft option (#3063)
M	common/common.cpp
M	common/common.h
M	examples/speculative/speculative.cpp

commit	b52b29ab9d601bb298050bcd2261169bc917ba2c	4f7cd6ba9c88d3ca9a207b6e04f8b2b1efd707b8	2023-09-13T02:54:20+01:00	Eric Sommerlade	arm64 support for windows (#3007)
M	CMakeLists.txt
M	ggml.c
M	ggml.h
M	k_quants.c

commit	4f7cd6ba9c88d3ca9a207b6e04f8b2b1efd707b8	89e89599fd095172f8d67903b5e227467420f036	2023-09-13T00:15:33+02:00	Johannes Gäßler	CUDA: fix LoRAs (#3130)
M	ggml-cuda.cu

commit	89e89599fd095172f8d67903b5e227467420f036	d54a4027a6ebda98ab0fef7fa0c2247d0bef132a	2023-09-11T22:58:41+02:00	Johannes Gäßler	CUDA: fix mul_mat_q not used for output tensor (#3127)
M	ggml-cuda.cu

commit	d54a4027a6ebda98ab0fef7fa0c2247d0bef132a	1b0d09259e37898c519edb6c52d58f4d096f10bd	2023-09-11T19:55:51+02:00	Johannes Gäßler	CUDA: lower GPU latency + fix Windows performance (#3110)
M	ggml-cuda.cu

commit	1b0d09259e37898c519edb6c52d58f4d096f10bd	8a4ca9af569853023ce87f047eb5165df13f2ff1	2023-09-11T19:49:06+08:00	Jhen-Jie Hong	cmake : support build for iOS/tvOS (#3116)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	8a4ca9af569853023ce87f047eb5165df13f2ff1	f31b6f4e2d6def3c0bd7c75f75c0c1e8698e0589	2023-09-11T13:00:24+02:00	Johannes Gäßler	CUDA: add device number to error messages (#3112)
M	ggml-cuda.cu

commit	f31b6f4e2d6def3c0bd7c75f75c0c1e8698e0589	6eeb4d90839bac1e6085e5544654ab5c319ad09a	2023-09-11T09:30:11+02:00	Kawrakow	metal : PP speedup (#3084)
M	ggml-metal.m
M	ggml-metal.metal

commit	6eeb4d90839bac1e6085e5544654ab5c319ad09a	21ac3a1503001020122db5dce6adf34b761675f5	2023-09-10T17:06:53+02:00	Erik Scholz	convert: remove most of the n_mult usage in convert.py (#3098)
M	convert.py

commit	21ac3a1503001020122db5dce6adf34b761675f5	4fd54779550e43e2a29f6840ebcf8f395a2f879e	2023-09-09T02:12:10-07:00	kchro3	metal : support for Swift (#3078)
M	Package.swift
M	ggml-metal.m

commit	4fd54779550e43e2a29f6840ebcf8f395a2f879e	ec2a24fedf1de8ebd5f170016953b09ff2806924	2023-09-09T16:46:04+08:00	Jhen-Jie Hong	metal : support build for iOS/tvOS (#3089)
M	ggml-metal.m

commit	ec2a24fedf1de8ebd5f170016953b09ff2806924	7d99aca759f2f8a1ff39f3bb02a840f69863428b	2023-09-08T17:06:26+01:00	takov751	flake : add train-text-from-scratch to flake.nix (#3042)
M	flake.nix

commit	7d99aca759f2f8a1ff39f3bb02a840f69863428b	ba7ffbb2517ff8cf4c689f94a9ad866f3ee71225	2023-09-09T01:04:32+09:00	Ikko Eltociear Ashimine	readme : fix typo (#3043)
M	README.md

commit	ba7ffbb2517ff8cf4c689f94a9ad866f3ee71225	e64f5b55783e910d8287363895d652b4bea6527a	2023-09-08T18:01:04+02:00	Kawrakow	metal : Q3_K speedup (#2995)
M	ggml-metal.metal

commit	e64f5b55783e910d8287363895d652b4bea6527a	94f10b91ed69980f299441e49c8dbdb448f0ccc6	2023-09-08T11:43:35-04:00	Cebtenzzre	examples : make n_ctx warning work again (#3066)
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp
M	llama.h

commit	94f10b91ed69980f299441e49c8dbdb448f0ccc6	b3e9852e471d12cbbe5dad20c81c4766d969739a	2023-09-08T18:18:04+03:00	Georgi Gerganov	readme : update hot tpoics
M	README.md

commit	b3e9852e471d12cbbe5dad20c81c4766d969739a	cb6c44c5e045709b6bb5cc9bb8c9be107c771a78	2023-09-08T17:58:07+03:00	Georgi Gerganov	sync : ggml (CUDA GLM RoPE + POSIX) (#3082)
M	CMakeLists.txt
M	ggml-cuda.cu
M	ggml.c

commit	cb6c44c5e045709b6bb5cc9bb8c9be107c771a78	a21baeb12202a9020b48c53beaaf4b355228e8ba	2023-09-08T14:09:21+02:00	Przemysław Pawełczyk	build : do not use _GNU_SOURCE gratuitously (#2035)
M	CMakeLists.txt
M	Makefile
M	examples/beam-search/beam-search.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/main/main.cpp
M	examples/simple/simple.cpp
M	examples/speculative/speculative.cpp
M	ggml-alloc.c
M	ggml.c
M	llama.cpp

commit	a21baeb12202a9020b48c53beaaf4b355228e8ba	6ff712a6d1a0c85d996e2f681df57a2554cfe5c1	2023-09-08T18:57:55+08:00	hongbo.mo	docker : add git to full-cuda.Dockerfile main-cuda.Dockerfile (#3044)
M	.devops/full-cuda.Dockerfile
M	.devops/main-cuda.Dockerfile

commit	6ff712a6d1a0c85d996e2f681df57a2554cfe5c1	ebc96086af49fe70108cafcea6ab4bebd658a41a	2023-09-08T12:32:55+02:00	Yui	Update deprecated GGML TheBloke links to GGUF (#3079)
M	README.md

commit	ebc96086af49fe70108cafcea6ab4bebd658a41a	7f412dab9c8801f5d37904f7dce1faf4c2b43b42	2023-09-08T04:04:56+02:00	slaren	ggml-alloc : correctly check mmap return value for errors (#3075)
M	ggml-alloc.c

commit	7f412dab9c8801f5d37904f7dce1faf4c2b43b42	6336d834ec7bff3e93e24182c0f609d2f2bdce26	2023-09-08T09:46:56+08:00	Kunshang Ji	enable CPU HBM (#2603)
M	CMakeLists.txt
M	ggml.c
M	llama.cpp

commit	6336d834ec7bff3e93e24182c0f609d2f2bdce26	00d62adb79bf914a95fb9a2e8f42f3029e76d62c	2023-09-07T14:27:42-04:00	Cebtenzzre	convert : fix F32 ftype not being saved (#3048)
M	convert.py

commit	00d62adb79bf914a95fb9a2e8f42f3029e76d62c	4fa2cc1750b861880de42515cb19c13b2d776ee2	2023-09-07T13:22:29-04:00	Cebtenzzre	fix some warnings from gcc and clang-tidy (#3038)
M	.clang-tidy
M	CMakeLists.txt
M	Makefile
M	common/common.cpp
M	common/common.h
M	common/grammar-parser.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
M	examples/gptneox-wip/falcon-main.cpp
M	examples/gptneox-wip/gptneox-main.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml.c
M	llama.cpp
M	tests/test-quantize-perf.cpp

commit	4fa2cc1750b861880de42515cb19c13b2d776ee2	5ffab089a54bc06ae4a9ab533893b558756a1e80	2023-09-07T10:15:01-04:00	Cebtenzzre	make : improve test target (#3031)
M	Makefile

commit	5ffab089a54bc06ae4a9ab533893b558756a1e80	15b67a66c2f2d6032415b28a699b5131962318f1	2023-09-07T10:13:50-04:00	Cebtenzzre	make : fix CPPFLAGS (#3035)
M	Makefile

commit	15b67a66c2f2d6032415b28a699b5131962318f1	be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af	2023-09-07T15:52:34+02:00	slaren	llama-bench : use two tokens in the warmup run for prompt evals (#3059)
M	examples/llama-bench/llama-bench.cpp

commit	be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af	be6beeb8d75294552c4918fce06d7b84eebf3d79	2023-09-07T15:45:01+02:00	Kawrakow	metal : parallel RoPE on Metal (#3024)
M	ggml-metal.m
M	ggml-metal.metal

commit	be6beeb8d75294552c4918fce06d7b84eebf3d79	c4f496648c1e32efeb714200e7eae7fc7cfbb223	2023-09-07T15:42:42+02:00	Kawrakow	metal : correct fix of kernel_norm (#3060)
M	ggml-metal.metal

commit	c4f496648c1e32efeb714200e7eae7fc7cfbb223	fec2fb19e4229aac58c98171c46e77144b99f8a3	2023-09-07T15:49:09+03:00	Georgi Gerganov	metal : fix kernel_norm (fixes Falcon on Metal) (#3057)
M	common/common.cpp
M	ggml-metal.metal

commit	fec2fb19e4229aac58c98171c46e77144b99f8a3	178b1850ebd21b349cebbee887950e435c5aa2d3	2023-09-07T10:15:06+02:00	Przemysław Pawełczyk	ggml : posixify madvise and pagesize (#3037)
M	ggml-metal.m
M	ggml.c
M	llama.cpp

commit	178b1850ebd21b349cebbee887950e435c5aa2d3	ea2c85d5d2a93d39d0172222917f3195f0e456ff	2023-09-06T12:40:57+03:00	Georgi Gerganov	k-quants : fix zero-weight guard in Q6_K (ref #3040)
M	k_quants.c

commit	ea2c85d5d2a93d39d0172222917f3195f0e456ff	9912b9efc8922321fe7202ab42ba913833cbe9cd	2023-09-06T02:49:11-06:00	Kerfuffle	convert-llama-ggml-to-gguf: Try to handle files older than GGJTv3 (#3023)
R068	convert-llama-ggmlv3-to-gguf.py	convert-llama-ggml-to-gguf.py

commit	9912b9efc8922321fe7202ab42ba913833cbe9cd	9e2023156e5b5acabaf8632e66c6ae68d3703c31	2023-09-05T18:21:10-04:00	Cebtenzzre	build : add LLAMA_METAL_NDEBUG flag (#3033)
M	CMakeLists.txt
M	Makefile

commit	9e2023156e5b5acabaf8632e66c6ae68d3703c31	de2fe892af92a5c7b5ef1beb7efbc0524343fbab	2023-09-05T15:12:00-04:00	Cebtenzzre	make : use new flag variables for recent changes (#3019)
M	Makefile

commit	de2fe892af92a5c7b5ef1beb7efbc0524343fbab	c9c3220c485c7bea740a07cda7343677fb3beaae	2023-09-05T15:10:27-04:00	Cebtenzzre	examples : replace fprintf to stdout with printf (#3017)
M	common/common.cpp
M	common/log.h
M	examples/gguf/gguf.cpp
M	examples/gptneox-wip/falcon-main.cpp
M	examples/gptneox-wip/gptneox-main.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/server/server.cpp

commit	c9c3220c485c7bea740a07cda7343677fb3beaae	d59bd97065cd7ded6c4ecab54b1d5e0b1b11e318	2023-09-05T19:41:00+02:00	Erik Scholz	convert: fix convert.py not working with int filename_stem (#3028)
M	convert.py

commit	d59bd97065cd7ded6c4ecab54b1d5e0b1b11e318	35938ee3b0c16f1fbbf240dae21e0228864b938c	2023-09-05T09:55:33+02:00	Kawrakow	Guard against all weights in a super-block being zero (#3010)
M	k_quants.c

commit	35938ee3b0c16f1fbbf240dae21e0228864b938c	921772104ba2219bfdc2b2980d05ebc0aa0c92a4	2023-09-05T10:46:39+03:00	Georgi Gerganov	llama : update logic for number of threads when using BLAS
M	llama.cpp

commit	921772104ba2219bfdc2b2980d05ebc0aa0c92a4	2ba85c8609309a59d49c45ab43c31800b7ba141c	2023-09-05T08:46:17+03:00	Georgi Gerganov	speculative : add grammar support (#2991)
M	Makefile
M	common/common.cpp
M	examples/speculative/speculative.cpp
A	grammars/json_arr.gbnf
M	llama.cpp
M	llama.h

commit	2ba85c8609309a59d49c45ab43c31800b7ba141c	e36ecdccc8754783f93ad3ac8a09e540101f2ca0	2023-09-04T22:50:50+03:00	Georgi Gerganov	py : minor
M	convert-falcon-hf-to-gguf.py

commit	e36ecdccc8754783f93ad3ac8a09e540101f2ca0	bd33e5ab92e7f214205792fc1cd9ca28e810f897	2023-09-04T22:26:24+03:00	Georgi Gerganov	build : on Mac OS enable Metal by default (#2901)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	README.md
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp

commit	bd33e5ab92e7f214205792fc1cd9ca28e810f897	31035681445181fb414e0def7ec3f84462b3bd97	2023-09-04T14:59:52+02:00	slaren	ggml-opencl : store GPU buffer in ggml_tensor::extra (#2994)
M	ggml-opencl.cpp

commit	31035681445181fb414e0def7ec3f84462b3bd97	5b8530d88c489f9d0c0ef3d0886b369f655b792e	2023-09-04T06:40:18-04:00	Cebtenzzre	llama-bench : make cpp file non-executable (#2999)
M	examples/llama-bench/llama-bench.cpp

commit	5b8530d88c489f9d0c0ef3d0886b369f655b792e	e4386f417faf894f6706eec005e24d142b577fcb	2023-09-04T03:39:57-07:00	Leng Yue	make : add speculative example (#3003)
M	.gitignore
M	Makefile

commit	e4386f417faf894f6706eec005e24d142b577fcb	35195689cd835464779c247b1c22ab9247418fd1	2023-09-04T10:28:55+02:00	Aarni Koskela	server : add a subtle loading animation to the edit box (#2466)
M	.editorconfig
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	35195689cd835464779c247b1c22ab9247418fd1	cf9b08485c4c2d4d945c6e74fe20f273a38b6104	2023-09-04T14:53:30+08:00	Jiahao Li	2x faster (rms) norm cuda kernels (3.7% e2e improvement) (#2985)
M	ggml-cuda.cu

commit	cf9b08485c4c2d4d945c6e74fe20f273a38b6104	47068e517004d90f13c16352bb3b4cafd53a00cd	2023-09-03T20:34:09+02:00	slaren	ggml-alloc : use virtual memory for measurement (#2973)
M	ggml-alloc.c

commit	47068e517004d90f13c16352bb3b4cafd53a00cd	8f429fa5111901f9646cf998643ac5310846d487	2023-09-03T15:12:08+03:00	Georgi Gerganov	speculative : PoC for speeding-up inference via speculative sampling (#2926)
M	common/common.cpp
M	common/common.h
M	examples/CMakeLists.txt
M	examples/main/main.cpp
A	examples/speculative/CMakeLists.txt
A	examples/speculative/speculative.cpp

commit	8f429fa5111901f9646cf998643ac5310846d487	6519e9c99cffbad19b31bcba86df48c500628c09	2023-09-03T13:42:56+03:00	Georgi Gerganov	perplexity : fix ETA by warming up the model with an empty run
M	common/common.cpp
M	examples/main/main.cpp

commit	6519e9c99cffbad19b31bcba86df48c500628c09	b7f2aa9e512c3be2e863d877cbb1056d7c4a03f8	2023-09-03T04:38:43-06:00	Kerfuffle	gguf(python): Fix special vocab handling when id < 0 (#2984)
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml

commit	b7f2aa9e512c3be2e863d877cbb1056d7c4a03f8	73a12a6344d5da4d8e2eba5d12221b8bc6895931	2023-09-03T13:23:33+03:00	Georgi Gerganov	metal : restore 363f0bf and fix reduce in F16_F32 kernels (#2986)
M	ggml-metal.metal

commit	73a12a6344d5da4d8e2eba5d12221b8bc6895931	37301347767d555d0a66c043ce4ef6ead8e61c55	2023-09-03T13:19:01+03:00	Alon	cov : disable comment in PRs (#2989)
A	codecov.yml

commit	37301347767d555d0a66c043ce4ef6ead8e61c55	d9151e6f570eb20bfd54427bd8a337d9b1a08018	2023-09-03T19:18:09+09:00	opparco	llama : fix bpe tokenize from byte (#2889)
M	llama.cpp

commit	d9151e6f570eb20bfd54427bd8a337d9b1a08018	afc43d5f82588d2ed71ea104e8262f5e5da13980	2023-09-03T12:40:56+03:00	Georgi Gerganov	metal : revert 6af0bab until we fix it
M	ggml-metal.metal

commit	afc43d5f82588d2ed71ea104e8262f5e5da13980	6460f758dbd472653296044d36bed8c4554988f5	2023-09-03T11:48:49+03:00	Alon	cov : add Code Coverage and codecov.io integration (#2928)
M	.github/workflows/build.yml
A	.github/workflows/code-coverage.yml
M	.gitignore
M	Makefile

commit	6460f758dbd472653296044d36bed8c4554988f5	ca82cf7bac0c91d03e3d320b3a865dd006f854ac	2023-09-03T16:46:44+08:00	Wentai Zhang	opencl : fix a bug in ggml_cl_pool_malloc() for ggml_cl_mul_mat_f32() (#2955)
M	ggml-opencl.cpp

commit	ca82cf7bac0c91d03e3d320b3a865dd006f854ac	6a31a3bd9806c85ed08266f6ab65181da0f30d03	2023-09-03T11:06:22+03:00	Kawrakow	metal : more optimizations (#2959)
M	ggml-metal.m
M	ggml-metal.metal

commit	6a31a3bd9806c85ed08266f6ab65181da0f30d03	cff7b0bf07cb46e1ad4fd199f6bdeb538925c8c4	2023-09-02T23:21:05-07:00	kchro3	swift : add support for k-quants (#2983)
M	Package.swift

commit	cff7b0bf07cb46e1ad4fd199f6bdeb538925c8c4	340af42f09a80e32f4998857b4f0543e41124525	2023-09-02T23:52:13-06:00	Kerfuffle	convert.py : BPE fixes (#2938)
M	convert.py

commit	340af42f09a80e32f4998857b4f0543e41124525	c42f0ec6b344e14bd81c8612ab1445b3ff77358b	2023-09-03T08:50:51+03:00	Ido S	docs : add `catai` to `README.md` (#2967)
M	README.md

commit	c42f0ec6b344e14bd81c8612ab1445b3ff77358b	2753415afdaf22a18c49608bd9d93cfffc05d435	2023-09-03T14:36:28+09:00	momonga	examples : fix gpt-neox (#2943)
M	examples/gptneox-wip/gptneox-main.cpp
M	llama.cpp

commit	2753415afdaf22a18c49608bd9d93cfffc05d435	bc054af97ac68a4b726e972cb283eb9565253ed5	2023-09-02T22:27:25-07:00	kchro3	swift : add missing c file to Package.swift (#2978)
M	Package.swift

commit	bc054af97ac68a4b726e972cb283eb9565253ed5	3358c381f6251bf6e65855e1c93bfaa9ec82ddb3	2023-09-03T01:26:59-04:00	Cebtenzzre	make : support overriding CFLAGS/CXXFLAGS/CPPFLAGS/LDFLAGS (#2886)
M	Makefile

commit	3358c381f6251bf6e65855e1c93bfaa9ec82ddb3	52315a421674ff64305dbf082f69e4ec77f0a3f3	2023-09-02T11:53:55-06:00	Kerfuffle	logging: Fix creating empty file even when disabled (#2966)
M	common/log.h

commit	52315a421674ff64305dbf082f69e4ec77f0a3f3	8b56b4f2c396eae1f4417e5a859557fed989e0ee	2023-09-02T09:53:18-03:00	bandoti	readme : update clblast instructions (#2903)
M	README.md

commit	8b56b4f2c396eae1f4417e5a859557fed989e0ee	21f3d1be867b4d7be07c26f5da6e4bc69bcf4d27	2023-09-02T14:29:09+02:00	Karsten Weiss	metal : show all Metal device instances in the system (#2952)
M	ggml-metal.m

commit	21f3d1be867b4d7be07c26f5da6e4bc69bcf4d27	571083f508266c4eb5cb5457d836df5dd3c173ce	2023-09-02T20:23:45+08:00	Jhen-Jie Hong	k-quants : fix build on armv7 (android only) (#2920)
M	ggml-alloc.c
M	ggml.c
M	k_quants.c

commit	571083f508266c4eb5cb5457d836df5dd3c173ce	f04d0028444bc9b3d4225fba47e19d4c3aeb3741	2023-09-02T08:31:46+08:00	Jhen-Jie Hong	server : avoid aniprompt in probabilities of final response (#2849)
M	examples/server/server.cpp

commit	f04d0028444bc9b3d4225fba47e19d4c3aeb3741	69fdbb9abc8907dd2a9ffdd840cba92d678a660a	2023-09-01T15:33:19-06:00	Engininja2	cuda : vsubss4 for older versions of ROCm/clang (#2942)
M	ggml-cuda.cu

commit	69fdbb9abc8907dd2a9ffdd840cba92d678a660a	5d6f19f16b2173afe2d5c6aee2f5c9fc31038eba	2023-09-01T22:06:44+08:00	ZHAOKAI WANG	readme : quick start command fix (#2908)
M	examples/main/README.md

commit	5d6f19f16b2173afe2d5c6aee2f5c9fc31038eba	0d5893668625456c94bbadfddc53fc69cd51c223	2023-09-01T08:02:48-06:00	Kerfuffle	Allow quantize to only copy tensors, some other improvements (#2931)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	0d5893668625456c94bbadfddc53fc69cd51c223	6c9c23429bf4e4fcaaddbebadc4638558430a7f2	2023-09-01T17:00:40+03:00	Georgi Gerganov	llama2c : rename function
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	6c9c23429bf4e4fcaaddbebadc4638558430a7f2	ee8654bcd0146708988a703e54406d5b553712ea	2023-09-01T09:53:14-04:00	Cebtenzzre	make : use unaligned vector moves on MinGW (#2945)
M	Makefile

commit	ee8654bcd0146708988a703e54406d5b553712ea	49bb9cbe0f598bc43be539b0df8eafb2130cfad3	2023-09-01T15:47:27+02:00	m3ndax	minor : add const qualifiers (#2853)
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	llama.cpp

commit	49bb9cbe0f598bc43be539b0df8eafb2130cfad3	ef156499721c67748cde01a5436cb6f0648bb4b4	2023-09-01T15:36:14+02:00	Konstantin Herud	docs : add java-llama.cpp to README.md (#2935)
M	README.md

commit	ef156499721c67748cde01a5436cb6f0648bb4b4	d8d6977f48f1fa402ade38ad32c5b5fb1358d059	2023-09-01T09:34:50-04:00	Cebtenzzre	build : fix most gcc and clang warnings (#2861)
M	CMakeLists.txt
M	Makefile
M	common/common.cpp
M	common/console.cpp
M	examples/baby-llama/baby-llama.cpp
M	examples/beam-search/beam-search.cpp
M	examples/server/server.cpp
M	k_quants.c
M	llama.cpp

commit	d8d6977f48f1fa402ade38ad32c5b5fb1358d059	5aec2cfaac386eb09aebb75b805860828f00de91	2023-09-01T09:32:14-04:00	Ben Siraphob	examples : add C grammar (#2357)
A	grammars/c.gbnf

commit	5aec2cfaac386eb09aebb75b805860828f00de91	13268c533177a4dc76bce0b465645d74f0d51d55	2023-09-01T18:27:40+05:00	Tameem	ggml : add RISC-V vector intrinsics support (#2929)
M	Makefile
M	ggml.c

commit	13268c533177a4dc76bce0b465645d74f0d51d55	4dcd47d71df8ca4edcc31302744bd93f0c31298e	2023-09-01T13:42:41+03:00	Georgi Gerganov	metal : slight speed-up for add and mul kernels (#2917)
M	ggml-metal.m
M	ggml-metal.metal

commit	4dcd47d71df8ca4edcc31302744bd93f0c31298e	18705a30ef3d6a89e1d7c6cb8cfe8633f760cb53	2023-09-01T11:07:06+02:00	staviq	logs : fix mingw-like builds (fixes #2898) (#2911)
M	Makefile
M	common/log.h

commit	18705a30ef3d6a89e1d7c6cb8cfe8633f760cb53	e8d91589258f9204397a7ac5f9b3c857835c98f8	2023-09-01T05:03:49-04:00	Cebtenzzre	llama2c : fix segfault and alloc-dealloc-mismatch (#2913)
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	e8d91589258f9204397a7ac5f9b3c857835c98f8	bce1fef328941499dc0acb76cc7fd7ac90449c2f	2023-09-01T11:15:57+03:00	Kawrakow	metal: somewhat faster f16 x f32 matrix multiply kernel (#2951)
M	ggml-metal.m
M	ggml-metal.metal

commit	bce1fef328941499dc0acb76cc7fd7ac90449c2f	528134dd0267838d9c0250cf1d9621631dff09b2	2023-08-31T22:13:51-04:00	Cebtenzzre	convert : fix another python 3.8 issue (#2949)
M	convert.py

commit	528134dd0267838d9c0250cf1d9621631dff09b2	aeefac4ff760acea5afe66fbfe8d7eca1937b79c	2023-09-01T01:32:09+02:00	slaren	remove convert-llama-7b-pth-to-gguf.py and convert-llama-hf-to-gguf.py (#2906)
D	convert-llama-7b-pth-to-gguf.py
D	convert-llama-hf-to-gguf.py

commit	aeefac4ff760acea5afe66fbfe8d7eca1937b79c	e8422de39e4aa2f7e50574124b060a80607e654a	2023-08-31T16:49:24-06:00	Kerfuffle	scripts: Use local gguf package when running from repo (#2927)
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-ggmlv3-to-gguf.py
M	convert.py
M	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py

commit	e8422de39e4aa2f7e50574124b060a80607e654a	92d0b751a77a089e650983e9f1564ef4d31b32b9	2023-08-31T04:21:45-07:00	DannyDaemonic	@vxiiduu's fix for PrefetchVirtualMemory (#2930)
M	llama.cpp

commit	92d0b751a77a089e650983e9f1564ef4d31b32b9	8afe2280009ecbfc9de2c93b8f41283dc810609a	2023-08-31T01:02:23-04:00	Cebtenzzre	convert : fix python 3.8 support, modernize type annotations (#2916)
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-7b-pth-to-gguf.py
M	convert-llama-ggmlv3-to-gguf.py
M	convert-llama-hf-to-gguf.py
M	convert-lora-to-ggml.py
M	convert.py
M	gguf-py/gguf/gguf.py
M	gguf-py/pyproject.toml
A	mypy.ini

commit	8afe2280009ecbfc9de2c93b8f41283dc810609a	71d6975559acfd6c8407a4ef8275a9979c737765	2023-08-30T21:46:19+02:00	Johannes Gäßler	CUDA: mul_mat_q=true llama_context_params default (#2912)
M	llama.cpp

commit	71d6975559acfd6c8407a4ef8275a9979c737765	b532a69b2fd08067f34f32f37a2fd9b37678a34a	2023-08-30T19:14:53+03:00	Henri Vasserman	[Docker] fix tools.sh argument passing. (#2884)
M	.devops/tools.sh

commit	b532a69b2fd08067f34f32f37a2fd9b37678a34a	c90d135eb433cf0d40fb95e46a48d1391d2352b5	2023-08-30T13:29:40+03:00	Georgi Gerganov	convert.py : use dir name to name the llama
M	convert.py

commit	c90d135eb433cf0d40fb95e46a48d1391d2352b5	0d1c706181cd31e7f368dd14eeb16c1a2569e4df	2023-08-30T12:52:46+03:00	Georgi Gerganov	examples : fix underscore in beam-search + .gitignore (close #2900)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
R078	examples/beam_search/CMakeLists.txt	examples/beam-search/CMakeLists.txt
R100	examples/beam_search/beam_search.cpp	examples/beam-search/beam-search.cpp

commit	0d1c706181cd31e7f368dd14eeb16c1a2569e4df	950929442070874d45561d2a4b68b010457767de	2023-08-30T12:47:40+03:00	M. Yusuf Sarıgöz	gguf : add workflow for Pypi publishing (#2896)
A	.github/workflows/gguf-publish.yml
M	gguf-py/README.md

commit	950929442070874d45561d2a4b68b010457767de	35092fb54712d032860f3976a6fc1ae1f84a4a28	2023-08-30T12:42:51+03:00	alonfaraj	make : add test and update CI (#2897)
M	.github/workflows/build.yml
M	Makefile

commit	35092fb54712d032860f3976a6fc1ae1f84a4a28	dc07dc492ef9640bbb82904d7c7679f7bdcf6d76	2023-08-30T11:40:12+03:00	Gilad S	docs : add `node-llama-cpp` to `README.md` (#2885)
M	README.md

commit	dc07dc492ef9640bbb82904d7c7679f7bdcf6d76	ad9ddcff6ef322db5cf13785bd7c856b610d242e	2023-08-30T02:25:50-06:00	Kerfuffle	convert : various script cleanups/fixes + merges and special token handling (#2842)
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-7b-pth-to-gguf.py
M	convert-llama-ggmlv3-to-gguf.py
M	convert-llama-hf-to-gguf.py
M	convert-lora-to-ggml.py
M	convert.py
M	gguf-py/gguf/gguf.py
A	gguf-py/gguf/py.typed
M	gguf-py/pyproject.toml

commit	ad9ddcff6ef322db5cf13785bd7c856b610d242e	8341a25957b319a03d4a811176cd5ad7f2b0fbd4	2023-08-30T14:50:55+08:00	chaihahaha	llm.vim : stop generation at multiple linebreaks, bind to <F2> (#2879)
M	examples/llm.vim

commit	8341a25957b319a03d4a811176cd5ad7f2b0fbd4	849408957c687cde4ab32c147107f643fc55130b	2023-08-30T08:29:32+02:00	staviq	main : log file (#2748)
M	.gitignore
M	Makefile
M	common/common.cpp
M	common/common.h
A	common/log.h
M	examples/chat.sh
M	examples/main/main.cpp

commit	849408957c687cde4ab32c147107f643fc55130b	06abf8eebabe086ca4003dee2754ab45032cd3fd	2023-08-30T02:20:26-04:00	Cebtenzzre	tests : add a C compliance test (#2848)
M	CMakeLists.txt
M	Makefile
M	tests/CMakeLists.txt
A	tests/test-c.c

commit	06abf8eebabe086ca4003dee2754ab45032cd3fd	c03a243abf9f30889f31fefdfa94fe9d7034820c	2023-08-29T23:24:42+02:00	slaren	ggml : add view_src and view_offs to ggml_tensor for views (#2874)
M	ggml-alloc.c
M	ggml.c
M	ggml.h

commit	c03a243abf9f30889f31fefdfa94fe9d7034820c	fa3582f509a2715e80a473e79f88dcd1ebff44c2	2023-08-29T23:17:34+02:00	slaren	remove outdated references to -eps and -gqa from README (#2881)
M	README.md

commit	fa3582f509a2715e80a473e79f88dcd1ebff44c2	e37e69dcc3d52f21222a63cafed2a71b3f6b53c6	2023-08-29T23:55:45+03:00	Kawrakow	Tell users attmepting to run perplexity with too few tokens to use more (#2882)
M	examples/perplexity/perplexity.cpp

commit	e37e69dcc3d52f21222a63cafed2a71b3f6b53c6	53885d7256909ec3e2176cdc2477f3986c15ec69	2023-08-29T23:55:03+03:00	Kawrakow	10X faster BPE tokenizer (#2876)
M	llama.cpp

commit	53885d7256909ec3e2176cdc2477f3986c15ec69	bcce96ba4dd95482824700c4ce2455fe8c49055a	2023-08-29T15:51:02+02:00	maddes8cht	py : fix "usage" messages (#2873)
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-7b-pth-to-gguf.py
M	convert-llama-hf-to-gguf.py

commit	bcce96ba4dd95482824700c4ce2455fe8c49055a	74e0caeb82fc9db77fa2cc93070bb919a9a935dd	2023-08-29T17:48:41+08:00	jameswu2014	convert.py : fix baichuan7B support (#2870)
M	convert.py

commit	74e0caeb82fc9db77fa2cc93070bb919a9a935dd	d4b5e16c32ba9c5fa6bbd035e80a99c113050cde	2023-08-29T17:30:10+08:00	Jhen-Jie Hong	readme : add react-native binding (#2869)
M	README.md

commit	d4b5e16c32ba9c5fa6bbd035e80a99c113050cde	3a007648f230ea37d6cca5e63850f04ebb12d2cf	2023-08-29T04:42:41-04:00	Cebtenzzre	make : fix clang tests build, add missing examples (#2859)
M	Makefile

commit	3a007648f230ea37d6cca5e63850f04ebb12d2cf	611363ac791435497e66278dfe31ac8a4e11fa4f	2023-08-29T11:33:46+03:00	Georgi Gerganov	metal : add option to disable debug logs (close #2764)
M	CMakeLists.txt
M	Makefile
M	ggml-metal.m

commit	611363ac791435497e66278dfe31ac8a4e11fa4f	95b6e5212f5e4e1419de1d833d7f8d788f9f2227	2023-08-29T10:50:30+03:00	Georgi Gerganov	scripts : add pipefail
M	scripts/qnt-all.sh
M	scripts/run-all-perf.sh
M	scripts/run-all-ppl.sh

commit	95b6e5212f5e4e1419de1d833d7f8d788f9f2227	44c117f41ee01c5ac8fb86bba041f08d8b87b46d	2023-08-28T23:33:27-07:00	Marcus Dunn	added `struct` to llama_dump_timing_info_yaml's `llama_context` (#2857)
M	llama.h

commit	44c117f41ee01c5ac8fb86bba041f08d8b87b46d	43033b7bb4858da4f591715b3babdf906c9b7cbc	2023-08-28T21:51:47+02:00	xaedes	train : mem usage and other improvements  (#2439)
M	common/common.cpp
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
A	examples/gguf/CMakeLists.txt
M	examples/train-text-from-scratch/README.md
A	examples/train-text-from-scratch/convert-train-checkpoint-to-gguf.py
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/test-grad0.cpp

commit	43033b7bb4858da4f591715b3babdf906c9b7cbc	6b73ef120114beb5664ea94aab48d07ed248ee52	2023-08-28T19:19:18+02:00	slaren	llama-bench : set locale to utf8 (#2832)
M	examples/llama-bench/llama-bench.cpp

commit	6b73ef120114beb5664ea94aab48d07ed248ee52	75fafcbcccc280a5b3883bc76d0a2dabf474d094	2023-08-28T17:59:39+02:00	Johannes Gäßler	YAML result logging + preset script (#2657)
M	common/common.cpp
M	common/common.h
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h
A	run_with_preset.py

commit	75fafcbcccc280a5b3883bc76d0a2dabf474d094	be475f60af1a54e8de81466ccc907d080cf6df1a	2023-08-28T18:38:35+03:00	alonfaraj	make : fix tests build (#2855)
M	.gitignore
M	Makefile

commit	be475f60af1a54e8de81466ccc907d080cf6df1a	3af6b86301ddfb11bb68e91dfc030b611b0d8426	2023-08-28T17:38:12+02:00	grahameth	llama.cpp : fix wrong vsnprintf call in MS compiler (#2856)
M	llama.cpp

commit	3af6b86301ddfb11bb68e91dfc030b611b0d8426	35feac6560387cf0484371af3d9b12bff678e0b9	2023-08-28T14:51:08+02:00	Ronny Brendel	ggml : tiny ggml_vec_dot_q4_K_q8_K AVX2 improvement (#2819)
M	k_quants.c

commit	35feac6560387cf0484371af3d9b12bff678e0b9	92b1bbd2ec43c82ec0530ba3c8758846c5790c75	2023-08-28T14:24:53+03:00	Georgi Gerganov	ggml : sync (mem align to header + conv_transpose_2d fixes + ggml_alloc) (#2852)
M	ggml-alloc.c
M	ggml.c
M	ggml.h

commit	92b1bbd2ec43c82ec0530ba3c8758846c5790c75	dd0dc366dab10e8df28d3924e7f313b5c695e908	2023-08-28T13:23:55+02:00	Johannes Gäßler	CUDA: fix RoPE asserts, block sizes (#2833)
M	ggml-cuda.cu

commit	dd0dc366dab10e8df28d3924e7f313b5c695e908	f55538c3ccba9b926846ef862fa830cea08c433e	2023-08-28T10:19:59+02:00	igarnier	llama.h : add missing struct keyword for C compat in callback type (#2847)
M	llama.h

commit	f55538c3ccba9b926846ef862fa830cea08c433e	ebcee207b6058b7f695bb5c203ad87b1066a9790	2023-08-28T10:59:08+03:00	Georgi Gerganov	metal : fix memory leak (#2762)
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c

commit	ebcee207b6058b7f695bb5c203ad87b1066a9790	3e8ff47af620a31e0810c58a41e4b089145982ef	2023-08-28T02:32:25-04:00	Cebtenzzre	quantize : make output filename optional again (#2823)
M	examples/quantize/quantize.cpp

commit	3e8ff47af620a31e0810c58a41e4b089145982ef	103cfafc774f6feb3172b5d4d39681c965b17eba	2023-08-28T07:31:24+01:00	JohnnyB	devops : added systemd units and set versioning to use date. (#2835)
R056	.devops/lamma-cpp-clblast.srpm.spec	.devops/llama-cpp-clblast.srpm.spec
R071	.devops/lamma-cpp-cublas.srpm.spec	.devops/llama-cpp-cublas.srpm.spec
M	.devops/llama-cpp.srpm.spec

commit	103cfafc774f6feb3172b5d4d39681c965b17eba	c10704d01e21e3dbe4d6ca1026ebff85349dd239	2023-08-27T21:50:22+03:00	Georgi Gerganov	gguf : fix strings to not be null-terminated (#2839)
M	ggml.c

commit	c10704d01e21e3dbe4d6ca1026ebff85349dd239	230d46c723edf5999752e4cb67fd94edb19ef9c7	2023-08-27T18:55:41+03:00	Georgi Gerganov	llama : fix MPI threads (close #2827)
M	llama.cpp

commit	230d46c723edf5999752e4cb67fd94edb19ef9c7	463173a6c0ff353055eb90665794884c888c790f	2023-08-27T15:13:31+01:00	Olivier Chafik	examples : update llama2.c converter to read vocab and write models in GGUF format (#2751)
M	examples/convert-llama2c-to-ggml/README.md
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	463173a6c0ff353055eb90665794884c888c790f	eaa13a48ff4136f01c1cdb79cacd61b67ec53095	2023-08-27T16:50:33+03:00	Kawrakow	llama : speedup tokenization (#2831)
M	examples/perplexity/perplexity.cpp
M	llama.cpp

commit	eaa13a48ff4136f01c1cdb79cacd61b67ec53095	da7455d0467b5f5cc2e45d0dcffaf098df13db63	2023-08-27T16:40:48+03:00	Georgi Gerganov	falcon : fix CUDA inference by making K and Q contiguous (#2830)
M	ggml-cuda.cu
M	llama.cpp

commit	da7455d0467b5f5cc2e45d0dcffaf098df13db63	25423e9185b7c2a1881ed8f85cc752a12370be9d	2023-08-27T15:52:34+03:00	Georgi Gerganov	readme : fix headings
M	README.md

commit	25423e9185b7c2a1881ed8f85cc752a12370be9d	a6d1189fdd4c1ab4ba23f9d777f8950901dcffb2	2023-08-27T15:24:40+03:00	Georgi Gerganov	scripts : helper convert script
A	scripts/convert-gg.sh
M	scripts/qnt-all.sh
M	scripts/run-all-perf.sh
M	scripts/run-all-ppl.sh

commit	a6d1189fdd4c1ab4ba23f9d777f8950901dcffb2	c48c5bb0b06385f6c708339188d2aaf2bc278477	2023-08-27T15:19:59+03:00	Kawrakow	k_quants tuning for Falcon-7b (#2816)
M	ggml-cuda.cu
M	llama.cpp

commit	c48c5bb0b06385f6c708339188d2aaf2bc278477	d0cee0d36d5be95a0d9088b674dbb27354107221	2023-08-27T14:44:35+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	d0cee0d36d5be95a0d9088b674dbb27354107221	edd4c1481708fcd788b0e423268304fd26e2b125	2023-08-27T14:19:54+03:00	Georgi Gerganov	gguf : add 64-bit support (GGUF v2) (#2821)
M	examples/gguf/gguf.cpp
M	ggml.c
M	ggml.h
M	gguf-py/gguf/gguf.py
M	llama.cpp

commit	edd4c1481708fcd788b0e423268304fd26e2b125	1591e2e590762011b43b10a9b6e04f13f98f2aa5	2023-08-27T14:19:19+03:00	Georgi Gerganov	llama : more tokenizer fixes (#2810)
M	common/common.cpp
M	common/common.h
M	examples/beam_search/beam_search.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
A	tests/test-tokenizer-0-falcon.cpp
A	tests/test-tokenizer-0-falcon.py
A	tests/test-tokenizer-0-llama.cpp
A	tests/test-tokenizer-0-llama.py
D	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1.cpp

commit	1591e2e590762011b43b10a9b6e04f13f98f2aa5	789c8c945a2814e1487e18e68823d9926e3b1454	2023-08-27T10:10:25+02:00	Przemysław Pawełczyk	ggml : detect SSSE3 (#2825)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	789c8c945a2814e1487e18e68823d9926e3b1454	c1ac54b77aaba10d029084d152be786102010eb2	2023-08-27T09:03:27+02:00	slaren	ci : add LoRA test to CI (#2650)
M	ci/run.sh

commit	c1ac54b77aaba10d029084d152be786102010eb2	730d9c681e339b76407659344e5a2cd50af7d7d5	2023-08-26T16:11:45-07:00	Bruce MacDonald	server : add `/detokenize` endpoint (#2802)
M	examples/server/README.md
M	examples/server/server.cpp

commit	730d9c681e339b76407659344e5a2cd50af7d7d5	c7d92e6dfec3f54849f3a0ba373054d29f321ea2	2023-08-26T14:13:36-06:00	Kerfuffle	convert.py : advanced option (#2753)
M	convert.py

commit	c7d92e6dfec3f54849f3a0ba373054d29f321ea2	61d1a2895eeca55e0c8b7018492f6ab9c90cff78	2023-08-27T03:27:07+09:00	Tim Miller	llama : use Unicode Escape Sequence to replace encoded characters (#2814)
M	llama.cpp

commit	61d1a2895eeca55e0c8b7018492f6ab9c90cff78	741ca7dd1cec0a0349494742b9083d6ef4cd73c5	2023-08-26T20:19:44+02:00	Tungsten842	flake.nix : add rocm support and cleanup (#2808)
M	flake.lock
M	flake.nix

commit	741ca7dd1cec0a0349494742b9083d6ef4cd73c5	72f895c923ba98b8f2af294440206f35915c0501	2023-08-26T14:17:51-04:00	Cebtenzzre	llama : move #includes out of _GNU_SOURCE conditional (#2817)
M	llama.cpp

commit	72f895c923ba98b8f2af294440206f35915c0501	50526f37eba0b28336700890242ff282b949cd83	2023-08-26T14:12:56-04:00	Dr. Tom Murphy VII Ph.D	main : fix bug (penalize_nl=false doesn't work) + suppress warning on mingw (#1528)
M	examples/main/main.cpp

commit	50526f37eba0b28336700890242ff282b949cd83	04f4b1eb10f3e25750ca3e530265ce2841730e6b	2023-08-26T12:53:52-04:00	Cebtenzzre	llama : use std::abs in llama_sample_tail_free (#2800)
M	llama.cpp

commit	04f4b1eb10f3e25750ca3e530265ce2841730e6b	7592375403a0bd0456d5ec2cdf8350e591f04fb0	2023-08-26T17:37:35+03:00	Georgi Gerganov	k-quants : remove unnecessary tensor shape restrictions (#2811)
M	llama.cpp

commit	7592375403a0bd0456d5ec2cdf8350e591f04fb0	771551a793c9976ed9cdfe7b8c69536af32af9f9	2023-08-26T17:27:49+03:00	Kawrakow	Better perplexity for 2- and 3-bit quantization for LLaMA-v2-70B (#2807)
M	llama.cpp

commit	771551a793c9976ed9cdfe7b8c69536af32af9f9	f305bad11e10ad09e396faed2e37f4f845f5d566	2023-08-26T16:48:53+03:00	Kawrakow	Fix HellaSwag (#2805)
M	examples/perplexity/perplexity.cpp

commit	f305bad11e10ad09e396faed2e37f4f845f5d566	a2ca4e9de9da45ed0bb1c34935d5ec80cebc22d5	2023-08-26T14:25:39+01:00	Volodymyr Vitvitskyi	flake : build llama.cpp on Intel with nix (#2795)
M	flake.nix

commit	a2ca4e9de9da45ed0bb1c34935d5ec80cebc22d5	2ba83c8685177faea3399db9564f9c52df75c366	2023-08-26T07:11:17-05:00	Nigel Bosch	Handle null rope scaling value (#2793)
M	convert.py

commit	2ba83c8685177faea3399db9564f9c52df75c366	bae5c5f679e043371bc2b4dffff8d4964d6cb953	2023-08-26T13:45:53+02:00	klosax	Fix spm whitespaces (#2806)
M	examples/main/main.cpp
M	llama.cpp
M	tests/test-tokenizer-0.cpp

commit	bae5c5f679e043371bc2b4dffff8d4964d6cb953	232caf3c1581a6cb023571780ff41dc2d66d1ca0	2023-08-26T10:07:43+02:00	lon	examples : skip unnecessary external lib in server README.md how-to (#2804)
M	examples/server/README.md

commit	232caf3c1581a6cb023571780ff41dc2d66d1ca0	d046dcee081118c9071bbc63dacdb359a58c467a	2023-08-25T09:17:15-07:00	Marcus Dunn	llama : fix struct decl (#2790)
M	llama.h

commit	d046dcee081118c9071bbc63dacdb359a58c467a	c82742ac9cd96fd34aa961978805c1d8a361d589	2023-08-25T19:05:02+03:00	Kawrakow	Faster perplexity computation (#2786)
M	examples/perplexity/perplexity.cpp

commit	c82742ac9cd96fd34aa961978805c1d8a361d589	28b2c996ca0ab90a5669946084f13443ec98e241	2023-08-25T11:18:48-04:00	Matt Pulver	llama : add llama_beam_search() (#2267)
M	common/common.h
M	examples/CMakeLists.txt
A	examples/beam_search/CMakeLists.txt
A	examples/beam_search/beam_search.cpp
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	28b2c996ca0ab90a5669946084f13443ec98e241	154725c5436808e5c519685d0279e850596dbe62	2023-08-25T09:41:52-05:00	Nigel Bosch	convert.py : Get rope scale from HuggingFace models (#2772)
M	convert.py

commit	154725c5436808e5c519685d0279e850596dbe62	12e2e33a977af73e75885eeee91c5575a77f4e5f	2023-08-25T15:16:19+02:00	slaren	llama-bench : add model sizes (#2771)
M	examples/llama-bench/llama-bench.cpp
M	llama.cpp
M	llama.h

commit	12e2e33a977af73e75885eeee91c5575a77f4e5f	29674ab4e847fcaba60cc6558f0d46d5f74ae279	2023-08-25T14:08:53+02:00	slaren	convert.py : export rope freq_base when converting CodeLlama from an HF model (#2773)
M	convert.py

commit	29674ab4e847fcaba60cc6558f0d46d5f74ae279	5439a0ab57c16b556ffa91a0953df5e46b1e7fb4	2023-08-25T18:32:45+08:00	Jhen-Jie Hong	server : display token probabilities in the UI (#2489)
M	examples/server/index.html.hpp
M	examples/server/public/index.html
M	examples/server/server.cpp

commit	5439a0ab57c16b556ffa91a0953df5e46b1e7fb4	8194cd8772c58b8a43aa07a2fc468f5366d7e320	2023-08-25T13:03:25+03:00	Georgi Gerganov	ci : pip install gguf in editable mode (#2782)
M	ci/run.sh

commit	8194cd8772c58b8a43aa07a2fc468f5366d7e320	6bbc598a632560cb45dd2c51ad403bda8723b629	2023-08-25T12:43:41+03:00	M. Yusuf Sarıgöz	gguf : export objects to user code (#2780)
M	gguf-py/gguf/__init__.py
M	gguf-py/pyproject.toml

commit	6bbc598a632560cb45dd2c51ad403bda8723b629	3f460a2b723c8b936ac29ecfd02f244b3adeba55	2023-08-25T12:09:42+03:00	Henri Vasserman	ROCm Port (#1087)
A	.devops/full-rocm.Dockerfile
A	.devops/main-rocm.Dockerfile
M	.dockerignore
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	README.md
M	common/common.cpp
M	examples/llama-bench/llama-bench.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp

commit	3f460a2b723c8b936ac29ecfd02f244b3adeba55	87e3733f24a85d894cc16e1cbdfa1ea1e81a76f3	2023-08-25T11:55:59+03:00	Georgi Gerganov	cuda : add RoPE kernel for mode == 2 (NeoX) (#2760)
M	ggml-cuda.cu
M	llama.cpp

commit	87e3733f24a85d894cc16e1cbdfa1ea1e81a76f3	b91ad7f46134d0d051dc516eb59a76f402de55c2	2023-08-25T09:26:05+03:00	M. Yusuf Sarıgöz	gguf : make gguf pip-installable
M	.gitignore
A	gguf-py/LICENSE
A	gguf-py/README.md
A	gguf-py/gguf/__init__.py
R100	gguf.py	gguf-py/gguf/gguf.py
A	gguf-py/pyproject.toml
A	gguf-py/tests/test_gguf.py
M	requirements.txt

commit	b91ad7f46134d0d051dc516eb59a76f402de55c2	2e5f70a25fc4576e9ed78603fe493eb7702c37a3	2023-08-25T01:58:00-04:00	Shouzheng Liu	ggml-alloc : enlarge size of parse_seq (#2776)
M	ggml-alloc.c

commit	2e5f70a25fc4576e9ed78603fe493eb7702c37a3	d0f77b1353fc820d1ff1e6b87bc6bedde315938d	2023-08-24T14:49:30-07:00	Marcus Dunn	Added `enum` to `llama_token_get_type` return type (#2774)
M	llama.h

commit	d0f77b1353fc820d1ff1e6b87bc6bedde315938d	0d3094f0c742ce61f84feb6e4f0b59beee6194d7	2023-08-24T21:10:39+02:00	slaren	convert.py : try to determine n_ctx automatically for CodeLlama (#2770)
M	convert.py

commit	0d3094f0c742ce61f84feb6e4f0b59beee6194d7	01f2224682b08185af609b28b1268b95c8b4cfa2	2023-08-24T20:04:05+02:00	slaren	gguf : add rope_freq_base parameter for CodeLlama (#2769)
M	convert.py
M	gguf.py
M	llama.cpp

commit	01f2224682b08185af609b28b1268b95c8b4cfa2	38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4	2023-08-24T19:58:30+03:00	Georgi Gerganov	falcon : write file type
M	convert-falcon-hf-to-gguf.py
M	scripts/run-all-ppl.sh

commit	38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4	8f8c28e89cb9531211783da697d6e7c445e2af1d	2023-08-24T12:27:25-04:00	Shouzheng Liu	metal : bug-fix when enable ggml-alloc (#2757)
M	ggml-alloc.c
M	llama.cpp

commit	8f8c28e89cb9531211783da697d6e7c445e2af1d	7694adda8d1111b3cf758ad6c91d754a0a4cacff	2023-08-24T19:26:19+03:00	Georgi Gerganov	convert : auto-determine model name based on dir + scripts update
M	convert.py
D	scripts/perf-run-all.sh
D	scripts/ppl-run-all.sh
A	scripts/qnt-all.sh
A	scripts/run-all-perf.sh
A	scripts/run-all-ppl.sh

commit	7694adda8d1111b3cf758ad6c91d754a0a4cacff	fea95c682d0028fdd25853bea58035794a0c964d	2023-08-24T10:11:13-06:00	Kerfuffle	Fix for main example getting stuck when -n -2 and --interactive (#2767)
M	examples/main/main.cpp

commit	fea95c682d0028fdd25853bea58035794a0c964d	ef955fbd230c571cc1cda0d19baaeec347523175	2023-08-24T17:44:11+02:00	slaren	fix convert.py for codellama, add llama 34B to the list of recognized models (#2768)
M	convert.py
M	llama.cpp

commit	ef955fbd230c571cc1cda0d19baaeec347523175	d67777c202c03bcb74372690599ef3c03affb3ba	2023-08-24T06:58:02-07:00	DannyDaemonic	Tag release with build number (#2732)
M	.github/workflows/build.yml

commit	d67777c202c03bcb74372690599ef3c03affb3ba	c3e53b421a9910548be0345f85712c535f467a98	2023-08-24T16:19:57+03:00	Georgi Gerganov	metal : add Q8_0 support (#2763)
M	ggml-metal.m
M	ggml-metal.metal

commit	c3e53b421a9910548be0345f85712c535f467a98	6e91a1b0706c2e0e52b9d9be7ee82d3c1e7a33c1	2023-08-24T12:26:01+03:00	Georgi Gerganov	llama : escape all U+2581 in a string (#2750)
M	llama.cpp

commit	6e91a1b0706c2e0e52b9d9be7ee82d3c1e7a33c1	44d5462b5cddc1c5cbcd7647646f7b55b175b01f	2023-08-24T00:07:13-04:00	Evan Jones	llama : fix grammar sometimes generating null char (#2756)
M	llama.cpp

commit	44d5462b5cddc1c5cbcd7647646f7b55b175b01f	c7868b075377c8c3fa916ea7c1aca600f44bed55	2023-08-23T23:44:19+03:00	Georgi Gerganov	readme : fix link
M	README.md

commit	c7868b075377c8c3fa916ea7c1aca600f44bed55	79da24b58c1ea72340e64f799a4717d372207676	2023-08-23T23:43:00+03:00	Georgi Gerganov	minor : fix trailing whitespace
M	README.md

commit	79da24b58c1ea72340e64f799a4717d372207676	cf658adc832badaaa2ca119fe86070e5a830f8f6	2023-08-23T23:41:16+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	cf658adc832badaaa2ca119fe86070e5a830f8f6	a192860cfec89a38d59a943623bf595b1fe4495b	2023-08-23T23:08:04+03:00	Georgi Gerganov	llm : add Falcon support (#2717)
M	common/common.cpp
M	common/common.h
M	convert-falcon-hf-to-gguf.py
M	convert.py
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	gguf.py
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
M	tests/test-tokenizer-1.cpp

commit	a192860cfec89a38d59a943623bf595b1fe4495b	95385241a91a616788a3bb76d12c9b7b2379ca2d	2023-08-23T22:37:39+03:00	Georgi Gerganov	minor : fix trailing whitespace
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	95385241a91a616788a3bb76d12c9b7b2379ca2d	335acd2ffd7b04501c6d8773ab9fcee6e7bf8639	2023-08-23T20:33:05+01:00	Olivier Chafik	examples : restore the functionality to import llama2.c models (#2685)
M	examples/convert-llama2c-to-ggml/README.md
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	335acd2ffd7b04501c6d8773ab9fcee6e7bf8639	5290c38e6e9b66ee2b543e560e301c1a1a90929c	2023-08-23T16:46:54+02:00	slaren	fix convert-lora-to-ggml.py (#2738)
M	convert-lora-to-ggml.py

commit	5290c38e6e9b66ee2b543e560e301c1a1a90929c	cc34dbda9681418a2b18382446b90cdcec398d82	2023-08-23T16:46:03+02:00	klosax	main : insert bos if no tokens (#2727)
M	examples/main/main.cpp

commit	cc34dbda9681418a2b18382446b90cdcec398d82	7c2227a1972a4add4b5c118e4914c086513d0382	2023-08-23T07:31:34-07:00	akawrykow	gitignore : fix for windows (#2729)
M	.gitignore

commit	7c2227a1972a4add4b5c118e4914c086513d0382	f19dca04ea5fbf9a0b2753091d93464585d5c73b	2023-08-23T10:29:09-04:00	Cebtenzzre	chmod : make scripts executable (#2675)
M	ci/run.sh
M	convert-falcon-hf-to-gguf.py
M	convert-gptneox-hf-to-gguf.py
M	convert-llama-7b-pth-to-gguf.py
M	convert-llama-ggmlv3-to-gguf.py
M	convert-llama-hf-to-gguf.py
M	convert-lora-to-ggml.py
M	convert.py
M	examples/embd-input/embd_input.py
M	examples/embd-input/llava.py
M	examples/embd-input/minigpt4.py
M	examples/embd-input/panda_gpt.py
M	examples/jeopardy/graph.py
M	examples/jeopardy/jeopardy.sh
M	examples/json-schema-to-grammar.py
M	examples/make-ggml.py
M	examples/reason-act.sh
M	examples/server-llama2-13B.sh
M	examples/server/api_like_OAI.py
M	examples/server/chat-llama2.sh
M	examples/server/chat.sh
M	gguf.py
M	scripts/get-wikitext-2.sh

commit	f19dca04ea5fbf9a0b2753091d93464585d5c73b	8207214b6a37a46526cee9e72d4c9092b9d1872f	2023-08-23T15:28:22+01:00	JohnnyB	devops : RPM Specs (#2723)
A	.devops/lamma-cpp-clblast.srpm.spec
A	.devops/lamma-cpp-cublas.srpm.spec
A	.devops/llama-cpp.srpm.spec

commit	8207214b6a37a46526cee9e72d4c9092b9d1872f	62959e740e8759d246ac8d09036950efde09981c	2023-08-23T12:57:12+03:00	Kawrakow	Fix values shown in the quantize tool help (#2735)
M	examples/quantize/quantize.cpp

commit	62959e740e8759d246ac8d09036950efde09981c	7f7ddd5002040804e33fcdbde44aa22f8635f57d	2023-08-23T12:56:42+03:00	Kawrakow	Strided perplexity (#2714)
M	common/common.cpp
M	common/common.h
M	examples/perplexity/perplexity.cpp

commit	7f7ddd5002040804e33fcdbde44aa22f8635f57d	b8ad1b66b23f9b2e6e4531e9a62753323036a556	2023-08-23T06:31:09-03:00	IgnacioFDM	Fix ggml to gguf conversion on Windows (#2733)
M	convert-llama-ggmlv3-to-gguf.py

commit	b8ad1b66b23f9b2e6e4531e9a62753323036a556	f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26	2023-08-23T02:12:12-05:00	Xiao-Yong Jin	server : allow json array in prompt or content for direct token input (#2306)
M	examples/server/README.md
M	examples/server/server.cpp

commit	f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26	777f42ba18b29f25c71ff8de3ecf97b8017304c0	2023-08-22T21:01:57-04:00	Evan Jones	docs : add grammar docs (#2701)
M	README.md
M	examples/main/README.md
A	grammars/README.md

commit	777f42ba18b29f25c71ff8de3ecf97b8017304c0	46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea	2023-08-22T17:39:39-06:00	Kerfuffle	Improve handling of special tokens in GGML to GGUF converter (#2725)
M	convert-llama-ggmlv3-to-gguf.py
M	llama.cpp

commit	46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea	c63bb1d16a70c03440671b76954bb767513cead8	2023-08-22T23:10:42+02:00	goerch	llama : fix whitespace escaping in tokenizer (#2724)
M	llama.cpp
M	tests/test-tokenizer-0.cpp
M	tests/test-tokenizer-1.cpp

commit	c63bb1d16a70c03440671b76954bb767513cead8	3b6cfe7c927df178ca3c11643c3ec93e143471c9	2023-08-22T22:47:05+02:00	Johannes Gäßler	CUDA: use mul_mat_q kernels by default (#2683)
M	common/common.cpp
M	common/common.h
M	examples/server/server.cpp
M	ggml-cuda.cu

commit	3b6cfe7c927df178ca3c11643c3ec93e143471c9	800c9635b4a9390126f397870f3a825fc7455bd1	2023-08-22T21:58:16+03:00	Alex Petenchea	convert.py : clarifying error message (#2718)
M	convert.py

commit	800c9635b4a9390126f397870f3a825fc7455bd1	deb7dfca4b9725cd295d1426db75fe8e0a6d5312	2023-08-23T02:27:06+08:00	Jiahao Li	Fix CUDA softmax by subtracting max value before exp (#2665)
M	ggml-cuda.cu

commit	deb7dfca4b9725cd295d1426db75fe8e0a6d5312	bac66994cf356cf488078c056831396eb4ce31d5	2023-08-22T20:05:59+03:00	Georgi Gerganov	gguf : add ftype meta info to the model (#2710)
M	convert.py
M	gguf.py
M	llama.cpp
M	llama.h

commit	bac66994cf356cf488078c056831396eb4ce31d5	519c981f8b65ee6c87c2965539685ced0a17223b	2023-08-22T19:14:09+03:00	Kawrakow	Quantization imrovements for k_quants (#2707)
M	k_quants.c
M	llama.cpp

commit	519c981f8b65ee6c87c2965539685ced0a17223b	1123f7fbdfb8012e46f05e903e6f675922916378	2023-08-22T16:03:12+02:00	slaren	embedding : evaluate prompt in batches (#2713)
M	examples/embedding/embedding.cpp

commit	1123f7fbdfb8012e46f05e903e6f675922916378	ef3f333d3775600d1646a9fa249aca532d15fb89	2023-08-22T15:25:19+02:00	slaren	ggml-cuda : use graph allocator (#2684)
M	common/common.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp

commit	ef3f333d3775600d1646a9fa249aca532d15fb89	8e4364f2af9cd5d57240f23e83c0e29bc068bc02	2023-08-22T14:22:08+03:00	Georgi Gerganov	ggml : sync latest (SAM + SD operators, CUDA alibi) (#2709)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-alloc.c
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	scripts/sync-ggml.sh

commit	8e4364f2af9cd5d57240f23e83c0e29bc068bc02	1e3bc523d8053a77df3ac7126a84d0297ee97ef6	2023-08-22T09:56:03+02:00	slaren	llama-bench : minor fixes (#2695)
M	examples/llama-bench/llama-bench.cpp

commit	1e3bc523d8053a77df3ac7126a84d0297ee97ef6	14b1d7e6f720dee41ce5a826376df738096d9033	2023-08-22T15:14:23+08:00	Kylin	ggml : support CUDA's half type for aarch64(#1455) (#2670)
M	ggml.h

commit	14b1d7e6f720dee41ce5a826376df738096d9033	226255b44ef2c2794bfac48d101d35a9c2dbb965	2023-08-22T02:18:40-04:00	Shouzheng Liu	metal : add missing barriers for mul-mat (#2699)
M	ggml-metal.metal

commit	226255b44ef2c2794bfac48d101d35a9c2dbb965	930523c8e1cbbee5449c055daa894917fac6805e	2023-08-22T08:32:00+08:00	Jhen-Jie Hong	server : fallback to default if client param is null (#2688)
M	examples/server/server.cpp

commit	930523c8e1cbbee5449c055daa894917fac6805e	c8dba409e6d6a754090f08e6a862c5ffdd52e421	2023-08-21T18:01:34-06:00	Kerfuffle	Fix convert-llama-ggmlv3-to-gguf.py vocab conversion (#2698)
M	convert-llama-ggmlv3-to-gguf.py

commit	c8dba409e6d6a754090f08e6a862c5ffdd52e421	6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9	2023-08-21T23:40:22+03:00	Georgi Gerganov	py : remove obsolete script
D	convert-pth-to-ggml.py

commit	6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9	dadbed99e65252d79f81101a392d0d6497b86caa	2023-08-21T23:07:43+03:00	Georgi Gerganov	gguf : new file format with flexible meta data (beta) (#2398)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	README.md
M	ci/run.sh
A	common/CMakeLists.txt
R092	examples/common.cpp	common/common.cpp
R088	examples/common.h	common/common.h
R100	examples/console.cpp	common/console.cpp
R100	examples/console.h	common/console.h
R100	examples/grammar-parser.cpp	common/grammar-parser.cpp
R100	examples/grammar-parser.h	common/grammar-parser.h
A	convert-falcon-hf-to-gguf.py
A	convert-gptneox-hf-to-gguf.py
A	convert-llama-7b-pth-to-gguf.py
A	convert-llama-ggmlv3-to-gguf.py
A	convert-llama-hf-to-gguf.py
M	convert.py
M	docs/token_generation_performance_tips.md
M	examples/CMakeLists.txt
M	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
A	examples/gguf/gguf.cpp
A	examples/gptneox-wip/cmpnct_gpt2bpe.hpp
A	examples/gptneox-wip/falcon-main.cpp
A	examples/gptneox-wip/gptneox-main.cpp
M	examples/llama-bench/llama-bench.cpp
M	examples/main/main.cpp
M	examples/metal/metal.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/README.md
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
A	gguf.py
D	llama-util.h
M	llama.cpp
M	llama.h
A	models/.editorconfig
A	models/ggml-vocab-llama.gguf
D	models/ggml-vocab.bin
M	tests/CMakeLists.txt
M	tests/test-grammar-parser.cpp
M	tests/test-llama-grammar.cpp
M	tests/test-tokenizer-0.cpp
A	tests/test-tokenizer-1.cpp

commit	dadbed99e65252d79f81101a392d0d6497b86caa	cb1c0727bd59803b439b6a3af121c99e6393ff3d	2023-08-21T06:59:29-04:00	Shouzheng Liu	metal : fix synchronization in new matrix multiplication kernel (#2686)
M	ggml-metal.metal

commit	cb1c0727bd59803b439b6a3af121c99e6393ff3d	9e232f0234073358e7031c1b8d7aa45020469a3b	2023-08-21T11:11:31+03:00	Kawrakow	HellaSwag: split token evaluation into batches if needed (#2681)
M	examples/perplexity/perplexity.cpp

commit	9e232f0234073358e7031c1b8d7aa45020469a3b	5e9ff54a675d163d9f42aad1b5b3e734f17b2701	2023-08-20T22:17:53+02:00	slaren	ggml : move all type info to ggml_type_traits (#2663)
M	ggml.c
M	ggml.h

commit	5e9ff54a675d163d9f42aad1b5b3e734f17b2701	1f0bccb27929e261744c979bc75114955da49e98	2023-08-20T16:44:46+03:00	Kawrakow	More efficient Hellaswag implementation (#2677)
M	examples/perplexity/perplexity.cpp

commit	1f0bccb27929e261744c979bc75114955da49e98	f63564adfaa157ca387071d6b9a06cfaef0ef576	2023-08-19T00:45:36+03:00	Georgi Gerganov	server : better default prompt (#2646)
M	examples/server/public/index.html

commit	f63564adfaa157ca387071d6b9a06cfaef0ef576	2d8b76a110d76ff6b5728ff0af8477531e4db60e	2023-08-19T05:41:32+08:00	Jhen-Jie Hong	server : update xxd usage for older versions compatibility (#2649)
M	examples/server/deps.sh

commit	2d8b76a110d76ff6b5728ff0af8477531e4db60e	7af633aec339367e36c867ae709088d6a801aa75	2023-08-18T12:39:22-07:00	Adrian	Add link to clojure bindings to Readme. (#2659)
M	README.md

commit	7af633aec339367e36c867ae709088d6a801aa75	097e121e2f17ed3541cf02c55ff7e9febc091b19	2023-08-18T17:48:31+03:00	Georgi Gerganov	readme : incoming BREAKING CHANGE
M	README.md

commit	097e121e2f17ed3541cf02c55ff7e9febc091b19	eaf98c2649d7da705de255712f0038ac7e47c610	2023-08-18T12:44:58+02:00	slaren	llama : add benchmark example (#2626)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/llama-bench/CMakeLists.txt
A	examples/llama-bench/llama-bench.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp
M	llama.h

commit	eaf98c2649d7da705de255712f0038ac7e47c610	e9b12c332ec6e215fbac4b2ef165353acbcd8319	2023-08-18T15:47:58+05:30	mdrokz	readme : add link to Rust bindings (#2656)
M	README.md

commit	e9b12c332ec6e215fbac4b2ef165353acbcd8319	604b8bdfa6320bbcb018eebcc1252dfede603c6b	2023-08-18T12:48:55+03:00	Georgi Gerganov	perplexity : more meaningful ETA number - 2 decimal points
M	examples/perplexity/perplexity.cpp

commit	604b8bdfa6320bbcb018eebcc1252dfede603c6b	10151bee2e38b5711335c4a38f6ca93b50223acf	2023-08-17T19:54:44-04:00	Evan Jones	Fix unicode in grammars (fixes #2501) (#2553)
M	llama.cpp
M	tests/test-llama-grammar.cpp

commit	10151bee2e38b5711335c4a38f6ca93b50223acf	0992a7b8b18a89e29a205efb48ceb559c9a08203	2023-08-17T23:34:01Z	staviq	server : support for saving templates in browser LocalStorage (#2486)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	0992a7b8b18a89e29a205efb48ceb559c9a08203	6ddeefad9b634c5c79e6bcf046523493ff1fdf7d	2023-08-17T23:57:59+02:00	Johannes Gäßler	README: fix LLAMA_CUDA_MMV_Y documentation (#2647)
M	README.md

commit	6ddeefad9b634c5c79e6bcf046523493ff1fdf7d	8dae7ce68437faf1fa96ec0e7687b8700956ef20	2023-08-17T23:11:18+03:00	Henri Vasserman	[Zig] Fixing Zig build and improvements (#2554)
M	README.md
M	build.zig

commit	8dae7ce68437faf1fa96ec0e7687b8700956ef20	a73ccf1aa34de49f61bfeb7f8a679c3bfdb3abe3	2023-08-17T07:29:44-06:00	Kerfuffle	Add --cfg-negative-prompt-file option for examples (#2591)
M	examples/common.cpp

commit	a73ccf1aa34de49f61bfeb7f8a679c3bfdb3abe3	7cf54e1f746941279d81d485796777c01f88049c	2023-08-17T10:47:09+03:00	Georgi Gerganov	llama : replace (permute + reshape + view_1d) with (view_3d) (#2538)
M	llama.cpp

commit	7cf54e1f746941279d81d485796777c01f88049c	a872a2b28eaefc8d464eaa535c94deeb501666f9	2023-08-17T03:41:01-04:00	drbh	tests : adds simple llama grammar tests (#2618)
M	Makefile
M	tests/CMakeLists.txt
A	tests/test-llama-grammar.cpp

commit	a872a2b28eaefc8d464eaa535c94deeb501666f9	0919a0f73d95cfb93a1646a1d1741a0615fe2c5e	2023-08-17T03:35:53-04:00	Shouzheng Liu	ggml-alloc : fix discrepency between measure&eval (#2639)
M	ggml-alloc.c

commit	0919a0f73d95cfb93a1646a1d1741a0615fe2c5e	ed53db86c3b0e0815331a96d7a379edb5e62472c	2023-08-16T21:09:49+01:00	Kolen Cheung	cmake : install ggml-meta.metal if LLAMA_METAL (#2449)
M	CMakeLists.txt

commit	ed53db86c3b0e0815331a96d7a379edb5e62472c	fc8ef549e50087762a0b4f901cd74b2defcc6ae3	2023-08-17T04:09:03+08:00	Jhen-Jie Hong	metal : print error of load pipeline state (#2564)
M	ggml-metal.m

commit	fc8ef549e50087762a0b4f901cd74b2defcc6ae3	bf83bff6742c0f1795b4c18695a13a34ac7adf62	2023-08-16T16:08:28-04:00	Shouzheng Liu	metal : enable ggml-alloc (#2627)
M	ggml-alloc.c
M	ggml-alloc.h
M	ggml-metal.h
M	ggml-metal.m
M	llama.cpp

commit	bf83bff6742c0f1795b4c18695a13a34ac7adf62	b5ffb2849d23afe73647f68eec7b68187af09be6	2023-08-16T16:07:04-04:00	Shouzheng Liu	metal : matrix-matrix multiplication kernel (#2615)
M	CMakeLists.txt
M	Makefile
M	flake.nix
M	ggml-metal.m
M	ggml-metal.metal
M	llama.cpp

commit	b5ffb2849d23afe73647f68eec7b68187af09be6	3ebb00935f3f0522b75df49c2769ab1774b91380	2023-08-15T10:04:58+03:00	Georgi Gerganov	scripts : add helper script to get wikitext
A	scripts/get-wikitext-2.sh

commit	3ebb00935f3f0522b75df49c2769ab1774b91380	d783f7982e0e823a2626a9956359c0d36c1a7e21	2023-08-15T06:14:14+08:00	Jhen-Jie Hong	server : add missing /json-schema-to-grammar.mjs (#2616)
M	examples/server/server.cpp

commit	d783f7982e0e823a2626a9956359c0d36c1a7e21	d75561df207d22790609ee0ad924302f66ac2599	2023-08-14T21:37:39+08:00	Jhen-Jie Hong	metal : return null instead of exit(1) (#2573)
M	ggml-metal.m
M	llama.cpp

commit	d75561df207d22790609ee0ad924302f66ac2599	348acf188c9fbe66396990f2dc83229df367969b	2023-08-14T15:36:42+02:00	Cheng Shao	server : add --numa support (#2524)
M	examples/server/README.md
M	examples/server/server.cpp

commit	348acf188c9fbe66396990f2dc83229df367969b	1cd06fa25eb859b14b3427a1d815a48f25fc3c34	2023-08-14T15:35:16+02:00	Kamil Tomšík	llama : add missing enum keyword in function signatures (#2610)
M	llama.h

commit	1cd06fa25eb859b14b3427a1d815a48f25fc3c34	2feb8934eb75ca63f3c42724229cce1df9579c8e	2023-08-14T10:41:22+02:00	Johannes Gäßler	CUDA: launch_bounds, small q4_K, q5_K mmq refactor (#2596)
M	ggml-cuda.cu

commit	2feb8934eb75ca63f3c42724229cce1df9579c8e	5517d6e69214cdead000a76983b9fe175c3f8329	2023-08-14T16:20:17+08:00	Jhen-Jie Hong	server : fix default grammar by use empty string in the UI (#2604)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	5517d6e69214cdead000a76983b9fe175c3f8329	f31b5397143009d682db90fd2a6cde83f1ef00eb	2023-08-14T15:16:54+08:00	Jhen-Jie Hong	server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588)
M	examples/server/chat.mjs
M	examples/server/index.html.hpp
M	examples/server/index.js.hpp
A	examples/server/json-schema-to-grammar.mjs.hpp
M	examples/server/public/index.html
M	examples/server/public/index.js
A	examples/server/public/json-schema-to-grammar.mjs

commit	f31b5397143009d682db90fd2a6cde83f1ef00eb	ee77efea2a1e3f7d153976b0934522b6bbaa62e6	2023-08-14T13:59:16+10:00	vxiiduu	Enhance Windows 7 and below compatibility. (#2592)
M	llama-util.h

commit	ee77efea2a1e3f7d153976b0934522b6bbaa62e6	f64d44a9b9581cd58f7ec40f4fa1c3ca5ca18e1e	2023-08-13T10:00:48-04:00	drbh	test : add simple grammar parsing tests (#2594)
M	.gitignore
M	Makefile
M	tests/CMakeLists.txt
A	tests/test-grammar-parser.cpp

commit	f64d44a9b9581cd58f7ec40f4fa1c3ca5ca18e1e	b19edd54d51cef5e3616c18b1d0d8626895b2cba	2023-08-13T00:24:45+02:00	Johannes Gäßler	CUDA: Fixed OpenLLaMA 3b mmq, reduced compile time (#2590)
M	CMakeLists.txt
M	ggml-cuda.cu

commit	b19edd54d51cef5e3616c18b1d0d8626895b2cba	53dc399472d5bd35ee739b865e843b1996bd3814	2023-08-11T19:17:25-04:00	byte-6174	Adding support for llama2.c models (#2559)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/convert-llama2c-to-ggml/CMakeLists.txt
A	examples/convert-llama2c-to-ggml/README.md
A	examples/convert-llama2c-to-ggml/convert-llama2c-to-ggml.cpp

commit	53dc399472d5bd35ee739b865e843b1996bd3814	9ca4abed893685692f90413e4d43153af12342d9	2023-08-12T06:35:14+08:00	Equim	server: fixed wrong variable name in timing json (#2579)
M	examples/server/server.cpp

commit	9ca4abed893685692f90413e4d43153af12342d9	e59fcb2bc129881f4a269fee748fb38bce0a64de	2023-08-10T13:11:36-07:00	DannyDaemonic	Handle `ENABLE_VIRTUAL_TERMINAL_PROCESSING` more gracefully on earlier versions of Windows.
M	examples/console.cpp

commit	e59fcb2bc129881f4a269fee748fb38bce0a64de	1638757767072a4957f52b9e3594f0b67610631b	2023-08-10T10:28:27-04:00	Christian Demsar	Add --n-predict -2 for stopping generation on full context (#2565)
M	examples/common.cpp
M	examples/main/README.md
M	examples/main/main.cpp

commit	1638757767072a4957f52b9e3594f0b67610631b	916a9acdd0a411426690400ebe2bb7ce840a6bba	2023-08-10T12:16:38+02:00	Martin Krasser	Fix grammar-based sampling issue in server (#2566)
M	examples/server/server.cpp

commit	916a9acdd0a411426690400ebe2bb7ce840a6bba	ea04a4ca1940d92becc0ee26523aa2c4a18cf938	2023-08-09T23:47:42+03:00	Sam Spilsbury	ggml-alloc: Don't try to re-use buffers of external tensors (#2562)
M	ggml-alloc.c

commit	ea04a4ca1940d92becc0ee26523aa2c4a18cf938	25d43e0eb578b6e73046d9d6644a3a14d460600d	2023-08-09T22:46:40+02:00	grahameth	add log_callback to llama_context_params for custom logging. (#2234)
M	llama.cpp
M	llama.h

commit	25d43e0eb578b6e73046d9d6644a3a14d460600d	f5bfea0580e417f99850d5456ca541d871a3e48c	2023-08-09T09:42:34+02:00	Johannes Gäßler	CUDA: tuned mul_mat_q kernels (#2546)
M	Makefile
M	README.md
M	ggml-cuda.cu

commit	f5bfea0580e417f99850d5456ca541d871a3e48c	acfc5478ff3446ca3b54553967a3dea09b7c771a	2023-08-08T15:29:19+02:00	Martin Krasser	Allow passing grammar to completion endpoint (#2532)
M	Makefile
M	examples/server/README.md
M	examples/server/server.cpp

commit	acfc5478ff3446ca3b54553967a3dea09b7c771a	7ed8d1fe7f8cbe6a6763e6b46759795ac8d21e12	2023-08-08T14:38:16+02:00	Johannes Gäßler	CUDA: tighter VRAM scratch size for 65b/70b (#2551)
M	llama.cpp

commit	7ed8d1fe7f8cbe6a6763e6b46759795ac8d21e12	e7f94d6fdc83b41ba449b4b8c80821673dd12ffc	2023-08-08T20:07:02+08:00	chaihahaha	llm.vim : multiline autocompletion, get rid of "^@" (#2543)
M	examples/llm.vim

commit	e7f94d6fdc83b41ba449b4b8c80821673dd12ffc	2d7baaf50f3277e65cf71071f61ea34823d14c30	2023-08-08T15:05:30+03:00	Georgi Gerganov	vim : bring back simple llm.vim example
A	examples/llm.vim

commit	2d7baaf50f3277e65cf71071f61ea34823d14c30	f3c3b4b1672d860800639c87d3b5d17564692469	2023-08-08T06:44:48-05:00	AustinMroz	vim : streaming and more (#2495)
A	examples/llama.vim
D	examples/llm.vim

commit	f3c3b4b1672d860800639c87d3b5d17564692469	93356bdb7a324a8f6570f99d02af392cd4c45796	2023-08-07T19:07:19+02:00	klosax	Add --rope-scale parameter (#2544)
M	examples/common.cpp
M	examples/main/README.md

commit	93356bdb7a324a8f6570f99d02af392cd4c45796	60baff7c8584ec369e53469cad5f92e102b1efe4	2023-08-07T14:25:58+03:00	Georgi Gerganov	ggml : mul mat tweaks (#2372)
M	ggml.c

commit	60baff7c8584ec369e53469cad5f92e102b1efe4	9082b5dfbfae01243a0b822dcd2812877e63bf1b	2023-08-07T14:24:42+03:00	Georgi Gerganov	ggml : pad result of ggml_nbytes()
M	ggml.c

commit	9082b5dfbfae01243a0b822dcd2812877e63bf1b	99d29c0094476c4962023036ecd61a3309d0e16b	2023-08-07T13:55:18+03:00	Georgi Gerganov	ggml : change params pointer (style change) (#2539)
M	ggml.c

commit	99d29c0094476c4962023036ecd61a3309d0e16b	3d9a55181603e85a26378a850a14068034e5002d	2023-08-07T13:20:09+03:00	Georgi Gerganov	ggml : sync (custom ops) (#2537)
M	ggml.c
M	ggml.h

commit	3d9a55181603e85a26378a850a14068034e5002d	f6f9896ac3d2ff207e18f87dab85d126ceef5236	2023-08-07T10:09:40+02:00	Johannes Gäßler	Fixed mmap prefetch for GPU offloading (#2529)
M	llama-util.h
M	llama.cpp

commit	f6f9896ac3d2ff207e18f87dab85d126ceef5236	34a14b28ff7f3c98730339bacee035091b2a812a	2023-08-07T10:52:57+03:00	Georgi Gerganov	metal : fix out-of-bounds access + inc concurrency nodes (#2416)
M	ggml-metal.m

commit	34a14b28ff7f3c98730339bacee035091b2a812a	7297128db8159c7b12db4c28a4532b993025c2e5	2023-08-06T23:21:46-07:00	GiviMAD	[Makefile] Move ARM CFLAGS before compilation (#2536)
M	Makefile

commit	7297128db8159c7b12db4c28a4532b993025c2e5	86c32198954a2bc482025703d6875e11f1c2a574	2023-08-07T08:35:53+03:00	Henri Vasserman	[Zig] Rewrite build for Zig 0.11 (#2514)
M	build.zig

commit	86c32198954a2bc482025703d6875e11f1c2a574	2e8265ae1764d6288aab0e2df641909072e2d58e	2023-08-05T23:49:34-07:00	DannyDaemonic	console : fix issue related to Windows 11 PowerShell console mode persistence (#2521)
M	examples/console.cpp

commit	2e8265ae1764d6288aab0e2df641909072e2d58e	f514d1b306e1114c2884fcb25dd9bd48ae64ba32	2023-08-06T15:34:05+09:00	Keiichi Tabata	convert.py : add missing abstract methods for quantized data (#2491)
M	convert.py

commit	f514d1b306e1114c2884fcb25dd9bd48ae64ba32	332311234a0aa2974b2450710e22e09d90dd6b0b	2023-08-05T18:20:44+02:00	Johannes Gäßler	CUDA: faster k-quant mul_mat_q kernels (#2525)
M	ggml-cuda.cu

commit	332311234a0aa2974b2450710e22e09d90dd6b0b	182af739c4ce237f7579facfe8f94dc53a1f573f	2023-08-04T20:16:11Z	Jonas Wunderlich	fix firefox autoscroll (#2519)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	182af739c4ce237f7579facfe8f94dc53a1f573f	4329d1acb01c353803a54733b8eef9d93d0b84b2	2023-08-04T15:00:57-04:00	Cebtenzzre	server: regenerate completion.js.hpp (#2515)
M	examples/server/completion.js.hpp

commit	4329d1acb01c353803a54733b8eef9d93d0b84b2	02f9d96a866268700b8d8e7acbbcb4392c5ff345	2023-08-04T11:35:22-04:00	Cebtenzzre	CUDA: use min compute capability of GPUs actually used (#2506)
M	ggml-cuda.cu

commit	02f9d96a866268700b8d8e7acbbcb4392c5ff345	3498588e0fb4daf040c4e3c698595cb0bfd345c0	2023-08-04T11:34:32-04:00	Cebtenzzre	CUDA: check if event is NULL before cudaStreamWaitEvent (#2505)
M	ggml-cuda.cu

commit	3498588e0fb4daf040c4e3c698595cb0bfd345c0	5f631c26794b6371fcf2660e8d0c53494a5575f7	2023-08-04T08:20:12-07:00	DannyDaemonic	Add --simple-io option for subprocesses and break out console.h and cpp (#1558)
M	Makefile
M	examples/CMakeLists.txt
M	examples/common.cpp
M	examples/common.h
A	examples/console.cpp
A	examples/console.h
M	examples/main/main.cpp

commit	5f631c26794b6371fcf2660e8d0c53494a5575f7	415e99fec27be5a2e4283f1937afd17eb33fbd66	2023-08-04T06:37:24-05:00	Stephen Nichols	Fixing race condition in server and partial stream handling in frontend. (#2391)
M	examples/server/public/completion.js
M	examples/server/server.cpp

commit	415e99fec27be5a2e4283f1937afd17eb33fbd66	ff966e7ca6af127c9405523cdb07ef8fa01bf6d6	2023-08-04T19:29:52+08:00	l3utterfly	Stream save llama context data to file instead of allocating entire buffer upfront (#2488)
M	llama-util.h
M	llama.cpp

commit	ff966e7ca6af127c9405523cdb07ef8fa01bf6d6	8183159cf3def112f6d1fe94815fce70e1bffa12	2023-08-04T13:07:21+03:00	Borislav Stanimirov	build : fix several cast and printf warnings (#2499)
M	examples/embd-input/embd-input-lib.cpp
M	examples/grammar-parser.cpp
M	examples/perplexity/perplexity.cpp
M	examples/simple/simple.cpp

commit	8183159cf3def112f6d1fe94815fce70e1bffa12	468ea24fb4633a0d681f7ac84089566c1c6190cb	2023-08-02T22:05:44-04:00	Evan Jones	examples : generate JSON according to schema (#1887)
A	examples/json-schema-to-grammar.py
M	grammars/json.gbnf

commit	468ea24fb4633a0d681f7ac84089566c1c6190cb	4f6b60c77652cdfc9d5545fe247ae5d764815598	2023-08-02T18:04:04+02:00	Johannes Gäßler	CUDA: faster non k-quant mul_mat_q kernels (#2483)
M	ggml-cuda.cu

commit	4f6b60c77652cdfc9d5545fe247ae5d764815598	220d9318647a8ce127dbf7c9de5400455f41e7d8	2023-08-02T16:48:10+02:00	Johannes Gäßler	CUDA: Fix models with output size != 32000 (#2480)
M	CMakeLists.txt
M	ggml-cuda.cu

commit	220d9318647a8ce127dbf7c9de5400455f41e7d8	81844fbcfd93a162b7aeaea9e4f2ab1358f7f97e	2023-08-02T16:21:11+08:00	ldwang	readme : add Aquila-7B model series to supported models (#2487)
M	README.md

commit	81844fbcfd93a162b7aeaea9e4f2ab1358f7f97e	a312193e184b919047f33a5e844d846c5538dbe6	2023-08-02T04:06:19-04:00	Eve	tests : Fix compilation warnings (Linux/GCC) (#2451)
M	Makefile
M	examples/common.cpp
M	scripts/sync-ggml.sh
M	tests/CMakeLists.txt
R088	tests/test-double-float.c	tests/test-double-float.cpp
R098	tests/test-grad0.c	tests/test-grad0.cpp
R096	tests/test-opt.c	tests/test-opt.cpp

commit	a312193e184b919047f33a5e844d846c5538dbe6	c574bddb368424b5996cbee2ec45ec050967d404	2023-08-02T14:18:31+08:00	Yiming Cui	readme : Add Chinese LLaMA-2 / Alpaca-2 to supported models (#2475)
M	README.md

commit	c574bddb368424b5996cbee2ec45ec050967d404	86aeb27734481751592abd85590020b40d9224c8	2023-08-01T20:54:28+08:00	Bono Lv	fix a typo in examples/server/README.md (#2478)
M	examples/server/README.md

commit	86aeb27734481751592abd85590020b40d9224c8	1873ff586bd8499a18f763632711bf15d253585e	2023-08-01T01:56:23-07:00	ebraminio	server : Support dark mode (#2414)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	1873ff586bd8499a18f763632711bf15d253585e	49e7cb5bb1f75c91dd5db7d2d88cbc11bd9ee0c5	2023-08-01T09:43:12+02:00	Matteo Boschini	metal : add gqa8 kernel to allow llama-2-70B on metal (#2459)
M	ggml-metal.m
M	ggml-metal.metal

commit	49e7cb5bb1f75c91dd5db7d2d88cbc11bd9ee0c5	b772bba42e3bbca3cdab224456f8ff2ce427fd0b	2023-07-31T21:02:19+02:00	Johannes Gäßler	CUDA: fixed LLAMA_FAST compilation option (#2473)
M	Makefile

commit	b772bba42e3bbca3cdab224456f8ff2ce427fd0b	0728c5a8b9569183ffca0399caac099afef87595	2023-07-31T19:52:22+02:00	Johannes Gäßler	CUDA: fixed cmake F16 option (#2471)
M	CMakeLists.txt

commit	0728c5a8b9569183ffca0399caac099afef87595	1215ed7d5ccf854a55eccb52661427bb985e7f2c	2023-07-31T15:44:35+02:00	Johannes Gäßler	CUDA: mmq CLI option, fixed mmq build issues (#2453)
M	CMakeLists.txt
M	Makefile
M	README.md
M	examples/common.cpp
M	examples/common.h
M	examples/server/server.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp
M	llama.h

commit	1215ed7d5ccf854a55eccb52661427bb985e7f2c	2dbf518911926ef5a30f43aa83a0b1b1cdeaaa11	2023-07-31T14:32:30+02:00	Johannes Gäßler	CUDA: Implemented row flattening for non-glm RoPE (#2468)
M	ggml-cuda.cu

commit	2dbf518911926ef5a30f43aa83a0b1b1cdeaaa11	9d2382b3e45b5815fc6a054045a2f2c2b18c22a2	2023-07-31T13:18:51+02:00	Johannes Gäßler	CUDA: fewer memory bank conflicts for mul_mat_q (#2458)
M	ggml-cuda.cu

commit	9d2382b3e45b5815fc6a054045a2f2c2b18c22a2	a113689571420fb4d6540f1a324d12965781356a	2023-07-31T11:02:53+02:00	slaren	Fix Metal backend broken from the allocator changes (#2455)
M	llama.cpp

commit	a113689571420fb4d6540f1a324d12965781356a	11f3ca06b8c66b0427aab0a472479da22553b472	2023-07-30T15:58:01+02:00	slaren	ggml : add graph tensor allocator (#2411)
M	CMakeLists.txt
M	Makefile
A	ggml-alloc.c
A	ggml-alloc.h
M	ggml.c
M	ggml.h
M	llama.cpp

commit	11f3ca06b8c66b0427aab0a472479da22553b472	9baf9ef304f330009d5a93b7390280a0fd27c9a1	2023-07-29T23:04:44+02:00	Johannes Gäßler	CUDA: Quantized matrix matrix multiplication (#2160)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu

commit	9baf9ef304f330009d5a93b7390280a0fd27c9a1	8a88e5855c3b93024be0f93290b01a4206b65b38	2023-07-29T23:04:10+02:00	Johannes Gäßler	CUDA: faster multi GPU synchronization (#2448)
M	ggml-cuda.cu

commit	8a88e5855c3b93024be0f93290b01a4206b65b38	a9559bf77b903d94eb21614ceae5ae8950f0f1fc	2023-07-28T20:25:36+02:00	klosax	perplexity : add Hellaswag calculation (#2389)
M	examples/common.cpp
M	examples/common.h
M	examples/perplexity/perplexity.cpp

commit	a9559bf77b903d94eb21614ceae5ae8950f0f1fc	ee1b497c985f61d6ec519c39fcfed78a3c6f1d06	2023-07-29T02:17:45+08:00	Lee	ggml : workaround for missing _mm256_setr_m128i in GCC < 8 in k_quants.c (#2405)
M	k_quants.c

commit	ee1b497c985f61d6ec519c39fcfed78a3c6f1d06	d73b8d48b45d6e2c0ae9bb8c39623c4024adc275	2023-07-29T02:10:05+08:00	eric8607242	llama : support more diverse tokenizers? (#2420)
M	llama.cpp

commit	d73b8d48b45d6e2c0ae9bb8c39623c4024adc275	34ae1caf7fdea4c4c09087002e15e6230102e6a9	2023-07-28T21:05:08+03:00	Georgi Gerganov	examples : fix whitespace
M	examples/server-llama2-13B.sh

commit	34ae1caf7fdea4c4c09087002e15e6230102e6a9	d91f3f0c55663719ea03b76311e8c36ed55eb0e2	2023-07-29T03:02:10+09:00	nhamanasu	examples : server chat mode with llama2 (#2400)
A	examples/server-llama2-13B.sh
A	examples/server/chat-llama2.sh

commit	d91f3f0c55663719ea03b76311e8c36ed55eb0e2	65cdf34bdc469fa86248e667a5880992684ef114	2023-07-28T10:44:43+02:00	Weird Constructor	readme : fix the description of the Tail free sampling (TFS) method (#2431)
M	examples/main/README.md

commit	65cdf34bdc469fa86248e667a5880992684ef114	edcc7ae7d26007bbf83136e9d33f863fcad9b871	2023-07-28T01:42:53-07:00	Rand Xie	llama : use n_embd_gqa instead of n_embd to handle llama-2 70B (#2433)
M	examples/save-load-state/save-load-state.cpp
M	llama.cpp

commit	edcc7ae7d26007bbf83136e9d33f863fcad9b871	7c529cede6e84054e77a3eceab31c53de7b2f55b	2023-07-28T03:14:11+02:00	niansa/tuxifan	Obtaining LLaMA 2 instructions (#2308)
M	README.md

commit	7c529cede6e84054e77a3eceab31c53de7b2f55b	1a941869cbef8e9cc351a6c6987e4ae3b0f021f7	2023-07-27T22:39:17+02:00	mj-shifu	convert.py : Update to support 70B HF format model files (#2427)
M	convert.py

commit	1a941869cbef8e9cc351a6c6987e4ae3b0f021f7	b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4	2023-07-27T11:00:54+03:00	Georgi Gerganov	metal : disable graph concurrency optimization due to bug (#2413)
M	llama.cpp

commit	b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4	6df1f5940f889adde32fe47dc8881f010dcf9aba	2023-07-26T23:57:23+02:00	slaren	ggml : fix assert in ggml_set_unary_op (#2410)
M	ggml.c

commit	6df1f5940f889adde32fe47dc8881f010dcf9aba	5488fb789ea5692268309baa76f67598155060be	2023-07-26T14:00:04-04:00	Cebtenzzre	make : build with -Wmissing-prototypes (#2394)
M	CMakeLists.txt
M	Makefile

commit	5488fb789ea5692268309baa76f67598155060be	eb542d39324574a6778fad9ba9e34ba7a14a82a3	2023-07-26T15:56:53+02:00	slaren	ggml : allocate graphs in a context (#2392)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	eb542d39324574a6778fad9ba9e34ba7a14a82a3	07aaa0f63fccaeab099b3a732abda20b921bc5a5	2023-07-25T18:35:53+03:00	Kawrakow	Add LLAMA_DEFAULT_RMS_EPS so we can change the default (#2384)
M	examples/baby-llama/baby-llama.cpp
M	examples/common.h
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp
M	llama.h

commit	07aaa0f63fccaeab099b3a732abda20b921bc5a5	fce48caf9a6b9930eee9e2a5971428cdff403ba8	2023-07-25T16:20:12+02:00	slaren	ggml : fix ggml_flash_attn to use op_params (#2387)
M	ggml.c

commit	fce48caf9a6b9930eee9e2a5971428cdff403ba8	875086bdb95ce1f3294439811536533199e3b579	2023-07-25T21:22:09+08:00	ldwang	convert.py : support bpe tokenizer (#2228)
M	convert.py

commit	875086bdb95ce1f3294439811536533199e3b579	da1889834a036a63ead2b0ca5c9ed8967712568c	2023-07-25T20:58:32+08:00	Jiahao Li	ggml : relax contiguous constraints in activation function (#2371)
M	ggml.c

commit	da1889834a036a63ead2b0ca5c9ed8967712568c	82552b7f5403ca13957ac9a2cdc1732470057b62	2023-07-25T14:32:20+02:00	slaren	ggml : improve graph build time via hash table lookup (#2329)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	82552b7f5403ca13957ac9a2cdc1732470057b62	0c06204fb39aa5560e883e0ae74be9518c57d88e	2023-07-25T05:24:09-07:00	Hesen Peng	build : fix line breaking error in build-info.sh (#2349)
M	scripts/build-info.sh

commit	0c06204fb39aa5560e883e0ae74be9518c57d88e	1fed755b1fb9babb6dbc1b4023e492950cd5a5be	2023-07-25T07:19:11-05:00	Xiao-Yong Jin	main : add `--in-prefix-bos` to prefix BOS to user inputs; keep EOS (#2304)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	1fed755b1fb9babb6dbc1b4023e492950cd5a5be	be2301bcdaf6c9f0921141bd071de7788e2a351a	2023-07-25T08:16:13-04:00	Eve	ci : add non-AVX scalar build/test (#2356)
M	.github/workflows/build.yml

commit	be2301bcdaf6c9f0921141bd071de7788e2a351a	1aa18ef994a6a2b531434eb13251ef48e56d345b	2023-07-25T21:13:41+09:00	katsu560	k_quants : add AVX support to dot functions with QK_K as 64 (#2339)
M	k_quants.c

commit	1aa18ef994a6a2b531434eb13251ef48e56d345b	9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90	2023-07-25T08:00:19-04:00	Shouzheng Liu	metal : concurrently dispatch commands (#2358)
M	ggml-metal.h
M	ggml-metal.m
M	llama.cpp

commit	9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90	129d844c87d90e74aafc23dcc84c980fd408def4	2023-07-25T13:48:29+03:00	Kawrakow	Another speed gain for Q4_0 and Q4_1 on Metal (#2375)
M	ggml-metal.metal

commit	129d844c87d90e74aafc23dcc84c980fd408def4	d5512b782b27ff698007dcd175da18959d5f163f	2023-07-25T13:48:04+03:00	Kawrakow	Fix Q4_K and Q5_K for QK_K = 64 on CUDA (#2359)
M	ggml-cuda.cu

commit	d5512b782b27ff698007dcd175da18959d5f163f	c798308e3a425eae050a1f249a576fa8c6433327	2023-07-25T11:36:17+02:00	slaren	server: add rms_norm_eps parameter (#2380)
M	examples/server/server.cpp

commit	c798308e3a425eae050a1f249a576fa8c6433327	41c674161fb2459bdf7806d1eebead15bc5d046e	2023-07-25T10:27:34+03:00	Henri Vasserman	[Server] Escape HTML in webchat (#2368)
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	41c674161fb2459bdf7806d1eebead15bc5d046e	b3f138d05849ccbce67303ac17b50ebbc268128a	2023-07-24T17:57:12+02:00	slaren	make rms_norm_eps a parameter (#2374)
M	examples/baby-llama/baby-llama.cpp
M	examples/common.cpp
M	examples/common.h
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-grad0.c

commit	b3f138d05849ccbce67303ac17b50ebbc268128a	5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185	2023-07-24T17:54:22+03:00	Aarni Koskela	Chat UI extras (#2366)
M	Makefile
M	examples/server/index.html.hpp
M	examples/server/public/index.html

commit	5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185	42f70cb2f6a8089e0a0560a459e4ba317bac4d49	2023-07-24T14:46:21+03:00	Georgi Gerganov	ggml : sync (unary ops refactor, static-correctness) (#2370)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	tests/test-grad0.c
M	tests/test-opt.c

commit	42f70cb2f6a8089e0a0560a459e4ba317bac4d49	84e09a7d8bc4ab6d658b5cd81295ac0add60be78	2023-07-24T12:55:02+03:00	Kawrakow	Fix scalar version of Q5_K when QK_K = 64 (#2362)
M	k_quants.c

commit	84e09a7d8bc4ab6d658b5cd81295ac0add60be78	2f9cf974a066ac0e03fbb235d834b01b0164d743	2023-07-23T23:58:10-04:00	Evan Jones	llama : add grammar-based sampling (#1773)
M	Makefile
M	examples/CMakeLists.txt
M	examples/common.cpp
M	examples/common.h
A	examples/grammar-parser.cpp
A	examples/grammar-parser.h
M	examples/main/main.cpp
A	grammars/arithmetic.gbnf
A	grammars/chess.gbnf
A	grammars/japanese.gbnf
A	grammars/json.gbnf
A	grammars/list.gbnf
M	llama.cpp
M	llama.h

commit	2f9cf974a066ac0e03fbb235d834b01b0164d743	4f06592cc6b83979e4b442e8cb97b3948c857188	2023-07-24T00:19:47+03:00	Kawrakow	Some more Q4_K and Q5_K speedup on CUDA (#2346)
M	ggml-cuda.cu

commit	4f06592cc6b83979e4b442e8cb97b3948c857188	70d26ac3883009946e737525506fa88f52727132	2023-07-23T17:31:17-03:00	IgnacioFDM	Add gqa parameter support to the server (#2351)
M	examples/server/server.cpp

commit	70d26ac3883009946e737525506fa88f52727132	57921ca6db53e08eb90010fba99add85be28b5a1	2023-07-23T17:49:06+02:00	Johannes Gäßler	Fix __dp4a documentation (#2348)
M	README.md

commit	57921ca6db53e08eb90010fba99add85be28b5a1	3602ac4255fd4cd589821346290b464a64b955d1	2023-07-23T21:33:02+08:00	wzy	common : n_threads == -1 uses std::thread::hardware_concurrency() (#2347)
M	examples/common.cpp

commit	3602ac4255fd4cd589821346290b464a64b955d1	95a6c595e7ca8dbe47ccf8824e04213e10357f9a	2023-07-23T15:19:39+02:00	slaren	fix n_tasks (#2342)
M	ggml.c

commit	95a6c595e7ca8dbe47ccf8824e04213e10357f9a	e76d630df17e235e6b9ef416c45996765d2e36fb	2023-07-23T14:36:02+02:00	slaren	ggml: move op parameters from tensors to ggml_tensor::op_params (#2333)
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml.c
M	ggml.h

commit	e76d630df17e235e6b9ef416c45996765d2e36fb	1d0824b2476e7fda09751a0235c9e571b76d6f2c	2023-07-23T15:09:47+03:00	Georgi Gerganov	llama : grouped-query attention + LLaMAv2 70B support (#2276)
M	convert.py
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	ggml-cuda.cu
M	llama.cpp
M	llama.h

commit	1d0824b2476e7fda09751a0235c9e571b76d6f2c	bc3ec2cdc9ea20b0faba2e1b4576fab3a911e4d1	2023-07-23T13:59:48+02:00	maddes8cht	llama : print help to stdout (#2338)
M	examples/common.cpp

commit	bc3ec2cdc9ea20b0faba2e1b4576fab3a911e4d1	a940458e4814e87bd0d3fbdb3f3d2733b4a3ccb1	2023-07-23T19:57:02+08:00	wzy	flake : support `nix build '.#opencl'` (#2337)
M	flake.nix

commit	a940458e4814e87bd0d3fbdb3f3d2733b4a3ccb1	91171b8072f6f0c8ae3a61e23451acb538bb9ece	2023-07-23T07:56:34-04:00	Christian Demsar	llama : print max tensor size to stderr (#2336)
M	llama.cpp

commit	91171b8072f6f0c8ae3a61e23451acb538bb9ece	355c80f49e32b0b15c0a457f3bad380e57f5b9ac	2023-07-23T07:52:08-04:00	Jose Maldonado	make : fix CLBLAST compile support in FreeBSD (#2331)
M	Makefile
M	README.md

commit	355c80f49e32b0b15c0a457f3bad380e57f5b9ac	83a00ce69bef9124c0702424a012ea799128b77d	2023-07-23T06:16:48-05:00	AustinMroz	examples : simplify vim plugin (#2327)
M	examples/llm.vim

commit	83a00ce69bef9124c0702424a012ea799128b77d	d2a43664f93ba30a84e42713bb69f936cbdacf2a	2023-07-23T19:00:37+08:00	Jiahao Li	metal : support bcast add & dup & cont op (#2323)
M	ggml-metal.m
M	ggml-metal.metal

commit	d2a43664f93ba30a84e42713bb69f936cbdacf2a	b9b7d94fc10a8039befd1bc3af4f4b09c620c351	2023-07-23T08:49:20+03:00	Kawrakow	Speed up Q4_K (#2322)
M	ggml-cuda.cu

commit	b9b7d94fc10a8039befd1bc3af4f4b09c620c351	b47b8a9cfeb439d271bf997fb985fd6d82b3af5e	2023-07-22T21:27:34+02:00	Johannes Gäßler	CUDA: Fixed 7b q3_K_S with mul_mat_vec_q (#2313)
M	ggml-cuda.cu

commit	b47b8a9cfeb439d271bf997fb985fd6d82b3af5e	b5fe67f8c69113bd9354bc1adcfe2df6be323740	2023-07-22T21:17:57+03:00	Georgi Gerganov	llama : optimize memory buffers (#2325)
M	examples/common.cpp
M	examples/main/main.cpp
M	llama.cpp

commit	b5fe67f8c69113bd9354bc1adcfe2df6be323740	24baa54ac1ff3d4156a2360deb1473af04a9b1a2	2023-07-22T14:21:24+02:00	klosax	Perplexity: Compute scores correlated to HellaSwag (#2312)
M	examples/common.cpp
M	examples/common.h
M	examples/perplexity/perplexity.cpp

commit	24baa54ac1ff3d4156a2360deb1473af04a9b1a2	dd6c67d3cbb7b360747f776412bf01976aa32f4b	2023-07-22T12:34:51+02:00	whoreson	examples : basic VIM plugin
A	examples/llm.vim

commit	dd6c67d3cbb7b360747f776412bf01976aa32f4b	5d500e8ccf5eee3de3ae66685cc3be75e43e08b9	2023-07-22T12:00:56+03:00	Georgi Gerganov	ci : fix args
M	ci/run.sh

commit	5d500e8ccf5eee3de3ae66685cc3be75e43e08b9	7d5f18468ceabd7a38f414f9f21b26b0c137f994	2023-07-22T11:48:22+03:00	Georgi Gerganov	ci : add 7B CUDA tests (#2319)
M	ci/README.md
M	ci/run.sh

commit	7d5f18468ceabd7a38f414f9f21b26b0c137f994	d924522a46c5ef097af4a88087d91673e8e87e4d	2023-07-21T13:01:10-06:00	Richard Roberson	examples : add easy python script to create quantized (k-bit support) GGML models from local HF Transformer models (#2311)
A	examples/make-ggml.py

commit	d924522a46c5ef097af4a88087d91673e8e87e4d	4d76a5f49b9b5382dba5d13d92edb9159536c225	2023-07-21T17:27:51+03:00	Kawrakow	Custom RoPE + bettter memory management for CUDA (#2295)
M	ggml-cuda.cu

commit	4d76a5f49b9b5382dba5d13d92edb9159536c225	0db14fef06836caaa13cc123c0a24dc598bdb9f0	2023-07-21T17:05:30+03:00	Kawrakow	Faster Q3_K implementation on Metal (#2307)
M	ggml-metal.m
M	ggml-metal.metal

commit	0db14fef06836caaa13cc123c0a24dc598bdb9f0	03e566977b277937c5f706180171c5d12b597b0b	2023-07-21T15:16:55+03:00	Georgi Gerganov	ggml : fix the rope fix (513f8619535a64fa9ace808cdcbcf66211535f5c)
M	ggml.c

commit	03e566977b277937c5f706180171c5d12b597b0b	513f8619535a64fa9ace808cdcbcf66211535f5c	2023-07-21T20:53:07+09:00	Ikko Eltociear Ashimine	examples :  fix typo in minigpt4.py (#2298)
M	examples/embd-input/minigpt4.py

commit	513f8619535a64fa9ace808cdcbcf66211535f5c	3973b25a64a37a47eac156a3fd28f83c16f14bf2	2023-07-21T14:51:34+03:00	Georgi Gerganov	ggml : fix rope args order + assert (#2054)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	3973b25a64a37a47eac156a3fd28f83c16f14bf2	ab0e26bdfb7b3adb1e3145c61a0fa92d1abd21d0	2023-07-21T14:42:41+03:00	Georgi Gerganov	gitignore : fix final newline
M	.gitignore

commit	ab0e26bdfb7b3adb1e3145c61a0fa92d1abd21d0	73643f5fb1136dc2b65ae910bdc5a431520d70a2	2023-07-21T12:58:36+02:00	Guillaume "Vermeille" Sanchez	llama : remove cfg smooth factor as it is only a reparameterization of the guidance scale (#2280)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	73643f5fb1136dc2b65ae910bdc5a431520d70a2	a814d04f81121e0429b39a61fe4afd946cd42046	2023-07-21T06:53:27-04:00	Jose Maldonado	gitignore : changes for Poetry users + chat examples (#2284)
M	.gitignore
M	Makefile
A	examples/llama2-13b.sh
A	examples/llama2.sh

commit	a814d04f81121e0429b39a61fe4afd946cd42046	4c013bb7385a0e52ce721480c40c45bec5ef103f	2023-07-21T13:50:55+03:00	Georgi Gerganov	make : fix indentation
M	Makefile

commit	4c013bb7385a0e52ce721480c40c45bec5ef103f	42c7c2e2e9cae79330f57456fbc0eae1eaff17fa	2023-07-21T13:48:18+03:00	Georgi Gerganov	ci : fix MNT realpath usage (#2250)
M	ci/run.sh

commit	42c7c2e2e9cae79330f57456fbc0eae1eaff17fa	78a3d13424b01c3f8ea94ea7e59650ab0501e902	2023-07-21T18:38:57+08:00	Sky Yan	make : support customized LLAMA_CUDA_NVCC and LLAMA_CUDA_CCBIN (#2275)
M	Makefile

commit	78a3d13424b01c3f8ea94ea7e59650ab0501e902	ae178ab46bfd6ecb2422da5dad441a4e2fef8b7e	2023-07-21T18:26:34+08:00	wzy	flake : remove intel mkl from flake.nix due to missing files (#2277)
M	CMakeLists.txt
M	README.md
M	flake.nix

commit	ae178ab46bfd6ecb2422da5dad441a4e2fef8b7e	54e3bc76fed914f8d4a30a7a50c19867cccb1338	2023-07-21T13:10:51+03:00	Georgi Gerganov	llama : make tensor_split ptr instead of array (#2272)
M	examples/common.cpp
M	ggml-cuda.cu
M	llama.cpp
M	llama.h

commit	54e3bc76fed914f8d4a30a7a50c19867cccb1338	019fe257bbf699f400231683a8b816ad90281275	2023-07-21T12:09:16+02:00	Jiří Podivín	make : add new target for test binaries (#2244)
M	.gitignore
M	Makefile

commit	019fe257bbf699f400231683a8b816ad90281275	e68c96f7fee8fc22814a4a1209ffc97bbf35f7bd	2023-07-21T08:13:18Z	Hatsune Miku	MIKU MAYHEM: Upgrading the Default Model for Maximum Fun 🎉 (#2287)
M	examples/Miku.sh

commit	e68c96f7fee8fc22814a4a1209ffc97bbf35f7bd	9cf022a1889e50113fd348dc96b4557fc75a6296	2023-07-21T10:44:40+03:00	Kawrakow	Faster Q2_K on Metal (#2297)
M	ggml-metal.m
M	ggml-metal.metal

commit	9cf022a1889e50113fd348dc96b4557fc75a6296	e782c9e735f93ab4767ffc37462c523b73a17ddc	2023-07-21T09:42:21+02:00	Przemysław Pawełczyk	make : fix embdinput library and server examples building on MSYS2 (#2235)
M	Makefile
M	examples/server/CMakeLists.txt

commit	e782c9e735f93ab4767ffc37462c523b73a17ddc	785829dfe8baf0213f2ff66963d28c62f92d7930	2023-07-20T18:19:45+03:00	Kawrakow	Faster Q5_K and Q6_K on Metal (#2294)
M	ggml-metal.m
M	ggml-metal.metal

commit	785829dfe8baf0213f2ff66963d28c62f92d7930	fff0e0eafe817eef429ecb64f892ab7bdae31846	2023-07-20T15:18:43+03:00	Kawrakow	Faster Q4_K on Metal (#2290)
M	ggml-metal.m
M	ggml-metal.metal

commit	fff0e0eafe817eef429ecb64f892ab7bdae31846	417a85a0010519224cf154eb85d383ffeafeeead	2023-07-20T13:47:26+03:00	Georgi Gerganov	llama : fix regression from #2000 - could not load no-mmap models
M	llama.cpp

commit	417a85a0010519224cf154eb85d383ffeafeeead	294f424554c1599784ac9962462fc39ace92d8a5	2023-07-20T06:32:22-04:00	Shouzheng Liu	metal: minor q4 optimization and reduce code size (#2248)
M	ggml-metal.m
M	ggml-metal.metal

commit	294f424554c1599784ac9962462fc39ace92d8a5	45a1b07e9b20c33d71d8c849ff27d693a75a0269	2023-07-19T15:06:40+08:00	Rinne	llama : extend API to get max devices at runtime (#2253)
M	llama.cpp
M	llama.h

commit	45a1b07e9b20c33d71d8c849ff27d693a75a0269	b1f429095328a34556c0e9a7a2fefced3db3368c	2023-07-19T15:01:55+08:00	wzy	flake : update flake.nix (#2270)
M	CMakeLists.txt
M	README.md
M	flake.nix

commit	b1f429095328a34556c0e9a7a2fefced3db3368c	d01bccde9f759b24449fdaa16306b406a50eb367	2023-07-19T15:01:11+08:00	wzy	cmake : install targets (#2256)
M	CMakeLists.txt
M	convert-lora-to-ggml.py
M	convert.py
M	examples/baby-llama/CMakeLists.txt
M	examples/benchmark/CMakeLists.txt
M	examples/embd-input/CMakeLists.txt
M	examples/embedding/CMakeLists.txt
M	examples/main/CMakeLists.txt
M	examples/metal/CMakeLists.txt
M	examples/perplexity/CMakeLists.txt
M	examples/quantize-stats/CMakeLists.txt
M	examples/quantize/CMakeLists.txt
M	examples/save-load-state/CMakeLists.txt
M	examples/server/CMakeLists.txt
M	examples/simple/CMakeLists.txt
M	examples/train-text-from-scratch/CMakeLists.txt
M	tests/CMakeLists.txt

commit	d01bccde9f759b24449fdaa16306b406a50eb367	6cbf9dfb32f0e23ed3afd02d30ab066ed53e2c4d	2023-07-18T14:24:43+03:00	Georgi Gerganov	ci : integrate with ggml-org/ci (#2250)
M	.gitignore
A	ci/README.md
A	ci/run.sh
M	examples/common.cpp
M	examples/common.h
M	examples/perplexity/perplexity.cpp
M	llama.cpp
M	tests/test-sampling.cpp

commit	6cbf9dfb32f0e23ed3afd02d30ab066ed53e2c4d	7568d1a2b206331412106ea66da3f871025e0c3c	2023-07-18T11:50:49+03:00	Georgi Gerganov	llama : shorten quantization descriptions
M	examples/quantize/quantize.cpp

commit	7568d1a2b206331412106ea66da3f871025e0c3c	b7647436ccc80970b44a270f70f4f2ea139054d1	2023-07-18T01:39:29+08:00	Jiahao Li	Support dup & cont ops on CUDA (#2242)
M	ggml-cuda.cu

commit	b7647436ccc80970b44a270f70f4f2ea139054d1	672dda10e4d8ac79df5d5970da7fb69d242ca9a7	2023-07-16T14:01:45-07:00	Alex Klinkhamer	llama : fix t_start_sample_us initialization warning (#2238)
M	llama.cpp

commit	672dda10e4d8ac79df5d5970da7fb69d242ca9a7	27ab66e437797aedbb23b3599385756b6c26ac39	2023-07-17T03:57:28+08:00	Qingyou Meng	ggml : fixed runtime bugs and compile errors related to GGML_PERF and GGML_DEBUG (#2219)
M	ggml.c

commit	27ab66e437797aedbb23b3599385756b6c26ac39	6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f	2023-07-16T21:54:47+02:00	Jiří Podivín	py : turn verify-checksum-models.py into executable (#2245)
M	README.md
M	scripts/verify-checksum-models.py

commit	6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f	a6803cab946c817fb7aaf2a40b317f5d3e373bd1	2023-07-15T06:34:16-04:00	Xiao-Yong Jin	llama : add custom RoPE (#2054)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	examples/server/README.md
M	examples/server/chat.sh
M	examples/server/server.cpp
M	ggml-metal.m
M	ggml-metal.metal
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	a6803cab946c817fb7aaf2a40b317f5d3e373bd1	7dabc66f3c63f8ea0f61bac346fa138e01df675f	2023-07-14T15:13:38-04:00	Dave Della Costa	flake : add runHook preInstall/postInstall to installPhase so hooks function (#2224)
M	flake.nix

commit	7dabc66f3c63f8ea0f61bac346fa138e01df675f	7cdd30bf1f84339c55a5e3de29384f6bbdebb61c	2023-07-15T03:05:08+08:00	wzy	make : use pkg-config for OpenBLAS (#2222)
M	Makefile

commit	7cdd30bf1f84339c55a5e3de29384f6bbdebb61c	e8035f141e1f71d739fa5cfc9c01531cdee6fc16	2023-07-15T03:00:58+08:00	Bach Le	cuda : allocate all temporary ggml_tensor_extra_gpu from a fixed-size buffer (#2220)
M	ggml-cuda.cu

commit	e8035f141e1f71d739fa5cfc9c01531cdee6fc16	7513b7b0a1c11faa00ad5a34d22681e5f07d32e4	2023-07-14T14:55:56-04:00	Evan Miller	ggml : fix static_assert with older compilers #2024 (#2218)
M	ggml.c
M	k_quants.h

commit	7513b7b0a1c11faa00ad5a34d22681e5f07d32e4	de8342423d9600cf6e15455c1a27bae441262b45	2023-07-15T02:55:24+08:00	Bach Le	llama : add functions that work directly on model (#2197)
M	llama.cpp
M	llama.h

commit	de8342423d9600cf6e15455c1a27bae441262b45	c48c525f8711780f3f7c59bf92f1760f38317218	2023-07-14T11:50:58-07:00	Ali Chraghi	build.zig : install config header (#2216)
M	build.zig

commit	c48c525f8711780f3f7c59bf92f1760f38317218	206e01de117cc65ed8713ac9fdebc57ba4532ec3	2023-07-15T02:40:05+08:00	Shangning Xu	examples : fixed path typos in embd-input (#2214)
M	examples/embd-input/README.md
M	examples/embd-input/llava.py

commit	206e01de117cc65ed8713ac9fdebc57ba4532ec3	4304bd3cded73c867a882ea5ca4517e3995cc996	2023-07-15T02:38:24+08:00	Jiahao Li	cuda : support broadcast add & mul (#2192)
M	ggml-cuda.cu

commit	4304bd3cded73c867a882ea5ca4517e3995cc996	229aab351c375899debad45fcb213bf0565bba4e	2023-07-14T19:44:08+02:00	Johannes Gäßler	CUDA: mul_mat_vec_q kernels for k-quants (#2203)
M	ggml-cuda.cu

commit	229aab351c375899debad45fcb213bf0565bba4e	697966680b27d9b4f05668605b863cb9aea3e15f	2023-07-14T11:34:40-06:00	James Reynolds	make : fix combination of LLAMA_METAL and LLAMA_MPI (#2208)
M	Makefile

commit	697966680b27d9b4f05668605b863cb9aea3e15f	27ad57a69b85bf12420a27e9945e580cc280be57	2023-07-14T16:36:41+03:00	Georgi Gerganov	ggml : sync (ggml_conv_2d, fix mul_mat bug, CUDA GLM rope)
M	ggml-cuda.cu
M	ggml.c

commit	27ad57a69b85bf12420a27e9945e580cc280be57	32c54116318929c90fd7ae814cf9b5232cd44c36	2023-07-14T12:46:21+03:00	Kawrakow	Metal: faster Q4_0 and Q4_1 matrix x vector kernels (#2212)
M	ggml-metal.m
M	ggml-metal.metal

commit	32c54116318929c90fd7ae814cf9b5232cd44c36	ff5d58faecf1f02b05bd015bdfc6a394cf2bc9ba	2023-07-13T21:58:25+08:00	Howard Su	Revert "Support using mmap when applying LoRA (#2095)" (#2206)
M	examples/common.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	llama-util.h

commit	ff5d58faecf1f02b05bd015bdfc6a394cf2bc9ba	b782422a3e090d0aeab84bfa03ba008dcd1c2a3d	2023-07-13T21:58:09+08:00	Howard Su	Fix compile error on Windows CUDA (#2207)
M	ggml-cuda.cu

commit	b782422a3e090d0aeab84bfa03ba008dcd1c2a3d	1cbf561466e957b25f0e8163c2386683f8674369	2023-07-13T15:49:14+02:00	Bodo Graumann	devops : add missing quotes to bash script (#2193)
M	.devops/tools.sh

commit	1cbf561466e957b25f0e8163c2386683f8674369	975221e9548ef6d9f4af8d39cdffc4811c050beb	2023-07-12T16:10:55-04:00	Shouzheng Liu	metal : new q4_0 matrix-vector kernel (#2188)
M	ggml-metal.m
M	ggml-metal.metal

commit	975221e9548ef6d9f4af8d39cdffc4811c050beb	4523d10d0cf8c088f1b26c76d38d73290eb3b444	2023-07-12T20:51:29+03:00	Georgi Gerganov	ggml : broadcast mul_mat + conv batch support (#2199)
M	ggml.c

commit	4523d10d0cf8c088f1b26c76d38d73290eb3b444	680e6f91775f972f0df34f56807f30826370db59	2023-07-12T20:27:03+03:00	Georgi Gerganov	ggml : add ggml_pool_1d and ggml_pool_2d
M	ggml.c
M	ggml.h

commit	680e6f91775f972f0df34f56807f30826370db59	4e7464ef88885cb3532738b03cac890f4077fa20	2023-07-12T20:26:18+03:00	Georgi Gerganov	cuda : add gelu support
M	ggml-cuda.cu

commit	4e7464ef88885cb3532738b03cac890f4077fa20	2b5eb72e109577ed84e44bb8fa47e4956f337300	2023-07-12T20:18:40+08:00	Howard Su	FP16 is supported in CM=6.0 (#2177)
M	CMakeLists.txt

commit	2b5eb72e109577ed84e44bb8fa47e4956f337300	f7d278faf308cb989c221895968f2a26f14b2155	2023-07-12T10:38:52+02:00	Johannes Gäßler	Fixed __dp4a compute capability: 6.0 -> 6.1 (#2189)
M	ggml-cuda.cu

commit	f7d278faf308cb989c221895968f2a26f14b2155	20d7740a9b45f6e5b247fa3738fdda35e18c2e8a	2023-07-12T10:54:19+03:00	Georgi Gerganov	ggml : revert CUDA broadcast changes from #2183 (#2191)
M	ggml-cuda.cu

commit	20d7740a9b45f6e5b247fa3738fdda35e18c2e8a	5bf2a2771886ee86137e01dbc7492f78fb392066	2023-07-11T22:53:34+03:00	Georgi Gerganov	ggml : sync (abort callback, mul / add broadcast, fix alibi) (#2183)
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	tests/test-grad0.c
M	tests/test-opt.c

commit	5bf2a2771886ee86137e01dbc7492f78fb392066	c9c74b4e3f9dcfab8b0032749ff8a579ab4e4d8d	2023-07-11T12:31:10-04:00	Spencer Sutton	ggml : remove src0 and src1 from ggml_tensor and rename opt to src (#2178)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-mpi.c
M	ggml.c
M	ggml.h

commit	c9c74b4e3f9dcfab8b0032749ff8a579ab4e4d8d	3ec7e596b2ba3f43c22f441254ca2bcfa91102ba	2023-07-12T00:18:43+08:00	Bach Le	llama : add classifier-free guidance (#2135)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	3ec7e596b2ba3f43c22f441254ca2bcfa91102ba	917831c63a4138814d23da1917bf2b5d5b9faa6c	2023-07-12T01:12:35+09:00	Jinwoo Jeong	docker : add '--server' option (#2174)
M	.devops/tools.sh

commit	917831c63a4138814d23da1917bf2b5d5b9faa6c	2347463201a9f4159ae95b737e1544dd300569c8	2023-07-11T11:03:06-05:00	Chad Brewbaker	readme : fix zig build instructions (#2171)
M	README.md

commit	2347463201a9f4159ae95b737e1544dd300569c8	bbef28218fe827265716b66977719b9ee2b21165	2023-07-11T22:37:01+08:00	Howard Su	Support using mmap when applying LoRA (#2095)
M	examples/common.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	llama-util.h

commit	bbef28218fe827265716b66977719b9ee2b21165	5656d10599bd756dc0f17284e418e704200b43f3	2023-07-11T22:01:08+08:00	LostRuins	Possible solution to allow K-quants on models with n_vocab!=32000 (#2148)
M	llama.cpp

commit	5656d10599bd756dc0f17284e418e704200b43f3	1d1630996920f889cdc08de26cebf2415958540e	2023-07-10T11:49:56-04:00	Evan Miller	mpi : add support for distributed inference via MPI (#2099)
M	.github/workflows/build.yml
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	README.md
M	examples/embd-input/embd-input-lib.cpp
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	ggml-metal.m
A	ggml-mpi.c
A	ggml-mpi.h
M	llama.cpp
M	llama.h
M	tests/test-tokenizer-0.cpp

commit	1d1630996920f889cdc08de26cebf2415958540e	db4047ad5cd8eae04db3b2efe0245e69a376601a	2023-07-09T05:59:53-03:00	oobabooga	llama : remove "first token must be BOS" restriction (#2153)
M	llama.cpp

commit	db4047ad5cd8eae04db3b2efe0245e69a376601a	18780e0a5e17348236230bbe891901b9b5718709	2023-07-09T03:56:18-05:00	Nigel Bosch	main : escape prompt prefix/suffix (#2151)
M	examples/common.cpp

commit	18780e0a5e17348236230bbe891901b9b5718709	3bbc1a11f04a9adc0d0e08c2940ba4d2978755ab	2023-07-09T05:20:43-03:00	JackJollimore	readme : update Termux instructions (#2147)
M	README.md

commit	3bbc1a11f04a9adc0d0e08c2940ba4d2978755ab	2492a53fd0d8372ecc67f49f07b581905175eea8	2023-07-09T16:12:20+08:00	clyang	ggml : fix buidling with Intel MKL but ask for "cblas.h" issue (#2104) (#2115)
M	CMakeLists.txt
M	ggml.c

commit	2492a53fd0d8372ecc67f49f07b581905175eea8	64639555ff93c8ead2b80becb49cc6b60aeac240	2023-07-09T15:38:42+08:00	rankaiyx	readme : add more docs indexes (#2127)
M	README.md

commit	64639555ff93c8ead2b80becb49cc6b60aeac240	061f5f8d2109bb7adcbd40f1b456d887c5a1df25	2023-07-08T20:01:44+02:00	Johannes Gäßler	Fixed OpenLLaMA 3b CUDA mul_mat_vec_q (#2144)
M	ggml-cuda.cu

commit	061f5f8d2109bb7adcbd40f1b456d887c5a1df25	84525e7962bee0abef91108948bbf7f7bfdcf421	2023-07-08T00:25:15+02:00	Johannes Gäßler	CUDA: add __restrict__ to mul mat vec kernels (#2140)
M	ggml-cuda.cu

commit	84525e7962bee0abef91108948bbf7f7bfdcf421	a7e20edf2266169ccd97a4eb949a593d628fbd64	2023-07-07T11:25:25-07:00	dylan	docker : add support for CUDA in docker (#1461)
A	.devops/full-cuda.Dockerfile
A	.devops/main-cuda.Dockerfile
M	Makefile
M	README.md

commit	a7e20edf2266169ccd97a4eb949a593d628fbd64	1d656d6360359cfdaaf5d64ed9690047b600dbcb	2023-07-07T21:23:57+03:00	Georgi Gerganov	ci : switch threads to 1 (#2138)
M	.github/workflows/build.yml

commit	1d656d6360359cfdaaf5d64ed9690047b600dbcb	72421402834141df6cbdcf595fe46dbd11874dce	2023-07-08T00:24:01+08:00	Qingyou Meng	ggml : change ggml_graph_compute() API to not require context (#1999)
M	.github/workflows/build.yml
M	examples/baby-llama/baby-llama.cpp
M	examples/benchmark/benchmark-matmult.cpp
M	examples/metal/metal.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/CMakeLists.txt
M	tests/test-grad0.c
M	tests/test-opt.c

commit	72421402834141df6cbdcf595fe46dbd11874dce	3e08ae99ceb143d67f9273fda47541e9d98ff23f	2023-07-07T18:36:37+03:00	Georgi Gerganov	ggml : remove sched_yield() call in ggml_graph_compute_thread() (#2134)
M	ggml.c

commit	3e08ae99ceb143d67f9273fda47541e9d98ff23f	481f793acc3882a09d45d8d2c3076ad3d1c60cfc	2023-07-07T16:12:49+03:00	Aarni Koskela	convert.py: add mapping for safetensors bf16 (#1598)
M	convert.py

commit	481f793acc3882a09d45d8d2c3076ad3d1c60cfc	dfd9fce6d65599bf33df43e616e85aa639bdae4c	2023-07-07T11:34:18+08:00	Howard Su	Fix opencl by wrap #if-else-endif with \n (#2086)
M	ggml-opencl.cpp

commit	dfd9fce6d65599bf33df43e616e85aa639bdae4c	36680f6e40e4440c3ec3385d0b7e5ca8bb6c37f7	2023-07-06T19:41:31+03:00	Georgi Gerganov	ggml : fix restrict usage
M	ggml.h

commit	36680f6e40e4440c3ec3385d0b7e5ca8bb6c37f7	a17a2683d8fdb899ba497d0c28ccafb28c62efb6	2023-07-07T00:23:49+08:00	Judd	convert : update for baichuan (#2081)
M	README.md
M	convert.py
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/README.md

commit	a17a2683d8fdb899ba497d0c28ccafb28c62efb6	31cfbb1013a482e89c72146e2063ac4362becae7	2023-07-06T09:17:50-07:00	tslmy	alpaca.sh : update model file name (#2074)
M	examples/alpaca.sh

commit	31cfbb1013a482e89c72146e2063ac4362becae7	983b555e9ddb36703cee4d22642afe958de093b7	2023-07-05T16:51:13-04:00	Tobias Lütke	Expose generation timings from server & update completions.js (#2116)
M	examples/server/README.md
M	examples/server/completion.js.hpp
M	examples/server/deps.sh
M	examples/server/index.html.hpp
M	examples/server/public/completion.js
M	examples/server/public/index.html
M	examples/server/server.cpp
M	llama.cpp
M	llama.h

commit	983b555e9ddb36703cee4d22642afe958de093b7	ec326d350c72afd23709a409944728a607188cc0	2023-07-05T18:03:19Z	Jesse Jojo Johnson	Update Server Instructions (#2113)
M	examples/server/README.md

commit	ec326d350c72afd23709a409944728a607188cc0	1b6efeab829f3eeda5b39bd47624bb60b3531b88	2023-07-05T20:44:11+03:00	Georgi Gerganov	ggml : fix bug introduced in #1237
M	ggml.c

commit	1b6efeab829f3eeda5b39bd47624bb60b3531b88	1b107b8550dced48dc5f41184640061354226b96	2023-07-05T20:20:05+03:00	Georgi Gerganov	tests : fix test-grad0
M	scripts/sync-ggml.sh
M	tests/test-grad0.c

commit	1b107b8550dced48dc5f41184640061354226b96	8567c76b5326e862be0755a8dc1dd988223fcae3	2023-07-05T16:13:06Z	Stephan Walter	ggml : generalize `quantize_fns` for simpler FP16 handling (#1237)
M	.github/workflows/build.yml
M	examples/quantize-stats/quantize-stats.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	pocs/vdot/q8dot.cpp
M	pocs/vdot/vdot.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	8567c76b5326e862be0755a8dc1dd988223fcae3	924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb	2023-07-05T15:13:35Z	Jesse Jojo Johnson	Update server instructions for web front end (#2103)
M	examples/server/README.md

commit	924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb	051c70dcd55709c9cbbfa849af035951fe720433	2023-07-05T14:19:42+02:00	Johannes Gäßler	Quantized dot products for CUDA mul mat vec (#2067)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu

commit	051c70dcd55709c9cbbfa849af035951fe720433	9e4475f5cf639315f61ed7b8da6258bb0c7c5ca9	2023-07-05T18:31:23+08:00	Howard Su	llama: Don't double count the sampling time (#2107)
M	llama.cpp

commit	9e4475f5cf639315f61ed7b8da6258bb0c7c5ca9	7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa	2023-07-05T08:58:05+02:00	Johannes Gäßler	Fixed OpenCL offloading prints (#2082)
M	llama.cpp

commit	7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa	b472f3fca558b6335adbd87210ed58cfb5da37cb	2023-07-04T18:33:33-05:00	Nigel Bosch	embd-input: Fix input embedding example unsigned int seed (#2105)
M	examples/embd-input/embd-input-lib.cpp

commit	b472f3fca558b6335adbd87210ed58cfb5da37cb	ed9a54e5129a11c2a5b555e1dc65e875e3c37b4f	2023-07-04T22:25:22+03:00	Georgi Gerganov	readme : add link web chat PR
M	README.md

commit	ed9a54e5129a11c2a5b555e1dc65e875e3c37b4f	f257fd255044decffad93dee2502875ce66ad80c	2023-07-04T21:54:11+03:00	Georgi Gerganov	ggml : sync latest (new ops, macros, refactoring) (#2106)
M	ggml.c
M	ggml.h
M	scripts/sync-ggml.sh

commit	f257fd255044decffad93dee2502875ce66ad80c	7ee76e45afae7f9a7a53e93393accfb5b36684e1	2023-07-05T03:06:12+09:00	jwj7140	Add an API example using server.cpp similar to OAI. (#2009)
M	examples/server/README.md
A	examples/server/api_like_OAI.py
M	examples/server/server.cpp

commit	7ee76e45afae7f9a7a53e93393accfb5b36684e1	acc111caf93fc6681450924df9f99679c384c59e	2023-07-04T10:05:27-04:00	Tobias Lütke	Simple webchat for server (#1998)
M	CMakeLists.txt
A	examples/server/completion.js.hpp
A	examples/server/deps.sh
A	examples/server/index.html.hpp
A	examples/server/index.js.hpp
A	examples/server/public/completion.js
A	examples/server/public/index.html
A	examples/server/public/index.js
M	examples/server/server.cpp

commit	acc111caf93fc6681450924df9f99679c384c59e	23c7c6fc9182b041f006b86ea1e7f99911ecf344	2023-07-04T15:38:04+03:00	Henri Vasserman	Allow old Make to build server. (#2098)
M	Makefile

commit	23c7c6fc9182b041f006b86ea1e7f99911ecf344	698efad5fbbf326f01288649b123eff5f79b417e	2023-07-04T20:15:16+08:00	ZhouYuChen	Update Makefile: clean simple (#2097)
M	Makefile

commit	698efad5fbbf326f01288649b123eff5f79b417e	14a2cc71f62e45803ae70890ffbdeb0a172e6210	2023-07-04T01:50:12+02:00	Erik Scholz	CI: make the brew update temporarily optional. (#2092)
M	.github/workflows/build.yml

commit	14a2cc71f62e45803ae70890ffbdeb0a172e6210	1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd	2023-07-04T07:50:00+08:00	Govlzkoy	[ggml] fix index for ne03 value in ggml_cl_mul_f32 (#2088)
M	ggml-opencl.cpp

commit	1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd	cc45a7feb8412e84ff292207621412fffc0d3d51	2023-07-04T00:05:23+03:00	Henri Vasserman	fix server crashes (#2076)
M	examples/server/server.cpp

commit	cc45a7feb8412e84ff292207621412fffc0d3d51	55dbb915cc2a95048f56e667b09dfad38d840421	2023-07-04T02:43:55+08:00	Howard Su	Fix crash of test-tokenizer-0 under Debug build (#2064)
M	ggml-cuda.cu
M	llama.cpp

commit	55dbb915cc2a95048f56e667b09dfad38d840421	d7d2e6a0f0c74f7a570dae384dfff371ac744d2a	2023-07-03T19:58:58+08:00	Howard Su	[llama] No need to check file version when loading vocab score (#2079)
M	llama.cpp

commit	d7d2e6a0f0c74f7a570dae384dfff371ac744d2a	46088f72318981341a2d646f12f6eee6aec06d65	2023-07-03T05:38:44+08:00	WangHaoranRobin	server: add option to output probabilities for completion (#1962)
M	examples/common.h
M	examples/server/server.cpp

commit	46088f72318981341a2d646f12f6eee6aec06d65	0bc2cdfc875fa7877d8e01c8bb17066f99c08f21	2023-07-02T09:46:46+03:00	Georgi Gerganov	ggml : fix build with OpenBLAS (close #2066)
M	ggml.c

commit	0bc2cdfc875fa7877d8e01c8bb17066f99c08f21	befb3a35627432473f143c90994557d78ff5bc67	2023-07-01T21:49:44+02:00	Johannes Gäßler	Better CUDA synchronization logic (#2057)
M	ggml-cuda.cu
M	ggml-cuda.h

commit	befb3a35627432473f143c90994557d78ff5bc67	b2132270678c473f7cd9ba871b03d694126bc33a	2023-07-01T21:47:26+02:00	Johannes Gäßler	Test-based VRAM scratch size + context adjustment (#2056)
M	llama.cpp

commit	b2132270678c473f7cd9ba871b03d694126bc33a	2f8cd979ecd1fa582852e7136e92ff8990b98fd8	2023-07-01T20:31:44+02:00	Daniel Drake	cmake : don't force -mcpu=native on aarch64 (#2063)
M	CMakeLists.txt

commit	2f8cd979ecd1fa582852e7136e92ff8990b98fd8	471aab6e4cb89d8ef6d043f1bc93acb6eb78ab67	2023-07-01T11:14:59-07:00	Aaron Miller	metal : release buffers when freeing metal context (#2062)
M	ggml-metal.m
M	llama.cpp

commit	471aab6e4cb89d8ef6d043f1bc93acb6eb78ab67	463f2f4c4f8dd5ca9594b7d65849f346f0effe05	2023-07-02T01:00:25+08:00	Judd	convert : add support of baichuan-7b (#2055)
M	README.md
M	convert.py

commit	463f2f4c4f8dd5ca9594b7d65849f346f0effe05	cb44dbc7de287b3d17772cfb1aa49d55e082ce5b	2023-07-01T19:05:09+03:00	Georgi Gerganov	llama : fix return value of llama_load_session_file_internal (#2022)
M	llama.cpp

commit	cb44dbc7de287b3d17772cfb1aa49d55e082ce5b	79f634a19d1c32a6cfb1befc21551ee684fced6b	2023-07-02T00:02:58+08:00	Rand Xie	llama : catch llama_load_session_file_internal exceptions (#2022)
M	llama.cpp

commit	79f634a19d1c32a6cfb1befc21551ee684fced6b	04606a159947566b27810508433e6ca5dbc684ba	2023-07-01T18:46:00+03:00	Georgi Gerganov	embd-input : fix returning ptr to temporary
M	examples/embd-input/embd-input-lib.cpp
M	examples/embd-input/embd-input.h

commit	04606a159947566b27810508433e6ca5dbc684ba	b1ca8f36a9cdbcee5f5c425df717611a1040a897	2023-07-01T18:45:44+03:00	Georgi Gerganov	train : fix compile warning
M	examples/train-text-from-scratch/train-text-from-scratch.cpp

commit	b1ca8f36a9cdbcee5f5c425df717611a1040a897	b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf	2023-07-01T23:42:43+08:00	Qingyou Meng	ggml : disable GGML_TASK_INIT and GGML_TASK_FINALIZE by default (#1995)
M	ggml.c
M	ggml.h

commit	b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf	96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1	2023-06-29T21:15:15+08:00	Howard Su	Use unsigned for random seed (#2006)
M	examples/common.cpp
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/server/README.md
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp
M	llama.h

commit	96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1	d3494bb86bf7ad5b0b60aae0220ea576f273b5c0	2023-06-29T11:56:43+08:00	LostRuins	Porting the improved K-Quant CUDA kernels to OpenCL (#1966)
M	ggml-opencl.cpp

commit	d3494bb86bf7ad5b0b60aae0220ea576f273b5c0	5b351e94d041742cd50ffcf2d44718d63bab398a	2023-06-28T20:39:08+02:00	m3ndax	llama : replacing auto &kv with const auto &kv (#2041)
M	llama.cpp

commit	5b351e94d041742cd50ffcf2d44718d63bab398a	6432aabb6dc887436e4d57414b63116189c3b13b	2023-06-28T14:27:31-03:00	Salvador E. Tropea	cuda : remove nchannels_x argument from mul_mat_vec_nc_f16_f32 (#2028)
M	ggml-cuda.cu

commit	6432aabb6dc887436e4d57414b63116189c3b13b	b922bc351b69770cec2d35d2aa50fa052b95ca93	2023-06-28T14:26:26-03:00	Salvador E. Tropea	cuda : fix missing const qualifier in casts (#2027)
M	ggml-cuda.cu

commit	b922bc351b69770cec2d35d2aa50fa052b95ca93	7f9753fa1263c4eded9a3de19778562f0e1093d7	2023-06-28T10:13:02-07:00	Howard Su	llama : remove shards weight file support (#2000)
M	llama.cpp

commit	7f9753fa1263c4eded9a3de19778562f0e1093d7	cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e	2023-06-28T18:35:54+02:00	Johannes Gäßler	CUDA GPU acceleration for LoRAs + f16 models (#1970)
M	examples/common.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	llama.cpp

commit	cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e	9d23589d638dc74577d5ff880e6d4248b795f12e	2023-06-28T23:53:37+08:00	ningshanwutuobang	llama : support input embeddings directly  (#1910)
M	.gitignore
M	Makefile
M	convert-lora-to-ggml.py
M	examples/CMakeLists.txt
A	examples/embd-input/.gitignore
A	examples/embd-input/CMakeLists.txt
A	examples/embd-input/README.md
A	examples/embd-input/embd-input-lib.cpp
A	examples/embd-input/embd-input-test.cpp
A	examples/embd-input/embd-input.h
A	examples/embd-input/embd_input.py
A	examples/embd-input/llava.py
A	examples/embd-input/minigpt4.py
A	examples/embd-input/panda_gpt.py
M	llama.cpp
M	llama.h

commit	9d23589d638dc74577d5ff880e6d4248b795f12e	0be54f75a6c3e9a09ea71bdfcdabf9a996a0549b	2023-06-27T19:06:33+02:00	Erik Scholz	fix pthreads setaffinity usage on android (#2020)
M	ggml.c

commit	0be54f75a6c3e9a09ea71bdfcdabf9a996a0549b	181e8d975528a4e27eabb8ae6e9865f9ceae4b37	2023-06-27T13:07:13+08:00	Howard Su	baby-llama : fix build after ggml_rope change (#2016)
M	examples/baby-llama/baby-llama.cpp

commit	181e8d975528a4e27eabb8ae6e9865f9ceae4b37	d9779021bd59ed96daae75e820a5ac5da47ca8ff	2023-06-27T00:37:13+03:00	Georgi Gerganov	llama : fix rope usage after ChatGLM change
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp

commit	d9779021bd59ed96daae75e820a5ac5da47ca8ff	d38e45157862b58a1824387e64860d68ca3533a7	2023-06-27T00:06:51+03:00	Georgi Gerganov	ggml : add support for ChatGLM RoPE
M	ggml.c
M	ggml.h

commit	d38e45157862b58a1824387e64860d68ca3533a7	eaa6ca5a61b8c9501df9ebe3d264f45b75a5f8aa	2023-06-26T22:47:59+03:00	Roman Parykin	readme : add Scala 3 bindings repo (#2010)
M	README.md

commit	eaa6ca5a61b8c9501df9ebe3d264f45b75a5f8aa	aa777abbb73655c4e1e9237b7c0ad66745e8e48c	2023-06-27T03:45:32+08:00	David Yang	ggml : increase max tensor name + clean up compiler warnings in train-text (#1988)
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.h

commit	aa777abbb73655c4e1e9237b7c0ad66745e8e48c	c824d2e368d193d9f564ff29880a51cda9f90527	2023-06-26T16:34:45-03:00	Gustavo Rocha Dias	readme : LD_LIBRARY_PATH complement for some Android devices when building with CLBlast inside Termux (#2007)
M	README.md

commit	c824d2e368d193d9f564ff29880a51cda9f90527	b853d456018b10820686362af41b2f2f75f1eec6	2023-06-26T21:03:59+03:00	Georgi Gerganov	ggml : avoid conv 2d kernel round up
M	ggml.c

commit	b853d456018b10820686362af41b2f2f75f1eec6	9225baef71407d799a6f7f563b77fd7f82791416	2023-06-26T13:57:59-04:00	zrm	ggml : add NUMA support (#1556)
M	examples/common.cpp
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	ggml.c
M	ggml.h
M	llama-util.h
M	llama.cpp
M	llama.h

commit	9225baef71407d799a6f7f563b77fd7f82791416	a84ab1da8dc6a59a5b67420ae1322f09503ffc72	2023-06-26T20:10:52+03:00	Georgi Gerganov	k-quants : fix indentation
M	k_quants.c

commit	a84ab1da8dc6a59a5b67420ae1322f09503ffc72	5743ca80928d8410754ec64a5673d5c2dd6cfbb7	2023-06-27T01:47:02+09:00	katsu560	tests : fix quantize perf (#1990)
M	tests/test-quantize-perf.cpp

commit	5743ca80928d8410754ec64a5673d5c2dd6cfbb7	412c60e4739367144e51e59add5dc7749d084115	2023-06-27T01:46:07+09:00	katsu560	k-quants : add AVX support to dot functions (#1916)
M	k_quants.c

commit	412c60e4739367144e51e59add5dc7749d084115	6769e944c727c63612dcafbef52009d21ae00fff	2023-06-26T19:45:09+03:00	Georgi Gerganov	readme : add link to new k-quants for visibility
M	README.md

commit	6769e944c727c63612dcafbef52009d21ae00fff	cbebf61ca7584e9709265395f0127ae7fc0f1882	2023-06-26T19:43:07+03:00	Kawrakow	k-quants : support for super-block size of 64 (#2001)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu
M	ggml-metal.m
M	ggml-metal.metal
M	k_quants.c
M	k_quants.h
M	llama.cpp

commit	cbebf61ca7584e9709265395f0127ae7fc0f1882	447ccbe8c39332fcdd0d98a041b6e2ff6f06219d	2023-06-26T23:15:47+08:00	Howard Su	Fix assert when free invalid cuda pointer (#2005)
M	ggml-cuda.cu

commit	447ccbe8c39332fcdd0d98a041b6e2ff6f06219d	bd34cdde38f8fd661890ddd5f57ca30bf279877b	2023-06-25T16:08:12+03:00	Georgi Gerganov	readme : add new roadmap + manifesto
M	README.md

commit	bd34cdde38f8fd661890ddd5f57ca30bf279877b	c2a08f87b8d180115d04b8688f383d1b2761b16d	2023-06-25T14:25:08+03:00	Georgi Gerganov	ggml : sync latest ggml (custom operators)
M	ggml.c
M	ggml.h

commit	c2a08f87b8d180115d04b8688f383d1b2761b16d	66a2555ba6cab954c56d653b29c27bfbbacfbfb1	2023-06-25T08:48:36Z	anon998	fix server sampling: top k sampler first (#1977)
M	examples/server/server.cpp

commit	66a2555ba6cab954c56d653b29c27bfbbacfbfb1	e65ca7e14ac76c4046091da39d41a9017abaa9b3	2023-06-25T09:07:03+03:00	Georgi Gerganov	readme : add Azure CI discussion link
M	README.md

commit	e65ca7e14ac76c4046091da39d41a9017abaa9b3	5ec8dd5a3c6a9a109351d2257bb9d53869bd0a94	2023-06-25T13:45:44+08:00	sjinzh	zig : upgrade build system support (#1981)
M	build.zig

commit	5ec8dd5a3c6a9a109351d2257bb9d53869bd0a94	65bdd52a867539691007f85c5508146d507f72c1	2023-06-25T04:10:29+10:00	Robyn	#1869 Fix null reference errors when training from scratch with CUDA (#1907)
M	ggml-cuda.cu
M	ggml.c

commit	65bdd52a867539691007f85c5508146d507f72c1	fdd18609113862dc6eb34dfc44a093d54c59ff1f	2023-06-24T19:40:18+03:00	Georgi Gerganov	tests : sync test-grad0 from ggml
M	tests/test-grad0.c

commit	fdd18609113862dc6eb34dfc44a093d54c59ff1f	c943d823c14cef33092205ca3944de6fdf7abf99	2023-06-24T04:07:08-07:00	Rowan Hart	flake : fix ggml-metal.metal path and run nixfmt (#1974)
M	flake.nix

commit	c943d823c14cef33092205ca3944de6fdf7abf99	f2c754e1c38936fdde74e4848ac468a696eb73c6	2023-06-24T19:02:06+08:00	AN Long	convert : fix invalid params in write_vocab_only (#1975)
M	convert.py

commit	f2c754e1c38936fdde74e4848ac468a696eb73c6	11da1a85cd69af84b5861134738c7e9e20907470	2023-06-24T12:57:18+02:00	slaren	ggml : improve ggml_graph_dump_dot, add ggml_format_name (#1978)
M	ggml.c
M	ggml.h

commit	11da1a85cd69af84b5861134738c7e9e20907470	235b610d650cbfed6dbd5d671f750d35fc18cd7d	2023-06-24T13:38:18+03:00	Georgi Gerganov	readme : fix whitespaces
M	README.md

commit	235b610d650cbfed6dbd5d671f750d35fc18cd7d	b061ba9e2a7a2c335a200df8c11aed5e31e4ccbb	2023-06-24T12:32:13+02:00	Alberto	readme : fixed termux instructions (#1973)
M	README.md

commit	b061ba9e2a7a2c335a200df8c11aed5e31e4ccbb	527b6fba1d237befb324fd846bda7418c0fa394d	2023-06-24T03:15:01-07:00	Alex Renda	llama : fix top-p sampling to match the canonical definition (#1953)
M	llama.cpp
M	tests/test-sampling.cpp

commit	527b6fba1d237befb324fd846bda7418c0fa394d	d7b7484f74d486f77feb4c0b7af7e1718ed91651	2023-06-24T11:47:58+03:00	Didzis Gosko	llama : make model stateless and context stateful (llama_state) (#1797)
M	examples/common.cpp
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/server/server.cpp
M	examples/simple/simple.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	llama.cpp
M	llama.h
M	tests/test-tokenizer-0.cpp

commit	d7b7484f74d486f77feb4c0b7af7e1718ed91651	7487137227eb32ed9b12156338b865cb29b2dfd1	2023-06-23T04:38:01-04:00	eiery	Add OpenLLaMA instructions to the README (#1954)
M	README.md

commit	7487137227eb32ed9b12156338b865cb29b2dfd1	bbca06e26949686d61a5126332680ba3cccf235c	2023-06-22T14:20:47+02:00	Erik Scholz	rework convert.py to read hyper-parameters from config.json (#1958)
M	convert.py

commit	bbca06e26949686d61a5126332680ba3cccf235c	fb98254f99d769fcbbf20966ef386abdb48ef601	2023-06-21T23:49:25+02:00	Johannes Gäßler	cmake: revert CUDA arch default to 52, 61 if f16 (#1959)
M	CMakeLists.txt

commit	fb98254f99d769fcbbf20966ef386abdb48ef601	049aa16b8c5c6d086246e4e6b9feb18de4fbd663	2023-06-22T03:18:43+05:30	Rahul Vivek Nair	Fix typo in README.md (#1961)
M	README.md

commit	049aa16b8c5c6d086246e4e6b9feb18de4fbd663	2322ec223a21625dfe9bd73ee677444a98a24ac9	2023-06-20T19:05:54+03:00	Georgi Gerganov	readme : add link to p1
M	README.md

commit	2322ec223a21625dfe9bd73ee677444a98a24ac9	aacdbd40562684665b6f7b8ba6695b7a2088bbb0	2023-06-20T05:42:40-07:00	Xiake Sun	Fix typo (#1949)
M	README.md

commit	aacdbd40562684665b6f7b8ba6695b7a2088bbb0	20568fe60f00155fa25e92eb3a7f6b911d557967	2023-06-20T03:24:39+02:00	Ettore Di Giacinto	llama : fix params struct slignment (#1936)
M	llama.cpp
M	llama.h

commit	20568fe60f00155fa25e92eb3a7f6b911d557967	18b35625c3c19c64b7818a12460ba5ddb006dfdc	2023-06-20T01:12:39+03:00	Henri Vasserman	[Fix] Reenable server embedding endpoint (#1937)
M	examples/server/README.md
M	examples/server/server.cpp

commit	18b35625c3c19c64b7818a12460ba5ddb006dfdc	ba4e85a8339b9dd7cdffad31838235f2fe45a8ea	2023-06-19T20:43:30+03:00	Georgi Gerganov	ggml : fix bug in LBFGS optimizer (found by ggml tests)
M	ggml.c

commit	ba4e85a8339b9dd7cdffad31838235f2fe45a8ea	23fc5c219a9aebd57c8af3fac454062cc4622980	2023-06-19T23:20:06+08:00	l3utterfly	llama : use aligned memory during ggml_init call from loading saved sessions (#1934)
M	llama.cpp

commit	23fc5c219a9aebd57c8af3fac454062cc4622980	cb40dfca694b5cb849837548fd69932117c78362	2023-06-19T18:18:34+03:00	Georgi Gerganov	cmake : fix trailing whitespaces
M	CMakeLists.txt

commit	cb40dfca694b5cb849837548fd69932117c78362	ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8	2023-06-19T18:17:03+03:00	Kawrakow	llama : only use Q6_K for output weights if tensor size is multiple of 256 (#1932)
M	llama.cpp

commit	ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8	b97ca431db35ec96a339a721acb1219c1dd78bed	2023-06-19T18:14:09+03:00	Kawrakow	cuda : faster k-quants on older GPUs (#1930)
M	ggml-cuda.cu

commit	b97ca431db35ec96a339a721acb1219c1dd78bed	1e3abfcef073e73c2b31e8570cb06c5cb2fd1f55	2023-06-19T18:12:33+03:00	Georgi Gerganov	ggml : sync latest ggml repo (#1924)
M	ggml.c
M	ggml.h

commit	1e3abfcef073e73c2b31e8570cb06c5cb2fd1f55	16b9cd193965769089881bb8ec012fccca7b37b6	2023-06-19T23:10:37+08:00	Howard Su	cmake : fix build shared ggml when CUDA is enabled (#1929)
M	CMakeLists.txt

commit	16b9cd193965769089881bb8ec012fccca7b37b6	b24c3049d96557c24782e4d32feaae65f47277af	2023-06-19T10:23:56+02:00	Johannes Gäßler	Convert vector to f16 for dequantize mul mat vec (#1913)
M	CMakeLists.txt
M	Makefile
M	README.md
M	ggml-cuda.cu
M	llama.cpp

commit	b24c3049d96557c24782e4d32feaae65f47277af	0ede372a51fd8160688e01b587582666c14e94e5	2023-06-18T17:41:26+02:00	Johannes Gäßler	Added tokens per second to info prints (#1928)
M	llama.cpp

commit	0ede372a51fd8160688e01b587582666c14e94e5	8596af427722775f0df4a7c90b9af067ba90d4ef	2023-06-18T16:07:09+02:00	Johannes Gäßler	Fixed incorrectly applying RMS norm twice (#1925)
M	llama.cpp

commit	8596af427722775f0df4a7c90b9af067ba90d4ef	e1886cf4fe0d0f31661dda52a4a9f34bd9b9009a	2023-06-18T19:19:16+08:00	l3utterfly	ggml : fix bug in ggml_compute_forward_add_q_f32 (#1918)
M	ggml.c

commit	e1886cf4fe0d0f31661dda52a4a9f34bd9b9009a	8ab8ba62eb27cc340be2edf3418e051b1d967416	2023-06-18T16:28:26+08:00	Mike	readme : update Android build instructions (#1922)
M	README.md

commit	8ab8ba62eb27cc340be2edf3418e051b1d967416	90cc59d6ab1363a5c69c60c4b94db647d3a54a18	2023-06-18T11:13:43+03:00	Kawrakow	llama : prevent usage of k-quants when tensor size is not a multiple of 256 (#1921)
M	llama.cpp

commit	90cc59d6ab1363a5c69c60c4b94db647d3a54a18	ce2c7d72e2d06988b5ddec6811ab923254542077	2023-06-18T10:52:10+03:00	Kawrakow	examples : fix examples/metal (#1920)
M	examples/metal/metal.cpp

commit	ce2c7d72e2d06988b5ddec6811ab923254542077	57cd69460f736031a3fc54af1e97c03f80128478	2023-06-18T09:09:47+03:00	Georgi Gerganov	metal : handle buffers larger than device's maxBufferLength (#1826)
M	Makefile
M	ggml-metal.h
M	ggml-metal.m
M	ggml.c
M	ggml.h
M	llama.cpp

commit	57cd69460f736031a3fc54af1e97c03f80128478	b2416493ab3ab21686d47c96669da6d6c6af08a4	2023-06-18T12:29:47+08:00	Howard Su	cmake : add CUDA_ARCHITECTURES to new target ggml_static (#1917)
M	CMakeLists.txt

commit	b2416493ab3ab21686d47c96669da6d6c6af08a4	4f9c43e3bd488b7561119785485e1155dba338d7	2023-06-17T20:55:03+03:00	Georgi Gerganov	make : do not print help for simple example
M	Makefile

commit	4f9c43e3bd488b7561119785485e1155dba338d7	2c9380dd2f77e41149340f3ecb09764d793b16db	2023-06-17T20:24:11+03:00	Georgi Gerganov	minor : warning fixes
M	examples/main/main.cpp
M	ggml-metal.m

commit	2c9380dd2f77e41149340f3ecb09764d793b16db	051e1b0e6a6e3aee7d989b47760980e6fda5861c	2023-06-17T19:15:02+02:00	Johannes Gäßler	Only one CUDA stream per device for async compute (#1898)
M	README.md
M	examples/common.cpp
M	ggml-cuda.cu

commit	051e1b0e6a6e3aee7d989b47760980e6fda5861c	86c7571864ff331f8cdb9e092f3abeb123729a56	2023-06-17T19:30:22+03:00	Georgi Gerganov	llama : fix kv_cache `n` init (close #1903)
M	.gitignore
M	examples/CMakeLists.txt
M	llama.cpp

commit	86c7571864ff331f8cdb9e092f3abeb123729a56	3d59ec5935ea1d33e9d51060a8dd737169b9b89b	2023-06-17T18:17:22+02:00	DaniAndTheWeb	make : update for latest Arch (#1701)
M	Makefile

commit	3d59ec5935ea1d33e9d51060a8dd737169b9b89b	0711a5f6dce7f04c2a791b14bc47f7d4cb545408	2023-06-17T23:46:15+08:00	Howard Su	ggml : fix warnings under MSVC (#1908)
M	ggml-cuda.cu
M	ggml-opencl.cpp
M	llama.cpp

commit	0711a5f6dce7f04c2a791b14bc47f7d4cb545408	fc45a81bc642b9ef33d9004f2b363d558438a6c9	2023-06-17T07:37:49-07:00	Aaron Miller	metal : add norm, cpy f16->f16, alibi kernels (#1823)
M	ggml-metal.m
M	ggml-metal.metal

commit	fc45a81bc642b9ef33d9004f2b363d558438a6c9	794db3e7b982fee37e3995db9c3a216a57ff65e3	2023-06-17T17:13:05+05:00	Faez Shakil	exposed modules so that they can be invoked by nix run github:ggerganov/llama.cpp#server etc (#1863)
M	flake.nix

commit	794db3e7b982fee37e3995db9c3a216a57ff65e3	5ddf7ea1fb42bac21026de2f77e0f9c069b92234	2023-06-17T07:53:04-04:00	Randall Fitzgerald	Server Example Refactor and Improvements (#1570)
M	.gitignore
M	Makefile
M	examples/server/CMakeLists.txt
M	examples/server/README.md
A	examples/server/chat.mjs
A	examples/server/chat.sh
M	examples/server/server.cpp

commit	5ddf7ea1fb42bac21026de2f77e0f9c069b92234	bac19927c302737465a1deb14ac0943a221863e8	2023-06-17T12:32:48+02:00	Jiří Podivín	hooks : setting up flake8 and pre-commit hooks (#1681)
A	.flake8
A	.pre-commit-config.yaml
M	convert.py
M	examples/jeopardy/graph.py
M	scripts/verify-checksum-models.py

commit	bac19927c302737465a1deb14ac0943a221863e8	b4c6f46f17b6e02f1cd55a81339e7e64f3aaa688	2023-06-17T06:01:06-03:00	Gustavo Rocha Dias	readme :  alternative way to build for Android with CLBlast. (#1828)
M	README.md

commit	b4c6f46f17b6e02f1cd55a81339e7e64f3aaa688	92f20d9942c86daeb78637bdad7296a572f4da28	2023-06-17T01:49:42-06:00	Kerfuffle	Allow cmake to build ggml as a library (#1896)
M	CMakeLists.txt

commit	92f20d9942c86daeb78637bdad7296a572f4da28	d411968e990c37f51328849c96a743dd78f3c3dd	2023-06-17T14:51:54+08:00	David Yang	train : get raw text instead of page with html (#1905)
M	examples/train-text-from-scratch/README.md

commit	d411968e990c37f51328849c96a743dd78f3c3dd	b41b4cad6f956b5f501db0711dd7007c32b5eee5	2023-06-16T20:59:49+02:00	0cc4m	opencl : support k-quants (#1836)
M	ggml-opencl.cpp

commit	b41b4cad6f956b5f501db0711dd7007c32b5eee5	13fe9d2d84f30cab613c960bf66ac83916006694	2023-06-16T20:58:09+02:00	SuperUserNameMan	examples : add "simple" (#1840)
M	Makefile
A	examples/simple/CMakeLists.txt
A	examples/simple/simple.cpp

commit	13fe9d2d84f30cab613c960bf66ac83916006694	ac3b8869538c7fbdb48ff141d78c4dea091789f0	2023-06-17T03:53:04+09:00	Zenix	cmake : add auto detection of BLAS_INCLUDE_DIRS (#1886)
M	CMakeLists.txt

commit	ac3b8869538c7fbdb48ff141d78c4dea091789f0	5b9ccaf104cc1054d4f8f17bc8a4b8dc949e5527	2023-06-16T20:25:51+02:00	Johannes Gäßler	llama : fix embd when offloading non-repeating layers (#1891)
M	llama.cpp

commit	5b9ccaf104cc1054d4f8f17bc8a4b8dc949e5527	9cbf50c041a525d781c7764f493a5443924e4e38	2023-06-17T02:25:01+08:00	FrankHB	Fixed possible macro redefinition (#1892)
M	examples/main/main.cpp

commit	9cbf50c041a525d781c7764f493a5443924e4e38	3d0112261042b356621e93db3fa4c6798a5d098f	2023-06-16T21:23:53+03:00	Borislav Stanimirov	build : fix and ignore MSVC warnings (#1889)
M	examples/baby-llama/baby-llama.cpp
M	examples/benchmark/benchmark-matmult.cpp
M	examples/common.cpp
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/save-load-state/save-load-state.cpp
M	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	llama.cpp
M	pocs/vdot/vdot.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp
M	tests/test-sampling.cpp
M	tests/test-tokenizer-0.cpp

commit	3d0112261042b356621e93db3fa4c6798a5d098f	602c748863e15270d80d74aa2c3bf86ab8139e07	2023-06-16T20:08:44+03:00	Kawrakow	CUDA : faster k-quant dot kernels (#1862)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu

commit	602c748863e15270d80d74aa2c3bf86ab8139e07	a09f9195be39afb4b023b646c0a6ec8a86915174	2023-06-16T09:58:11+03:00	Borislav Stanimirov	gitignore : add several entries specific to Visual Studio (#1888)
M	.gitignore

commit	a09f9195be39afb4b023b646c0a6ec8a86915174	bed92756172d4514b23aaf9744cf8e2dc892fc7b	2023-06-15T21:49:08+02:00	Johannes Gäßler	Fixed CUDA runtime version check (#1879)
M	ggml-cuda.cu

commit	bed92756172d4514b23aaf9744cf8e2dc892fc7b	c36e81da62ebfe09a768201cc44fa8d712dd00ed	2023-06-15T21:56:50+03:00	Georgi Gerganov	cmake : remove whitespaces
M	CMakeLists.txt

commit	c36e81da62ebfe09a768201cc44fa8d712dd00ed	3559433fecedf365e7aba2fe3d5f89d9abb817c1	2023-06-15T11:05:53-07:00	yangli2	examples : add chat-vicuna.sh (#1854)
A	examples/chat-vicuna.sh
M	llama.h

commit	3559433fecedf365e7aba2fe3d5f89d9abb817c1	69b34a0e80300bfb3e996983ac3ea075f5526675	2023-06-15T12:51:26-05:00	Igor Okulist	cmake : set include path for OpenBlas (#1830)
M	CMakeLists.txt

commit	69b34a0e80300bfb3e996983ac3ea075f5526675	cf267d1c71a781700698f8518e903239c3bcc929	2023-06-16T02:47:04+09:00	Frederik Vogel	swift : Package compile breaks due to ggml-metal.metal (#1831)
M	Package.swift
A	spm-headers/ggml.h

commit	cf267d1c71a781700698f8518e903239c3bcc929	9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983	2023-06-15T19:42:48+02:00	daboe01	make : add train-text-from-scratch (#1850)
M	.gitignore
M	Makefile

commit	9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983	37e257c48e350cf03c353c10d31e777f8d00123d	2023-06-15T18:36:38+01:00	Srinivas Billa	readme : server compile flag (#1874)
M	examples/server/README.md

commit	37e257c48e350cf03c353c10d31e777f8d00123d	64cc19b4fe3df03bc20e520aa111c30cff3a655e	2023-06-15T23:06:06+05:30	sandyiscool	make : clean *.so files (#1857)
M	Makefile

commit	64cc19b4fe3df03bc20e520aa111c30cff3a655e	4bfcc855abdb2c9fcc3c5a84747974521909fa41	2023-06-16T01:29:59+08:00	Howard Su	Fix the validation of main device (#1872)
M	ggml-cuda.cu

commit	4bfcc855abdb2c9fcc3c5a84747974521909fa41	6b8312e7979b852f6b6ac9d29cd51fda16c17948	2023-06-15T20:29:48+03:00	Georgi Gerganov	metal : parallel command buffer encoding (#1860)
M	ggml-metal.h
M	ggml-metal.m

commit	6b8312e7979b852f6b6ac9d29cd51fda16c17948	254a7a7a5ff4c874ff8488f1f5cbdd7e9c89d682	2023-06-15T19:06:46+02:00	Johannes Gäßler	Better error when using both LoRA + GPU layers (#1861)
M	examples/common.cpp

commit	254a7a7a5ff4c874ff8488f1f5cbdd7e9c89d682	92549202659fc23ba9fec5e688227d0da9b06b40	2023-06-14T19:47:19+02:00	Johannes Gäßler	CUDA full GPU acceleration, KV cache in VRAM (#1827)
M	examples/common.cpp
M	examples/common.h
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	92549202659fc23ba9fec5e688227d0da9b06b40	e32089b2c20b1b87b22912f4a8b93fe01647d5b9	2023-06-13T15:37:54-04:00	0xspringtime	baby-llama : fix operator!= (#1821)
M	examples/baby-llama/baby-llama.cpp

commit	e32089b2c20b1b87b22912f4a8b93fe01647d5b9	2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343	2023-06-13T21:04:40+02:00	xaedes	train : improved training-from-scratch example (#1652)
M	examples/CMakeLists.txt
M	examples/baby-llama/baby-llama.cpp
A	examples/train-text-from-scratch/CMakeLists.txt
A	examples/train-text-from-scratch/README.md
A	examples/train-text-from-scratch/train-text-from-scratch.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-grad0.c

commit	2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343	74d4cfa3438cb58bd177eed30014e6588694aaa8	2023-06-13T20:20:07+03:00	Georgi Gerganov	llama : do a warm-up eval at start for better timings (#1824)
M	examples/main/main.cpp

commit	74d4cfa3438cb58bd177eed30014e6588694aaa8	74a6d922f12ccfe16b0c265f43be8978c6f25e98	2023-06-13T04:23:23-06:00	Kerfuffle	Allow "quantizing" to f16 and f32 (#1787)
M	Makefile
M	examples/quantize/quantize.cpp
M	ggml.c
M	llama.cpp

commit	74a6d922f12ccfe16b0c265f43be8978c6f25e98	e4caa8da59c1c97dc23fa336f4d726984a20560f	2023-06-12T22:39:21+03:00	Kawrakow	Metal implementation for all k_quants (#1807)
M	ggml-metal.m
M	ggml-metal.metal
M	llama.cpp

commit	e4caa8da59c1c97dc23fa336f4d726984a20560f	58970a4c39124a647ac2a640d9e178ea6c961e65	2023-06-12T19:12:47+02:00	slaren	ci : run when changing only the CUDA sources (#1800)
M	.github/workflows/build.yml

commit	58970a4c39124a647ac2a640d9e178ea6c961e65	8c0a10e64dbf60fd9946c0cd5e6f59690800b123	2023-06-12T20:44:16+08:00	Howard Su	Leverage mmap for offloading tensors to GPU (#1597)
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-opencl.cpp
M	ggml-opencl.h
M	llama.cpp

commit	8c0a10e64dbf60fd9946c0cd5e6f59690800b123	fa84c4b3e80199a5683438f062009c031a06c4fa	2023-06-12T14:31:36+03:00	Kawrakow	metal : fix failure to load model (#1817)
M	ggml-metal.m

commit	fa84c4b3e80199a5683438f062009c031a06c4fa	12b063f0ecf280e98028e444fc492ee6222cdcdc	2023-06-11T08:19:17-06:00	Kerfuffle	Fix issue where interactive mode crashes when input exceeds ctx size (#1789)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	12b063f0ecf280e98028e444fc492ee6222cdcdc	31d2b5f4a4bae081e59b36ab37c6ff6f5b5940ad	2023-06-11T21:20:52+08:00	Kyle Liang	Fixed WSL cuda's OOM error (#1594)
M	ggml-cuda.cu

commit	31d2b5f4a4bae081e59b36ab37c6ff6f5b5940ad	4de0334f5cabf4696eced2e5d6e279fdfaa6c0f2	2023-06-11T17:38:53+08:00	Ryan Landay	Update SHA256SUMS with current hashes for models quantized using q4_0 (#1798)
M	SHA256SUMS

commit	4de0334f5cabf4696eced2e5d6e279fdfaa6c0f2	3f1223155a462477ac933474ebc4eab0ce3ca264	2023-06-10T22:56:53+03:00	Georgi Gerganov	cmake : fix Metal build (close #1791)
M	CMakeLists.txt

commit	3f1223155a462477ac933474ebc4eab0ce3ca264	303f5809f1b4ec49823dbe70cacd2124ec1d0df0	2023-06-10T22:51:36+03:00	Artyom Lebedev	k-quants : GCC12 compilation fix (#1792)
M	k_quants.c

commit	303f5809f1b4ec49823dbe70cacd2124ec1d0df0	059e99066d95d73d1ca26c3375d47c0e35596229	2023-06-10T10:47:34-04:00	Andrei	metal : fix issue with ggml-metal.metal path. Closes #1769 (#1782)
M	CMakeLists.txt
M	flake.nix
M	ggml-metal.m

commit	059e99066d95d73d1ca26c3375d47c0e35596229	17c10acfb44ecb7af25e37fb67b9501cbc0034d2	2023-06-11T00:08:11+10:00	Aisuko	doc : fix wrong address of BLIS.md (#1772)
M	README.md

commit	17c10acfb44ecb7af25e37fb67b9501cbc0034d2	e9b66ee9829039d4ab54550d6222e42a0b31e52a	2023-06-10T12:06:45+03:00	Georgi Gerganov	ggml : force no_alloc == false when creating opt tensors (close #1699)
M	ggml.c

commit	e9b66ee9829039d4ab54550d6222e42a0b31e52a	4f0154b0bad775ac4651bf73b5c216eb43c45cdc	2023-06-10T11:28:11+03:00	Kawrakow	metal : add Q4_1 implementation (#1785)
M	ggml-metal.m
M	ggml-metal.metal

commit	4f0154b0bad775ac4651bf73b5c216eb43c45cdc	ef3171d16241c18581d4d08374f0b9e396ade6b7	2023-06-10T01:59:17-06:00	Kerfuffle	llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691)
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	ef3171d16241c18581d4d08374f0b9e396ade6b7	555275a693843273759230547001f9ae07fb537e	2023-06-10T15:49:40+08:00	Xingchen Song(宋星辰)	ggml : workaround for missing _mm256_setr_m128i in GCC < 8 (#1638)
M	ggml.c

commit	555275a693843273759230547001f9ae07fb537e	98ed16557432d7a5179c57eddcc3a08a7ae6d54d	2023-06-10T14:41:59+08:00	rankaiyx	make : add SSSE3 compilation use case (#1659)
M	Makefile

commit	98ed16557432d7a5179c57eddcc3a08a7ae6d54d	ae9663f1887513e152839e91f61c513075a19422	2023-06-10T01:24:40+09:00	Robert Sung-wook Shin	OpenCL: Add release memory (#1741)
M	ggml-opencl.cpp
M	ggml-opencl.h
M	llama.cpp

commit	ae9663f1887513e152839e91f61c513075a19422	b33dee282f5d8032b5f780152732dc45cbf2d349	2023-06-09T13:58:15+02:00	Johannes Gäßler	Windows nvcc workaround (#1753)
M	ggml-cuda.cu

commit	b33dee282f5d8032b5f780152732dc45cbf2d349	92f44ff7f778ef1b94028b2ba6d39943b5ca0ada	2023-06-09T11:11:04+03:00	Georgi Gerganov	metal : fix build "tanhf" -> "tanh"
M	ggml-metal.metal

commit	92f44ff7f778ef1b94028b2ba6d39943b5ca0ada	245fc3c37da5ac5963f9f11a9f4f2ac08d96afc6	2023-06-09T04:00:51-04:00	AT	metal : add GELU implementation (#1770)
M	ggml-metal.m
M	ggml-metal.metal

commit	245fc3c37da5ac5963f9f11a9f4f2ac08d96afc6	72ff5282bf0388c60821f504c4c8cc2b1f491aa6	2023-06-09T10:39:59+03:00	Kawrakow	metal : faster q4_0 (#1775)
M	ggml-metal.m
M	ggml-metal.metal

commit	72ff5282bf0388c60821f504c4c8cc2b1f491aa6	0bf7cf1b296fc9fca05411b37afdf08a531487d2	2023-06-08T22:28:21+03:00	Kawrakow	metal : add Q2_K implementation (#1762)
M	ggml-metal.m
M	ggml-metal.metal

commit	0bf7cf1b296fc9fca05411b37afdf08a531487d2	8432d4d9f716b25133e3ed671d91e21f6f3be867	2023-06-08T20:48:14+03:00	Georgi Gerganov	Revert "ggml : load data into int8x16x4_t using vld4q_s8 on arm64 (#1738)"
M	k_quants.c

commit	8432d4d9f716b25133e3ed671d91e21f6f3be867	0f291e1f65c1d68201e71ce99c89562a36686b6d	2023-06-09T00:47:56+08:00	le.chang	ggml : load data into int8x16x4_t using vld4q_s8 on arm64 (#1738)
M	k_quants.c

commit	0f291e1f65c1d68201e71ce99c89562a36686b6d	8fc8179919a11738910db07a800f2b176f8adf09	2023-06-08T19:46:22+03:00	Kawrakow	metal : Q6_K implementation (#1752)
M	ggml-metal.m
M	ggml-metal.metal

commit	8fc8179919a11738910db07a800f2b176f8adf09	b50b570ed9d699d3d126d72fc02de92926bcd937	2023-06-08T15:58:53+08:00	qingfengfenga	Add llama.cpp docker support for non-latin languages (#1673)
M	.devops/full.Dockerfile
M	.devops/main.Dockerfile

commit	b50b570ed9d699d3d126d72fc02de92926bcd937	53aba3f393f2e02a78ddaba2e934893a8bbf3246	2023-06-08T00:12:28-07:00	Steven Roussey	ggml : fix fprintf warnings (#1720)
M	ggml.c

commit	53aba3f393f2e02a78ddaba2e934893a8bbf3246	4161bdc04debb70bf5f275492b4d89fd9330087c	2023-06-08T10:09:08+03:00	Georgi Gerganov	clang-tidy : restore dot file from accidental deletion
A	.clang-tidy

commit	4161bdc04debb70bf5f275492b4d89fd9330087c	0035858273ebe0694926bf4414d279f3e1cd109d	2023-06-08T10:08:23+03:00	Kawrakow	metal : add Q4_K implementation (#1733)
D	.clang-tidy
M	ggml-metal.m
M	ggml-metal.metal

commit	0035858273ebe0694926bf4414d279f3e1cd109d	5c64a0952ee58b2d742ee84e8e3d43cce5d366db	2023-06-08T08:02:48+01:00	johnson442	k-quants : add missing compile definition to CMakeLists (#1748)
M	CMakeLists.txt

commit	5c64a0952ee58b2d742ee84e8e3d43cce5d366db	5b57a5b72676540b6a45a3f527126299969ad241	2023-06-07T10:59:52+03:00	Georgi Gerganov	k-quants : allow to optionally disable at compile time (#1734)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu
M	ggml.c
R095	ggml-quants-k.c	k_quants.c
R052	ggml-quants-k.h	k_quants.h

commit	5b57a5b72676540b6a45a3f527126299969ad241	4dc62c545df0af60635d579e9e4dd91bc5afff51	2023-06-07T00:15:31-04:00	jacobi petrucciani	flake : update to support metal on m1/m2 (#1724)
M	flake.lock
M	flake.nix

commit	4dc62c545df0af60635d579e9e4dd91bc5afff51	35a84916fb029905c44746127026079268216e7a	2023-06-07T07:15:08+03:00	Georgi Gerganov	readme : add June roadmap
M	README.md

commit	35a84916fb029905c44746127026079268216e7a	2d7bf110edd8c49209401a16132052cba706ffd0	2023-06-07T04:10:17+02:00	Willy Tarreau	main: add the possibility to open the prompt cache read-only (#1640)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	2d7bf110edd8c49209401a16132052cba706ffd0	2a4e41a086ce80da68c402457c75c77e52dcc698	2023-06-06T22:54:39+03:00	Georgi Gerganov	llama : fix vram_scratch var
M	llama.cpp

commit	2a4e41a086ce80da68c402457c75c77e52dcc698	17366df842e358768c0df7024484fffecfc7865b	2023-06-06T22:41:53+03:00	Georgi Gerganov	llama : fix compile warnings
M	ggml.c
M	llama.cpp

commit	17366df842e358768c0df7024484fffecfc7865b	44f906e8537fcec965e312d621c80556d6aa9bec	2023-06-06T21:33:23+02:00	Johannes Gäßler	Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703)
M	examples/common.cpp
M	examples/common.h
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-opencl.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	44f906e8537fcec965e312d621c80556d6aa9bec	d5b111f53d14972669eb52055f9df2567663ad8b	2023-06-06T20:16:57+03:00	Georgi Gerganov	metal : add f16 support
M	ggml-metal.m
M	ggml-metal.metal
M	llama.cpp

commit	d5b111f53d14972669eb52055f9df2567663ad8b	2d43387dafe9c60f15f57aa23ee0b37864b98b32	2023-06-07T01:00:01+08:00	LostRuins	Clblast fixes + enhancements to save VRAM and offload more layers (#1675)
M	ggml-opencl.cpp

commit	2d43387dafe9c60f15f57aa23ee0b37864b98b32	7ad7750c5c9f6bcea73a1895ffc57e7d21f2ab95	2023-06-06T10:18:03+03:00	Georgi Gerganov	ggml : fix builds, add ggml-quants-k.o (close #1712, close #1710)
M	.gitignore
M	Makefile
M	ggml.c

commit	7ad7750c5c9f6bcea73a1895ffc57e7d21f2ab95	7a74dee6b4e0e80862191141c0037abe28967d5c	2023-06-06T09:55:10+03:00	Georgi Gerganov	gitignore : add .clang-tidy
M	.gitignore

commit	7a74dee6b4e0e80862191141c0037abe28967d5c	590250f7a9847bc9c83aa063dbaac8fa0fea27c8	2023-06-06T09:39:38+03:00	Georgi Gerganov	llama : temporary disable Q6_K output quantization (#1711)
M	llama.cpp

commit	590250f7a9847bc9c83aa063dbaac8fa0fea27c8	f4c55d3bd7e124b101bc974cbbf0e0dbbc32d5a3	2023-06-05T23:28:17-04:00	Spencer Sutton	metal : add checks for buffer size (#1706)
M	ggml-metal.m
M	llama.cpp

commit	f4c55d3bd7e124b101bc974cbbf0e0dbbc32d5a3	f1465624c2cbc8ee65b566e3d87f2af27796d4c4	2023-06-05T23:32:36+03:00	Yuval Peled	docs : add performance troubleshoot + example benchmark documentation (#1674)
M	README.md
R100	BLIS.md	docs/BLIS.md
A	docs/token_generation_performance_tips.md

commit	f1465624c2cbc8ee65b566e3d87f2af27796d4c4	c2df36d60dc0ff1576541b965d751eadbacbeada	2023-06-05T22:28:37+02:00	Foul-Tarnished	readme : fix typo (#1700)
M	README.md

commit	c2df36d60dc0ff1576541b965d751eadbacbeada	9d0693bce38013364b1042568d9083353bfff48f	2023-06-05T22:24:29+02:00	mgroeber9110	llama : consistently catch and throw only exceptions deriving from std::exception (#1599)
M	llama.cpp

commit	9d0693bce38013364b1042568d9083353bfff48f	efe05076323f5c6bafece109e21cce046f5e4b07	2023-06-05T13:24:04-07:00	kiltyj	metal : use shared buffers between CPU and GPU (#1696)
M	ggml-metal.m
M	ggml.c
M	llama-util.h
M	llama.cpp

commit	efe05076323f5c6bafece109e21cce046f5e4b07	e7fe66e670537990ccc075cce9286df88bba052a	2023-06-05T22:11:49+02:00	grahameth	ggml : fix internal overflow in ggml_time_us on Windows (#1702)
M	ggml.c

commit	e7fe66e670537990ccc075cce9286df88bba052a	99009e72f8072fa552eb02efee436be596c71cdd	2023-06-05T23:05:05+03:00	Georgi Gerganov	ci : disable auto tidy (#1705)
M	.github/workflows/tidy-post.yml

commit	99009e72f8072fa552eb02efee436be596c71cdd	5220a991a5e92bddad9542267ab445a2c033681c	2023-06-05T22:56:18+03:00	Kawrakow	ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684)
M	CMakeLists.txt
M	Makefile
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
A	ggml-quants-k.c
A	ggml-quants-k.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-quantize-fns.cpp

commit	5220a991a5e92bddad9542267ab445a2c033681c	d1f563a743a83dabc11e125d4a7d64189c16498c	2023-06-05T13:43:08+03:00	Henri Vasserman	Increase 3B scratch buffers. (#1698)
M	llama.cpp

commit	d1f563a743a83dabc11e125d4a7d64189c16498c	827f5eda91e5b7299848ee2c7179d873bdee0f7b	2023-06-05T10:19:03+03:00	Georgi Gerganov	llama : fix Metal KV cache sync (close #1695)
M	llama.cpp

commit	827f5eda91e5b7299848ee2c7179d873bdee0f7b	ecb217db4fcfa3880300ad08531a5fb6bb142d45	2023-06-04T23:38:19+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	ecb217db4fcfa3880300ad08531a5fb6bb142d45	dcb2ed48268e421baf25adc00d602dad0f415564	2023-06-04T23:34:30+03:00	Georgi Gerganov	llama : Metal inference (#1642)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	README.md
M	examples/CMakeLists.txt
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
A	examples/metal/CMakeLists.txt
A	examples/metal/metal.cpp
A	ggml-metal.h
A	ggml-metal.m
A	ggml-metal.metal
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	dcb2ed48268e421baf25adc00d602dad0f415564	d8bd0013e8768aaa3dc9cfc1ff01499419d5348e	2023-06-04T08:12:05+02:00	0cc4m	OpenCL: Fix duplication of layers in VRAM and RAM, add GPU mul kernel (#1653)
M	ggml-opencl.cpp
M	ggml-opencl.h
M	ggml.c
M	llama.cpp

commit	d8bd0013e8768aaa3dc9cfc1ff01499419d5348e	b5c85468a3eadf424420af5bf11c2353ff828cda	2023-06-03T16:35:20+03:00	Henri Vasserman	Add info about CUDA_VISIBLE_DEVICES (#1682)
M	README.md

commit	b5c85468a3eadf424420af5bf11c2353ff828cda	136476e898fb96c302b0829ee3e79267ae12660f	2023-06-03T14:11:53+02:00	Jiří Podivín	Docker: change to calling convert.py (#1641)
M	.devops/tools.sh
M	convert-pth-to-ggml.py

commit	136476e898fb96c302b0829ee3e79267ae12660f	ffb06a345e3a9e30d39aaa5b46a23201a74be6de	2023-06-03T07:28:45-04:00	Evan Jones	Fix prompt cache saving and chat-persistent rollover (#1678)
M	examples/main/main.cpp

commit	ffb06a345e3a9e30d39aaa5b46a23201a74be6de	7552ac586380f202b75b18aa216ecfefbd438d94	2023-05-30T21:24:22+03:00	Henri Vasserman	OpenLLaMA 3B support (#1588)
M	llama.cpp

commit	7552ac586380f202b75b18aa216ecfefbd438d94	5d1830b99dfd85bb6279adb4dd94aa444afd5b5e	2023-05-29T19:31:44+03:00	Georgi Gerganov	ggml : sync cgraph import / export API
M	ggml.c
M	ggml.h

commit	5d1830b99dfd85bb6279adb4dd94aa444afd5b5e	248367605ead6fb7c36d2bfb1ebd8f00a23f7c71	2023-05-29T19:30:49+03:00	Georgi Gerganov	ggml : fix bug in ggml_alibi
M	ggml.c

commit	248367605ead6fb7c36d2bfb1ebd8f00a23f7c71	0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae	2023-05-29T05:13:40-07:00	DannyDaemonic	Work around for recalculating logits in cached prompts (Fixes #1585) (#1609)
M	examples/main/main.cpp

commit	0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae	3b126f654fceb4f5f195a1c2e825bb18e101188c	2023-05-29T06:45:50+02:00	Jiří Podivín	Adding git in container package dependencies (#1621)
M	.devops/full.Dockerfile
M	.devops/main.Dockerfile

commit	3b126f654fceb4f5f195a1c2e825bb18e101188c	1b78ed20818b72306edc7208b9bfb69a1a0d3297	2023-05-28T21:01:02+02:00	Johannes Gäßler	LLAMA_DEBUG adds debug symbols (#1617)
M	Makefile

commit	1b78ed20818b72306edc7208b9bfb69a1a0d3297	337aea11390221bc925e4acb1f603f1649af2735	2023-05-28T11:48:57-06:00	Kerfuffle	Only show -ngl option when relevant + other doc/arg handling updates (#1625)
M	examples/common.cpp
M	examples/main/README.md
M	examples/server/README.md
M	examples/server/server.cpp
M	llama.h

commit	337aea11390221bc925e4acb1f603f1649af2735	bb051d9723d628414b9e929e5264e23262a2f1b2	2023-05-28T20:14:24+03:00	Vladimir Zorin	examples : add --alias option to gpt_params to set use friendly model name (#1614)
M	examples/common.cpp
M	examples/common.h
M	examples/server/server.cpp

commit	bb051d9723d628414b9e929e5264e23262a2f1b2	ca74884f6625b15ef69832f07fc60fe00db5f90c	2023-05-29T01:13:36+08:00	Howard Su	opencl : no need to allocate cl_mem on heap (#1612)
M	ggml-opencl.cpp

commit	ca74884f6625b15ef69832f07fc60fe00db5f90c	a6704643b62243bc4b6bbcd727d63d44e01a1002	2023-05-29T01:09:56+08:00	Howard Su	opencl : use strstr to check if fp16 supported (#1611)
M	ggml-opencl.cpp

commit	a6704643b62243bc4b6bbcd727d63d44e01a1002	0df7d63e5ba0ab8856476e121a03b985d6f15c9d	2023-05-27T21:03:25+01:00	apcameron	ggml : add support for the RISCV architecture (#1616)
M	ggml.c

commit	0df7d63e5ba0ab8856476e121a03b985d6f15c9d	97c9b77c4fc5e2283755c4418759cfc5fc73ad05	2023-05-27T11:04:14-06:00	Kerfuffle	Include server in releases + other build system cleanups (#1610)
M	.github/workflows/build.yml
M	Makefile
M	examples/server/server.cpp

commit	97c9b77c4fc5e2283755c4418759cfc5fc73ad05	0ecb1bbbeb16e36a2ea7a5ce525c6c59ef74312b	2023-05-27T18:47:55+03:00	Henri Vasserman	Add documentation about CLBlast (#1604)
M	README.md

commit	0ecb1bbbeb16e36a2ea7a5ce525c6c59ef74312b	93618031c7ccdd949d976370f24953d261048575	2023-05-27T17:24:06+03:00	Henri Vasserman	[CI] Fix openblas (#1613)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	93618031c7ccdd949d976370f24953d261048575	83c54e6da58f1970556741b143bd26e30b1f46af	2023-05-27T16:19:56+03:00	Georgi Gerganov	ggml : add ggml_tensor_overhead()
M	ggml.c
M	ggml.h

commit	83c54e6da58f1970556741b143bd26e30b1f46af	bdbda1b17afb78e8613d03c8210a57fac632397b	2023-05-27T15:18:25+03:00	Henri Vasserman	[CI] CLBlast: Fix directory name (#1606)
M	.github/workflows/build.yml

commit	bdbda1b17afb78e8613d03c8210a57fac632397b	66874d4fbcc7866377246efbcee938e8cc9c7d76	2023-05-27T12:22:05+03:00	Georgi Gerganov	ggml : sync ggml core (minor additions, e.g. ggml_get_tensor_by_name())
M	ggml.c
M	ggml.h

commit	66874d4fbcc7866377246efbcee938e8cc9c7d76	1fcdcc28b119a6608774d52de905931bd5f8a43d	2023-05-25T20:18:01-06:00	Kerfuffle	Some improvements to loading the session with --prompt-cache (#1550)
M	examples/main/README.md
M	examples/main/main.cpp

commit	1fcdcc28b119a6608774d52de905931bd5f8a43d	ac7876ac20124a15a44fd6317721ff1aa2538806	2023-05-25T23:07:29+02:00	Johannes Gäßler	cuda : performance optimizations (#1530)
M	CMakeLists.txt
M	Makefile
M	ggml-cuda.cu

commit	ac7876ac20124a15a44fd6317721ff1aa2538806	c31bbe934b9666af42f32ce12d32cae9160e5dc4	2023-05-24T10:30:09+03:00	Henri Vasserman	Update CLBlast to 1.6.0 (#1580)
M	.github/workflows/build.yml

commit	c31bbe934b9666af42f32ce12d32cae9160e5dc4	1359b6aba55d5b0410f6adaa0aa2e49bbfd01d84	2023-05-24T02:24:01-04:00	Evan Jones	readme : add docs for chat-persistent.sh (#1568)
M	README.md

commit	1359b6aba55d5b0410f6adaa0aa2e49bbfd01d84	7d873811f31d4d8c909015c946a862c0089cda7d	2023-05-24T06:16:22Z	Senemu	chat-persistent.sh : use bracket expressions in grep (#1564)
M	examples/chat-persistent.sh

commit	7d873811f31d4d8c909015c946a862c0089cda7d	2e6cd4b02549e343bef3768e6b946f999c82e823	2023-05-23T18:01:15+02:00	Maarten ter Huurne	Fix handling of "invalid property" when creating OpenCL command queue (#1565)
M	ggml-opencl.cpp

commit	2e6cd4b02549e343bef3768e6b946f999c82e823	7e4ea5beff567f53be92f75f9089e6f11fa5dabd	2023-05-22T23:33:24+02:00	0cc4m	OpenCL Token Generation Acceleration (#1459)
M	CMakeLists.txt
M	Makefile
D	ggml-opencl.c
A	ggml-opencl.cpp
M	ggml-opencl.h
M	ggml.c
M	ggml.h
M	llama.cpp

commit	7e4ea5beff567f53be92f75f9089e6f11fa5dabd	7780e4f479dc5af106287c164b8e186cd9b6215c	2023-05-21T11:51:18-06:00	Steward Garcia	examples : add server example with REST API (#1443)
M	CMakeLists.txt
M	examples/CMakeLists.txt
A	examples/server/CMakeLists.txt
A	examples/server/README.md
A	examples/server/httplib.h
A	examples/server/json.hpp
A	examples/server/server.cpp

commit	7780e4f479dc5af106287c164b8e186cd9b6215c	265db9834e761b7c8210ea1888117efcd3262f52	2023-05-21T16:03:44+02:00	Stefan Sydow	make : .PHONY clean (#1553)
M	Makefile

commit	265db9834e761b7c8210ea1888117efcd3262f52	fab49c685e09d95942de34e3eadd72f880de21d5	2023-05-21T11:56:23+03:00	Georgi Gerganov	ggml : output 3d sizes in ggml_graph_dump_dot()
M	ggml.c

commit	fab49c685e09d95942de34e3eadd72f880de21d5	b8ee340abe4a46143eb8cc4a135b976856c9136c	2023-05-20T20:00:41+03:00	Georgi Gerganov	ggml : update WASM SIMD
M	ggml.c

commit	b8ee340abe4a46143eb8cc4a135b976856c9136c	9ecb30f9594f222d8318fb1e803a4c363b0c39e5	2023-05-20T23:58:31+09:00	Zenix	feature : support blis and other blas implementation  (#1536)
M	.github/workflows/build.yml
A	BLIS.md
M	CMakeLists.txt
M	Makefile
M	README.md

commit	9ecb30f9594f222d8318fb1e803a4c363b0c39e5	29cf5596fe0c37213f9b74e80d8f631193a93f0f	2023-05-20T17:57:39+03:00	Henri Vasserman	OpenCL: Fixes for older devices. (#1435)
M	ggml-opencl.c

commit	29cf5596fe0c37213f9b74e80d8f631193a93f0f	3de84b26066d95068409c1dc79bcc41c1eea2a03	2023-05-20T15:58:15+03:00	Juuso Alasuutari	llama : define magic numbers as integer constants (#1518) (#1520)
M	llama.cpp
M	llama.h

commit	3de84b26066d95068409c1dc79bcc41c1eea2a03	affc76edfdefa7b326f526e463cc65ff13fcfb92	2023-05-20T15:34:45+03:00	Georgi Gerganov	ggml : add ggml_clamp() (#1539)
M	ggml.c
M	ggml.h

commit	affc76edfdefa7b326f526e463cc65ff13fcfb92	ea600071cb005267e9e8f2629c1e406dd5fde083	2023-05-20T14:19:28+02:00	Johannes Gäßler	cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	llama-util.h
M	llama.cpp

commit	ea600071cb005267e9e8f2629c1e406dd5fde083	07e9ace0f9da424d82e75df969642522880feb92	2023-05-20T12:03:48+03:00	Georgi Gerganov	Revert "feature : add blis and other BLAS implementation support (#1502)"
D	BLIS.md
M	CMakeLists.txt
M	Makefile
M	README.md

commit	07e9ace0f9da424d82e75df969642522880feb92	ec2e10c4443209da56b431b24dd0845b60e757fb	2023-05-20T18:02:48+09:00	Zenix	feature : add blis and other BLAS implementation support (#1502)
A	BLIS.md
M	CMakeLists.txt
M	Makefile
M	README.md

commit	ec2e10c4443209da56b431b24dd0845b60e757fb	d2c59b8ba498ab01e65203dde6fe95236d20f6e7	2023-05-20T11:06:11+03:00	Georgi Gerganov	llama : add llama_init_backend() API (close #1527)
M	examples/benchmark/benchmark-matmult.cpp
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	llama.cpp
M	llama.h

commit	d2c59b8ba498ab01e65203dde6fe95236d20f6e7	503db28849d8641d66244385e7e9649608a2e4d0	2023-05-20T00:40:02-07:00	DannyDaemonic	Fix for mingw (#1462)
M	examples/common.cpp

commit	503db28849d8641d66244385e7e9649608a2e4d0	8a203f9fa1b24e010be8f35ebbbd6786293684cb	2023-05-20T09:22:37+02:00	Maxime	llama : fix name shadowing and C4146 (#1526)
M	ggml.c
M	llama-util.h
M	llama.cpp

commit	8a203f9fa1b24e010be8f35ebbbd6786293684cb	4fd3e29297e3246a7be291932c115636fadb0f52	2023-05-20T10:14:31+03:00	Georgi Gerganov	llama : fix compile warnings in llama_set_state_data()
M	llama.cpp
M	llama.h

commit	4fd3e29297e3246a7be291932c115636fadb0f52	2d5db48371052087a83974abda3767d1aedec598	2023-05-20T10:13:19+03:00	Georgi Gerganov	ggml : fix scalar implementation of Q4_1 dot
M	ggml.c

commit	2d5db48371052087a83974abda3767d1aedec598	6986c7835adc13ba3f9d933b95671bb1f3984dc6	2023-05-19T22:17:18+03:00	Georgi Gerganov	ggml : use F16 instead of F32 in Q4_0, Q4_1, Q8_0 (#1508)
M	README.md
M	ggml-cuda.cu
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	6986c7835adc13ba3f9d933b95671bb1f3984dc6	943e6081cc939df7584f8f0ab7057a39c2ef3271	2023-05-19T21:17:28+03:00	Georgi Gerganov	tests : add missing header
M	tests/test-sampling.cpp

commit	943e6081cc939df7584f8f0ab7057a39c2ef3271	7694b52b9a206b93d59139c3c7c9b55da0f5aa59	2023-05-19T13:39:51-04:00	Evan Jones	examples : add persistent chat (#1495)
A	examples/chat-persistent.sh

commit	7694b52b9a206b93d59139c3c7c9b55da0f5aa59	79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4	2023-05-19T10:24:59-07:00	Jason McCartney	main : make reverse prompt option act as a stop token in non-interactive mode (#1032)
M	examples/common.cpp
M	examples/main/main.cpp

commit	79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4	4b7e245adf63db675c3daab4a9bfddd451ef4097	2023-05-19T13:16:30-04:00	David Kennedy	readme : adds WizardLM to the list of supported models (#1485)
M	README.md

commit	4b7e245adf63db675c3daab4a9bfddd451ef4097	5ea43392731040b454c293123839b90e159cbb99	2023-05-19T20:14:51+03:00	Georgi Gerganov	minor : fix compile warnings
M	examples/common.cpp
M	examples/common.h
M	llama.cpp
M	tests/test-sampling.cpp

commit	5ea43392731040b454c293123839b90e159cbb99	ee9654138ab0ae5f138f4abddf56ca234ea3c352	2023-05-18T19:31:01+02:00	Erik Scholz	make kv_f16 the default for api users (#1517)
M	llama.cpp

commit	ee9654138ab0ae5f138f4abddf56ca234ea3c352	dc271c52ed65e7c8dfcbaaf84dabb1f788e4f3d0	2023-05-18T10:30:40-07:00	DannyDaemonic	Fixes #1511 lambda issue for w64devkit (mingw) (#1513)
M	examples/main/main.cpp

commit	dc271c52ed65e7c8dfcbaaf84dabb1f788e4f3d0	c238b5873a1ea496db03ffcfe124c9d0d83afbc6	2023-05-17T22:12:01Z	Stephan Walter	Remove unused n_parts parameter (#1509)
M	examples/common.cpp
M	examples/common.h
M	examples/quantize-stats/quantize-stats.cpp
M	examples/save-load-state/save-load-state.cpp
M	llama.cpp
M	llama.h

commit	c238b5873a1ea496db03ffcfe124c9d0d83afbc6	2b2646931bd2a2eb3e21c6f3733cc0e090b2e24b	2023-05-17T22:47:58+08:00	rankaiyx	benchmark-matmul: Print the average of the test results (#1490)
M	examples/benchmark/benchmark-matmult.cpp

commit	2b2646931bd2a2eb3e21c6f3733cc0e090b2e24b	42627421ece816e632e6a0d757fa75150c687f87	2023-05-16T23:04:35+01:00	Tom Jobbins	convert.py: Support models which are stored in a single pytorch_model.bin (#1469)
M	convert.py

commit	42627421ece816e632e6a0d757fa75150c687f87	9560655409dc80771a9b19e838ff47c5c1df6483	2023-05-17T01:36:47+07:00	Ilya Kurdyukov	~7% faster Q5_1 AVX2 code (#1477)
M	ggml.c

commit	9560655409dc80771a9b19e838ff47c5c1df6483	2a5ee023ad3022bc0b505343394b9754587fb731	2023-05-16T16:46:34+01:00	András Salamon	define default model path once, sync path with readme (#1366)
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/save-load-state/save-load-state.cpp

commit	2a5ee023ad3022bc0b505343394b9754587fb731	63d20469b85467c5729cc9a97bd44cc3da63423f	2023-05-16T14:00:15+05:30	sandyiscool	Add alternate include path for openblas (#1476)
M	Makefile

commit	63d20469b85467c5729cc9a97bd44cc3da63423f	b5c9295eef2b56e307393b35b3a923e3518d226e	2023-05-14T22:25:42-04:00	zrm	fix get_num_physical_cores() (#1436)
M	examples/common.cpp

commit	b5c9295eef2b56e307393b35b3a923e3518d226e	eb363627fda5f47de8ab5e9be8abd426049d00df	2023-05-14T22:46:00+02:00	slaren	benchmark-matmul: fix clang-tidy issues, report results in GFLOPS (#1458)
M	examples/benchmark/benchmark-matmult.cpp

commit	eb363627fda5f47de8ab5e9be8abd426049d00df	79b2d5b69d80be0bf29312fb9a95854876b0a8a5	2023-05-14T20:53:23+02:00	Johannes Gäßler	cuda : deduplicated dequantization code (#1453)
M	ggml-cuda.cu

commit	79b2d5b69d80be0bf29312fb9a95854876b0a8a5	13c351ad7292c5b5ab35db25c7a4f993e75d9cfd	2023-05-14T17:55:02+02:00	xaedes	ggml : alternative fix for race condition bug in non-inplace ggml_compute_forward_diag_mask_f32 (#1454)
M	ggml.c

commit	13c351ad7292c5b5ab35db25c7a4f993e75d9cfd	60f8c361ca26328ef8523dfb08077fe2f1034490	2023-05-14T18:22:50+03:00	Georgi Gerganov	ggml : various fixes (#1450)
M	ggml.c
M	ggml.h

commit	60f8c361ca26328ef8523dfb08077fe2f1034490	601a033475645370483973817d987928ea95f36c	2023-05-14T19:03:51+09:00	katsu560	ggml : add AVX support based on AVX2 code (#1430)
M	ggml.c

commit	601a033475645370483973817d987928ea95f36c	08737ef720f0510c7ec2aa84d7f70c691073c35d	2023-05-14T10:20:19+03:00	Georgi Gerganov	ggml : add GGML_QNT_VERSION to track quantization format changes
M	ggml.h

commit	08737ef720f0510c7ec2aa84d7f70c691073c35d	bda4d7c215aa16b2a78e522521dfc0e1c2e8b194	2023-05-13T17:40:58+03:00	Georgi Gerganov	cuda : fix convert function (#1412)
M	ggml-cuda.cu

commit	bda4d7c215aa16b2a78e522521dfc0e1c2e8b194	5a5aeb1e91009c72bf816400b758bb8a305616d7	2023-05-13T17:25:09+03:00	Georgi Gerganov	make : fix PERF build with cuBLAS
M	Makefile

commit	5a5aeb1e91009c72bf816400b758bb8a305616d7	66841fdb0eaf0cc210757cc7f683d0f4eebadc21	2023-05-13T16:55:14+03:00	Georgi Gerganov	llama : fix unused warning
M	llama.cpp

commit	66841fdb0eaf0cc210757cc7f683d0f4eebadc21	905d87b70aa189623d500a28602d7a3a755a4769	2023-05-13T16:48:03+03:00	Georgi Gerganov	ggml : multi-thread mul and diag_mask ops (#1428)
M	ggml.c

commit	905d87b70aa189623d500a28602d7a3a755a4769	f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b	2023-05-13T15:38:36+02:00	Johannes Gäßler	ggml : GPU-accelerated token generation (#1412)
M	examples/common.cpp
M	examples/common.h
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b	f048af0230ad5381bb20b9e3c1467ec6fc7debdf	2023-05-13T14:56:40+02:00	xaedes	ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
M	examples/CMakeLists.txt
A	examples/baby-llama/CMakeLists.txt
A	examples/baby-llama/baby-llama.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	tests/CMakeLists.txt
A	tests/test-grad0.c
A	tests/test-opt.c

commit	f048af0230ad5381bb20b9e3c1467ec6fc7debdf	ac0cd259d54be7e45ffa2c7b2508812cf4f83ccf	2023-05-13T11:54:33+03:00	Georgi Gerganov	ggml : sync alibi fix from ggml repo
M	ggml.c

commit	ac0cd259d54be7e45ffa2c7b2508812cf4f83ccf	0cd22e190aeaef867fa5db025b4d274f2fcfdcf6	2023-05-13T10:43:33+02:00	3ooabkhxtn	Adding SSE instructions to ggml_vec_dot_q4_0_q8_0 (#1413)
M	ggml.c

commit	0cd22e190aeaef867fa5db025b4d274f2fcfdcf6	6456a4eb9f9c1f4de8f6908ef100daa78802ad00	2023-05-13T11:23:15+03:00	Georgi Gerganov	llama : fix various warnings
M	.gitignore
M	llama.cpp

commit	6456a4eb9f9c1f4de8f6908ef100daa78802ad00	cdd5350892b1d4e521e930c77341f858fcfcd433	2023-05-13T15:24:20+08:00	Rinne	embedding : remove unused code (#1426)
M	examples/embedding/embedding.cpp

commit	cdd5350892b1d4e521e930c77341f858fcfcd433	738ace394a6f8cf0174e90a97185d9e512c0e200	2023-05-13T09:12:44+03:00	Georgi Gerganov	readme : update Q4_0 perplexities
M	README.md

commit	738ace394a6f8cf0174e90a97185d9e512c0e200	699b1ad7fe6f7b9e41d3cb41e61a8cc3ea5fc6b5	2023-05-13T09:08:52+03:00	Georgi Gerganov	llama : free ggml context in set / copy state data (close #1425)
M	llama.cpp
M	llama.h

commit	699b1ad7fe6f7b9e41d3cb41e61a8cc3ea5fc6b5	fb62f924336c9746da9976c6ab3c2e6460258d54	2023-05-13T09:01:15+03:00	Henri Vasserman	opencl : fix kernels for the new formats (#1422)
M	ggml-opencl.c

commit	fb62f924336c9746da9976c6ab3c2e6460258d54	773ee249fb6c14f791ac39f6ec05536f40dedc54	2023-05-12T21:44:20+03:00	Georgi Gerganov	llama : fix --mtest option (close #1414)
M	examples/main/main.cpp

commit	773ee249fb6c14f791ac39f6ec05536f40dedc54	553fd4d4b5f3314f338be8006f62a4fdf7670186	2023-05-12T16:34:55+02:00	Johannes Gäßler	CLI args use - instead of _, backwards compatible (#1416)
M	examples/common.cpp

commit	553fd4d4b5f3314f338be8006f62a4fdf7670186	089b1c93ba2b93bc9a605af293730a028fad2c4e	2023-05-12T15:40:53+02:00	slaren	Add clang-tidy reviews to CI (#1407)
A	.clang-tidy
A	.github/workflows/tidy-post.yml
A	.github/workflows/tidy-review.yml

commit	089b1c93ba2b93bc9a605af293730a028fad2c4e	b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1	2023-05-12T13:39:40+08:00	Rinne	readme : add C#/.NET bindings repo (#1409)
M	README.md

commit	b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1	b608b55a3ea8e4760c617418538465449175bdb8	2023-05-12T00:23:08+03:00	Georgi Gerganov	ggml : remove bit shuffling (#1405)
M	.gitignore
M	README.md
M	SHA256SUMS
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-opencl.c
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
A	scripts/perf-run-all.sh
M	scripts/ppl-run-all.sh

commit	b608b55a3ea8e4760c617418538465449175bdb8	cf348a60e0af3905acd1d297cb064b918265b7ac	2023-05-11T10:10:19-05:00	CRD716	prompts : model agnostic DAN (#1304)
A	prompts/dan-modified.txt
M	prompts/dan.txt

commit	cf348a60e0af3905acd1d297cb064b918265b7ac	e6a46b0ed1884c77267dc70693183e3b7164e0e0	2023-05-10T11:37:14-04:00	Evan Jones	main : add option to save full output to session (#1338)
M	examples/common.cpp
M	examples/common.h
M	examples/main/README.md
M	examples/main/main.cpp

commit	e6a46b0ed1884c77267dc70693183e3b7164e0e0	9f8dbc4787f32cd9c13b5c647d497d13c1a06db2	2023-05-09T10:53:28-07:00	DannyDaemonic	Locale fix for Windows (#1379)
M	examples/common.cpp

commit	9f8dbc4787f32cd9c13b5c647d497d13c1a06db2	41654efea879bbdf4fd794e13335929d4cf0eb90	2023-05-09T15:29:20+03:00	Sami Farin	use pause asm insn in busyloop to run the CPU (13600K) 10 °C cooler (#1314)
M	ggml.c

commit	41654efea879bbdf4fd794e13335929d4cf0eb90	56551bc11f46b2716fdf61bb48ac28414889dc0a	2023-05-08T19:45:48-07:00	DannyDaemonic	Interface improvements and `--multiline-input` (previously `--author-mode`) (#1040)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	56551bc11f46b2716fdf61bb48ac28414889dc0a	fe60904eef4b504685fa0406cb19864ae619fb4f	2023-05-08T22:52:18+03:00	Georgi Gerganov	readme : add notice about upcoming breaking change
M	README.md

commit	fe60904eef4b504685fa0406cb19864ae619fb4f	003ba2fb4309e2339487564bd249e4fcc8d7ea01	2023-05-08T21:03:30+04:30	AlpinDale	readme : add TOC and Pygmalion instructions (#1359)
M	README.md

commit	003ba2fb4309e2339487564bd249e4fcc8d7ea01	f9a6364912fd0463fddfdbc9ef9f79fdc281570d	2023-05-08T16:48:21+02:00	Pavol Rusnak	llama : fix hparams shadow (#1367)
M	llama.cpp

commit	f9a6364912fd0463fddfdbc9ef9f79fdc281570d	95078cc554fe03d4512363c7e4dec963f0047c72	2023-05-08T17:41:54+03:00	Georgi Gerganov	llama : require first token to be BOS (#1303)
M	.gitignore
M	README.md
M	examples/common.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp
A	scripts/ppl-run-all.sh

commit	95078cc554fe03d4512363c7e4dec963f0047c72	1f48b0abcfbd6cc99571e42348e0ec97e4be8b93	2023-05-08T04:54:26-07:00	ubik2	convert: add ability to convert safetensors files (#1276)
M	convert.py

commit	1f48b0abcfbd6cc99571e42348e0ec97e4be8b93	e1295513a48ae8254d8af5ec0250b56d6eaffefd	2023-05-08T02:42:01+02:00	Johannes Gäßler	Documented CUDA reproducibility, added warning (#1346)
M	README.md
M	examples/common.cpp
M	ggml-cuda.cu

commit	e1295513a48ae8254d8af5ec0250b56d6eaffefd	1b0fd454650ef4d68a980e3225488b79e6e9af25	2023-05-07T14:20:09+03:00	Henri Vasserman	CI: add Windows CLBlast and OpenBLAS builds (#1277)
M	.github/workflows/build.yml

commit	1b0fd454650ef4d68a980e3225488b79e6e9af25	3924088512d9e12e90ed6dbf28a6c5712481d33e	2023-05-07T10:03:23+07:00	swittk	ggml : Allow usage of CLBlast alongside Accelerate.framework (#1336)
M	ggml.c

commit	3924088512d9e12e90ed6dbf28a6c5712481d33e	173d0e6419e8f8f3c1f4f13201b777f4c60629f3	2023-05-06T17:01:47-04:00	Jed Fox	Remove default arguments from sampling functions (#1343)
M	.gitignore
M	examples/main/main.cpp
M	llama.cpp
M	llama.h
M	tests/test-sampling.cpp

commit	173d0e6419e8f8f3c1f4f13201b777f4c60629f3	a3b85b28da84c67c3406807aef5e0457bcc4b00f	2023-05-05T23:57:14+02:00	DaniAndTheWeb	makefile: automatic Arch Linux detection (#1332)
M	Makefile
M	README.md

commit	a3b85b28da84c67c3406807aef5e0457bcc4b00f	921dcee00a55d9aba3b3026d0509d31ac8386e2a	2023-05-05T22:56:09+02:00	Erik Scholz	ci : add cublas to windows release (#1271)
M	.github/workflows/build.yml

commit	921dcee00a55d9aba3b3026d0509d31ac8386e2a	2d13786e91ec9fd28ddf737053822042a824da78	2023-05-05T16:43:36+02:00	Pavol Rusnak	readme: add missing info (#1324)
M	README.md

commit	2d13786e91ec9fd28ddf737053822042a824da78	a90e96b266873ebb5e947c9864b12193bdada0fb	2023-05-05T08:18:21-04:00	Ionoclast Laboratories	Fix for OpenCL / clbast builds on macOS. (#1329)
M	Makefile

commit	a90e96b266873ebb5e947c9864b12193bdada0fb	94c5652fc0f4d04ac54412c4d81e2ebcdafb6ede	2023-05-05T02:17:07+02:00	Benjamin Lecaillon	Convert.py @staticmethod (#1327)
M	convert.py

commit	94c5652fc0f4d04ac54412c4d81e2ebcdafb6ede	34d9f22f44c42d345cc72c8f3aa4cb71c5df0acb	2023-05-05T00:58:56+02:00	slaren	quantize: make output filename optional, default to ggml-model-<ftype>.bin (#1301)
M	examples/quantize/quantize.cpp

commit	34d9f22f44c42d345cc72c8f3aa4cb71c5df0acb	d3e8093e9b5845514b049ede3b12728c8f013eba	2023-05-04T19:56:27+03:00	Ivan Stepanov	Wrap exceptions in std::exception to verbose output on exception. (#1316)
M	llama-util.h

commit	d3e8093e9b5845514b049ede3b12728c8f013eba	360cfe5bec852805b84eec799102fc6f45df9fef	2023-05-04T19:54:37+03:00	Ivan Stepanov	convert: support DT_BF16 tensors (#1309)
M	convert.py

commit	360cfe5bec852805b84eec799102fc6f45df9fef	2edbdb0f99336cb41f0995061c7602ed54beb863	2023-05-05T00:33:31+08:00	44670	readme : add OpenBuddy link (#1321)
M	README.md

commit	2edbdb0f99336cb41f0995061c7602ed54beb863	20fbf2a2a08d8edefe9b3435fa86f8b2f63f8588	2023-05-04T23:41:12+08:00	44670	main : add --in-suffix option (#1318)
M	examples/common.cpp
M	examples/common.h
M	examples/main/README.md
M	examples/main/main.cpp

commit	20fbf2a2a08d8edefe9b3435fa86f8b2f63f8588	db1080876a62ec3bb4119d90b16e7dce7594b733	2023-05-04T11:05:59-04:00	Ron Jailall	ggml : change immintrin.h to intrin.h for compatibility (#1307)
M	ggml.c

commit	db1080876a62ec3bb4119d90b16e7dce7594b733	c65a7fbfa9c736416a25369cc05d356789df4c15	2023-05-04T05:08:25-07:00	DannyDaemonic	Only escape prompts when used with `-e` (#1311)
M	examples/common.cpp
M	examples/main/README.md

commit	c65a7fbfa9c736416a25369cc05d356789df4c15	f647ce040ff06348d2ceaa5443a6a7a8b80c70c9	2023-05-04T03:02:59-07:00	DannyDaemonic	Update main's README.md with new features (#1296)
M	examples/main/README.md

commit	f647ce040ff06348d2ceaa5443a6a7a8b80c70c9	799fdc1b5d888b8a8682baf112e1c2a2df0df1c4	2023-05-04T17:02:30+07:00	Tomas	fix #1224 reverse prompt and multi line (#1297)
M	examples/main/main.cpp

commit	799fdc1b5d888b8a8682baf112e1c2a2df0df1c4	6daa09d87926fe654385c2887e39ec3eeaa58120	2023-05-03T23:24:20+03:00	Georgi Gerganov	ggml : vectorize Q8_0 quantization
M	ggml.c

commit	6daa09d87926fe654385c2887e39ec3eeaa58120	bca9ad938a2a43621cf406d993b755cc91728dd5	2023-05-03T10:58:11-07:00	khimaros	examples : read chat prompts from a template file (#1196)
M	examples/chat-13B.sh
A	prompts/chat-with-vicuna-v0.txt
A	prompts/chat-with-vicuna-v1.txt
A	prompts/chat.txt

commit	bca9ad938a2a43621cf406d993b755cc91728dd5	e2a937ca6abadc7e01e139db31e6db9dce16e3e9	2023-05-03T20:09:42+03:00	Georgi Gerganov	minor : fix whitespaces (#1302)
M	README.md
M	scripts/verify-checksum-models.py

commit	e2a937ca6abadc7e01e139db31e6db9dce16e3e9	b0c71c7b6dc0c0adb507d78f401e95e7ab0f5a38	2023-05-03T18:43:23+03:00	Georgi Gerganov	minor : fix trailing whitespaces
M	scripts/verify-checksum-models.py

commit	b0c71c7b6dc0c0adb507d78f401e95e7ab0f5a38	a8a2efdc8161d4f69a0dd863e741c11fbd5df85c	2023-05-03T17:31:28+02:00	KASR	scripts : platform independent script to verify sha256 checksums (#1203)
M	README.md
A	scripts/verify-checksum-models.py

commit	a8a2efdc8161d4f69a0dd863e741c11fbd5df85c	e216aa04633892b972d013719e38b59fd4917341	2023-05-03T10:26:47-05:00	CRD716	examples : various prompt and example fixes (#1298)
M	examples/Miku.sh
M	examples/chat-13B.sh
M	prompts/dan.txt

commit	e216aa04633892b972d013719e38b59fd4917341	2485d7a4d39406cd0f468e35551b472cceb5bd61	2023-05-02T22:26:13-04:00	Evan Jones	llama : only copy used KV cache in get / set state (#1272)
M	llama.cpp
M	llama.h

commit	2485d7a4d39406cd0f468e35551b472cceb5bd61	13b0c68ed7a9948db0720f7393df094ab1005b14	2023-05-02T18:46:20-07:00	DannyDaemonic	Process escape sequences given in prompts (#1173)
M	examples/common.cpp

commit	13b0c68ed7a9948db0720f7393df094ab1005b14	55bc5f0900d925c539488901c5538b637d68665c	2023-05-02T18:01:57-07:00	DannyDaemonic	Handle signals properly on Windows (#1123)
M	examples/main/main.cpp

commit	55bc5f0900d925c539488901c5538b637d68665c	9daff419f6be818595ddbea293a0ea7283af726e	2023-05-02T17:52:35-07:00	DannyDaemonic	Call sh on build-info.sh (#1294)
M	Makefile

commit	9daff419f6be818595ddbea293a0ea7283af726e	bf4b22ffe433dc5e2fba7588c4485a7e51b1a30d	2023-05-03T03:43:43+03:00	kuvaus	fix build-info.h for git submodules (#1289)
M	CMakeLists.txt
M	scripts/build-info.cmake
A	scripts/build-info.h.in

commit	bf4b22ffe433dc5e2fba7588c4485a7e51b1a30d	67c77799e025a8425c23a6a0599c007f46ded590	2023-05-03T01:36:45+02:00	slaren	fix missing parameters in `llama_init_from_gpt_params` (#1293)
M	examples/common.cpp

commit	67c77799e025a8425c23a6a0599c007f46ded590	0e6cbff1b7509628c588e661166f6e187137734d	2023-05-02T22:39:51+02:00	Ron Evans	examples : add llama_init_from_gpt_params() common function (#1290)
M	examples/common.cpp
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp

commit	0e6cbff1b7509628c588e661166f6e187137734d	5d5817ca603d4cb451bed26594aa3dcd93f4ec56	2023-05-02T23:09:08+03:00	Georgi Gerganov	llama : fix compile warnings
M	examples/benchmark/benchmark-matmult.cpp
M	llama.cpp
M	llama.h
M	tests/test-sampling.cpp

commit	5d5817ca603d4cb451bed26594aa3dcd93f4ec56	8c9be35ff998cbb4178b0fedcb9afd85cb6852e2	2023-05-02T22:14:50+03:00	Georgi Gerganov	ggml : fix 32-bit ARM
M	ggml.c

commit	8c9be35ff998cbb4178b0fedcb9afd85cb6852e2	cc0bb7235c72e50a621800e366d0e4fe315f0e11	2023-05-02T19:53:52+02:00	Ron Evans	examples : improve vertical alignment of a few variables (#1286)
M	examples/main/main.cpp

commit	cc0bb7235c72e50a621800e366d0e4fe315f0e11	2bb992f034689e2ddd7b9ac05163b0359a5957b3	2023-05-02T18:42:16+02:00	Marvin Gießing	ggml : fix ppc64le build error and make cmake detect Power processors (#1284)
M	CMakeLists.txt
M	ggml.c

commit	2bb992f034689e2ddd7b9ac05163b0359a5957b3	e2cd5069999181a9e4a22cf420e0491878b3062f	2023-05-02T12:23:44-04:00	Robert Brisita	llama : allow 0 as a seed number. (#1275)
M	examples/common.cpp
M	examples/embedding/embedding.cpp
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp
M	llama.h

commit	e2cd5069999181a9e4a22cf420e0491878b3062f	2d099e5193d73f800b646c39e2fad08c1c1f1096	2023-05-02T18:13:26+02:00	Ron Evans	main : switch input_noecho to input_echo to remove negation (#979)
M	examples/main/main.cpp

commit	2d099e5193d73f800b646c39e2fad08c1c1f1096	f4cef87edfd1b2f8d5befd4fde54ca2e03987bea	2023-05-02T16:03:00+02:00	slaren	ggml: add names to tensors (#1268)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	f4cef87edfd1b2f8d5befd4fde54ca2e03987bea	58b367c2d757c0ea12aec672382462b42204c724	2023-05-01T09:23:47-07:00	DannyDaemonic	Add git-based build information for better issue tracking (#1232)
M	.gitignore
M	CMakeLists.txt
M	Makefile
M	examples/benchmark/CMakeLists.txt
M	examples/benchmark/benchmark-matmult.cpp
M	examples/embedding/CMakeLists.txt
M	examples/embedding/embedding.cpp
M	examples/main/CMakeLists.txt
M	examples/main/main.cpp
M	examples/perplexity/CMakeLists.txt
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/CMakeLists.txt
M	examples/quantize/quantize.cpp
M	examples/save-load-state/CMakeLists.txt
M	examples/save-load-state/save-load-state.cpp
A	scripts/build-info.cmake
A	scripts/build-info.sh

commit	58b367c2d757c0ea12aec672382462b42204c724	ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae	2023-05-01T18:11:07+02:00	slaren	cuBLAS: refactor and optimize f16 mat mul performance (#1259)
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	ggml.h

commit	ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae	2bdc09646d8c6cb74a6f573e9081586b4b83b9d1	2023-05-01T08:58:51-04:00	xloem	llama : update stubs for systems without mmap and mlock (#1266)
M	llama-util.h

commit	2bdc09646d8c6cb74a6f573e9081586b4b83b9d1	70269cae37538461ff816e714afbb3ebcdcdc26b	2023-05-01T05:56:07-06:00	Kerfuffle	ggml : fix ggml_used_mem() (#1264)
M	ggml.c

commit	70269cae37538461ff816e714afbb3ebcdcdc26b	b925f1f1b082319ee69943f8d1a83ac9b6ff09ca	2023-05-01T14:54:59+03:00	Georgi Gerganov	llama : fix session load / save (#1263)
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	b925f1f1b082319ee69943f8d1a83ac9b6ff09ca	90b19bd6eee943832584f9cac0b6f9ea29cc42a4	2023-05-01T13:32:22+02:00	slaren	cuBLAS: fall back to pageable memory if pinned alloc fails (#1233)
M	ggml-cuda.cu
M	llama-util.h
M	llama.cpp

commit	90b19bd6eee943832584f9cac0b6f9ea29cc42a4	7ff0dcd32091c703a12adb0c57c32c565ce17664	2023-05-01T00:24:20-07:00	Alex Klinkhamer	llama : let context be const when accessing const data (#1261)
M	llama.cpp
M	llama.h

commit	7ff0dcd32091c703a12adb0c57c32c565ce17664	6f796992869f306c48484d62a39f2a181ae2fd6f	2023-04-30T22:28:51+03:00	Georgi Gerganov	ggml : fix UB (int << 31)
M	ggml.c

commit	6f796992869f306c48484d62a39f2a181ae2fd6f	a5d30b1f53677cb50791fec41c43e93274347303	2023-04-30T20:48:38+02:00	Pavol Rusnak	build: add armv{6,7,8} support to cmake (#1251)
M	CMakeLists.txt
M	Makefile

commit	a5d30b1f53677cb50791fec41c43e93274347303	76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c	2023-04-30T14:41:35-04:00	jon-chuang	common : better default number of threads (#934)
M	examples/common.cpp
M	examples/common.h

commit	76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c	6bc4400e67e6bc4faad3ad3d5e9d8a6576a9752d	2023-04-30T20:34:52+02:00	0cc4m	ggml : add CLBlast q5_0, q5_1, q8_0 dequant kernels (#1225)
D	ggml-opencl-dequant.cl
M	ggml-opencl.c

commit	6bc4400e67e6bc4faad3ad3d5e9d8a6576a9752d	f0d70f147d969e41fa410b8af2965a27aa901eb9	2023-04-30T19:07:00+03:00	Georgi Gerganov	ggml : add Q5 WASM SIMD + GGML_FTYPE
M	ggml.c
M	ggml.h

commit	f0d70f147d969e41fa410b8af2965a27aa901eb9	3e5aa8a1c44051153d6d7b3eeca2f4b4e5fb310c	2023-04-30T12:32:37Z	Stephan Walter	Various fixes to mat_mul benchmark (#1253)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/benchmark/CMakeLists.txt
R092	examples/benchmark/benchmark-q4_0-matmult.c	examples/benchmark/benchmark-matmult.cpp

commit	3e5aa8a1c44051153d6d7b3eeca2f4b4e5fb310c	c3ca7a5f0546c561eb278be3f2fe335795679e01	2023-04-30T10:25:46+03:00	Georgi Gerganov	ggml : fix labels for GGML_OP_ALIBI
M	ggml.c

commit	c3ca7a5f0546c561eb278be3f2fe335795679e01	e8c051611abfc9a7f37fd4bba48217180893bd68	2023-04-29T21:34:23+03:00	Georgi Gerganov	ggml : fix 32-bit ARM NEON
M	ggml.c

commit	e8c051611abfc9a7f37fd4bba48217180893bd68	0b5a9350993e6fc8be45dc2a3eafc1fd0812d392	2023-04-29T21:12:56+03:00	Georgi Gerganov	ggml : use vzip instead of vuzp for consistency
M	ggml.c

commit	0b5a9350993e6fc8be45dc2a3eafc1fd0812d392	ec728e44d7488c2da3560970317708b2b12b9c04	2023-04-29T19:28:36+03:00	Georgi Gerganov	ggml : fix visibility and unused warnings
M	ggml.c
M	ggml.h

commit	ec728e44d7488c2da3560970317708b2b12b9c04	214b6a35702a489e3738acd81fad6d46182d3036	2023-04-29T18:43:42+03:00	Georgi Gerganov	ggml : fix #if for f32_f32 mul_mat (CLBlast) (#1229)
M	ggml.c

commit	214b6a35702a489e3738acd81fad6d46182d3036	305eb5afd51325e3142c01c17431febb7c67de87	2023-04-29T18:43:28+03:00	Georgi Gerganov	ggml : adjust mul_mat_f16 work memory (#1226)
M	Makefile
M	ggml.c
M	llama.cpp

commit	305eb5afd51325e3142c01c17431febb7c67de87	84ca9c2ecf3391d911589d0fe2b483cbfb4b82a6	2023-04-29T13:53:12+03:00	Georgi Gerganov	build : fix reference to old llama_util.h
M	CMakeLists.txt
M	Makefile
M	examples/save-load-state/save-load-state.cpp

commit	84ca9c2ecf3391d911589d0fe2b483cbfb4b82a6	334637e43e3a0529b4b50e2c22968b1ed1633353	2023-04-29T13:48:11+03:00	Georgi Gerganov	examples : fix save-load-state + rename llama-util.h
M	examples/save-load-state/save-load-state.cpp
R099	llama_util.h	llama-util.h
M	llama.cpp

commit	334637e43e3a0529b4b50e2c22968b1ed1633353	dd7eff57d8491792010b1002b8de6a4b54912e5c	2023-04-29T09:51:06+03:00	Georgi Gerganov	common : change default parameters to pre-#1126 (#1223)
M	examples/common.h
M	examples/main/main.cpp

commit	dd7eff57d8491792010b1002b8de6a4b54912e5c	7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c	2023-04-29T08:34:41+03:00	Ivan Stepanov	llama : new sampling algorithms (#1126)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	examples/save-load-state/save-load-state.cpp
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
A	tests/test-sampling.cpp

commit	7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c	b1ee8f59b4101b46999a0995d9a34506f7285466	2023-04-29T02:04:18+02:00	slaren	cuBLAS: use host pinned memory and dequantize while copying (#1207)
M	Makefile
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	llama.cpp
M	llama_util.h

commit	b1ee8f59b4101b46999a0995d9a34506f7285466	36d19a603b221d1bd7897fcb10e823e2103b052d	2023-04-29T02:31:56+03:00	Henri Vasserman	cuBLAS: non-contiguous tensor support (#1215)
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c

commit	36d19a603b221d1bd7897fcb10e823e2103b052d	7f15c5c477d9933689a9d1c40794483e350c2f19	2023-04-28T23:10:43Z	Stephan Walter	Remove Q4_3 which is no better than Q5 (#1218)
M	README.md
M	SHA256SUMS
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml-opencl-dequant.cl
M	ggml-opencl.c
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	7f15c5c477d9933689a9d1c40794483e350c2f19	55390bcaf2579a5435564d7267ae3ed367837fd6	2023-04-28T21:32:52+03:00	Georgi Gerganov	readme : update hot topics
M	README.md

commit	55390bcaf2579a5435564d7267ae3ed367837fd6	5fba3c016bfd1d73a070e7c93dac14162ce118d0	2023-04-28T20:37:43+03:00	Georgi Gerganov	ggml : sync ggml (ggml_alibi)
M	ggml.c
M	ggml.h

commit	5fba3c016bfd1d73a070e7c93dac14162ce118d0	1481a9cf25ea2e4abef6b13a57660a35f3e66af1	2023-04-28T11:13:33-05:00	CRD716	examples : add Jeopardy example (#1168)
M	.gitignore
A	examples/jeopardy/README.md
A	examples/jeopardy/graph.py
A	examples/jeopardy/jeopardy.sh
A	examples/jeopardy/qasheet.csv
A	examples/jeopardy/questions.txt

commit	1481a9cf25ea2e4abef6b13a57660a35f3e66af1	11d902364b0e3b503a02a4e757ee2dc38aacb68f	2023-04-28T11:59:37-04:00	Evan Jones	llama : add session file format and saved sessions in main (#1169)
M	examples/chat-13B.sh
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	llama.cpp
M	llama.h

commit	11d902364b0e3b503a02a4e757ee2dc38aacb68f	7296c961d9303010a2b98379f738da2a8a55aa1b	2023-04-28T17:58:44+03:00	Georgi Gerganov	ggml : add helper debug printf in soft_max
M	ggml.c

commit	7296c961d9303010a2b98379f738da2a8a55aa1b	78ec543733d10a1629f984fd0302fdaa4e87fe66	2023-04-28T16:57:16+02:00	0cc4m	ggml : add CLBlast support (#1164)
M	CMakeLists.txt
M	Makefile
A	ggml-opencl-dequant.cl
A	ggml-opencl.c
A	ggml-opencl.h
M	ggml.c
M	ggml.h
M	llama.cpp

commit	78ec543733d10a1629f984fd0302fdaa4e87fe66	92a6e13a31ba052abd9062af6cb8df2a293ce661	2023-04-28T19:22:48+05:00	Folko-Ven	Correcting link to w64devkit (#1214)
M	README.md

commit	92a6e13a31ba052abd9062af6cb8df2a293ce661	04aaae1d79482cad2564412f3b32e70298ac7789	2023-04-28T15:40:32+02:00	Johannes Gäßler	Add Manjaro CUDA include and lib dirs to Makefile (#1212)
M	Makefile

commit	04aaae1d79482cad2564412f3b32e70298ac7789	0b2da20538d01926b77ea237dd1c930c4d20b686	2023-04-28T19:59:48+08:00	Yann Follet	add avx2 for dot_q8_0_q8_0, 2x faster than scalar (#1211)
M	ggml.c

commit	0b2da20538d01926b77ea237dd1c930c4d20b686	f9be42add0bf3ce61814b7ede0e6d0dda9ff22c6	2023-04-26T20:26:42Z	Stephan Walter	ggml : slightly faster AVX2 implementation for Q5 (#1197)
M	ggml.c

commit	f9be42add0bf3ce61814b7ede0e6d0dda9ff22c6	574406dc7e350ddbffaeca33bf0392b7bfeb1436	2023-04-26T23:24:42+03:00	Georgi Gerganov	readme : add quantization info
M	README.md

commit	574406dc7e350ddbffaeca33bf0392b7bfeb1436	87a6f846d3e929632c45916dd08f1e2a9c72d2a3	2023-04-26T23:14:13+03:00	Georgi Gerganov	ggml : add Q5_0 and Q5_1 quantization (#1187)
M	.gitignore
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	87a6f846d3e929632c45916dd08f1e2a9c72d2a3	ea3ad7eb60cfb44526a58122e8019850f437cd1b	2023-04-26T20:08:43Z	Ásgeir Bjarni Ingvarsson	Allow setting the rng seed after initialization. (#1184)
M	llama.cpp
M	llama.h

commit	ea3ad7eb60cfb44526a58122e8019850f437cd1b	859fee6dfb00fab7ce6bc215b4adae78d82f4759	2023-04-26T22:03:03+02:00	DaniAndTheWeb	Updating build instructions to include BLAS support (#1183)
M	README.md

commit	859fee6dfb00fab7ce6bc215b4adae78d82f4759	4afcc378698e057fcde64e23eb664e5af8dd6956	2023-04-26T18:43:27+02:00	Pavol Rusnak	quantize : use `map` to assign quantization type from `string` (#1191)
M	.devops/tools.sh
M	README.md
M	examples/quantize/quantize.cpp

commit	4afcc378698e057fcde64e23eb664e5af8dd6956	667c501334ace706e3abc3f7a37cf1d6b4228745	2023-04-25T21:41:56Z	Stephan Walter	Update SHA256SUMS after quantization change (#1181)
M	SHA256SUMS

commit	667c501334ace706e3abc3f7a37cf1d6b4228745	bb98e77be704584fb40b0400394b4c16ae75f8e2	2023-04-25T23:33:08+02:00	ostix360	py : cast lora_alpha to int in convert-lora-to-ggml (#1170)
M	convert-lora-to-ggml.py

commit	bb98e77be704584fb40b0400394b4c16ae75f8e2	7a32fcb3b29f4db8aed8a85dc58eb958fb118153	2023-04-25T23:19:57+02:00	Pavol Rusnak	nix: use convert.py instead of legacy wrapper convert-pth-to-ggml.py (#981)
M	flake.nix

commit	7a32fcb3b29f4db8aed8a85dc58eb958fb118153	dd0eabc049fb1efc631cab8eb0a646808d704e18	2023-04-25T23:40:51+03:00	Georgi Gerganov	ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON) (#1179)
M	examples/quantize/quantize.cpp
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-quantize-fns.cpp

commit	dd0eabc049fb1efc631cab8eb0a646808d704e18	54bb60e26858be251a0eb3cb70f80322aff804a0	2023-04-25T19:20:46+02:00	unbounded	ggml : use full range for Q4_0 and Q4_2 quantization (#729)
M	ggml.c

commit	54bb60e26858be251a0eb3cb70f80322aff804a0	8a0f8673ba1cdc6aa6df27a9fbc698431ca70e8d	2023-04-24T23:02:02+02:00	xaedes	ggml : fix bug in ggml_compute_forward_sum_f32 (#1162)
M	ggml.c

commit	8a0f8673ba1cdc6aa6df27a9fbc698431ca70e8d	0c5692345d5c046dbc6a7d311a00ae5842ac39c3	2023-04-24T22:18:25+03:00	Georgi Gerganov	ggml : export symbols (#1155)
M	ggml.h

commit	0c5692345d5c046dbc6a7d311a00ae5842ac39c3	957c8ae21d1e7052ea45a40ee8c0407b909e90cc	2023-04-24T18:23:31+02:00	xaedes	examples : add save_load_state example (#1150)
M	examples/CMakeLists.txt
A	examples/save-load-state/CMakeLists.txt
A	examples/save-load-state/save-load-state.cpp

commit	957c8ae21d1e7052ea45a40ee8c0407b909e90cc	9b0a4d421459f4e5e1af735c9784c3247b379025	2023-04-24T18:47:03+03:00	Georgi Gerganov	llama : increase scratch buffer size for 65B (ref #1152)
M	llama.cpp

commit	9b0a4d421459f4e5e1af735c9784c3247b379025	2ec83428de7a876ecbbe484e1de42b73b5a40e25	2023-04-24T17:45:32+02:00	mgroeber9110	examples/main README improvements and some light refactoring (#1131)
M	README.md
M	examples/common.cpp
M	examples/common.h
M	examples/main/README.md
M	examples/main/main.cpp

commit	2ec83428de7a876ecbbe484e1de42b73b5a40e25	e4cf982e0d4fcfbb4b977a52dbeacd115da10c3b	2023-04-24T15:38:26Z	Stephan Walter	Fix build for gcc 8 and test in CI (#1154)
M	.github/workflows/build.yml
M	ggml.c

commit	e4cf982e0d4fcfbb4b977a52dbeacd115da10c3b	c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae	2023-04-24T17:29:58+02:00	slaren	Fix cuda compilation (#1128)
M	Makefile

commit	c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae	1d78fecdab4087028a38517e86ed129f077174d8	2023-04-24T07:40:02+03:00	Georgi Gerganov	llama : refactor get / set state + remove redundant kv cache API (#1143)
M	llama.cpp
M	llama.h

commit	1d78fecdab4087028a38517e86ed129f077174d8	284685f1692258c2bcf08b86b723b80ba2e66c7a	2023-04-23T23:03:44+02:00	slaren	Fix LoRA acronym (#1145)
M	examples/main/README.md

commit	284685f1692258c2bcf08b86b723b80ba2e66c7a	edce63baa9dbd3963c3441bce07ee0acbb635697	2023-04-23T19:57:09+03:00	Georgi Gerganov	scripts : add helper scripts to synch ggml repo
A	scripts/sync-ggml.sh

commit	edce63baa9dbd3963c3441bce07ee0acbb635697	ec9cdb6752dd96b3cc74d90ad1adeba5b4fa2b0e	2023-04-23T08:37:02-07:00	DannyDaemonic	Added README.md for main with examples and explanations (#1139)
M	examples/main/README.md

commit	ec9cdb6752dd96b3cc74d90ad1adeba5b4fa2b0e	e4422e299c10c7e84c8e987770ef40d31905a76b	2023-04-23T18:32:52+03:00	Georgi Gerganov	ggml : do not print perf ops that have not been used at all
M	ggml.c

commit	e4422e299c10c7e84c8e987770ef40d31905a76b	53c8434398b3cba7ac6298cdd44abd40f0e640b1	2023-04-23T18:15:39+03:00	Georgi Gerganov	ggml : better PERF prints + support "LLAMA_PERF=1 make"
M	Makefile
M	ggml.c
M	llama.cpp

commit	53c8434398b3cba7ac6298cdd44abd40f0e640b1	c6524f46eb93fdb949330293a8469fd70080bd5a	2023-04-23T11:01:03Z	Stephan Walter	Improve AVX2 for vec_dot_q4_3_q8_0 (#1138)
M	ggml.c

commit	c6524f46eb93fdb949330293a8469fd70080bd5a	c9e2c26f413377b352845f442cdab976ce85a05d	2023-04-23T10:21:26+02:00	Pavol Rusnak	readme : update gpt4all instructions (#980)
M	README.md

commit	c9e2c26f413377b352845f442cdab976ce85a05d	0e018fe008eacebdbcfa2d61b6c988c245c961cd	2023-04-23T15:57:05+08:00	Yishuo Wang	A better `packNibbles` and `mul_sum_i8_pairs_float` implementation using AVX512 (#1119)
M	ggml.c

commit	0e018fe008eacebdbcfa2d61b6c988c245c961cd	857308d1e8fb6afe33edb481d48560eee8fe7d7c	2023-04-22T16:31:56+03:00	Georgi Gerganov	ggml : fix Q4_3 cuBLAS
M	CMakeLists.txt
M	ggml.c

commit	857308d1e8fb6afe33edb481d48560eee8fe7d7c	c50b628810f36a3e6e0324371f6db579eacefa0e	2023-04-22T13:12:29Z	Stephan Walter	ci : trigger CI for drafts, but not most PR actions (#1125)
M	.github/workflows/build.yml

commit	c50b628810f36a3e6e0324371f6db579eacefa0e	5f939498d517b4dddbe904f202e895a3ecfb9dc4	2023-04-22T10:54:13Z	Stephan Walter	Fix CI: ARM NEON, quantization unit tests, editorconfig (#1122)
M	examples/main/main.cpp
M	ggml.c
M	llama.cpp
M	tests/test-quantize-fns.cpp
M	tests/test-quantize-perf.cpp

commit	5f939498d517b4dddbe904f202e895a3ecfb9dc4	36b4f7e06406eed8a605cc9f2921d9244ef6a8e5	2023-04-22T11:10:39+02:00	unbounded	ggml : unit test for quantization functions (#953)
M	tests/CMakeLists.txt
A	tests/test-quantize-fns.cpp
A	tests/test-quantize-perf.cpp
D	tests/test-quantize.c

commit	36b4f7e06406eed8a605cc9f2921d9244ef6a8e5	10f19c1121068ce3dab9bece03a8b9caaea2db36	2023-04-22T16:56:35+08:00	wbpxre150	llama : print timings on ctrl+c exit (#1021)
M	examples/main/main.cpp

commit	10f19c1121068ce3dab9bece03a8b9caaea2db36	7e312f165c5047d6e16680d1eebc83055e95c313	2023-04-22T04:27:05-04:00	eiery	llama : have n_batch default to 512 (#1091)
M	examples/common.h

commit	7e312f165c5047d6e16680d1eebc83055e95c313	872c365a9176a011b13d31269bb3121fa89c37e1	2023-04-22T16:18:20+08:00	Howard Su	cmake : fix build under Windows when enable BUILD_SHARED_LIBS (#1100)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	872c365a9176a011b13d31269bb3121fa89c37e1	955ef9a5d53d8f911fe00580ac9bd0caa56430af	2023-04-22T11:08:12+03:00	Georgi Gerganov	ggml : fix AVX build + update to new Q8_0 format
M	Makefile
M	ggml.c
M	llama.cpp

commit	955ef9a5d53d8f911fe00580ac9bd0caa56430af	c5aa5e577741d0359ad26ec50b9e21a74c65d911	2023-04-22T10:55:35+03:00	Georgi Gerganov	ggml : alternative Q4_3 implementation using modified Q8_0 (#1109)
M	ggml.c

commit	c5aa5e577741d0359ad26ec50b9e21a74c65d911	e9a9cb0c54461ffbda75b7b2f99f3ea5562291c2	2023-04-22T07:37:05Z	Stephan Walter	ggml : AVX2 optimization for vec_dot_q4_3_q8_0 and refactoring (#1099)
M	ggml.c

commit	e9a9cb0c54461ffbda75b7b2f99f3ea5562291c2	b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9	2023-04-22T02:54:33-04:00	Clint Herron	examples : Improve Alpaca Default Repeat Penalty: Better Match Alpaca.cpp Experience (#1107)
M	examples/alpaca.sh

commit	b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9	50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1	2023-04-22T08:21:32+02:00	xaedes	llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105)
M	llama.cpp
M	llama.h

commit	50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1	25d7abbd1f73582b7e0fdc422a936e8541c0780b	2023-04-21T21:59:17+02:00	slaren	Improve cuBLAS performance by using a memory pool (#1094)
M	Makefile
M	ggml-cuda.cu
M	ggml-cuda.h
M	ggml.c

commit	25d7abbd1f73582b7e0fdc422a936e8541c0780b	018f2279f5fe3ef743bd8254b23ea8f0efae7e73	2023-04-21T13:48:06-05:00	apaz	llama : fixed rlimit error message (#888)
M	llama_util.h

commit	018f2279f5fe3ef743bd8254b23ea8f0efae7e73	9411288271ab548216902a029f42a0a38ebcedb7	2023-04-22T02:27:06+08:00	源文雨	cmake : link threads publicly to ggml (#1042)
M	CMakeLists.txt

commit	9411288271ab548216902a029f42a0a38ebcedb7	8687c1f2581d059cd5b6a9502f89bd343566062a	2023-04-21T11:18:09-07:00	Alex Klinkhamer	main : evaluate tokens in batches after swapping context (#1014)
M	examples/main/main.cpp

commit	8687c1f2581d059cd5b6a9502f89bd343566062a	1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9	2023-04-21T17:25:21+02:00	xaedes	llama : remember and restore kv cache data pointers (#1104)
M	llama.cpp

commit	1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9	3d59769c3bb7e72c915646ddb1e239b1face19f5	2023-04-21T17:18:26+02:00	Kawrakow	ggml : a faster version for Q4_1 x Q8_0 dot products (#1083)
M	ggml.c
M	pocs/vdot/CMakeLists.txt
A	pocs/vdot/q8dot.cpp

commit	3d59769c3bb7e72c915646ddb1e239b1face19f5	d40fded93e1a533e969768e1e335c15c61c296ce	2023-04-21T14:57:57+02:00	slaren	Show perplexity ETA in hours and minutes (#1096)
M	examples/perplexity/perplexity.cpp

commit	d40fded93e1a533e969768e1e335c15c61c296ce	2510c1831fac874f32e272f6079f01b5461f3986	2023-04-21T10:23:36+03:00	Georgi Gerganov	llama : fix comment for "output.weight" tensor
M	llama.cpp

commit	2510c1831fac874f32e272f6079f01b5461f3986	12b5900dbc9743dee3ce83513cf5c3a44523a1b6	2023-04-20T21:56:44Z	Stephan Walter	Add ggml-model-*.bin checksums for 7B, 13B, 30B, 65B (#1088)
M	SHA256SUMS

commit	12b5900dbc9743dee3ce83513cf5c3a44523a1b6	9ff334f3c9b960a44c5e149b08c748a2914fb882	2023-04-20T23:32:59+03:00	Georgi Gerganov	ggml : sync ggml (add GPT-NeoX RoPE implementation)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	9ff334f3c9b960a44c5e149b08c748a2914fb882	2005469ea130cf920c50175d4f47a87bfd8aaf4d	2023-04-20T21:58:05+03:00	Georgi Gerganov	ggml : fix bug in ggml_compute_forward_dup_f32()
M	ggml.c

commit	2005469ea130cf920c50175d4f47a87bfd8aaf4d	8a1756abdf1f48cb4dcb898bc8fbe9102ef49dc6	2023-04-20T20:49:53+02:00	slaren	Add Q4_3 support to cuBLAS (#1086)
M	Makefile
M	ggml-cuda.cu
M	ggml-cuda.h

commit	8a1756abdf1f48cb4dcb898bc8fbe9102ef49dc6	66aab46079609972ee1f7bd6f319d826205a2fbd	2023-04-20T21:43:50+03:00	Georgi Gerganov	ggml : do not break cuBLAS build (Q4_3 is not yet implemented)
M	ggml.c

commit	66aab46079609972ee1f7bd6f319d826205a2fbd	38de86a7114c97ecf3644e3a60159f1ed893e1b0	2023-04-20T20:44:05+03:00	Georgi Gerganov	ggml : fix Q4_3 quantization
M	ggml.c

commit	38de86a7114c97ecf3644e3a60159f1ed893e1b0	e0305ead3a072db9c08b35c9600c49273b38a4b5	2023-04-20T19:42:27+02:00	Kawrakow	llama : multi-threaded quantization (#1075)
M	examples/quantize-stats/quantize-stats.cpp
M	examples/quantize/quantize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	e0305ead3a072db9c08b35c9600c49273b38a4b5	6a9661ea5ad72166b700ae5e87976e4452499dda	2023-04-20T20:35:53+03:00	Georgi Gerganov	ggml : add Q4_3 quantization (#1082)
M	examples/quantize/quantize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	6a9661ea5ad72166b700ae5e87976e4452499dda	5addcb120cf2682c7ede0b1c520592700d74c87c	2023-04-20T17:15:18+02:00	Ivan Komarov	ci : remove the LLAMA_ACCELERATE matrix dimension from Ubuntu builds in the CI (#1074)
M	.github/workflows/build.yml

commit	5addcb120cf2682c7ede0b1c520592700d74c87c	c8c2c524827be8fd681a63f0e5a697b0bf4c587b	2023-04-20T21:28:43+08:00	源文雨	fix: LLAMA_CUBLAS=1 undefined reference 'shm_open' (#1080)
M	Makefile

commit	c8c2c524827be8fd681a63f0e5a697b0bf4c587b	02d6988121510c067e06d498a273a351a888f5b9	2023-04-20T06:45:41Z	Stephan Walter	AVX2 optimization for vec_dot_q4_2_q8_0 (#1068)
M	ggml.c

commit	02d6988121510c067e06d498a273a351a888f5b9	834695fe3a3ed2a962e774c9615e3f7b41d360a8	2023-04-20T03:14:14+02:00	slaren	Improve cuBLAS performance by dequantizing on the GPU (#1065)
M	CMakeLists.txt
M	Makefile
A	ggml-cuda.cu
A	ggml-cuda.h
M	ggml.c

commit	834695fe3a3ed2a962e774c9615e3f7b41d360a8	f7d05095b404b5500b4a702ea16f67fc22446e49	2023-04-19T14:52:14-05:00	CRD716	Minor: Readme fixed grammar, spelling, and misc updates (#1071)
M	README.md

commit	f7d05095b404b5500b4a702ea16f67fc22446e49	884e7d7a2bfd7325b107442d6758983f5886ed3d	2023-04-19T20:20:14+02:00	Kawrakow	Q4_2 quantization with rmse-optimized scale and quants (#1062)
M	ggml.c

commit	884e7d7a2bfd7325b107442d6758983f5886ed3d	7cd5c4a3e9106151d48f328bb3c94c298a211f18	2023-04-19T20:10:08+03:00	Georgi Gerganov	ggml : use 8-bit precision for Q4_1 intermediate results (#1047)
M	.gitignore
M	ggml.c

commit	7cd5c4a3e9106151d48f328bb3c94c298a211f18	f3d4edf504c19ee9d1381c5727fe38667205d979	2023-04-19T19:07:54+03:00	Georgi Gerganov	readme : add warning about Q4_2 and Q4_3
M	README.md

commit	f3d4edf504c19ee9d1381c5727fe38667205d979	8944a1329648c57bb7d66851170938230587a52c	2023-04-19T16:06:37Z	Stephan Walter	ggml : Q4 cleanup - remove 4-bit dot product code (#1061)
M	CMakeLists.txt
M	Makefile
M	ggml.c

commit	8944a1329648c57bb7d66851170938230587a52c	66674012389f9537140044290f8517bc4a5e0b74	2023-04-19T11:22:45+02:00	slaren	Add NVIDIA cuBLAS support (#1044)
M	CMakeLists.txt
M	Makefile
M	ggml.c
M	ggml.h
M	llama.cpp

commit	66674012389f9537140044290f8517bc4a5e0b74	77a73403ca8eaced2590559d0f9cebd2b3649d32	2023-04-19T00:53:24+02:00	slaren	Multi-threaded ggml_cpy (#1035)
M	ggml.c

commit	77a73403ca8eaced2590559d0f9cebd2b3649d32	50a8a2af97cb92e53e7a3195aa201c3d87da5415	2023-04-18T23:54:57+03:00	Georgi Gerganov	ggml : add new Q4_2 quantization (ARM only) (#1046)
M	examples/quantize/quantize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	50a8a2af97cb92e53e7a3195aa201c3d87da5415	4caebf6d408b91c2d29d0abc7b1e867b5de64db5	2023-04-18T23:11:23+03:00	Georgi Gerganov	ggml : scratch that - vmlaq_n_f32 is always better
M	ggml.c

commit	4caebf6d408b91c2d29d0abc7b1e867b5de64db5	dcdd65e2969bc03c91a1ebd1160162d5054e6923	2023-04-18T23:00:08+03:00	Georgi Gerganov	gitignore : vdot
M	.gitignore

commit	dcdd65e2969bc03c91a1ebd1160162d5054e6923	5ecff35151156118c2df74899637ad34ee384b9b	2023-04-18T22:59:17+03:00	Georgi Gerganov	ggml : optimize ggml_vec_dot_q4_0_q8_0() using vectorized accumulators
M	ggml.c

commit	5ecff35151156118c2df74899637ad34ee384b9b	7faa7460f03bdd88becf1e659cf359f274055404	2023-04-18T21:00:14+02:00	Kawrakow	Adding a simple program to measure speed of dot products (#1041)
M	CMakeLists.txt
M	Makefile
A	pocs/CMakeLists.txt
A	pocs/vdot/CMakeLists.txt
A	pocs/vdot/vdot.cpp

commit	7faa7460f03bdd88becf1e659cf359f274055404	5af8e32238c7d9c4cdb7fc640472c9a26538b9da	2023-04-18T20:10:26+03:00	Georgi Gerganov	readme : update hot topics about new LoRA functionality
M	README.md

commit	5af8e32238c7d9c4cdb7fc640472c9a26538b9da	42747220b4cac548b6e3059b66b3e960b517cfa4	2023-04-17T18:00:10+03:00	Georgi Gerganov	ci : do not run on drafts
M	.github/workflows/build.yml
M	.github/workflows/docker.yml

commit	42747220b4cac548b6e3059b66b3e960b517cfa4	e9298af3896b536d0c6d740447dc764e56b22102	2023-04-18T03:15:50+02:00	Ivan Komarov	Do not close file after mmap (Windows version) (#1034)
M	llama_util.h

commit	e9298af3896b536d0c6d740447dc764e56b22102	4ad73137a1aadc40a62f7101aab883f69e7172c6	2023-04-18T04:34:35+09:00	Atsushi Tatsuma	readme : add Ruby bindings (#1029)
M	README.md

commit	4ad73137a1aadc40a62f7101aab883f69e7172c6	315a95a4d30db726fb7d244dd3b9e90a83fb1616	2023-04-17T11:26:23-07:00	Cameron	add 4_0 to default outfile namestr dict (#1031)
M	convert.py

commit	315a95a4d30db726fb7d244dd3b9e90a83fb1616	efd05648c88a0923a55f56e7ce1b0f9c33410afb	2023-04-17T17:28:55+02:00	slaren	Add LoRA support (#820)
A	convert-lora-to-ggml.py
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	llama_util.h

commit	efd05648c88a0923a55f56e7ce1b0f9c33410afb	eb17a026fd23d1c1b612fa4600f7f5c58e501a28	2023-04-17T17:41:53+03:00	Arik Poznanski	llama : well-defined static initialization of complex objects (#927)
M	llama.cpp
M	tests/test-tokenizer-0.cpp

commit	eb17a026fd23d1c1b612fa4600f7f5c58e501a28	69b740289f9b3756ea9dd2a23f241c6f688d88b9	2023-04-17T17:31:06+03:00	Georgi Gerganov	quantize-stats : fix bug in --type argument
M	examples/quantize-stats/quantize-stats.cpp

commit	69b740289f9b3756ea9dd2a23f241c6f688d88b9	f266259ad9a2bce5a34d919592310147af23f3dc	2023-04-17T16:16:23+03:00	Georgi Gerganov	ggml : avoid using ggml_fp16_to_fp32() and ggml_fp32_to_fp16() in ggml.c
M	ggml.c

commit	f266259ad9a2bce5a34d919592310147af23f3dc	47f61aaa5f76d04286792e2fbd0c95b659ab2af0	2023-04-17T15:10:57+02:00	Ivan Komarov	Speedup the AVX-512 implementation of ggml_vec_dot_q4_0() (#933)
M	CMakeLists.txt
M	ggml.c
M	ggml.h
M	llama.cpp

commit	47f61aaa5f76d04286792e2fbd0c95b659ab2af0	3173a62eb9f90b94fb3184131032c1c8b7aa8d86	2023-04-16T21:27:38+02:00	slaren	Fix: do not close file on mmap (#1017)
M	llama_util.h

commit	3173a62eb9f90b94fb3184131032c1c8b7aa8d86	489537e6cf6c93b74a029a11533dbcaa89791dcc	2023-04-16T13:58:48+03:00	Georgi Gerganov	stdout : vertical align outputs for better readibility
M	convert.py
M	llama.cpp

commit	489537e6cf6c93b74a029a11533dbcaa89791dcc	2d3481c72125cd388258864c7ad8d7d36777bad7	2023-04-16T12:13:00+02:00	Pavol Rusnak	examples: add missing <ctime> include for time() (#1011)
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp

commit	2d3481c72125cd388258864c7ad8d7d36777bad7	74f5899df4a6083fc467b620baa1cf821e37799d	2023-04-16T17:13:42+08:00	nanahi	Fix msys2 build error and warnings (#1009)
M	llama.cpp
M	llama_util.h

commit	74f5899df4a6083fc467b620baa1cf821e37799d	2f7c8e014e3c0ceaf39688845c2ff6f919fb03b7	2023-04-15T14:53:21-07:00	comex	convert.py: Fix loading safetensors and ggml format on Windows (#991)
M	convert.py

commit	2f7c8e014e3c0ceaf39688845c2ff6f919fb03b7	0ad964631f9b3970f1936008fcfb1eadef59c7ed	2023-04-15T18:28:56Z	Stephan Walter	Fix potential int8 overflow in non-SIMD vec_dot (#986)
M	ggml.c

commit	0ad964631f9b3970f1936008fcfb1eadef59c7ed	e95b6554b493e71a0275764342e09bd5784a7026	2023-04-15T16:25:38Z	Stephan Walter	Refactor ggml.c for future tensor types (#1001)
M	ggml.c

commit	e95b6554b493e71a0275764342e09bd5784a7026	aa485cee334e84437e21681c14b6f80b65876d8b	2023-04-15T17:53:22+03:00	Georgi Gerganov	ggml : add Q8_0 quantization for intermediate results (#951)
M	Makefile
M	ggml.c
M	ggml.h

commit	aa485cee334e84437e21681c14b6f80b65876d8b	c12b14b77fced0ce9a0e2d81f670c3a746dec251	2023-04-15T14:25:45+03:00	Georgi Gerganov	ggml : use posix_memalign on non-Windows env
M	ggml.c

commit	c12b14b77fced0ce9a0e2d81f670c3a746dec251	106faaf2971d6c89d6010279a9a95737772470ef	2023-04-15T07:51:54+02:00	Ivan Komarov	benchmark : fix result validation in benchmark-q4_0-matmult (#987)
M	examples/benchmark/benchmark-q4_0-matmult.c

commit	106faaf2971d6c89d6010279a9a95737772470ef	c85e03d12e4b8af22cb13aa9c618dcd5935862fd	2023-04-15T14:51:11+09:00	katsu560	cmake : add finding the OpenBLAS header file (#992)
M	CMakeLists.txt

commit	c85e03d12e4b8af22cb13aa9c618dcd5935862fd	489093548c89c67520109ab25c4df4a4614a32a0	2023-04-14T21:58:43+02:00	Pavol Rusnak	Revert "main : alternative instruct mode (Vicuna support, etc.) (#863)" (#982)
D	configs/alpaca-native-enhanced.txt
D	configs/alpaca.txt
D	configs/chat-with-bob.txt
D	configs/llama.txt
D	configs/vicuna-simple.txt
D	configs/vicuna-stop.txt
D	configs/vicuna.txt
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
A	prompts/alpaca.txt
A	prompts/chat-with-bob.txt

commit	489093548c89c67520109ab25c4df4a4614a32a0	93265e988af32b8be314bfed334f795a3037555d	2023-04-14T21:46:49+02:00	Pavol Rusnak	py : bump sentencepiece to 0.1.98 to support Python 3.11 (#976)
M	requirements.txt

commit	93265e988af32b8be314bfed334f795a3037555d	c56b7152690ca25cfd66b20210b3629e6c1e739b	2023-04-14T19:39:48Z	Stephan Walter	make : fix dependencies, use auto variables (#983)
M	Makefile

commit	c56b7152690ca25cfd66b20210b3629e6c1e739b	f4d277ae17247ee51129ef1a9ff74d377cc90b1b	2023-04-14T20:05:37+02:00	Pavol Rusnak	Expose type name from ggml (#970)
M	examples/quantize-stats/quantize-stats.cpp
M	ggml.c
M	ggml.h
M	llama.cpp

commit	f4d277ae17247ee51129ef1a9ff74d377cc90b1b	c9a59b70a54e0bc05777df287feaea3dbe0310c4	2023-04-14T17:19:17+02:00	Tomáš Pazdiora	main : alternative instruct mode (Vicuna support, etc.) (#863)
A	configs/alpaca-native-enhanced.txt
A	configs/alpaca.txt
A	configs/chat-with-bob.txt
A	configs/llama.txt
A	configs/vicuna-simple.txt
A	configs/vicuna-stop.txt
A	configs/vicuna.txt
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp
D	prompts/alpaca.txt
D	prompts/chat-with-bob.txt

commit	c9a59b70a54e0bc05777df287feaea3dbe0310c4	a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f	2023-04-14T08:43:55-06:00	Kerfuffle	ggml : add unary and binary map operations (#874)
M	ggml.c
M	ggml.h

commit	a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f	43ffdefb7424f79a3d510c199e2ea86684b4f824	2023-04-14T15:37:11+02:00	Pavol Rusnak	py : cleanup dependencies (#962)
M	.devops/full.Dockerfile
M	flake.nix

commit	43ffdefb7424f79a3d510c199e2ea86684b4f824	1623a6e9b46453bff30afd7d0f6c3fd188499c2f	2023-04-14T14:23:21+02:00	Pavol Rusnak	py : fix flake8 and isort nitpicks (#960)
M	convert.py

commit	1623a6e9b46453bff30afd7d0f6c3fd188499c2f	c14e0d2f23e6d1e785255f4da8c253c1b4723659	2023-04-14T13:31:29+03:00	Georgi Gerganov	ggml : minor
M	ggml.c

commit	c14e0d2f23e6d1e785255f4da8c253c1b4723659	723dac55fa2ba7adc6e3fc8609781d1ad0378906	2023-04-14T13:31:15+03:00	Georgi Gerganov	ggml : always allocate buffers with size multiple of GGML_MEM_ALIGN
M	ggml.c

commit	723dac55fa2ba7adc6e3fc8609781d1ad0378906	0f07cacb05f49704d35a39aa27cfd4b419eb6f8d	2023-04-14T00:03:03-07:00	comex	py : new conversion script (#545)
M	README.md
D	convert-ggml-to-pth.py
D	convert-gpt4all-to-ggml.py
D	convert-gptq-to-ggml.py
M	convert-pth-to-ggml.py
D	convert-unversioned-ggml-to-ggml.py
A	convert.py
D	migrate-ggml-2023-03-30-pr613.py
A	requirements.txt

commit	0f07cacb05f49704d35a39aa27cfd4b419eb6f8d	c5d70f5c9ea5a8f0f6b0d6aa741455978a1dabfd	2023-04-14T09:45:42+03:00	Georgi Gerganov	ggml : fix q4_1 dot product types
M	ggml.c

commit	c5d70f5c9ea5a8f0f6b0d6aa741455978a1dabfd	be87b6ed20a5f7528bf491a83e759a9fc6a24fea	2023-04-14T14:24:52+08:00	Howard Su	ggml : optimize rope function to avoid call powf in the tight loop (#807)
M	ggml.c

commit	be87b6ed20a5f7528bf491a83e759a9fc6a24fea	0e07e6a8399fd993739a3ba3c6f95f92bfab6f58	2023-04-13T14:50:42-07:00	Gary Linscott	perplexity : add support for batch size to `--perplexity` (#407)
M	examples/perplexity/perplexity.cpp

commit	0e07e6a8399fd993739a3ba3c6f95f92bfab6f58	a3a2a0eda8828b60436e9f69d9ac2c1060d03e7a	2023-04-13T10:39:25-05:00	CRD716	common : remove unnecessary includes (#947)
M	examples/common.cpp

commit	a3a2a0eda8828b60436e9f69d9ac2c1060d03e7a	d990e3fffc5b0f5448e90a16c79a4f2675100af0	2023-04-13T18:36:40+03:00	Georgi Gerganov	ggml : add GGML_DEFAULT_N_THREADS
M	ggml.c
M	ggml.h

commit	d990e3fffc5b0f5448e90a16c79a4f2675100af0	9190e8eac8bdc108c40d2d7505e9b45fa773251f	2023-04-13T18:32:36+03:00	Georgi Gerganov	ggml : speed-up ggml_vec_dot_q4_1() ARM_NEON + 32-bit ARM support (#900)
M	ggml.c

commit	9190e8eac8bdc108c40d2d7505e9b45fa773251f	c85980acd04631a7c43d13676276f76ec72f5dfe	2023-04-13T18:04:45+03:00	Georgi Gerganov	llama : merge llama_internal.h into llama.h
M	CMakeLists.txt
M	Makefile
M	examples/quantize-stats/quantize-stats.cpp
M	llama.cpp
M	llama.h
D	llama_internal.h

commit	c85980acd04631a7c43d13676276f76ec72f5dfe	6232f2d7fd7a22d5eeb62182b2f21fcf01359754	2023-04-13T18:01:22+03:00	Georgi Gerganov	gitignore : benchmark
M	.gitignore

commit	6232f2d7fd7a22d5eeb62182b2f21fcf01359754	6c248707f51c8a50f7792e7f7787ec481881db88	2023-04-13T14:59:50Z	Stephan Walter	ggml : optimize non-SIMD Q4_0 vector dot product (#703)
M	ggml.c

commit	6c248707f51c8a50f7792e7f7787ec481881db88	8cda5c981d0bf4dcb7664194b2cb9a06e2dbdd54	2023-04-13T16:08:32+02:00	Pavol Rusnak	ggml : introduce GGML_ALIGNED_MALLOC/GGML_ALIGNED_FREE macros (#884)
M	ggml.c

commit	8cda5c981d0bf4dcb7664194b2cb9a06e2dbdd54	ec29272175d7a79681d9919f3e755b1bcefa0478	2023-04-13T09:03:57-05:00	CRD716	fix whitespace (#944)
M	Makefile
M	examples/benchmark/benchmark-q4_0-matmult.c

commit	ec29272175d7a79681d9919f3e755b1bcefa0478	7e941b95eba067cb5b92785e642fd803657376ee	2023-04-13T08:59:53-05:00	CRD716	readme : remove python 3.10 warning (#929)
M	README.md

commit	7e941b95eba067cb5b92785e642fd803657376ee	c729ff730a46a135817a3d9988a097e3678a9722	2023-04-13T21:54:27+08:00	Genkagaku.GPT	readme : llama node binding (#911)
M	README.md

commit	c729ff730a46a135817a3d9988a097e3678a9722	4579af95e8e16910f6dbab0994917a5b3901f0cf	2023-04-13T15:49:05+02:00	Pavol Rusnak	flake.nix: add all binaries from bin (#848)
M	flake.nix

commit	4579af95e8e16910f6dbab0994917a5b3901f0cf	8c3ffc2f048a372639906fb30ec3c2070288d3be	2023-04-13T21:43:22+08:00	Judd	zig : update build.zig (#872)
M	README.md
M	build.zig

commit	8c3ffc2f048a372639906fb30ec3c2070288d3be	107980d970808c2ccf9334ad033e2782a560b911	2023-04-13T15:24:30+02:00	Vladimir	ggml : update cblas_sgemm columns var to be more reasonable (#838)
M	ggml.c

commit	107980d970808c2ccf9334ad033e2782a560b911	585d91a156794d30eec16ebe67c8d7a1d41406c1	2023-04-13T15:03:39+02:00	niansa/tuxifan	examples : add -n to alpaca and gpt4all scripts (#706)
M	examples/alpaca.sh
M	examples/gpt4all.sh

commit	585d91a156794d30eec16ebe67c8d7a1d41406c1	95ea26f6e92d620a5437f576b80868aee7f808d6	2023-04-13T15:48:21+03:00	anzz1	cmake : add explicit F16C option (x86) (#576)
M	CMakeLists.txt

commit	95ea26f6e92d620a5437f576b80868aee7f808d6	82d146df9b43cf677e0dbce20b03cf864958a0cc	2023-04-13T14:46:23+02:00	SebastianApel	benchmark : add tool for timing q4_0 matrix multiplication (#653)
M	Makefile
A	examples/benchmark/benchmark-q4_0-matmult.c

commit	82d146df9b43cf677e0dbce20b03cf864958a0cc	e7f6997f897a18b6372a6460e25c5f89e1469f1d	2023-04-13T11:33:16+02:00	Pavol Rusnak	do not force the prompt file to end with a new line (#908)
M	.editorconfig
M	prompts/chat-with-bob.txt
M	prompts/reason-act.txt

commit	e7f6997f897a18b6372a6460e25c5f89e1469f1d	f76cb3a34d6a6b03afb96650e39495f201eac042	2023-04-12T15:06:16Z	Stephan Walter	Don't crash on ftype (formerly f16) == 4 (#917)
M	llama.cpp
M	llama.h

commit	f76cb3a34d6a6b03afb96650e39495f201eac042	782438070f7568380755ffc7bf5e09b20c1e8272	2023-04-12T14:48:57+03:00	Georgi Gerganov	readme : change "GPU support" link to discussion
M	README.md

commit	782438070f7568380755ffc7bf5e09b20c1e8272	4dbbd407500cf500ca5f47e4e947635797997c05	2023-04-12T14:31:12+03:00	Georgi Gerganov	readme : update hot topics with link to "GPU support" issue
M	README.md

commit	4dbbd407500cf500ca5f47e4e947635797997c05	8b679987cdce292ff36bd741f6715e4927e26f9b	2023-04-12T08:46:20+02:00	Nicolai Weitkemper	readme: link to sha256sums file (#902)
M	README.md

commit	8b679987cdce292ff36bd741f6715e4927e26f9b	3e6e70d8e8917b5bd14c7c9f9b89a585f1ff0b31	2023-04-11T21:45:44+02:00	Pavol Rusnak	Fix whitespace, add .editorconfig, add GitHub workflow (#883)
M	.devops/main.Dockerfile
M	.dockerignore
A	.ecrc
A	.editorconfig
M	.github/ISSUE_TEMPLATE/custom.md
M	.github/workflows/docker.yml
A	.github/workflows/editorconfig.yml
M	README.md
M	examples/Miku.sh
M	examples/common.cpp
M	examples/embedding/README.md
M	examples/main/README.md
M	examples/main/main.cpp
M	examples/perplexity/README.md
M	ggml.c

commit	3e6e70d8e8917b5bd14c7c9f9b89a585f1ff0b31	2663d2c6784ad7b77998c6874df25648d597f74b	2023-04-11T15:03:51Z	Stephan Walter	Add enum llama_ftype, sync ggml_type to model files (#709)
M	examples/quantize/quantize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	2663d2c6784ad7b77998c6874df25648d597f74b	a0caa34b162449b5c13b8d604573053300ff54a1	2023-04-11T06:19:54-07:00	comex	Windows fixes (#890)
M	examples/main/main.cpp
M	ggml.c
M	llama.cpp
M	llama_util.h

commit	a0caa34b162449b5c13b8d604573053300ff54a1	461ba9e66ed3885f80680d71495e055580573c74	2023-04-11T04:41:53+08:00	qouoq	Add BAIR's Koala to supported models (#877)
M	README.md

commit	461ba9e66ed3885f80680d71495e055580573c74	c3ac702e5ee3533457e0489df4906ee112fe88e7	2023-04-10T23:20:01+03:00	Georgi Gerganov	ggml : fix WASM build
M	ggml.c

commit	c3ac702e5ee3533457e0489df4906ee112fe88e7	9d634ef452d0fc24fcd49592952d13d0ab0f41b7	2023-04-10T22:40:28+03:00	Georgi Gerganov	ggml : add ggml_cont() + optimize ggml_cpy() for contiguous dst
M	ggml.c
M	ggml.h

commit	9d634ef452d0fc24fcd49592952d13d0ab0f41b7	d9a239c4104c888eafda672c1e42c9bbc5084cb8	2023-04-10T19:32:45+03:00	Georgi Gerganov	ggml : remove trailing whitespaces
M	ggml.c

commit	d9a239c4104c888eafda672c1e42c9bbc5084cb8	684da25926e5c505f725b4f10b5485b218fa1fc7	2023-04-10T19:57:59+02:00	Marco Matthies	Simplify to include lower-case windows.h always, fix compile on mingw32 (#747)
M	ggml.c

commit	684da25926e5c505f725b4f10b5485b218fa1fc7	180b693a47b6b825288ef9f2c39d24b6eea4eea6	2023-04-10T19:29:48+03:00	Georgi Gerganov	ggml : fix quantize_row_q4_1() ARM_NEON (close #876)
M	ggml.c

commit	180b693a47b6b825288ef9f2c39d24b6eea4eea6	f963b63afa0e057cfb9eba4d88407c6a0850a0d8	2023-04-08T13:08:21-07:00	comex	Print model version.
M	llama.cpp

commit	f963b63afa0e057cfb9eba4d88407c6a0850a0d8	aaf3b23debc1fe1a06733c8c6468fb84233cc44f	2023-04-08T12:24:37-07:00	comex	Rewrite loading code to try to satisfy everyone:
M	CMakeLists.txt
M	Makefile
M	examples/common.cpp
M	examples/common.h
M	examples/embedding/embedding.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize-stats/quantize-stats.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
A	llama_internal.h
A	llama_util.h

commit	aaf3b23debc1fe1a06733c8c6468fb84233cc44f	f2d1c472946dee2aba9077e8df73346796752b10	2023-04-08T17:49:39+02:00	Tomáš Pazdiora	fix for windows utf-8 input (#840)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	f2d1c472946dee2aba9077e8df73346796752b10	317fb12fbd7cef5d86476574bffe0e904af884ca	2023-04-08T07:15:17-04:00	eiery	cmake should link openblas properly with -lopenblas like how it's done in the makefile (#839)
M	CMakeLists.txt

commit	317fb12fbd7cef5d86476574bffe0e904af884ca	62cfc54f77e519057110265b52b0d614fa363e2a	2023-04-08T07:04:23-03:00	lon	Add new binaries to flake.nix (#847)
M	flake.nix

commit	62cfc54f77e519057110265b52b0d614fa363e2a	698f7b5d6316a1f8453b3b32fd0d637d24952ffd	2023-04-08T00:09:18+02:00	unbounded	Add quantize-stats command for testing quantization (#728)
M	.gitignore
M	Makefile
M	examples/CMakeLists.txt
A	examples/quantize-stats/CMakeLists.txt
A	examples/quantize-stats/quantize-stats.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h

commit	698f7b5d6316a1f8453b3b32fd0d637d24952ffd	c1950c343109ab1fd15fc2ae1c83650c85d4eeef	2023-04-08T02:11:58+10:00	bhubbb	make : add libllama.so target for llama-cpp-python (#797)
M	Makefile

commit	c1950c343109ab1fd15fc2ae1c83650c85d4eeef	4953e9007f86327aabc8312a7211c18019a3a40e	2023-04-07T16:05:29Z	iacore	zig : don't link examples/common.cpp for non-example (#814)
M	build.zig

commit	4953e9007f86327aabc8312a7211c18019a3a40e	cc9cee8e9e7598bd280295f6264f36d3a9224006	2023-04-07T19:02:12+03:00	Ivan Stepanov	llama : always sort logits before nucleus sampling (#812)
M	llama.cpp

commit	cc9cee8e9e7598bd280295f6264f36d3a9224006	d2beca95dcfcd6f1145886e914b879ffc3604b7a	2023-04-06T17:59:11+02:00	Sergey Alirzaev	Do not crash when it has nothing to say. (#796)
M	examples/main/main.cpp

commit	d2beca95dcfcd6f1145886e914b879ffc3604b7a	eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3	2023-04-06T08:56:58+02:00	Pavol Rusnak	Make docker instructions more explicit (#785)
M	README.md

commit	eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3	986b6ce9f99503c51ec5afd8a10baa32359434c6	2023-04-05T22:11:03+03:00	Georgi Gerganov	ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781)
M	ggml.c

commit	986b6ce9f99503c51ec5afd8a10baa32359434c6	34162989297fdfe3ab7305451ce55bc87e3f4c9c	2023-04-05T22:07:33+03:00	Georgi Gerganov	ggml, llama : avoid heavy V transpose + improvements (#775)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	34162989297fdfe3ab7305451ce55bc87e3f4c9c	5a8c4f624077373a198cd562146ffa67b02ebc75	2023-04-05T19:54:30+03:00	Georgi Gerganov	Update README.md
M	README.md

commit	5a8c4f624077373a198cd562146ffa67b02ebc75	ff05d05c960076b42f027e4d318cbd6ea59b3030	2023-04-05T19:20:05+03:00	Ivan Stepanov	llama : define non-positive top_k; top_k range check (#779)
M	llama.cpp

commit	ff05d05c960076b42f027e4d318cbd6ea59b3030	62b3e81aaeafb282934de8b21de13b0104f12f8c	2023-04-05T15:59:13Z	at8u	miku.sh : add executable bit (#780)
M	examples/Miku.sh

commit	62b3e81aaeafb282934de8b21de13b0104f12f8c	8d10406d6ee230e6c1a96590cc8273f86ae606f8	2023-04-05T18:58:06+03:00	Georgi Gerganov	media : add logos and banners
A	media/llama-leader.jpeg
A	media/llama0-banner.png
A	media/llama0-logo.png
A	media/llama1-banner.png
A	media/llama1-logo.png

commit	8d10406d6ee230e6c1a96590cc8273f86ae606f8	ed1c214e667d58ac442b3c6664831fe0eed2941d	2023-04-05T18:56:20+03:00	Georgi Gerganov	readme : change logo + add bindings + add uis + add wiki
M	README.md

commit	ed1c214e667d58ac442b3c6664831fe0eed2941d	0c44427df10ee024b4e7ef7bfec56e993daff1db	2023-04-05T15:06:02Z	iacore	zig : add build.zig (#773)
M	.gitignore
A	build.zig

commit	0c44427df10ee024b4e7ef7bfec56e993daff1db	594cc95fabab0b662dabba3ea619ca5dca18bf6b	2023-04-05T17:38:37+03:00	Ivan Stepanov	make : missing host optimizations in CXXFLAGS (#763)
M	Makefile

commit	594cc95fabab0b662dabba3ea619ca5dca18bf6b	88ed5761b869a221bc26847ff3f6977e7ee6425e	2023-04-05T16:36:12+02:00	Adithya Balaji	readme : update with CMake and windows example (#748)
M	README.md

commit	88ed5761b869a221bc26847ff3f6977e7ee6425e	58c438cf7dfbbef710b1905a453a38a8a9ced07d	2023-04-05T14:32:42Z	at8u	examples : add Miku.sh (#724)
A	examples/Miku.sh

commit	58c438cf7dfbbef710b1905a453a38a8a9ced07d	53dbba769537e894ead5c6913ab2fd3a4658b738	2023-04-05T11:44:24+01:00	Andrew Duffy	Add Accelerate/BLAS when using Swift (#765)
M	Package.swift

commit	53dbba769537e894ead5c6913ab2fd3a4658b738	437e77855a54e69c86fe03bc501f63d9a3fddb0e	2023-04-03T18:00:55+02:00	mgroeber9110	Windows: reactive sigint handler after each Ctrl-C (#736)
M	examples/main/main.cpp

commit	437e77855a54e69c86fe03bc501f63d9a3fddb0e	cd7fa956904cb8e321b72b3499f4a3a82e43c266	2023-04-03T09:52:28+02:00	SebastianApel	10+% performance improvement of ggml_vec_dot_q4_0 on AVX2 (#654)
M	ggml.c

commit	cd7fa956904cb8e321b72b3499f4a3a82e43c266	a0c05164168297c04737936ad0cad849a512547a	2023-04-03T03:19:04+03:00	Ivan Stepanov	Define non-positive temperature behavior (#720)
M	llama.cpp

commit	a0c05164168297c04737936ad0cad849a512547a	d8d4e865cd481b18f10508ffee35db903767ef5c	2023-04-02T15:13:03-07:00	bsilvereagle	Remove torch GPU dependencies from the Docker.full image (#665)
M	.devops/full.Dockerfile

commit	d8d4e865cd481b18f10508ffee35db903767ef5c	e986f94829bae0b9e66b326acbbba179931c84f1	2023-04-02T06:48:57-04:00	Thatcher Chamberlin	Add a missing step to the gpt4all instructions (#690)
M	README.md

commit	e986f94829bae0b9e66b326acbbba179931c84f1	c0bb1d3ce21005ab21d686626ba87261a6e3a660	2023-04-02T12:23:04+02:00	Christian Falch	Added api for getting/setting the kv_cache (#685)
M	llama.cpp
M	llama.h

commit	c0bb1d3ce21005ab21d686626ba87261a6e3a660	6e7801d08d81c931a5427bae46f00763e993f54a	2023-04-02T12:21:31+02:00	Marian Cepok	ggml : change ne to int64_t (#626)
M	ggml.c
M	ggml.h
M	llama.cpp

commit	6e7801d08d81c931a5427bae46f00763e993f54a	81040f10aae3160317c5787c9c59acb219927826	2023-04-02T04:56:20-03:00	Leonardo Neumann	examples : add gpt4all script (#658)
A	examples/gpt4all.sh

commit	81040f10aae3160317c5787c9c59acb219927826	c4f89d8d73aab4318a6c61e3835135adfcf55407	2023-04-02T07:18:53Z	Stephan Walter	llama : do not allocate KV cache for "vocab_only == true" (#682)
M	llama.cpp

commit	c4f89d8d73aab4318a6c61e3835135adfcf55407	5b70e7de4c0b8186669d0c5609ba61a2d46de562	2023-04-02T09:17:05+02:00	Fabian	make : use -march=native -mtune=native on x86 (#609)
M	Makefile

commit	5b70e7de4c0b8186669d0c5609ba61a2d46de562	a717cba8440b380f43cd3e2510862fc1ea3de9a2	2023-04-01T23:41:12-03:00	Murilo Santana	fix default params for examples/main (#697)
M	examples/common.cpp

commit	a717cba8440b380f43cd3e2510862fc1ea3de9a2	d0a7f742e76bb48c0bd852f0b3bf09ec0b75b200	2023-04-02T01:38:18+09:00	Ikko Eltociear Ashimine	py: huggingface -> Hugging Face (#686)
M	convert-ggml-to-pth.py

commit	d0a7f742e76bb48c0bd852f0b3bf09ec0b75b200	0d054e292e5492981867be69c788edd04dc8adeb	2023-04-01T11:57:30-03:00	rimoliga	readme: replace termux links with homepage, play store is deprecated (#680)
M	README.md

commit	0d054e292e5492981867be69c788edd04dc8adeb	3525899277d2e2bdc8ec3f0e6e40c47251608700	2023-03-31T20:03:48+02:00	Slaren	Show error message when -f fails
M	examples/common.cpp

commit	3525899277d2e2bdc8ec3f0e6e40c47251608700	1d08882afa647c44195f4f6495a68ea455650cae	2023-03-31T19:19:16Z	Stephan Walter	Enable -std= for cmake builds, fix warnings (#598)
M	CMakeLists.txt
M	ggml.c

commit	1d08882afa647c44195f4f6495a68ea455650cae	02c5b27e91a6d18cf1043d3a2d8dbc59610ac257	2023-03-31T17:55:52+02:00	slaren	Optimize AVX2 ggml_vec_dot_q4_0 (#642)
M	ggml.c

commit	02c5b27e91a6d18cf1043d3a2d8dbc59610ac257	cbef542879962fdc491656cd0c8cadd65a5f1356	2023-03-31T16:55:44+05:00	perserk	Add AVX acceleration (#617)
M	ggml.c

commit	cbef542879962fdc491656cd0c8cadd65a5f1356	9733104be5389ebb1ff05095eca2a70280cd875a	2023-03-29T21:31:24+02:00	Pavol Rusnak	py : cleanup the code
M	convert-ggml-to-pth.py
M	convert-gpt4all-to-ggml.py
M	convert-gptq-to-ggml.py
M	convert-pth-to-ggml.py
M	convert-unversioned-ggml-to-ggml.py
M	migrate-ggml-2023-03-30-pr613.py

commit	9733104be5389ebb1ff05095eca2a70280cd875a	3df890aef432ce68143cfafcd7caf828bc4c3e55	2023-03-31T00:52:06+02:00	Pavol Rusnak	drop quantize.py (now that models are using a single file)
M	README.md
D	quantize.py

commit	3df890aef432ce68143cfafcd7caf828bc4c3e55	ee0c40dd6de8c3c658ae43199939ef40bb1cf408	2023-03-30T22:31:54+03:00	Georgi Gerganov	readme : update supported models
M	README.md

commit	ee0c40dd6de8c3c658ae43199939ef40bb1cf408	6f23ba5ee235cbcb1eedd63b98422dd8d4392a78	2023-03-30T05:42:56-07:00	Justine Tunney	Introduce GGML migration tool for new file format
M	convert-pth-to-ggml.py
M	llama.cpp
A	migrate-ggml-2023-03-30-pr613.py

commit	6f23ba5ee235cbcb1eedd63b98422dd8d4392a78	78ca9838ee36660a776e97e3391b6fb5dcaacf7f	2023-03-30T01:53:36-07:00	Justine Tunney	Ensure --mlock works properly with mmap() support
M	ggml.c
M	ggml.h
M	llama.cpp

commit	78ca9838ee36660a776e97e3391b6fb5dcaacf7f	a017390358cdb23fffb30988dc84bb190d0403ca	2023-03-29T13:51:37-07:00	Justine Tunney	Make loading weights 10-100x faster
M	.gitignore
M	convert-ggml-to-pth.py
M	convert-gptq-to-ggml.py
M	convert-pth-to-ggml.py
M	llama.cpp
M	llama.h
M	models/ggml-vocab.bin

commit	a017390358cdb23fffb30988dc84bb190d0403ca	ac184d514723902f9b05b688703b1be6e8dc65de	2023-03-29T22:22:36+02:00	Slaren	Initial windows support (untested)
M	llama.cpp

commit	ac184d514723902f9b05b688703b1be6e8dc65de	276e5b781155e3bbe6834472c58f03dfe62efabe	2023-03-29T08:53:14+02:00	Slaren	Always initialize mm_addr and mm_length in llama_model
M	llama.cpp

commit	276e5b781155e3bbe6834472c58f03dfe62efabe	d68c5dc4356c8f49e933df210f2ceca5002a8118	2023-03-29T08:31:26+02:00	Slaren	Unmap the file in llama_free
M	llama.cpp

commit	d68c5dc4356c8f49e933df210f2ceca5002a8118	64bde3ffd4aef799acb790a3eedddbd0a0612108	2023-03-29T06:18:18+02:00	Slaren	Make mmap_file static
M	llama.cpp

commit	64bde3ffd4aef799acb790a3eedddbd0a0612108	c03ae8dca1d7c451054754979e60a6de1f64c3cd	2023-03-29T05:38:57+02:00	Slaren	Fix ggml_init_params in quantize
M	examples/quantize/quantize.cpp
M	llama.cpp

commit	c03ae8dca1d7c451054754979e60a6de1f64c3cd	3bcc129ba881c99795e850b0a23707a4dfdabe9d	2023-03-29T02:03:43+02:00	Slaren	Add mmap support for model files
M	ggml.c
M	ggml.h
M	llama.cpp

commit	3bcc129ba881c99795e850b0a23707a4dfdabe9d	a4755cf288deb83df646f91f8fc98613271322db	2023-03-30T17:56:59Z	Stephan Walter	cmake : properly invoke CTest (#629)
M	CMakeLists.txt

commit	a4755cf288deb83df646f91f8fc98613271322db	1f0414feecc336482163af6c1e5650f9373ed8c9	2023-03-30T10:53:35-07:00	Casey Primozic	Remove unused variable (#607)
M	ggml.c

commit	1f0414feecc336482163af6c1e5650f9373ed8c9	77efdf5a501b1140801da5cd8751e9f9b259ec32	2023-03-30T13:34:45-04:00	david raistrick	make : fix darwin f16c flags check (#615)
M	Makefile

commit	77efdf5a501b1140801da5cd8751e9f9b259ec32	ed3c680bcd0e8ce6e574573ba95880b694449878	2023-03-30T20:27:32+03:00	Georgi Gerganov	ggml : fix NEON signs (close #620, #622)
M	ggml.c

commit	ed3c680bcd0e8ce6e574573ba95880b694449878	9cbc404ba6699a9ba4925ea25a60552b13491c7a	2023-03-30T11:16:30+02:00	slaren	Fix GGML_F32Cx8_STORE in AVX without F16C path (#619)
M	ggml.c

commit	9cbc404ba6699a9ba4925ea25a60552b13491c7a	b51c717d5cf9181c33afcb84554e47f6d539c891	2023-03-29T23:44:39+03:00	anzz1	ci : re-enable AVX512 testing (Windows-MSVC) (#584)
M	.github/workflows/build.yml

commit	b51c717d5cf9181c33afcb84554e47f6d539c891	0ba76c1e73ae21038b80bfb5a746157376c88173	2023-03-29T22:15:34+03:00	Georgi Gerganov	ggml : init time on first ggml_init() call
M	ggml.c

commit	0ba76c1e73ae21038b80bfb5a746157376c88173	cea1c859483a5cfc7e2b31a06f8561d7a7604870	2023-03-29T22:13:12+03:00	Georgi Gerganov	llama : fix compile warnings when reading the vocab
M	llama.cpp

commit	cea1c859483a5cfc7e2b31a06f8561d7a7604870	f202ada131f60059112a948f660b2e0ac93d049a	2023-03-29T22:10:01+03:00	Georgi Gerganov	ggml : add ARM_NEON dequantize_row_q4_1()
M	ggml.c

commit	f202ada131f60059112a948f660b2e0ac93d049a	3b44d30d9b618f0f2eb9abcfe912770a4e7d85d4	2023-03-29T22:03:02+03:00	Georgi Gerganov	ggml : add ARM_NEON quantize_row_q4_1()
M	ggml.c

commit	3b44d30d9b618f0f2eb9abcfe912770a4e7d85d4	61cbfff5c95e45236883b1b60e025f8f6fa8c8a3	2023-03-29T21:47:33+03:00	Georgi Gerganov	ggml : add ARM_NEON ggml_vec_dot_q4_1()
M	ggml.c

commit	61cbfff5c95e45236883b1b60e025f8f6fa8c8a3	d9ad104440d84a0cc0734bff47ef0ba41ba740c4	2023-03-29T20:09:25+02:00	Pavol Rusnak	rename convert_ggml_to_pth.py -> convert-ggml-to-pth.py (#600)
R100	convert_ggml_to_pth.py	convert-ggml-to-pth.py

commit	d9ad104440d84a0cc0734bff47ef0ba41ba740c4	b467702b87461543c75013207e9adc6d20dcc01d	2023-03-29T19:21:09+02:00	Thérence	Create chat-13B.bat (#592)
A	examples/chat-13B.bat

commit	b467702b87461543c75013207e9adc6d20dcc01d	516d88e75c9e768c0001a452dbad212494c586b3	2023-03-29T19:38:31+03:00	Georgi Gerganov	readme : fix typos
M	README.md

commit	516d88e75c9e768c0001a452dbad212494c586b3	53635c081c49321d523567112f9fddfbba6b787b	2023-03-29T19:37:20+03:00	Georgi Gerganov	readme : add GPT4All instructions (close #588)
M	README.md

commit	53635c081c49321d523567112f9fddfbba6b787b	41318d708ed196ff727dce14d263a64b23c7333d	2023-03-29T19:29:26+03:00	Georgi Gerganov	py : add GPT4All conversion script
A	convert-gpt4all-to-ggml.py
M	convert-unversioned-ggml-to-ggml.py

commit	41318d708ed196ff727dce14d263a64b23c7333d	a6956b25a1c783e5e96fe06c9c00438f846ef047	2023-03-29T18:10:07+02:00	Maël Kerbiriou	llama : use the same threshold for OpenBLAS and ggml thread limiting (#577)
M	llama.cpp

commit	a6956b25a1c783e5e96fe06c9c00438f846ef047	83df5639eb182ed7c122382907691d8baa3c32df	2023-03-29T17:10:24+02:00	Tobias Lütke	add example of re-act pattern (#583)
A	examples/reason-act.sh
A	prompts/reason-act.txt

commit	83df5639eb182ed7c122382907691d8baa3c32df	a5c42c4b13b3be9e58fe8f9adbb6ee60417674a6	2023-03-29T16:20:07+03:00	anzz1	Fix GCC warning about binary literal (#595)
M	ggml.c

commit	a5c42c4b13b3be9e58fe8f9adbb6ee60417674a6	5a5f8b1501fbb34367225544010ddfc306d6d2fe	2023-03-29T16:19:29+03:00	anzz1	Fix typo in llama.h (#593)
M	llama.h

commit	5a5f8b1501fbb34367225544010ddfc306d6d2fe	f1217055eaedfc7214be93d98e529cae89830430	2023-03-28T22:44:29+03:00	anzz1	Enable Fused-Multiply-Add (FMA) and F16C/CVT16 vector extensions on MSVC (#375)
M	ggml.c

commit	f1217055eaedfc7214be93d98e529cae89830430	7f4c5c66514227c3870c2bd189fb0609fdd0de10	2023-03-28T22:43:25+03:00	anzz1	CI: fix subdirectory path globbing (#546)
M	.github/workflows/build.yml

commit	7f4c5c66514227c3870c2bd189fb0609fdd0de10	2a98bc18ea34dbf15f261a0df37080e588a189d1	2023-03-28T21:23:09+03:00	anzz1	llama : fix linkage with mingw (#551)
M	examples/embedding/CMakeLists.txt
M	examples/main/CMakeLists.txt
M	examples/perplexity/CMakeLists.txt
M	examples/quantize/CMakeLists.txt
M	llama.h

commit	2a98bc18ea34dbf15f261a0df37080e588a189d1	d0aaff571cd5c316b68e3e11d57e274bfd2bd457	2023-03-28T20:06:03+02:00	slaren	ggml : add AVX2 implementation of quantize_row_q4_1 (#515)
M	ggml.c

commit	d0aaff571cd5c316b68e3e11d57e274bfd2bd457	d0330fd783d7c67349cdcce4a56604ef0aeccdb5	2023-03-28T19:55:42+02:00	thement	py : add temporary script to convert old ggml files to newer version (#539)
A	convert-unversioned-ggml-to-ggml.py
M	llama.cpp

commit	d0330fd783d7c67349cdcce4a56604ef0aeccdb5	99c5b2765422232ebb4414f5a63693d734406a7f	2023-03-28T13:51:29-04:00	Tai Duc Nguyen	py : add capabiliy to convert from ggml back to torch or hf format for further consumption/training/finetuning (#403)
A	convert_ggml_to_pth.py

commit	99c5b2765422232ebb4414f5a63693d734406a7f	692ce3164ef1201ecb9cfad315cc0a08b965adb8	2023-03-28T17:13:01Z	Stephan Walter	ggml : refactor quantized processing functions (#509)
M	ggml.c

commit	692ce3164ef1201ecb9cfad315cc0a08b965adb8	96f9c0506fa81cada6f96f45768c34f45406c4bb	2023-03-29T02:02:34+09:00	DooWoong Lee (David)	py : removed unused `model` variable and verified that the code functions correctly with `vocab_only` setting. Also confirmed that the code works as expected after running with reduced memory usage due to deletion of no-longer-needed variable. (#547)
M	convert-pth-to-ggml.py

commit	96f9c0506fa81cada6f96f45768c34f45406c4bb	d502bc7c9d9d6dfb3a09aea404395b666d7b374d	2023-03-28T20:01:09+03:00	Georgi Gerganov	ci : make ctest verbose, hopefully we see what is wrong with the sanitizer
M	.github/workflows/build.yml

commit	d502bc7c9d9d6dfb3a09aea404395b666d7b374d	436e56193199a1625f8c561069f702e8840a9e08	2023-03-28T19:51:55+03:00	Georgi Gerganov	tests : free llama context at the end of the test
M	CMakeLists.txt
M	tests/test-tokenizer-0.cpp

commit	436e56193199a1625f8c561069f702e8840a9e08	20e1e84884376b3fb44ffbfd48d478b2934b0b5e	2023-03-28T16:48:20Z	Stephan Walter	all : be more strict about converting float to double (#458)
M	CMakeLists.txt
M	Makefile
M	examples/common.cpp
M	examples/main/main.cpp
M	examples/perplexity/perplexity.cpp
M	examples/quantize/quantize.cpp
M	ggml.c
M	llama.cpp
M	llama.h
M	tests/CMakeLists.txt
A	tests/test-double-float.c

commit	20e1e84884376b3fb44ffbfd48d478b2934b0b5e	c1f885067c61191a07a1aedf684168dda62f3f71	2023-03-28T11:39:01-05:00	Jed Fox	deploy : add a Package.swift for SwiftPM support (#393)
M	.gitignore
A	Package.swift
A	spm-headers/llama.h

commit	c1f885067c61191a07a1aedf684168dda62f3f71	e0670260fb50a882b37074112b1881fb0820cf77	2023-03-28T15:56:03Z	Stephan Walter	ggml : introduce structs for the q4 data blocks (#356)
M	examples/quantize/quantize.cpp
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	tests/test-quantize.c

commit	e0670260fb50a882b37074112b1881fb0820cf77	28ba975aea1dcae2f31770516f5d542ff177771e	2023-03-28T18:34:35+03:00	Georgi Gerganov	gitignore : add "embedding"
M	.gitignore

commit	28ba975aea1dcae2f31770516f5d542ff177771e	a6bdc47cba23713a22ade47dd65b6afeb8009ff4	2023-03-28T23:06:28+08:00	dotpy314	Check the existence of f16_model_path_base in quantize.py (#574)
M	quantize.py

commit	a6bdc47cba23713a22ade47dd65b6afeb8009ff4	7b8dbcb78b2f65c4676e41da215800d65846edd0	2023-03-28T16:26:55+02:00	slaren	Fix usage of F16C intrinsics in AVX code (#563)
M	ggml.c

commit	7b8dbcb78b2f65c4676e41da215800d65846edd0	4b8efff0e3945090379aa2f897ff125c8f9cdbae	2023-03-28T17:09:55+03:00	anzz1	main.cpp fixes, refactoring (#571)
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	4b8efff0e3945090379aa2f897ff125c8f9cdbae	7e5395575a3360598f2565c73c8a2ec0c0abbdb8	2023-03-28T08:11:09+02:00	RJ Adriaansen	Add embedding example to Makefile (#540)
M	Makefile

commit	7e5395575a3360598f2565c73c8a2ec0c0abbdb8	34c1072e497eb92d81ee7c0e12aa6741496a41c6	2023-03-27T06:55:26+02:00	Marco Matthies	Fix missing ggml link in cmake for examples/* on w64-mingw32 (#542)
M	examples/embedding/CMakeLists.txt
M	examples/main/CMakeLists.txt
M	examples/perplexity/CMakeLists.txt
M	examples/quantize/CMakeLists.txt

commit	34c1072e497eb92d81ee7c0e12aa6741496a41c6	939ad2d3a56815f480b6fd5ea432a7ee576a7e6b	2023-03-26T17:48:40+02:00	Erik Scholz	ci: add debug build to sanitizer build matrix (#527)
M	.github/workflows/build.yml

commit	939ad2d3a56815f480b6fd5ea432a7ee576a7e6b	8c2ec5e21d580c99e257c3cfddcf21fa53229aa4	2023-03-26T15:34:02Z	Stephan Walter	Fix undefined variables in debug build, remove unused variables (#531)
M	ggml.c

commit	8c2ec5e21d580c99e257c3cfddcf21fa53229aa4	b391579db92f095666be1d979899b54ae0981573	2023-03-26T10:48:42-04:00	Juan Calderon-Perez	Add support for linux/arm64 platform during Docker Builds (#514)
M	.github/workflows/docker.yml

commit	b391579db92f095666be1d979899b54ae0981573	7a87d31f4f0c37bbb2ea695929fa4fe3ad579cda	2023-03-26T13:14:01Z	Stephan Walter	Update README and comments for standalone perplexity tool (#525)
M	README.md
M	examples/perplexity/perplexity.cpp

commit	7a87d31f4f0c37bbb2ea695929fa4fe3ad579cda	348d6926ee31d4476f9b90e1a627b0925a70f847	2023-03-26T16:06:10+03:00	anzz1	[main] fix infinite generation (-n == -1) (#523)
M	examples/main/main.cpp

commit	348d6926ee31d4476f9b90e1a627b0925a70f847	33e35b8fe8f09adcac0632e9cece62e1dd629f7d	2023-03-26T10:20:49+03:00	Georgi Gerganov	Add logo to README.md
M	README.md

commit	33e35b8fe8f09adcac0632e9cece62e1dd629f7d	19726169b379bebc96189673a19b89ab1d307659	2023-03-26T07:25:46+02:00	Harald Fernengel	Exit from interactive mode if input stream is bad (#491)
M	examples/main/main.cpp

commit	19726169b379bebc96189673a19b89ab1d307659	f732695cd57fb41e3a1be625cec4edf5be45b40a	2023-03-26T00:13:28+02:00	anzz1	CI: Run other sanitizer builds even if one fails (#511)
M	.github/workflows/build.yml

commit	f732695cd57fb41e3a1be625cec4edf5be45b40a	2f7bf7dd7cd7299874d582f7f34834418abf4057	2023-03-25T14:53:55-07:00	jp-x-g	Clarify console output in convert-pth-to-ggml.py (#512)
M	convert-pth-to-ggml.py

commit	2f7bf7dd7cd7299874d582f7f34834418abf4057	34ab5268432fd287caa68d60bdd8aef411def3fa	2023-03-25T23:38:11+02:00	anzz1	CMake / CI additions (#497)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	34ab5268432fd287caa68d60bdd8aef411def3fa	c2b25b6912662d2637d9c6e6df3a5de931e0d7ce	2023-03-25T22:29:22+02:00	anzz1	(Windows) Set console to UTF-8 on init (#420)
M	examples/main/main.cpp

commit	c2b25b6912662d2637d9c6e6df3a5de931e0d7ce	79b2b266db6b198b5af450982c3cd61120fac951	2023-03-25T21:53:39+02:00	Georgi Gerganov	Fix colors enabling on WIN32
M	examples/main/main.cpp

commit	79b2b266db6b198b5af450982c3cd61120fac951	e2d490dafd860eaaaf9aa8008ab790527d556daf	2023-03-25T21:51:41+02:00	Georgi Gerganov	If n_predict == -1, generate forever
M	examples/chat.sh
M	examples/common.cpp
M	examples/main/main.cpp

commit	e2d490dafd860eaaaf9aa8008ab790527d556daf	03f7e335604b3d68f74995aa2ccb4955833ee423	2023-03-25T21:36:22+02:00	Georgi Gerganov	Inifinite generation via context swapping (#71)
M	examples/chat.sh
M	examples/common.cpp
M	examples/common.h
M	examples/main/main.cpp

commit	03f7e335604b3d68f74995aa2ccb4955833ee423	55ad42af845127bd0eb0c1f36f327ecec83f4bca	2023-03-25T20:51:14+02:00	Georgi Gerganov	Cleanup STL headers + fix embedding examples + minor stuff
M	examples/embedding/embedding.cpp
M	examples/perplexity/perplexity.cpp
M	llama.cpp
M	llama.h

commit	55ad42af845127bd0eb0c1f36f327ecec83f4bca	459e93cce07cab9052c06b5bf360819893442e1e	2023-03-25T20:36:52+02:00	Georgi Gerganov	Move chat scripts into "./examples"
M	README.md
R089	alpaca.sh	examples/alpaca.sh
R100	examples/chatLLaMa	examples/chat-13B.sh
R089	chat.sh	examples/chat.sh

commit	459e93cce07cab9052c06b5bf360819893442e1e	a316a425d04027453dc0fd45f003b647c12f66f9	2023-03-25T19:31:48+01:00	slaren	Add AVX2 implementation of dequantize_row_q4_1 (#505)
M	ggml.c

commit	a316a425d04027453dc0fd45f003b647c12f66f9	ecbe466a364876927994e2f1ec14f4d82301d201	2023-03-25T20:26:40+02:00	Georgi Gerganov	Overhaul the examples structure
M	.gitignore
M	CMakeLists.txt
M	Makefile
A	examples/CMakeLists.txt
R099	utils.cpp	examples/common.cpp
R100	utils.h	examples/common.h
A	examples/embedding/CMakeLists.txt
A	examples/embedding/README.md
A	examples/embedding/embedding.cpp
A	examples/main/CMakeLists.txt
A	examples/main/README.md
R076	main.cpp	examples/main/main.cpp
A	examples/perplexity/CMakeLists.txt
A	examples/perplexity/README.md
A	examples/perplexity/perplexity.cpp
A	examples/quantize/CMakeLists.txt
A	examples/quantize/README.md
R100	quantize.cpp	examples/quantize/quantize.cpp
M	ggml.c
M	tests/CMakeLists.txt
M	tests/test-tokenizer-0.cpp

commit	ecbe466a364876927994e2f1ec14f4d82301d201	502a400192013d3e95ed87b777e8fa3bec45713c	2023-03-25T19:47:21+02:00	Georgi Gerganov	Retire the ggml_mul_mat() branch for transposed src0 (#500)
M	ggml.c

commit	502a400192013d3e95ed87b777e8fa3bec45713c	09aecbf6283bbce9449e2d96000073145aaaf5fc	2023-03-25T17:16:50+02:00	Georgi Gerganov	Disable prompt verbosity by default and add option to enable (#480)
M	main.cpp
M	utils.cpp
M	utils.h

commit	09aecbf6283bbce9449e2d96000073145aaaf5fc	4640eff23d341a0273587800e17ff4a378132d60	2023-03-25T16:06:49+01:00	slaren	Add AVX2 implementation of dequantize_row_q4_0 (#467)
M	ggml.c

commit	4640eff23d341a0273587800e17ff4a378132d60	ab77d7631211b299cb734bea6ad1f74324154150	2023-03-25T17:03:10+02:00	Georgi Gerganov	Don't interefe with BLAS for large prompts by running only 1 thread
M	llama.cpp

commit	ab77d7631211b299cb734bea6ad1f74324154150	29b7baab670ae8b76ac0da21c2ded69ff18971ee	2023-03-25T16:47:59+02:00	Georgi Gerganov	Add longer DAN prompt for testing big batch numbers
A	prompts/dan.txt

commit	29b7baab670ae8b76ac0da21c2ded69ff18971ee	4a7129acd2e939b92d70dd568c746f2fa078232c	2023-03-25T15:34:23+01:00	slaren	Add timings for the prompt evaluation (#478)
M	llama.cpp

commit	4a7129acd2e939b92d70dd568c746f2fa078232c	6b6dbc8910c6d53f4d96c46c8fcec70e2cd435d8	2023-03-25T16:30:32+02:00	Georgi Gerganov	Remove obsolete information from README
M	README.md

commit	6b6dbc8910c6d53f4d96c46c8fcec70e2cd435d8	2a2e63ce0503d9bf3e55283e40a052c78c1cc3a8	2023-03-25T16:22:05+02:00	Georgi Gerganov	Remove obsolete assert and fix compiler warning
M	ggml.c
M	main.cpp

commit	2a2e63ce0503d9bf3e55283e40a052c78c1cc3a8	e899bf54b291e8c84173a0e534a2c262f3f63229	2023-03-25T16:09:54+02:00	Georgi Gerganov	Fix nasty bug in ggml_compute_forward_mul_mat_f32() and reenable BLAS
M	ggml.c
M	llama.cpp

commit	e899bf54b291e8c84173a0e534a2c262f3f63229	fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c	2023-03-25T14:42:09+02:00	anzz1	bounds checking for input prefix (#492)
M	utils.cpp

commit	fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c	58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae	2023-03-25T14:03:19+02:00	anzz1	feat: '--in-prefix STRING' option (#426)
M	main.cpp
M	utils.cpp
M	utils.h

commit	58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae	36d07532ef7ccf0bdc12e050472f359a6794957f	2023-03-25T01:26:28-04:00	Jed Fox	Add support for file load progress reporting callbacks (#434)
M	llama.cpp
M	llama.h

commit	36d07532ef7ccf0bdc12e050472f359a6794957f	6f1ee4b640912211a4b07965c585d327e32e734d	2023-03-25T01:21:24-04:00	Doomsdayrs	Add missing struct annotation (#483)
M	llama.h

commit	6f1ee4b640912211a4b07965c585d327e32e734d	8520fc310eab87f2c4612f2a00d4adbd44a20d0d	2023-03-24T23:38:14-05:00	Chris Kuehl	Fix crash for 65B model with pre-allocated memory (#485)
M	llama.cpp

commit	8520fc310eab87f2c4612f2a00d4adbd44a20d0d	b3f460e94139cb24b0af81cc8bc10eb86269d704	2023-03-24T23:47:06+02:00	Georgi Gerganov	Disable BLAS altogether - the bug is not just for qunatized mat mul
M	ggml.c

commit	b3f460e94139cb24b0af81cc8bc10eb86269d704	04c6f5ed6fafd63601fa06757877ed5ccf9d5991	2023-03-24T23:39:17+02:00	Georgi Gerganov	Disable BLAS branch in mul_mat - seems there is a bug
M	ggml.c

commit	04c6f5ed6fafd63601fa06757877ed5ccf9d5991	7a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d	2023-03-24T23:17:58+02:00	Georgi Gerganov	Immediately start processing the prompt before user input has been provided (#476)
M	alpaca.sh
M	chat.sh
M	examples/chatLLaMa
M	main.cpp

commit	7a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d	31572d966531f7d768eb773322016ab78eb6e835	2023-03-24T23:17:37+02:00	Georgi Gerganov	Reduce memory usage and allocate enough memory for largest context (#473)
M	ggml.c
M	llama.cpp
M	main.cpp
M	utils.cpp
M	utils.h

commit	31572d966531f7d768eb773322016ab78eb6e835	f4f5362edb01b05c383b23f36d7b3489c77061b5	2023-03-24T18:23:56+02:00	Georgi Gerganov	Temporary bump the memory buffer size - hopefully fix issues from 483bab2e
M	llama.cpp

commit	f4f5362edb01b05c383b23f36d7b3489c77061b5	863f65e2e32dc1e6d23c96a4811bf382d6b2a548	2023-03-24T15:23:09Z	Gary Mulder	Update README.md (#444)
M	README.md

commit	863f65e2e32dc1e6d23c96a4811bf382d6b2a548	afd220d9c665e4c19107120ace2f0cb742e28aa1	2023-03-24T10:22:39-05:00	rabidcopy	fix instruct mode (#445)
M	main.cpp

commit	afd220d9c665e4c19107120ace2f0cb742e28aa1	481044d50cfe8eaa6cd0c1a1b445680e4b0b3ebc	2023-03-24T17:21:01+02:00	Georgi Gerganov	Properly free llama_context on failure
M	llama.cpp

commit	481044d50cfe8eaa6cd0c1a1b445680e4b0b3ebc	563cdc391dde140f1084d1012234e8e6f57f881f	2023-03-24T08:19:26-07:00	Cameron Kaiser	additional optimizations for POWER9 (#454)
M	Makefile
M	ggml.c

commit	563cdc391dde140f1084d1012234e8e6f57f881f	8d4a855c241ecb0f3ddc03447fe56002ebf27a37	2023-03-24T08:19:05-07:00	comex	Support calling mlock() on loaded model data on Linux and macOS (#453)
M	ggml.c
M	ggml.h
M	llama.cpp
M	llama.h
M	main.cpp
M	utils.cpp
M	utils.h

commit	8d4a855c241ecb0f3ddc03447fe56002ebf27a37	b6b268d4415fd3b3e53f22b6619b724d4928f713	2023-03-24T08:05:13-07:00	Luciano	Add embedding mode with arg flag. Currently working (#282)
M	llama.cpp
M	llama.h
M	main.cpp
M	utils.cpp
M	utils.h

commit	b6b268d4415fd3b3e53f22b6619b724d4928f713	3cd8dde0d1357b7f11bdd25c45d5bf5e97e284a0	2023-03-24T09:13:35+02:00	Georgi Gerganov	Add link to Roadmap discussion
M	README.md

commit	3cd8dde0d1357b7f11bdd25c45d5bf5e97e284a0	4870e455b3653f7d7769fa5772b2c90ffad088df	2023-03-24T06:22:28+02:00	Georgi Gerganov	Revert "Fix memory allocation issues and seg faults"
M	llama.cpp

commit	4870e455b3653f7d7769fa5772b2c90ffad088df	483bab2e3d4a868fe679d8bb32827d2a4df214dc	2023-03-24T00:11:53+02:00	Georgi Gerganov	Fix memory allocation issues and seg faults
M	llama.cpp

commit	483bab2e3d4a868fe679d8bb32827d2a4df214dc	404e1da38ec8025707031a8027da14dc1590f952	2023-03-23T23:22:01+02:00	Georgi Gerganov	Avoid the transposed X branch in the Z = X * Y matrix multiplication (#439)
M	llama.cpp

commit	404e1da38ec8025707031a8027da14dc1590f952	4cc053b6d5e9df7ac21fa06b7208a70c156d4d7a	2023-03-23T16:42:52-04:00	Jed Fox	Fix quantize script not finding models in parent directory (#428)
M	quantize.py

commit	4cc053b6d5e9df7ac21fa06b7208a70c156d4d7a	0ba5a3a9a5efedb1aeecbbc70a4e9825542472d5	2023-03-23T22:39:44+02:00	Georgi Gerganov	Remove oboslete command from Docker script
M	.devops/tools.sh

commit	0ba5a3a9a5efedb1aeecbbc70a4e9825542472d5	2e17dfd80a473099dacc0f41c9146d233c6a5972	2023-03-23T22:32:02+02:00	Georgi Gerganov	Obsolete
D	download-pth.py

commit	2e17dfd80a473099dacc0f41c9146d233c6a5972	20a1a4e09c522a80e2a0db51643d25fa38326065	2023-03-23T15:22:47-05:00	rabidcopy	Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333)
M	main.cpp

commit	20a1a4e09c522a80e2a0db51643d25fa38326065	ad072fc5ad6f6905a7224ff6ea07c0644aa075b1	2023-03-23T10:18:13-10:00	Timmy Knight	Fix GPTQ converter (#423)
M	convert-gptq-to-ggml.py

commit	ad072fc5ad6f6905a7224ff6ea07c0644aa075b1	ea10d3ded2994106596ddf8e4ed02741b3e053e6	2023-03-24T05:16:48+09:00	nusu-github	Generate library with CMake (#430)
M	CMakeLists.txt

commit	ea10d3ded2994106596ddf8e4ed02741b3e053e6	a18c19259a3cb9dec332d613e8f15704f678a468	2023-03-23T19:54:28+02:00	anzz1	Command line args bounds checking (#424)
M	utils.cpp

commit	a18c19259a3cb9dec332d613e8f15704f678a468	a50e39c6fe36be3de0941b3c05aaf9c37912fd47	2023-03-22T00:37:02-05:00	Ben Siraphob	Fix Nix build
M	flake.nix

commit	a50e39c6fe36be3de0941b3c05aaf9c37912fd47	a140219e81cfb80356438112cd2290d701b282bb	2023-03-23T14:15:48Z	Stephan Walter	Revert "Delete SHA256SUMS for now" (#429)
M	README.md
A	SHA256SUMS

commit	a140219e81cfb80356438112cd2290d701b282bb	8a3e5ef801339e57b9b0449220e9ffb11a6648e2	2023-03-23T05:41:32-06:00	Kerfuffle	Fix Makefile echo escape codes (by removing them). (#418)
M	Makefile

commit	8a3e5ef801339e57b9b0449220e9ffb11a6648e2	8eea5ae0e5f31238a97c79ea9103c27647380e37	2023-03-23T11:30:40Z	Gary Mulder	Move model section from issue template to README.md (#421)
M	.github/ISSUE_TEMPLATE/custom.md
M	README.md

commit	8eea5ae0e5f31238a97c79ea9103c27647380e37	93208cfb929c2323e5d2ac6bf354e278040e70ed	2023-03-23T12:26:19+02:00	anzz1	Delete SHA256SUMS for now (#416)
D	SHA256SUMS

commit	93208cfb929c2323e5d2ac6bf354e278040e70ed	03ace14cfd68a1289ac3b76563534c8ee72a2e53	2023-03-23T10:46:58+02:00	Georgi Gerganov	Adjust repetition penalty ..
M	README.md

commit	03ace14cfd68a1289ac3b76563534c8ee72a2e53	e4412b45e395981068d2850d3fa04cc16c77d70d	2023-03-23T09:48:51+02:00	Georgi Gerganov	Add link to recent podcast about whisper.cpp and llama.cpp
M	README.md

commit	e4412b45e395981068d2850d3fa04cc16c77d70d	f7dc43bc0d759732815856183246f167111587ad	2023-03-23T04:20:34+02:00	anzz1	CI: CMake: Separate build and test steps (#376)
M	.github/workflows/build.yml

commit	f7dc43bc0d759732815856183246f167111587ad	ee8a7887865a893be208e0a92d6d94d2cb66a789	2023-03-23T01:30:23+01:00	tjohnman	Fix instruct mode broken by PR #354 (#409)
M	main.cpp

commit	ee8a7887865a893be208e0a92d6d94d2cb66a789	69c92298a9e36dc2363b3bf50452976ce49487b3	2023-03-22T19:06:18Z	Gary Mulder	Update issue template so people will use it (#404)
M	.github/ISSUE_TEMPLATE/custom.md

commit	69c92298a9e36dc2363b3bf50452976ce49487b3	97940520e8fd49c56bb29b71cc350190b723513f	2023-03-22T17:29:06Z	Stephan Walter	Deduplicate q4 quantization functions (#383)
M	.github/workflows/build.yml
M	ggml.c
M	ggml.h
M	tests/CMakeLists.txt
A	tests/test-quantize.c

commit	97940520e8fd49c56bb29b71cc350190b723513f	305ba6f0e6daa3796aad9dd18053a1945dd4cc58	2023-03-22T18:20:25+01:00	Valentyn Bezshapkin	fix: add POSIX functionality for Linux compilation (#51)
M	ggml.c

commit	305ba6f0e6daa3796aad9dd18053a1945dd4cc58	4122dffff958cd137175b58f1f27c0913528d7ba	2023-03-22T18:16:35+01:00	tjohnman	Don't force immediate interactive without `-i` (#354)
M	main.cpp
M	utils.cpp
M	utils.h

commit	4122dffff958cd137175b58f1f27c0913528d7ba	56e659a0b271436e24813a801640d015e7b05328	2023-03-22T17:37:10+01:00	Erik Scholz	cmake: make llama an actual library (#392)
M	CMakeLists.txt

commit	56e659a0b271436e24813a801640d015e7b05328	40ea807a972ec7b5a426f034ebfa593b5e7a06ed	2023-03-22T17:09:38+01:00	Erik Scholz	fix perplexity after c-api refactor (#390)
M	main.cpp
M	utils.cpp

commit	40ea807a972ec7b5a426f034ebfa593b5e7a06ed	d5850c53ca179b9674b98f35d359763416a3cc11	2023-03-22T08:53:54-07:00	Gary Linscott	Add details on perplexity to README.md (#395)
M	README.md

commit	d5850c53ca179b9674b98f35d359763416a3cc11	ae44e23ee36c02da0e37ab508a4b473ace724f8e	2023-03-22T11:55:45+03:00	Yusuf Kağan Hanoğlu	Add missing header for memcpy (#386)
M	llama.cpp

commit	ae44e23ee36c02da0e37ab508a4b473ace724f8e	928480ef5b7b03d7a07e98286aebe3d8b24457d9	2023-03-22T07:47:15+02:00	Georgi Gerganov	When seed <= 0 - use the clock to generate one
M	main.cpp
M	utils.cpp

commit	928480ef5b7b03d7a07e98286aebe3d8b24457d9	56817b1f882b1894daa4051d0de0bf9a0926d315	2023-03-22T07:45:00+02:00	Georgi Gerganov	Init llama_context_params properly from CLI (#370)
M	llama.cpp
M	main.cpp

commit	56817b1f882b1894daa4051d0de0bf9a0926d315	f5a77a629bd0f37ae1696747633ab42a5530ec15	2023-03-22T07:34:02+02:00	Georgi Gerganov	Remove temporary notice and update hot topics
M	README.md

commit	f5a77a629bd0f37ae1696747633ab42a5530ec15	da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b	2023-03-22T07:32:36+02:00	Georgi Gerganov	Introduce C-style API (#370)
M	CMakeLists.txt
M	Makefile
M	convert-pth-to-ggml.py
M	ggml.c
M	ggml.h
A	llama.cpp
A	llama.h
M	main.cpp
M	models/ggml-vocab.bin
M	quantize.cpp
M	tests/CMakeLists.txt
M	tests/test-tokenizer-0.cpp
M	utils.cpp
M	utils.h

commit	da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b	e6c9e0986c79ba1cc8848879b2fcce979f9b4672	2023-03-20T20:14:06Z	Gary Mulder	Add SHA256SUMS file and instructions to README how to obtain and verify the downloads
M	README.md
A	SHA256SUMS

commit	e6c9e0986c79ba1cc8848879b2fcce979f9b4672	01a297b09932e29f3319d6588977c32a926c7907	2023-03-21T23:49:24+02:00	anzz1	Fix bin dir for win ci
M	.github/workflows/build.yml

commit	01a297b09932e29f3319d6588977c32a926c7907	3366853e41fcc818222a0271c76b6106179106fb	2023-03-21T22:34:25+01:00	Erik Scholz	specify build type for ctest on windows (#371)
M	.github/workflows/build.yml

commit	3366853e41fcc818222a0271c76b6106179106fb	3f9c6135e45ae3f520b1e17197004cc60c9ca45b	2023-03-21T22:57:35+02:00	Georgi Gerganov	Add notice about pending change
M	README.md

commit	3f9c6135e45ae3f520b1e17197004cc60c9ca45b	0f6135270839f0715843c4d480c63ae150def419	2023-03-21T16:52:27-04:00	Mathieu Nayrolles	fix typo in chatLLaMa (#368)
M	examples/chatLLaMa

commit	0f6135270839f0715843c4d480c63ae150def419	353ec251a42491f5192c48561da4b444ef67f23c	2023-03-21T19:47:27+02:00	Georgi Gerganov	Update issue templates
A	.github/ISSUE_TEMPLATE/custom.md

commit	353ec251a42491f5192c48561da4b444ef67f23c	89d5d90f3b6d25f134da7a8e252c3432bffcf674	2023-03-21T14:21:50-03:00	Fabio R. Sluzala	We could use std::unordered_map over std::map (#305)
M	main.cpp
M	quantize.cpp
M	utils.cpp
M	utils.h

commit	89d5d90f3b6d25f134da7a8e252c3432bffcf674	16ffc013c62f22bdaa3cdc022d7a13fd952d73fc	2023-03-21T18:11:01+01:00	Matvey Soloviev	Fix color codes emitting mid-UTF8 code. (#312)
M	main.cpp

commit	16ffc013c62f22bdaa3cdc022d7a13fd952d73fc	486ae645fd3eda8b9d7413d5ff34fb65a3e337fb	2023-03-21T09:42:25-07:00	comex	Importer for GPTQ quantized LLaMA models (#301)
A	convert-gptq-to-ggml.py
M	main.cpp

commit	486ae645fd3eda8b9d7413d5ff34fb65a3e337fb	3ab3e6582f7320c2b6568c892fdfc8215caf7e6c	2023-03-21T09:27:42-07:00	Gary Linscott	Compute perplexity over prompt (#270)
M	main.cpp
M	utils.cpp
M	utils.h

commit	3ab3e6582f7320c2b6568c892fdfc8215caf7e6c	f157088cb75f23208abc92b473a132ef3f7a7f15	2023-03-21T18:23:15+02:00	Jean-Christophe Hoelt	Add chatLLaMa script (#198)
A	examples/chatLLaMa

commit	f157088cb75f23208abc92b473a132ef3f7a7f15	c86ba036e613d46815501a4c6775117c9fc7afce	2023-03-21T11:21:06-05:00	Alex von Gluck IV	makefile: Fix CPU feature detection on Haiku (#218)
M	Makefile

commit	c86ba036e613d46815501a4c6775117c9fc7afce	1daf4dd71235dbbf537738e7ad53daad8d97586f	2023-03-21T18:14:46+02:00	anzz1	Enable ANSI colors on Windows 10+ (#311)
M	main.cpp

commit	1daf4dd71235dbbf537738e7ad53daad8d97586f	dc6a845b8573cd7d06c6b295241d26f311602a1f	2023-03-21T18:10:32+02:00	Georgi Gerganov	Minor style changes
M	README.md

commit	dc6a845b8573cd7d06c6b295241d26f311602a1f	6a612959e1b6c37b68b6b141329751a2902b1030	2023-03-21T18:09:37+02:00	Georgi Gerganov	Add chat.sh script
M	README.md
A	chat.sh

commit	6a612959e1b6c37b68b6b141329751a2902b1030	d5f56a5e5a0069329a81f96460221e7afb1daddc	2023-03-21T17:05:06+01:00	tjohnman	Check for reverse prompt by characters instead of tokens (#292) (#330)
commit	d5f56a5e5a0069329a81f96460221e7afb1daddc	3bfa3b43b7319b71853bfc7d3cf4e9767c24bbc8	2023-03-21T17:04:43+01:00	tjohnman	Check for reverse prompt by characters instead of tokens (#292) (#330)
M	main.cpp

commit	3bfa3b43b7319b71853bfc7d3cf4e9767c24bbc8	715d292ee0e34d27f27af43d7feaad1f1344981d	2023-03-21T17:59:16+02:00	Georgi Gerganov	Fix convert script, warnings alpaca instructions, default params
M	README.md
M	alpaca.sh
M	convert-pth-to-ggml.py
M	main.cpp

commit	715d292ee0e34d27f27af43d7feaad1f1344981d	c98ae02668a25916954b1653e25a5a35ca048d63	2023-03-21T09:50:09-06:00	Kevin Lo	Add OpenBSD support (#314)
M	Makefile
M	ggml.c
M	utils.cpp

commit	c98ae02668a25916954b1653e25a5a35ca048d63	c3b2306b18a087799acc431e485b8a2e3162cd52	2023-03-21T08:49:43-07:00	Mack Straight	fix typo in comment (#318)
M	convert-pth-to-ggml.py

commit	c3b2306b18a087799acc431e485b8a2e3162cd52	975d2cebf97ce888fa0aeee6f5ac774d7135891f	2023-03-21T23:44:11+08:00	Qingyou Meng	Makefile: slightly cleanup for Mac Intel; echo instead of run ./main -h (#335)
M	Makefile

commit	975d2cebf97ce888fa0aeee6f5ac774d7135891f	e0ffc861fae5ac8b40ce973f822d03db02929d36	2023-03-21T17:42:43+02:00	anzz1	cmdline option for custom amount of model parts (--n_parts N) (#348)
M	main.cpp
M	utils.cpp
M	utils.h

commit	e0ffc861fae5ac8b40ce973f822d03db02929d36	8f644a0a859938c787d329d27f98e03c58d7df27	2023-03-21T08:34:49-07:00	Kevin Kwok	Update IPFS links to quantized alpaca with new tokenizer format (#352)
M	README.md

commit	8f644a0a859938c787d329d27f98e03c58d7df27	eb34620aeceaf9d9df7fcb19acc17ad41b9f60f8	2023-03-21T17:32:14+02:00	Georgi Gerganov	Change default repeat_penalty to 1.0
M	utils.h

commit	eb34620aeceaf9d9df7fcb19acc17ad41b9f60f8	2e664f1ff413995506c9a54f3a8d5b8c64e37a91	2023-03-21T17:29:41+02:00	Georgi Gerganov	Add tokenizer test + revert to C++11 (#355)
M	.github/workflows/build.yml
M	CMakeLists.txt
M	Makefile
M	convert-pth-to-ggml.py
M	main.cpp
A	models/ggml-vocab.bin
M	quantize.cpp
A	tests/CMakeLists.txt
A	tests/test-tokenizer-0.cpp
M	utils.cpp
M	utils.h

commit	2e664f1ff413995506c9a54f3a8d5b8c64e37a91	8cf9f34eddc124d4ab28f4d2fe8e99d574510bde	2023-03-21T07:35:42-07:00	Casey Primozic	Add initial AVX512 support for dot product on Linux (#320)
M	Makefile
M	ggml.c

commit	8cf9f34eddc124d4ab28f4d2fe8e99d574510bde	bd4b46d6ba504b99c936f43fc014529adffb6048	2023-03-21T09:37:16+09:00	nusu-github	Adding missing features of CMakeLists.txt & Refactoring (#131)
M	CMakeLists.txt

commit	bd4b46d6ba504b99c936f43fc014529adffb6048	6b6d5b5024faaf82019d08cde5e8a9d69c6ca316	2023-03-20T16:44:30-05:00	Ben Siraphob	Nix flake: set meta.mainProgram to llama
M	flake.nix

commit	6b6d5b5024faaf82019d08cde5e8a9d69c6ca316	a791a68b613b162c88a83f5f0225223bc167c762	2023-03-21T03:33:10+08:00	Qingyou Meng	Fixed tokenizer.model not found error when model dir is symlink (#325)
M	convert-pth-to-ggml.py

commit	a791a68b613b162c88a83f5f0225223bc167c762	0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32	2023-03-20T12:26:01-07:00	Mack Straight	move file magic/version to header, print expected version (#319)
M	main.cpp
M	quantize.cpp
M	utils.h

commit	0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32	074bea2eb1f1349a0118239c4152914aecaa1be4	2023-03-20T18:05:20+01:00	Bernat Vadell	Docker - Fix publish docker image in GitHub Registry (#235)
M	.github/workflows/docker.yml

commit	074bea2eb1f1349a0118239c4152914aecaa1be4	5cb63e2493c49bc2c3b9b355696e8dc26cdd0380	2023-03-20T03:17:23-07:00	Mack Straight	sentencepiece bpe compatible tokenizer (#252)
M	Makefile
M	README.md
M	convert-pth-to-ggml.py
M	main.cpp
M	quantize.cpp
M	utils.cpp
M	utils.h

commit	5cb63e2493c49bc2c3b9b355696e8dc26cdd0380	da5303c1ea68aa19db829c634f1e10d08d409680	2023-03-20T08:24:11Z	Stephan Walter	Add tqdm to Python requirements (#293)
M	.devops/full.Dockerfile

commit	da5303c1ea68aa19db829c634f1e10d08d409680	4545539d718cf88f4c3a76669b8ac2e26cd8a1e5	2023-03-19T17:44:20-04:00	cocktailpeanut	bugfix: default should not be interactive (#304)
M	main.cpp

commit	4545539d718cf88f4c3a76669b8ac2e26cd8a1e5	edeba283665591f2f726024a92efe4b0b40434b3	2023-03-19T21:58:51+02:00	Georgi Gerganov	Rename script
R100	chat.sh	alpaca.sh

commit	edeba283665591f2f726024a92efe4b0b40434b3	5c19c70ba631a8f5d54feb6634e0eea178911a84	2023-03-19T21:57:28+02:00	Georgi Gerganov	Add temporary helper script for Alpaca chat
A	chat.sh

commit	5c19c70ba631a8f5d54feb6634e0eea178911a84	24568371ae0d7caf85164abe4753f36a7dba0288	2023-03-19T13:44:30-06:00	Rickey Bowers Jr	fix coloring of last `n_batch` of prompt, and refactor line input (#221)
M	main.cpp

commit	24568371ae0d7caf85164abe4753f36a7dba0288	7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9	2023-03-19T20:33:06+01:00	tjohnman	Support for multiple reverse prompts. (#299)
M	main.cpp
M	utils.cpp
M	utils.h

commit	7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9	ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d	2023-03-19T12:38:44-06:00	Suaj Carrot	Improved quantize script (#222)
M	README.md
A	quantize.py
D	quantize.sh

commit	ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d	368d0c8a9ebae16a20e1c8971b21ee888bdefad5	2023-03-19T19:36:19+01:00	tjohnman	Make prompt randomization optional. (#300)
M	main.cpp
M	utils.cpp
M	utils.h

commit	368d0c8a9ebae16a20e1c8971b21ee888bdefad5	50fae10d0339f2bd639f69dd679c0201d939a265	2023-03-19T19:31:17+01:00	tjohnman	Respect the maximum number of tokens in interactive. (#298)
M	main.cpp

commit	50fae10d0339f2bd639f69dd679c0201d939a265	084e2f0ec081c929343d44b09df07ae87cd1ed32	2023-03-19T19:22:48+01:00	slaren	Add --ignore-eos parameter (#181)
M	main.cpp
M	utils.cpp
M	utils.h

commit	084e2f0ec081c929343d44b09df07ae87cd1ed32	0b366e735729327476ec31da02de3c9c9771ddfb	2023-03-20T02:10:00+08:00	Qingyou Meng	interactive mode: print '\n' in sigint_handler, this flush stdout thus ensure color reset. (#283)
M	main.cpp

commit	0b366e735729327476ec31da02de3c9c9771ddfb	160bfb217da5038ccbd74438f9f16a16012d7866	2023-03-19T18:57:00+01:00	Erik Scholz	Command line switch to use F16 for memory_k and memory_v (refactor of #154) (#294)
M	main.cpp
M	utils.cpp
M	utils.h

commit	160bfb217da5038ccbd74438f9f16a16012d7866	c494ed5b94b429d3d73721235e78c9f5fa6e5652	2023-03-19T19:51:55+02:00	Georgi Gerganov	Update hot topics to mention Alpaca support
M	README.md

commit	c494ed5b94b429d3d73721235e78c9f5fa6e5652	c1c7026b470ced0b8a6c67e968c04bb47864def1	2023-03-19T19:46:32+02:00	Georgi Gerganov	Fix off-by-one bug (#115)
M	main.cpp

commit	c1c7026b470ced0b8a6c67e968c04bb47864def1	467b149761cd63248b00d6ffb204d50a4cbb451a	2023-03-19T19:33:18+02:00	Georgi Gerganov	Fix python stuff (#109)
M	convert-pth-to-ggml.py

commit	467b149761cd63248b00d6ffb204d50a4cbb451a	70f01cb8632f73b5cf70428608b89cd3c0775d23	2023-03-19T20:17:39+03:00	qunash	Refactoring `convert-pth-to-ggml.py`: more concise and readable (#109)
M	convert-pth-to-ggml.py

commit	70f01cb8632f73b5cf70428608b89cd3c0775d23	a4e63b73dfa1894387926cc8072b5f36deebf0a5	2023-03-19T19:04:44+02:00	Georgi Gerganov	Drop trailing new line from file prompts (#80)
M	main.cpp
M	utils.cpp

commit	a4e63b73dfa1894387926cc8072b5f36deebf0a5	9e1707218a24ff758c7b623594f8c0ce5e12eb6c	2023-03-19T18:49:50+02:00	Georgi Gerganov	Add instruction for using Alpaca (#240)
M	README.md

commit	9e1707218a24ff758c7b623594f8c0ce5e12eb6c	22213a17b56336bbea384a572a9484ce208c0333	2023-03-19T18:37:02+02:00	Georgi Gerganov	Add "--instruct" argument for usage with Alpaca (#240)
M	main.cpp
A	prompts/alpaca.txt
A	prompts/chat-with-bob.txt
M	utils.cpp
M	utils.h

commit	22213a17b56336bbea384a572a9484ce208c0333	d7def1a7524f712e5ebb7cd02bab0f13aa56a7f9	2023-03-19T17:30:00+02:00	Georgi Gerganov	Change RMSNorm eps to 1e-6 (#173)
M	ggml.c

commit	d7def1a7524f712e5ebb7cd02bab0f13aa56a7f9	6f61c18ec9a30416e21ed5abfb1321bdb14979be	2023-03-18T17:10:47-07:00	Ronsor	Warn user if a context size greater than 2048 tokens is specified (#274)
M	main.cpp

commit	6f61c18ec9a30416e21ed5abfb1321bdb14979be	1e5a6d088d0f3a967c6e86298a756daec9e8df12	2023-03-18T22:39:46+01:00	Pavol Rusnak	Fix typo in readme
M	README.md

commit	1e5a6d088d0f3a967c6e86298a756daec9e8df12	554b54152145c30618bac171efb712cf4a7d1e96	2023-03-18T22:20:04+01:00	Pavol Rusnak	Add note about Python 3.11 to readme
M	README.md

commit	554b54152145c30618bac171efb712cf4a7d1e96	d3f202d57b694376cef6f381a6b6901825c3f6d9	2023-03-18T21:58:46+01:00	Pavol Rusnak	Add memory/disk requirements to readme
M	README.md

commit	d3f202d57b694376cef6f381a6b6901825c3f6d9	e03e359730c127f888fcf00e93375771bc0a3500	2023-03-18T20:51:49+07:00	Alex Nguyen	Remove unused code since n_vocab is model.hparams.n_vocab (#262)
M	main.cpp

commit	e03e359730c127f888fcf00e93375771bc0a3500	a81d0c2a171a4446e6a21a3ec74a0c0768d71184	2023-03-18T07:44:09-04:00	Justin Suess	fixed warning with std::ignore about unused function result (#151)
M	main.cpp

commit	a81d0c2a171a4446e6a21a3ec74a0c0768d71184	b2de7f18dfbb93463eeb5b4392117bbe82d5bd1b	2023-03-18T04:17:19-07:00	Gary Linscott	Fix n^2 loop in tokenization (#254)
M	utils.cpp

commit	b2de7f18dfbb93463eeb5b4392117bbe82d5bd1b	a29274789309029fd88a9465e6d0832d4632272b	2023-03-18T09:27:12+02:00	anzz1	CI Improvements (#230)
M	.github/workflows/build.yml

commit	a29274789309029fd88a9465e6d0832d4632272b	c9f670a17755311aa28c411f5c7f3c8c05434770	2023-03-17T23:03:48+01:00	Niklas Korz	Nix flake (#40)
M	.gitignore
A	flake.lock
A	flake.nix

commit	c9f670a17755311aa28c411f5c7f3c8c05434770	4f546091102a418ffdc6230f872ac56e5cedb835	2023-03-17T21:05:58+01:00	thement	Implement non-greedy tokenizer that tries to maximize token lengths (#242)
M	main.cpp
M	utils.cpp

commit	4f546091102a418ffdc6230f872ac56e5cedb835	e81b9c81c101f64531ef0fa1ee6b77d562635652	2023-03-17T21:46:46+02:00	Georgi Gerganov	Default to 4 threads (#243)
M	utils.h

commit	e81b9c81c101f64531ef0fa1ee6b77d562635652	367946c668757532deed929e1d78673c6ac6bcb8	2023-03-17T20:30:04+02:00	Georgi Gerganov	Update Contributing section
M	README.md

commit	367946c668757532deed929e1d78673c6ac6bcb8	6b0df5ccf360fe5c015f6607f0375bfc6849005e	2023-03-17T17:47:35Z	Stephan Walter	Don't tell users to use a bad number of threads (#243)
M	.devops/tools.sh
M	README.md
M	ggml.c
M	utils.cpp
M	utils.h

commit	6b0df5ccf360fe5c015f6607f0375bfc6849005e	2af23d30434a677c6416812eea52ccc0af65119c	2023-03-18T00:38:24+08:00	mmyjona	add ptread link to fix cmake build under linux (#114)
M	.github/workflows/build.yml
M	CMakeLists.txt

commit	2af23d30434a677c6416812eea52ccc0af65119c	904d2a8d6acd667c9633138d45a361d40fbf76d0	2023-03-17T10:47:06+01:00	Bernat Vadell	🚀 Dockerize llamacpp (#132)
A	.devops/full.Dockerfile
A	.devops/main.Dockerfile
A	.devops/tools.sh
A	.dockerignore
M	.github/workflows/build.yml
A	.github/workflows/docker.yml
M	README.md
M	convert-pth-to-ggml.py
A	download-pth.py

commit	904d2a8d6acd667c9633138d45a361d40fbf76d0	721311070e31464ac12bef9a4444093eb3eaebf7	2023-03-17T05:48:39+01:00	Matvey Soloviev	Q4_1 quantization (#193)
M	ggml.c
M	utils.cpp

commit	721311070e31464ac12bef9a4444093eb3eaebf7	ac15de789547e5a6e93df552e787379b3a23ef26	2023-03-16T15:00:09+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	ac15de789547e5a6e93df552e787379b3a23ef26	273abc47ff9dd899b3c4f58acd19d4649e90d6b4	2023-03-16T08:55:13+02:00	Georgi Gerganov	Expand "Contributing" section
M	README.md

commit	273abc47ff9dd899b3c4f58acd19d4649e90d6b4	9b4a15b17d8395eb075379b140fcd0b0283f4ef6	2023-03-16T07:12:12+02:00	Georgi Gerganov	Update hot topics - RMSnorm
M	README.md

commit	9b4a15b17d8395eb075379b140fcd0b0283f4ef6	6eac39ba953acaeec396cea2969dbf413907e2ec	2023-03-15T19:29:25-04:00	Nebula	Fix RMS norm in GGML (#191)
M	ggml.c

commit	6eac39ba953acaeec396cea2969dbf413907e2ec	27944c4206a49bbe003021a2610bacaa3044e619	2023-03-15T18:41:38-04:00	hoangmit	Add RMS norm and use it (#187)
M	ggml.c
M	ggml.h
M	main.cpp

commit	27944c4206a49bbe003021a2610bacaa3044e619	2d15d6c9a959749f954d4fbbf44d711e19c5bdff	2023-03-15T21:35:25+01:00	moritzbrantner	fixed typo (#178)
M	README.md

commit	2d15d6c9a959749f954d4fbbf44d711e19c5bdff	2d64715ad475f192a4004a52d134c67ccb6f44ad	2023-03-15T13:56:24-06:00	Rickey Bowers Jr	add SIGINT support for _WIN32 environments (#120)
M	main.cpp

commit	2d64715ad475f192a4004a52d134c67ccb6f44ad	16b2c61a22f828ea77d9f084ca871c63bc5cc283	2023-03-15T15:42:40-04:00	Justin Suess	added ctx_size parameter (#148)
M	main.cpp
M	utils.cpp
M	utils.h

commit	16b2c61a22f828ea77d9f084ca871c63bc5cc283	977295c700a2952c18400026d57467077dcd1a20	2023-03-15T15:39:38-04:00	Justin Suess	fixed color reset on exit (#149)
M	main.cpp

commit	977295c700a2952c18400026d57467077dcd1a20	956dfda8ad8cea7961e22e0384bbc315bf79aed2	2023-03-15T22:39:06+03:00	Musab Gultekin	Fix potential licensing issue (#126)
M	README.md

commit	956dfda8ad8cea7961e22e0384bbc315bf79aed2	113e685d18ac4edb20f647fd34b000941556f6a6	2023-03-15T12:37:50-07:00	Ronsor	Use `tokenizer.vocab_size()` instead of hardcoding 32000 in convert-pth-to-ggml.py (#142)
M	convert-pth-to-ggml.py

commit	113e685d18ac4edb20f647fd34b000941556f6a6	47857e564c218a2c38346d0cdd94314632878fcb	2023-03-15T15:05:14-04:00	hoangmit	inline -> static inline for "bytesFromNibbles" (#161)
M	ggml.c

commit	47857e564c218a2c38346d0cdd94314632878fcb	60f819a2b10475055a36415bc489e5b55df2d052	2023-03-14T12:34:37-07:00	Ronsor	Don't use vdotq_s32 if it's not available (#139)
M	ggml.c

commit	60f819a2b10475055a36415bc489e5b55df2d052	97ab2b257897bfe7e2ae72876a3e50ed41b8c7ce	2023-03-14T15:30:08+02:00	Radoslav Gerganov	Add section to README on how to run the project on Android (#130)
M	README.md
D	models/.gitignore

commit	97ab2b257897bfe7e2ae72876a3e50ed41b8c7ce	2f700a27381e558a4eb5a3f8fd56757f4c7a417c	2023-03-14T09:43:52+02:00	Georgi Gerganov	Add Misc section + update hot topics + minor fixes
M	README.md

commit	2f700a27381e558a4eb5a3f8fd56757f4c7a417c	c09a9cfb06c87d114615c105adda91b0e6273b69	2023-03-13T17:29:10-03:00	Sebastián A	Add windows to the CI (#98)
M	.github/workflows/build.yml

commit	c09a9cfb06c87d114615c105adda91b0e6273b69	7ec903d3c162417c11463f14ad5b773a918fb7f1	2023-03-13T21:22:15+02:00	Georgi Gerganov	CMake build in Release by default (#75)
M	CMakeLists.txt

commit	7ec903d3c162417c11463f14ad5b773a918fb7f1	4497ad819c0010a8b19ffeaf8c0428eb7558d3e0	2023-03-13T19:21:51+02:00	Georgi Gerganov	Update contribution section, hot topics, limitations, etc.
M	README.md

commit	4497ad819c0010a8b19ffeaf8c0428eb7558d3e0	ed6849cc07a8973e5d31947b9df2df2da975ac96	2023-03-13T19:15:08+02:00	Georgi Gerganov	Print system information
M	main.cpp

commit	ed6849cc07a8973e5d31947b9df2df2da975ac96	41be0a3b3d76ee4f254dc81b42bd8ed26ee324e7	2023-03-13T14:12:33-03:00	Sebastián A	Initial support for CMake (#75)
A	CMakeLists.txt

commit	41be0a3b3d76ee4f254dc81b42bd8ed26ee324e7	671d5cac15241b495006f56482bf2d6967dca91f	2023-03-13T17:40:54+01:00	Thomas Klausner	Add NetBSD support. (#90)
M	Makefile
M	ggml.c
M	utils.cpp

commit	671d5cac15241b495006f56482bf2d6967dca91f	84d9015c4a91ab586ba65d5bd31a8482baf46ba1	2023-03-13T17:39:56+01:00	Pavol Rusnak	Use fprintf for diagnostic output (#48)
M	main.cpp

commit	84d9015c4a91ab586ba65d5bd31a8482baf46ba1	63fd76fbb06f9b723ca11505352387a3148b1814	2023-03-13T18:36:44+02:00	Georgi Gerganov	Use vdotq_s32 to improve performance (#67)
M	ggml.c

commit	63fd76fbb06f9b723ca11505352387a3148b1814	2a20f48efad692a8c2744f10c673bbdbe0c751b7	2023-03-14T01:33:43+09:00	uint256_t	Reduce model loading time (#43)
M	main.cpp

commit	2a20f48efad692a8c2744f10c673bbdbe0c751b7	d1f224712d78ab2cbb78777acfeb6739f660eb96	2023-03-13T12:24:18-04:00	Val Kharitonov	Fix UTF-8 handling (including colors) (#79)
M	convert-pth-to-ggml.py
M	main.cpp

commit	d1f224712d78ab2cbb78777acfeb6739f660eb96	1808ee0500ea674b4bc2911acd0489ee5cbcef87	2023-03-13T17:15:20+01:00	Pavol Rusnak	Add quantize script for batch quantization (#92)
M	README.md
A	quantize.sh

commit	1808ee0500ea674b4bc2911acd0489ee5cbcef87	a169bb889cfe7b77a798f04fbc573e67ccb4316a	2023-03-13T09:42:26+02:00	Georgi Gerganov	Add initial contribution guidelines
M	README.md

commit	a169bb889cfe7b77a798f04fbc573e67ccb4316a	460c48254098b28d422382a2bbff6a0b3d7f7e17	2023-03-13T04:08:01+01:00	Matvey Soloviev	Gate signal support on being on a unixoid system. (#74)
M	main.cpp

commit	460c48254098b28d422382a2bbff6a0b3d7f7e17	c80e2a8f2adeda202cbffe76ef800f134e51f03f	2023-03-13T00:35:51+01:00	Matvey Soloviev	Fix token count accounting
M	main.cpp

commit	c80e2a8f2adeda202cbffe76ef800f134e51f03f	54a0e66ea0ed3248e6c95a070a2da0bf5c6d4817	2023-03-13T01:28:08+02:00	Georgi Gerganov	Revert "10% performance boost on ARM"
M	ggml.c

commit	54a0e66ea0ed3248e6c95a070a2da0bf5c6d4817	543c57e991a23121c666561c2837faa09c4a78ca	2023-03-13T01:21:03+02:00	Georgi Gerganov	Check for vdotq_s32 availability
M	ggml.c

commit	543c57e991a23121c666561c2837faa09c4a78ca	113a9e83ebc0f788f861394437087bf3ca0e019b	2023-03-13T01:05:24+02:00	Georgi Gerganov	Ammend to previous commit - forgot to update non-QRDMX branch
M	ggml.c

commit	113a9e83ebc0f788f861394437087bf3ca0e019b	404fac0d623c9eea74ad7a9347da69e33f10984e	2023-03-13T00:56:10+02:00	Georgi Gerganov	10% performance boost on ARM
M	ggml.c

commit	404fac0d623c9eea74ad7a9347da69e33f10984e	1a0a74300f35ad4868715d684d0bc0effdaa9d31	2023-03-12T23:07:34+01:00	Matvey Soloviev	Fix color getting reset before prompt output done (#65)
M	main.cpp

commit	1a0a74300f35ad4868715d684d0bc0effdaa9d31	96ea727f4780620b60c1897b538654931411a3fd	2023-03-12T23:39:01+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	96ea727f4780620b60c1897b538654931411a3fd	966195483549e201cff062096a848d9e9833a1a6	2023-03-12T22:13:28+01:00	Matvey Soloviev	Add interactive mode (#61)
M	README.md
M	main.cpp
M	utils.cpp
M	utils.h

commit	966195483549e201cff062096a848d9e9833a1a6	f385f8dee83d1baf59896b2eb09f1524dc9cde45	2023-03-13T03:30:08+07:00	Marc Köhlbrugge	Fix typo in README (#45)
M	README.md

commit	f385f8dee83d1baf59896b2eb09f1524dc9cde45	02f0c6fe7f9b7be24c7d339aed016e54a92388ea	2023-03-12T13:28:36-07:00	Ben Garney	Allow using prompt files (#59)
M	utils.cpp

commit	02f0c6fe7f9b7be24c7d339aed016e54a92388ea	eb062bb012c4e131818dd757a6d3a757fdee3961	2023-03-12T16:23:15-04:00	beiller	Add back top_k (#56)
M	main.cpp
M	utils.cpp
M	utils.h

commit	eb062bb012c4e131818dd757a6d3a757fdee3961	7027a97837c351e0a7bc48db2027af368de382db	2023-03-12T17:15:00-03:00	Sebastián A	Windows fixes (#31)
M	ggml.c
M	main.cpp
M	quantize.cpp
M	utils.cpp

commit	7027a97837c351e0a7bc48db2027af368de382db	2d555e5b42922cda6dfc0c3ff54df7b1ee4d0ff4	2023-03-12T22:09:26+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	2d555e5b42922cda6dfc0c3ff54df7b1ee4d0ff4	7c9e54e55e4106f84688245fb15207f6df917e12	2023-03-12T22:08:24+02:00	Georgi Gerganov	Add CI (#60)
A	.github/workflows/build.yml

commit	7c9e54e55e4106f84688245fb15207f6df917e12	b9bd1d014113b7498f04ad4d28e6021d5f4cddad	2023-03-12T20:59:01+02:00	Georgi Gerganov	Revert "weights_only" arg - this causing more trouble than help
M	README.md
M	convert-pth-to-ggml.py

commit	b9bd1d014113b7498f04ad4d28e6021d5f4cddad	129c7d1ea886e52ac1b87ff6184310bab3158806	2023-03-12T14:16:33+02:00	Oleksandr Nikitin	python/pytorch compat notes (#44)
M	README.md
M	convert-pth-to-ggml.py

commit	129c7d1ea886e52ac1b87ff6184310bab3158806	702fddf5c5c3c1377e169ba9ecdfed4cb16c268b	2023-03-12T05:27:42-04:00	beiller	Add repetition penalty (#20)
M	main.cpp
M	utils.cpp
M	utils.h

commit	702fddf5c5c3c1377e169ba9ecdfed4cb16c268b	7d86e25bf648eb369a3a8388bf239b6b19f7a789	2023-03-12T09:03:25+02:00	Georgi Gerganov	Clarify meaning of hacking
M	README.md

commit	7d86e25bf648eb369a3a8388bf239b6b19f7a789	a93120236f99e13d77e4b278e47ffcaad4a899e4	2023-03-12T08:41:54+02:00	Georgi Gerganov	README: add "Supported platforms" + update hot topics
M	README.md

commit	a93120236f99e13d77e4b278e47ffcaad4a899e4	6a9a67f0bee5eed67cf8bf03f74f77619da40d3f	2023-03-11T22:36:35-08:00	deepdiffuser	use weights_only in conversion script (#32)
M	convert-pth-to-ggml.py

commit	6a9a67f0bee5eed67cf8bf03f74f77619da40d3f	da1a4ff01f42d058cfa59806dd5679c0fe5a8604	2023-03-12T07:36:03+01:00	Pavol Rusnak	Add LICENSE (#21)
A	LICENSE

commit	da1a4ff01f42d058cfa59806dd5679c0fe5a8604	6b2cb6302ffaf8264e33af1dc52e3ea54003e690	2023-03-12T01:26:32+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	6b2cb6302ffaf8264e33af1dc52e3ea54003e690	4235e3d5b3f4a0e6844f6291322ebb42181345c9	2023-03-11T18:32:20+01:00	Juraj Bednar	Fix a typo in model name (#16)
M	README.md

commit	4235e3d5b3f4a0e6844f6291322ebb42181345c9	f1eaff4721153a5a5094fd1bd8cbdae7a3c079cc	2023-03-11T18:10:18+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	f1eaff4721153a5a5094fd1bd8cbdae7a3c079cc	a9e58529ea507ac15cd2df4c39d1b9613d6acb6e	2023-03-11T17:58:18+02:00	Georgi Gerganov	Add AVX2 support for x86 architectures thanks to @Const-me !
M	README.md
M	ggml.c

commit	a9e58529ea507ac15cd2df4c39d1b9613d6acb6e	7d9ed7b25fe17db3fc8848b5116d14682864ce8e	2023-03-11T17:40:14+02:00	Georgi Gerganov	Fix un-initialized FP16 tables on x86 (#15, #2)
M	quantize.cpp

commit	7d9ed7b25fe17db3fc8848b5116d14682864ce8e	0c6803321c818f3f2da4a0693d20128b0f79ad28	2023-03-11T12:44:21+02:00	Georgi Gerganov	Bump memory buffer
M	main.cpp

commit	0c6803321c818f3f2da4a0693d20128b0f79ad28	f60fa9e50afce35e7ebe1fedf34d4a9327353927	2023-03-11T12:31:21+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	f60fa9e50afce35e7ebe1fedf34d4a9327353927	7211862c943273fc8ce4b7fdf4c04f9821b7b591	2023-03-11T12:26:46+02:00	Georgi Gerganov	.gitignore models/
M	.gitignore

commit	7211862c943273fc8ce4b7fdf4c04f9821b7b591	a5c5ae2f545d0d3338f5b2a7840457e35d5bccc1	2023-03-11T12:26:16+02:00	Georgi Gerganov	Update Makefile var + add comment
M	Makefile
M	README.md

commit	a5c5ae2f545d0d3338f5b2a7840457e35d5bccc1	ea977e85ecda7b983f0e7b1db20b509998ddc889	2023-03-11T11:34:25+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	ea977e85ecda7b983f0e7b1db20b509998ddc889	007a8f6f459c6eb56678fdee4c09219ddb85b640	2023-03-11T11:34:11+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	007a8f6f459c6eb56678fdee4c09219ddb85b640	5f2f970d51a04b783799bc92fd1d006408269f26	2023-03-11T10:47:09+02:00	Georgi Gerganov	Support all LLaMA models + change Q4_0 quantization storage
M	README.md
M	convert-pth-to-ggml.py
M	ggml.c
M	main.cpp
M	utils.cpp

commit	5f2f970d51a04b783799bc92fd1d006408269f26	73c6ed5e8784a20f89d51b1703a09bc690c68227	2023-03-10T21:47:26-08:00	Simon Willison	Include Python dependencies in README (#6)
M	README.md

commit	73c6ed5e8784a20f89d51b1703a09bc690c68227	01eeed8fb1437978603a8523c0b8ea2f6280f5d7	2023-03-11T01:30:47+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	01eeed8fb1437978603a8523c0b8ea2f6280f5d7	6da2df34ee40301d9ecb126968ec4c0c6195f26d	2023-03-11T01:22:58+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	6da2df34ee40301d9ecb126968ec4c0c6195f26d	9dcf4dba459ba6482a7a5aced22645a387ec6991	2023-03-11T01:18:10+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	9dcf4dba459ba6482a7a5aced22645a387ec6991	920a7fe2d94cc7e4fed0e88db830b674c91865c5	2023-03-10T18:04:06-05:00	Jean-Michaël Celerier	Add missing headers for memcpy and assert (#3)
M	utils.cpp

commit	920a7fe2d94cc7e4fed0e88db830b674c91865c5	3a57ee59de53c2a9d2c3a2c643b609ce07a58a16	2023-03-11T00:55:22+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	3a57ee59de53c2a9d2c3a2c643b609ce07a58a16	b85028522d6e924473159ba0da3543fc174d2ded	2023-03-11T00:51:46+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	b85028522d6e924473159ba0da3543fc174d2ded	8a01f565ff78cc6c0c5a9fa402787a2f179f2d78	2023-03-11T00:09:19+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	8a01f565ff78cc6c0c5a9fa402787a2f179f2d78	70bc0b8b15b98dca23b28f0c8f5e34b27e424cda	2023-03-10T23:53:11+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	70bc0b8b15b98dca23b28f0c8f5e34b27e424cda	18ebda34d67c05f4f5584a9209e7efb949f5fd56	2023-03-10T23:46:39+02:00	Georgi Gerganov	Fix a bug in the rope calculation
M	convert-pth-to-ggml.py
M	main.cpp
M	utils.cpp
M	utils.h

commit	18ebda34d67c05f4f5584a9209e7efb949f5fd56	319cdb3e1ffe263cf5b08249c9559e011396c1de	2023-03-10T21:52:27+02:00	Georgi Gerganov	Update README.md
M	README.md

commit	319cdb3e1ffe263cf5b08249c9559e011396c1de	775328064e69db1ebd7e19ccb59d2a7fa6142470	2023-03-10T21:50:46+02:00	Georgi Gerganov	Final touches
M	README.md
M	main.cpp
A	models/.gitignore
M	utils.cpp
M	utils.h

commit	775328064e69db1ebd7e19ccb59d2a7fa6142470	26c084662903ddaca19bef982831bfb0856e8257	2023-03-10T21:47:46+02:00	Georgi Gerganov	Create README.md
A	README.md

commit	26c084662903ddaca19bef982831bfb0856e8257		2023-03-10T20:40:58+02:00	Georgi Gerganov	Initial release
A	.gitignore
A	Makefile
A	convert-pth-to-ggml.py
A	ggml.c
A	ggml.h
A	main.cpp
A	quantize.cpp
A	utils.cpp
A	utils.h
